モデルの読み · 証拠の更新 (元の論文は 2025 年 12 月 20 日/相殺する証拠は 9 月 3 日)
この記事の出典 2026年9月4日 夕刊
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要な発見の一つは逐語で「RL optimization does not materially decrease monitorability even at the current frontier scale」、強化学習の最適化は、いまのフロンティア規模でも監視可能性を実質的には下げない、というものだ(arXiv 2512.18311)。ところが 2026 年 9 月 3 日の Astra システムカードは「CoT controllability for Astra especially increases over the course of RL training」と書く。制御可能性が上がるのは悪い知らせで、理由は前に書いた。本紙が読み直したうえでの処置は、あの古い判断の信頼度を下げること。ただし失効の印は付けない。 原因はまだ定まっておらず、もし能力の跳躍が主因なら、あの論文はもともと主張した範囲の中では間違っておらず、「いまの規模」が外挿の有効期限だと自分で明記してもいた。今回ほんとうに記すべき教訓は「供給元の自己申告を信じるな」ではない。 それはとうに制度が止めている。教訓はこうだ。結論に明確な適用範囲が付いているとき、他人に引かれる際に最も落とされやすいのが、まさにその範囲である。
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…
このシミュレータが測るのは、モデルが実際にハードウェア上で動くときの挙動であって、モデル自身の点数ではない。パデュー大学の研究チームが論文を発表し、Nvidia の Ampere、…