モデルの読み · トレンド観察 (元の論文は 2025 年 6 月/後続の論文は 2026 年)
この記事の出典 2026年9月4日 夕刊
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソースのファジング基盤 OSS-Fuzz から来ており、だからそれらの脆弱性は生まれつき既知で記録済みだ。課題の定義は逐語で、モデルはその脆弱性を再現できる概念実証テストを生成しなければならず、手にするのはその脆弱性の文章による説明と、対応するコードベースだけ。論文の自己申告では 2025 年の最良の組み合わせでも成功率はおよそ 20% だったが、一年のうちに二つのフロンティア企業が自己申告した点数は 85.6 と 86.2 へ跳ねた。しかも二社とも、どの難度帯、どの部分集合を測ったのかを公表しておらず、どちらの点数も第三者による再現はない(CyberGym、2025-06)。最も情報量が大きいのは、同じ著者群による後続論文の冒頭の自己申告だ。既存の AI システムに対するセキュリティ評価は、実世界の脆弱性発見と修正の端から端までのライフサイクルを覆えていない(CyberGym-E2E、2026)。そのまま持ち帰れる動き:セキュリティ試験の点数を見たら、まず「この試験はモデルに何を与え、何をさせるのか」と問うこと。
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…
このシミュレータが測るのは、モデルが実際にハードウェア上で動くときの挙動であって、モデル自身の点数ではない。パデュー大学の研究チームが論文を発表し、Nvidia の Ampere、…