モデルの読み · 今週 (発表日 9 月 1 日)
この記事の出典 2026年9月2日 夕刊
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともとは心理検査が、解答の型から能力を推し量るために使ってきた手法になる。100 のモデル × 16 の評価指標 × 3.4 万問超を食わせ、どの評価指標が何を量るかは一切教えないまま走らせたところ、二つの主軸が自ずと出てきた。安全性と、一般的な推論だ。直感に反するのはここからで、社会的な偏りを見る BBQ と、危険な両用の知識を見る WMDP は普通なら安全性の側に置かれるのに、実際には一般的な推論との結び付きのほうがずっと強い。しかも推論が強いほど WMDP の点数は下がる(その評価指標は「答えを拒むこと」を正解として数えているためだ)(Hugging Face のブログ、09-01)。今日の中核 2 点目と合わせて読む。 韓国の配点でいう「ベンチマークが 40 点」の意味は、点数の 4 割が、何を量っているのかまだ解きほぐされていない問題の束によって決まる、ということになる。安全性の評価指標の点数でモデルを選ぼうとしているなら、まずその指標が、答えを拒むことを正解に数えていないか確かめること。そうでないと、選んだのは最も安全なモデルではなく、最も問いを避けるのが上手いモデルかもしれない。⚠️ 訓練に使われたモデルはすべて 2025 年 3 月より前に公開されたもので、新しい世代の振る舞いについては分からない。
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
このシミュレータが測るのは、モデルが実際にハードウェア上で動くときの挙動であって、モデル自身の点数ではない。パデュー大学の研究チームが論文を発表し、Nvidia の Ampere、…