モデルの読み · 今週 (公開日 8 月 27 日)
この記事の出典 2026年8月28日 夕刊
Google DeepMind は昨日、外部の機関と二重盲検の評価を終えたと発表した(Google DeepMind、08-27)。もともとの板挟みはこうだった。 危険度の高い外部評価は、これまで二つに一つしかなかった。評価する側が問題を渡せば、モデルの提供元が先に答案を見られるかもしれない。モデルの提供元が重みを渡せば、知的財産が漏れるかもしれない。今回は両者をそれぞれ Google Cloud の機密計算の環境へ封じ込めた。 ハードウェアが、これから実行されるのはどのコードかを先に証明し、双方が確認して合意したうえで各自の資産を入れる。走り終えたら、取り決めた出力だけを外へ出す。評価する側はモデルの重みを見られず、Google は問題を見られない。 ここで暗号技術が担うのは「隔離が本当に効いていることの証明」であって、二重盲検そのものの実現手段ではない。参加したのは、シンガポール政府の AI 安全機関、オープンソースの共同体 OpenMined、フロンティア AI の監査組織 AVERI、ベンチマークの標準化団体 MLCommons になる。AVERI の告知は、受けたのが Gemini 2.5 Flash-Lite であること(DeepMind の記事に版の番号はない)、問題が MLCommons の安全ベンチマークのうち一度も使われていない一群から取られたことを補っている(AVERI、08-27)。⚠️ 正直な印を四つ。発表されたのは方法であって、評価の結果の数字は一つも出ていない。AVERI 自身は「小規模」な定量評価だと述べている。双方が公表した協力先の名簿は一致しない。「世界初」は当事者自身の主張になる。
あなたにとっての意味: 評価の要件を書く人に、引ける作法が一つ増えた。AVERI は同じ告知で、いまある規範のいくつかは第三者評価にあたって安全とプライバシーへ配慮せよと正しく要求しているのに、どうやるかの指針をほとんど与えていない、と名指しした。この試行は、その作法を与えるものになる。次に自分で確かめられる読み: あの技術報告がいつ公開されるか、そのなかに本当に評価の点数があるかどうか。点数が出るまで、これは方法の実演にとどまる。
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…