モデルの読み · 今日 (出来事の日は 08-12)
この記事の出典 2026年8月14日 夕刊
Stella Biderman は、オープンな AI 研究組織 EleutherAI で事務局長を務める。機構的解釈可能性とは、モデルの内側を開き、具体的な回路と動作の仕組みを突き止めようとする研究の道筋を指す。主張は二層になっている。弱い版(元の投稿にある)は、干渉の結果を予測することにも、よい理論を立てることにも、機構のモデルは要らないというものだ。歴史の類比が三つ添えられている。ワクチンは細菌の理論より先にあった。熱力学の第二法則は、誤った熱の理論を抱いた人物が立てた。量子力学に標準の機構モデルはない。強い版(返信のなかにある)は、「mech interp の研究のほとんどは、実のところ本当の科学とは言えない」である(原文)。本紙は、引かれていたその論文の要旨を取り出して一度突き合わせた。 それは arXiv 2606.06533、題は〈Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics〉で、筆頭著者は本人である。つまり独立した傍証ではなく、本人の主張そのものだ。要旨が言っているのは、AI の科学は事後の手直しを超え、モデルの振る舞いを生む訓練の動態を研究しなければならない、である。しかも機構的解釈可能性を、検討すべき進展の一つとして明示に挙げている。科学の外へ追い出してはいない(arXiv 2606.06533)。投稿は論文よりずっと強い。そして強くなったその一段には、根拠がない。 ⚠️ 本紙は要旨だけを読み、全文は読んでいない。これは立場を述べる論文であり、議題を主張する文類であって実証の結果ではないので、引くときに「研究が示した」と書いてはならない。三つの歴史の類比も、一つずつ確かめてはいない。意思決定にとっての実際の含みは、こうなる。「解釈可能性へ投資すべきだ」という論の多くは、「仕組みを理解して初めて、認証でき、干渉できる」を暗黙の前提に置いている。主張されているのは、その矢印が成り立たない、ということだ。これは解釈可能性が役に立たないという意味ではない。もし投資の理由が「機構の理解は必要条件である」の上に建っているなら、その理由は別のものへ取り替える必要がある、という意味だ。本紙はどちらが正しいかを裁かない——本紙の記録には、機構の発見を中核の価値とする素材が別にあり、どちらも覆されていない。矛盾はそのまま残す。
2025 年 3 月、OpenAI の研究者がある発見を発表した。弱いほうのモデルに、強いほうのモデルの思考の鎖——答えを出す前にモデルが書き残す途中の推論の文——を読ませると、ご…
蒸留とは、あるモデル(教師)の出力を使って別のモデル(生徒)を訓練することをいう。近ごろ、中国のオープンウェイトモデルが Anthropic の Opus から蒸留したことの証明と…
8 月 10 日、Google のチームが arXiv に AMIE(Video)を出した。Gemini を土台にした複数エージェントの系である。OSCE(客観的臨床能力試験)は医…
実行の殻(harness)はモデルの外側を包むエージェントの実行環境で、文脈の管理、ツールの呼び出し、再試行の方針を受け持つ。Claude Code も Codex もこれにあたる…