モデルの読み · 今日 (計測をめぐる論争、出来事の日は 08-11 から 08-12)
この記事の出典 2026年8月13日 夕刊
蒸留とは、あるモデル(教師)の出力を使って別のモデル(生徒)を訓練することをいう。近ごろ、中国のオープンウェイトモデルが Anthropic の Opus から蒸留したことの証明として、ある論文が広く引かれている。その論文を段ごとに伝えた @bookwormengr が出した数字はこうだ。あるモデルに、Opus と連続 16 トークン完全に同じ推論の過程を生成させるには、理論上どれだけ独立に試す必要があるか——最も取り出しやすいモデルでおよそ 10 の 10 乗回、残りは 10 の 14 乗から 16 乗に落ちる。ところが同じことが目に見える答えの側で起きるには、およそ 10 万回で足りる。二つの経路はおよそ十万倍離れていて、証拠として広まったのは後者のほうだ。伝えた本人は、論文自身の一文も引いている。「these results do not support verbatim memorisation of the reasoning」(これらの結果は、推論が逐語で記憶されていることを支持しない)(原文)。⚠️ 最大の問題は、文のなかに書いておく必要がある。論文の本体を本紙は手にしていない。著者も番号も題名も一つも分からず、数字はすべて立場のはっきりした反対側の一人を経由した伝聞であり、その試行の回数も実際に測ったものではなく理論上の見積もりである。だから結論はこうとしか書けない。「広まったこの証拠は、伝えられた数字のもとでは、あの結論を支えきれない」。「中国のモデルは蒸留していない」と書いてはならない。そのまま持ち帰れるのは三つの検査の問いだ。次に「あるモデルが蒸留であると証明された」を見たら、こう聞く。証拠が乗っているのは推論の経路か、答えの経路か。試験の集合は公開の有名な基準か。同じ系列の内部で対照の基線を取ったか。二つ目の理由はこうだ。試験の集合が公開なら、「訓練のデータにもともとその問題が入っていた」という説明が同じだけ整合し、しかもより単純だからである。直感に反する注意も一つ。あの論文の実験では、ネット上で「自分は Claude だ」と名乗る画面写真が大量に出回った、あのモデルの、トークンの層での取り出しやすさは、むしろきれいだった。自分が誰かを言い間違えることと、重みを写されることは、別々に起こりうる二つの事柄である。
2025 年 3 月、OpenAI の研究者がある発見を発表した。弱いほうのモデルに、強いほうのモデルの思考の鎖——答えを出す前にモデルが書き残す途中の推論の文——を読ませると、ご…
Stella Biderman は、オープンな AI 研究組織 EleutherAI で事務局長を務める。機構的解釈可能性とは、モデルの内側を開き、具体的な回路と動作の仕組みを突き…
8 月 10 日、Google のチームが arXiv に AMIE(Video)を出した。Gemini を土台にした複数エージェントの系である。OSCE(客観的臨床能力試験)は医…
実行の殻(harness)はモデルの外側を包むエージェントの実行環境で、文脈の管理、ツールの呼び出し、再試行の方針を受け持つ。Claude Code も Codex もこれにあたる…