SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年8月11日

「モデルは自社の実行の殻に縛られる」という通念に、今日から独立した学術の基準が二本ついた。

モデルの読み · 証拠更新 (元の発信は 2026-06-27)

この記事の出典 2026年8月11日 夕刊

実行の殻(harness)はモデルの外側を包むエージェントの実行環境で、文脈の管理、ツールの呼び出し、再試行の方針を受け持つ。Claude Code も Codex もこれにあたる。6 月、機械学習の教科書を書いた著者が小さな自己流の試験をして、アリババの Qwen3.6 が自社の Qwen-Code よりも OpenAI の Codex の上でよく動くと気づいた。本人も、これはごく小さな基準なので話半分に聞いてほしいと書いている。本紙は今日、狙いを定めた確認を終えた。一本は 8 つのモデル、6 つの実行の殻、106 の課題を覆い、実行の軌跡は 5,194 本ある。結論は、能力を裸のモデルにではなく「モデル×殻の組み合わせ」という層に帰すべきだ、というものだ(Harness-Bench、2026-05-27)。もう一本は、モデルを固定して殻だけ替えると、一発合格率が 27.4 ポイント振れると測った。モデルそのものを替えたときは 29.4 ポイントで、二つの量は近い(Claw-SWE-Bench、2026-06-10)。本紙のこの線についての内部の確信度は、これで 0.55 から 0.6 へ上がった(満点は 1。0.5 を下回るあいだは、どちらの側も主張できるだけの証拠がないことを意味する。採点の方法は方法論に置いた)。6 月には一人の小さな自己流の試験しかなかったものに、今日は千本単位の軌跡を持つ独立した基準が二本ついた。それでも動いたのは半目盛りだけで、この抑制そのものが方法である。⚠️ 新しい証拠は、もとの処方を同時に狭めた。27.4 ポイントは大きく、「慣れた殻に好きなモデルを押し込む」は、組み合わせを外したときの代償が重い。正しい読み方は「自社製どうしの結び付きは信用しない。ただし組み合わせは一対ずつ実測する」になる。⚠️ あの著者の具体的なデータ点は、二本とも直接には測り直しておらず、依然として単一のソースだ。本紙は Nvidia の論文が逆の結論を出したことも別に記録しており、両方を残してどちらが正しいかは裁いていない。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新