モデルの読み
この記事の出典 2026年8月9日 夕刊
「第三の軸」は論文自身の分類であり、本紙は裏書きしない。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation〉(arXiv 2607.27372)は、計算効率が 4.1 倍、サンプル効率が 6.2 倍だと自ら報じている。元 Meta の研究者 Armen Aghajanyan が指摘した数字の形は、めずらしいほどきれいだ。一歩ごとに生成する候補の数を増やすと、論文が最適化しているその指標は一貫してよくなり(0.0896 → 0.0763 → 0.0703)、汎化の力を本当に表すホールドアウト側の指標は一貫して悪くなる(0.1437 → 0.1631 → 0.1835)。同じつまみ、二つの指標、向きは正反対、しかもどちらも単調である(原文、2026-08-04)。ホールドアウトとは、学習のあいだ一度も見せずに検証のために取り分けておくデータのことだ。学習の分布の上でよくなり、その上で悪くなるのは、「最適化された指標」と「本当に欲しい性質」が外れていく教科書どおりの形である。⚠️ あの反転の数字は単一の出どころが報じたもので、本紙は再現していない。実験の設定が論文のもとの設定と比べられるのかも確かめていない——これはこの一本が自ら批判している誤りの型そのものであり、だからこれは追う値打ちのある手がかりであって、成り立った反証ではない。 論文の本文も本紙は読んでおらず、争点はまさに実験の章にある。持ち帰れる三つの問い(技術の細部が分からなくても問える)。この指標はどこで測ったのか、学習の分布かホールドアウトか。分母から何かが抜かれていないか。これは新しいのか、古いものの名前を替えただけか。効率の主張は、企業価値の見立てにも調達の判断にも入力として入りはじめている。この三つは、それを確かめられる状態へ引き戻す最短の道である。
評価機関 Artificial Analysis の AA-Omniscience の表は設計が変わっている。誤答は減点、知らないと認めるのは減点しない。だから知識の広さと「でっち…
Teortaxes は DeepSeek の 2024 年の末の V3 のモデルについての公式の開示に、2 つの経路で検算を掛けている。ハードの経路(カードの枚数 × 1 枚あたり…
先に、この「1 点差」がどの物差しで測られたものかを書く。第三者の評価機関 Artificial Analysis の総合の知性の指数、つまり複数の試験を重み付けして 1 つの総点…
K3 の発表の資料に 2 本の線がある(いずれも Teortaxes が逐語で転引したものである)。1 本目は、開発の後期に K3 の初期の版が kernel の大半を書いた、とい…