モデルの読み · 今月 (初出は 9 月 8 日)
この記事の出典 2026年9月20日 夕刊
実験はこう組まれている。2019 年から 2025 年までの 6 年間について、各年を代表するオープンモデルの設計・訓練手法と、各年の訓練コーパスを交差させ、複数の小さな規模で訓練し直す。結果はデータ側の計算資源等価の利得が 12.0 倍、モデル側が 3.7 倍で、割れば 3.24 になる。これは二つの利得倍率の比であって、寄与の割合ではない。著者は、二種類の利得はほぼ独立に足し合わさり、よいデータはどの構成にもだいたい同じだけ効くとも述べている(Dwarkesh Patel、2026-09-08)。計算資源等価の利得とは、同じ進歩をその改良なしで達成するには計算資源が何倍要るか、という意味である。⚠️ 保留は三つ、まとめて持ち帰ってほしい。規模の範囲は原文に「複数の小さな規模で」としか書いていない。事前学習とは大量の文章でまず基盤モデルを訓練する段階を指すが、この種の実験の結論は規模にきわめて敏感である。どの年の手法を「代表的」とするか、その選び方自体が結論を左右する。誤差の範囲もなく、査読も独立の再現もない。同じ日、Adaption Labs 最高経営責任者の Sara Hooker がこの実験を引き、こう述べた。「Pretraining model size scaling is dead because transformers are saturated」と「Only gains now are data」(Sara Hooker、2026-09-08)。⚠️ 彼女の会社が掲げる主張はまさに「経験とデータから学ぶほうが、ひたすらモデルを大きくするより勝る」なので、この発言を中立な技術的観察として引くことはできない。この項の本当の使いどころは、数字へ戻って突き合わせるよう促すところにある。元の実験はモデル側になお 3.7 倍あると測っていた。伝えられた版では「残るのはデータだけ」になった。「X は死んだ」という形の文に出会ったら、最初の一手は、それが根拠にしている数字まで戻り、その数字が本当にゼロと言っているかを見ることである。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…