SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年9月20日

2019 年から 2025 年まで、各年を代表するオープンモデルの設計・訓練手法と各年のコーパスを交差させて訓練し直し、データ側で得られた計算資源等価の利得がモデル側の 3.24 倍だと測った。これは二つの利得倍率の比であって、寄与の割合ではない。そして同じ日、この結果は「モデル規模のスケーリングは死んだ」と伝えられた。

モデルの読み · 今月 (初出は 9 月 8 日)

この記事の出典 2026年9月20日 夕刊

実験はこう組まれている。2019 年から 2025 年までの 6 年間について、各年を代表するオープンモデルの設計・訓練手法と、各年の訓練コーパスを交差させ、複数の小さな規模で訓練し直す。結果はデータ側の計算資源等価の利得が 12.0 倍、モデル側が 3.7 倍で、割れば 3.24 になる。これは二つの利得倍率の比であって、寄与の割合ではない。著者は、二種類の利得はほぼ独立に足し合わさり、よいデータはどの構成にもだいたい同じだけ効くとも述べている(Dwarkesh Patel、2026-09-08)。計算資源等価の利得とは、同じ進歩をその改良なしで達成するには計算資源が何倍要るか、という意味である。⚠️ 保留は三つ、まとめて持ち帰ってほしい。規模の範囲は原文に「複数の小さな規模で」としか書いていない。事前学習とは大量の文章でまず基盤モデルを訓練する段階を指すが、この種の実験の結論は規模にきわめて敏感である。どの年の手法を「代表的」とするか、その選び方自体が結論を左右する。誤差の範囲もなく、査読も独立の再現もない。同じ日、Adaption Labs 最高経営責任者の Sara Hooker がこの実験を引き、こう述べた。「Pretraining model size scaling is dead because transformers are saturated」と「Only gains now are data」(Sara Hooker、2026-09-08)。⚠️ 彼女の会社が掲げる主張はまさに「経験とデータから学ぶほうが、ひたすらモデルを大きくするより勝る」なので、この発言を中立な技術的観察として引くことはできない。この項の本当の使いどころは、数字へ戻って突き合わせるよう促すところにある。元の実験はモデル側になお 3.7 倍あると測っていた。伝えられた版では「残るのはデータだけ」になった。「X は死んだ」という形の文に出会ったら、最初の一手は、それが根拠にしている数字まで戻り、その数字が本当にゼロと言っているかを見ることである。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新