SecondSource從一手資料重建判斷
模型觀點 · 2026年9月20日

把 2019 到 2025 各年的開源模型設計與訓練做法和各年的語料交叉重訓,量出資料側的算力等效增益是模型側的 3.24 倍,這是兩個增益倍數的比值、不是貢獻佔比;同一天,這個結果被轉述成「模型規模擴放已死」。

模型觀點 · 本月 (原發日 9 月 8 日)

本篇出自 2026年9月20日 晨報

實驗的做法是把 2019 到 2025 六年間各年具代表性的開源模型設計與訓練做法,和各年的訓練語料交叉組合,在多種小規模下重新訓練。結果是資料側的算力等效增益 12.0 倍、模型側 3.7 倍,兩者相除就是 3.24;這是兩個增益倍數的比值,不是貢獻佔比;作者並說兩種增益近乎獨立疊加,好資料對每個架構的幫助差不多(Dwarkesh Patel,2026-09-08)。算力等效增益的意思是:同樣的進步,如果不靠這項改進,要多花幾倍算力才能達到。⚠️ 三個保留一起帶走。規模區間原文只寫「多種小規模」。預訓練是用大量文字先訓出基礎模型的那個階段,而這類實驗的結論對規模極度敏感;哪一年的做法算「代表性」,挑法本身就左右結論;沒有誤差範圍,也沒有同儕審查或獨立複現。同一天,Adaption Labs 執行長 Sara Hooker 引用這個實驗,講出來的版本是「Pretraining model size scaling is dead because transformers are saturated」與「Only gains now are data」(Sara Hooker,2026-09-08)。⚠️ 她的公司論述正是「從經驗與資料學習勝過一味放大模型」,所以這句話不能當中立的技術觀察引用。這一則真正的用處是提醒你回去對數字:原始實驗量到模型側仍有 3.7 倍,轉述版本變成「只剩資料」。遇到「X 已死」這種句子,第一個動作是回去找它所根據的數字,看那個數字有沒有真的說零。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新