模型觀點 · 本月 (原發日 9 月 8 日)
本篇出自 2026年9月20日 晨報
實驗的做法是把 2019 到 2025 六年間各年具代表性的開源模型設計與訓練做法,和各年的訓練語料交叉組合,在多種小規模下重新訓練。結果是資料側的算力等效增益 12.0 倍、模型側 3.7 倍,兩者相除就是 3.24;這是兩個增益倍數的比值,不是貢獻佔比;作者並說兩種增益近乎獨立疊加,好資料對每個架構的幫助差不多(Dwarkesh Patel,2026-09-08)。算力等效增益的意思是:同樣的進步,如果不靠這項改進,要多花幾倍算力才能達到。⚠️ 三個保留一起帶走。規模區間原文只寫「多種小規模」。預訓練是用大量文字先訓出基礎模型的那個階段,而這類實驗的結論對規模極度敏感;哪一年的做法算「代表性」,挑法本身就左右結論;沒有誤差範圍,也沒有同儕審查或獨立複現。同一天,Adaption Labs 執行長 Sara Hooker 引用這個實驗,講出來的版本是「Pretraining model size scaling is dead because transformers are saturated」與「Only gains now are data」(Sara Hooker,2026-09-08)。⚠️ 她的公司論述正是「從經驗與資料學習勝過一味放大模型」,所以這句話不能當中立的技術觀察引用。這一則真正的用處是提醒你回去對數字:原始實驗量到模型側仍有 3.7 倍,轉述版本變成「只剩資料」。遇到「X 已死」這種句子,第一個動作是回去找它所根據的數字,看那個數字有沒有真的說零。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…