SecondSource從一手資料重建判斷
模型觀點 · 2026年8月9日

一篇自稱開出「第三條預訓練軸」的論文,被同一個旋鈕的兩個指標打了對台,2026-08-04。

模型觀點

本篇出自 2026年8月9日 晨報

「第三條軸」是論文自己的分類,本報不背書。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation〉(arXiv 2607.27372)自報運算效率 4.1 倍、樣本效率 6.2 倍。前 Meta 研究者 Armen Aghajanyan 指出的那組數字形狀特別乾淨:當每一步生成的備選數量增加時,論文正在最佳化的那個指標一路變好(0.0896 → 0.0763 → 0.0703),而真正代表泛化能力的保留集指標一路變壞(0.1437 → 0.1631 → 0.1835)。同一個旋鈕、兩個指標、方向完全相反、而且都是單調的原文,2026-08-04)。保留集是訓練時完全沒看過、專門留著檢驗的資料;在訓練分布上變好而在它上面變壞,是「被最佳化的指標」與「真正想要的性質」脫鉤的教科書形狀。⚠️ 那組反轉數字是單一來源報出、本報未複現,也未確認其實驗設定與論文原設定是否可比——這正是本則自己在批評的錯誤類型,所以它是值得追的線索,不是已成立的反駁;論文全文本報未讀,而爭議恰恰全在實驗章節。能拿走的三題盤問清單(不需要讀懂技術細節就能問):這個指標是在哪裡量的,訓練分布還是保留集?分母裡有沒有東西被拿掉?這是新的,還是舊的換個名字?效率宣稱正在成為估值模型與採購決策的輸入,這三題是把它拉回可查證狀態的最短路徑。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新