模型觀點
本篇出自 2026年8月9日 晨報
「第三條軸」是論文自己的分類,本報不背書。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation〉(arXiv 2607.27372)自報運算效率 4.1 倍、樣本效率 6.2 倍。前 Meta 研究者 Armen Aghajanyan 指出的那組數字形狀特別乾淨:當每一步生成的備選數量增加時,論文正在最佳化的那個指標一路變好(0.0896 → 0.0763 → 0.0703),而真正代表泛化能力的保留集指標一路變壞(0.1437 → 0.1631 → 0.1835)。同一個旋鈕、兩個指標、方向完全相反、而且都是單調的(原文,2026-08-04)。保留集是訓練時完全沒看過、專門留著檢驗的資料;在訓練分布上變好而在它上面變壞,是「被最佳化的指標」與「真正想要的性質」脫鉤的教科書形狀。⚠️ 那組反轉數字是單一來源報出、本報未複現,也未確認其實驗設定與論文原設定是否可比——這正是本則自己在批評的錯誤類型,所以它是值得追的線索,不是已成立的反駁;論文全文本報未讀,而爭議恰恰全在實驗章節。能拿走的三題盤問清單(不需要讀懂技術細節就能問):這個指標是在哪裡量的,訓練分布還是保留集?分母裡有沒有東西被拿掉?這是新的,還是舊的換個名字?效率宣稱正在成為估值模型與採購決策的輸入,這三題是把它拉回可查證狀態的最短路徑。
只留 email,隨時退訂。這是我們唯一想請你做的事。
評測機構 Artificial Analysis 的 AA-Omniscience 榜設計特殊:答錯扣分、承認不知道不扣分,所以同時量到知識廣度與「拒絕瞎編」的傾向。Teortax…
Teortaxes 對 DeepSeek 2024 年底 V3 模型的官方揭露做雙路徑驗算:硬體路徑(卡數 × 每卡實際算力 × 秒數)和模型路徑(活躍參數 × 訓練資料量 × 標…
先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthrop…
K3 發布材料兩條線(經 Teortaxes 逐字轉引):開發後期「一個早期版本的 K3 撰寫了大多數 kernel」。kernel 是決定模型跑多快的底層加速程式,等於用上一版模…