SecondSource從一手資料重建判斷
大神觀點 · 2026年8月6日

「為什麼中型模型追得平旗艦」等到了第二位獨立分析者。

大神觀點 · 證據更新 (貼文原發 07-24,判斷今日升級)

本篇出自 2026年8月6日 晨報

Anthropic 7 月 24 日發布 Claude Opus 5——定位中型、約旗艦 Fable 5 的半價,官方稱多數實務任務追平旗艦。按舊常識,追平旗艦該靠更大的模型,所以「憑什麼」需要解釋。本報 7/27 期報過當時唯一的機制歸因,來自 Ai2(Allen Institute for AI)研究員、Interconnects 電子報作者、後訓練領域專家 Nathan Lambert:槓桿是「更快的迭代速度+規模化強化學習」——後訓練階段大規模跑強化學習(獎勵正確的最終答案,讓模型學會長鏈推理),迭代要反覆試錯,模型越大越貴越慢,「Fable 太大,還跑不動這樣的強化學習」(Lambert,07-24)。當時只有一人主張,本報按下不表。今天等到第二位:長期追蹤中國模型的獨立評論者 Teortaxes 同日的歸因是「規模化強化學習+蒸餾——而且是自家大模型的正規蒸餾」,即拿自家更大模型的輸出當教材訓練中型模型(Teortaxes,07-24)。兩人互相沒有引用,說法相容互補:大模型當老師、中型模型跑得動快迭代。這條機制判斷今天從按下不表升為本報的工作假說——但仍未查證:機制真偽,最終只有 Anthropic 官方的訓練方法自述能定。它支持的是本報 7/27 期那條單人版判斷;要推翻它也很簡單,官方自述講出不同的做法就翻。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新