大神觀點 · 證據更新 (貼文原發 07-24,判斷今日升級)
本篇出自 2026年8月6日 晨報
Anthropic 7 月 24 日發布 Claude Opus 5——定位中型、約旗艦 Fable 5 的半價,官方稱多數實務任務追平旗艦。按舊常識,追平旗艦該靠更大的模型,所以「憑什麼」需要解釋。本報 7/27 期報過當時唯一的機制歸因,來自 Ai2(Allen Institute for AI)研究員、Interconnects 電子報作者、後訓練領域專家 Nathan Lambert:槓桿是「更快的迭代速度+規模化強化學習」——後訓練階段大規模跑強化學習(獎勵正確的最終答案,讓模型學會長鏈推理),迭代要反覆試錯,模型越大越貴越慢,「Fable 太大,還跑不動這樣的強化學習」(Lambert,07-24)。當時只有一人主張,本報按下不表。今天等到第二位:長期追蹤中國模型的獨立評論者 Teortaxes 同日的歸因是「規模化強化學習+蒸餾——而且是自家大模型的正規蒸餾」,即拿自家更大模型的輸出當教材訓練中型模型(Teortaxes,07-24)。兩人互相沒有引用,說法相容互補:大模型當老師、中型模型跑得動快迭代。這條機制判斷今天從按下不表升為本報的工作假說——但仍未查證:機制真偽,最終只有 Anthropic 官方的訓練方法自述能定。它支持的是本報 7/27 期那條單人版判斷;要推翻它也很簡單,官方自述講出不同的做法就翻。
只留 email,隨時退訂。這是我們唯一想請你做的事。
:今天的模型比半年前「更有企圖心」。這裡說的 agent,指能自主連續執行多步驟任務的 AI 系統。舊一代 agent 不斷把專案降級成試點,現在的模型急著真的把事做完;他把這歸因…
:多數人——包括會議室裡拍板的人——連最基本的「AI 丸」都沒吞(吞藥丸=接受現實的英文比喻):「他們不相信 AI 有朝一日能做到它現在已經在做的事」。他把落差釘在已實現能力上:認…
同一位 Gavin Baker 的另一筆帳,與上一則的 TPU 估計合看:同一個人,一筆低估、一筆美化,共同教訓是轉述會失真:方向能信,數字與「免費」要回原文。他多次引用的太空資料…
AI 工程圈意見領袖、Latent Space 播客共同主持人 swyx 公開宣告:「每百萬 token 多少錢,大約去年就不再是相關的成本量測了;x 軸還沒換成每任務成本($/t…