模型觀點 · 方法論 趨勢觀察
本篇出自 2026年8月5日 晨報
Teortaxes 對 DeepSeek 2024 年底 V3 模型的官方揭露做雙路徑驗算:硬體路徑(卡數 × 每卡實際算力 × 秒數)和模型路徑(活躍參數 × 訓練資料量 × 標準係數)各算一次,兩邊差 14%,可用部分運算仍走較慢精度解釋,他判「大致對得上」(Teortaxes,07-21)。本報重算了他的兩條算式,確認無誤,並自己補了第三道他沒做的:2048 張卡 × 24 小時 × 55 天=約 270 萬 GPU 小時,與 V3 技術報告自揭的約 266 萬差 1.5%——獨立對上,「55 天」不是湊的。所以任何實驗室給出「X 張卡、Y 天、Z 資料量」,就把兩邊各算一次,對不上就是有東西沒說——不需要任何非公開資訊。關鍵切割照抄:這證明「最終那次訓練的揭露數字自洽」,不證明「DeepSeek 沒有更多卡」——外部對其組織級總持有量的更高估計與此完全相容,兩回事別混。
只留 email,隨時退訂。這是我們唯一想請你做的事。
評測機構 Artificial Analysis 的 AA-Omniscience 榜設計特殊:答錯扣分、承認不知道不扣分,所以同時量到知識廣度與「拒絕瞎編」的傾向。Teortax…
先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthrop…
K3 發布材料兩條線(經 Teortaxes 逐字轉引):開發後期「一個早期版本的 K3 撰寫了大多數 kernel」。kernel 是決定模型跑多快的底層加速程式,等於用上一版模…
昨夜新進的 15 篇論文尚未處理、本欄無單日增量,出一組「說法對學術」的對照。Vinyals 自陳過去一年改變的想法:在數學/寫程式這類答案可自動核對的窄領域上訓練(AI 圈稱 R…