SecondSource從一手資料重建判斷
模型觀點 · 2026年8月5日

一道任何人都能重做的算力對帳。

模型觀點 · 方法論 趨勢觀察

本篇出自 2026年8月5日 晨報

Teortaxes 對 DeepSeek 2024 年底 V3 模型的官方揭露做雙路徑驗算:硬體路徑(卡數 × 每卡實際算力 × 秒數)和模型路徑(活躍參數 × 訓練資料量 × 標準係數)各算一次,兩邊差 14%,可用部分運算仍走較慢精度解釋,他判「大致對得上」(Teortaxes,07-21)。本報重算了他的兩條算式,確認無誤,並自己補了第三道他沒做的:2048 張卡 × 24 小時 × 55 天=約 270 萬 GPU 小時,與 V3 技術報告自揭的約 266 萬差 1.5%——獨立對上,「55 天」不是湊的。所以任何實驗室給出「X 張卡、Y 天、Z 資料量」,就把兩邊各算一次,對不上就是有東西沒說——不需要任何非公開資訊。關鍵切割照抄:這證明「最終那次訓練的揭露數字自洽」,不證明「DeepSeek 沒有更多卡」——外部對其組織級總持有量的更高估計與此完全相容,兩回事別混。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新