SecondSource從一手資料重建判斷
模型觀點 · 2026年9月3日

有人把一款部署中的模型權重整個拆開實測,推翻了一個業界常用的省錢假設。

模型觀點 · 本週 (發表日 9 月 2 日)

本篇出自 2026年9月3日 晨報

先解釋:現在的大模型多半是專家混合架構,不是每個字都跑整個大模型,而是把每個字分派給少數幾個專門的子模型,所以模型可以很大而每次只用一小塊算力。工程上常見的省錢做法是「把最不重要的專家剪掉」,而判斷重要性的常用代理指標是「這個專家被分派到幾次」。獨立研究者 Alexey Fateev 在四張 RTX PRO 6000 上實跑 GLM-5.3 Flash 的部署檢查點(320B 總參數、18B 活躍),逐項量測而不是讀設定檔,量出兩件事:一、被分派次數與專家實際重要性幾乎不相關(Spearman 相關係數 −0.222);二、把最不重要的那 2% 專家丟掉,仍然改變了 64% 的輸出序列(丟掉最重要的 2% 是 79%)(@superalesha,09-02)。這對「剪枝省成本」這條工程路線是壞消息:常用的那把尺量錯了東西,而且就算量對了,最不重要的那一小撮也不是可以無痛拿掉的。⚠️ 本報對這位研究者的過往紀錄沒有資料,這是單一來源的實測,還沒有人複現。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新