SecondSource從一手資料重建判斷
模型觀點 · 2026年8月24日

一個行之有年的標準優化,在今天這種流量下把快取命中率從理論的 96.0% 打到實測 28.8%。

模型觀點 · 今日 (發布日 8 月 24 日)

本篇出自 2026年8月24日 晨報

同一份量測裡有一段可以直接照做的內容。DP-attention 是一種把注意力計算(判斷句子裡哪些字彼此相關的步驟)按「資料平行」切開的優化,在單輪固定長度的場景通常是淨賺的;但在長脈絡多輪流量下它由正轉負——在 MiniMax M3 這個模型上,併發 40 時吞吐掉到不開的六成、首字延遲(按下送出到看到第一個字的時間)惡化三倍以上;併發 32 時快取命中率實測 28.8%,理論值是 96.0%。⚠️ 這兩組數字的併發點不同(40 與 32),不是同一次量測的兩個欄位。機制寫得很白:每個運算單元只擁有快取池的私有四分之一,一段 30 萬字的對話只要下次被派到別的單元,整段就得從頭重算SemiAnalysis,08-24)。

兩件可以直接搬走的:一、先量快取命中率,再看吞吐量——命中率崩了,後面的吞吐數字全是白算的。二、要做主記憶體外溢,主記憶體容量要明顯大於顯示記憶體的快取容量,因為它是寫入時同步複製的設計:寫進顯示記憶體的每一份,也同時寫進主記憶體。不夠大,等於沒開。至於要大多少,量測方給的建議值是 1.5 到 3 倍,原文沒有交代這個區間的兩端怎麼算出來。⚠️ 兩者都出自今天這份單一來源的量測,沒有第三方重跑。另外,本報這一週掃到的學術論文裡沒有值得單獨寫的新東西,這一段本期沒有新的——不拿常青概念冒充新聞。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新