模型觀點 · 今日 (發布日 8 月 24 日)
本篇出自 2026年8月24日 晨報
同一份量測裡有一段可以直接照做的內容。DP-attention 是一種把注意力計算(判斷句子裡哪些字彼此相關的步驟)按「資料平行」切開的優化,在單輪固定長度的場景通常是淨賺的;但在長脈絡多輪流量下它由正轉負——在 MiniMax M3 這個模型上,併發 40 時吞吐掉到不開的六成、首字延遲(按下送出到看到第一個字的時間)惡化三倍以上;併發 32 時快取命中率實測 28.8%,理論值是 96.0%。⚠️ 這兩組數字的併發點不同(40 與 32),不是同一次量測的兩個欄位。機制寫得很白:每個運算單元只擁有快取池的私有四分之一,一段 30 萬字的對話只要下次被派到別的單元,整段就得從頭重算(SemiAnalysis,08-24)。
兩件可以直接搬走的:一、先量快取命中率,再看吞吐量——命中率崩了,後面的吞吐數字全是白算的。二、要做主記憶體外溢,主記憶體容量要明顯大於顯示記憶體的快取容量,因為它是寫入時同步複製的設計:寫進顯示記憶體的每一份,也同時寫進主記憶體。不夠大,等於沒開。至於要大多少,量測方給的建議值是 1.5 到 3 倍,原文沒有交代這個區間的兩端怎麼算出來。⚠️ 兩者都出自今天這份單一來源的量測,沒有第三方重跑。另外,本報這一週掃到的學術論文裡沒有值得單獨寫的新東西,這一段本期沒有新的——不拿常青概念冒充新聞。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…