SecondSource從一手資料重建判斷
產品動態 · 2026年8月31日

快閃記憶體每一疊裝得下 16 倍,但直接換上去會讓 GPU 餓死——牛津大學提出的折衷。

晶片與半導體 · 本週 (發布日 8 月 30 日)

本篇出自 2026年8月31日 晨報

牛津大學的研究團隊發表論文:高頻寬快閃記憶體每一疊的容量是現行高頻寬記憶體的 16 倍、頻寬相當,看起來就是推論裝不下大模型的解答;但直接替換會嚴重拖垮效能,因為快閃記憶體的長尾延遲會讓 GPU 的排程器空等。他們的做法是兩種記憶體混用,靠預測把慢的那一半排出關鍵路徑(Semiconductor Engineering,08-30論文原文,IEEE Computer Architecture Letters,2026 年 8 月)。為什麼值得記: 今日主線第 1、2 點講的都是推論的錢,而推論成本的物理底層就卡在「模型放不放得進記憶體」。容量便宜 16 倍是個很大的數字,但它換來的是延遲。這筆帳還沒有人算完,而算完之前,任何「記憶體要變便宜了」的推論都缺一半。這筆帳算完的訊號是有人公布混用架構在真實推論負載下的延遲實測,而不是又一個容量倍數。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新