SecondSource從一手資料重建判斷
產品動態 · 2026年9月1日

兩天內第二篇「用快閃記憶體裝模型」的論文,來自完全不同的團隊。

晶片與半導體 · 本週 (發布日 8 月 31 日)

本篇出自 2026年9月1日 晨報

本報 8 月 31 日那期講過牛津大學那篇:高頻寬快閃記憶體每一疊裝得下的容量是現行高頻寬記憶體的 16 倍,但直接換上去會拖垮效能,因為快閃記憶體的長尾延遲會讓 GPU 的排程器空等。今天新的是第二個團隊、不同解法:華為、蘇黎世聯邦理工學院與華中科技大學共同發表 FLINT,同樣把快閃記憶體當成高頻寬記憶體旁邊的容量層來放模型權重,做法有三件——用硬體緩衝控制器把零碎讀取合併成連續大批、把快閃記憶體的維護動作整個搬出推論的關鍵路徑、把一般固態硬碟那套「什麼都能寫」的位址對照表換成一張只讀的精簡表(Semiconductor Engineering,08-31論文原文 arXiv 2608.25062,2026 年 8 月)。兩篇論文擺在一起看: 兩天內兩個互不相干的團隊、兩種不同做法,指向同一個瓶頸診斷——推論現在卡的是記憶體裝得下多少,不是算得多快。⚠️ 兩篇都停在論文階段,沒有任何一篇公布真實推論負載下的延遲實測,那仍是這條線該等的訊號。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新