晶片與半導體 · 本週 (發布日 8 月 30 日)
本篇出自 2026年8月31日 晨報
牛津大學的研究團隊發表論文:高頻寬快閃記憶體每一疊的容量是現行高頻寬記憶體的 16 倍、頻寬相當,看起來就是推論裝不下大模型的解答;但直接替換會嚴重拖垮效能,因為快閃記憶體的長尾延遲會讓 GPU 的排程器空等。他們的做法是兩種記憶體混用,靠預測把慢的那一半排出關鍵路徑(Semiconductor Engineering,08-30;論文原文,IEEE Computer Architecture Letters,2026 年 8 月)。為什麼值得記: 今日主線第 1、2 點講的都是推論的錢,而推論成本的物理底層就卡在「模型放不放得進記憶體」。容量便宜 16 倍是個很大的數字,但它換來的是延遲。這筆帳還沒有人算完,而算完之前,任何「記憶體要變便宜了」的推論都缺一半。這筆帳算完的訊號是有人公布混用架構在真實推論負載下的延遲實測,而不是又一個容量倍數。
只留 email,隨時退訂。這是我們唯一想請你做的事。
9 月 3 日的 Daybreak for Frontline Defenders 公告承諾十億美元補貼防禦方取用其前沿資安能力,起於美國,目標六個月內消耗完;優先對象是水務與污水…
Broadcom 做客製 AI 加速器與網通晶片,是超大規模雲端業者自研晶片的主要設計夥伴,所以它的營收是「大廠不用 NVIDIA 的那一部分」的直接代理指標。9 月 2 日的官方…
代理編碼工具在企業端最大的採用障礙,一直是「我的原始碼與密鑰會不會離開我的網路」。Cursor 9 月 2 日推出自架機器:模型推論仍在雲端,但工具執行整個拉回客戶自己的機器,程式…
現價是每一百萬個輸入 token 0.75 美元、輸出 3.75 美元,而同一頁逐字寫著這是優惠價、2026 年 12 月 31 日到期,2027 年 1 月 1 日起改為 1.5…