模型觀點 · 本週 (事件日 08-17)
本篇出自 2026年8月18日 晨報
一個團隊在模型託管平台 Hugging Face 的部落格報告:他們做了一個會看限制條件的 GPU 配置器(該團隊自家的產品),在七個情境上與最單純的「先到先服務」排程對比,硬體完全相同、工作負載完全相同,GPU 使用率最多提升 33 個百分點(對照組的基準線約在五成,等於半個叢集閒著),優先權加權的產出在七個情境中全數提升,最多 105%。這把尺量的是照工作優先權加權後的完成量,比的是同一情境下的先到先服務排程。⚠️ 這兩個是兩把不同的尺,不可互推成「效率提升 105%」。問題的形狀值得看懂:四種工作搶同一批 GPU:訓練、批次推論、量化是批次型(一旦啟動就要一整塊 GPU 連續不中斷跑完),即時推論相反,需求曲線每個時間步都在變。即時推論不能等,所以唯一保證可用的做法是按當日尖峰整天保留:一個中午要 6 顆、凌晨只要 2 顆的應用,會整天佔住 6 顆,那 4 顆閒置 GPU 整天不能給任何批次工作用;它們沒被使用,也不是免費的。跟今日主線第 2 點併讀會很刺眼:一邊是 4.25 吉瓦的算力要拿 1,050 億美元去擔保,一邊是同一批硬體光靠改排程就能多用出三成。「算力短缺」有多少是真短缺、有多少是排程沒做好,是一個對資本敘事有殺傷力的問題。⚠️ 這個併讀是本報的推論,不是這篇的主張。⚠️ 另外四個限制一起帶:這是發表方自己的量測、自己設的對照基準線,沒有獨立複現,也沒有同儕審查。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…