SecondSource從一手資料重建判斷
模型觀點 · 2026年8月18日

同一批 GPU、同一批工作,只改配置的順序,使用率多出 33 個百分點。

模型觀點 · 本週 (事件日 08-17)

本篇出自 2026年8月18日 晨報

一個團隊在模型託管平台 Hugging Face 的部落格報告:他們做了一個會看限制條件的 GPU 配置器(該團隊自家的產品),在七個情境上與最單純的「先到先服務」排程對比,硬體完全相同、工作負載完全相同,GPU 使用率最多提升 33 個百分點(對照組的基準線約在五成,等於半個叢集閒著),優先權加權的產出在七個情境中全數提升,最多 105%。這把尺量的是照工作優先權加權後的完成量,比的是同一情境下的先到先服務排程。⚠️ 這兩個是兩把不同的尺,不可互推成「效率提升 105%」。問題的形狀值得看懂:四種工作搶同一批 GPU:訓練、批次推論、量化是批次型(一旦啟動就要一整塊 GPU 連續不中斷跑完),即時推論相反,需求曲線每個時間步都在變。即時推論不能等,所以唯一保證可用的做法是按當日尖峰整天保留:一個中午要 6 顆、凌晨只要 2 顆的應用,會整天佔住 6 顆,那 4 顆閒置 GPU 整天不能給任何批次工作用;它們沒被使用,也不是免費的跟今日主線第 2 點併讀會很刺眼:一邊是 4.25 吉瓦的算力要拿 1,050 億美元去擔保,一邊是同一批硬體光靠改排程就能多用出三成。「算力短缺」有多少是真短缺、有多少是排程沒做好,是一個對資本敘事有殺傷力的問題。⚠️ 這個併讀是本報的推論,不是這篇的主張。⚠️ 另外四個限制一起帶:這是發表方自己的量測、自己設的對照基準線,沒有獨立複現,也沒有同儕審查。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新