SecondSource從一手資料重建判斷
模型觀點 · 2026年8月23日

同一家供應商用同一套方法做了兩份對照,結論相反——而真正可以搬走的不是誰贏,是「要不要把兩個模型串起來用」的判準。

模型觀點 · 本週 (發文日 8 月 21 日)

本篇出自 2026年8月23日 晨報

Together AI 是開放權重模型的推論服務供應商,同一天發了兩份對照,用同一套方法、同一組題目(113 個軟體工程任務、每組跑 4 次),只是對手不同。GLM-5.3 是中國智譜的開放權重模型。第一份GLM-5.3 對 Claude Fable 5):首次嘗試通過率 69.0% 對 69.7% 實質平手,每次執行成本 3.99 對 21.63 美元,5.4 倍價差第二份GLM-5.3 對 GPT-5.6 Sol):69.0% 對 72.7%,成本 3.99 對 8.37 美元。兩份給了相反的操作建議——一份說不要兩個都跑,一份說串起來用。這不是自相矛盾,是同一個判準的兩個結果:兩個模型若在同樣的題目上失敗(相關係數 0.65),組合起來只是多花錢;在不同題目上失敗(0.43),組合才有互補價值。第二份的串接(便宜的先跑、測試不過才升級)拿到 85.9%、每題 6.61 美元,比貴的那個單獨用高 13.2 個百分點、便宜 21%。

驗證: 評測方是利害關係人,方向明確:「便宜的開放權重模型加編排打贏昂貴閉源」直接是它的商業敘事。還有一個足以翻轉排名的口徑問題:第一份裡 Claude Fable 5 有 16 次因模型路由產生的基礎設施錯誤,全算失敗的話它是 67.3%,官方計分是 69.7%——兩種計分差 2.4 個百分點,而首次嘗試的差距只有 0.7 個百分點,換一種計分方式結論就翻面。GLM 那邊的成本只到指數層級、沒有逐次明細,兩邊可信度不對稱。所以可以搬走的是那個判準——先量兩個模型的失敗重疊度,再決定要不要串——不是「誰比較強」這個結論。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新