模型觀點 · 本週 (發文日 8 月 21 日)
本篇出自 2026年8月23日 晨報
Together AI 是開放權重模型的推論服務供應商,同一天發了兩份對照,用同一套方法、同一組題目(113 個軟體工程任務、每組跑 4 次),只是對手不同。GLM-5.3 是中國智譜的開放權重模型。第一份(GLM-5.3 對 Claude Fable 5):首次嘗試通過率 69.0% 對 69.7% 實質平手,每次執行成本 3.99 對 21.63 美元,5.4 倍價差。第二份(GLM-5.3 對 GPT-5.6 Sol):69.0% 對 72.7%,成本 3.99 對 8.37 美元。兩份給了相反的操作建議——一份說不要兩個都跑,一份說串起來用。這不是自相矛盾,是同一個判準的兩個結果:兩個模型若在同樣的題目上失敗(相關係數 0.65),組合起來只是多花錢;在不同題目上失敗(0.43),組合才有互補價值。第二份的串接(便宜的先跑、測試不過才升級)拿到 85.9%、每題 6.61 美元,比貴的那個單獨用高 13.2 個百分點、便宜 21%。
驗證: 評測方是利害關係人,方向明確:「便宜的開放權重模型加編排打贏昂貴閉源」直接是它的商業敘事。還有一個足以翻轉排名的口徑問題:第一份裡 Claude Fable 5 有 16 次因模型路由產生的基礎設施錯誤,全算失敗的話它是 67.3%,官方計分是 69.7%——兩種計分差 2.4 個百分點,而首次嘗試的差距只有 0.7 個百分點,換一種計分方式結論就翻面。GLM 那邊的成本只到指數層級、沒有逐次明細,兩邊可信度不對稱。所以可以搬走的是那個判準——先量兩個模型的失敗重疊度,再決定要不要串——不是「誰比較強」這個結論。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…