SecondSource從一手資料重建判斷
模型觀點 · 2026年8月11日

「模型會綁死在自家執行框架上」這個通念,今天有了兩篇獨立學術基準。

模型觀點 · 證據更新 (原發 2026-06-27)

本篇出自 2026年8月11日 晨報

執行框架(harness)是包在模型外面的 agent 執行殼,負責上下文管理、工具呼叫與重試策略,Claude Code、Codex 都是。六月時一位機器學習教科書作者做了個小型自測,發現阿里的 Qwen3.6 在 OpenAI 的 Codex 裡反而比在自家 Qwen-Code 裡好,他自己也說「這是很小的基準,姑且聽之」。本報今天完成定向查證:一篇涵蓋 8 個模型後端、6 個執行框架、106 個任務,共 5,194 條執行軌跡,結論是能力應該算在「模型×框架配置」這個層級,而不是算在裸模型頭上(Harness-Bench,2026-05-27);另一篇量到固定模型只換框架,一次通過率可擺動 27.4 個百分點,而換模型本身是 29.4 個百分點,兩者量級逼近(Claw-SWE-Bench,2026-06-10)。本報對這條的內部信心分數因此從 0.55 升到 0.6(滿分 1;低於 0.5 代表證據還不足以主張任何一方,評分方法見方法論):六月一個人的小自測,今天有了兩篇千軌跡等級的獨立基準,幅度也只動了半格,這個節制本身就是方法。⚠️ 新證據同時收窄了原本的處方:27.4 個百分點大到「選你熟的框架硬塞模型」在錯誤配對上代價很大,正確讀法是「原生綁定不可信,但配對必須逐對實測」。⚠️ 那位作者的具體資料點兩篇都沒直接複測,仍是單一來源;本報另記過一篇 Nvidia 的論文結論相反,兩邊並存、不判誰對。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新