模型觀點 · 證據更新 (原發 2026-06-27)
本篇出自 2026年8月11日 晨報
執行框架(harness)是包在模型外面的 agent 執行殼,負責上下文管理、工具呼叫與重試策略,Claude Code、Codex 都是。六月時一位機器學習教科書作者做了個小型自測,發現阿里的 Qwen3.6 在 OpenAI 的 Codex 裡反而比在自家 Qwen-Code 裡好,他自己也說「這是很小的基準,姑且聽之」。本報今天完成定向查證:一篇涵蓋 8 個模型後端、6 個執行框架、106 個任務,共 5,194 條執行軌跡,結論是能力應該算在「模型×框架配置」這個層級,而不是算在裸模型頭上(Harness-Bench,2026-05-27);另一篇量到固定模型只換框架,一次通過率可擺動 27.4 個百分點,而換模型本身是 29.4 個百分點,兩者量級逼近(Claw-SWE-Bench,2026-06-10)。本報對這條的內部信心分數因此從 0.55 升到 0.6(滿分 1;低於 0.5 代表證據還不足以主張任何一方,評分方法見方法論):六月一個人的小自測,今天有了兩篇千軌跡等級的獨立基準,幅度也只動了半格,這個節制本身就是方法。⚠️ 新證據同時收窄了原本的處方:27.4 個百分點大到「選你熟的框架硬塞模型」在錯誤配對上代價很大,正確讀法是「原生綁定不可信,但配對必須逐對實測」。⚠️ 那位作者的具體資料點兩篇都沒直接複測,仍是單一來源;本報另記過一篇 Nvidia 的論文結論相反,兩邊並存、不判誰對。
只留 email,隨時退訂。這是我們唯一想請你做的事。
2025 年 3 月,OpenAI 的研究者發表過一個發現:讓較弱的模型去讀較強模型的思路鏈——也就是模型給答案前寫下的中間推理文字——抓作弊的效果遠好過只看它最後做了什麼;但如果…
Stella Biderman 是開源 AI 研究組織 EleutherAI 的執行董事。機制可解釋性指的是試圖打開模型內部、找出具體電路與運作機制的研究路線。她的主張有兩層:弱版…
蒸餾是用一個模型(老師)的輸出去訓練另一個模型(學生)。近日有一份論文被廣泛引用來證明中國的開放權重模型蒸餾自 Anthropic 的 Opus。逐段轉述該論文的 @bookwor…
8 月 10 日,Google 團隊在 arXiv 放出 AMIE(Video)——一套以 Gemini 為基礎的多 agent 系統。OSCE(客觀結構式臨床測驗)是醫學教育用的…