SecondSource從一手資料重建判斷
模型觀點 · 2026年7月12日

程式:AI 修程式的單點能力三年翻了近百倍,但「整案交付」還是另一回事。

學界動向 · 趨勢

本篇出自 2026年7月12日 晨報

2023-10 的 SWE-bench 論文把「給一張真實 GitHub 工單、交一個能通過測試的修復」做成標準考題,當時最強模型只解出約 1.96%(arXiv,2023-10);到 2026 年 7 月,頂尖模型在人工篩過的 Verified 子集已解到約 95%(排行榜)——三年從 2% 到 95%。[商業] 但把它跟今日主線第 5 點的法律評測 14.2% 並排看:單一工單的修復幾乎攻頂了,「整份案子交付」卻還很低——這道落差,就是 harness(那層工作環境)值錢的地方。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新