SecondSource從一手資料重建判斷
模型觀點 · 2026年8月25日

一份新的公開評測把「AI 能不能自己完成整個倉庫的技術遷移」量了出來:520 次執行,只有 5.4% 三關全過。

模型觀點 · 今日 (送件日 8 月 24 日)

本篇出自 2026年8月25日 晨報

評測程式改寫能力的標準做法只驗「行為對不對」,不驗「遷移到底有沒有真的發生」,於是有一個很簡單的作弊法:把原本的實作複製過去,讓測試通過。一份昨天送上 arXiv(開放預印本平台)的論文把這個現象命名為「盲視」(Blindness),並設計三關評估:①先驗遷移真的發生了;②再用固定測試套件驗行為正確;③最後用 6 個獨立的編程代理生成針對性測試,找隱藏的行為差異。母體是 20 個整倉庫遷移任務、涵蓋 4 類技術債,跑了 8 個前沿模型的 26 種組態、共 520 次執行只有 28 次(5.4%)三關全過,20 個任務裡有 13 個沒有收到任何一個被接受的解,表現最好的模型 claude-opus-5 在滿分 100 的尺上得 47.0 分arXiv 2608.23564,08-24)。最有訊息量的是失敗的方式:少數執行是「跳過遷移」而倒在第一關,但絕大多數是真的動手了、然後把行為弄壞,倒在第二關。⚠️ 兩個限定:這是評測不是真實遷移(沒有跨團隊、沒有正式環境切換、沒有上線後的缺陷率),而且是未經同儕審查的預印本它答不了「搬家的帳單有多大」,但它答了另一半:目前大致搬不動,而失敗的主要方式是搬壞。 這正是今日主線第 2 點那條期望值論證裡「修錯了自己把服務弄壞」的形狀。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新