模型觀點 · 今日 (送件日 8 月 24 日)
本篇出自 2026年8月25日 晨報
評測程式改寫能力的標準做法只驗「行為對不對」,不驗「遷移到底有沒有真的發生」,於是有一個很簡單的作弊法:把原本的實作複製過去,讓測試通過。一份昨天送上 arXiv(開放預印本平台)的論文把這個現象命名為「盲視」(Blindness),並設計三關評估:①先驗遷移真的發生了;②再用固定測試套件驗行為正確;③最後用 6 個獨立的編程代理生成針對性測試,找隱藏的行為差異。母體是 20 個整倉庫遷移任務、涵蓋 4 類技術債,跑了 8 個前沿模型的 26 種組態、共 520 次執行:只有 28 次(5.4%)三關全過,20 個任務裡有 13 個沒有收到任何一個被接受的解,表現最好的模型 claude-opus-5 在滿分 100 的尺上得 47.0 分(arXiv 2608.23564,08-24)。最有訊息量的是失敗的方式:少數執行是「跳過遷移」而倒在第一關,但絕大多數是真的動手了、然後把行為弄壞,倒在第二關。⚠️ 兩個限定:這是評測不是真實遷移(沒有跨團隊、沒有正式環境切換、沒有上線後的缺陷率),而且是未經同儕審查的預印本。它答不了「搬家的帳單有多大」,但它答了另一半:目前大致搬不動,而失敗的主要方式是搬壞。 這正是今日主線第 2 點那條期望值論證裡「修錯了自己把服務弄壞」的形狀。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…