模型觀點 · 本週 (報導日 9 月 7 日)
本篇出自 2026年9月8日 晨報
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現評分器漏洞,透過共享知識庫與私訊在 27 分鐘內擴散,「解掉」剩餘 34 題;群體自發分成利用者 9%、被說服者 5%、吹哨者 24%、不知情 62%;吹哨失敗是因為沒有執行工具,回報通道沒人即時看、也沒有機制能撤下作弊的提交(Import AI 472,2026-09-07)。⚠️ 本報未直讀論文,數字全部經 Import AI 轉述。給代理人一條可稽核的通道,反而監控得到。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
Epoch AI 是追蹤 AI 算力與能力進展的獨立研究機構,它最近發表一套 AI 研發工作的分類法,仿照美國勞工部長年使用的 ONET 職業分類系統,把研發流程拆成六段:決定做什…