模型觀點 · 本週 趨勢 (公布 07-22 前後,經轉引)
本篇出自 2026年7月24日 晨報
Jacobian 猜想是 1939 年提出的代數幾何名題,說的是:如果一個多項式映射的「Jacobian 行列式」是非零常數,這個映射就應該可逆。Anthropic 研究員公布:在人機協作下,Claude Fable 找到一個具體反例,行列式恆為常數、卻把不同的點映到同一處,直接違反猜想;反例另經 Kimi(月之暗面)、ChatGPT(OpenAI)等不同公司的模型,以及 Anthropic 自家的 Sonnet 各自獨立驗證,其後又找到多個同型反例(theZvi 週報,07-23)。本報 7/20 期報過 DeepMind 的系統自主解出 353 個 Erdős 開放問題中的 9 個;這次的證據品質更好:反例本身數學上可機械驗證,且驗證來自互為競品的模型,不是單一廠商自報。邊界有三條,該一起記:一、人類數學家的貢獻是實質的,這不是 AI 獨立完成;二、轉述者自己提醒,一題被解出也同時說明它相對容易;三、有評論者質疑反例可能源自訓練資料中人類已有的結果;成果歸屬與「首例」定位,要等學術界定調。本條同樣是週報單一轉引,我們尚未取得原始公布貼文。附帶一句方法論價值:這種多個競品模型互相交叉驗證的做法,對評測與驗收流程的設計也有參考。其餘方向本週無重大新論文。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…