模型觀點 · 論文,2026-07-13
本篇出自 2026年7月16日 晨報
新論文在困難規劃測驗上跨多個模型家族做統計分解,發現「規劃」是兩種獨立能力:判斷「這一步能不能走」的局部推理,隨模型放大與更長思考確實變好;想清楚「目標到底可不可達」的全局列舉,幾乎不動(arXiv 2607.11197)。這是「推理算力換能力」信念的又一個域邊界反例,而且最尖銳——全局搜尋恰恰是最該靠多想受益的能力。這條信念的譜系:
並存 ⇄
我們對這條線的現行判斷(2026-07-14 已裁,本期沿用):並存分化、按工作負載分流——開放性問題買「推理時思考」,窄域高頻任務蒸餾進小模型,兩者都在擴張、不互斥。反轉條件:蒸餾小模型在開放性測驗追平前沿推理模型,思考溢價敘事崩;反向,蒸餾模型在窄域外崩壞頻出,蒸餾路線縮回。本條屬「劃界」證據,尚不觸發反轉;單一團隊、單一測驗,未經複現。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…