模型觀點
本篇出自 2026年8月22日 晨報
本報今天定向找了一輪獨立複製或反駁,四個命中全部上溯同一個原點:論文本體、該研究機構的專頁、OpenAI 的官方公告、以及這項研究的專屬網站。去重之後仍然只有一個來源,所以本報的內部信心分數維持 0.55 不動(滿分 1,代表證據還不足以主張任何一方;評分方法)。發表近一年仍無外部複製,這件事本身值得記下來:安全訓練效果的核心負面發現,目前只有提出者自己量過。 第二件是方法細節。 那個「因果證據」的做法,是直接編輯模型的推理文字:加入被評測的措辭則違規減少,移除則增加(該研究的問答頁)。這指向一個自我指涉的限制:用來證明「評測意識污染結果」的那個實驗,靠的正是同一篇論文警告正在退化的、人類讀得懂的推理過程。 如果模型不再用標準英文推理,這個因果實驗連同它想證明的警訊會一起失效,沒辦法再驗證。另有二手摘要載了幾組更細的量值,但本報在論文摘要與官方問答頁都找不到對應原文,依規矩不採用、也不轉述。
怎麼用: 任何實驗室引用類似的「安全訓練把違規率壓了多少」時,這是標配的對質材料——問兩件事:這個降幅有沒有第二個團隊在自己的環境裡重現過,以及量測所依賴的那條推理文字,在你們的模型上還讀不讀得懂。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…