模型觀點 · 今日 (發表日 9 月 8 日)
本篇出自 2026年9月9日 晨報
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這一側是漂亮的勝利;但在同一個時點,專門測過度拒答的 XSTest 上,誤拒率從 2.00% 升到 74.00%。XSTest 是一組「聽起來危險但其實無害」的提示。他們自己的話是:那不是更安全的模型,是一台鈍化的拒答機器,而只看有害那一側完全看不到它(Multiverse Computing CAI,2026-09-08)。為什麼只按主題設護欄不夠,用他們自己的例子: 同一個基礎模型可能被部署成公民教育輔導,也可能被部署成公部門助理;兩者都該回答關於選舉的事實問題,但只有其中一個需要拒絕「幫我寫針對性的政治操縱文案」。他們的修法是把提示成對做出來,一對共享同一主題、只在意圖上不同:加入這種資料後,該回答那一側的誤拒從 32.94% 降到 4.16%,而該拒絕那一側只從 91.88% 掉到 87.72%。向供應商要安全數字時,記得同時要誤拒率:只給一側,看不出鈍化。 ⚠️ 這是研究團隊自己介紹自己的論文,未經同儕審查;但它主動報告了對自己不利的那個 74%,這在本報的判準裡是加分項。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…
Epoch AI 是追蹤 AI 算力與能力進展的獨立研究機構,它最近發表一套 AI 研發工作的分類法,仿照美國勞工部長年使用的 ONET 職業分類系統,把研發流程拆成六段:決定做什…