SecondSource從一手資料重建判斷
模型觀點 · 2026年9月9日

同一個模型在「有害提示拒答率」最好的那個時點,對明顯安全的提示誤拒率是 74%。

模型觀點 · 今日 (發表日 9 月 8 日)

本篇出自 2026年9月9日 晨報

Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這一側是漂亮的勝利;但在同一個時點,專門測過度拒答的 XSTest 上,誤拒率從 2.00% 升到 74.00%。XSTest 是一組「聽起來危險但其實無害」的提示。他們自己的話是:那不是更安全的模型,是一台鈍化的拒答機器,而只看有害那一側完全看不到它(Multiverse Computing CAI,2026-09-08)。為什麼只按主題設護欄不夠,用他們自己的例子: 同一個基礎模型可能被部署成公民教育輔導,也可能被部署成公部門助理;兩者都該回答關於選舉的事實問題,但只有其中一個需要拒絕「幫我寫針對性的政治操縱文案」。他們的修法是把提示成對做出來,一對共享同一主題、只在意圖上不同:加入這種資料後,該回答那一側的誤拒從 32.94% 降到 4.16%,而該拒絕那一側只從 91.88% 掉到 87.72%。向供應商要安全數字時,記得同時要誤拒率:只給一側,看不出鈍化。 ⚠️ 這是研究團隊自己介紹自己的論文,未經同儕審查;但它主動報告了對自己不利的那個 74%,這在本報的判準裡是加分項。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新