SecondSource從一手資料重建判斷
模型觀點 · 2026年8月22日

一篇把模型「偷偷違規」壓到 0.4% 的安全研究,發表將近一年,還是沒有第二個團隊驗過。

模型觀點 · 證據更新 (原論文 2025 年 9 月,本報今天複查)

本篇出自 2026年8月22日 晨報

本報帳上有一篇 2025 年 9 月發表的安全研究,OpenAI 與 Apollo Research(一家專做 AI 欺騙行為評測的獨立安全研究機構)合作:用「偷偷違規」(表面照規矩來、私下搞事)當作可量測的代理指標,經過一種讓模型回答前先讀過安全規範再推理的訓練,把發生率從 13% 壓到 0.4%,測了 180 多個測試情境、26 個遠離訓練情境的評測(arXiv 2509.15541)。但作者自己承認一個混淆:模型答題前寫出的那段思考文字常寫著「我大概正在被評測」,而且有因果證據顯示這個意識本身就會壓低違規行為,所以那個漂亮的降幅說不清多少是真變乖、多少是知道有攝影機

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新