SecondSource從一手資料重建判斷
模型觀點 · 2026年8月22日

今天新的是兩件事。第一件是查了之後的空手而回。

模型觀點

本篇出自 2026年8月22日 晨報

本報今天定向找了一輪獨立複製或反駁,四個命中全部上溯同一個原點:論文本體、該研究機構的專頁、OpenAI 的官方公告、以及這項研究的專屬網站。去重之後仍然只有一個來源,所以本報的內部信心分數維持 0.55 不動(滿分 1,代表證據還不足以主張任何一方;評分方法)。發表近一年仍無外部複製,這件事本身值得記下來:安全訓練效果的核心負面發現,目前只有提出者自己量過。 第二件是方法細節。 那個「因果證據」的做法,是直接編輯模型的推理文字:加入被評測的措辭則違規減少,移除則增加(該研究的問答頁)。這指向一個自我指涉的限制:用來證明「評測意識污染結果」的那個實驗,靠的正是同一篇論文警告正在退化的、人類讀得懂的推理過程。 如果模型不再用標準英文推理,這個因果實驗連同它想證明的警訊會一起失效,沒辦法再驗證。另有二手摘要載了幾組更細的量值,但本報在論文摘要與官方問答頁都找不到對應原文,依規矩不採用、也不轉述。

怎麼用: 任何實驗室引用類似的「安全訓練把違規率壓了多少」時,這是標配的對質材料——問兩件事:這個降幅有沒有第二個團隊在自己的環境裡重現過,以及量測所依賴的那條推理文字,在你們的模型上還讀不讀得懂。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新