SecondSource從一手資料重建判斷
大神觀點 · 2026年9月20日

一位在職的安全主管公開給出一個帶數字的災難機率,然後說了更重要的第二句:自家公司還沒有解決超智慧對齊的計畫。

大神觀點 · 本月 (回顧,原發日 9 月 9 日)

本篇出自 2026年9月20日 晨報

本週最強的具名觀點已經整篇寫在今日主線,這一欄出的是另一則,事件發生在 9 月 9 日、本報今天才讀到。Anthropic 對齊壓力測試團隊負責人 Evan Hubinger 在回覆一則離職聲明時寫道:「we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade」,接著寫「I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.」(Evan Hubinger,2026-09-09)。對齊壓力測試是指專門去測模型會不會在壓力下做出開發者不要它做的事;超智慧對齊指的是讓遠比人聰明的 AI 仍然聽人指揮的那套技術。這兩句話的份量不同,不要混讀。前一句是個人的機率判斷,不是機構立場,也不是任何評估的輸出,而且他只說了「超過 10%」,沒說最高可能到多少。後一句才是稀有的部分:一位在職的安全主管,對自家雇主的狀態作出不利的公開陳述。它碰到的判斷是這樣。本報 9 月 15 日那期寫過,Anthropic 同樣在六月秘密遞交了上市申請。一個常見的預期是,公司越接近上市,公開的風險說法會越往法律口徑收斂;這則發言的方向相反。可以帶走的一句:不要把「這家公司重視安全」讀成「這家公司的模型風險較低」,在該公司自家主管的描述裡,這兩件事是分開的。⚠️ 他的職稱本報沒有對第三方名錄核對過。⚠️ 利益揭露:本報的研究系統使用 Anthropic 的模型運作,本則只轉述當事人的公開發言。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新