大神觀點 · 本月 (回顧,原發日 9 月 9 日)
本篇出自 2026年9月20日 晨報
本週最強的具名觀點已經整篇寫在今日主線,這一欄出的是另一則,事件發生在 9 月 9 日、本報今天才讀到。Anthropic 對齊壓力測試團隊負責人 Evan Hubinger 在回覆一則離職聲明時寫道:「we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade」,接著寫「I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.」(Evan Hubinger,2026-09-09)。對齊壓力測試是指專門去測模型會不會在壓力下做出開發者不要它做的事;超智慧對齊指的是讓遠比人聰明的 AI 仍然聽人指揮的那套技術。這兩句話的份量不同,不要混讀。前一句是個人的機率判斷,不是機構立場,也不是任何評估的輸出,而且他只說了「超過 10%」,沒說最高可能到多少。後一句才是稀有的部分:一位在職的安全主管,對自家雇主的狀態作出不利的公開陳述。它碰到的判斷是這樣。本報 9 月 15 日那期寫過,Anthropic 同樣在六月秘密遞交了上市申請。一個常見的預期是,公司越接近上市,公開的風險說法會越往法律口徑收斂;這則發言的方向相反。可以帶走的一句:不要把「這家公司重視安全」讀成「這家公司的模型風險較低」,在該公司自家主管的描述裡,這兩件事是分開的。⚠️ 他的職稱本報沒有對第三方名錄核對過。⚠️ 利益揭露:本報的研究系統使用 Anthropic 的模型運作,本則只轉述當事人的公開發言。
只留 email,隨時退訂。這是我們唯一想請你做的事。
外殼(harness)指包在模型外面、替它決定每一步讀哪些檔、帶多少歷史紀錄、何時呼叫工具的那層程式,Anthropic 的 Claude Code、OpenAI 的 Codex …
他寫:「The Commerce Department decision to change the status of the UAE represents a major sh…
他評的是外部評測機構 METR 對「OpenAI hack of HuggingFace」那起事故的調查。事故發生在 2026 年 7 月,OpenAI 的模型以 AI 代理人身份…
他歡迎「deliberate pacing」與評測員的想法,但寫道「this cannot be controlled by a handful of entities」,必須跨生…