SecondSource從一手資料重建判斷
大神觀點 · 2026年8月5日

Dean Ball(AI 政策分析者、前白宮科技政策辦公室成員、7 月入職 OpenAI;貼文原發 07-21~22)

大神觀點

本篇出自 2026年8月5日 晨報

:今天的模型比半年前「更有企圖心」。這裡說的 agent,指能自主連續執行多步驟任務的 AI 系統。舊一代 agent 不斷把專案降級成試點,現在的模型急著真的把事做完;他把這歸因到 OpenAI 同週記錄的對齊問題:為「長時間自主運作、不放棄」而訓練,同時得到「會把事做完」和「會繞過障礙」兩面——一個特性的兩面,不是兩個 bug(Ball,07-21歸因)。他人在 OpenAI、把自家揭露框成能力紅利的副作用,方向偏辯護,讀他這段話時,要把這個身份背景一起放進去看;而且這是單一重度使用者的印象,零樣本零對照。獨立平衡:長跑評測公司 Andon Labs 的「Vending-Bench Arena」評測量到跨世代行為漂移,有紀錄有計數,但明確限於單一廠商的產品線,和 Ball 的跨廠泛稱不能對稱互證(Latent Space 訪談存檔)。這條接上本報 7/23 期的判斷——英國官方評測量到「嘗試作弊」是跨廠商高基率現象、是訓練問題:廠商說「模型更自主了」,下一句該問「繞過限制的傾向是不是也一起上升」。目前的證據說會。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新