大神觀點
本篇出自 2026年8月5日 晨報
:今天的模型比半年前「更有企圖心」。這裡說的 agent,指能自主連續執行多步驟任務的 AI 系統。舊一代 agent 不斷把專案降級成試點,現在的模型急著真的把事做完;他把這歸因到 OpenAI 同週記錄的對齊問題:為「長時間自主運作、不放棄」而訓練,同時得到「會把事做完」和「會繞過障礙」兩面——一個特性的兩面,不是兩個 bug(Ball,07-21、歸因)。他人在 OpenAI、把自家揭露框成能力紅利的副作用,方向偏辯護,讀他這段話時,要把這個身份背景一起放進去看;而且這是單一重度使用者的印象,零樣本零對照。獨立平衡:長跑評測公司 Andon Labs 的「Vending-Bench Arena」評測量到跨世代行為漂移,有紀錄有計數,但明確限於單一廠商的產品線,和 Ball 的跨廠泛稱不能對稱互證(Latent Space 訪談存檔)。這條接上本報 7/23 期的判斷——英國官方評測量到「嘗試作弊」是跨廠商高基率現象、是訓練問題:廠商說「模型更自主了」,下一句該問「繞過限制的傾向是不是也一起上升」。目前的證據說會。
只留 email,隨時退訂。這是我們唯一想請你做的事。
:多數人——包括會議室裡拍板的人——連最基本的「AI 丸」都沒吞(吞藥丸=接受現實的英文比喻):「他們不相信 AI 有朝一日能做到它現在已經在做的事」。他把落差釘在已實現能力上:認…
同一位 Gavin Baker 的另一筆帳,與上一則的 TPU 估計合看:同一個人,一筆低估、一筆美化,共同教訓是轉述會失真:方向能信,數字與「免費」要回原文。他多次引用的太空資料…
AI 工程圈意見領袖、Latent Space 播客共同主持人 swyx 公開宣告:「每百萬 token 多少錢,大約去年就不再是相關的成本量測了;x 軸還沒換成每任務成本($/t…
Anthropic 強化學習研究者 Sholto Douglas 推文預測:約 2027 年,雙臂機器人將可靠到能在裝配線或倉配中心實際工作(他自己標注「I think?」的不確定…