今天 2 條,全部在本頁全文展開。
1. 業界唯一大規模在用的 AI 監督手段被公開吵了一輪,而立場相反的雙方都同意:現在沒有機構查得出誰說得對。
2. 一款新模型讓代理的失敗率減半、亂編答案降到十分之一,代價是每個正確答案的帳單變成 1.8 倍。
3. 同一個資安分數,七十二天內從最貴的檔次掉到最便宜的檔次,而管住它的那份名單一動也沒動。
本期材料取自本報 9 月 3 日這一輪的判讀;材料事件時間橫跨 2026 年 6 月 22 日至 9 月 3 日。昨夜掃 221 篇 → 本期用上 26 條有連結可查的外部收據。
近兩年的推理模型在給出答案之前,會先用人看得懂的文字把推理過程一步步寫出來,業界叫思維鏈。既然那段推理是人類語言,安全團隊就讀得到、也能用另一個模型自動掃它,看模型有沒有在計畫做壞事。這是目前業界唯一大規模部署、而且真的抓到過事的監督手段。
事情分三拍。9 月 1 日,OpenAI 官方帳號宣告即將發布的模型 Astra「在資安能力上是一次重大躍進,達到我們 Preparedness Framework 下的 Critical 門檻」(@OpenAI,09-01)。Preparedness Framework 是 OpenAI 自訂的模型風險分級與部署管制制度,它是公司內部制度不是法規,沒有外部機構驗證分級;Critical 是最高一級,意思是公司承諾在防護措施到位前不部署。9 月 2 日凌晨,訂閱制科技商業調查媒體 The Information 報導 Astra 用了一項突破,可能摧毀思維鏈的可監控性,並引述消息來源說 OpenAI 目前「正在限制該技術的使用」。同日清晨五點半,OpenAI 首席科學家 Jakub Pachocki 本人出面,給了一個可查的量:「我們目前前沿模型、包含 Astra 在內,計算圖深度都在 GPT-4 的兩倍以內」,並承認思維鏈監控「脆弱、而且正朝不好的方向走,原因與架構改變無關」(@merettm,09-02;他的職稱由 OpenAI 研究員 Noam Brown 在同一串公開確認)。計算圖深度粗略是模型內部疊了幾層運算,沒暴增就代表沒把推理搬到看不見的地方。
驗證: 三個互不隸屬的方向各自出手,方向都不利於「OpenAI 被抓包」這個讀法。一、技術面。 機器學習教育者 Sebastian Raschka(《Build a Large Language Model (From Scratch)》作者,對雙方皆無商業依存)當天拆解報導點名的那項技術:把同一疊層重複跑兩次,模型大小不變、計算成本近乎翻倍。他的結論是「重複用層本身不會壓掉可見的思維鏈」,並直說記者可能指的是別的技術或誤解了它(@rasbt,09-02)。他同時給了唯一合理的擔憂路徑:跑更多趟可能讓模型少產出中間推理文字。但他也指出,把模型放大也會得到一模一樣的效果,所以這個擔憂不是這個架構特有的。二、競爭對手。 Anthropic 可解釋性研究員 Jack Lindsey 明說「這不是在打 OpenAI,我沒有證據顯示 OpenAI 讓思維鏈可監控性顯著退化」,同時給了一個判斷:不看文字、直接讀模型內部數值活動的那套白箱技術,一年之內不可能提供跟今天思維鏈一樣多的可監控性(@Jack_W_Lindsey,09-02)。三、記者本人。 The Information 的 Stephanie Palazzolo 公開表示這件事「比大家從標題讀到的更有層次」(@steph_palazzolo,09-02)。⚠️ 本報沒有讀到 The Information 的原文(付費牆),所有關於報導內容的描述都是第三方轉述。⚠️ Pachocki 那個「兩倍以內」是相對量不是絕對值,他沒有說 GPT-4 的深度是多少,網路上流傳的換算全是別人推的。
判斷更新: 這一則的重點不是「一家公司做壞事」,是一次公開的技術爭議,以及它暴露出來的空洞。政策學者 Dean Ball 的論證最直白:上市公司的財務不會靠社群平台互相喊話來定案,而是靠稽核制度與經審計的財報(@deanwball,09-02)。引用他必須附一件事:他現在任職於 OpenAI,這是他自己說的。而立場相反的 AI 安全研究者 Geoffrey Irving 直接反問:「要立法很好,但你們其實可以直接告訴一個獨立的人架構是什麼?」(@geoffreyirving,09-02)兩個人主張的做法完全相反,落點卻是同一個:現在沒有任何獨立機構有權查證前沿實驗室的架構決策,所以這種事只能在社群平台上吵。 這是本報要長期盯的問題。能直接拿去問自家團隊的問題:如果我們的 AI 供應商明天做了同一件事,我們有任何辦法自己查嗎?答案很可能是沒有,那麼你的合約裡該寫進什麼,就是今天該動的事。什麼會推翻它: 一年內出現一種白箱技術,整體表現優於思維鏈監控,Lindsey 的判斷就錯了;反過來,任一家前沿廠公開承認自家思維鏈可監控性顯著退化,這條風險就從推測變成事實。對答案日訂 2027 年 9 月 2 日,照 Lindsey 那句「一年之內」的時間窗訂的,不是任何機構承諾的日期。
這對投資判斷的意思: 現在的敘事假設「AI 安全是實驗室內部能自我管理的事,出事會被發現」。這條證據對它是弱化:唯一在運作的那道護欄,防守方自己說它脆弱、競爭對手說一年內沒有替代品。要盯的領先訊號不是下一則爆料,是有沒有任何一家實驗室真的把架構細節交給一個獨立的人看。
Anthropic 在 9 月 1 日發布 Claude Fable 5.1,官方自己給的分數是 Terminal-Bench 4.0 上 55.8%,對照前一代 Fable 5 的 42.0%(@claudeai,09-01)。今天該讀的不是發布,是隔天幾個互不隸屬的第三方各自量出來的東西。
第一件是斜率變了。 LlamaIndex 是做文件解析與檢索基礎設施的公司,維護 ParseBench 這個文件解析評測,母體是 2,000 份以上的真實金融、法律、保險文件。它量到 Fable 5.1 在表格、內容忠實度、格式、圖表、視覺定位所有項目上都勝過前一代,並寫下這句話:「這是近期記憶中第一款文件辨識效能在世代之間真的改善的前沿模型;在這之前,最新一批模型(Opus 5、GPT-5.6 Sol、Gemini 3.7 Flash)在視覺理解上一直是停滯的。」(@jerryjliu0,09-02)企業真正的資料躺在 PDF、掃描件、表格、手寫表單裡:模型在推理評測上分數再高,讀不對表格裡的數字,下游整條工作流都是錯的,而這個維度過去兩年幾乎沒有跟著推理能力一起進步。
第二件是代價被量出來了。 獨立技術效能測試機構 Signal65 在自家 PINNACLE 這個企業工作流評測上量到:Opus 5 與 GPT-5.6 Sol 每 100 個工作流失敗 14 個,Fable 5.1 降到 7 個;對文件回答不了的問題,Fable 5.1 只有 0.7% 會編一個答案出來,Opus 5 是 7.6%。代價寫得同樣清楚:每個正確答案的完整 API 帳單是 2.46 美元,等於 Opus 5 的 1.8 倍,而這 80% 來自一個動作:代理每走一步就把先前內容重新送進模型一次,沒有任何設定可以關掉。 換算成規模,每月一萬個正確任務約 25,000 美元(Fable 5.1)、14,000 美元(Opus 5)、5,000 美元(在租來的 GPU 機器上跑中國智譜的開放權重模型 GLM-5.2)(@Signal_65,09-02)。
驗證: ⚠️ ParseBench 那份只有「全面勝出」這個總結句,逐項分數藏在一個本報打不開的縮網址後面。⚠️ 更要緊的是量測者的身份:LlamaIndex 同時是評測者與競品供應商,同一則貼文也在推銷自家產品。不過這個偏誤的方向對本則有利,因為它的商業利益是說「前沿模型不夠好,來用我們的」,它卻公開說前沿模型這一次真的進步了。它也說了對自己有利的那半:Fable 5.1 當文件辨識引擎用每頁 15 美分,是自家產品的 10 到 15 倍而「表現差不多」,後面這句是自評要打折。⚠️ Signal65 的收入模式可能含廠商委測,本報無法確認本次是不是。⚠️ 那個 5,000 美元的對照母體不同(自己租 GPU 跑開放權重模型 vs 呼叫 API),而且沒有附上 GLM-5.2 的失敗率,不能推論它便宜又一樣好。
判斷更新: Signal65 那句論證值得完整留著:「讓 AI 代理進不了生產環境的不是智力,是失敗率。代理每失敗一個工作流,就是一個要人去接的工作流。」在 14/100 的失敗率下,企業會對每一件事都保留人工複核;降到 7/100 加上編答案的比率降到十分之一,差別是「每個任務都要審查」變成「只審例外」。本報把「代理落地的閘門」從能力那一欄搬到失敗率與單位成本這一欄,而這一輪把兩者變成明確的取捨:失敗少一半、帳單多 1.8 倍,不是同時改善。可以直接拿去做的事有兩件:如果你在做文件工作流,現在該重測一輪,因為停滯的那個維度動了;但不要把它當文件辨識引擎用,貴 10 到 15 倍。那個 80% 還有一層:它不是模型的固有成本,是包在模型外面那層程式決定上下文怎麼裁切的結果,所以它是工程處理得掉的,只是今天沒有開關。什麼會推翻它: 下一代模型在失敗率下降的同時每個正確答案的成本也下降,這個取捨就消失了。
這對投資判斷的意思: 現在的敘事假設「模型變強,代理就會鋪開」。這條證據對它是改寫方向而不是強弱:能力那一欄的進步是真的,但擋在生產環境門口的一直是失敗率與每個正確答案的帳單,而這一輪只換掉了其中一項。要盯的是有沒有人開始揭露「每個正確答案的成本」這個口徑,它一旦變成標準揭露項,模型比較的整張表就要重畫。
1. 一個叫 FrontierHarness 的評測 9 月 2 日發布,做法是把模型、題目、執行環境全部固定、只換包在模型外面的那層程式。這層程式業界叫「外殼」,它決定模型能用哪些工具、怎麼裁切上下文、失敗時怎麼重試。對九種外殼跑 360 次:通過率從 50% 到 67%,每次通過的成本從 1.05 美元到 18.34 美元,差 17.5 倍(@guanlan,09-02)。⚠️ 本報今天不把它寫成判斷,因為「同一個模型」是這個實驗的核心控制變因,而用的是哪個模型沒有公布。值得追。
2. 企業支出管理平台 Ramp 的研究團隊說,OpenAI 與 Anthropic 的企業營收有 80% 來自 1% 的客戶,且前 1% 明顯偏向科技業與 AI 產品服務公司。本報沒有拿到原始報告,而且這份資料只涵蓋使用 Ramp 的企業,不是全市場(@arakharazian,09-02)。
3. 中國科技產業分析師 Rui Ma 說,2026 上半年中國新車銷售中接近四成配備 L2+ 或 L2++ 輔助駕駛(前者大致是以高速公路為主的自動輔助駕駛,後者延伸到市區街道),而且越來越是隨車綁定、通常不收訂閱費;對照美國的 Tesla FSD 每月 99 美元、Ford BlueCruise 50 美元、GM Super Cruise 40 美元。那個四成的原始資料出處她沒有給(@ruima,09-02)。
4. [本週](事件日 9 月 2 日)兩家前沿廠獨立走到同一套資安處置法,而該問的問題今天要換一個:Google、Gemini、0.75 美元(Google DeepMind 官方發布稿,09-02)。⚠️ 這則今天只放得下一行,細節請看前面的原文連結。
各自獨立成篇,一句話說明為什麼今天值得點:
本期沒有這一欄。 本報過去累積的深度素材,能用的舊材料已經用完(最後一則用在 7 月 30 日,今天是連續第十五期空著);寧可空著,也不重播用過的條目。
過去 24 小時。 昨夜寫進本報待讀清單的新材料是 221 篇:X 貼文彙整 121 份、學術論文 50 篇、公司與個人部落格 39 篇、業界電子報 5 篇、公司財報申報 4 份、Podcast 逐字稿 1 份、業界分析 1 篇。被過濾掉的是 0 篇,所以這一欄今天替你省下的時間是零。今天真的讀完、拿來當證據的是 28 篇:那 121 份 X 貼文彙整裡讀了 25 份,部落格 3 篇(Google DeepMind 官方發布稿、Broadcom 投資人關係稿、Cursor 更新日誌,三篇全部供出了今天版面上的材料)。昨夜拉到的電子報包含 Latent Space 與 Gary Marcus,公司財報申報那四份是 Vertiv、Broadcom 與 Microsoft 的 8-K 檢索頁。
今天你拿不到什麼。 四件。一、 The Information 9 月 2 日那篇引爆主線第 1 點的報導在付費牆後面,本報兩個管道都沒有讀到原文。二、 Meta 的官方價目頁本報沒有直接抓到,產品動態欄那組 1.25 與 4.25 美元是第三方評測機構轉述的;同一層的貢獻者價有三個互不一致的口徑,本報判不出哪個是官方值。三、 ParseBench、Signal65 PINNACLE、FrontierHarness 這幾份榜單的逐項分數藏在本報打不開的縮網址後面,所以主線第 2 點與快訊第 1 則只拿得到總結句,「全面勝出」「差 17.5 倍」這種說法無法再往下拆。四、 昨夜進到清單的 50 篇論文、5 篇電子報、1 份逐字稿今天一篇都沒讀,其中兩篇電子報的標題直接指向今天的主線第 1 與第 2 點。所以本期沒有獨立的學界欄,真實成因是沒讀,不是讀了沒東西。
一次性補回來的舊材料。 昨夜的補檔量不小,但本期一篇都沒用上,全是七、八月的舊材料,母體也跟上面那段不同,每一項對的都是昨夜新進的同類:學術論文 1,808 篇、業界電子報 891 篇對昨夜的 5 篇、公司財報申報 745 份對 4 份、業界分析 533 篇對 1 篇、部落格 362 篇對昨夜 39 篇與今天讀完的 3 篇、Podcast 351 份、供應鏈情報 134 篇、X 貼文 119 則對昨夜拉回的 519 則,合計 4,943 篇,日期範圍多落在 2026-07-01 至 08-30。
來源集中度提醒。 今天快訊第 4 則與產品動態欄第二則的承重來源集中在 Google 自家的官方頁面上,以「抽掉它論述就垮」計,兩處加起來的九組材料裡有六組出自 Google 官方,遠高於本報自訂的三分之一警戒線。本報的處置寫在快訊第 4 則的驗證段裡:把官方稿裡那三筆外部讀數逐一點名。反過來,主線第 1 與第 2 點沒有這個問題:第 1 點的承重來源橫跨官方、獨立媒體、競爭對手研究員、學界拆解與政策端五個互不隸屬的方向,第 2 點是四個互不隸屬的第三方各自量測。
本報追蹤的來源。 名冊上去重後共 529 位:X 302、Podcast 90、媒體與新聞稿 51、個人部落格 48、論文作者 48、電子報 46、財報法說 26、主題演講 23、其餘 15;同一個人可以同時出現在好幾個管道,所以分項加起來會大於 529。另有 77 個公司與機構的部落格名冊(NVIDIA 技術部落格、Google Research、Hugging Face 等),那是機構不是人頭,不計入 529。代表性的名字:X 有 Elon Musk、Andrej Karpathy;電子報有 Zvi Mowshowitz、Dylan Patel、Ben Thompson;論文有 Percy Liang、Sebastian Raschka;播客有 Demis Hassabis、Dario Amodei。幾個同名不同母體的數字要分清楚。 X:昨夜實際去拉的帳號 374 個、拉回 519 則貼文(全部原創,轉推與回覆各為 0),去重整理成 121 份彙整檔寫進待讀清單,而名冊上以 X 為主要管道的人頭是 302 位;抓取名單、抓取量、彙整份數、名冊人頭,四者是四個不同的母體,不能相加。電子報同理:昨夜新進的 5 篇是當天讀到的量,名冊上的 46 位是本報長期追蹤的總人數。第三把尺是版尾署名的那個數字:本期正文用上 28 個外部來源,數的是這一篇真的引用到、而且是外部的那幾條收據(本報自家舊期與各平台首頁都不算),與名冊上那 529 位是不同母體。
本報不是新聞摘要:從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的。重點永遠是『哪條判斷變硬了、誰說得準』,不是今天發生了什麼。
只留 email,隨時退訂。這是我們唯一想請你做的事。
1. 三家大廠把最強的資安 AI 改成只發給名單內的人。決定這道門能關多久的,是外面那種誰都能下載的模型還差幾個月追上來。
1. 被拿來證明「AI 降價、需求就撐得住」的那個十四倍用量,只發生在一條剛好便宜一半的通路上;本報上一期自己寫的一句話,今天被自己的查核推翻。
1. 一個被大量轉發、用來證明「AI 降價需求就撐得起來」的十四倍數字,量的是單一模型分派平台,搬過去的舊需求也算在裡面。
1. 開權重模型(參數公開、可自行下載部署的那種)跑掉一個模型分派平台三成的用量,卻只佔不到 4% 的錢。擋住錢的不是模型不夠強。