SecondSource 晨報 · 2026/7/20|AI 宣稱拿下奧數滿分:證明能驗,過程只有它自己說了算
本期一眼
- 一家 AI 新創自報在國際數學奧林匹亞(全球最高中學生數學競賽)六題全對、拿到滿分。它公開的數學證明任何人都能用軟體驗證,但「在比賽條件下自主做到」目前只有公司自己的說法;事發四天,官方與大媒體都沉默。這個確認缺口本身就是訊號。
- Claude 開發商 Anthropic 官方宣布募資 $65B、估值 $965B、年化營收跨過 $47B;同一輪裡,Micron、Samsung、SK hynix 三家記憶體大廠以投資人身份入股。過去是 AI 公司向供應商搶產能,現在供應商反過來用股權綁住最大客戶。
- 昨夜完成的深度研究:AI 模型商賣 token 第一次有錢賺,但高毛利眼下只在最貴的旗艦檔成立,撐著它的三根支柱都在鬆動;最近的檢驗點是 8/31 的一個定價決定。
本期素材:2026-07-20 的研究日報;今日真正新的 3 條(其中 2 條錨定 OpenAI 總裁 Brockman 的 X 貼文,對單一帳號的依賴先講明),另 2 條為舊事件的查證更新(事件日 5/28、6/15,逐條標明);回顧素材多出自 Dwarkesh Podcast 2024-25 年舊訪談的重讀,同一節目來源、彼此不互為印證,全標原發年月。昨夜掃 44 篇新內容、另收 X 原創貼文 17 條 → 本期 21 條帶連結的收據。
今日主線
1. [本週](事件日 07-15/16,公司公開 07-16 起)六題全解、42/42,宣稱者是一家新創,不是兩大 lab。 第 67 屆國際數學奧林匹亞(IMO)7/15-16 在上海舉行;賽後,專攻 AI 定理證明的新創 Axiom Math 在 GitHub 公開其系統 AxiomProver 對六道賽題的完整形式證明,自稱六題全解、42/42 滿分(GitHub,07-16)。對照基線:2025 年 OpenAI 與 Google DeepMind 模型的成績公開發表為 35/42、達金牌線。要注意兩者證據等級不同:去年那個分數是公開發表的成績,今年這條 42/42 只有公司自己說,證據等級要看下一段的驗證。若獲證實,競賽數學一年內就從「金牌級」推進到「滿分」,而且做到的是新創。細節裡有一根刺:公司自報單題耗時從 24 分鐘到 14 小時以上,而人類賽制是每天 4.5 小時考 3 題,「14 小時解一題」若屬實,並不在人類賽制時限內。OpenAI 總裁 Greg Brockman 7/19 發文稱「感覺是推進數學的分水嶺時刻,能真正改善生活的科學與醫療突破感覺很近了」,時點吻合,但推文連結未指名事件,指涉關係是推斷(X / @gdb,07-19)。 驗證: 這條的證據結構是不對稱的:證明以 Lean 4(一種形式證明語言)寫成,任何人可用軟體機器驗證「證明本身是對的」,不需要信任公司;但「在賽制時限內、無人工介入、由 AI 自主完成」只有公司自己的說法。目前只看到這一個來源,周邊全是內容轉貼、不算獨立確認;在本報追蹤的 51 家科技/財經媒體與公開內容轉載範圍內,事發四天未見任一家的獨立確認。本報把它當待驗宣稱保守記帳,升級條件寫明:IMO 官方或一線媒體確認賽制條件,任一即可。 判斷更新: 形式證明這條路線今年已有前一階。先說 agent 是什麼:它指能自主連續執行多步驟任務的 AI 程式,不必人一步步下指令。5 月一組研究團隊的 agent 系統自主解掉 353 個 Erdős 開放問題(匈牙利數學家 Erdős 留下的未解問題集)中的 9 個,每題成本只有幾百美元(arXiv,2026-05)。今天的宣稱若獲證實,就是下一階:從「解開放問題」到「競賽滿分」。為什麼值得盯:數學證明可以被機器逐步驗證,是驗證成本最低的領域,AI 的能力進展會在這裡最先顯形;Brockman 那句「科學與醫療突破很近」,講的正是從數學往其他領域的傳導。若形式化證明的自主能力真到這量級,對 AI 輔助證明工具、科研 agent 產品線會是直接可用的能力躍升,值得重評優先序。盯什麼:IMO 官方名單或一線媒體任一確認賽制條件,在此之前一律當未證實的公司片面說法看待。
2. [證據更新](事件日 05-28,官方稿今日逐字核實)Anthropic 的 $47B 年化營收,從分析師轉述升級為官方口徑;同一輪融資,記憶體三雄用股權綁住最大買家。 Claude 開發商 Anthropic 5/28 官方宣布 Series H 輪:募資 $65B、投後估值 $965B,新聞稿並自述 run-rate 營收本月稍早跨過 $47B——run-rate 是把單月營收乘 12 的年化口徑,不是經審計的全年營收,兩者差異必須標明(Anthropic 官方新聞稿,05-28)。本報今天把這份官方稿逐字核對完;重點不是事件本身(5 月的事),是口徑升級:此前「$44B+」的說法出自半導體與 AI 基建研究機構 SemiAnalysis 的分析,同文口徑下 2025 年還是 $9B,約半年 5 倍(SemiAnalysis,2026-05),現在官方數字對上了。輪內還有兩個結構訊號:hyperscaler 先前承諾的 $15B 投資入輪(含 Amazon 的 $5B);Micron、Samsung、SK hynix 三家記憶體廠以策略投資人身份入股。 驗證: 官方新聞稿對「公司如此宣布」是最強證據;數字本身仍是公司自報、未經審計。分析師先前口徑與官方口徑互相對上,是這條今天升級的原因。 判斷更新: 2023-25 年的資本流向是 AI 公司向上游搶產能;供應商反過來用股權綁定最大買家,是資本第一次從基建層反向流入模型層的訊號。HBM(高頻寬堆疊記憶體)是 AI 晶片眼下最緊缺的部件,它下一輪產能分配的優先順序,值得對照這張股東名單讀。記憶體產能有限,供應商既然用股權綁住 Anthropic,其他模型商在下一輪 HBM 採購優先序上的位置就值得留意;這目前只是個開放問題,沒有證據顯示這輪投資附帶排他條款或產能保證。與下方「深度報告」合看:這條升級的是那篇毛利分析的收入端;毛利端還有三本帳,見該段。
3. [證據更新](產品發布 06-15,獨立佐證今日對齊)AWS 幫內容網站向 AI 爬蟲收費,它給的兩個宣傳數字,被第三方實測拆成一半可信、一半存疑。 Amazon 雲端部門 AWS 6/15 在其網站防火牆服務(WAF)上線「AI 流量貨幣化」:內容擁有者可對 AI 爬蟲逐請求收費。爬蟲命中收費規則時,伺服器回覆「HTTP 402 需要付款」與機器可讀的價格表,以美元穩定幣、開放的 x402 協定結算,可辨識 650 多種 AI 爬蟲,AWS 不抽成(AWS 官方部落格,06-15)。x402 就是以 HTTP 402「需要付款」狀態碼為基礎設計的開放付款協定。背後的結構問題:傳統搜尋爬蟲索引內容後會回導流量,AI 爬蟲拿內容生成摘要、幾乎不回導,出版方承擔流量成本卻換不到讀者。AWS 為此給了兩個需求數字,本報逐一拿去對第三方數據查核。「AI 爬蟲年增 300%」:全球最大內容遞送網路(CDN)商之一的 Akamai,4 月以自家網路實測發布同一數字,與 AWS 無利益一致性(Akamai 新聞稿,04-08);Cloudflare、Fastly、Imperva 三家的量測口徑各異但方向一致、甚至更高,AWS 這個數在同業實測裡反而偏保守。「AI 爬蟲佔許多內容站流量五成以上」:沒有任何獨立來源以同一口徑量到,最接近的是 Imperva 的「全體機器流量(不限 AI)佔 53%」,分母與分子都不同,不能當佐證。 驗證: 前一個數字今日升級為多方獨立實測印證;後一個維持「供應商行銷口徑」看待。 判斷更新: 給內容平台與出版的商務負責人兩句可直接用的:對外引「AI 爬蟲年增三倍」,現在有三家以上獨立實測背書;談判時的流量佔比,用自己站上的實測數字,別用供應商給的分母。
4. [今日] OpenAI 總裁自述 ChatGPT Work 的關鍵形態:agent 跑在雲端,筆電闔上也在做事。 OpenAI 面向工作場景的 agent 產品 ChatGPT Work,總裁 Brockman 7/19 自述它最好的特性之一是跑在雲端:手機上能用、筆電闔上也行,並直言至今拿到 agent 魔力的主流方式「都得讓筆電開著,頗荒謬」(X / @gdb,07-19)。現有主流的寫程式與辦公 agent,長時任務多半得綁定本地裝置、保持開機在線:agent 跑十分鐘,電腦就得開著十分鐘。改跑雲端,數小時級的背景任務第一次能脫離本機、在雲端持續執行。 驗證: 產品負責人的一手自述,有行銷誘因;原文只講這一項特性,完整規格與定價未見,先記方向。 判斷更新: 對企業 IT 與選型的人,一個新的採購評估項成形:長時任務要不要人開著電腦陪跑。
也發生了
- [趨勢觀察](原發 2024-06,07-19 短片重傳)前 OpenAI 研究員、《Situational Awareness》作者 Leopold Aschenbrenner 的實體安全論:百 GW 級資料中心是固定、可定位的戰略單點,「一枚巡弋飛彈就能癱瘓」;他現主理 AGI 主題對沖基金,立場與敘事一致(Dwarkesh Podcast,2024-06)
- [趨勢觀察](原發 2024-06,同場訪談,轉述未核)同場另一條:DeepMind 的安全框架把資安分 0-4 級(4=能抵抗國家級行為者),Leopold 稱 DeepMind 當時自評第 0 級;單人轉述,原始文件本報尚未核對(Dwarkesh Podcast,2024-06)
- [趨勢觀察](原發 2025-02,近日才讀到)Microsoft CEO Satya Nadella 談 Muse 遊戲世界模型:它用遊戲對局資料訓練、能即時生成可玩世界。他說「遊戲資料之於 Microsoft,如同 YouTube 之於 Google」,把多年遊戲併購重估為訓練資料護城河(Dwarkesh Podcast,2025-02)
深度報告(昨夜完稿):賣 token 終於賺錢了,然後呢
核心判斷。 Anthropic 賣 token 從賠錢變賺錢是事實,但要分三層讀:收入端有官方口徑(見今日主線第 2 點);毛利端是內部與分析師一致、但未經審計的改善;「獲利季」還只是指引。高毛利眼下只在最貴的旗艦 agentic 檔成立,由三根支柱撐著:算力短缺、對開源模型的品質差距、買方的 ROI 質詢還沒傳導到帳單。三根都在動,三根都沒倒。
為什麼現在挖。 本報 2026/7/19 期主線第 1 點記過:四個行家同週指向「AI 值錢的位置正在離開模型本身」。同一週,「模型商毛利翻正」的反向敘事也在變硬,兩邊必有一邊要修正。這篇挖的就是:翻正撐不撐得住。市場上還掛著一對活矛盾:有創辦人說「過去半年每家模型商實際上都在漲價」,也有媒體報導 OpenAI 內部在考慮大降價,本報兩條都留著、不先裁。
毛利有三本帳,別混著讀。 The Information(以內部文件報導見長的科技訂閱媒體)報的是 2025 全年、全成本口徑:毛利預測曾從 50% 下修到約 40%,原因之一是雲端推理成本比預期高(The Information);SemiAnalysis 的口徑只算推理服務:從 38% 升到 70% 上下(SemiAnalysis,2026-05);CNBC 引投資人口徑:每 $1 營收的算力成本從 0.71 降到 0.56(CNBC,2026-05)。時序上,下修在前、講 2025;改善在後、講 2026。拿 40% 去打 70% 是口徑錯配。三本帳沒有一本經過審計,上市文件才是終審法院。

什麼會推翻它。 旗艦檔出現實際降價,「定價權持久」這一線就翻。最近的檢驗點是 8/31:Anthropic 中階模型 Sonnet 5 的上市促銷價是每百萬 token $2/$10(輸入/輸出),官方預告 8/31 後回標準價 $3/$15;屆時不回,促銷就成了事實降價(發布日價格整理:Simon Willison,06-30)。價格階梯的下段其實已經開戰:Google 把消費端 AI 訂閱從 $7.99 降到 $4.99,被科技媒體稱為訂閱價格戰的鳴槍(TechCrunch,06-09)。給用 API 建產品的人一句可直接用的:若 9/1 後 Sonnet 5 回標準價,現在用促銷價估算的單位經濟模型就得重跑,能路由到中低檔的用量先路由下去。
對答案日。 本報自設 12 個月觀察窗。最近的一格是 9/1 回看 Sonnet 5 回不回價;最重的一格,是 Anthropic 上市文件裡經審計的毛利,最終落在哪一本帳。
大神觀點(回顧)
本週的大神級發言(Brockman 兩則)已入今日主線第 1、4 點;本欄出一則回顧,配合本報正在做的「把舊預測釘進帳上」工作。
- Dylan Patel(SemiAnalysis 創辦人、一線晶片與資料中心分析師),原發 2024-10。 跨資料中心訓練,是把一場模型訓練拆到相距數百公里的多個資料中心同時跑,用來解單一園區電力不夠的難題。他當時斷言這條路「至少 Microsoft 與 OpenAI 已經搞定」;給的證據不是技術文件,是資本足跡:Microsoft 與光纖商簽了超過 $10B 的合約、沿線的開挖許可。他同場預測 OpenAI 將募 $50-100B、2026 年出現單站 1GW 級資料中心(Dwarkesh Podcast,2024-10)。以 2026 年現在的時點看,方向大體兌現。這條對本報的價值在於:斷言與證據都有時間戳,2026 年可以逐項對帳:把行家的預測原文釘進帳上,正是本報「誰說得準」帳本的原料。
模型觀點(學術與技術)
昨夜新進的 28 篇學術論文尚在閱讀中,本欄今日不硬湊新論文;出兩則回顧,都與今日主線直接相關,標明原發時間。
- [回顧](2024-06 訪談)Chollet 的位移密碼探針,和今天的滿分宣稱擺在一起看。 Keras 作者 François Chollet 當時給「大模型只是記憶、不是推理」一支可實測的探針:模型能解位移密碼(把每個字母往後挪 n 格的入門加密),但多只在 n=3 或 5(網路教材最常見的例子)時做對,換成 9 就失敗;若模型真能現場合成解法,位移多少根本不影響難度(Dwarkesh Podcast,2024-06)。與今日主線第 1 點合看的張力:2024 年的診斷是「不會現場合成演算法」,2026 年出現了形式證明滿分宣稱。平心而論,兩者任務性質不同,探針測的是模型參數內的即時合成,IMO 系統是多 agent 加 Lean 工具鏈的組合;且 2024-06 是推理模型問世前的時點,這支探針的當前狀態沒有公開複測,本報記為待補。
- [回顧](2024-11 訪談)Gwern:agent 可靠性差,因為 agency 從來不是訓練目標。 匿名獨立研究者 Gwern 以 2020 年對 scaling 假說的早期系統論證聞名,他的診斷是:網路語料裡只有 agent 行為的「描述」,沒有一步步的決策軌跡,現成模型的 agentic 能力是「拿資料訓練時的意外副產品」(Dwarkesh Podcast × Gwern,2024-11)。這對 2026 年「demo 亮眼、生產不穩」的 agent 現況仍有解釋力。呼應今日主線第 4 點:產品形態在進化,可靠性的根子問題是另一條線。時效邊界:2025-26 年業界對 agent 強化學習的投入已大幅上升,這是 2024 年時點的診斷。
過去洞見
「三條互相印證的證據」,攤開驗完只剩一條半(本報深度研究,2026-07-04)。 7 月 1 日,Meta 被報導要仿 SpaceX 把過剩算力出租變現,市場當天重挫半導體股(TechCrunch,2026-07-01)。當時流行把三條證據串成「算力供過於求」:Oracle 的 GPU 雲毛利偏低、B200 晶片租金三週下跌、Meta 拋售算力。本報的深度研究逐條驗獨立性,結果:Oracle 那條講的是「機房用租的、客戶又集中」的公司結構劣勢,不是全行業過剩;租金下跌是三週的單點數字,且與 Meta 拋售出自同一天的同一報導原點;真正獨立的供給側證據,只有 SoftBank 宣布的 10GW 級新算力服務一條。名義三條、實質約一條半。反面證據同場保留:SemiAnalysis 同期反共識指出,Meta 的算力採購在加速、其出租段定價是同業 3-4 倍的溢價;真正的供過於求會壓出折價,不會壓出溢價(SemiAnalysis,2026-07-02)。可帶走的一句:看到「三條證據互相印證」,先問它們是不是同一個原點投出來的三個影子。(Oracle GPU 雲毛利率與 B200 三週租金跌幅的實際數字出自訂閱來源,公開版從略。)
來源與盤點
過去 24 小時。 昨夜我們掃了 44 篇新內容:學術論文 28(主題掃描;另 47 位追蹤作者無新作,少數查詢逾時未完成,該範圍外不作保證)、播客舊集逐字稿 13(夜裡以較保守的標準讀完 11 篇、濾掉 2 篇無新訊號的,幫讀者省時間)、部落格 2、電子報 1(濾除);X 原創貼文另收 17 條,取自 305 個追蹤帳號的原創(@gdb 2、@elonmusk 12、@LisaSu 1、@sundarpichai 1、@steipete 1),未跑全網掃描。訂閱電子報與檔案庫(Stratechery、Colossus、7 家 Substack 檔案)無新文;財報來源 27 家無新申報;總經來源無新官方發布,本期無總經段。我們昨夜整理出 15 條新事實,其中 6 條出自 2024 年 Dwarkesh 舊訪談的重讀,全數列回顧、不當新事件;凌晨完成一篇深度研究(見深度報告段);白天對 3 條做了當日定向查證(今日主線第 2、3 點與深度報告段的營收錨)。今日無新增追蹤來源、無一次性回填。覆蓋聲明:本期只能保證上述掃描範圍內的訊號。
我們追蹤的來源。 本報判斷的底層,目前追蹤 529 個具名的聲音:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Jensen Huang 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。
本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。
—— SecondSource·由研究系統自動生成 · 19 個來源 · 回信給我們,就是最好的意見回饋
繁 中文版|EN English edition →