今天 8 條:本頁 6 條全文,另 2 條分在產品動態(下方有連結)。
先講事情本身。Rutgers 大學統計系教授 Guanyang Wang 於 07-13 在個人 blog 自述:他用 ChatGPT 5.5 Pro 生成了 1997 年 Kannan–Tetali–Vempala(KTV)猜想的證明(作者 blog,一手)。KTV 猜想是機率論裡懸置近 30 年的問題,問的是一種「隨機交換洗牌」的過程要走多少步才算洗勻的數學界限。這次的流程走了三道驗證:模型生成證明;再用 OpenAI 的程式代理工具 Codex 把證明改寫成 7 到 8 萬行(重構後行數)的 Lean 程式碼——Lean 是一種形式化證明語言,通過檢查等於機器確認每一步推導無誤,但不保證「題目翻譯對了」,也不等於期刊審查;最後由 Wang 與兩位共同作者逐行人工查核,結論是證明成立、而且定理比原猜想更強,成果已上 arXiv(論文,2026-06,附 Lean 程式庫)。作者還主動寫下侷限:模型會漏引文獻,人類必須細讀——這不是自主 AI 研究,是專家駕駛的工具鏈。這件事為什麼值得用力記:三週前 GPT-5.6 上線 48 小時內,OpenAI 圈流傳「64 個 AI 代理一小時證明了懸置 50 年的圖論難題 Cycle Double Cover 猜想」(AINews 當時的彙整,2026-07),放大者同樣是 OpenAI 總裁 Greg Brockman,那個宣稱至今零項通過外部查核。同路線的另一頭,DeepMind 系團隊 2026-05 已示範用「模型生成證明+Lean 機器驗證」系統性掃數學家 Erdős 留下的開放問題、自主解出 353 題中的 9 題(論文)——跨兩家 lab 的模型都走得通,這不是單一公司現象。
而歸因要單獨記一筆:作者 blog 白紙黑字寫「I used ChatGPT 5.5 Pro to obtain a proof」,Brockman 07-29 放大時卻寫成「5.6 for solving another longstanding open problem」(放大推文)。0.1 個版本號的差距,恰好跨過新旗艦 GPT-5.6 的發布日(2026-07-09)——而解題發生在那之前(2026-06)。
驗證: 解題流程與行數全部出自作者本人一手自述,三位作者查核屬團隊自報;證明未經期刊同行審查,Lean 驗證未經第三方重跑,目前只看到這個來源,方向可信、細節保留。版本歸因一節:Brockman 引推的原文(Wang 本人的 X 貼文)未能直接讀取,不能完全排除作者後續補充用過 5.6,但兩份可讀的一手材料口徑目前就是對不上,本報以作者口徑為準。
判斷更新: 「AI 解了某道數學難題」類新聞,從今天起有一個可用的分類器,問三件事:發起人是誰(獨立學者還是利益方)、有沒有機器可驗的形式化、作者查核了沒——KTV 案三項全過,Cycle Double Cover 案至今零項。同時把版本歸因列入例行核對:功勞被記到新旗艦頭上的這種通膨,會系統性高估最新模型。現況截至本期:證明的期刊審查與 Lean 第三方重跑都還沒發生。
與〈解開猜想的不是 lab,是要用它的人〉合看——同一天、同一個放大者,而且同樣往新旗艦的敘事上靠,評估時用同一把折扣尺。Brockman 07-29 另發推稱,OpenAI 拿 GPT-5.6 Sol 改善自家 production serving 的效率,是「我們能做到這種價格性能比的方法之一」(原推文)。serving 效率指的是推理機房把同樣的硬體榨出更多有效輸出的工程——批次排程、精度壓縮、快取設計——直接決定每個 token 的成本。背景是兩週前他把 GPT-5.6 Sol 的推廣主軸定在「任何任務給你最好的價格」,當時只有口號、公開徵反例,沒說憑什麼做到(定位宣言推文,07-15、價格效率數字推文);今天算是他自己補了一半答案。這句話值得認真對待,是因為推理效率工程師是行業裡公認的稀缺人才——今年 6 月起,從業者間流傳多起「同樣的 GPU 靠這類工程多服務數十倍用戶」的自報案例,Lamini 執行長 Sharon Zhou 甚至開源了拿 AI 代理優化 GPU 核心程式的工具(Sharon Zhou 的 X;投資人 Nathan Benaich 的轉述,兩者互不相關)。
驗證: 單一來源、利益方自陳、零數字:效率提升幅度、具體做了什麼(排程?精度?快取?)全都沒給,「方法之一」也是自承講法。「有在用」和「用了有效多少」是兩回事,今天只能錨定前者。
判斷更新: 若為真,推理成本競爭的瓶頸會從「搶效率工程師」變成「誰的模型能自己改善自己」——護城河從團隊搬到模型自用權。該盯的訊號:OpenAI 工程端何時給出可核對的數字;在那之前,這條按「利益方宣稱」保留。
本報 2026/7/29 期(〈出保的在跌、被保的在漲:同一天、同一則消息,市場其實在按位置分帳〉,存檔)把循環融資的定價儀表指向債市;今天把半年前的一筆舊帳查完,結論同向。半導體獨立研究電子報 Fabricated Knowledge 的 Doug O'Laughlin 在 2026-01-07 的年度展望裡記下「AI 故事拿到槓桿」的四個關鍵數字(原記錄),當時只有這一個來源;今天逐項對表:①OpenAI 向投資人自報、至 2029 年累計現金消耗約 1,150 億美元——是累計預估不是年燒(The Information 原報、CNBC 轉載,2025-09);②OpenAI 與 Oracle 的 3,000 億美元五年算力合約(2027-2031 執行)確認;③原記錄寫 Oracle「四年借了 1,000 億美元」——查證結果要修正:那是投行 KeyBanc 的分析師估算,履行合約「可能需要」新舉債約 1,000 億(約每年 250 億×4 年),是未來需求不是既成借款,引用一律用「估需舉債」(The Register,2025-09-29,②③同源);④CoreWeave 的五年期信用違約交換——替它的公司債買的保險,保費越高代表債市認為違約風險越高——從 2025-09-26 的 371 個基點,走闊到 12 月盤中峰值 881(收盤口徑 773),再於 2026-06 回落到約 452(The Next Web);自盤中峰值計約腰斬(881→452,約 −49%)。
驗證: 四個數字各有獨立於原記錄的來源,這筆記錄從「單一來源轉述」升為「多源核實」;③的口徑修正正是這種查證的價值所在。數據現況必須標明:CoreWeave 的 452 個基點截至 2026-06、Nvidia 的 82 個基點截至 07-27(TradingKey),兩者的今日值都未取。
判斷更新: 兩端擺在一起讀:被兜底的 CoreWeave 信用壓力緩解,出保的 Nvidia 信用壓力創新高——風險沒有消失,是搬家了,從被保方的資產負債表搬到出保方的信用曲線上。監測姿勢因此升級:從盯 CoreWeave 單點,改為 CoreWeave 與 Nvidia 對讀——被保方利差回落不等於警報解除,出保方利差創高才是主訊號。什麼會推翻這個讀法:Nvidia 的信用違約交換年底前回落到 40 個基點附近、且 CoreWeave 續降,就要下修為「虛驚一場」。
還是同一節目(EP630 音檔):主持人團隊自述,2025 年從 AMD 與 NVIDIA 伺服器的元件用量反推出被動元件與 TLVR 電感(AI 伺服器供電鏈裡的電感元件)將缺貨漲價,當時業內的回應是「根本沒看到漲價」;到 2026 年 1 月,研究報告才開始寫這件事;我們自己的資料庫也要到 4 月才收進正式記錄。從口頭訊號到研究確認,約兩三個月——這個時滯樣本只有兩例(被動元件、TLVR),而且是自述的成功案例、沒列押錯的,選擇偏誤要打折。但配上主持人自己的警語,它反而更完整:「領先半年也沒有用」——資訊太早拿到不代表用得上,行動端還有績效與時間壓力。
驗證: 單一來源的方法自述,n=2、含成功案例選擇偏誤,時滯數字是經驗值不是統計。
判斷更新: 可複用的部分不是「他押對了」,是節奏本身:下次聽到「業內說沒有看到」,該問的不是真假,是還要幾個月。本報自己的引用紀律同款:早期口頭訊號一律當假說收,等報價或報告確認才升級。
各自獨立成篇,一句話說明為什麼今天值得點:
「誰說得準」不能只靠印象,要回原典判分。本報今年 7 月初把 2023 年的一批原始訪談收進資料庫對表,三年後的成績單有三份最有教育意義。OpenAI 共同創辦人、首席科學家 Ilya Sutskever 2023-03 的訪談(Dwarkesh Patel 播客原集)命中得驚人:「若 2030 年 AI 的經濟影響令人失望,唯一原因會是可靠性」——可靠性與長時間任務正是 2026 年營收解鎖的主軸;「模型允許出聲思考時推理好得多」——就是後來的推理模型。他失分的兩條同樣有價值:「TPU 和 GPU 幾乎是同一種東西」低估了自研晶片的戰略分量,「硬體不是限制」在 2023 年的研究視角成立、到 2026 年全行業供給受限完全反轉。GitHub 前執行長 Nat Friedman 同月的訪談(原集)是半對半錯的範本:他判斷「GPT-4 成本比 GPT-3 高兩個數量級但能力顯然沒有——我們在 S 曲線的漸近段」,純預訓練這條軸上他是對的,但整體能力曲線沒有停——因為軸換了(強化學習、思考時間)。半導體分析師 Dylan Patel 2023-01 的微影管制分析(SemiAnalysis 原文)則是回測裡命中度最高的單篇:「只禁 EUV 擋不住中國,DUV 多重曝光在物理上可達 7 奈米,只是貴」——三年後成為現實。
判斷更新: 2023 那一代預測者的共同錯誤,不是看錯手上那條曲線,是低估了「換一條曲線」的可能。這條教訓已寫進本報自己的校準規則:評判斷力看的是逐條判分的紀律,不是單次命中。
本期取材自 2026-07-30 的研究日報;今日新事件時間跨度 07-13〜07-29,另有 14 條 2026 年 1 月素材(1 條定向查證+13 條播客回顧,均標明原發年月)。昨夜例行掃描新進 88 篇(44 篇部落格/24 篇播客逐字稿/13 篇公司申報/7 篇電子報)+X 380 個帳號的 592 則原創貼文 → 白天細讀 5 篇+定向查證 1 條 → 12 項收錄決定。來源集中度先說在前:今日新聞側的原始訊源集中在 OpenAI 總裁 Brockman 同一天的推文(其中解題一事已錨到解題者本人的一手 blog),回顧側 13 條全部出自同一位台灣播客主持人——本期是結構性的來源集中日,語氣與驗證標註都按這個現實寫;本週具名觀點由 Brockman 承載、已入今日核心,大神觀點不另立欄。自動報表連五天未跑出,以上數字為研究日報逐批手動核對口徑。
過去 24 小時。 夜間例行掃描新進 88 篇待處理:44 篇公司與個人部落格/24 篇播客逐字稿/13 篇公司申報/7 篇業界電子報;X 入口掃 380 個帳號共 592 則原創貼文(轉推與回覆只計數、不分析)。白天細讀的優先素材:X 貼文 1 篇(Greg Brockman 的五則推文——2 則收進本期、3 則無訊號:ChatGPT Voice 促銷、無具體內容的學術取用宣傳、單字回推,我們幫你省下的閱讀時間在這條註記裡);另針對 KTV 猜想做溯源(以作者本人 blog 為錨)、完成 1 條半年前記錄的定向查證(〈半年前的四個資本槓桿數字全數過了獨立源〉一則)。覆蓋聲明:自動報表連五天未跑出,以上數字為研究日報逐批手動核對口徑;本期只能保證此掃描範圍內的訊號。
一次性回填(非過去 24 小時)。 播客逐字稿 4 集:台灣投資播客「股癌」2026 年 1 月的四集(EP627/628/629/630,SoundOn),回填 13 條記錄——全屬回顧與校準素材、每條標明原發年月,不計入昨夜例行批。
來源集中度提醒。 今日兩條新訊號的原始出處都是 Brockman 同一天的推文(其一經解題作者 blog 一手錨定);回顧側 13 條全部出自股癌同一位主持人,相鄰集數不構成獨立第二源,本報全按「只有一個來源」標註、可信度照此打折。本期不是廣譜掃描日,是集中查證日。
我們追蹤的來源。 本報判斷的底層,目前追蹤 529 個具名的聲音:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Jensen Huang 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。
本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。
只留 email,隨時退訂。這是我們唯一想請你做的事。
Nvidia 傳出要替 OpenAI 的資料中心融資作保最高 2,500 億美元,消息當天它自己跌了 5%。但同一天、同一則消息,靠這筆擔保壓低資金成本的算力公司反而在漲。「市場開…
中國 AI 公司 Moonshot 公開新旗艦模型 Kimi K3 的權重,但授權書寫明:年營收超過兩千萬美元的推理服務商要先簽約才能商用,定價還站上中國模型價格帶頂端、約為同行 …
有記者具名指出:出價近 100 億美元洽購 AI 模型中介 OpenRouter 的那個神秘買家,就是全球網路支付基礎設施商 Stripe,而且數據平台商 Databricks 也…
開源(含開放權重模型,下同)之戰 48 小時內在三條互不隸屬的戰線同時加碼:北京最高層首度發表 AI 專題演說、被解讀為替開放路線插旗;華府預測市場把「美國年內禁掉一個開源模型」的…