晨報 SecondSource 晨報 · 2026/8/2 · 2026年8月2日
本期取材自 2026-08-02 的研究日報;今日無三天內新事件,主線是 07-28 排入的四集訪談積壓完成分析後的判斷(原發 2026-05-22~07-28,逐條標原發)加一件 SEC 定向查證。昨夜掃 32 篇新進素材(15 論文/10 播客/6 部落格/1 電子報,尚在排隊)加 X 上 380 個帳號的 410 則原創貼文;白天精讀 4 集逐字稿 → 本期 16 條查核記錄、6 則主線。集中度先講:近半材料出自 a16z 自家發行渠道,誘因逐條標注;本週無新的具名大神觀點,該欄以回顧一則補位;本期無產品動態,近 48 小時只有一篇廠商部落格待處理、尚未進圖;數字出自抓取日誌逐批核對口徑。
這是本期完整版(官網存檔正本):每一則全文展開。email 版為每日精選 3 則核心全文+其餘一行摘要的縮短版,點「全文」即回到本頁。雙版式試行第 7 天(共兩週),文末有一鍵回覆。
負責 OpenAI 生產力產品線的 Akshay Nathan(OpenAI Productivity/核心產品工程負責人)在 AI 工程訪談節目 Latent Space(swyx 主持、以一手長訪談著稱)親口說:「我認為我們還沒把這件事搞清楚」。他說的「這件事」,是怎麼量 AI 有沒有讓使用者更有生產力。他點名的失效清單:程式碼提交數、程式碼行數、token 用量、pull request 數(程式碼合併請求,常被工程組織當產出指標)。這些代理指標「與團隊能不能達成目標,可能不再高度相關」;就連按讚、按倒讚這類回饋訊號,也量不出使用者是不是真的更有生產力;他把難題推給全行業:「整個產業都得把這件事想清楚」(Latent Space 訪談,07-28 發布)。獨立科技分析師 Benedict Evans(前 a16z 合夥人、年度「AI Eats the World」報告作者)在另一場訪談補上第二層:就算量得到,增益也留不住。投資銀行的現金流折現分析(DCF,把未來現金流折算成今日價值的估值方法)從一週變十秒,你會做五十份分析、但收不了客戶更多錢;工具一旦人人必買,成本結構同步下移,增益歸客戶而不歸採用者。「AI 的錢在損益表上看不見」,其實是市場競爭跑出來的正常結果,談不上量測失敗,Excel 當年就是這樣(a16z Podcast 訪談,06-08 發布)。
驗證: 兩源獨立:OpenAI 自家員工訪談與獨立分析師,互不引用;但都是單源口述、全程零量化數據,Evans 引述的顧問業與央行 CFO 調查未附名稱與樣本數,本報未直核。誘因方向是這條的關鍵:OpenAI 的營收與 token 消耗直接掛鉤,賣 token 的人否定 token 量當生產力指標,是對自家不利的自認,份量重於任何第三方批評;Evans 的結論對創投圈的軟體應用部位同樣不討喜。
判斷更新: 本報帳上一條還在驗證的判斷是這樣寫的:「AI 增益量不量得到,取決於該職位的產出單位能否與外部變量分離;量得到的增益也會因工具普及被競爭掉」。前後兩腿今天各補上一個反向誘因的證詞,信心上調,但暫不升為正式判斷,因為「量不量得到」與「留不留得住」是兩個可以分別開獎的命題,拆開才升。還有一個已在追的接點,傳聞裡有大公司員工寫程式空轉刷 token 用量。一旦公司拿用量當 KPI,「量不準」就會惡化成「被刷爆」,該傳聞仍在等獨立證據。
投資定向段: 目前的敘事假設企業 AI 支出終將被 ROI 數字證明;這兩條證詞指出的落差是量測工具本身缺席、且增益結構性流向客戶端。對「AI 支出可以用生產力報表辯護」的敘事是弱化,對「必需品化、不用者被淘汰」的採用邏輯反而是強化。
上月半導體與 AI 算力研究機構 SemiAnalysis 的一篇建模分析文章轉述稱:Amazon 雲端部門 AWS 在 2026 年第一季營業利潤率環比上升 213 個基點(basis point,1 基點=0.01 個百分點)、高於其他雲端服務商,歸因於 Anthropic 模型在 Bedrock 平台(讓企業經同一組 API 接多家 AI 模型的服務)的用量拉動(SemiAnalysis 原文)。本報今天拿 SEC(美國證券交易委員會)申報原文逐格對帳,結果一半對一半錯。對的那半更強:AWS 分部營業利潤率實際從 35.0% 升到 37.7%,環比 +270 基點。轉述版低估約 60 基點,歸因故事的量化前提反而更硬(Amazon 2026 Q1 財報 8-K)。錯的那半是比較級。Google Cloud 同季利潤率從 30.1% 升到 32.9%,這兩個百分比是四捨五入後的顯示值,直接相減會少幾個基點;用該分部未四捨五入的營收與營業利益原始數字自算,環比是 +286 基點,高於 AWS,本報以自算值為準(Alphabet 2026 Q1 財報、Alphabet 2025 Q4 財報)。這裡要帶兩個口徑上的但書:Microsoft 不單獨披露 Azure 利潤率,「同業比較」只限有分部披露的公司;SemiAnalysis 原文也提醒過 Google Cloud 的利潤率有成本歸集因素墊高,原因是 DeepMind 的訓練成本不算在雲端分部,兩家分部的記帳規則不同。
驗證: 新數字全部出自 SEC 申報文件,經審計、可逐格點驗,是本期唯一審計級材料;被對帳的轉述版保留供校準:方向對、量值低估 60 基點,這筆誤差已記入該機構的追蹤紀錄。
判斷更新: 三層。其一,轉述的數字就算方向抓對,量值也可能偏,二手數字一律只能當方向指標用。其二,「AWS 領先同業」的措辭停用;被推翻的比較級反而暴露更大的線:兩大雲端分部利潤率同季同步大擴,「AI 資本支出轉化為分部利潤」是行業級現象,本報已另立一條待驗證的判斷在追,下一季兩家若分道而行則收回(本報自設觀察窗,對照下一季兩家財報)。其三,掛在原數字上的兩條既有判斷(Amazon 押多家模型供應商做對沖、這套對沖已開始兌現)證據升級而非受損。對正在評估要不要押 Bedrock 這類多模型平台的人,今天拿到的是審計級而非二手轉述的證據。
投資定向段: 「AI 資本支出燒錢無回報」與「AWS 是最大受益者」兩種敘事都在流通;審計級數字對前者是弱化(利潤傳導已在兩家分部同季發生)、對後者也是弱化(同季漲更多的是 Google 雲端),真正被強化的是「行業級傳導」這個中間讀法。
Google DeepMind 的 Gemini 共同負責人 Oriol Vinyals(與 Jeff Dean、Noam Shazeer 共同領導 Gemini)在創投 Redpoint 合夥人主持的訪談節目 Unsupervised Learning 裡,把 continual learning(持續學習:讓 AI 從持續互動中累積經驗)的勝出形態判給「檔案式外掛記憶」:agent 把經驗寫進外部檔案、跨任務讀寫,而不是把經驗訓練回模型權重(模型本體的參數)。他給的理由與效果無關,而是服務經濟學:「我們是把一個模型服務到全球規模……要替每個使用者服務一份帶著不同記憶的模型,會非常痛苦」;他也留了退路:如果進權重真是最好的路,「我們會想辦法做出支撐個人權重的硬體」(Unsupervised Learning 訪談,2026-05-22 錄製)。這段話為什麼重要?上月 Allen Institute(美國非營利 AI 研究機構)研究員 Nathan Lambert 推測過同一件事:前沿實驗室「少數模型服務所有人」的規模經濟,結構性排斥一人一份權重,所以個人化這條軸的價值會沉澱在開放權重模型的基建(記憶層、本地微調),而不是實驗室的 API(Interconnects 原文,2026-06)。當時是單一來源的推測;今天被推測的那一方親口說出同一機制,理由正是推測裡的那一個。
驗證: 一手發言逐字稿,身分經三處交叉確認。要標三件事:訪談錄於 5 月下旬、上週才排進處理排程,距今已兩個月,他對能力現況的說法可能已經過時;Vinyals 所屬公司結構上就偏好「個人化不進權重」的答案,這條發言誘因順向;升格依據是「機制被當事方證實」,不是新增量化數據。對照組留在帳上:晶片公司 Cerebras 的多用戶客製權重服務,是「絕對做不到」強讀法的既存反例。
判斷更新: 「個人化屬於開放模型陣營」從初步推測升為正式判斷,但只升半格,因為 Vinyals 證實機制的同時,也給出了實驗室側的解法形態:檔案式外掛記憶,而那正是「中央路線用淺層方案收掉個人化市場」的具體形態。開獎點收斂成一句:檔案式記憶滿不滿足得了個人化的主需求。什麼會推翻:前沿實驗室若推出權重級的個人客製且定價可行,機制腿被削弱。
投資定向段: 押「個人化/記憶層基建」的敘事有了更具體的對手情境:實驗室的答案是外掛檔案、不是個人權重;對該敘事整體持平偏強化(實驗室親口讓出權重級個人化),但市場邊界縮小為「檔案式記憶不夠用的場景」,盡調問題該從「實驗室會不會做」換成「檔案式在哪裡不夠用」。
email 縮短版把以下各則收成一行;完整版在此全文展開,順序同信。
與今日核心第 1 則同一場訪談的另一段。OpenAI 對外的「1,000 萬」使用數,主持人 swyx 當面指出是 Codex(OpenAI 的 agent 式寫程式產品)加 ChatGPT Work(其 7 月推出的知識工作 agent 工作區)的合計:「因為 harness 是同一套……你沒辦法分開統計」;受訪的產品負責人未否認,並直答「harness 是同一個、是共用的」。harness 指模型外圍的執行框架:工具呼叫、沙盒、提示組裝這一層(Latent Space 訪談,07-28 發布)。同段三個可用細節:活躍口徑(週活/月活/累計)全程未定義;ChatGPT Work 不預設開給既有用戶、目前僅限付費用戶,這兩點是對自家聲量不利的揭露,可信度反而高;路由是模型自己決定的:偵測到你在做試算表,模型會主動把你推去 Work 模式。「聊天介面正被 Codex 框架取代」是主持人的措辭,受訪者以「原本的 harness 今天還在」(ChatGPT Classic)部分修正,不能記成官方宣告汰除;官方 7 月 9 日另有「Codex 週活超過 500 萬」的口徑,兩者定義不同,不能相減算成長率。
驗證: 一手在場發言,但屬產品發布宣傳窗口的自家員工訪談,採用面自述全部單源;合計口徑是主持人陳述+受訪者默認,非官方明文;架構共用與路由行為可由公開產品行為部分驗證。
判斷更新: 兩件。讀 OpenAI 的產品數字先問口徑,「1,000 萬」既無產品拆分也無活躍定義,只能當量級引用。更結構性的一件是,OpenAI 把一般知識工作判給了「給 agent 一台可任意操作的電腦」的框架。聊天框長年優化的是延遲與陪伴,正事交給另一套底座。對做應用的公司,該假設的對手是 agent 工作區,不是聊天機器人。
投資定向段: 「Codex 週活千萬」正被當成 AI 寫程式工具滲透率的證據流傳;這條證據指出該數字是雙產品合計、口徑未定義。對以單一數字支撐的滲透敘事是弱化,對「agent 工作區吃掉知識工作入口」的方向判斷是強化。
與今日核心第 3 則、以及本則上一條合看(同屬「模型外那一層歸誰」的線)。Vinyals 被問「你長年主張通用方法加算力終將勝過人工巧結構(AI 圈稱 bitter lesson),現在哪裡還沒被遵守」時,點名 agent scaffold 本身。scaffold 指開發者在模型外圍手寫的編排程式:何時開子 agent、怎麼委派、怎麼管長任務。他的判斷:這一層終將從「人寫的程式」變成「模型當場自己寫的程式」,終局「也許沒有系統」;形態未定(從頭生成,或自動搜尋出正確結構)(Unsupervised Learning 訪談,2026-05-22 錄製)。這條判斷直接撞上本報帳上一條反向判斷,提出者是開源 agent harness 的作者 Peter Steinberger。Steinberger 講的 harness(模型外圍的執行框架)與 Vinyals 講的 scaffold(外圍的編排程式)是同一塊地盤的兩個切面,本報以下統稱編排層。他主張,鎖定效應的槓桿點正從模型層遷到編排層。最乾淨的讀法是誘因結構:賣模型的人說編排層會被模型吸收,靠編排生態吃飯的人說價值正沉澱在編排層。兩邊立場都與自身利益同向,可信度分不出勝負,只能時間開獎;可調和的讀法是時程:當下的判例(同一模型換編排,表現差距可以大於換模型)對上「極限情況」的終局。OpenAI 的 Codex 團隊立場與 Vinyals 相同,但同屬賣模型方,不構成獨立誘因的第二源。還有一條同人張力:同一個 Vinyals,主張「記憶」該放模型外面(今日核心第 3 則)、卻主張「編排」該被模型吃進去。什麼進模型、什麼留外部,分界線他沒說,這是 agent 架構目前最核心的開放題。這條線的過去路徑:
進行中 ?
判斷更新: 引用帳上既有判讀,不臨場改判:這條路線之爭目前的判讀是「分域對峙」:編排層的商品化在中低難度任務已發生、沿難度往上爬;高難度端的整合溢價還在變厚;不是單一終局,是一條會移動的前沿。Vinyals 的極限主張不改變這個判讀:推翻「不可解耦」需要「高難度任務換非原生編排且品質不掉」的可核企業案例,目前沒有。實務對沖不變:編排層按「可被模型重寫」設計,要薄、要可拋棄,別把護城河押在編排本身。
投資定向段: agent 編排層新創的估值敘事預設編排是護城河;這條證據顯示賣模型方正明白主張反面,且兩邊誘因對稱、無法用可信度分勝負。對「編排層護城河」敘事是張力提示,持平偏弱化。
a16z 自家節目 The a16z Show 裡,成長基金合夥人 David(推定為 David George;逐字稿只出現名、未出現姓)自陳現在的第一篩選:「你必須在 token path 上」,意思是公司的營收或成本結構直接搭在 AI 用量計費流上;機制是買方預算排擠:客戶不會為上一代軟體加預算,連砍舊軟體省下的錢都補不上 AI 帶來的成本增幅(The a16z Show,2026-05-29 發布)。這是自家頻道對自家組合的定位句,誘因偏高、「什麼算在 token path 上」也無操作化定義,這框架若照單全收,參考價值不大。真正罕見的是同一集三個互斥的量化口徑同框,發言者要分清楚。合夥人 David 給的是一個:頂尖 1% 出場門檻 24 個月從 100 億美元漲到 320 億美元(僅計已交割)。對談的 LP(有限合夥人,創投基金的出資人,自述投創投基金 34 年)給的是另外兩個,一是 Forbes AI 50 榜單(Forbes 年度 AI 私有公司五十強)去年上榜公司四成今年掉榜,二是他自家早期基金歷史損失率六成,對比過去兩年 AI 領域「大概個位數百分比」。LP 直言「這不可持續」,David 當場接話「會上去的」。
驗證: 全部口頭自報:出場門檻的樣本母體未定義、損失率的基金年份與認列時點未定義;榜單更替率可外部重算。三個數字來自對立座位(管理人對出資人)且彼此獨立,這個結構比任一數字本身可信;損失率是對自家不利的揭露,可信度上調。
判斷更新: 買賣雙方在「虧損還沒認列」上有共識,分歧只在何時認列。這比任何多空觀點都硬,因為它是雙方在對自己不利方向上的交集。連帶紀律:任何「誰會贏」的框架,先對帳「四成年掉榜」這個更替率。與凌晨深度報告的接點:「在不在 token 流上」篩的是拿不拿得到增量預算的入場券,深度報告的三變數(見下方深度報告段)篩的是拿到之後賺不賺得到毛利:一個管進場、一個管存活,兩把尺不衝突,疊著用。反過來說,產品營收若不隨 AI 用量成長,在這條篩選標準下就會被歸到拿不到增量預算的那一側。
投資定向段: 「AI 投資勝率高」的敘事與 LP 揭露的損失率結構相抵:個位數損失率被對談雙方共認為暫時現象;對高勝率敘事是弱化,對「篩選門檻正收斂到用量計費流」的觀察是中性新增。
同批訪談中落選但值得一行的(原發日期見各條,皆單源口述、方向參考):
核心判斷: 半年前,台灣投資播客股癌(謝孟恭主持,台灣下載量最大的投資類播客之一)畫過一條分裂線:軟體公司會沿『能不能把 AI 運算成本轉嫁給客戶』裂成兩群。本報凌晨付印的深度報告,對這條線做了六個月對帳。分裂本身超額兌現。同一個軟體指數(IGV)裡,年內最強與最弱的成分股差了約 140 個百分點,最強的一端是 Datadog 漲逾八成、最弱的一端是 Atlassian 跌逾六成;投行也已照這條裂縫開出多空配對交易。但「轉嫁」這條分裂線陣亡了:十八個月內轉嫁管道商品化,五家從相反起點出發的指標軟體公司收斂到同一張「訂閱打包+用量地板+超額計量」的計費架構,「AI 免費附送」的公司佔比一年內從 34% 掉到 15%。人人都會轉嫁,轉嫁就不再分生死。真分裂線改判為三個變數的乘積。消耗有界性,是點一下生成一次,還是掛著跑整夜的 agent;在這組樣本裡,它是預測力唯一沒失效的變數,同期毛利差距約 100 個百分點都落在它身上。說「唯一」的依據是排除法:掛著 agent 跑長任務那一組公司,產品力是全行業公認最強的,用產品力預測毛利在這組資料上直接失效。口徑要封頂:這組毛利數字是媒體轉述、未經審計,本報以單源處理。降檔自由,是工作負載能不能從旗艦模型搬到便宜檔;能搬的吃得到同能力價格的通縮,這個通縮的口徑出自 Epoch AI:把模型能力固定住之後,取得同一能力的價格每年降 9 到 900 倍不等,中位數 50 倍。可複製性,是業務邏輯扛不扛得住客戶自建。三者相乘才是真分裂線。毛利的真實路徑是「先吞下成本→優化→收復」;「因轉嫁而毛利擴張」翻遍申報文件查無一例。
為什麼現在挖: 分裂線是半年前的歸因框架(提出於軟體股單日崩跌隔天),在本報帳上一直是待驗證的判斷;六個月後市場已拿它開出交易,而帳上的計費證據卻與「轉嫁」判準衝突,到了必須對帳的時點。
這條判斷的過去路徑:
進行中 ?
與白天批的接點:Benedict Evans(本報 7/31 期在 OpenAI 三段降價那則引過他的商品化終局論)在 07-28 發布的訪談裡,主動把一句斷言,換成一條可被反駁的論證鏈(斷言強度是他自己調低的),給出三個可反駁條件——只剩兩家能力相當、大部分功能被模型本體吸收、實驗室在上層拿到產品槓桿——任一成立即他認錯;這組條件與對立面「定價權持久論」的成立條件第一次對齊,樹上路徑 B 從此可監控。
什麼會推翻它: 任一公司在申報文件把毛利擴張明文歸因「成本轉嫁給客戶」,「轉嫁非分裂線」收回;非寫程式類公司裝了用量閘門後毛利仍崩,「消耗有界性」變數降級。
對答案日: 近窗三點:明天(08-03)盤後 Palantir 財報;09-01 看 Anthropic 的 Sonnet 促銷價到期是否執行(截至本期,官方頁仍載 8-31 截止);以及 ICONIQ(追蹤約三百家軟體公司經營數據的投資機構調查)年中實測數據出爐,目前流通的年中值是預測不是實測。完整對帳窗到 2027 年 8 月。
以上是濃縮版——完整深度版今晚美國中部時間 7:30 另寄一封到同一個信箱。
[趨勢觀察](素材原發 2026-04-22/04-29)聯發科的 Google TPU 出貨顆數,被綁在 Intel 的封裝良率上。同一位講者六天後自己補了另一半。 股癌 4 月下旬講了一條當週對自己持股不利的訊息:Google 決定讓聯發科承接設計的 TPU(Google 自研 AI 晶片)走 Intel 的 EMIB 封裝(Intel 的先進晶片封裝技術),聯發科的出貨顆數因此高度綁定 Intel 的良率;他明說是刻意在行情最好的時候講潛在威脅,並自留轉折:若台積電能保證更多產能,不排除移回台積電的 CoWoS 封裝(股癌 EP655,2026-04-22)。六天後他自己補了風險的另一半:他查訪到 Intel 後段封裝良率已達九成,而市場仍拿載板端三到四成的良率推斷「Intel 做不出來」。這個認知落差本身就是資訊(股癌 EP657,2026-04-29)。兩條要並列讀:第一條的持久價值是「綁定關係被揭露」,第二條若成立、風險大小就被大幅削弱。全部是單源口播、無公告佐證,「Google 決定走 EMIB」是他的產業資訊,方向參考。這批證據落在「互連與封裝」這條追蹤線上,過去的路徑:
進行中 ?
判斷更新: 引用帳上既有判讀,不臨場改判:機櫃內互連「銅近期贏、光遞延」:共封裝光學(把光學元件與交換晶片封在一起以省功耗的下一代互連方案)卡在系統良率與可維修性,雲端業者在最新世代寧可退回耗電但今天量產得出來的傳統方案,穩定性優先於省電。什麼會推翻:共封裝光學良率突破且任一雲端巨頭進入量產部署(非試點),「銅近期贏」作廢;反向若光學良率三年不破,遞延改判結構性。倡議「快轉向光」最力的 Gelsinger(前 Intel 執行長)本人是光互連新創的投資人,利益衝突記著,兩邊說法都留。
本週掃描沒有新的具名重量級觀點(開頭已聲明),出一則舊而重要的。(原發 2026-05-22)世界模型的主場,當事人全面降溫。 在自家世界模型產品發表次日、主場條件下,Gemini 共同負責人 Vinyals 對世界模型路線(讓 AI 學會「世界如何因行動而變化」的內部模擬器,DeepMind 正押注的方向)連續踩煞車:影像/影片領域的「GPT 時刻」(類比語言模型當年的能力躍遷點)未到;機器人只在粗粒度規劃層先受益,觸覺這個感官通道「根本沒有資料」;物理評測是空白;最重的一句是:「我們需不需要世界模型?如果做成了,那一定需要;如果沒做成,也許不要也行」(Unsupervised Learning 訪談,2026-05-22 錄製)。發表次日在主場題目上降溫,誘因反向、可信度高。並列讀才完整:Meta 的研究部門正把「無標註純視覺」路線推成可量測。V-JEPA 2.1 模型在真實機器人抓取的成功率上,比前一代 V-JEPA-2 AC 高 20 個百分點(論文自報),早這段話兩個月(V-JEPA 2.1 論文,2026-03)。「只在規劃層受益」的強讀法已有反例,兩邊誘因剛好相反,並列最準。它動了本報哪條判斷:帳上那條「AI 的下個戰場在語言之外的世界」的樂觀待驗證判斷(此前未對讀者發過),因此加上反向配重:公司在推的路線,內部溫度不一致本身就是資訊。
[趨勢觀察](訪談原發 2026-05-22,學術對照 2026-06/07)窄領域訓練的泛化讓 Vinyals 意外,但他押的「模型當評判」正被量測打臉。 昨夜新進的 15 篇論文尚未處理、本欄無單日增量,出一組「說法對學術」的對照。Vinyals 自陳過去一年改變的想法:在數學/寫程式這類答案可自動核對的窄領域上訓練(AI 圈稱 RLVR,可驗證獎勵的強化學習),產生的跨領域泛化「超出我的預期」;但他明說這題未決:只練數學和程式夠不夠誘發通用解題能力,「我不知道,兩邊都有可能」;他押的解方是讓模型自己當評判,打開無法自動判分的領域(Unsupervised Learning 訪談,2026-05-22 錄製)。學術量測剛好打在這個賭注上:一份 2026-07 的評測研究量到,無參考答案場景下 AI 評判系統性給分過寬,補上參考答案後判定翻轉的比例最高達 85%(arXiv 論文,2026-07);另一份 2026-06 的判分器設計研究量到,以單元測試充當判分器對特定錯誤型的偵測力可以是零,而且錯的判分器給的回饋比沒有回饋更糟(arXiv 論文,2026-06)。並列讀:「寫不出判分器的領域」正是 AI 評判目前最不可靠的領域。賭注不是不能押,是目前的量測不站在它那邊。
[趨勢觀察](帳目區間 2025–2026,本報 2026-07-23 深度分析)「長跑能力取代考試分數」要拆三條腿分開判。 今年上半年的流行敘事:考題接連被打穿、模型商營收起飛,所以「模型能連續有效工作多久」取代考試分數成了新主軸。本報當時把它拆成三條腿體檢,結論到今天還好用。量測腿確實成立。評測機構 METR 的「時間軸」量尺(模型能以五成成功率完成多長的人類任務)顯示能力翻倍週期從長期的約七個月,縮到不同方法估出的三至六個月;麥基爾大學團隊用完全獨立的心理計量方法重建出同一條加速曲線(METR 時間軸 1.1,2026-01;BRIDGE 研究)。營收腿就沒這麼硬了,只有相關、沒有因果。收銀機其實在 agent 產品與企業席位,長跑能力是入場門檻、不是帳單上的品項;最硬的反證是定價:到 2026 年 7 月,沒有任何前沿實驗室按「任務完成」或「運行時長」收費。可靠性腿差四到五倍:把成功率門檻從五成提到八成,頭條的「兩個工作日」掉到半天級;機制是錯誤複利:任務時長翻倍,失敗率約翻四倍(agent 可靠性研究,2026-02);讓模型自主經營模擬生意一整年的實測裡,所有前沿模型只拿到人類高手收益的一小部分(Vending-Bench 2)。用法:聽到「模型能自主工作 X 小時」,先問成功率口徑;八成口徑未來一年爬不爬得過 8 小時,是這條敘事的開獎時鐘。
過去 24 小時。 昨夜進來 32 篇待讀:15 篇 arXiv 論文/10 篇播客逐字稿/6 篇公司與個人部落格/1 篇業界電子報。這批今日全數排隊、尚未處理;X 那邊掃了 380 個帳號、共 410 則原創貼文(轉推與回覆只計數、不分析),其中 353 個帳號昨日無原創。白天實際處理的是排程積壓:07-28 排入的四集訪談逐字稿(Latent Space、Unsupervised Learning、a16z 系兩集),全部完成分析,共 16 條查核記錄(含一件 SEC 定向查證)。覆蓋聲明:以上數字出自昨夜抓取日誌的逐批核對;自動盤點檔本期存在、但 X 側口徑與抓取日誌不一致,以日誌核對值為準;能保證的只有這個掃描範圍內的訊號。
一次性回填(非過去 24 小時)。 四集訪談原發 2026-05-22 至 07-28,為 7-28 排入的積壓、本日清畢;SEC 財報三份(Amazon 2026 Q1、Alphabet 2026 Q1 與 2025 Q4)為定向查證當日調取;晶片欄兩集股癌逐字稿(原發 2026-04)為此前已完成分析的素材、本期首次對讀者呈現。均不計入昨夜例行批。
來源集中度提醒。 本期主線與「也發生了」近半素材出自 a16z 自家發行渠道(a16z Podcast+The a16z Show,約當白天批的 47%):其中 Evans 是獨立分析師、誘因較獨立;The a16z Show 屬自家募資敘事、誘因標高。四集全是單源口述、逐條封頂處理;獨立第二視角由 SEC 審計級對帳與股癌晶片線提供。
我們追蹤的來源。 本報判斷的底層,目前追蹤的來源:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Demis Hassabis 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。
本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。