SecondSource從一手資料重建判斷
晨報 · 2026年8月2日

AI 生產力量不出來,賣方自己承認:OpenAI 生產力負責人點名用量指標已失效;獨立分析師補上結構原因,就算量到,好處也會被競爭抵消掉

本期一眼

今天 6 條,全部在本頁全文展開。

今日主線

[趨勢觀察](訪談原發 07-28 與 06-08,判斷收錄 08-02)失效清單很具體:提交數、行數、token 用量、合併請求數。就算量到,增益也留不進你的損益表

負責 OpenAI 生產力產品線的 Akshay Nathan(OpenAI Productivity/核心產品工程負責人)在 AI 工程訪談節目 Latent Space(swyx 主持、以一手長訪談著稱)親口說:「我認為我們還沒把這件事搞清楚」。他說的「這件事」,是怎麼量 AI 有沒有讓使用者更有生產力。他點名的失效清單:程式碼提交數、程式碼行數、token 用量、pull request 數(程式碼合併請求,常被工程組織當產出指標)。這些代理指標「與團隊能不能達成目標,可能不再高度相關」;就連按讚、按倒讚這類回饋訊號,也量不出使用者是不是真的更有生產力;他把難題推給全行業:「整個產業都得把這件事想清楚」(Latent Space 訪談,07-28 發布)。獨立科技分析師 Benedict Evans(前 a16z 合夥人、年度「AI Eats the World」報告作者)在另一場訪談補上第二層:就算量得到,增益也留不住。投資銀行的現金流折現分析(DCF,把未來現金流折算成今日價值的估值方法)從一週變十秒,你會做五十份分析、但收不了客戶更多錢;工具一旦人人必買,成本結構同步下移,增益歸客戶而不歸採用者。「AI 的錢在損益表上看不見」,其實是市場競爭跑出來的正常結果,談不上量測失敗,Excel 當年就是這樣(a16z Podcast 訪談,06-08 發布)。

驗證: 兩源獨立:OpenAI 自家員工訪談與獨立分析師,互不引用;但都是單源口述、全程零量化數據,Evans 引述的顧問業與央行 CFO 調查未附名稱與樣本數,本報未直核。誘因方向是這條的關鍵:OpenAI 的營收與 token 消耗直接掛鉤,賣 token 的人否定 token 量當生產力指標,是對自家不利的自認,份量重於任何第三方批評;Evans 的結論對創投圈的軟體應用部位同樣不討喜。

判斷更新: 本報帳上一條還在驗證的判斷是這樣寫的:「AI 增益量不量得到,取決於該職位的產出單位能否與外部變量分離;量得到的增益也會因工具普及被競爭掉」。前後兩腿今天各補上一個反向誘因的證詞,信心上調,但暫不升為正式判斷,因為「量不量得到」與「留不留得住」是兩個可以分別開獎的命題,拆開才升。還有一個已在追的接點,傳聞裡有大公司員工寫程式空轉刷 token 用量。一旦公司拿用量當 KPI,「量不準」就會惡化成「被刷爆」,該傳聞仍在等獨立證據。

投資定向段: 目前的敘事假設企業 AI 支出終將被 ROI 數字證明;這兩條證詞指出的落差是量測工具本身缺席、且增益結構性流向客戶端。對「AI 支出可以用生產力報表辯護」的敘事是弱化,對「必需品化、不用者被淘汰」的採用邏輯反而是強化。

[證據更新](原轉述 2026-07 入帳,SEC 對表完成 08-02)「AWS 利潤率漲幅領先同業」一半對一半錯:漲幅其實更大,但同季 Google 雲端漲得更多

上月半導體與 AI 算力研究機構 SemiAnalysis 的一篇建模分析文章轉述稱:Amazon 雲端部門 AWS 在 2026 年第一季營業利潤率環比上升 213 個基點(basis point,1 基點=0.01 個百分點)、高於其他雲端服務商,歸因於 Anthropic 模型在 Bedrock 平台(讓企業經同一組 API 接多家 AI 模型的服務)的用量拉動(SemiAnalysis 原文)。本報今天拿 SEC(美國證券交易委員會)申報原文逐格對帳,結果一半對一半錯。對的那半更強:AWS 分部營業利潤率實際從 35.0% 升到 37.7%,環比 +270 基點。轉述版低估約 60 基點,歸因故事的量化前提反而更硬(Amazon 2026 Q1 財報 8-K)。錯的那半是比較級。Google Cloud 同季利潤率從 30.1% 升到 32.9%,這兩個百分比是四捨五入後的顯示值,直接相減會少幾個基點;用該分部未四捨五入的營收與營業利益原始數字自算,環比是 +286 基點,高於 AWS,本報以自算值為準(Alphabet 2026 Q1 財報Alphabet 2025 Q4 財報)。這裡要帶兩個口徑上的但書:Microsoft 不單獨披露 Azure 利潤率,「同業比較」只限有分部披露的公司;SemiAnalysis 原文也提醒過 Google Cloud 的利潤率有成本歸集因素墊高,原因是 DeepMind 的訓練成本不算在雲端分部,兩家分部的記帳規則不同。

驗證: 新數字全部出自 SEC 申報文件,經審計、可逐格點驗,是本期唯一審計級材料;被對帳的轉述版保留供校準:方向對、量值低估 60 基點,這筆誤差已記入該機構的追蹤紀錄。

判斷更新: 三層。其一,轉述的數字就算方向抓對,量值也可能偏,二手數字一律只能當方向指標用。其二,「AWS 領先同業」的措辭停用;被推翻的比較級反而暴露更大的線:兩大雲端分部利潤率同季同步大擴,「AI 資本支出轉化為分部利潤」是行業級現象,本報已另立一條待驗證的判斷在追,下一季兩家若分道而行則收回(本報自設觀察窗,對照下一季兩家財報)。其三,掛在原數字上的兩條既有判斷(Amazon 押多家模型供應商做對沖、這套對沖已開始兌現)證據升級而非受損。對正在評估要不要押 Bedrock 這類多模型平台的人,今天拿到的是審計級而非二手轉述的證據。

投資定向段: 「AI 資本支出燒錢無回報」與「AWS 是最大受益者」兩種敘事都在流通;審計級數字對前者是弱化(利潤傳導已在兩家分部同季發生)、對後者也是弱化(同季漲更多的是 Google 雲端),真正被強化的是「行業級傳導」這個中間讀法。

[證據更新](訪談原發 2026-05-22,判斷升格 08-02)「個人化不進模型本體」被當事方親口坐實:不是做不到,是服務成本

Google DeepMind 的 Gemini 共同負責人 Oriol Vinyals(與 Jeff Dean、Noam Shazeer 共同領導 Gemini)在創投 Redpoint 合夥人主持的訪談節目 Unsupervised Learning 裡,把 continual learning(持續學習:讓 AI 從持續互動中累積經驗)的勝出形態判給「檔案式外掛記憶」:agent 把經驗寫進外部檔案、跨任務讀寫,而不是把經驗訓練回模型權重(模型本體的參數)。他給的理由與效果無關,而是服務經濟學:「我們是把一個模型服務到全球規模……要替每個使用者服務一份帶著不同記憶的模型,會非常痛苦」;他也留了退路:如果進權重真是最好的路,「我們會想辦法做出支撐個人權重的硬體」(Unsupervised Learning 訪談,2026-05-22 錄製)。這段話為什麼重要?上月 Allen Institute(美國非營利 AI 研究機構)研究員 Nathan Lambert 推測過同一件事:前沿實驗室「少數模型服務所有人」的規模經濟,結構性排斥一人一份權重,所以個人化這條軸的價值會沉澱在開放權重模型的基建(記憶層、本地微調),而不是實驗室的 API(Interconnects 原文,2026-06)。當時是單一來源的推測;今天被推測的那一方親口說出同一機制,理由正是推測裡的那一個。

驗證: 一手發言逐字稿,身分經三處交叉確認。要標三件事:訪談錄於 5 月下旬、上週才排進處理排程,距今已兩個月,他對能力現況的說法可能已經過時;Vinyals 所屬公司結構上就偏好「個人化不進權重」的答案,這條發言誘因順向;升格依據是「機制被當事方證實」,不是新增量化數據。對照組留在帳上:晶片公司 Cerebras 的多用戶客製權重服務,是「絕對做不到」強讀法的既存反例。

判斷更新: 「個人化屬於開放模型陣營」從初步推測升為正式判斷,但只升半格,因為 Vinyals 證實機制的同時,也給出了實驗室側的解法形態:檔案式外掛記憶,而那正是「中央路線用淺層方案收掉個人化市場」的具體形態。開獎點收斂成一句:檔案式記憶滿不滿足得了個人化的主需求。什麼會推翻:前沿實驗室若推出權重級的個人客製且定價可行,機制腿被削弱。

投資定向段: 押「個人化/記憶層基建」的敘事有了更具體的對手情境:實驗室的答案是外掛檔案、不是個人權重;對該敘事整體持平偏強化(實驗室親口讓出權重級個人化),但市場邊界縮小為「檔案式記憶不夠用的場景」,盡調問題該從「實驗室會不會做」換成「檔案式在哪裡不夠用」。

[趨勢觀察](訪談原發 07-28)「Codex 週活 1,000 萬」是合計數,而且結構上拆不開;知識工作被判給「給 AI 一台電腦」的框架

與今日核心第 1 則同一場訪談的另一段。OpenAI 對外的「1,000 萬」使用數,主持人 swyx 當面指出是 Codex(OpenAI 的 agent 式寫程式產品)加 ChatGPT Work(其 7 月推出的知識工作 agent 工作區)的合計:「因為 harness 是同一套……你沒辦法分開統計」;受訪的產品負責人未否認,並直答「harness 是同一個、是共用的」。harness 指模型外圍的執行框架:工具呼叫、沙盒、提示組裝這一層(Latent Space 訪談,07-28 發布)。同段三個可用細節:活躍口徑(週活/月活/累計)全程未定義;ChatGPT Work 不預設開給既有用戶、目前僅限付費用戶,這兩點是對自家聲量不利的揭露,可信度反而高;路由是模型自己決定的:偵測到你在做試算表,模型會主動把你推去 Work 模式。「聊天介面正被 Codex 框架取代」是主持人的措辭,受訪者以「原本的 harness 今天還在」(ChatGPT Classic)部分修正,不能記成官方宣告汰除;官方 7 月 9 日另有「Codex 週活超過 500 萬」的口徑,兩者定義不同,不能相減算成長率。

驗證: 一手在場發言,但屬產品發布宣傳窗口的自家員工訪談,採用面自述全部單源;合計口徑是主持人陳述+受訪者默認,非官方明文;架構共用與路由行為可由公開產品行為部分驗證。

判斷更新: 兩件。讀 OpenAI 的產品數字先問口徑,「1,000 萬」既無產品拆分也無活躍定義,只能當量級引用。更結構性的一件是,OpenAI 把一般知識工作判給了「給 agent 一台可任意操作的電腦」的框架。聊天框長年優化的是延遲與陪伴,正事交給另一套底座。對做應用的公司,該假設的對手是 agent 工作區,不是聊天機器人。

投資定向段: 「Codex 週活千萬」正被當成 AI 寫程式工具滲透率的證據流傳;這條證據指出該數字是雙產品合計、口徑未定義。對以單一數字支撐的滲透敘事是弱化,對「agent 工作區吃掉知識工作入口」的方向判斷是強化。

[趨勢觀察](訪談原發 2026-05-22)賣模型的人說:agent 的編排層終將被模型自己寫掉,而靠編排生態吃飯的人剛好押相反方向

與今日核心第 3 則、以及本則上一條合看(同屬「模型外那一層歸誰」的線)。Vinyals 被問「你長年主張通用方法加算力終將勝過人工巧結構(AI 圈稱 bitter lesson),現在哪裡還沒被遵守」時,點名 agent scaffold 本身。scaffold 指開發者在模型外圍手寫的編排程式:何時開子 agent、怎麼委派、怎麼管長任務。他的判斷:這一層終將從「人寫的程式」變成「模型當場自己寫的程式」,終局「也許沒有系統」;形態未定(從頭生成,或自動搜尋出正確結構)(Unsupervised Learning 訪談,2026-05-22 錄製)。這條判斷直接撞上本報帳上一條反向判斷,提出者是開源 agent harness 的作者 Peter Steinberger。Steinberger 講的 harness(模型外圍的執行框架)與 Vinyals 講的 scaffold(外圍的編排程式)是同一塊地盤的兩個切面,本報以下統稱編排層。他主張,鎖定效應的槓桿點正從模型層遷到編排層。最乾淨的讀法是誘因結構:賣模型的人說編排層會被模型吸收,靠編排生態吃飯的人說價值正沉澱在編排層。兩邊立場都與自身利益同向,可信度分不出勝負,只能時間開獎;可調和的讀法是時程:當下的判例(同一模型換編排,表現差距可以大於換模型)對上「極限情況」的終局。OpenAI 的 Codex 團隊立場與 Vinyals 相同,但同屬賣模型方,不構成獨立誘因的第二源。還有一條同人張力:同一個 Vinyals,主張「記憶」該放模型外面(今日核心第 3 則)、卻主張「編排」該被模型吃進去。什麼進模型、什麼留外部,分界線他沒說,這是 agent 架構目前最核心的開放題。這條線的過去路徑:

專案級上下文(2023)從單檔建議到先讀懂整個專案
Coding agent(2023-24)自己改碼、跑測試、端到端解一張 ticket
Harness 價值躍遷(2025-26)同一顆模型換殼,分數差距可大於換模型——主戰場部分移到工作流程組織本身

進行中 ?

路徑Aharness 商品化,價值遷出模型層(Steinberger $200→$10判例/Omnigent 共通層/harness設計可自動搜索)
路徑Bharness×model 不可解耦,整合點吃 margin(Ben Thompson整合-未夠好理論/Altman 自認分不清Codex 神奇來自哪層)

判斷更新: 引用帳上既有判讀,不臨場改判:這條路線之爭目前的判讀是「分域對峙」:編排層的商品化在中低難度任務已發生、沿難度往上爬;高難度端的整合溢價還在變厚;不是單一終局,是一條會移動的前沿。Vinyals 的極限主張不改變這個判讀:推翻「不可解耦」需要「高難度任務換非原生編排且品質不掉」的可核企業案例,目前沒有。實務對沖不變:編排層按「可被模型重寫」設計,要薄、要可拋棄,別把護城河押在編排本身。

投資定向段: agent 編排層新創的估值敘事預設編排是護城河;這條證據顯示賣模型方正明白主張反面,且兩邊誘因對稱、無法用可信度分勝負。對「編排層護城河」敘事是張力提示,持平偏弱化。

[趨勢觀察](訪談原發 2026-05-29)創投的第一篩選只剩一句話:「你必須在 token 流上」,但同一集裡三個互斥的量化口徑更值錢

a16z 自家節目 The a16z Show 裡,成長基金合夥人 David(推定為 David George;逐字稿只出現名、未出現姓)自陳現在的第一篩選:「你必須在 token path 上」,意思是公司的營收或成本結構直接搭在 AI 用量計費流上;機制是買方預算排擠:客戶不會為上一代軟體加預算,連砍舊軟體省下的錢都補不上 AI 帶來的成本增幅(The a16z Show,2026-05-29 發布)。這是自家頻道對自家組合的定位句,誘因偏高、「什麼算在 token path 上」也無操作化定義,這框架若照單全收,參考價值不大。真正罕見的是同一集三個互斥的量化口徑同框,發言者要分清楚。合夥人 David 給的是一個:頂尖 1% 出場門檻 24 個月從 100 億美元漲到 320 億美元(僅計已交割)。對談的 LP(有限合夥人,創投基金的出資人,自述投創投基金 34 年)給的是另外兩個,一是 Forbes AI 50 榜單(Forbes 年度 AI 私有公司五十強)去年上榜公司四成今年掉榜,二是他自家早期基金歷史損失率六成,對比過去兩年 AI 領域「大概個位數百分比」。LP 直言「這不可持續」,David 當場接話「會上去的」。

驗證: 全部口頭自報:出場門檻的樣本母體未定義、損失率的基金年份與認列時點未定義;榜單更替率可外部重算。三個數字來自對立座位(管理人對出資人)且彼此獨立,這個結構比任一數字本身可信;損失率是對自家不利的揭露,可信度上調。

判斷更新: 買賣雙方在「虧損還沒認列」上有共識,分歧只在何時認列。這比任何多空觀點都硬,因為它是雙方在對自己不利方向上的交集。連帶紀律:任何「誰會贏」的框架,先對帳「四成年掉榜」這個更替率。與凌晨深度報告的接點:「在不在 token 流上」篩的是拿不拿得到增量預算的入場券,深度報告的三變數(見下方深度報告段)篩的是拿到之後賺不賺得到毛利:一個管進場、一個管存活,兩把尺不衝突,疊著用。反過來說,產品營收若不隨 AI 用量成長,在這條篩選標準下就會被歸到拿不到增量預算的那一側。

投資定向段: 「AI 投資勝率高」的敘事與 LP 揭露的損失率結構相抵:個位數損失率被對談雙方共認為暫時現象;對高勝率敘事是弱化,對「篩選門檻正收斂到用量計費流」的觀察是中性新增。

也發生了

同批訪談中落選但值得一行的(原發日期見各條,皆單源口述、方向參考):

今天另外還有 2 篇

各自獨立成篇,一句話說明為什麼今天值得點:

過去洞見

[趨勢觀察](帳目區間 2025–2026,本報 2026-07-23 深度分析)「長跑能力取代考試分數」要拆三條腿分開判。 今年上半年的流行敘事:考題接連被打穿、模型商營收起飛,所以「模型能連續有效工作多久」取代考試分數成了新主軸。本報當時把它拆成三條腿體檢,結論到今天還好用。量測腿確實成立。評測機構 METR 的「時間軸」量尺(模型能以五成成功率完成多長的人類任務)顯示能力翻倍週期從長期的約七個月,縮到不同方法估出的三至六個月;麥基爾大學團隊用完全獨立的心理計量方法重建出同一條加速曲線(METR 時間軸 1.1,2026-01BRIDGE 研究)。營收腿就沒這麼硬了,只有相關、沒有因果。收銀機其實在 agent 產品與企業席位,長跑能力是入場門檻、不是帳單上的品項;最硬的反證是定價:到 2026 年 7 月,沒有任何前沿實驗室按「任務完成」或「運行時長」收費。可靠性腿差四到五倍:把成功率門檻從五成提到八成,頭條的「兩個工作日」掉到半天級;機制是錯誤複利:任務時長翻倍,失敗率約翻四倍(agent 可靠性研究,2026-02);讓模型自主經營模擬生意一整年的實測裡,所有前沿模型只拿到人類高手收益的一小部分(Vending-Bench 2)。用法:聽到「模型能自主工作 X 小時」,先問成功率口徑;八成口徑未來一年爬不爬得過 8 小時,是這條敘事的開獎時鐘。

來源與盤點(本期 2 個來源)

本期取材自 2026-08-02 的研究日報;今日無三天內新事件,主線是 07-28 排入的四集訪談積壓完成分析後的判斷(原發 2026-05-22~07-28,逐條標原發)加一件 SEC 定向查證。昨夜掃 32 篇新進素材(15 論文/10 播客/6 部落格/1 電子報,尚在排隊)加 X 上 380 個帳號的 410 則原創貼文;白天精讀 4 集逐字稿 → 本期 16 條查核記錄、6 則主線。集中度先講:近半材料出自 a16z 自家發行渠道,誘因逐條標注;本週無新的具名大神觀點,該欄以回顧一則補位;本期無產品動態,近 48 小時只有一篇廠商部落格待處理、尚未進圖;數字出自抓取日誌逐批核對口徑。

過去 24 小時。 昨夜進來 32 篇待讀:15 篇 arXiv 論文/10 篇播客逐字稿/6 篇公司與個人部落格/1 篇業界電子報。這批今日全數排隊、尚未處理;X 那邊掃了 380 個帳號、共 410 則原創貼文(轉推與回覆只計數、不分析),其中 353 個帳號昨日無原創。白天實際處理的是排程積壓:07-28 排入的四集訪談逐字稿(Latent Space、Unsupervised Learning、a16z 系兩集),全部完成分析,共 16 條查核記錄(含一件 SEC 定向查證)。覆蓋聲明:以上數字出自昨夜抓取日誌的逐批核對;自動盤點檔本期存在、但 X 側口徑與抓取日誌不一致,以日誌核對值為準;能保證的只有這個掃描範圍內的訊號。

一次性回填(非過去 24 小時)。 四集訪談原發 2026-05-22 至 07-28,為 7-28 排入的積壓、本日清畢;SEC 財報三份(Amazon 2026 Q1、Alphabet 2026 Q1 與 2025 Q4)為定向查證當日調取;晶片欄兩集股癌逐字稿(原發 2026-04)為此前已完成分析的素材、本期首次對讀者呈現。均不計入昨夜例行批。

來源集中度提醒。 本期主線與「也發生了」近半素材出自 a16z 自家發行渠道(a16z Podcast+The a16z Show,約當白天批的 47%):其中 Evans 是獨立分析師、誘因較獨立;The a16z Show 屬自家募資敘事、誘因標高。四集全是單源口述、逐條封頂處理;獨立第二視角由 SEC 審計級對帳與股癌晶片線提供。

我們追蹤的來源。 本報判斷的底層,目前追蹤的來源:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Demis Hassabis 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。


免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新