SecondSourceAI 產業洞見 · 完整版檔案庫

晨報 SecondSource 晨報 · 2026/8/31 · 2026年8月31日

開權重模型拿走三成用量、只拿到 4% 的錢:擋住錢的不是模型不夠強,是工作切不夠窄

三十秒看完

1. 開權重模型(參數公開、可自行下載部署的那種)跑掉一個模型分派平台三成的用量,卻只佔不到 4% 的錢。擋住錢的不是模型不夠強。

2. OpenAI 自研晶片每一度電產出的量高 1.5 到 1.9 倍,但每個 token 的總成本與輝達打平。

3. 同一份晶片拆解,二手轉述時把「總成本打平」那句略過了,結論因此翻向相反邊。

本期材料取自本報 8 月 31 日這一輪的判讀;材料事件時間橫跨 2026 年 6 月至 8 月 30 日。昨夜掃 79 篇 → 本期用上 17 條有連結可查的外部收據。

今日主線

1. [證據更新](指數發布 7 月、資料期間 6 月;技術報告 8 月)「開權重只接得走便宜的活」這個解釋撐不住了:前沿模型贏不了的那個任務,錢一樣沒有搬家

Vercel 是前端部署平台,它的 AI Gateway 是企業用來把請求分派給多家模型供應商的中間層,因此手上有跨廠商的實際用量與支出數據。它 7 月發布的官方指數(資料期間是 2026 年 6 月)寫著兩個方向相反的數字:開權重模型跑掉了該平台 29% 的 token 量,卻只佔不到 4% 的支出,平均每個 token 的價格約為平台整體均價的十分之一。這三個數是該指數分別給的讀數,不是彼此換算來的;「不到 4%」只給了上限,用它跟 29% 相除也不會剛好得到十分之一。同一份指數也給了走勢:4 月時開權重約佔全部用量的九分之一,6 月已接近三分之一(Vercel AI Gateway Production Index,2026 年 7 月)。

驗證: 29% 這個「量」的數字對本報不是新的:本報 7 月 28 日那期就登過同一個 29%,當時的來源是電子報 Exponential View 依該平台公開排行榜算出來的數字(本報 2026-07-28 期)。今天新的是「錢」與「價」那兩欄,外加把量的數字從二手計算改成以公司自己發布的定期指數為準,可複核的程度不同級。⚠️ 這是單一平台的樣本,Vercel 客群偏前端與應用開發,不能外推成企業 API 全市場;它賣的是分派層不是模型,對開權重與閉源的分歧沒有明顯方向性動機,但仍是自家營運數據的自我報告。⚠️ 另有一個本報不採信的數字:有人引該平台執行長的即時圖表,稱 8 月 22 日單日開權重佔比創 62% 紀錄。那不在任何已發布的指數內,是單日讀數,當天是週六而週末流量偏實驗性,與月度口徑不可比(引用該圖的貼文,08-22)。

這個分岔本身不是新觀察,今天變的是它的成因。 7 月 22 日,X 上的匿名產業評論者 @teortaxesTex 就提出過同一個區分。本報名冊長期追蹤這個帳號,他對中國模型有明顯的同向立場。他的區分是:追蹤開權重的競爭壓力要看被取代的支出,不是看 token 佔比。他給的成因是長尾:開權重接走的是價格敏感、本來就不會付高價的那批工作,所以量會漲、錢不會跟著漲。那則是純斷言,沒有任何數字(原貼文,07-22)。

今天讀到的第二份帶數字的材料把長尾這個解釋戳出一個洞。 全球最大的避險基金之一 Bridgewater,與 AI 實驗室 Thinking Machines Lab 合作發表技術報告。該實驗室的產品 Tinker 提供企業做模型微調服務。微調是拿一個現成模型、用自家資料再訓練一輪,讓它專精某件事。報告的做法是以阿里巴巴的開權重模型 Qwen3-235B 為底,在專家標註過的「什麼算有價值的金融資訊」任務上微調,自報平均準確率 84.7%,而他們評測的前沿模型(各家最強的通用模型)最佳者是 78.2%,等於少犯 29.8% 的錯,同時每個任務的推論成本降低 13.8 倍。同一份報告還記錄:前沿模型未經最佳化時在該任務只有約 50% 準確率,經專家寫的提示調校後升到 70 中段,天花板不到 80%Thinking Machines × Bridgewater,2026 年 8 月)。那個任務不是長尾:前沿模型在那裡不是比較貴,是比較差。

⚠️ 這份報告的評測任務、專家標註、前沿模型的對照提示全由利害關係雙方自己設計,沒有獨立複現;它升級的是可證偽性,不是可信度。有了具體數字,別人才有東西可以拿去複現或推翻,但這件事本身沒有因此變得更可信。13.8 倍是推論成本,未計專家標註與微調的一次性投入,所以不是端到端的總成本。⚠️ 這個微調案本報 6 月 30 日就從第三方轉述知道了,當時零數字、也沒有獨立基準,所以本報一個字都沒對你寫;今天補上的是數字。

判斷更新: 如果連前沿模型贏不了的工作,錢都還沒有大規模搬家,那擋住錢的就不是能力,也不是價格敏感度。剩下的解釋是可窄化,加上可標註:把一條工作流定義成邊界清楚、輸入輸出固定的窄任務,而且客戶端有專家能標出「什麼是對的答案」。兩件同時成立,量和錢才會一起走;沒有同時成立,開權重就只接得走便宜的那半邊。這把該盯的變數從時間軸搬到結構軸:不是「開源什麼時候追平前沿」,而是「客戶手上有多少比例的工作負載可以被切窄」。⚠️ 這是一條推論,不是已經確認的事:兩條腿都只有單一來源,其中一條還是利害關係方自報,證據還不足以主張任何一方。什麼會讓它翻盤,講死三條:獨立第三方用夠強的對照組複現 Bridgewater 那個任務失敗;分派平台的開權重支出佔比在兩個月內從不到 4% 跳到 15% 以上、而客戶的任務結構沒變;出現通用能力打平前沿的開權重模型。中間那一條裡的時間窗與門檻是本報自己設的,不是任何當事人給的判準:兩個月,是因為該指數大致月更,屆時會有兩期新讀數可比。對答案日訂在 2026 年 10 月 31 日。屆時 8 月與 9 月兩期指數都該發布了,直接讀支出佔比有沒有脫離 4% 這個量級。

這對投資判斷的意思: 壓縮已經在一個窄任務上發生過一次,而總支出佔比仍停在不到 4%。把這兩個讀數擺在一起,「開權重追平前沿的那一天,就是模型層毛利率被壓縮的那一天」這個敘事就被弱化了:它把風險押在時間上,而落差其實出現在另一個地方。該改去量的是客戶端可窄化負載的佔比。

三個位子讀出三個不同動作。前沿實驗室:護城河審計該換對象了。真正的競爭者不是某個追平的開源模型,是客戶內部那支會把工作切窄、而且請得起專家標註的資料團隊;守溢價的錢該花在通用性、服務保證與外層編排,不是在通用測驗上再加分,因為在窄任務上已經輸過一次了。雲端業者若拿收入曲線推容量,會系統性落後:29% 的量只值 4% 的錢,意味著低價層的容量壓力會先到、收入訊號可能永遠不到,所以容量與收入要拆成兩張表。企業資訊長的第一個問題要從「哪個模型最強」換成「這條工作流能不能被定義成窄任務、我手上有沒有人能標它」。自建的分水嶺比多數人想像的低,卡住的不是模型,是標註的人。而三個位子共用同一個動作:看到「開權重佔比 X%」這種數字,先問那個分母是量還是錢。 今天這兩個數在同一個平台、同一個月,差了七倍以上。

2. [證據更新](拆解發布日 8 月 27 日)OpenAI 自研晶片每度電贏 1.9 倍,每個 token 的總成本卻打平:承重的是後面那句

本報 8 月 26 日的快訊提過 OpenAI 的自研推論晶片 Jalapeño 交出第一份成績單;今天新的是實測數字,以及同一份拆解裡緊接著的那句「打平」。

Jalapeño 是 OpenAI 與 Broadcom 合作的首款自研 AI 推論晶片(推論=模型上線後回答問題的那一半工作,相對於訓練)。半導體產業獨立分析機構 SemiAnalysis(創辦人 Dylan Patel)用自家公開的 InferenceX 測試,並稱在 OpenAI 實驗室現場複核了部分測試。結論是:700 瓦的 Jalapeño 對上 1,200 到 1,400 瓦級的 Nvidia GB200/GB300(Nvidia Blackwell 世代的產品),每一度電能產出的量高 1.5 到 1.9 倍、回應延遲低 1.7 到 3.6 倍。能效比幾乎全場景勝過 Blackwell。但同一份拆解判定,兩者「每個 token 的總持有成本大致打平」——總持有成本是把晶片單價、良率、機櫃密度、利用率、電費、攤提全算進去之後,每個 token 實際花掉的錢(SemiAnalysis,2026 年 8 月)。

另兩個數字值得記:從開始招募團隊到晶片設計定案送製造約 16 個月(2024 年年中啟動、2025 年 11 月定案);OpenAI 自報 AI 輔助設計讓晶片內兩個運算區塊的面積各減 8%10%,而且它自家的程式生成模型 Codex 在底層程式團隊完全沒介入的情況下,寫出了可用而且高效的運算核心程式。

驗證: 承重的只有 SemiAnalysis 這一份拆解。OpenAI 的一手頁面本輪抓取回 403、未取得逐字內容,沒有計為第二個獨立來源,所以「Jalapeño 實際上優於 Nvidia」這件事,本報只當單一來源的說法看待。受測模型與機器配置由 OpenAI 選定,現場複核的範圍是「部分測試」不是全量獨立複現;面積削減 8% 與 10% 是 OpenAI 自報,拆解者原文寫的是「他們宣稱」,本報不代為認定。這組瓦數的比較顆粒度本報未向一手頁複核。⚠️ 而且 700 瓦對 1,400 瓦的能效比優勢有一部分單純來自零件比較小,不等於同尺度下的架構優勢。⚠️ 拆解裡另外拿 Jalapeño 與 Nvidia 下一代平台 Vera Rubin 的每 MW 產出做對比,兩邊用的是不同運行模式,不是同一把尺。

判斷更新: 1.5 到 1.9 倍讀起來像自研晶片陣營要開始吃 Nvidia 的份額,但真正承重的是「打平」那句:份額由總持有成本決定,不由能效比決定。 本報手上有一條還在跑的判斷:到 2027 年年中,Nvidia 仍保有 AI 加速器(跑 AI 運算的專用晶片)供給價值七成以上的份額,結構是黏著的;今天這份讀數的方向是強化它,不是動搖它。什麼會讓它鬆動也講死:不是更高的能效比,是每個 token 的總持有成本第一次出現明顯落差。今天就能做的一件事:採購與談判條款押在每個 token 的總持有成本,不押在能效比測試分數。

這對投資判斷的意思: 現在的敘事假設「自研晶片跑得更省電,就代表 Nvidia 的份額要鬆動」。這條證據把兩件事拆開了:省電是真的,帳單上的差額是零。對「自研晶片侵蝕份額」這個押注是弱化;該等的訊號不是下一份能效比新高,是總持有成本第一次拉開差距。

3. [本週](電子報發布日 8 月 30 日)同一份拆解、兩個轉述,掉的是那句對結論不利的話

本報今天讀的那份 SemiAnalysis 拆解,業界電子報 Exponential View(創辦人 Azeem Azhar)在同一週也讀了,而且附上了原文連結。它引了 1.5 到 1.9 倍,沒有引「總持有成本打平」那句。 逐字對照:該電子報寫 Jalapeño「beats comparable Nvidia silicon by 1.5–1.9x on tokens per megawatt」,而「total cost of ownership」這串字在全篇一次都沒出現(Exponential View #599,08-30)。兩邊的結論因此往相反方向走:該電子報寫的是「這種差異化的硬體需求會把市場做大,即使它可能降低 Nvidia 的相對主導地位」;本報的讀數是總持有成本打平、本輪不構成份額鬆動的證據。

驗證: ⚠️ 這不是抓錯。 該電子報全程附了一手連結、讀者點得進去;它把 29.8% 四捨五入寫成「大約 30%」、把 13.8 倍寫成「十四分之一的成本」,都在合理的科普裁量之內。可查的只有一件事:兩份文件並排放,被略過的那一句,正好是同一份拆解裡對結論不利、而對採購決策承重的那一句。兩邊的結論本報都保留,不判誰對:如果總持有成本在下一代拉開差距,該電子報的結論會先成立。

同一位作者主動揭露的另一件事值得一起讀:他在同一篇文章裡寫明自己是低延遲推論晶片新創 Fractile 的投資人,也是微調服務公司 Trainloop 的投資人,而這兩條線正好各自對上今日主線第 2 點與第 1 點的方向。主動揭露是加分不是減分;本報的動作不是不信任他,是今天三條事實全部繞過他、直接讀一手頁面。

判斷更新: 對任何靠二手摘要跟進這個產業的人,這一則給的是一個可以立刻執行的動作:看到一個亮眼的比值,回原文找那一句「但是」——它通常存在,而且通常就是決定要不要簽約的那一句。 與第 2 點合看:那裡被誤讀的是 1.9 倍(那是每一度電的產出,不是每個 token 的成本),這裡被略過的是同一份文件裡替它設限的那句話,兩件是同一個問題的兩層。

這對投資判斷的意思: 多家轉述同一份文件,不是多個來源。現在不少對自研晶片的樂觀判斷,追到底是同一份拆解的同一個比值,中間隔了一到兩層轉述;這條證據不改變那份拆解說了什麼,只弱化「多家獨立來源都這麼說」這個印象。

快訊(本報還沒查證)

1. 哲學家 Toby Ord 發表論文,論證遞迴自我改進(AI 幫忙設計並訓練下一代的自己,一代比一代強)的關鍵閘門是單次改良迴圈的時長,並疊上三道物理上限:光速、單位空間裝得下的資訊量、不可逆運算的能量下限。本報只讀到二手摘述,未讀論文本體(arXiv 2608.14426)。

2. 法律與金融專業資訊供應商 Thomson Reuters(Westlaw、路透社的母集團)據報開發了第一個以阿里巴巴 Qwen 為底的內部自研模型以降低成本;本報只讀到轉述,一手報導未讀(Yahoo Finance)。若屬實,它會是今日主線第 1 點那條推論的第二個企業案例。

3. 新創 int21.ai 稱換一套外層編排系統(負責拆題、重試、驗證的那一層),就把 GPT-5.6 在抽象推理測驗 ARC-AGI-3 的公開題組上從 13.3% 推到 100%。⚠️ 公開題組的題目與答案都是公開的,等於考前看過考卷,這個 100% 幾乎沒有資訊量;本報未讀該廠商頁面(int21.ai)。

4. 路透社調查報導稱 Meta 曾考慮把部分團隊縮編至多 60%,以成為「AI 原生」組織,後來告吹。⚠️ 這是考慮過的計畫,不是執行過的事實;本報未讀報導原文(路透社,08-26)。

晶片與半導體

[本週](發布日 8 月 30 日)快閃記憶體每一疊裝得下 16 倍,但直接換上去會讓 GPU 餓死——牛津大學提出的折衷。 牛津大學的研究團隊發表論文:高頻寬快閃記憶體每一疊的容量是現行高頻寬記憶體的 16 倍、頻寬相當,看起來就是推論裝不下大模型的解答;但直接替換會嚴重拖垮效能,因為快閃記憶體的長尾延遲會讓 GPU 的排程器空等。他們的做法是兩種記憶體混用,靠預測把慢的那一半排出關鍵路徑(Semiconductor Engineering,08-30論文原文,IEEE Computer Architecture Letters,2026 年 8 月)。為什麼值得記: 今日主線第 1、2 點講的都是推論的錢,而推論成本的物理底層就卡在「模型放不放得進記憶體」。容量便宜 16 倍是個很大的數字,但它換來的是延遲。這筆帳還沒有人算完,而算完之前,任何「記憶體要變便宜了」的推論都缺一半。這筆帳算完的訊號是有人公布混用架構在真實推論負載下的延遲實測,而不是又一個容量倍數。

[本週](發布日 8 月 30 日)晶片上的高速記憶體縮 25% 面積、寫入快 42%。 喬治亞理工學院與電子設計軟體商 Synopsys 發表論文,對象是 2 奈米製程的 6 電晶體 SRAM。SRAM 是貼在運算單元旁邊的高速小記憶體,也是晶片上最占面積的東西之一。論文的做法是把它改成立體堆疊:把負責存取的電晶體搬進金屬連線層,配合矽奈米片與埋入式供電軌,單元面積比高效能矽基準少 25%、子陣列的寫入延遲少 42.2%Semiconductor Engineering,08-30論文原文 arXiv 2608.22741,2026 年 8 月)。為什麼值得記: SRAM 既然是晶片上最占面積的東西之一,面積少 25% 就是往今日主線第 2 點那句「承重的是總持有成本」的方向走。但這則目前對採購與產品決策沒有可執行動作,本報只做技術追蹤。⚠️ 這是論文階段的設計提案,不是量產良率,中間隔著整條製程驗證。

大神觀點

[本週](發文日 8 月 30 日)Simon Willison:OpenAI 用「這是拿來幹嘛的」解釋新產品,而不是「它實際上會做什麼」——所以他自己去問了。 Simon Willison 是開源網站框架 Django 的共同作者,長期公開實測 AI 工具並逐項記錄。他花了一段時間摸 OpenAI 7 月 9 日發表的 ChatGPT Work,寫下的結論很直接:官方文件用「什麼時候該用它」來定義這個產品(要一份簡報、一份分析、一個可交付的檔案就用它),而他認為那幾乎沒有資訊量,因為那些事一般的 ChatGPT 本來就在做。他整理出的實際差別是一份能力清單:可連網的程式執行環境、無介面的瀏覽器、跨對話共用的檔案系統、能派出子任務、可排程的自動化。文章發出後他做了更直接的一件事:開一個新工作階段,叫那套系統自己把它擁有的每一個工具列出來、分類、逐項說明用途,做成一個網站;結果列出 223 個已註冊的工具,其中 6 個是他自己接上去的Simon Willison,08-30)。他點名的問題在第二層:OpenAI 至今不公開系統提示與工具說明,用他的話說,文件裡若有這些,這篇就不用寫了。為什麼值得記: 企業要判斷一個代理型產品能不能進自家流程,需要的是工具清單與權限邊界,不是使用情境文案;而這份清單今天是使用者自己問出來的,不是廠商給的。這對採購與資安審查是一個現成的動作:你也可以直接問它。

模型觀點

[本週](發布日 8 月 30 日)普渡大學的 GPU 模擬器對到真晶片 99%:模型跑起來會是什麼行為,不必買到那批機器也量得出來。 這套模擬器量的是模型實際跑在硬體上時的行為,不是模型本身的分數。普渡大學研究團隊發表論文,提出一套涵蓋 Nvidia Ampere、Hopper、Blackwell 三個世代的週期級模擬框架(週期級=把晶片每一個時脈週期的行為都算出來,而不是估個平均),並報告了與實體晶片的驗證結果:在 H100 上的皮爾森相關係數達 99%(皮爾森相關係數衡量兩組數字走勢貼合的程度,1 代表完全一致)(Semiconductor Engineering,08-30論文原文 arXiv 2608.22602,2026 年 8 月)。為什麼值得記: 一套對得上真晶片的公開模擬器,會影響下一代晶片評測讀數的可信度,而採購判斷正是押在這類讀數上。它同時把「下一代 GPU 該怎麼設計」從少數幾家公司的內部工具,變成學界也進得去的題目:過去要研究非同步、分散式的 GPU 架構,要嘛買得到那批機器,要嘛只能用粗略估算。⚠️ 99% 是對 H100 的驗證讀數,不代表它對其他世代或其他工作負載一樣準——論文自己列的驗證對象就是 H100。

產品動態

本期沒有這一欄。 各家 AI 公司的官方部落格,今天沒有一篇發布日落在過去 48 小時內;本報手上最新的一篇發布於 7 月 22 日,那不是今天的新聞。本報不拿既有產品的功能介紹湊一則。

過去洞見

本期沒有這一欄。 本報過去累積的深度素材,能用的舊材料已經用完(最後一則用在 7 月 30 日,今天是連續第十二期空著);寧可空著,也不重播用過的條目。

來源與盤點

過去 24 小時。 昨夜寫進本報待讀清單的新材料是 79 篇:學術論文 64 篇、播客逐字稿 8 份、公司與個人部落格 6 篇、業界電子報 1 篇。名字:那 1 篇電子報是 Exponential View #599;6 篇部落格全部是 Semiconductor Engineering 的論文摘要,晶片欄兩則與模型觀點欄那一則都出自這裡。播客那 8 份逐字稿是今年 1 月到 2 月舊集數的回填;昨夜真正新抓下來的只有 5 份(Dwarkesh Podcast 1 集、BG2 4 集)。今天真的被讀完並判斷的是 8 篇:那篇電子報、它指路過去的三份一手文件(SemiAnalysis 的拆解、Vercel 的官方指數、Thinking Machines 與 Bridgewater 的技術報告)、三則論文摘要,以及 Simon Willison 8 月 30 日那篇。那 64 篇學術論文今天一篇都還沒有人讀。沒進本期的材料,主要原因是還沒讀,不是被篩掉。

今天你拿不到什麼。 三件。一、 本報最大的追蹤管道 X(推特)今天登入不上,一則新的社群貼文都沒拉到,所以今天沒有任何一條主線是靠社群貼文撐著的。二、 付費訂閱的 Stratechery 同樣讀不到,連續第三天。三、 12 條播客頻道裡有 11 條被平台擋下而中止,真正取得逐字稿的只有 2 個節目。這兩個數字加起來大於頻道總數,本報照抓取紀錄原樣寫,不硬併成一套分法。擋下本報的是平台端的封鎖,不是本報缺登入憑證。另外,今日主線第 2 點想要的 OpenAI 官方頁面對本報回 403,那顆晶片的數字今天全部經第三方拆解取得,沒有一手頁的逐字內容。

一次性補回來的舊材料。 昨夜那 8 份播客逐字稿本期一篇都沒引用。今天沒有人工新增的來源。

來源集中度提醒。 兩個分母,兩個答案,兩個都講。以「今天是誰帶本報找到這些材料」計,集中度是 100%:今天所有新材料的檢索入口都是同一篇電子報(Exponential View #599),遠高於本報自訂的三分之一警戒線。以「今天是誰的話被本報拿來當證據」計,是三分天下:今日主線的三條事實分別承重在 SemiAnalysis 的拆解、Vercel 的官方指數、Thinking Machines 與 Bridgewater 的技術報告上,那篇電子報一條都沒當上承重來源。原因是它的作者自陳在其中兩條線上有持倉方向,而本報有能力繞過他直接讀一手頁,就繞過去了。

本報追蹤的來源。 名冊上去重後共 529 位(本報今天實數)。有六類分項今天數得準:播客 90、媒體與新聞稿 51、論文作者 48、部落格 48、電子報 46、財報法說 26。X 這一類今天數出兩個不一樣的答案:以「主要管道就是 X」計是 171 位,以「名冊上留有 X 帳號」計是 388 位。分母換了,答案就差一倍多,所以本報今天不挑一個當唯一數字(這正是今日主線第 1 點那句「先問分母」的自家版本)。同一個人可以同時出現在好幾個管道,所以分項加起來會大於 529。代表性的名字:X 有 Mark Zuckerberg、Arvind Narayanan;電子報有 Zvi Mowshowitz、Nathan Lambert;論文有 Ion Stoica、Yann LeCun;播客有 Satya Nadella、Dario Amodei。第三把尺是版尾署名的那個數字:本期正文用上 17 個來源,數的是這一篇真的引用到、而且是外部的那幾條收據(本報自家舊期與各平台首頁都不算),它與名冊上那 529 位母體不同,三本帳不能相加。

本報不是新聞摘要:從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的。重點永遠是『哪條判斷變硬了、誰說得準』,不是今天發生了什麼。