SecondSource 深度版 · 2026/7/20|深度專欄 #10 — 賣 token 終於賺錢了,然後呢:模型商的毛利保衛戰
故事要從一個大逆轉說起:2023 到 2025 年,AI 的錢幾乎都被賣晶片、賣電、賣記憶體的人賺走,模型商自己賣 token 是賠錢生意:Anthropic 2024 年的推理毛利是負 94%。2026 上半年這件事翻了過來,Anthropic 官方宣布年化營收跨過 470
深度專欄 #10 — 賣 token 終於賺錢了,然後呢:模型商的毛利保衛戰
本篇重點
故事要從一個大逆轉說起:2023 到 2025 年,AI 的錢幾乎都被賣晶片、賣電、賣記憶體的人賺走,模型商自己賣 token 是賠錢生意:Anthropic 2024 年的推理毛利是負 94%。2026 上半年這件事翻了過來,Anthropic 官方宣布年化營收跨過 470 億美元,並向投資人給出史上第一個獲利季的指引。於是一場新辯論開打,而且三邊都是一線人物:一方主張短缺加品質差距給了模型商「按價值收費」的定價權,低毛利時代結束了;另一方反過來認為賣 token 天生是大宗商品生意,高毛利遲早被競爭掉;還有人乾脆質疑數字本身——現在的需求訊號就摻了水。本篇把三條路線的證據第一次攤開放上同一張桌子。我們的判斷:翻正是事實,但「留得住」眼下只在旗艦檔成立,而且決定勝負的不是護城河,是兩個時鐘的賽跑:商品化沿著價格階梯往上爬的速度,對上模型商把客戶鎖進工作流的速度。
這場辯論在我們地圖上的位置:

先把帳算清楚:「毛利翻正」其實是三本帳
這場辯論最大的陷阱是「毛利」二字。市面上流傳的 Anthropic 毛利數字,從 40% 到 70% 都有,它們其實是三本不同的帳,年份與口徑各不相同。
第一本帳講 2025 年、算全部成本。The Information 報導,Anthropic 曾把 2025 全年毛利預測從 50% 下修到約 40%,原因是雲端上的推理成本比預期高出約 23%(The Information)。第二本帳只算推理服務。SemiAnalysis 的說法是,推理毛利從 2025 年的 38% 升到 2026 年的 60% 到 70% 一帶(SemiAnalysis)。第三本帳是給投資人看的成本比:每一美元營收花在算力上的錢,從第一季的 0.71 降到第二季預估的 0.56,這 15 美分的算力成本改善,與該季從接近打平轉為 5.59 億美元營運獲利同期出現(本報未取得該季營收基數,無法逐項乘算歸因,故不宜斷言它是唯一那根槓桿)(CNBC)。
三本帳的時序要記住:下修發生在前、講的是 2025 年;改善數字在後、講的是 2026 年。拿 40% 去打 65%,或反過來,都是口徑錯配。更要緊的是,三本帳沒有一本經過審計:收入端有官方稿背書(Anthropic),毛利端全是內部資料與分析師模型,獲利季到今天仍是指引不是事實。Anthropic 已在準備上市,招股文件會是這場口徑之爭的終審法院。
所以本篇說「翻正」,精確含義是:收入翻正有官方口徑;毛利翻正是內部與分析師兩邊口徑一致、但未經審計的改善趨勢。這是後面一切判斷的地基。
主張留得住的路線:短缺加品質差距,就能按價值收費
它是什麼。 這條路線的機制鏈:agentic 工作流讓每個 token 完成的活變值錢了,一次跑數小時的代理任務,實付混合成本大約每百萬 token 一美元,換來的是數十倍人力時薪的產出;同時軟體優化與新一代晶片讓 token 生產成本大跌。需求價值升、供給成本崩,中間的差就是毛利。而這個毛利不會被殺價競爭吃掉,因為算力短缺讓沒有任何一家能服務整個市場,品質差距讓開源接不住最難的活:有 frontier 品質的模型商可以按交付的價值定價,不必互相殺價。
誰押它。 SemiAnalysis 的 Dylan Patel,他五月的原話是「frontier 模型商的低毛利時代結束了」,並判斷 agentic 已永久抬高了市場出清的 token 價格(SemiAnalysis)。結構面的補強來自兩處:一份七月的學術情境分析主張,先發者攤提完的舊機隊像輸送帶一樣不斷送來近零成本產能,後進者的成本差 3.2 倍起跳、永不收斂(arXiv);而 NVIDIA 與台積電這兩個上游瓶頸壟斷者刻意不趁短缺提滿價,等於把定價空間讓給了下游。
證據硬度。 收入端是官方級:470 億年化、半年五倍。付費意願是行為級:Uber 五千名工程師把全年 AI 預算四個月燒完,重度使用者一人一個月燒 500 到 2,000 美元(Fortune);Sierra 共同創辦人的觀察是,第一線頂尖工程師如今一年燒在 token 上的錢已達十萬美元(原話未點明這是 Sierra 內部團隊還是其客戶的用量,此處僅按字面轉述)。價格現值也站在這邊:到 7 月 20 日為止,旗艦檔沒有任何一家降價——GPT-5.6 旗艦(Sol 檔)與 Claude Opus 並價在每百萬 token 5 美元,不過 GPT-5.6 的這個 5 美元目前僅是內測分層價、尚未官宣全市場;更高階的檔位反而上移——代號 Mythos 的高階檔開出約前代旗艦五倍的定價,但這同樣是分層/內測層的價、非全市場官宣,五倍的幅度也還待官宣核實;Glean 創辦人 Jain 的觀察更直接,「過去 6 到 9 個月,每一家模型商實際上都調漲了 per-token 價格」(20VC),此為單源說法,但可以用公開價目表核實。開源的便宜也要打折:Snowflake 用同一套系統跑同一批資料工程任務,開源模型燒了 2 倍的 token(X/Ramaswamy),標價差 8 倍,帳單差只剩 4 倍左右。
它的弱點。 毛利數字是自己的帳,前一節講過。獲利季還是指引。而且這是 Anthropic 一家的故事:第三方估算 OpenAI 的毛利反而從 40% 降到 33% 一帶——但這是 OpenAI(以消費訂閱為主)的全成本口徑估算(信心低),與 Anthropic(以 API 為主)的業務結構本身不可比,並非同一本帳的對照;即便如此,把單家翻正說成「時代結束」,仍是把一家公司的現象當成整個梯隊的事實。短缺這根支柱也有時鐘:今年承諾交付的算力只有三分之一在建,缺口約 7GW,根因是變壓器等設備三到五年的交期,這代表短缺是「執行延遲」而不是永久結構,2027 到 2028 年供應鏈瓶頸有明確的緩解時程(SemiAnalysis)。
什麼會推翻它。 旗艦檔出現實際降價。WSJ 六月報導 OpenAI 內部考慮「大幅」降價備戰搶客,到 7 月 20 日仍未落地;更近的檢核點是 Anthropic 官方預告的回價日:Sonnet 5 上市促銷價每百萬 token 2/10 美元,8 月 31 日之後若不回到標準價 3/15 美元,促銷就變成了事實降價。再往後,上市文件揭露的審計毛利若遠低於內部口徑,整個翻正敘事要重審。
主張留不住的路線:賣 token 是教科書級的大宗商品生意
它是什麼。 經濟學有個老結果:兩家公司賣無差異的商品,就算只有兩家,均衡價格也會被壓到成本附近,誰先漲價誰失去全部客戶。這條路線主張,賣 token 是這個結果「異常純粹」的現實版,五個條件全齊:模型高度無差異、開源模型已經夠好、幾百個 benchmark 讓等價性對客戶透明可見、各家資本成本相近、切換只要在路由器上改一行設定(Normal Tech)。歷史基準率也站在這邊:六個資本密集的基建行業,光纖七年容量暴增後蒸發了兩兆美元市值,航空業八十年淨利率 2% 到 4%,只有雲端與台積電逃脫。還有一道算術:4 到 8 兆美元的基建投資,按 5% 淨利率五年回收,需要 16 到 32 兆美元年營收,高標等於今天世界 GDP 的四分之一。
誰押它。 這是人數最多的一邊。AI Snake Oil 的 Narayanan 給出上面的系統性論證;Benedict Evans 七月九日的專文說,推理毛利 40% 到 50% 還沒算訓練成本,而且「類比沒有預測力」,要有一件現在看不見的事發生,定價權才有可能出現(Benedict Evans);Databricks 的 Ghodsi 主張模型層終局是台積電式的「有價值但可互換」(BG2);政策研究者 Dean Ball 指出前沿溢價只活在發布後數月的窄窗裡,競爭、蒸餾與開源會把它壓回去(Hyperdimensional);Dwarkesh 部落格徵文獎得主 Michael Li 的版本最狠:API 是永遠虧本的鐵路,能賺錢的是鐵路帶起來的地產(Dwarkesh blog prize)。
證據硬度。 歷史斜率是它最硬的牌:據商品化陣營引用的公開估算(本報未逐條獨立核對其鏈結),GPT-4 發布以來同級能力的價格約跌九成、2024 年智能單價一年降超過九成、GPT-4 級能力約 15 個月就被開源追平。開源差距的現值:在 Artificial Analysis 智能指數上,Kimi 對 Opus 的差距縮到 9 分的歷史低點;GLM 5.2 在同一個月被企業部署、評論者實測、推理商獨立複現三種彼此獨立的證據指向「跨過前沿門檻」。價格戰確實已經開打:Google 把消費端 AI 訂閱從 7.99 美元降到 4.99 美元,科技媒體直接稱之為訂閱價格戰的鳴槍(TechCrunch);OpenAI 七月開出每百萬 token 1/6 美元的新低價檔;Anthropic 在中檔打限時促銷。
它的弱點。 這條路線 2025 年就預言毛利起不來,但 2026 上半年 Anthropic 的推理經濟照樣翻正:至少在短缺與品質差距還在的窗口裡,它輸了一局。它最強的理論版本還自帶逃生門:Narayanan 自己承認,歷史上逃脫商品陷阱的兩條路是「變成軟體生意」與「壟斷級集中」,而模型商正在全力走第一條,Claude Code、企業多年約、嵌進整間公司工作流的數位員工;他的原話是,除非可攜性被刻意內建,這種數位員工「實質上無法開除」,鎖定力超過史上最黏的企業軟體。換句話說,連看空這一方最好的理論都同意:勝負不由 token 價格決定,由鎖定形成的速度決定。
什麼會推翻它。 旗艦檔定價連續守住或上移,同時鎖定指標持續變厚:多年約、committed spend、產品層營收占比。這是本報自設的觀察窗,12 個月,已掛回檢清單。另外,若同系統對照持續顯示開源在最難的活上品質與 token 效率雙落後,「夠好」這個前提就得收窄。
主張數字摻水的路線:需求訊號沒有看起來那麼硬
它是什麼。 這條路線不糾結於定價權之爭,而是質疑輸入數字本身。機制有二。其一是補貼定價:Bill Gurley 的版本,模型公司全部按搶份額定價、不按成本定價,所以「供不應求」的訊號含補貼成分,資本窗口一關、被迫重新定價,需求曲線會出現空洞(BG2)。其二是 ROI 未清算:Chamath 轉述他公司 CTO 的內部實測,token 總支出(用量×單價)每 45 天翻倍,下游生產力最多加 5%,「我們實質上已經到頂了」(All-In);買方遲早要被 CFO 問一句:你的 EPS 到底多了多少?
誰押它。 Gurley 之外,還有投資人 Gavin Baker 的成本結構版:Google 靠自研晶片是最低成本的 token 生產者,可以理性地用負 30% 毛利跑 AI,用搜尋的現金流補貼,刻意抽乾整個生態的經濟氧氣。
證據硬度。 吃到飽方案確實死了:ChatGPT 改成 100 與 200 美元兩檔並設用量上限,OpenAI 高管公開說定價「不可能不大幅演化」。MIT 2026 年的一份調查說,95% 的企業 AI 試點看不到損益表影響(此處為二手轉述、單源)。Uber 案例的另一面在這裡:燒完預算之後,COO 公開質疑這筆錢值不值(Fortune);Coinbase 的董事會也開始對 token 支出表態反對、踩煞車。ROI 質詢已經上桌,這不是預言,是現在進行式。
它的弱點。 「補貼」有替代解釋:Sourcegraph CEO 的反駁是(此為單源、待核)——低邊際成本加高折舊本來就長這樣,問「補貼何時結束」像問「航空公司何時停飛經濟艙」。定價現值也跟補貼論的預測相反:補貼論預期價格一路向下,但過去 6 到 9 個月 per-token 牌價在漲不在跌。最關鍵的是傳導斷點:質疑歸質疑,錢還在燒,ROI 質詢至今沒有反映到任何一家 lab 的收入曲線上。
什麼會推翻它。 資本窗口收緊後需求沒有出現空洞。兩家模型商的上市就是天然實驗:上市後補貼動機消失大半,若大買方的續約與擴大採購照樣成長,摻水論就得降級。
把三條路線放上同一張桌:毛利是一場兩個時鐘的賽跑
一個產業留不留得住利潤,教科書的答案是看幾股壓力:同行殺價、買方議價、替代品進逼。把 7 月 20 日的現值疊上去,三條路線其實各對了一段,而且可以收攏在同一道價格階梯上。
階梯的下段已經開戰。 Google 消費端降價 37.5%、OpenAI 開出 1/6 美元低價檔、Meta 在追趕層打 API 價格戰、Anthropic 中檔限時促銷。商品化不是「會不會來」的問題,它已經在階梯下段燒起來了。這一段,商品化路線全對。
階梯的頂端還在漲價。 旗艦檔兩家並價未降、更高階的檔位上移、全體 per-token 牌價過去半年向上。頂端撐得住,靠的是三根支柱同時成立:短缺讓對手就算想搶量也沒有量可搶,殺價換不到東西;品質差距讓最難的活只有 frontier 接得住,替代品進不來;買方的 ROI 質詢還沒真正卡住預算,議價力尚未成形。這一段,定價權路線全對。
但三根支柱都已經在動。 短缺已經有了時程表——變壓器三到五年的交期把緩解點推到 2027 至 2028;同一時間,品質差距縮到歷史低點、開源在部分軸上追平,而 ROI 質詢也已經上桌,只是還沒傳導到收入。所以正確的問題不是「商品化會不會發生」,而是「商品化爬完階梯的速度,快不快得過模型商把客戶鎖進工作流的速度」。這個判準不是我們發明的,是商品化路線自己的理論給的:Bertrand 陷阱的歷史逃脫者只有兩種,變成軟體生意,或壟斷級集中。模型商顯然知道,Claude Code、多年期的承諾支出(committed spend)、嵌進整間公司的數位員工,全是逃生工程。毛利的持久性不住在 token 定價裡,住在逃生工程完工速度與三根支柱倒塌速度的相對快慢裡。
方向判斷
「frontier 高毛利不會被競爭掉」的正確讀法是分層的:單 token 經濟翻正是事實,收入端有官方口徑,毛利端是內部與分析師一致但未經審計的改善;高毛利眼下只活在旗艦 agentic 檔,由短缺、品質差距、ROI 未清算三根支柱撐著,三根都已在動、三根都未倒。未來 12 個月的裁決變數,此為本報自設的觀察窗、已掛回檢:一看旗艦檔是否出現實際降價,最近的檢核點是 8 月 31 日 Sonnet 5 促銷價回不回標準價,依 Anthropic 官方預告;二看算力兌現缺口與預約租金走勢;三看同系統對照上,開源在高難度任務的品質與 token 效率是否雙追平;四看 Anthropic 上市文件的審計毛利落在哪一本帳;五看 token 需求年增是否守住 2 倍——這是 Matsuoka(該情境模型的提出者)所說「償付走廊」給的門檻:token 需求年增若跌破約 2 倍,現有算力投資的償付/獲利模型就撐不住。
這對誰意味著什麼
- 做 AI 配置的投資人:「模型商終於賺錢了」和「賣 token 註定商品化」都只對一半。可操作的版本是把 lab 的營收拆成兩層估:API 層按大宗商品邏輯折現,產品與鎖定層,像 Claude Code、企業長約、數位員工,按軟體邏輯折現。招股書出來,先翻毛利口徑那一頁,再看產品層營收占比。
- 企業買方的財務長:你的議價力正在階梯下段快速變大,低價檔在互殺,能路由下去的活盡量路由下去;但最難的活短期還得付頂端溢價。Uber 的教訓不是『別用』,而是 token 計量制碰上內部用量排行榜文化,會讓帳單自己長大:把「能路由下去的活盡量路由下去」的成本紀律立起來,別讓文化替你定價(其中路由架構與模型選型的拍板,屬下一則產品經理畫像)。
- 做 AI 產品的人(產品經理):你拍板的是路由架構與模型選型——給 agentic 用量建立儀表板(dashboard)、按難度把工作分層路由到對應檔位的模型,並盯自家產品定價要不要跟著旗艦檔一起漲。這些是產品決策,不在財務長的日常裡。
- 雲廠與算力供應鏈:頂端毛利的第一根支柱是短缺,而短缺的根因在變壓器與電力等交付瓶頸。你手裡的兌現速度就是模型商毛利的碼表:交付愈快,商品化爬梯愈快,這是同一件事的兩面。
- 模型商策略觀察者:盯兩個數就夠。一是旗艦牌價,它量的是三根支柱倒了沒;二是 committed spend 與產品層營收占比,它量的是逃生工程完工了沒。其他數字都是這兩個數的注腳。
結尾再看一次這張樹。本篇更新的是分岔的讀法:三條路線從「三選一」改成「同一道價格階梯上的三段事實」,並掛上五個可查的裁決變數與兩個短窗檢核點。

繁 中文版|EN English edition →