深度 深度專欄 #34 · 2026年9月17日
九月十七日凌晨,本站記下了一條還在驗證的判斷:前沿模型的成本戰,決定成本高低的關鍵變數,已經從牌價移到「每個任務要吐多少 token」,而兩家在九月第一週走了相反方向。Anthropic 的 Fable 5.1 多吐約 1.7 倍的輸出 token,換來評測機構 Artificial Analysis 綜合指數多 4 分;降價只落在快取讀取這一項,牌價不動,每個任務反而貴兩成。OpenAI 則把 GPT-6 Astra 定位成「更少 token、更少重試」。那條判斷給買方的建議是:比價單位要換成每任務成本,而且同一家的降價,對 agent 型工作與一般呼叫的效果方向可能相反。agent 型工作,指的是模型自己連續跑好幾輪、呼叫讀檔或跑程式這類工具才完成的任務。那條判斷當時自己標了暫緩的理由:OpenAI 那一側只有廠商自報。
本篇把它拆開重驗,結論分三層。
第一層,「每個任務貴兩成」是一次真實的量測,但它綁在一個一週內改版三次的評測上。 九月一日那篇評測文寫的是 3.76 美元、比前代 Fable 5 貴兩成;九月七日同一家機構換了新版指數,同一個模型每任務 7.63 美元,前代 8.75 美元,變成便宜約一成三。兩家的牌價在這一週裡一分錢都沒動。更直接的是:同一次新版量測公開的兩個數字裡,把整份評測跑完的總花費,Fable 5.1 比前代多 18%;按那家機構自己的加權方式算每任務,卻少 13%。換一個分母,正負號就翻過來。
第二層,兩家的分岔是真的,而且 OpenAI 那一側現在有獨立讀數了。 九月九日 Artificial Analysis 量到:在綜合指數同分的情況下,Astra 每個任務只吐約 2.7 萬個輸出 token,Fable 5.1 吐約 7.8 萬,Astra 的每任務成本約為 Fable 5.1 的四成。那條判斷暫緩的理由,在它寫下之前八天就已經被解除,而且方向與它一致。但它漏了分岔的另一半:OpenAI 把 Astra 的牌價訂成前代 GPT-5.6 Sol 的 2.5 倍。 同一家機構的讀數是,Astra 在綜合指數上每任務比自家前代貴約六成,在程式 agent 指數上貴約一成五。token 效率沒有變成買方手上更便宜的每任務價格,它被牌價收走了。Anthropic 走的是鏡像路線:牌價不動,token 變多,再用快取讀取降價把一部分補回去;而那刀降價只給 Fable 5.1,讓它的快取讀取價變成 Opus 5 的一半。Opus 5 是自家次一檔的型號,牌價只有 Fable 5.1 的一半;第一個公開搬家的客戶,正是從 Opus 搬上來的。
第三層,所以買方該比的不是「每任務成本」這個數字,是自己帳單上的兩行。 每任務成本不是模型的屬性,它是模型、題目組合、努力程度設定、工具環境與計費方式五件事一起決定的。努力程度是呼叫模型時可以指定的檔位:檔位越高,模型回答前想得越久,吐的 token 也越多。決定 Fable 5 升級到 5.1 是省錢還是花錢的,是你現在帳單上「快取讀取」那一行與「輸出」那一行的比例:大約低於兩成幾乎一定變貴,高於 1.2 倍幾乎一定變省,中間看你的努力程度設定讓它多吐多少。至於「同一刀降價效果方向相反」這句話,要改寫:降價本身不會讓任何人變貴;會翻正負號的是換代,而最可能翻過來的分界,是按 token 計費的 API 與訂閱方案的用量額度之間。
本篇路線分六步:
① 先對數字:「貴兩成」量的是哪一版評測,同一次量測換個分母會怎樣。
② 分岔成立:OpenAI 那一側的獨立讀數,以及 Anthropic 那一側到底多吐多少。
③ 分岔的另一半:省下來的 token,兩家各自交給了誰。
④ 那刀快取降價,第一個砍到的是誰。
⑤ 買方怎麼比:帳單上的兩行,以及跨廠比較時快取價差吃得掉多少。
⑥ 所以本站往後怎麼讀這類消息,以及什麼會推翻本篇。
這條還沒上過日報:它是凌晨才記下、還在驗證的判斷,本篇是它第一次面對讀者。本篇拆開了「每任務貴兩成」的分母,也查了「OpenAI 走少 token、替買方省錢」這個說法。若 OpenAI 在本報自設的觀察窗內,於同一把獨立尺上讓 Astra 的每任務成本低於自家前代,「token 效率被牌價收走」這個讀法就錯。
進行中 ?
上圖是本站追蹤「前沿模型的定價權留不留得住」這條線的地圖。本篇碰的是它樹梢那一層:七月那一輪,三家以「同能力、幾分之一價」圍攻 Anthropic 的溢價;到九月,OpenAI 的旗艦牌價反而一路漲到與 Anthropic 一模一樣的數字,每百萬輸入 token 10 美元、輸出 50 美元。牌價那條戰線在旗艦這一檔停了,戰事搬進了每任務吐多少 token 與快取怎麼收費。
如果你只讀到這裡:拿你自己上個月的帳單,看快取讀取那一行是輸出那一行的幾倍。這一個比例,比任何一份評測上的每任務成本都更能告訴你換代之後會變貴還是變省。
那條判斷最關鍵的一筆讀數,出自 Artificial Analysis 九月一日的 Fable 5.1 評測文。原文寫的是:Fable 5.1 在最高努力程度下每個指數任務花 3.76 美元,比 Fable 5 貴 20%,原因是多用了約 1.7 倍的輸出 token;快取讀取降價每任務省下約 1.40 美元,集中在 agent 型的評測項目,若沒有這刀降價,每任務會是約 5.16 美元。這些句子本篇逐字回到原頁核過,一字不差。Artificial Analysis 在這篇評測文裡也自己寫明,發布前曾協助 Anthropic 做評測;讀者看它對 Fable 5.1 的讀數時,應該知道這層關係。
這個讀數沒有錯。問題在它量的那把尺,接下來一週換了三次。
| 日期 | 綜合指數版本 | Fable 5.1 每任務成本 | 發生了什麼 |
|---|---|---|---|
| 9 月 1 日 | 發布當日版 | 3.76 美元,比 Fable 5 貴兩成 | 評測文發布 |
| 9 月 3 日 | v4.1.1 | 3.69 美元 | Astra 發布當天的版本,Fable 5.1 領先 Astra 5 分 |
| 9 月 4 日 | v4.2 | 6.12 美元 | 換題 |
| 9 月 7 日 | v4.3 | 7.63 美元;Fable 5 為 8.75 美元 | 程式終端機評測升到 4.0 版,銀行客服評測換成工作流程自動化評測 |
四列裡,第一列與最後一列的 Fable 5 數字都來自 Artificial Analysis 自己的頁面;中間兩列來自整理站 TokenCost 的逐版表格,以及科技媒體 TechTimes 對三次改版日期的報導。九月一日那一列該算哪一版,兩篇整理的說法不一致,本篇只寫「發布當日版」。
三件事要從這張表讀出來。
第一,每任務成本在五天內翻了一倍,而牌價沒動。 TokenCost 的原話是 Fable 5.1「五天內翻倍,從九月三日的每任務 3.69 美元到九月八日的 7.63 美元,牌價一直是 10 美元與 50 美元」。原因是新版的題目變長、變得更像 agent,每一題要吐更多 token。一個模型的「每任務成本」首先是那份題目的屬性,其次才是模型的屬性。
第二,換代是變貴還是變便宜,跟著版本翻面。 發布當日版:Fable 5.1 比 Fable 5 貴兩成。v4.3:Fable 5.1 每任務 7.63 美元,Fable 5 為 8.75 美元,便宜約一成三。同一時期,綜合分數的差距也從 4 分縮成 3 分,Astra 從落後 5 分變成同分。
第三,也是最反直覺的一件:同一次 v4.3 量測公開的兩個數字,換一個分母,正負號就翻。 Artificial Analysis 的模型頁同時公開兩個數字。一個是跑完整份指數的總花費:Fable 5.1 為 13,128.86 美元,Fable 5 為 11,160.86 美元,多 18%。另一個是每任務成本,頁面說明是「除以任務數,再按各評測在指數裡的權重加權」:7.63 對 8.75,少 13%。
為什麼兩個數字方向相反?把總花費拆開就看得到。Fable 5 的帳單裡,快取讀取佔 28%;Fable 5.1 因為快取讀取價砍到四分之一,這一行只剩 11%,輸出那一行則從 54% 升到 70%。題目數量多、每題短的評測,快取讀取少,多吐的輸出直接變成多花的錢;題目少、每題長、在指數裡權重高的 agent 型評測,快取讀取多,降價省下的超過多吐的。總花費按「每一塊錢都算一樣重」加總,被前一類拉向變貴;加權每任務成本按「每一類評測算一樣重」,被後一類拉向變省。這一段的機制是本報從公開的拆帳推出來的,Artificial Analysis 沒有公布逐項評測的每任務成本,所以無法逐項驗證;頁面也沒寫兩個模型每項評測重複跑了幾次,若次數不同,總花費就不能直接相比。 但正負號不同這件事本身,就寫在頁面上那兩個數字裡。
獨立的第三方對這件事有一句很乾淨的總結。開發工具公司 Firecrawl 九月七日自己跑了 57 次按 API 計費的測試,它的結論是:Anthropic 說的「典型工作省 25%、重度 agent 工作省到 45%」與 Artificial Analysis 說的「每任務貴」,「都量對了」:前者對大量讀快取的工作為真,後者對很少讀快取的工作為真,兩者用的是同一張價目表。
所以那條判斷的第一個關鍵數字要這樣收下:它是一次真實的量測,但它回答的是「在九月一日那份題目、最高努力程度下,跑完要多少錢」,而不是「你換過去會貴多少」。
那條判斷暫緩的理由寫得很清楚:OpenAI 那一側的「更少 token」只有自報;要是 Artificial Analysis 對 Astra 量出來的每任務 token 數方向相反,兩家分岔這一面就不成立。
那個讀數九月九日就出來了,比那條判斷寫下早八天,而且方向相同。
Artificial Analysis 的 Astra 評測文寫的是:在綜合指數 v4.3 上,Astra 最高努力程度得 53 分,與 Fable 5.1 同分;Astra「每任務用 2.7 萬個輸出 token,約為 Fable 5.1 的 7.8 萬的三分之一,分數相同」;每任務成本 3.26 美元對 7.63 美元,約四成。在另一份程式 agent 指數上,兩者也同分,Astra 的每任務成本約為 Fable 5.1 的六成,原文說是因為它是「指數裡 token 用量最低的 agent」。
第二個獨立來源是程式終端機評測 Terminal-Bench 4.0 的公開排行,由評測框架 Harbor 維護。依整理站 CodingFleet 九月十一日轉述:Astra 在 OpenAI 的 Codex 環境裡解出 58.2%,Fable 5.1 解出 57.9%,前者用了 15 億個 token、評測花費約 3,300 美元,後者 27 億個 token、約 6,200 美元,便宜約 47%。這一條本篇沒有直接讀到 Harbor 的原始頁,只讀到轉述。
對照 OpenAI 自己的說法:九月九日企業版發布稿稱,在同一份 Terminal-Bench 4.0 上,Astra 的估計每題 API 成本比 Fable 5.1 低約 63%,但沒有公開怎麼算的。Harbor 排行在這份評測上的讀數是便宜約 47%,方向與 OpenAI 自報一致,幅度比它的 63% 小一截。 Artificial Analysis 量到的便宜約 57%,用的是另一把尺,也就是綜合指數,只能佐證方向一致,不能算同一份評測的第二個讀數。
Anthropic 這一側,「多吐 token」這件事也有獨立讀數,但幅度要收窄。
所以「Anthropic 用更多 token 換分數」要收窄成:對自家前代、同一個努力程度,多吐一成到四成;1.7 倍是發布當日版評測在最高努力程度下的讀數。
最後一個方向相反的讀數要處理掉。AI 工具公司 MindStudio 九月六日寫,同一組程式測試,Astra 花了約 198 美元,Fable 5.1 約 113 美元,Astra 貴 75%。但它的 Astra 跑在 Codex 的最高檔思考模式,而據本站紀錄,OpenAI 七月為這一代新增的最高檔,官方說明就是「預設同時協調四個 agent 並行,以更高的 token 用量換更強的結果」。這不是推翻,是提醒:「更少 token」只在同一個努力程度標籤下比才有意義,而各家的標籤並不對齊。 TokenCost 也寫了同一件事:「最高」、「高」這些字眼各家定義不同。
那條判斷的畫面是:Anthropic 讓使用者多付 token,換取更強的能力,OpenAI 用更少 token 替使用者省錢。第二節確認了 token 的方向。但「替使用者省錢」需要第三個數字:牌價。
把 OpenAI 的旗艦牌價依序排出來:
這是 OpenAI 半年內第二次做同一個動作:漲牌價,同時說新模型用更少 token。
那結果呢?Artificial Analysis 在同一篇評測文裡給了答案:在綜合指數上,Astra 最高努力程度「比 GPT-5.6 Sol 貴約六成……每 token 價格較高,只被較低的 token 用量部分抵銷」;在程式 agent 指數上,每任務 7.09 美元,比 Sol 貴約一成五,分數高 7 分。
把兩家並排:
| OpenAI:Astra 對 Sol | Anthropic:Fable 5.1 對 Fable 5 | |
|---|---|---|
| 牌價 | 2.5 倍 | 不變 |
| 每任務輸出 token | 綜合指數少約 7%;程式 agent 指數約三分之一 | 同努力程度多一成到四成 |
| 快取讀取價 | 維持輸入價的一成 | 砍到輸入價的 2.5% |
| 每任務成本,對自家前代 | 綜合指數貴約六成,程式 agent 指數貴約一成五 | 發布當日版貴兩成;v4.3 便宜一成三;Anthropic 八月流量自報便宜 25% 到 45% |
表中「少約 7%」是 Artificial Analysis 模型頁公開的每任務輸出 token 數,2.72 萬對 2.93 萬。「約三分之一」則是它評測文程式 agent 段落裡,Astra 對 GPT-5.6 Sol 的文字描述,本篇沒有取得兩者的原始 token 數。這兩則讀數說的是不同的指數,在綜合指數上 Astra 對自家前代其實沒有少多少。表中的「約三分之一」也跟第二節 Astra 對 Fable 5.1 的「三分之一」是不同的一組比較。
讀這張表,兩家在「每任務成本對自家前代」這一欄都沒有給買方明顯更便宜的東西。差別在旋鈕:OpenAI 把 token 效率拿去墊高牌價;Anthropic 把 token 的膨脹用快取價吸收。 買方真正拿到的便宜,是跨廠的:在同樣的牌價下,Astra 的每任務成本是 Fable 5.1 的四到六成。那是 OpenAI 對 Anthropic 的價差,不是 OpenAI 對它自己過去的價差。本篇在 OpenAI 那一側只有牌價與評測讀數,沒有看到買方公開說明為什麼願意付 Astra 的溢價,這一半缺使用者證據。
這也回答了本站七月那條判斷。當時三家以「同能力、幾分之一價」話術圍攻 Anthropic 的溢價,OpenAI 的武器是更便宜的產品檔位。兩個月後,OpenAI 的旗艦牌價漲到與 Anthropic 的旗艦一分不差。在旗艦這一檔,牌價這把武器被收回了;攻擊沒有停,它搬到了每任務 token 數上。
那條判斷把 Anthropic 的快取降價讀成「對 agent 型工作負載的定向補貼,而不是回應對手攻擊的牌價」。前半句大致站得住,但目標要寫得更準。
先看這刀砍在哪裡。Anthropic 官方價目頁的註腳原文:「Claude Fable 5.1 與 Claude Mythos 5.1 的快取命中與刷新,計價為基本輸入價的 0.025 倍。其餘所有模型使用標準的 0.1 倍。」快取寫入的價格沒動,一樣是 5 分鐘 12.50 美元、1 小時 20 美元。
只給最貴的這一檔,意味著一件事:Fable 5.1 的快取讀取價,每百萬 0.25 美元,現在比自家下一檔 Opus 5 的 0.50 美元還便宜一半。 牌價上 Opus 5 是 Fable 5.1 的一半,快取讀取價上倒過來。
第一個公開說出後果的是 Cognition。Anthropic 發布稿裡引述它的原話:「我們在發布當天就把 Devin 裡 Opus 5 的流量搬到 Claude Fable 5.1……有了新的快取讀取定價,Fable 等級的模型終於對那些我們一直留在 Opus 上的工作變得划算,從程式碼審查開始。」它自己的部落格給了數字:在它的程式評測、中等努力程度下,Fable 5.1 每任務 2.68 美元,Opus 5 為 3.51 美元,Fable 5 為 5.84 美元。它的解釋是,在舊的快取讀取價下,Fable 5.1 一個任務的錢大部分花在重讀看過的內容,降價後同一個任務從約 5 美元掉到 2.68 美元;而 Opus 5 讀快取的價格是 Fable 新價的兩倍,「所以儘管牌價比較便宜,它反而落在 Fable 之上」。
所以本篇看得到的第一個效果,是自家產品線內部的搬家:大量讀快取的工作,從 Opus 那一檔搬上 Fable 這一檔。這不排除 Anthropic 同時也在回應 OpenAI;本篇不裁動機,只記錄看得到的第一個搬家者是誰、從哪裡搬來。Cognition 是發布當天的合作夥伴,它的數字是自報。
還有兩件事要跟著這刀一起看。
第一,快取帳單的下一行沒動。 降價之後,在 Artificial Analysis 的 Fable 5.1 帳單裡,快取寫入佔 16%,已經比快取讀取的 11% 還大。
第二,這刀只落在按 token 計費的地方。 Anthropic 發布稿的原話是「凡是按 token 計費的用量,例如我們的 API」。訂閱方案的用量額度怎麼算快取,稿子沒說。開發者部落格 paddo.dev 九月三日的標題就是這件事:「在 API 上更便宜,在 Max 方案上更吃額度」。作者自己的 Claude Code 紀錄是每一輪輸出 1,207 個 token 對 Fable 5 的 990 個,多 22%,快取讀取量差不多;在 API 上多吐的被降價吸收,在訂閱額度上沒有東西可以吸收。這一段證據目前只有使用者自報與一位作者的個人紀錄,額度計量有沒有跟著調整,他自己也寫成「還沒有答案」。 但如果它成立,那條判斷說的「同一家的降價效果方向可能相反」,最可能真的翻正負號的分界不在 agent 型工作與一般呼叫之間,而在 API 與訂閱方案之間。
第一節說每任務成本是題目的屬性;第四節說它還是計費方式的屬性。那買方到底要比什麼?
設你現在的 Fable 5 帳單上,輸出那一行是 O,快取讀取那一行是 C。換到 5.1 之後,輸出變成 O 乘上多吐的倍數 r;快取讀取的價格變成四分之一,但讀取的次數可能因為輪次變多而跟著變成 c 倍,所以那一行變成 C 乘 c 再乘四分之一。新帳單比舊帳單便宜的條件,是 C 大於 O 乘以 (r − 1),再除以 (1 − c/4)。
代數字進去:
所以粗略的判準是:快取讀取那一行不到輸出的兩成,幾乎一定變貴;超過輸出的 1.2 倍,幾乎一定變省;中間看你的努力程度設定讓它多吐多少。 這個算式忽略了快取寫入與未快取的輸入,前者會隨輪次變多而增加,所以實際門檻會再高一點。拿 Artificial Analysis v4.3 的 Fable 5 帳單驗算:快取讀取是輸出的 52%。按加權每任務的 token 倍數約 1.17 倍算,落在門檻上方,是省;按總花費的輸出倍數約 1.5 倍算,落在門檻下方,是貴。與第一節頁面上那兩個方向相反的數字,兩邊都對得上。
算式是本報自算,不是任何一方的主張。它的用處是:你不需要等任何評測,上個月的帳單就有兩個數字。
同樣的牌價下,Anthropic 的快取讀取價是 OpenAI 的四分之一。這個價差能不能抵銷 Astra 少吐的 token?
Artificial Analysis v4.3 公開了兩家跑完整份綜合指數的快取讀取花費;本報拿它除以兩家官方的快取讀取單價,也就是每百萬 0.25 美元與 1 美元,反推出讀取量:Fable 5.1 讀了約 55 億個快取 token,Astra 讀了約 11 億個,是 5.2 倍;付的錢卻只多 1.3 倍。 換句話說,四倍的快取價差,幾乎全被 Fable 5.1 多出來的讀取次數吃掉了,因為模型多跑的每一輪,都要把上下文重讀一遍。總帳單 Fable 5.1 是 Astra 的 2.47 倍;假設它付的是 Astra 的快取價,會是 3.25 倍。快取降價讓差距小了一截,但差距的主體是輸出。這組讀取量是本報推算,不是 Artificial Analysis 公布的數字;推算沒有計入長上下文的加價,如果評測裡觸發了,會高估 Astra 的讀取量。
三個跨廠讀數排在一起,差距隨題目越像 agent 而縮小:綜合指數每任務約 2.3 倍,Terminal-Bench 4.0 評測花費約 1.9 倍,程式 agent 指數約 1.7 倍。這三個讀數的工具環境不一樣,後兩者是各家自己的 agent 環境,所以本篇不把「縮小」單純歸因於快取價差;本篇只記錄方向,不寫成規律。
1. 你給的每任務 token 數,是在哪個努力程度、哪個工具環境下量的?
2. 我的工作負載裡,快取讀取與快取寫入各佔帳單幾成?
3. 如果我走訂閱方案,快取在額度裡怎麼算?
第三題目前沒有任何一家公開回答過。
那條判斷寫「目前只有 Artificial Analysis 一家第三方公開量每任務 token 數」。這句話不成立。本篇找到至少五個公開發表每任務成本或 token 用量的第三方或使用者:評測平台 Vals AI 的模型頁列出 Fable 5.1 每題 28.92 美元;Harbor 維護的 Terminal-Bench 4.0 排行有花費與 token 欄;Cognition 公開它自家程式評測的每任務成本;Firecrawl 公開 57 次測試;Databricks 七月公開過它在自家程式庫上量的「每完成一個任務的成本」基準。那條判斷自己引用的 Vals AI 讀數(那份題目由 Anthropic 提供),本身就是一個每任務成本。
站得住的收窄版是:被最多人引用的那一把尺是 Artificial Analysis,而那把尺一週內改了三次版,每一次都改變了每任務成本的數字,其中一次改變了正負號。
前沿旗艦的牌價,九月在每百萬輸入 10 美元、輸出 50 美元收斂成同一個數字,牌價這條戰線在旗艦這一檔停了;成本戰搬進每任務吐多少 token 與快取怎麼收費。兩家在 token 上確實走了相反方向,而且有兩個獨立來源;但兩家都沒有把變化變成對自家前代更便宜的每任務價格:OpenAI 把 token 效率拿去墊高牌價,Astra 對自家前代每任務貴一成五到六成;Anthropic 用快取讀取降價吸收 token 的膨脹,而那刀降價只給最貴的一檔,第一個看得到的效果是自家 Opus 流量往上搬。「每任務成本」不是模型的屬性,是題目組合、努力程度、工具環境與計費方式的屬性,被引用最多的那把尺一週內改版三次、翻過一次正負號。之後每一則「某模型每任務貴或便宜幾成」的消息,本站先問四件:哪一版評測、哪個努力程度、快取讀取佔帳單幾成、是 API 還是訂閱。
1. OpenAI 讓 Astra 的每任務成本低於自家前代。 具體是:Artificial Analysis 或 Harbor 的任一版評測上,同一個努力程度,Astra 的每任務成本低於 GPT-5.6 Sol,不論是因為降牌價、降快取價,還是 token 再減少。「token 效率被牌價收走」這個讀法當天作廢。觀察窗(本報自設)到 2026 年 12 月 31 日。
2. Anthropic 把 0.025 倍的快取讀取價擴到 Opus 5。 「這刀先砍向自家 Opus 流量」的讀法就削弱,因為留在 Opus 的工作不再需要搬家。
3. 出現一份同工具環境、同努力程度、同題集,而且公開快取讀取佔比的第三方對照,顯示 Fable 5.1 在快取讀取很少的工作上也比 Fable 5 省。 第五節「帳單兩行」的判準錯。
4. Anthropic 公告訂閱額度的計量已採用新的快取比率,或出現可重現的量測顯示 Max 方案的額度在 5.1 上消耗得比 5 慢。 第四節「API 與訂閱方案才是翻正負號的分界」那一段撤回。
5. Artificial Analysis 公開逐項評測的每任務成本,而 v4.3 上 agent 型評測並沒有比其他評測更省。 第一節對「同一批帳單換分母正負號就翻」的機制解釋錯,只剩兩個數字方向相反這件事本身。