SecondSource從一手資料重建判斷
晨報 · 2026年7月24日

美國政府第一次點名指控:中國模型 Kimi K3 是拿 Claude 當老師「偷學」出來的;制裁工具已上桌,但美方沒拿出證據

本期一眼

本期素材:2026-07-24 的研究日報;主要事件日 07-20 至 07-23,回顧素材標原發年月。昨夜到今晨處理 18 篇:播客逐字稿 12 篇(2 篇未取信號)+業界電子報 6 篇,另有 2 篇 7/22 抓取的電子報同輪處理 → 本期 32 條帶連結的收據。透明交代:今日主線 2、4 與模型觀點第 1 則主要靠 theZvi 同一份週報轉引,一手資料尚未逐一直取;主線 1 的指控原文已直接核對官方帳號一手貼文。

今日主線

1. [本週](發文 07-23)三個月前華府只說「有證據、將採取行動」,不點名;今天它變成了具名指控,而且指控內容很具體。

白宮科技政策辦公室(OSTP)主任 Michael Kratsios,美國行政部門最高層級的科技政策官員,在官方帳號發文指控:有資訊顯示中國 AI 公司月之暗面(Moonshot AI)「蒸餾」了 Anthropic 的 Claude Fable 來開發自家前沿模型 Kimi K3。蒸餾的白話是:拿對方模型的回答當教材訓練自己的模型,等於把能力抽過來;這算不算竊取智財,正是本案爭點。指控共三項:除了蒸餾本身,還包括建了一座大規模蒸餾平台,能在多種存取方式之間快速切換,藉此規避偵測,以及取得受美國出口管制的 Nvidia GB300 伺服器並「在泰國存取」算力(Kratsios 一手貼文,07-23)。財政部長 Scott Bessent 同日補上工具:「開源不代表美國的智慧財產任人予取予求」,不排除動用制裁與實體清單;實體清單是美國商務部的出口黑名單,列入後美國企業對其出口需特別許可(Bessent 引言經 theZvi 週報,07-23 轉述)。本報 7/22 期寫過這場蒸餾辯論的機制層與華府的設限風向,今天新的是兩件事:具名點名,以及制裁工具正式上桌。

驗證: 兩層要拆開。「指控發生了」是坐實的:Kratsios 貼文我們已逐字核對官方帳號原文。「指控屬實嗎」遠未定:美方沒有說明如何得知、未出示證據,月之暗面未回應;TechCrunch 同日刊出反方專家意見,認為 K3 的能力水準不是蒸餾一家前沿模型能解釋的(TechCrunch,07-23)。兩邊說法都保留。現況截至本期發稿:制裁與實體清單均為威脅性表態,未見正式行動。

判斷更新: 政策線從一般宣示升級為具名指控,是結構性的一步。若你在用或評估 Kimi K3 等中國開源模型:實體清單從威脅變成行動的那一天,API 供應鏈與合規審查都會被波及,替代軌現在就該在手上。附帶一條方向相反的判讀:政策分析者 Peter Wildeford 估計(經同一份週報轉述),K3 仍明顯落後美國最強模型約六個月;「蒸餾就能追平」的想像,與這個觀察對不上。

2. [本週](跑測發表 07-23,經轉引)四個一般人都租得到的模型同時拿下 IMO 滿分 42/42,「答對率」對前沿模型失去鑑別力。

國際數學奧林匹亞(IMO)是全球最難的高中數學競賽,長年被當成 AI 推理能力的標竿。2025 年 AI 的最好成績是 35/42,而且出自兩個未公開發布的實驗模型;今年,科技投資人 Deedy 的公開跑測顯示,四個一般人都用得到的模型全部拿到 42/42 滿分,單次成本約 10 到 50 美元(theZvi 週報,07-23)。四個模型各有特徵:Anthropic 的 Fable 5 最快且一次通過;OpenAI 的 GPT-5.6 Sol 最便宜;中國的 Kimi K3 也滿分,但多試四次、燒最多 token;新創 Axiom Math 全部以機器可驗證的形式化證明完成。本報 7/20 期報過 Axiom 自稱滿分後多日無獨立確認;這次跑測與其自報一致,但跑測本身也還是單一來源轉引。同週,評測機構 METR 是一家以量測 AI 能自主完成多長人類任務聞名的獨立研究機構,本週推出新量尺「支出視界」:AI 在單一任務上花再多錢,表現也會趨於上限,而人類投入足夠成本終會反超,所以改量「AI 要花多少錢才追平人類完成同一任務」。它的示範任務是公開的 NanoGPT 訓練優化研發題;在這個任務上,最好的模型約花 2 到 3 千美元追平人類(同見上引週報)。

驗證: 本條全部數字都經 theZvi 週報單一轉引,Deedy 的解題紀錄與 METR 的原始發布,我們尚未直接核對,先當方向看。METR 自己也標了兩個保留:示範任務是公開題目,模型可能對它過度練習;它同時呼籲各廠商公布「多花錢能多好」的完整成本曲線。

判斷更新: 我們記下一條新判斷(本報自家合成,不是任何外部專家的原話):前沿能力的比較軸線,正從「答對率」遷移到「達到等效人類成果的成本」。證據還薄,兩個支撐事實都是單一來源轉引,先按低信心記錄。它若成立,下一輪模型競爭的賣點會是成本效率曲線,不是峰值分數;替公司採購模型的人,盡調問法可以從今天換:滿分是入場券,要求供應商交「達到目標品質的每任務成本」。

3. [本週](發表 07-23)token 每降價 10%,用量多 11% 到 18%——需求的價格彈性 -1.11,殺價殺不垮賣 token 的生意。

本報 7/21 期用一整期問過「中國模型真的便宜嗎」;本週開源圈最熱的問題是它的續集:Kimi K3 的激進定價,會不會打垮賣 token 的生意。科技分析電子報 Exponential View 給出量化答案:不會。它自家的產業報告測出每降價 10%、token 消耗上升 12% 到 18%;美國國家經濟研究局(NBER)的一份工作論文獨立估出降價 10% 用量增約 11%,即經濟學說的彈性 -1.11:價格每降 1%,用量升 1.11%。不過 -1.11 精算下接近打平(彈性略高於 1 的臨界),單獨只能論證「不是崩潰式下降」;真正撐得住「總支出反而上升」的,是 EV 那組每降價 10%、用量增 12-18% 的數字(Exponential View,07-23)。兩組數字口徑不同,一個出自產業報告、一個是學術計量,不能平均成一個數,但方向一致:降價放量。同一篇文章補上供給端的帳:開源權重免費不等於部署免費。自架 K3 這種 2.8 兆參數、光權重就佔 1.4 TB 的模型,需要一台 GB200 NVL72 等級的 72 GPU 機架,買斷約 300 到 400 萬美元、公開市場租一年約 700 萬美元,還未計網路、儲存、散熱與人力。

驗證: 這兩個彈性數字(EV 的 12-18% 與 NBER 的 -1.11)都經同一篇 Exponential View 文章轉述:12-18% 是它自家報告的數字,有自報成分;NBER 論文我們尚未取原文核對。自架成本是作者的工程推估,2.8 兆參數的規格與彭博先前的轉述一致,其餘硬體與電力數字未見第二源。

判斷更新: 對賣推理算力的雲端業者,-1.11 是今天最該記的數字:單價下跌會被用量成長吃回來,定價目標是單位成本下降速度對用量成長速度的賽跑,不是守住單價。對平台選型的人:「開源沒有授權費」不等於「開源沒有成本」,自架的真實帳該進試算表。這條與文末的深度報告合看:上游在為算力發債續命,下游 token 單價跳水但總用量在漲;中間那條「用量變成付費」的轉換帶守不守得住,深報的三個裁決訊號——高價層淨留存能否守住 85%、自由現金流觸零後債市開出的條件、以及 coding 以外能否長出第二條營收曲線——會給答案。

4. [本週](生效 07-20)Anthropic 把最強模型改為訂閱方案常駐,並罕見明說原因:需求難預測、容量要邊擴邊放。

Anthropic 官方宣布 Claude Fable 5 自 7/20 起常駐 Max 與 Team Premium 方案,計費上以半價使用量認列,也就是用 Fable 時,一次操作要扣兩倍額度;Pro 方案續以用量點數存取並獲一次性 100 美元點數;Claude Code 每週限額加五成,延續到 8/19。官方說法直白:Fable 的需求很難預測,所以分階段開放、一邊擴容一邊延長。工程師 Thariq 自述,常駐是「日夜連軸」撐起來的(官方貼文經 theZvi 週報,07-23 轉述)。

驗證: 公司對自家產品的官方宣告,可信度高;但我們是經週報轉述看到,尚未取得官方原始公告的直接連結。

判斷更新: 與今日主線第 1 點合看,同一個模型今天出現在兩條新聞裡:一邊是需求超過供給的容量瓶頸,一邊是被指控的蒸餾標的。據同一份週報轉述,Anthropic 為了反蒸餾正在收緊模型思考過程的對外揭露,部分任務的可用性因此實質下降。防偷與擴容的代價,都落在同一群付費開發者身上;這個取捨,Anthropic 得拿出清楚的產品對策,否則指控事件最大的受害者會是自家客戶體驗。在用 Claude 的企業客戶可盯兩個訊號:Claude Code 週限額是否再度收緊、對外思考過程揭露被反蒸餾收緊後是否回復——這兩者反映防偷與擴容的取捨最終落到客戶體驗的程度。(本報判斷)Claude 若因反蒸餾與限額而可用性緊縮,正在比較 agent 產品的企業,替代方向主要落在 OpenAI 的 ChatGPT/Codex 一側。

5. [本週](評測發表 07-23,經彙整轉述)一位 Reddit 本地模型玩家把 Poolside 的開源新模型 Laguna S 拉進自己的題庫實測:速度與工具呼叫都好,壓力之下三度捏造事實。

AI 編碼公司 Poolside 上週發布小型開源模型 Laguna S 2.1,本報 7/23 期記過它的官方自述;今天新的是第一筆非廠商評測。一位 Reddit 本地模型社群的用戶用自己的題庫實測:速度小勝同級的 Qwen(每秒 109 對 103 個 token)、工具呼叫是同場最佳;但在刻意施壓的測試下三度捏造事實,同場的 Qwen 零次。評測者的歸因很傳神:它「數學想太多、事實想太少」;修正設定後 125 次重測,仍留一次捏造(AINews,07-23)。社群總評:對本地部署很有吸引力,但官方跑分「好到可疑」。

驗證: 單一用戶的私有題庫評測,經 AINews 彙整轉述,標準第三方評測機構尚未複現;「三次對零次」樣本很小,先當訊號、不當定論。

判斷更新: 開源模型的驗收正在分化出一個獨立軸:尺寸與速度之外,「壓力下的行為品質」要單獨驗。這也是對 Poolside 自家說法的第一筆反制:其創辦人主張自家模型的能力來自訓練後的行為塑造,社群首測發現的恰恰是行為面缺陷。給企業評測與採購的人:把壓力情境下的捏造率當成獨立驗收項,不能只看速度與工具呼叫成功率。

也發生了

過去洞見

一條命題最強的佐證,同時是它的天花板:「能力=算力預算的函數」的邊界(本報深度研究,2026-07-07)。 本報 7 月初整理過一條核心命題:現代模型配上恰當的執行環境,能力不再是固定屬性,而是「你願意投多少推理算力」的函數。當時最特別的不是佐證多,而是同一批 40 多篇論文既確認了命題、又劃出了邊界。確認側:能力確實隨思考預算上升,且跨領域可重現。設界側有兩份代表作:普林斯頓大學團隊的 HAL 評測跑了 21,730 次 agent 測試,發現提高「思考力度」在多數情況下反而降低準確率(arXiv,2025-10);VisualPuzzles 基準刻意把推理與領域知識拆開量,發現「思考模式」的增益跨模型、跨任務並不一致,甚至有負增益(arXiv,2025-04)。機制一句話:多思考不保證更好,紅利集中在答案可驗證的領域(數學、程式),其他領域燒 token 可能白燒。怎麼用:與今日主線第 2 點合看,METR 量的「成本交叉點」正是這條命題走進採購語言的下一步;但這條邊界提醒你,先問你的任務屬於哪個領域,再決定要不要為「多思考」付錢。

來源與盤點

過去 24 小時。 昨夜到今晨的週期素材 18 篇:業界電子報 6 篇讀完(theZvi 週報Exponential ViewAINews 兩篇另一篇)、NewcomerOne Useful Thing)+播客逐字稿 12 篇處理(2 篇未取信號;取用者含 Latent Space Poolside 訪談)。另 2 篇 7/22 抓取的電子報同輪處理,其中 1 篇為純活動公告、未取信號。X 貼文本批直接核對 1 則:Kratsios 官方指控原文(一手貼文);獨立媒體交叉 1 篇(TechCrunch)。白天另結兩案定向查證,新增 Nvidia 官方財報新聞稿與法說逐字稿共三個一手來源(結果見「也發生了」最後兩條)。今日無新增追蹤來源、無一次性回填。覆蓋聲明:本期只能保證上述掃描範圍內的訊號;產品公司官方部落格本批抓到 17 篇,多數僅存標題或正文不全,未取信號;X 未跑全網掃描。

來源集中度提醒。 今日主線 2、4 與模型觀點第 1 則主要依賴 theZvi 同一份週報轉引,佔本期取材素材近一半;其中主線 2 的兩個支撐事實一手均未直取。唯一例外是主線 1 的指控:已直接核對官方一手貼文,並有 TechCrunch 獨立反方。「一份週報斷供就傷兩條主線」的結構風險,讀者應該知道。

庫存(非過去 24 小時)。 本報的累積待讀庫存(7 月起分批回填,最近快照):學術論文 2,825、公司與個人部落格 2,299、X 貼文 1,381、業界電子報 974、公司申報 924、業界分析 533、播客逐字稿 288。今日主線之外的長尾,從這裡按主題定向取用。

我們追蹤的來源。 本報判斷的底層,目前追蹤 529 個具名的聲音:X 305 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Jensen Huang 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。


本期其他分類

這一期的其他欄目各自成篇:

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新