晨報 SecondSource 晨報 · 2026/8/26 · 2026年8月26日
1. 同一個模型換一套評測設定,分數 91→99:模型驗收要搬回自家環境跑。
2. 「AI 把 AI 研發加速了幾倍」出現公開對峙——本報判讀:兩邊爭的是分母,不是能力。
3. 等了兩個月的企業 AI 支出「第二個數據源」到了,數字相似到本報判定它和第一份很可能同源;中位數 12 美元沒動。
本期材料來自本報 8 月 26 日的日報;主體是 8 月 15-16 日的事件、本報今天才逐則判讀完(各條句首標原發日期),另有五則 8 月 24-25 日的新事件與兩次今日查證。昨夜例行掃進 795 篇 → 本期用上 22 條帶連結的外部收據。
1. [證據更新](事件日 8 月 14-15 日,本報今日判讀)本報 8 月 11 日提過「同一個模型、三家量出三個分數」;今天這條把原因找到了:開局第一輪看到什麼,就決定整條執行軌跡
先講結果:受測的是中國開源模型商 DeepSeek 的旗艦模型 V4 Pro,題目是同一道凍結的工程題。最低設定四次取樣拿 91、96、91、93,平均約 92.75 分;最高設定拿 98、99 分。同一道題,GPT-5.6 Sol 拿 99、98 分,Claude Fable 5 拿 98 分,Claude Opus 5 拿 97 分——DeepSeek 這次落在前沿閉源模型的同一個分數帶,全距 8 分(分數矩陣彙整,08-14)。實驗本體是 GitHub 使用者 xiaobright 的兩個公開程式庫,任何人可重跑;經中文 AI 社群彙整者 @zrainbo 整理成分數矩陣,再由長期追蹤 DeepSeek 的觀察者 @teortaxesTex 轉發並補做實驗。變因只有一個:harness——模型跑代理任務時的評測外殼,包含開場指令(system prompt)與工具清單。代理任務就是模型自己呼叫工具、多輪執行的任務。
機制比「工具越少越好」深一層:第一輪請求看到的開場指令與工具清單,決定整條執行軌跡——開局開對之後,把 25 項工具全部裝回來,分數不掉。當時社群最流行的另一種解釋是「DeepSeek 偷偷把請求轉發給 Claude 或 GPT 刷分」,被一個乾淨的單變數實驗排除:換到第三方 NovitaAI 託管的同一份模型權重、封鎖官方端點後現象不變,所以是模型本身的性質,不是端點作弊(排除實驗,08-15)。同系較小的 Flash 模型也有同樣性質(同現象,08-15),即這是模型家族層級的現象。DeepSeek 官方的模型說明文件腳註自承官方測試用的就是極簡設定——此點經同一條彙整鏈轉述,本報未直查該文件。
驗證: 分數矩陣是三層轉述(程式庫→中文彙整→轉發),本報未直跑那兩個公開程式庫;「首輪軌跡鎖定」這個機制解釋是實驗者自己的,沒有第三方複驗過。利害要計入:@teortaxesTex 長期公開看多中國開源模型,「分數被低估」方向的主張要按此打折。 撐住這條的是:兩個具名可查的程式庫加官方文件自承,可獨立複驗的路徑明確;排除實驗設計乾淨;與本報 8 月 11 日那期記過的「同一模型、同一基準、三家量出 82.7、79、67 三個分數」跨基準同向——當時只有現象,今天多了機制指認與排除實驗。
判斷更新: 採購或評測模型,驗收必須在自家環境、用自家的工具配置跑;只報模型名、不報評測設定的分數,量的是「引出方式」,不是能力。同一位觀察者由此推出更大的命題「現行評測系統性低估中國模型」——單一來源的推測(未定案),證據只來自 DeepSeek 一家、且與他的長期立場同向,本報記下但不採信。
這對投資判斷的意思: 市場敘事拿排行榜名次當模型能力的代理指標。這條證據說,若 8 分的變異可以來自評測設定,不揭露設定的名次差距就在誤差範圍內——對「排行榜可以直接指導選型」是弱化,對第三方標準化評測服務的價值是強化。
2. [證據更新](數據日 8 月 14-16 日;對照數據 6 月 15 日)本報 7 月 13 日那期寫過企業 AI 支出的極端傾斜;等了兩個月的「第二個數據源」今天到了。結論是,它很可能不是第二源
新數字先攤開:企業支出管理平台 Ramp 能直接看到客戶花在 AI 訂閱與 API 上的流水,樣本是它自己的客戶群、偏中小與科技企業。它的數據經創投 a16z 合夥人 Olivia Moore 轉述:企業 AI 支出中位數 12 美元/員工/月,最高的 1% 公司 7,500 美元/員工/月(原貼,08-14);企業雲端服務商 Box 執行長 Aaron Levie 轉發補充:前 10% 約 660 美元,並自承樣本偏工程密集企業(補充與預測,08-16)。
本報 7 月 13 日那期寫過一條幾乎相同的分佈——最頂尖 1% 每員工每月約 7,450 美元、典型公司 11.38 美元,轉述自數據帳號 econlab(經 Exponential View,06-15),當時本報只把它當單一轉述來源記下,可信度壓低,並記著要等第二個來源佐證。今天這條就是等的那個「第二源」,但 7,500 對 7,450 幾乎重合,12 對 11.38 差距略大一些、仍在同一量級。吻合到這個程度,正確的反應不是「驗證成功」,而是懷疑同源:對「企業 AI 支出中位數」這種母體、口徑、時窗都會動數字的量,真正獨立的兩次量測不該吻合到這個地步。本報判定六月那條的底層資料很可能本來就是 Ramp:這不是獨立驗證,是同一份資料的兩條轉述鏈,兩條的可信度都維持原級、不上調。撐住同源懷疑的主要是頭部那一組數字,中位數那組只是佐證。
驗證: 兩條鏈都是二手以上轉述(660 美元那個數字只見於 Levie 的文字,是三手);兩份數據口徑是否相同、獨立性如何,最終要查 econlab 的原始資料出處,本報已排入查證。真實的新增量有二:前 10% 這個中間層數據點——與前 1% 差 11 倍、與中位數差 55 倍,傾斜是全分佈性的,不是頭部幾家異常;以及兩個月過去、分佈形狀沒變——擴散到中位企業還沒發生。Levie 的看多預測「前 10% 今天的行為=3 年後前 50%,至少 token 量的口徑上」記為當事人觀點,他賣的就是企業軟體,利害同向。
判斷更新: 這是本報第二次在「等第二個來源」時等到假二源——上一次是兩家媒體轉述同一位知情人士。教訓同一句:數獨立來源,要數到資料的出生地,不是數轉述的嘴。 引用「企業 AI 支出爆炸」敘事時,拿 12 美元這個中位數提醒自己保持懷疑。
這對投資判斷的意思: 敘事假設企業 AI 滲透正在全面加速。這條證據對「頭部支出在爆發」是持平,對「擴散到一般企業」是弱化——分母仍然單薄:連續兩個數據點、隔兩個月都沒有變。Levie 那句三年預測是可對帳的看多押注,本報已記下,到期對答案。
3. [證據更新](事件日 8 月 15 日)「AI 把 AI 研發加速了幾倍」第一次出現公開對峙:官方口徑說不到 2 倍,觀察者說超過 2 倍已經六個月。本報判讀:兩邊爭的是分母
一邊是 Anthropic 的官方說法「AI 協助讓 AI 研發加速不到 2 倍」——本報只看到轉述的轉述,原始文件不在手上(轉述貼,08-15);另一邊是 DeepSeek 觀察者 @teortaxesTex:「商用模型超過 2 倍已經六個月」,並指控對方刻意選了讓自己不越線的算法——因為「加速超過 2 倍」正是實驗室自我約束政策裡的紅線指標之一(原貼,08-15)。
本報的判讀:兩邊沒有在爭能力,在爭分母。 「加速幾倍」需要基準線——比較對象是「完全不用 AI 的工程師」,還是「已經用著上一代 AI 的工程師」?選前者,今天輕鬆超過 2 倍;選後者(每一代相對上一代的邊際增量),讀數可以一直低於 2 倍,因為分母跟著漲。兩邊的數字本報都不採信——一邊原始文件沒有連結、口徑未知,另一邊是零量測的個人斷言,而且他長期對 Anthropic 的敵意是公開的,同樣要打折。本報收下的是爭點結構本身。
驗證: 對峙的存在是可查的(兩邊原話都有直連);雙方讀數本身都無法核對;「不到 2 倍」的原始出處本報已排入回查——口徑一出,這條就能判定誰對。
判斷更新: 讀任何「AI 加速了 X 倍」的宣稱,先問分母是誰;不附口徑定義的自我報告倍率,視為不可比較。
這對投資判斷的意思: 敘事把「AI 自我加速」當成即將到來的轉折點在定價。這條證據說,連當事的實驗室與最貼近的觀察者,都還在為「加速到底幾倍」用不同的分母各說各話——對「轉折點已可量測」是弱化;真正該盯的是哪家先公開自己的口徑定義。
4. [證據更新](原測發布 8 月 24 日;本報查證日 8 月 26 日)上週那份「AMD 缺一個省錢關鍵件」的測試,機制今天被一手工程紀錄證實。但同一份紀錄也顯示,修好病灶的程式碼在測試發布前三天就上線了
本報 8 月 24 日那期依半導體研究機構 SemiAnalysis 的量測收下一條:在代理式推論的最省錢配置裡,輝達高併發時每一個配置都用「KV offload」。KV offload 是把模型的對話記憶從昂貴的 GPU 記憶體外溢到便宜的主機記憶體、以撐更高併發的省錢手法。AMD 的最省錢配置則零個在用,原因不是取捨,是缺件:能一次搬移多段記憶體的程式介面 hipMemcpyBatchAsync,在 AMD 的軟體平台 ROCm 上缺到 7.14 版才補齊(SemiAnalysis,08-24)。
今天本報回上游查證機制面,結果:證實,而且是一手、與 SemiAnalysis 互相獨立的證據——業界最主流的開源推論引擎 vLLM 的工程紀錄自述先前就發現該介面缺件,並給出量級:ROCm 7.14 之後一次搬移多段,比一段一段搬快 6 到 19 倍(vLLM PR #43018)。但同一份紀錄暴露一個時間線:這個修法 8 月 21 日就合併上線,而那份測試 8 月 24 日才發布——它量的是修法落地前的世界。
驗證: 機制面升為雙源證實;量測面(兩家最省錢配置的分佈數字)仍是 SemiAnalysis 單一機構、無第三方重跑,可信度只微調不躍升。該機構與 AMD 有多年顧問式往來,利害已標。修好也不等於修滿:同一份紀錄自承新介面在超過 8,192 個搬移描述項時會出錯、需要繞路設定——「補上介面」與「補到與輝達同級」之間還有距離。
判斷更新: 兩個後果。一,對答案的日子提前了:本報 7 月 25 日那期 判斷過,護城河已經從單顆晶片搬到整套系統組合;下一輪用上 ROCm 7.14 的量測,AMD 的最省錢配置有沒有開始用 KV offload,就是那條判斷的反證條件,可以直接從這裡讀出來。二,引用那份測試的正確方式不是「AMD 不行」,是「AMD 在 ROCm 7.14 之前不行,之後還沒被測過」——一份量測可以既準確又過期。
這對投資判斷的意思: 敘事把那份測試讀成「AMD 在代理式推論再輸一城」。這條證據把它改寫成一個有日期的觀察題:修法已上線、量測還沒跟上,SemiAnalysis 自己說三到四週後會出更新文,那份重測會直接裁「護城河搬家論」的反證條件——在那之前,兩個方向的結論都言之過早。
5. [證據更新](發文日 8 月 15 日;本報查證日 8 月 26 日)Anthropic 執行長背書的那條「傳聞中」華府路線,本報查出在他發文前 12 天就已經定案。8 月 23 日那期只能記下這件事只有他一個人說、官方文本出來以前不算數,今天可以確認了
Anthropic 執行長 Dario Amodei 那兩篇回應「監管是前沿廠護城河」指控的長文,本報 8 月 23 日那期已完整寫過三個要點。這三個要點是:監管設計原則與加州 SB 53 法案的 5 億美元營收豁免線;「開源只是把集中點移到算力與晶片最多的人手上」的結構論;對華府「部署前測試」路線的背書。當時的保留是:華府那條路線「只有他一個人說,在官方文本出來之前只能填在假設欄」(原長文,08-15)。
今天新的是本報自己查證的結果:他稱「傳聞中(reported)」的那條路線,其實在他發文前 12 天(8 月 3 日)已由白宮定案——名為自願性前沿 AI 安全測試框架,掛在 6 月 2 日簽署的行政命令「Promoting Advanced Artificial Intelligence Innovation and Security」之下:30 天的自願部署前測試,明文不構成強制授權或預先核可制,Meta、Anthropic、Google、OpenAI 都在受邀名單內。⚠️ 本報存檔未帶可直接點開的網址,讀者可用上述行政命令名稱檢索白宮官網;現況截至 2026-08-26。
驗證: 三個限定。他的背書對象真實存在、已定案,從假設升為可查;但性質是自願、非強制,強度低於他支持的加州 SB 53 那種硬規範;他發文晚於定案 12 天仍用「傳聞中」措辭,可能指細節仍未公開——有政策媒體稱框架內容並不透明。
判斷更新: 本報原本只能把它當假設看待,今天改記為「已定案的自願框架」——但要備註「自願」,它跟硬規範是兩種情境。他的結構論仍留著可對帳的預測:若開源擴散真分散權力,算力與晶片層的集中度不應隨模型層開放而上升——本報持續追蹤。
這對投資判斷的意思: 敘事假設華府對前沿 AI 的管制還在傳聞階段。這條證據說框架已定案但性質自願——對「監管成本即將硬性落地」是弱化,對「測試類合規服務會先有需求」是溫和強化。
6. [證據更新](原發 8 月 15-16 日)兩條較小但方向清楚的線:「安全研究 vs 能力研究」的二分可能本身就是漏洞;軟體庫的分發單位,正移向「餵給模型讀的原始碼」
其一(安全):長期寫 AI 週報的獨立分析者 Zvi Mowshowitz 對 OpenAI 內部系統遭入侵那條事件線再進一層,這次指向分類法本身——「安全研究 vs 能力研究」的二分可能正在製造大的概念錯誤。對齊就是讓模型行為守住安全規範的那套訓練與調校;要毀掉模型的對齊,動能力訓練管線比動「安全研究」容易得多,而他點名 Anthropic 的風險報告把「竄改安全研究結果」列為威脅、保護的卻不是前者(原貼,08-15)。這是第二位獨立論者收斂到「訓練管線才是真攻擊面」——第一位是政策分析者 Samuel Hammond,一週前把那場事故重讀為訓練資料污染問題(前導貼,08-09)。與第 3 點合看:一條質疑加速讀數的分母、一條質疑威脅模型的分類法,是讀實驗室自我報告時兩個獨立的懷疑角度。
其二(應用):Vercel 執行長 Guillermo Rauch 說流行的 React 元件庫 shadcn 是「偽軟體庫」——「有程式碼,但它其實是要被模型讀進工作記憶(context window)、在裡面重新組合的」:分發單位不再是被安裝引用的套件,而是模型可讀可改的原始碼(原貼,08-15)。「為模型可消化性而設計」作為產品維度,本報第一次見到有人講明。
驗證: 兩條都是單一發言者、方向要打折。Zvi 的原話自帶保留(「可能正在造成」),是方向猜想不是完成的論證;他引的風險報告段落本報未對原文核對;他長期主張實驗室風險被低估,方向同向。Rauch 的利害直接:shadcn 維護者是他的員工,「React 的成功大半是 shadcn」這句歸因不可量測,本報只記後半句的形態判斷。
判斷更新: 兩條各給一道可帶走的檢查題。讀實驗室的風險框架時,看它的威脅清單保護的是「安全研究產出」還是「訓練管線完整性」——兩者的資安投資方向完全不同。評估開發工具時,問它對模型是黑盒(只給介面)還是白盒(原始碼直接進工作記憶)——後者在代理工作流有結構性優勢。
這對投資判斷的意思: Zvi 這條對「安全投資=安全團隊人數」的讀法是弱化;Rauch 那條對「開發工具的護城河在介面設計」是弱化——兩條都是單一發言者的判斷,方向可用,幅度不可用。
1. [本週](事件日 8 月 24 日)湯森路透(路透社母公司、法律與稅務資訊服務商)想降低對 Claude 的依賴,用阿里巴巴的開源模型 Qwen 自建了自家模型;其技術長把「租用前沿實驗室的模型」比作租房子。本報只讀到記者 Charles Rollet 的報導預告貼文,報導本文與細節皆未讀(貼文,08-24)。
2. [本週](事件日 8 月 24-25 日)德州檢察長 Ken Paxton 提出針對資料中心的方案,背景是德州選民對資料中心的不滿升溫;政策研究者 Adam Thierer 稱其中的責任條款「激進」。本報未讀報導原文、未核實方案內容(華盛頓郵報,08-24)。
本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是『哪條判斷變硬了、誰說得準』,不是今天發生了什麼。