SecondSource從一手資料重建判斷
晨報 · 2026年9月13日

換一個寫程式的模型,真的只要改一行設定嗎?公開紀錄說不是

今天 2 條,全部在本頁全文展開。

三十秒看完

1. 換寫程式的模型不是改一行設定,是等你的工具層補上「這個模型該用哪套工具寫法」那一列;沒補上的那幾週,成功率真的會掉。

2. 三組外部研究者量到 OpenAI 旗艦模型不寫思考時仍在做大量運算;而廠商用來自證「自家模型不擅長隱藏推理過程」的那把尺,另一份實驗指出它嚴重低估。

3. 廠商成績單該打折的是呈現不是能力:三件瑕疵,其中兩件是 OpenAI 自己在文件裡承認的。

本期吃的是 2026 年 9 月 13 日清晨的研究報告與同日產出的深度報告,材料時間跨度為 5 月 11 日至 9 月 13 日;昨夜掃 19 篇 → 本期用上 19 條有連結可查的外部收據。

本週專欄:AI 說法對帳

這週對的是這一句:「Google 自研晶片 TPU 的每美元效能最多贏 Nvidia 五成,CUDA 護城河正在縮小。」對帳結果:存疑。 TPU 是 Google 自己設計、給自己資料中心用的 AI 晶片;CUDA 是 Nvidia 的繪圖處理器軟體生態,護城河指別人難以取代它的那層優勢。說這句話的是 SemiAnalysis,半導體與算力基礎設施領域最常被轉引的獨立分析商,9 月 7 日由創辦人 Dylan Patel 與機構帳號同日發出(@dylan522p,2026-09-07@SemiAnalysis_,2026-09-07)。本報 9 月 8 日那期引過這個數字,今天做的是把它拿回原文對帳。

數字沒算錯,錯在條件被留在正文、沒有進標題。 本報讀了那封電子報的免費段全文,機種、模型、精度、工作負載、服務模式五項可比性參數全部抽得出來,這比市面上多數評測都硬(SemiAnalysis,2026-09-07)。但那個五成對應的是「每位使用者每秒 20 個字、256 路並發」這一個點;換到每秒 100 個字剩 19% 與 34%。這兩個數字量的是同一件事:TPU 對 B200 與 B300 兩款對照晶片的每美元效能優勢,不是兩個不同工作點的讀數。換到 20 秒中位回應剩 8% 與 25%,到 30 秒中位回應附近 Nvidia 的 B200 反而贏。原文自己就寫了:在效能曲線的多數位置上,TPU 並沒有贏過 Nvidia,把結論扳回來的是總持有成本。

而那個總持有成本,是評測方自己估的,不是 Google 的報價。 也就是說,把結論扳回來的那個變數,來源和作者是同一個人。原文還具名致謝 15 位 Google 工程師,量測跑的軟體是 Google 為這次評測寫的。主動揭露比隱瞞好,但公開不等於獨立。至於「護城河在縮小」這半句,正文量到的方向相反:在雙方都把回答的兩個階段分到不同晶片池處理的比較上,Nvidia 仍然領先。

怎麼用:看到每美元效能的比較,先問那是曲線上的哪一點。 推論成本誰便宜,會隨每秒吐字速度與回應時間翻面。先把自己的服務目標對到曲線上的位置,再向供應商要那一點的讀數。什麼會推翻這個結果: 10 月中一套叫 TorchTPU 的公開軟體釋出後,若有一個與 Google 沒有合作關係的第三方用它重跑同一組工作負載、得到同方向結論,本報改判成立。

今日主線

[證據更新](原始觀察日 7 月 4 日)新一代 Claude 接上別家工具層會多寫出對方根本沒定義的欄位,出處找到了,修法也找到了,而它真正改寫的是你採購時該量的那個數字

先定義清楚一個名詞。工具層指跑 AI 代理人時包在模型外面的那一層東西:告訴模型有哪些工具可用、每個工具收哪些參數、出錯了怎麼重試。Claude Code 是 Anthropic 自家的命令列寫程式工具,Pi 是一個第三方的同類專案。

八月下旬有一則轉述在社群流傳:新一代 Claude 接到 Pi 上時,會自己生出 `requireUnique`、`matchCase`、`oldText2` 這種 Pi 根本沒有定義的參數。本報昨夜把它與另一組跑分合成一條判斷。今天回頭重驗,出處與機制都得改。出處排錯了:那三個參數名不是八月的新消息,是 Flask 網頁框架作者 Armin Ronacher 七月四日一篇部落格裡的原句(Armin Ronacher,2026-07-04)。機制比昨夜寫的更具體也更可修:模型多寫出來的欄位,用的是對方工具的命名風格,配上自家工具的規則;作者本人的解釋不是「記住了自家欄位名」,而是 Claude Code 會把多出來的欄位靜默丟掉、也不開嚴格模式,所以模型在訓練時從來沒有因為多寫欄位被扣過分。

核心判斷:模型換得動,但不是換一行設定,是換一張表。 表上每一列寫的是:這個模型在你的工具層裡用哪套工具寫法、嚴格模式開不開、新模型上線後多久補上這一列。多寫欄位這個毛病本身一個開關就修得掉,所以它不證明「換過去一定會退步」;它證明的是工具層必須替每一個模型維護這張表,而表跟不上新模型世代的那幾週,就是退步真實發生的窗口

驗證: 三個環節都可以自己查。機制那條是一手部落格加一個公開的程式碼追蹤紀錄,不再是二手轉述。廠商自述那條有 OpenAI 白紙黑字:它的官方指南寫明 GPT-5.1 針對幾個常用於寫程式的工具做過後訓練,並給了數字:模型如果使用官方定義好的工具型別,而不是自己重寫一個同功能的函式,失敗率會降低 35%(OpenAI 官方指南,2026)。Anthropic 這一側,本報在它的文字編輯工具文件裡沒有找到同型的句子,這一點如實記下;但它的介面確實提供嚴格模式,把工具定義標上嚴格之後模型輸出會被文法約束、保證符合定義,支援名單涵蓋那兩款被回報有問題的模型(Anthropic 官方文件)。另外,本報昨夜引用的那個 4.6 個百分點不能用:那套題只有 113 題,單次跑分的抽樣誤差本身就是 4.6 個百分點,所以兩位評測者之間的差距對任何原因都是零資訊。換掉它之後,同一份公開跑分紀錄裡有一個更硬的數:113 次嘗試裡有 11 次,因為模型連續三次沒有回傳任何工具呼叫而中止,紀錄自己寫明那是格式錯誤不是推理不夠(公開逐題紀錄)。⚠️ 一件本報量不到:嚴格模式解決的是「多寫欄位」,解決不了「習慣不同」,模型可能改成分多次呼叫或塞更長的上下文,那一層有沒有成功率代價,目前沒有任何人量過。

專案級上下文(2023)從單檔建議到先讀懂整個專案
Coding agent(2023-24)自己改碼、跑測試、端到端解一張 ticket
Harness 價值躍遷(2025-26)同一顆模型換殼,分數差距可大於換模型——主戰場部分移到工作流程組織本身

進行中 ?

路徑Aharness 商品化,價值遷出模型層(Steinberger $200→$10判例/Omnigent 共通層/harness設計可自動搜索)
路徑Bharness×model 不可解耦,整合點吃 margin(Ben Thompson整合-未夠好理論/Altman 自認分不清Codex 神奇來自哪層)

判斷更新: 本報既有的一條記錄說「模型與工具層量測上分不開」,另一條說「控制權握在設定入口」,中間缺的是因果那一條。今天補上了,而補法與昨夜的版本相反:它不削弱「控制權在設定入口」,反而把它具體化。因為那張表由工具層廠商維護,不是模型廠。所以該量的數字也換了:不是跨工具層的模型排名,而是同一個模型在你自己工具層裡的工具呼叫格式失敗率,像上面那 11 次一樣,一個跑分裡就拿得到,不需要看別人的榜。一家宣稱支援多模型的工具層廠商,若拿不出「每個模型用哪套工具寫法、嚴格模式預設如何、新模型多久補列」的答案,它的多模型是介面上的,不是行為上的。

這對投資判斷的意思: 現在的敘事假設是模型可以隨時互換,所以價值留在模型層、工具層只是薄薄一層轉接。這條證據對它是弱化,落差很具體:轉換成本不是零,而是一張由第三方維護、有更新時差的表,那個時差長在工具層廠商手上。

什麼會推翻它: 有人在任一第三方工具層上對同一模型開嚴格模式前後各跑一次同一套題,開了之後編輯成功率仍明顯落後於原生工具層,那麼「一個開關修得掉」這個收窄就錯了。其次,若有人公布新一代模型在原始工具定義上的自創欄位率接近零,「新一代更嚴重」這條線只是單一世代的雜訊。對答案日:2026 年 11 月 12 日。

長版全文

[本週](發表日 9 月 12 日)三組互不相識的研究者量到 Astra 不寫思考時仍在做大量運算,而廠商拿來自證的那把尺,同一週被指認為嚴重低估

本報 9 月 10 日那期寫過第一份外部量測,今天新的是另外三組,以及一件更尷尬的事。 GPT-6 Astra 是 OpenAI 的旗艦模型,它 9 月 3 日的官方系統卡自承思維鏈可監控性下降。思維鏈就是模型給答案前寫出來的推理過程,人讀得到,所以能監控;模型若能不寫就算完,可監控性就下降。今天的三組讀數來自獨立 AI 評論者 Zvi Mowshowitz 的長文,他逐字轉錄了三篇發表在 AI 安全社群論壇 LessWrong 上的量測(Zvi Mowshowitz,2026-09-12)。第一組在題目前面塞一串沒有意義的字、要求立刻作答,多步推理題的正確率從約一成升到約五成,舊數學競賽題從約六成升到約九成;如果模型只靠寫出來的思考推理,塞垃圾字應該完全沒用,有用就代表運算發生在沒寫出來的地方。第二組估「不寫思考也能完成的任務有多長」,答案是 15 到 40 分鐘,而這兩位研究者自己先前的預測是「2028 年底前不超過 7 分鐘」。第三組比開思考與關思考的分數差:上一代同級模型掉 35 分,Astra 只掉 10 分。

同一週還有第二件事,而它直接打到本報自己 9 月 10 日印過的數字。 那天本報印過一組 CoT-Control 的讀數:一套量「模型能不能刻意改寫自己的推理軌跡以規避監控」的評測,開放權重模型的分數落在 0% 到 13%。9 月 11 日,AI 對齊研究社群論壇 Alignment Forum 上一份小型獨立實驗指出,那些分數可能嚴重低估:只是換了更好的提示,開放權重模型的分數就提高兩到三倍以上,其中 OpenAI 釋出的開放權重模型 GPT-OSS-120B 從 5.5% 升到 15%(Alignment Forum,2026-09-11)。OpenAI 與 Anthropic 都在近期的系統卡裡用這把尺論證自家模型不擅長遮蔽自己的思維鏈。

驗證: 兩邊的證據等級不一樣,分開說。三組量測本報今天沒有開那三篇原文,只核對了轉錄與本地全文一致,所以承重的是「有三組獨立方法、方向一致」,不是任何一個小數點。⚠️ 三組也不是完全獨立:其中兩組以同一份估計為起點,而那份估計上溯只到 OpenAI 自己的報告。至於那份低估的實驗,加分與扣分都要講:作者用化名、未經同儕審查、每個模式只有 50 題、而且只測開放權重模型,所以不能直接說 Astra 的數字也被低估;加分的是它的方向與作者立場相反,他是在對安全社群自己依賴的量測提出下修,而且他明寫自己不認為這推翻了「現有模型多半還做不到持續規避監控」這個底線結論。他不是唯一提出這個疑慮的人:Anthropic 自家的系統卡裡就記了英國政府設立的評測機構 UK AISI 提過同一件事,這把尺對提示很敏感。

判斷更新: 本報 9 月 4 日收下「Astra 可監控性下降的成因有爭議」這條記錄時,寫了一句到期條件:各方講的都是主張,不是量測。今天那句在其中一側到期了:反方累積到三組量測,第一方那句「原因是模型變聰明」到今天仍然一組都沒有。 本報仍然不裁定成因,因為三組都不是對成因的直接量測,沒有人拿同一個模型開關某個架構部件做對照。今天真正能帶走的是第二件事:廠商用來自證的那把尺本身是可以被提示品質左右的,所以「我們測過、分數很低」這種保證,在拿到誘發強度之前不成立。 誘發強度指研究者用多強的提示去逼模型露出這個行為。收到這類保證時該追問的是:你用的提示是誰寫的、有沒有人試過用更好的提示把分數推上去。

什麼會推翻它: 若有人用一組公開寫死、逐字可複現的提示,對閉源與開放權重模型重跑同一套 CoT-Control 評測,分數不再隨提示換手而大幅跳動,那麼「這把尺被提示品質左右」就該撤回。

這對投資判斷的意思: 現在的敘事假設是前沿實驗室的安全宣稱有可查的量測撐著。這條證據對它是弱化,落差在於這幾份量測的誘發強度沒有人公布,而那是分數高低的自變數之一。

快訊(本報還沒查證)

1. [本週](發布日 9 月 12 日)DeepSeek 發布 V4.1-Flash,把「讀輸入」與「產輸出」拆開用不同參數量:讀輸入啟用 80 億、產輸出 160 億,總量約 7,500 億,授權是 MIT(官方模型說明頁)。⚠️ 本報今天早上才第一次讀到這幾份文件,還沒經過自己的收錄檢查;但有一件事已經查得出結果:聚合摘要把這次發布讀成「DeepSeek 要停掉舊旗艦 V4 Pro」,而官方定價頁寫的是相反的事,9 月 14 日之後繼續提供 V4 Pro 的服務、計費不變官方定價頁)。⇒ 看到「某廠要停掉某產品」的轉述,去它的定價頁看一眼就好,這個查證幾乎不花力氣。

2. [本季](節目日 8 月 31 日)一段投資人對談指出一個外部人看不見的結構:前沿實驗室的營收不是客戶要多少就是多少,而是它自己決定把多少算力拿去賣;同一座 10 吉瓦的算力,推論與訓練的配比翻過來,年化營收就從 4,800 億掉到 1,200 億美元。⚠️ 那組數字是講者當場說「就假設」的假設值,不是量測,兩位講者在逐字稿裡也沒有姓;可以帶走的只有那個結構:拿「營收成長率」評價一家實驗室,你評的是一個你看不到分母的數(a16z Podcast,2026-08-31)。

3. [本週](發布日 9 月 12 日)獨立研究機構 Epoch AI 的九月簡報一次給了幾組本報手上沒有同型對照的讀數,其中最該記住的是:單一資料中心的最大電力容量紀錄,每十個月翻一倍。⚠️ 本報今天第一次讀到這份簡報,沒有核過方法;另外它自陳跑 Astra 評測用的是 OpenAI 提供的發布前存取,這件事它主動揭露了,而那正是快訊第 5 則那條核對清單要的欄位之一(Epoch AI,2026-09-12)。

4. [本週](訪談日 9 月 12 日)一家主打「主權 AI」的日本算力商創辦人自述:目前在運容量 8 百萬瓦,硬體是三家晶片商混部,而九成營收來自美國與歐洲。⚠️ 全部規模數字是業者自報,訪談者自己在稿內就說「這可能只是一個機櫃」;本報沒有第三方對帳(More Than Moore,2026-09-12)。

5. [本週](發表日 9 月 12 日)同一篇長文把 Astra 的成績單拆成三件可以一條條查的事,而其中兩件是 OpenAI 自己在文件裡承認的(Zvi Mowshowitz,2026-09-12)。

今天另外還有 4 篇

各自獨立成篇,一句話說明為什麼今天值得點:

過去洞見

本欄本期沒有內容,能用的舊材料已經用完。

來源與盤點

過去 24 小時。 9 月 12 日到 13 日新增 19 篇材料。分類與具名:業界電子報與部落格 10 篇,76 個訂閱源裡只有 8 個有新東西,分別是 More Than Moore 1 篇、Data Center Dynamics 1 篇、Latent Space 2 篇、Simon Willison 2 篇、Epoch AI 的 Gradient Updates 1 篇、Zvi Mowshowitz 的 Don't Worry About the Vase 1 篇、Gary Marcus 1 篇、Qualcomm 官方新聞 1 篇;節目逐字稿 8 篇,全部來自 a16z 一個頻道;語音轉文字 1 篇。學術論文 0 篇、公司申報 0 份、X 貼文 0 則。 這三個 0 不是過濾掉的,是今天根本沒有進來。今天正文用上的材料裡有 5 條不在這 19 篇內:DeepSeek 的模型說明頁與定價頁、Epoch 的九月簡報、那份談評測低估的實驗、以及那篇日本算力商訪談,都是今天早上直接去原始網站抓回來的。

另一組材料不在上面那個 19 裡,也不是過去 24 小時的。 昨夜補讀的是 8 月 21 日到 24 日的 X 貼文,21 則。今天大神觀點欄整則、快訊第 2 則,事件時間落在 8 月 23 日到 31 日,不是今天發生的事,標籤旁都寫了事件日。寫出來是因為讀者沒看過,但不當成今天的新聞。今天一次性新增的長期追蹤對象 0 個。

來源集中度提醒。 今天最該標的是:今日主線第 2 點與快訊第 5 則,承重來源是同一位評論者的同一篇長文,轉錄若有誤,兩則會同時倒。減輕的因素有兩個:快訊第 5 則裡真正承重的反向讀數來自出題方本人,誘因方向與廠商相反;第 2 點的後半段由一份完全不同的實驗承擔,而那份實驗的方向與作者自己的立場相反。獨立的第二視角在哪: 四則主線的承重來源分屬官方模型文件與定價頁、兩家模型廠的官方開發文件、一位開發者的個人部落格與公開跑分紀錄、獨立評論者長文,以及一份匿名作者的公開實驗。

今天你拿不到什麼。 三件。一,X 上今天的貼文本報一則都沒拿到,所以大神觀點欄與快訊第 2 則只能用八月積壓的舊材料,事件日已逐則標明。二,DeepSeek 官方部落格今天兩條取得路徑都回 404,所以快訊第 1 則只能靠模型說明頁與定價頁兩份官方文件,拿不到廠商自己的發布說明。三,Epoch 那份簡報與日本那家算力商的訪談本報今天第一次讀到,還沒把裡面的數字對到第二個來源,所以放在快訊、不放主線。

本報追蹤的來源。 具名發言者合計 529 位。分佈:X 302、節目 90、媒體 51、部落格 48、論文作者 48、電子報 46、財報法說 26、大會演講 23,其餘零星。⚠️ 上面這些算的是發言場合,同一個人可能同時有好幾個,所以加起來比 529 多。代表性的名字:X 上有 Arvind Narayanan、Miles Brundage、Susan Zhang;部落格有 Simon Willison、Armin Ronacher、Sebastian Raschka;電子報有 Dylan Patel、Ben Thompson、Zvi Mowshowitz;機構端有 SemiAnalysis、Epoch AI、More Than Moore。名字一樣、算的範圍卻不同的幾組數字要分清楚: 名冊上的 302 個 X 帳號與 46 份電子報算的是長期在盯的總量;今天真正進到材料裡的是 X 貼文 0 則、八月補讀的舊材料 21 則、電子報 8 個訂閱源共 10 篇,母體不同。

本報不是新聞摘要:從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的。重點永遠是『哪條判斷變硬了、誰說得準』,不是今天發生了什麼。


免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新