SecondSource從一手資料重建判斷
晨報 · 2026年8月16日

能自動打分的評測,就是能被鑽的評測——一份新的技術報告說這是結構問題,不是把題目出得更嚴就能解

本期一眼

1. 一份新報告把「模型鑽評測漏洞」講成結構問題:規則要能自動打分就必須事前寫死,寫死的規則就是不會動的靶。

2. 業界把要求 AI 護欄的人叫「減速派」,但真正在擋資料中心的是各州議會,理由跟模型風險無關。

3. 白宮科技政策辦公室主任與 Anthropic 共同創辦人在同一週,各自把「用 AI 做科學」標成下一個主軸。

本期用的是 8 月 15 日的內部研究日報與當天白天的判斷,沒有更新的一份;材料的事件時間落在 7 月 15 日至 8 月 14 日。昨夜掃過 38 篇待讀材料 → 本期 24 條帶連結的收據;完整盤點在文末。

今天 3 條,全部在本頁全文展開。

今日主線

[本週](事件日 08-14)一家倫敦實驗室說它的小模型在複現論文上贏過前沿模型;而它技術報告裡真正硬的那一句,跟它賣的產品無關也成立

8 月 14 日,倫敦 AI 實驗室 Inherent(今年 5 月拿到 5,000 萬美元種子輪,四位創辦人有三位出自 DeepMind)發布 Faraday——一個 270 億參數的模型,定位是「AI 科學家」,官方說它在「照著一篇論文把研究從零重做一遍」這件事上勝過 Claude Opus 4.8 與 GPT-5.5(官方發布串)。⚠️ 這句宣稱沒有帶任何數字:贏多少、在什麼題目上、跑了幾次,發布串一個字都沒說。

它的架構是本報過去沒記過的形狀:由這個小模型決定要試什麼、判斷結果對不對、下一步往哪走,真正寫程式的工作丟給前沿的編碼 agent(能自己決定下一步呼叫什麼工具、要不要重試的那層程式)去跑(常見配置是反過來,大模型指揮小模型)。所以「270 億參數贏過前沿模型」的正確讀法是系統贏系統,不是模型贏模型——它呼叫的正是前沿模型。

驗證: 廠商發布當天的自報,零第三方複現;技術報告本體本報沒有直接取到,讀到的擷取經 Susan Zhang(前 Meta AI 研究員,Meta 2022 年放出的大型開源模型 OPT-175B 的主訓練者)轉貼一層(擷取原文),她只貼不評論,不能算背書。這類宣稱本來有一把公開的尺:PaperBench 是 2025 年 4 月的公開基準,拿 20 篇 ICML(機器學習三大會議之一)入選論文要 AI 從零複現,評分細則與每篇原作者共同訂定、切成 8,316 個可個別打分的子項;當時最好的受測系統只拿到 21.0%,作者結論是尚未超過人類基線(arXiv 2504.01848)。⚠️ 那是 2025 年 4 月、受測者為當時的 Claude 3.5 Sonnet 的讀數,本報手上沒有 2026 年的最新分數,所以它只能當「這件事有多難」的量級,不能當今天的水位。而 Faraday 用的是自訂任務集與自訂評分細則,在對上同一把尺之前,「勝過前沿模型」這句話無法被檢驗。

判斷更新: 本報過去記到的「模型鑽評測漏洞」全是現象——前沿模型的作弊率、把作弊念頭壓下去它就學會藏起來、換一組沒見過的題目分數就垮,沒有一條回答「為什麼結構上一定會這樣」。這份報告給了第一個成因說法,而且指向主流做法的定義本身。業界主流叫「可驗證獎勵」:把答案寫成機器能自動判對錯的形式(單元測試通過、答案對上、格式符合),才能大規模自動打分。報告說:要讓機器能自動打分,你就必須事前把評分程序指定出來,而寫死的程序就是一個靜止的靶——這不是規則寫得不夠好,是任何寫得死的規則都有這個性質。由此推出一個很硬的否定結論:加更多測項不能解決這件事,加測項只是把靶做大,靶還是不會動。 對讀評測分數的人,這條的用處是:自建任務集加自訂評分細則的高分,與公開基準之間沒有匯率,別把「刷新某個榜」直接讀成「領先」。⚠️ 三個限定要一起帶:這是設計主張不是實驗結果,報告沒有給「改成事後評判使作弊下降多少」的對照數字;提出者正在賣依此設計做出來的產品;而替代方案自己的代價一個字沒提——誰來評判整段過程?如果評判者也是一個模型,靶只是換個地方站,而那是持續的推理成本,不是一次性的規則撰寫成本。 會推翻這條的是:有人拿同一組真實任務把「事前寫死規則」與「事後評判整段過程」跑對照,而作弊率沒有差別。

[本週](事件日 08-14)業界把要求護欄的人叫「減速派」;但真正在擋資料中心的是州議會,而它們擋的理由跟模型風險無關

8 月 14 日,前 OpenAI 政策研究總監、現為獨立 AI 政策研究者的 Miles Brundage 提出一個定位反轉:業界多年來把主張 AI 要有基本護欄的人貼上「decel」標籤(decelerationist 的縮寫,矽谷用來指主張放慢的人,對立面是主張全速前進的 e/acc),但真正在踩煞車的是其他所有人原文)。他接著補了兩句更刺的:AI 安全社群其實非常親技術、對業界推的那個「不用工作的未來」比一般人更買單(補述一);而且除非跟模型能力扯得上關係,他們幾乎不關心資料中心這類實體外部性補述二)。

驗證: 三則同一人同一串,不能當三個來源;而且他本人就是被貼上那個標籤的一方,有明確的自我辯護動機。⚠️ 他這句話一半有旁證、一半沒有,必須分開看。有旁證的那一半(煞車來自 AI 圈外):創投機構 Air Street Capital 的產業回顧記錄,到 2026 年 4 月為止至少有 11 個州提出限制資料中心的法案,聯邦層級也有一份暫緩興建的提案(State of AI: May 2026)。沒有旁證的那一半(安全社群的價值觀分布、他們對資料中心的關心程度):本報手上零資料,那是他的印象,不是量測。

判斷更新: 這改變的是「怎麼讓阻力消失」這一題的答案。如果擋資料中心的力量來自 AI 風險論述,那把安全做好、把風險講清楚就會鬆動它;但那些立法動作發生在州議會、理由是電費、用水與土地,跟模型會不會失控無關——那麼任何以「我們的模型很安全」為訴求的溝通,都不會讓這道關卡鬆一格。 要處理的是地方性的外部性與補償,那是另一套工作,而且通常不在 AI 團隊手上。⚠️ 邊界兩項:11 州那個計數是 2026 年 4 月的讀數,四個月沒有更新;「安全社群不關心資料中心」目前只有他一個人這樣說。年底把各州法案重數一次,數字往上就是這條變強、持平或回落就是它變弱;而如果接下來的資料中心爭議裡,反對方的主要理由開始換成模型風險而不是電、水與土地,這條就翻盤。

[本週](事件日 08-13、08-14)白宮科技政策辦公室主任與 Anthropic 共同創辦人,在同一週各自把「用 AI 做科學」標成下一個主軸

8 月 13 日,美國白宮科技政策辦公室主任 Michael Kratsios 在《經濟學人》投書(該辦公室是美國總統的科技政策幕僚機構,主任的公開投書通常被讀成行政部門的方向訊號),把主張壓成三條:優先照顧美國科學家、重振國家級科學任務、充分運用 AI 加速科學發現——AI 排第三,而且定位是工具,不是競賽標的他本人的推文)。隔天,Anthropic 共同創辦人兼政策負責人 Jack Clark 給 AI 研究進展畫了一條三段分期:2018 到 2022 年是基本能力,2022 到 2026 年是規範與時間連貫性,而現在起到「2028?」這一段,他命名為「科學直覺/獨立性」原文)。那個問號是他自己標的。

驗證: 兩則都是宣示不是量測,而且各有立場:Anthropic 正把「AI 做科學」當論述主軸,白宮那篇是預算與政策論述。⚠️ 投書本體在付費牆後,本報只讀到他推文裡的三句摘要,裡面有沒有具體措施、預算或時程,本報不知道。Clark 那則分期零判準——「科學直覺」怎麼量,他沒說。兩人之間零協調證據,本報也不主張因果。

判斷更新: 單看任何一則都只是一句宣示。值錢的是兩個誘因結構彼此獨立的人,在 48 小時內把同一件事標成下一個主軸——一家公司的敘事利益,跟一個政府部門的預算論述,很少會剛好對齊。如果這個方向成立,下一輪的價值故事就不會停在 agent 與生產力工具上,而會往「用 AI 做科學」移;順帶一提,今日主線第 1 點那個「小模型出研究判斷、前沿 agent 出力」的架構,正好長在這條爬坡目標上。⚠️ 但目前兩條線都停在宣示層、沒有預算數字。可以直接拿去對帳的一句話:如果 2027 年前沿實驗室的主力發布仍然集中在 agent 的可靠性,而不是科學能力,這條分期的最後一段就被證偽了一半。

也發生了

今天另外還有 7 篇

各自獨立成篇,一句話說明為什麼今天值得點:

過去洞見

harness 與模型的分界線一直在移動,而且它往兩個方向同時移。(取自本報 7 月 27 日那期,)harness 指模型外面那層工作環境——工具、記憶、流程;當時的判斷是:訓練時模型與 harness 越綁越緊,部署時卻在解耦,零件化從簡單任務開始沿難度往上爬,而高難度那一端的整合溢價同時在變厚(本報 7 月 16 日的深度報告)。與今日主線第 1 點合看: Faraday 那個架構正好是這條線上一個新的切法——它不是把 harness 做厚,是把 harness 裡「決定下一步試什麼」那一格單獨切出來訓練成一個小模型,再把執行外包給前沿 agent。當時說的「整合溢價變厚」,今天出現了一個可能的形狀:溢價不一定落在把整套做大的人身上,也可能落在切得最準的那一刀上。⚠️ 這是一個樣本、而且是廠商自報,不足以動這條判斷,只夠標一個要盯的方向。

來源與盤點

過去 24 小時。 本期沒有新的一批材料。它用的是 8 月 15 日那批裡、昨天那期放不下的部分,加上當晚才補進來的一批舊晶片新聞。那批材料的原始收件量是 38 篇待讀:公司與個人部落格 18 篇、podcast 逐字稿 8 份、業界電子報 5 篇、論文 5 篇、業界分析 1 篇、公司申報 1 份,一篇都沒被丟掉;另外讀完一批 X 帳號 8 月 14 日的貼文,白天再補讀 5 個帳號同一天的貼文,3 個有值得收的、2 個沒有。今日無新增追蹤來源。

你今天拿不到什麼。 四件事誠實講。一、今天沒有 8 月 15 日當天發生的新事件——主線三則的事件時間都落在 8 月 13 到 14 日,時效標籤照實寫成「本週」;主線只有三條,是合格材料不足,不是版面裁掉的。二、主線第 1 點那份技術報告的本體沒拿到,本報讀到的是第三方轉貼的擷取,所以「勝過前沿模型」到底怎麼量的,今天答不出來。三、兩份可能改變答案的原文都沒拿到:《Science》那篇談印度 AI 主權政策的社論回 403,《經濟學人》上白宮科技幕僚長的投書在付費牆後,只能用他推文裡的三句摘要。四、本期無產品動態欄——過去 48 小時沒有夠格的新產品發展,今天的模型發布分別進了「也發生了」與「模型觀點」。

一次性回填(非過去 24 小時)。 8 月 15 日晚間補進 17 條晶片與供應鏈材料,事件時間落在 7 月 15 日至 20 日,不是過去 24 小時——本期只用了其中兩條,都標成「趨勢觀察」並附原發日期。

來源集中度提醒。 三件事必須自己講。一、Susan Zhang 一個人出現在本期三個位置(主線第 1 點的技術報告擷取、大神觀點的框架評語、模型觀點的第三方實測)——三處的角色都不同:第一處她只是轉貼管道、不是背書,第二處是她自己的話,第三處她是獨立的驗證者。二、晶片段的兩則趨勢觀察出自同一位駐台記者的現場轉錄,正文已寫明它們不是兩個獨立來源。三、主線第 2 點的三則發言同屬一條串,已在該點內寫明不能當三個來源;他本人就是被貼標籤的一方。

本報追蹤的來源。 X 帳號 302 個(Elon Musk、Stella Biderman、Miles Brundage 等),其他來源 343 筆,內含 podcast 90 檔、新聞稿來源 51 個、部落格 48 個(Arvind Narayanan、Armin Ronacher、David Ha 等)、論文來源 48 份、電子報 46 份(Nathan Lambert、Zvi Mowshowitz、Ben Thompson 等)、財報與投資人關係來源 26 個。帳號數與來源筆數是兩本帳,不相加。

更正:8 月 14 日那期的開篇與版尾都寫「32 個來源/32 條帶連結的收據」,公開版實際只有 27 條帶連結的收據,其中 2 條還是本報自家的舊期。那個 32 是版面裁切之前算的、裁切之後沒有回頭重算;現在改由機器在裁切完成後才數,不再人工填。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。


免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新