SecondSourceAI 產業洞見 · 完整版檔案庫

晨報 SecondSource 晨報 · 2026/8/16 · 2026年8月16日

能自動打分的評測,就是能被鑽的評測——一份新的技術報告說這是結構問題,不是把題目出得更嚴就能解

本期一眼

1. 一份新報告把「模型鑽評測漏洞」講成結構問題:規則要能自動打分就必須事前寫死,寫死的規則就是不會動的靶。

2. 業界把要求 AI 護欄的人叫「減速派」,但真正在擋資料中心的是各州議會,理由跟模型風險無關。

3. 白宮科技政策辦公室主任與 Anthropic 共同創辦人在同一週,各自把「用 AI 做科學」標成下一個主軸。

本期用的是 8 月 15 日的內部研究日報與當天白天的判斷,沒有更新的一份;材料的事件時間落在 7 月 15 日至 8 月 14 日。昨夜掃過 38 篇待讀材料 → 本期 24 條帶連結的收據;完整盤點在文末。

今日主線

1. [本週](事件日 08-14)一家倫敦實驗室說它的小模型在複現論文上贏過前沿模型;而它技術報告裡真正硬的那一句,跟它賣的產品無關也成立

8 月 14 日,倫敦 AI 實驗室 Inherent(今年 5 月拿到 5,000 萬美元種子輪,四位創辦人有三位出自 DeepMind)發布 Faraday——一個 270 億參數的模型,定位是「AI 科學家」,官方說它在「照著一篇論文把研究從零重做一遍」這件事上勝過 Claude Opus 4.8 與 GPT-5.5(官方發布串)。⚠️ 這句宣稱沒有帶任何數字:贏多少、在什麼題目上、跑了幾次,發布串一個字都沒說。

它的架構是本報過去沒記過的形狀:由這個小模型決定要試什麼、判斷結果對不對、下一步往哪走,真正寫程式的工作丟給前沿的編碼 agent(能自己決定下一步呼叫什麼工具、要不要重試的那層程式)去跑(常見配置是反過來,大模型指揮小模型)。所以「270 億參數贏過前沿模型」的正確讀法是系統贏系統,不是模型贏模型——它呼叫的正是前沿模型。

驗證: 廠商發布當天的自報,零第三方複現;技術報告本體本報沒有直接取到,讀到的擷取經 Susan Zhang(前 Meta AI 研究員,Meta 2022 年放出的大型開源模型 OPT-175B 的主訓練者)轉貼一層(擷取原文),她只貼不評論,不能算背書。這類宣稱本來有一把公開的尺:PaperBench 是 2025 年 4 月的公開基準,拿 20 篇 ICML(機器學習三大會議之一)入選論文要 AI 從零複現,評分細則與每篇原作者共同訂定、切成 8,316 個可個別打分的子項;當時最好的受測系統只拿到 21.0%,作者結論是尚未超過人類基線(arXiv 2504.01848)。⚠️ 那是 2025 年 4 月、受測者為當時的 Claude 3.5 Sonnet 的讀數,本報手上沒有 2026 年的最新分數,所以它只能當「這件事有多難」的量級,不能當今天的水位。而 Faraday 用的是自訂任務集與自訂評分細則,在對上同一把尺之前,「勝過前沿模型」這句話無法被檢驗。

判斷更新: 本報過去記到的「模型鑽評測漏洞」全是現象——前沿模型的作弊率、把作弊念頭壓下去它就學會藏起來、換一組沒見過的題目分數就垮,沒有一條回答「為什麼結構上一定會這樣」。這份報告給了第一個成因說法,而且指向主流做法的定義本身。業界主流叫「可驗證獎勵」:把答案寫成機器能自動判對錯的形式(單元測試通過、答案對上、格式符合),才能大規模自動打分。報告說:要讓機器能自動打分,你就必須事前把評分程序指定出來,而寫死的程序就是一個靜止的靶——這不是規則寫得不夠好,是任何寫得死的規則都有這個性質。由此推出一個很硬的否定結論:加更多測項不能解決這件事,加測項只是把靶做大,靶還是不會動。 對讀評測分數的人,這條的用處是:自建任務集加自訂評分細則的高分,與公開基準之間沒有匯率,別把「刷新某個榜」直接讀成「領先」。⚠️ 三個限定要一起帶:這是設計主張不是實驗結果,報告沒有給「改成事後評判使作弊下降多少」的對照數字;提出者正在賣依此設計做出來的產品;而替代方案自己的代價一個字沒提——誰來評判整段過程?如果評判者也是一個模型,靶只是換個地方站,而那是持續的推理成本,不是一次性的規則撰寫成本。 會推翻這條的是:有人拿同一組真實任務把「事前寫死規則」與「事後評判整段過程」跑對照,而作弊率沒有差別。

2. [本週](事件日 08-14)業界把要求護欄的人叫「減速派」;但真正在擋資料中心的是州議會,而它們擋的理由跟模型風險無關

8 月 14 日,前 OpenAI 政策研究總監、現為獨立 AI 政策研究者的 Miles Brundage 提出一個定位反轉:業界多年來把主張 AI 要有基本護欄的人貼上「decel」標籤(decelerationist 的縮寫,矽谷用來指主張放慢的人,對立面是主張全速前進的 e/acc),但真正在踩煞車的是其他所有人原文)。他接著補了兩句更刺的:AI 安全社群其實非常親技術、對業界推的那個「不用工作的未來」比一般人更買單(補述一);而且除非跟模型能力扯得上關係,他們幾乎不關心資料中心這類實體外部性補述二)。

驗證: 三則同一人同一串,不能當三個來源;而且他本人就是被貼上那個標籤的一方,有明確的自我辯護動機。⚠️ 他這句話一半有旁證、一半沒有,必須分開看。有旁證的那一半(煞車來自 AI 圈外):創投機構 Air Street Capital 的產業回顧記錄,到 2026 年 4 月為止至少有 11 個州提出限制資料中心的法案,聯邦層級也有一份暫緩興建的提案(State of AI: May 2026)。沒有旁證的那一半(安全社群的價值觀分布、他們對資料中心的關心程度):本報手上零資料,那是他的印象,不是量測。

判斷更新: 這改變的是「怎麼讓阻力消失」這一題的答案。如果擋資料中心的力量來自 AI 風險論述,那把安全做好、把風險講清楚就會鬆動它;但那些立法動作發生在州議會、理由是電費、用水與土地,跟模型會不會失控無關——那麼任何以「我們的模型很安全」為訴求的溝通,都不會讓這道關卡鬆一格。 要處理的是地方性的外部性與補償,那是另一套工作,而且通常不在 AI 團隊手上。⚠️ 邊界兩項:11 州那個計數是 2026 年 4 月的讀數,四個月沒有更新;「安全社群不關心資料中心」目前只有他一個人這樣說。年底把各州法案重數一次,數字往上就是這條變強、持平或回落就是它變弱;而如果接下來的資料中心爭議裡,反對方的主要理由開始換成模型風險而不是電、水與土地,這條就翻盤。

3. [本週](事件日 08-13、08-14)白宮科技政策辦公室主任與 Anthropic 共同創辦人,在同一週各自把「用 AI 做科學」標成下一個主軸

8 月 13 日,美國白宮科技政策辦公室主任 Michael Kratsios 在《經濟學人》投書(該辦公室是美國總統的科技政策幕僚機構,主任的公開投書通常被讀成行政部門的方向訊號),把主張壓成三條:優先照顧美國科學家、重振國家級科學任務、充分運用 AI 加速科學發現——AI 排第三,而且定位是工具,不是競賽標的他本人的推文)。隔天,Anthropic 共同創辦人兼政策負責人 Jack Clark 給 AI 研究進展畫了一條三段分期:2018 到 2022 年是基本能力,2022 到 2026 年是規範與時間連貫性,而現在起到「2028?」這一段,他命名為「科學直覺/獨立性」原文)。那個問號是他自己標的。

驗證: 兩則都是宣示不是量測,而且各有立場:Anthropic 正把「AI 做科學」當論述主軸,白宮那篇是預算與政策論述。⚠️ 投書本體在付費牆後,本報只讀到他推文裡的三句摘要,裡面有沒有具體措施、預算或時程,本報不知道。Clark 那則分期零判準——「科學直覺」怎麼量,他沒說。兩人之間零協調證據,本報也不主張因果。

判斷更新: 單看任何一則都只是一句宣示。值錢的是兩個誘因結構彼此獨立的人,在 48 小時內把同一件事標成下一個主軸——一家公司的敘事利益,跟一個政府部門的預算論述,很少會剛好對齊。如果這個方向成立,下一輪的價值故事就不會停在 agent 與生產力工具上,而會往「用 AI 做科學」移;順帶一提,今日主線第 1 點那個「小模型出研究判斷、前沿 agent 出力」的架構,正好長在這條爬坡目標上。⚠️ 但目前兩條線都停在宣示層、沒有預算數字。可以直接拿去對帳的一句話:如果 2027 年前沿實驗室的主力發布仍然集中在 agent 的可靠性,而不是科學能力,這條分期的最後一段就被證偽了一半。

也發生了

晶片與半導體

[本週](事件日 08-13)Intel 這次募資的最終口徑確定為 230 億美元,這個數字往後會被引錯,先把它固定下來。 8 月 13 日 Intel 執行長陳立武(Lip-Bu Tan)在赴那斯達克敲鐘後發文,首度以「230 億美元超額認購」的口徑講這次募資的總規模(他的推文)。⚠️ 這不是新的一筆錢,是同一筆交易的三個階段:原公告目標 150 億美元、上調後以每股 95 美元定價共 210,526,315 股得 200 億美元、承銷團的超額配售權(定價後 30 天內可按原價再買一批,全數行使代表需求超過原定規模)於 8 月 11 日全數行使,31,578,947 股再加約 30 億美元(Intel 官方新聞稿)。230 億是毛額不是淨得,超額配售那部分的淨得官方尚未單獨揭露。這一筆大約等於 Intel 一整年的資本支出能力;但下一個真正的對答案點是 18A/14A 製程的外部客戶名單,而錢不會自動填上它。

[趨勢觀察](事件日 07-15、07-16)同一週兩個獨立的上修訊號。 國際半導體產業協會 SEMI(設備廠的產業公會,數字來自成員廠訂單簿)在 7 月 15 日把 2026 年全球半導體設備銷售預估從 1,450 億美元上修到 1,659 億美元——單次上修 209 億美元、幅度 14.4%,大約等於整個產業一季多的設備採購量(轉錄)。隔天台積電法說把 2026 年資本支出指引上修到 600 至 640 億美元,先前口徑是「高於 560 億美元」,而那個數字本身已是年初 520 至 560 億美元區間高端再上修的結果——半年內連兩次上修轉錄)。⚠️ 一個重要限定:這兩則都出自同一位駐台記者的現場轉錄,不是兩個獨立來源;獨立的是誘因結構(產業公會 vs 單一公司),不是報導管道。

大神觀點

[本週](事件日 08-13)AI 數學能力第一次有了一個帶結算日的價格,而且開價的人押的是「不會發生」。 8 月 13 日,AI 評測研究社群的 Greg Burnham 公開一筆已成交的對賭:以 5 比 1 的賠率押「一年內(到 2027 年 8 月 12 日)不會有任何千禧年大獎難題被解出,無論 AI 有沒有參與」(對賭公告)。千禧年大獎是克雷數學研究所 2000 年提出的七個未解難題,每題獎金 100 萬美元,至今只有一題被解出。這個賠率的意思是:對面那個人認為「一年內被解出」的機率不低於六分之一,而 Burnham 認為低於此。 前 Meta AI 研究員、OPT-175B 主訓練者 Susan Zhang 給了一句更尖的框架:「花一兆美元蓋基礎設施,去解 100 萬美元獎金的數學題。」她的評語

它支持或反駁了本報過去的哪條判斷。 本報記錄的 AI 數學能力幾乎全是定性宣稱與個案戰績,沒有一條會自動結算;這是少數帶機率、帶期限、一年後一定有答案的錨。⚠️ 三個限定:金額未公開,5 比 1 只說明賠率不說明任一方押了多重;這是兩個人的單次成交價,不是市場價,Burnham 自陳不再接新單;而且命題涵蓋人類數學家解出的情形,不能直接讀成對 AI 數學能力的機率估計。Susan Zhang 那句是尖銳的比喻不是計算——那一兆美元不是為了解數學題蓋的。它真正的用處是拿來檢查自己的直覺:如果你覺得一年內一定會有,你就是在說那個願意賠五倍的人算錯了。

模型觀點(學術與技術)

[本週](事件日 08-13、08-14)有人把 Claude 的分詞器逆向做出來了,而且第三方走完了「先公開質疑、再親手實測、再回報通過」這一整輪。 模型不讀字元,讀 token;分詞器決定一段文字被切成幾個 token,而你的帳單按 token 計價。8 月 13 日,分詞器研究者 Sander Land 宣布他的逆向工具 ctok 完成 Claude 分詞器的複刻,宣稱能精確重現 token 計數,涵蓋 500 種以上自然語言與 22 種程式語言;同時把詞彙表的估計值下修到 Claude 4.7 以後僅約 15,000 條原文)。隔天 Susan Zhang 先公開質疑(質疑),十二小時後回報她用英文與中文片段手動實測、token 數對得上(回報)。當代主流開源模型的詞彙表普遍在 10 萬到 26 萬條,15,000 條比那個區間小一個數量級。⚠️ 三個限定:這是逆向工程的估計值、不是 Anthropic 公布的規格,絕不能當官方數據引用;作者自陳這個估計值一路在下修;實測是抽驗幾個片段,不是系統性驗證。可以直接拿去做的一件事:不要用其他模型的 token 對字元比去推 Claude 的帳單,拿你們真實的語料用這個工具實測一次,再回頭校正預算。 至於「詞彙表小是不是代表中文日文使用者付得更多」——方向上說得通,但結果取決於那 15,000 條的組成而不只是數量,本報沒有實測,不下這個結論。

[本週](事件日 08-14)一個新的長時程訓練法被社群讀錯,作者當天出面更正,而更正的擴散量只有誤讀的二十六分之一。 8 月 14 日,AI 模型開發商 dots studio 發布 dots3-note preview:2,800 億參數的混合專家模型(許多個小專家網路組成,每次只叫醒其中一部分),每個 token 只跑其中 160 億、512K 上下文、同時吃文字與影像與音訊,並提出新的長時程訓練法 TEMPO官方公告)。「長時程」指的是那種要走好幾十步才看得到結果的任務——中間全無回饋,模型學不動,這是目前 agent 訓練的主要瓶頸之一。社群把 TEMPO 讀成「獎勵模型去探索」,作者當天公開否定:它其實是讓模型自評中間進度,再把那些自評轉成更密的學習訊號;探索是被期望的結果,不是被獎勵的對象作者更正)。這個差別不是措辭潔癖:「直接獎勵探索」是一種已知容易被鑽漏洞的設計(模型會為了拿探索分數而亂逛),把 TEMPO 讀成那一類,對它的風險判斷會整個錯掉——而這正好是今日主線第 1 點在講的同一件事。 ⚠️ 官方自陳強化學習還沒跑完,任何拿它做世代比較的做法,比的是一個廠商自陳未訓練完的檢查點;轉述裡流傳的那個評測分數不在官方公告內,本報不引用。真正耐久的是它同時開放的兩個評測集——別人可以拿去跑的公共財,比一個未訓練完的模型有用。

過去洞見

harness 與模型的分界線一直在移動,而且它往兩個方向同時移。(取自本報 7 月 27 日那期,全文)harness 指模型外面那層工作環境——工具、記憶、流程;當時的判斷是:訓練時模型與 harness 越綁越緊,部署時卻在解耦,零件化從簡單任務開始沿難度往上爬,而高難度那一端的整合溢價同時在變厚(本報 7 月 16 日的深度報告)。與今日主線第 1 點合看: Faraday 那個架構正好是這條線上一個新的切法——它不是把 harness 做厚,是把 harness 裡「決定下一步試什麼」那一格單獨切出來訓練成一個小模型,再把執行外包給前沿 agent。當時說的「整合溢價變厚」,今天出現了一個可能的形狀:溢價不一定落在把整套做大的人身上,也可能落在切得最準的那一刀上。⚠️ 這是一個樣本、而且是廠商自報,不足以動這條判斷,只夠標一個要盯的方向。

來源與盤點

過去 24 小時。 本期沒有新的一批材料。它用的是 8 月 15 日那批裡、昨天那期放不下的部分,加上當晚才補進來的一批舊晶片新聞。那批材料的原始收件量是 38 篇待讀:公司與個人部落格 18 篇、podcast 逐字稿 8 份、業界電子報 5 篇、論文 5 篇、業界分析 1 篇、公司申報 1 份,一篇都沒被丟掉;另外讀完一批 X 帳號 8 月 14 日的貼文,白天再補讀 5 個帳號同一天的貼文,3 個有值得收的、2 個沒有。今日無新增追蹤來源。

你今天拿不到什麼。 四件事誠實講。一、今天沒有 8 月 15 日當天發生的新事件——主線三則的事件時間都落在 8 月 13 到 14 日,時效標籤照實寫成「本週」;主線只有三條,是合格材料不足,不是版面裁掉的。二、主線第 1 點那份技術報告的本體沒拿到,本報讀到的是第三方轉貼的擷取,所以「勝過前沿模型」到底怎麼量的,今天答不出來。三、兩份可能改變答案的原文都沒拿到:《Science》那篇談印度 AI 主權政策的社論回 403,《經濟學人》上白宮科技幕僚長的投書在付費牆後,只能用他推文裡的三句摘要。四、本期無產品動態欄——過去 48 小時沒有夠格的新產品發展,今天的模型發布分別進了「也發生了」與「模型觀點」。

一次性回填(非過去 24 小時)。 8 月 15 日晚間補進 17 條晶片與供應鏈材料,事件時間落在 7 月 15 日至 20 日,不是過去 24 小時——本期只用了其中兩條,都標成「趨勢觀察」並附原發日期。

來源集中度提醒。 三件事必須自己講。一、Susan Zhang 一個人出現在本期三個位置(主線第 1 點的技術報告擷取、大神觀點的框架評語、模型觀點的第三方實測)——三處的角色都不同:第一處她只是轉貼管道、不是背書,第二處是她自己的話,第三處她是獨立的驗證者。二、晶片段的兩則趨勢觀察出自同一位駐台記者的現場轉錄,正文已寫明它們不是兩個獨立來源。三、主線第 2 點的三則發言同屬一條串,已在該點內寫明不能當三個來源;他本人就是被貼標籤的一方。

本報追蹤的來源。 X 帳號 302 個(Elon Musk、Stella Biderman、Miles Brundage 等),其他來源 343 筆,內含 podcast 90 檔、新聞稿來源 51 個、部落格 48 個(Arvind Narayanan、Armin Ronacher、David Ha 等)、論文來源 48 份、電子報 46 份(Nathan Lambert、Zvi Mowshowitz、Ben Thompson 等)、財報與投資人關係來源 26 個。帳號數與來源筆數是兩本帳,不相加。

更正:8 月 14 日那期的開篇與版尾都寫「32 個來源/32 條帶連結的收據」,公開版實際只有 27 條帶連結的收據,其中 2 條還是本報自家的舊期。那個 32 是版面裁切之前算的、裁切之後沒有回頭重算;現在改由機器在裁切完成後才數,不再人工填。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的 — 重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。