本篇出自 2026年9月4日 晨報
九月二日 Google 發表 Gemini 3.8 Flash Cyber:一款只做資安的模型,官方稿從頭到尾沒有價錢,只寫著「透過我們新的 Fairwind Program 提供給受信任的防禦方」。這和六月二十二日 OpenAI 的 GPT-5.5-Cyber 是同一個形狀:兩款都是專做資安的姊妹版本,都不公開標價,取得資格都限於所謂的「trusted defenders」。
本篇的結論分兩半。前半是更正:這不是兩家,是三家;而且第一家不是 OpenAI,是 Anthropic,時間是四月,比 OpenAI 早兩個月。Project Glasswing 把未公開發布的 Mythos 給了大約五十家維護關鍵基礎設施的機構。後半才是重點:三家做的是同一件事,但外界一直在問錯的問題。大家問的是「這道閘擋不擋得住人」(核准率多少、誰過得了),而那個問題三家都沒給數字、短期也不會給。真正決定這道閘還有多少壽命的是另一個數字,而且那個數字有人在定期量:英國 AI Security Institute 量到,開權重模型在資安能力上落後閉源前沿 4 到 7 個月,而 2025 年整年這個差距是 6 到 10 個月,它正在收斂。名單制擋的是從閘裡出來的那條路;閘外面那條路的到站時間,是可以查的。
本篇路線分五步:
① 先把時間軸修正過來:三家、五個月、各自的形狀,以及第一家其實揭露得最多。
② 解釋名單制到底取代了什麼,以及它的代價為什麼不是零:這一款的價目欄不是空的,只是不用錢計價。
③ 檢查三家用來自證的那把尺(CyberGym)實際上量的是什麼。答案會改變你怎麼讀那個 85.6 分。
④ 把閘的壽命換算成日期,並指出一件更要緊的事:三家自證用的能力軸,正好是壽命最短的那一條。
⑤ 最後看已經發生過的失效:這道閘歸零過一次,不是洩漏,是政府指令,三天。
這篇比昨天晨報上的同一條多給了什麼?三件,都指得出來。第一,我們回頭攻了自己昨天的判斷,結果它有三處沒撐住。 昨天那條寫「兩家在 72 天內獨立收斂」:家數錯了(是三家)、起點錯了(四月不是六月)、而「閘門一動也沒動」也錯了。閘從邀請制變成了申請制,揭露程度同時一路下降。第二,那把自證的尺被拆開了。 CyberGym 這個測驗給模型的是「一段漏洞的文字描述加上程式碼」,要模型寫出重現它的測試;它量的是重現一個已經被告知的漏洞,不是自己找出一個沒人知道的漏洞。而後者才是需要一道閘的那個能力。第三,我們寫死了一個推翻條件,而且它有明確的收件人。 英國 AISI 和美國 CAISI 已經在量開權重的資安差距,但他們量的一直是通用前沿模型;三家發的都是專用款。把同一把尺對準專用款量一次,這整篇的時鐘就從估算變成讀數。這個量測目前不存在,而做得出來的機構只有那兩家。
進行中 ?
上圖那條線講的是控制面搬家:2026 年之前,前沿廠處理「這個能力會被壞人拿去用」的辦法是在模型裡訓練拒答;2026 年四月起,三家改成另外做一款不設限的,然後只發給名單內的人。本篇處理的是這條線上最實際的一個問題:這個新辦法的保鮮期有多長,而那個期限由誰決定。
昨天那條判斷的骨架是「兩家、72 天、獨立收斂」。骨架裡的家數與窗口兩項要改,獨立收斂本身撐住;另外還有一項骨架沒寫進去、但同樣站不住的說法:「閘門一動也沒動」。合起來是三處更正。
這裡得先把一個詞定義清楚:名單制發行的意思是,這款東西不標價、不公開賣,想用的人要先提出申請,由廠商決定給不給。它的相反面是價格分配:標了價,付得起就有,廠商不問你是誰。
按時間排出來是這樣:
| 時間 | 誰 | 做了什麼 | 承載的模型層級 | 揭露了多少 |
|---|---|---|---|---|
| 2026-04 | Anthropic | Project Glasswing:把未公開發布的 Mythos 預覽版給約 50 家維護關鍵基礎設施的機構,用於防禦性找漏洞 | 全新前沿款(從未公開發行) | 家數(約 50)+ 五個具名成員(Amazon、Microsoft、Apple、Google、Linux Foundation) |
| 2026-06-09 | Anthropic / AWS | SKU 拆兩款:Fable 5 = Mythos 級能力加上護欄、供較廣使用;Mythos 5 = 同一個模型但沒有這些限制,只給一小群通過審查的客戶 | 旗艦線 | 「一小群」,無數字 |
| 2026-06-22 | OpenAI | GPT-5.5-Cyber 受限釋出給 trusted defenders;Trusted Access for Cyber 延伸成國家級夥伴 | 旗艦線 | 7 個國家 + EU-ENISA,無機構數 |
| 2026-07-22 | Gemini 3.5 Flash Cyber 發布,DeepMind 副總說是「讓第一線軟體防禦團隊取得先機」 | Flash 線 | 取得方式、資格、價格全部沒說 | |
| 2026-09-02 | Gemini 3.8 Flash Cyber,透過 Fairwind Program 只給 trusted defenders,官方稿與型號頁都不列價 | Flash 線 | 只有一個計畫名稱 |
三處更正,逐一說明。
第一,家數是三不是二。 據 Stratechery 的報導,Anthropic 在四月就做了同一件事,而且做得比另外兩家更硬:Mythos 連「限制發行」都算不上,它根本沒有公開發行。Frontier Red Team 主管 Logan Graham 當時給的理由是安全把握不足:得先確認把它放出來是安全的,而怎麼樣才算有十足把握,他說當時並不清楚。六月 AWS 的官方公告把這個機制寫得更白:不加這些限制的那一版叫 Claude Mythos 5,只給一小群通過審查的客戶。
這一點對昨天那條判斷的影響是雙向的。壞消息是「兩家獨立收斂」這個說法要改寫。好消息是它其實變強了:昨天那條自己列的第三個推翻條件是「第三家前沿廠發資安專用款時不設閘,收斂的說法就被推翻」。現在第三家找到了,而它不但設了閘,還設了三家裡最嚴的那一道。收斂這件事撐住了,而且樣本從二變成三。
第二,窗口是五個月不是 72 天。 那個 72 天是拿 OpenAI 的六月和 Google 的第二款九月相減得到的,中間漏掉了 Google 的第一款:七月二十二日的 Gemini 3.5 Flash Cyber。OpenAI 到 Google 的真實間隔是 30 天。整條線從 2026 年四月拉到九月,大約 150 天。
第三,也是最要緊的一處:閘沒有「一動也沒動」,它一直在動,而且揭露程度單向下降。 看上表最後一欄。第一家公開了家數和五個具名成員;第二家公開了七個國家夥伴但不說機構數;第三家只給了一個計畫名字。同時,機制的形狀也變了:Glasswing 是邀請制,由廠商主動挑人,人數天然有上限;Fairwind 是申請制,由使用者自己去申請,沒有公告任何上限。
這兩件事合起來看才有意思:揭露程度下降的時間點,正好是核准率開始有意義的那個時間點。 一個五十家的邀請名單,核准率是什麼意思不太重要,名單就是名單。一個沒有上限的申請制,核准率就是它到底是控制還是櫃檯的唯一判準。而它正是在這一步之後停止被揭露的。
要理解為什麼三家都往這裡走,得先看它取代的是什麼。
先定義一次:雙用途指同一個能力,守方拿來補自己的洞,攻方拿來找別人的洞,技術上是同一件事。在此之前,前沿廠處理這類能力的標準辦法叫拒答訓練:把模型訓練成遇到某類請求就不回答。這個辦法有一個被反覆批評的毛病:它對所有人一起生效。有決心的攻擊者會繞過去,而真正被擋住的是那個想修自己系統漏洞的資安工程師。用比較尖銳的說法:拒答政策是一道只對守方生效的稅。
名單制是對那個批評的回應形式。不再對所有人拒答,改成另外做一款不閹割的,發給守方。Anthropic 的做法把這個邏輯攤得最清楚:Fable 5 是加了護欄的版本,而護欄的實作方式是這樣。遇到資安、生物、化學、健康類的有害提示,改由一個比較弱的舊模型(Opus 4.8)來回答。也就是說,這道護欄是路由出來的,不必重新訓練模型:把危險問題丟給笨一點的模型。而 Mythos 5 就是同一個模型,沒有這條路由。
所以名單制的實質是:把「誰值得信任」這個判斷,從模型的即時反應,搬到一家公司的行政流程裡。
這裡有一個容易被跳過的推論錯誤,值得停一下。昨天那條寫的是「不是貴,是根本沒有價錢這個欄位」。但官方稿沒印價錢,和這款東西不用價格分配,是兩件事。前者是可觀察的,後者是推論。而我們有一個實例可以看出這個推論漏了什麼:AWS 官方公告寫明,要拿到不設限的那一款,客戶必須主動開啟資料分享,並接受 Anthropic 要求的三十天輸入輸出留存加上人工審查。
那不是沒有代價,那是用資料和可稽核性付的代價。你交出去的不是錢,是你送進模型的東西會被留存三十天並且被人看。
這件事的對稱面就在同一天的另一則消息裡。九月二日 Meta 發表 Muse Spark 1.3,最便宜的那一層每百萬輸入字元只要 0.10 美元,而那個價位的交換條件是讓 Meta 拿你的提示詞去當訓練資料。兩邊是同一個結構:便宜的那一款和管制的那一款,真正的價目欄都不是錢那一欄。 對一家要把客戶資料或內部程式碼送進去的公司,這兩者都不是價格問題,是法務問題。
三家裡有兩家用同一個測驗自證:OpenAI 說 GPT-5.5-Cyber 在 CyberGym 上拿 85.6 分(通用版 81.8),Google 的型號頁寫「Gemini 3.8 Flash Cyber 以 86.2% 領先」。兩個數字差 0.6 分。昨天那條把這件事讀成「兩家在拿同一把尺自證」。這是對的,但那把尺量的是什麼,值得看清楚。
CyberGym 是柏克萊團隊做的公開測驗,論文在 2025 年發表。它的規模不小:1,507 個真實漏洞,涵蓋 188 個開源專案,資料來自 Google 的 OSS-Fuzz。關鍵在它給模型什麼、要模型做什麼。論文的原話是:模型的任務是「產生一個能重現該漏洞的概念驗證測試,而它拿到的只有該漏洞的文字描述以及對應的程式碼庫」。
把這句話讀兩遍。漏洞在哪裡、是什麼,題目已經直接告訴模型了。 它要做的是把那段描述變成一個能真的觸發崩潰的測試檔。這是一個很有價值的能力:它正是「補漏洞」這件事的前半段,你得先能穩定重現才能驗證修好了沒。
但它不是「自己在一大堆沒人看過的程式碼裡找出一個沒人知道的漏洞」。而後面那一個,才是需要一道閘的那個能力。攻擊者要的不是重現一個 CVE 資料庫裡已經公告的漏洞,那個資訊本來就是公開的。
還有第二件事值得記。那篇論文自己報告的成績是:「即使是表現最好的組合,也只達到大約 20% 的成功率。」從 2025 年的約 20% 到 2026 年的 85.6%,一年之內大約四倍。這個跳躍可能是真的(這一年 AI 自己規劃步驟、動手跑完多步任務的能力確實跳很大),但有兩件事沒有人公布:三家都沒有說自己測的是哪個難度級距或哪個子集,也沒有第三方複現過任何一個分數。 兩個 85 分級的數字,目前的位階都是廠商自評。
而最能說明問題的訊號,來自這個測驗的作者自己。2026 年他們發表了 CyberGym-E2E,這篇論文已被 ICML 2026 接受。它的開場就寫:「現有對 AI 系統的資安評測在規模或範圍上都受限,未能涵蓋真實世界軟體漏洞發掘與修補的端到端生命週期。」新版做了 920 個漏洞、139 個專案,把「發掘 → 概念驗證 → 補丁」串成一條完整流程來評。
換句話說:同一批作者在後繼論文的開場語裡說「現有評測在規模或範圍上都受限」,那是泛稱,但他們接著做的正是舊版沒涵蓋的那一段;而兩家前沿廠在同一年,拿舊版的分數當作那道閘的正當性依據。 這不是說 85.6 是假的,是說它回答不了那道閘要回答的問題。
(Google 另外報了兩個數字:CWE-Bench 的 pass@1(第一次嘗試就答對的比例)是 47.2%,以及一個「成功率超過 70%」的內部漏洞發掘測試。後者是內部的,無法複核;而 47.2% 這個對外可比的數字,遠低於那個 86.2。)
現在講本篇的核心。
問「這道閘擋不擋得住人」是自然的,但那個問題沒有讀數,三家都不給。換一個問法就有讀數了:繞過這道閘的替代路徑,現在走到哪裡了?
一道閘要有意義,前提是閘外面沒有同樣的東西。名單制擋得住的是「從有閘門的 API 出來」的那條路。它完全擋不住的是另一條:開權重模型,參數公開讓人下載、在自己機房裡跑,沒有任何名單擋得住。
這條替代路徑走到哪了,有人在量,而且是政府機構。2026 年 7 月 17 日,英國 AI Security Institute 首次公開量化開權重模型在資安能力上落後閉源前沿多久。AISI 報告的原話是:
「近期的開放模型 GLM-5.2 與 DeepSeek V4-Pro,表現與比它們早 4 到 7 個月發布的閉源前沿模型相當——這比我們在 2025 年大部分時間量到的 6 到 10 個月差距要窄。」
同一篇還有一句直接對著本篇的主題:
「這意味著,在今日的前沿資安能力可能變得沒有同樣的安全防護就能取得之前,資安防禦方只剩一個很短的窗口可以準備。」
把這個換算成日期:Google 那款是 9 月 2 日發的;差距 4 到 7 個月,開權重的同級能力大約落在 2027 年 1 月到 4 月之間。這個換算有一個明確的但書,下面第二點會講。
但真正該注意的不是那個日期,是 AISI 同一篇裡的第二個發現。差距不是一個數字,是兩個:
這一分,整張圖就清楚了。這道閘在兩條能力軸上的壽命不一樣長:窄項的洞發掘,壽命以季為單位;長跑型的多步作戰,壽命長得多。
然後看三家拿什麼自證。CyberGym(重現一個被描述的漏洞)、CWE-Bench(補丁)、內部的漏洞發掘成功率。每一項都是窄項。沒有任何一家用長跑型作戰的讀數來為那道閘辯護。
也就是說,三家把閘設在壽命最短的那條軸上,並且用那條軸的分數來證明這道閘有必要。 這不必然是壞信念:窄項的東西比較好測,長跑的評測本來就難做。但結果是一樣的:那道閘保護的能力,正是開權重最快追上來的那一種。
這裡必須誠實說出這個推算的兩個弱點,因為它們可能讓時鐘往後走:
其一,AISI 量的是通用模型,三家發的是專用款。 AISI 拿 GLM-5.2、DeepSeek V4-Pro 去比 Claude Opus 4.6、GPT-5,全是通用前沿模型。而 Fairwind 和 Trusted Access 發的是資安專用款。Google 自己的官方稿說 3.8 Flash Cyber「超越 3.5 Flash Cyber,也超越顯著更大的前沿模型」。如果這句話是真的,專用化就有一個真實的溢價,而那個溢價從來沒有被任何人量過。開權重要追的可能不是 4 到 7 個月,而是 4 到 7 個月再加上一個沒人知道大小的專用化差距。
其二,那個差距本身在動。 它從 6 到 10 個月縮到 4 到 7 個月。用一個正在移動的數字外推,只能給區間不能給日期。
這兩點合起來指向同一個動作,而且是本篇認為最值得做的一件事:把 AISI 那把尺對準專用款量一次。 這個量測目前不存在。而它不需要任何人自願揭露核准率,只需要拿現成的開權重模型,跑三家用來自證的那些測驗。做得出來的機構已經在做這件事了:2026 年 7 月,英國 AISI 和美國 NIST 底下的 CAISI 已經聯合評估過開權重的 Kimi K3 的資安能力(在 ExploitBench 上 32%,對照 GLM-5.2 的 24%)。把同一套方法對準專用款,本篇的整個時鐘就從估算變成讀數。
談這類機制的失效,直覺都會往「洩漏」想。但已經發生過的那一次不是。
2026 年 6 月 9 日,Anthropic 的 Fable 5 與 Mythos 5 在 AWS 上線。6 月 12 日,同一份官方公告加了一行更新:
「為遵守美國政府的出口管制指令,Anthropic 已要求 AWS 撤銷所有用戶對 Claude Fable 5 與 Claude Mythos 5 的存取權。所有其他模型,包括 Opus 4.8,不受影響。」
上線三天,全面撤銷。 這件事的規模超過名單縮減:整款東西對所有人一起消失。
這件事改寫了採購方該擔心的順序。如果你是一個把 Fairwind 這類閘後模型放進自己防禦鏈的資安主管,你在想的風險大概是「名單洩漏了怎麼辦」或「我申請不過怎麼辦」。但已經被觀測到的失效模式是第三種:供應商在三天內被政府指令關掉整個 SKU。 而目前唯一一次被觀測到的撤銷,發生在三家裡最早做這件事的那一家身上。
這也正好是 Hugging Face 執行長 Clément Delangue 七月那組論證的實體版。他當時說:「開放模型不是風險,它們是防禦。攻擊者本來就能越獄任何 API 或護欄。防守方沒辦法用一個他們無法控制、檢視、測試或在本地執行的黑箱來守護系統。」這句話當時可以被讀成一個開源公司老闆的立場宣示。他確實有立場,但六月那次撤銷把它變成了一個可觀察的事實:一個你無法在本地執行的元件,可以在三天內從你的防禦鏈裡被拿走,而拿走它的人不是你也不是你的供應商。
還有一個更長的對照組,而且它就是資安產業自己的歷史。
Cobalt Strike 是一套紅隊/滲透測試工具,2012 年問世,商業銷售,現在由 Fortra 持有。它的發行機制和三家前沿廠現在做的事幾乎一模一樣,而且每一項都更嚴:一年一個使用者 3,500 美元(它有價格)、購買要通過廠商驗證、客戶要接受使用限制與出口管制條款,而且每一份授權副本都嵌了唯一識別的浮水印。
結果是有公開紀錄的。破解版與試用版流入了 APT41、Mustang Panda、OceanLotus、FIN7 這些國家級組織,以及 Conti、Ryuk 這些勒索軟體集團,Cobalt Strike 成為真實入侵事件裡最常見的指揮控制框架之一。
而真正把情況扳回來的不是那套審查機制:審查機制從頭到尾都在,它就是失效的那個東西。扳回來的是 2023 年 3 月 31 日紐約東區聯邦法院的一紙命令:Microsoft、Fortra 與 Health-ISAC 以違反授權合約與侵害智慧財產權為由提告,查封了 200 多個惡意網域、通知下架 1,900 多個 IP。Fortra 事後說,惡意使用在接下來兩年內下降了 80%。
這個對照組要小心使用,它有一個真實的邊界:Cobalt Strike 是一份你會拿到一個副本的軟體,而閘後的模型是一個 API,API 沒辦法被破解。所以這段歷史不適用於 API 那條路,只適用於「有一個可下載的成品」那條路,也就是開權重與蒸餾。
但正因為邊界劃在這裡,它反而指出一件更難處理的事。Cobalt Strike 那條救命的路徑之所以走得通,靠的是那個東西在野外可以被指認出來:執行檔上的浮水印、可以查封的指揮控制網域,加上一份可以拿去法院告的授權合約。
一個開權重模型,這三樣都不存在:權重本來就是公開的,沒有授權合約可違反;它跑在別人自己的機器上,沒有網域可查封;而三家至今沒有任何一家揭露過它們的資安款有輸出可追溯的識別機制。
所以這個歷史對照的結論不是「名單制會失敗」,那太廉價了。準確的說法是:這個機制在同類產品上被跑過二十年,它確實失效過,而當年救回它的那條路,在 AI 這一輪是走不通的。
這道閘的壽命不由這道閘決定。名單審得嚴不嚴、核准率高不高,決定的是它擋住了誰;決定它還有多久有意義的,是閘外面那條替代路徑的到站時間。那條路就是開權重模型:參數公開、誰都能下載回自己機房跑,沒有名單擋得住。而那條路有第三方在定期量:目前是落後 4 到 7 個月,而且在收斂。更要緊的是,這個差距不是一個數字而是兩個——窄項的洞發掘追得快,長跑型的多步作戰追得慢——而三家拿來為這道閘辯護的每一個分數,都落在追得快的那一條軸上。之後每一筆「某某能力被管制住了」的主張,都可以拿這條分界線來檢驗:先問那個能力屬於哪一條軸,再問閘外面那條軸現在走到哪裡。
三件事,按優先序:
1. 不要把 Fairwind / Trusted Access 這類程式當成採購項目排進時程,把它當成一條可能斷的供應。 已觀測到的失效跟「你申請不過」無關,真正發生的是整個 SKU 在三天內對所有人消失。你要問供應商的問題不是「多久會核准」,是「如果這款明天不能用了,我的防禦鏈裡有什麼東西會停」。
2. 申請前先看清楚那一款的真實對價。 目前唯一有公開條款的實例(Anthropic/AWS)要求開啟資料分享、接受三十天輸入輸出留存加上人工審查。你要送進去的如果是客戶資料或內部程式碼,這是法務問題不是價格問題。Fairwind 的對應條款目前沒有公開。
3. 分辨你要的是哪一條能力軸。 如果你要的是「把已知漏洞穩定重現然後修掉」(這是三家分數真正涵蓋的),那麼開權重的替代方案在 4 到 7 個月內就會逼近,你的路線圖可以把「等閘後模型」換成「等替代方案」。如果你要的是長跑型的多步攻防演練,替代方案還要更久,而閘後模型在這件事上沒有任何一家公布過分數,你在買一個沒有讀數的東西。
這裡有三個獨立的實作可以當對照組,而它們共同缺的是同一欄:核准率。但本篇要提的建議不是去要那一欄:三家都沒有交出它的動機,而且要得到也未必可信。
更有效的槓桿是一個不需要任何人自願配合的量測:把 AISI/CAISI 現有的那套方法,對準這三款專用款跑一次。這件事只需要現成的開權重模型和三家已經公開的那些測驗。它會一次回答兩個問題:專用化到底值多少個月,以及這道閘還剩多少壽命。目前所有公開的差距讀數比的都是通用模型,那個對比對這場辯論來說是錯的母體。
除第二項外,本篇不為其餘各項自設時間窗:它們的到期由 AISI 後續的量測節奏與三家自己的發布節奏決定。第二項的十二個月是本報自設的觀察窗,自本篇發布日起算。第三項是本篇唯一主動要求的量測,沒有任何機構承諾過會做它。
只留 email,隨時退訂。這是我們唯一想請你做的事。
九月一日,OpenAI 放行 GPT-6 Astra,這是它史上第一個被自家評為「Critical」資安等級的模型:給它工具與權限,它能自己找出沒人知道的漏洞並寫出攻擊鏈。官方的放…
八月底有一個數字在產業裡傳開。OpenRouter 是開發者用來跨數百個模型、數十家供應商比價選路的中轉平台,它公布 GPT-5.6 的 Luna 型號在大幅折扣後,平台上的 to…
本報 2026-08-28 晨報收了一條判斷:那句廣為流傳的安慰話(「別太擔心模型公司變大,因為賺到錢的其實是用它的人」)不是市場結構的性質,是模型公司每一季都可以翻面的資本配置決…
深度:本週還沒有新的一篇。深度只在證據夠強時才出,不排班期。上一篇《那張權證是 Marvell 給 Google 的折扣,價碼約當採購金額的 6%》(2026-08-21)仍在官網…