SecondSourceAI 產業洞見 · 完整版檔案庫

晨報 SecondSource 晨報 · 2026/8/7 · 2026年8月7日

2.8 兆參數的 Kimi K3 把權重和技術報告攤開,訓練過千億參數模型的行家逐節拆完:沒有新科學,全是壓住數值爆炸的工程手段——前沿門檻正從「誰有祕方」變成「誰的工程快」

本期一眼

今天略過的: X 上流傳的「GPT-6 已接近」說法,本報一字不收:我們看到的只有一則未具名的二手轉述,轉述者自己都標注存疑——沒有具名出處,也沒有第二個獨立來源,過不了收錄門檻。

本期取材自 2026-08-07 的研究日報;主線四則原發 7 月 27 日(K3 開放權重當天的第一手判讀,屬延後消化,逐條標原發日),晶片欄為兩週前判斷的當日查證升級。昨夜掃進 221 筆新素材(學術論文 50 篇、X 追蹤對象貼文打包檔 122 份、部落格 44 篇、電子報 4 份、公司申報 1 篇),全數排隊未動;本期 6 條收據(5 新 + 1 升級)全部來自 7 月底 X 積壓檔的定向處理。固定欄目照點名:本週無新的具名大神觀點——主線兩位判讀者即本欄材料,不另立;本期無模型觀點(昨夜 50 篇論文尚未消化);本期無產品動態(近 48 小時 16 篇產品文僅有標題級素材,兩條標題級訊號列「也發生了」)。

這是本期完整版(官網存檔正本):每一則全文展開。email 版為每日精選核心全文+其餘一行摘要的縮短版,點「全文」即回到本頁。雙版式試行第 12 天(共兩週),文末有一鍵回覆。

今日主線

1.[證據更新](判讀原發 07-27,本報今日入帳)拆完 K3 技術報告,行家看到的不是魔法:三條軸、一整排壓住數值爆炸的繃帶

先說判讀者是誰:Susan Zhang,曾主導 Meta 在 2022 年開源的 1750 億參數模型 OPT-175B 的訓練——親手踩過「模型放大之後數值造反」的坑,正是讀這份報告的專業對口。7 月 27 日 K3 權重與報告公開當天(事件本身見第 2 點),她逐節拆解後的收束是:整份報告的主題只有「規模化下的數值穩定性仍是硬問題」(Susan Zhang,07-27)。什麼叫數值爆炸:模型放大到兆參數尺度,訊號在幾百層之間傳遞會溢出電腦能表示的數值範圍,訓練直接失敗。她把 K3 的架構選擇攤在三條軸上——序列長度、深度、寬度——每條軸各有一組「繃帶」壓住數值的動態範圍(三軸整理,07-27):例如把注意力機制的衰減項搬到對數空間計算,躲開「有限精度除以極小數」的爆炸;又例如整個模型的權重都壓到 4 位元低精度存(見第 2 點),最脆弱的注意力輸出卻反過來退回 32 位元全精度保命(NoPE 與全精度,07-27)。她還抓到一處默默的撤退:上一代以「緩解注意力分數異常集中」為名引入的低秩設計,這一代被拿掉改回全尺寸——等於原廠用行動承認當初沒解掉問題(低秩撤退,07-27)。她的總結值得整句抄:瘋狂的工程讓你做得起瘋狂的架構(原句,07-27)。

驗證: 單一專家的判讀,對象是 Moonshot 自述的技術報告,可信度按單一來源封頂;各條繃帶「為何而加、解什麼問題」是她的專業推斷,不是官方說法。她與第 2 點的另一位判讀者互不相識、各自成文,但沒有第二位同等資歷者做過同樣的逐節解剖。

判斷更新: 本報 8 月初擱置過一條候選判斷:「前沿模型的傳統護城河——算力、資料、人才數——逐項失效,剩下的變數是研究文化」,當時擱置的主因是全部證據出自同一位評論者。今天這條解剖補上一條部分獨立的腿:一位與他無關、立場中性的一線從業者,支撐了「前沿優勢是工程執行、不是祕方科學」那一半。但本報維持擱置:她只講了工程,沒講文化,這中間還隔一步推論,那一步目前仍只有原評論者一人在走——順帶一記,他當天也說了方向一致的話(Anthropic 在訓練科學上沒有想像中的深優勢),但同一張嘴不算第二票。給讀者的可操作角度不用等:讀前沿技術報告時別只抄跑分,數繃帶——當一份報告攤開全是「壓住數值爆炸」的手段,護城河問題就從「誰握有別人沒有的科學」變成「誰的工程團隊貼繃帶貼得快」。

這對投資判斷的意思: 市場給前沿實驗室的溢價,有一部分掛在「獨有科學」的想像上;這條證據把評估重點往工程團隊的執行力移——「祕方溢價」少了一條支撐,挖角一個能貼繃帶的團隊比買算力更能改變格局。

2.[證據更新](發布日 07-27,本報今日入帳)K3 如期兌現開放權重的承諾,報告補上三個官宣沒說的數字

與今日主線第 1 點合看——這是被解剖的那個事件本身。本報 7/17 期報過 K3 的官宣:2.8 兆參數、上下文窗 100 萬 token,當時就承諾 7 月 27 日開放權重。今天記的是承諾兌現:27 日當天,權重如期上架模型託管平台 Hugging Face、技術報告同步公開(Susan Zhang,07-27)。兩位互不相識的專業讀者當天逐節讀報告,補上官宣沒有的三個數字:啟用參數 1040 億——對照總參數 2.8 兆,每次推理只動用不到 4%(Teortaxes,07-27);權重用 MXFP4、活化值用 MXFP8 的微縮浮點低精度格式——4 與 8 位元,省頻寬省記憶體,代價就是第 1 點講的那些繃帶(同上,07-27);每個 token 派給專家的運算量與上一代 K2 完全相同——省下的頻寬拿去把啟用專家數翻倍,不是拿去省成本(專家派發式,07-27)。報告沒揭訓練資料量;「訓練量超過 2×10²⁵ FLOP、中國史上訓練過最大的模型」是其中一位讀者的個人推估,不是報告數字(推估原文,07-27)。

驗證: 事件面(權重上架、報告發布)由兩位互不相識的讀者當日各自確認,算兩條獨立腿;但規格數字兩人讀的都是 Moonshot 自己寫的報告——兩條腿只保證「報告如此寫」,不保證寫的是真的。要拿這些數字估算自行部署的算力需求可以,要重壓,等獨立復現(第三方跑分、權重檔解析)。

判斷更新: 「開放權重承諾」到底是行銷話術還是可驗承諾,中國實驗室這一局給了一個乾淨的正例:官宣時把日期寫死,到期如約交付,權重和報告真的可下載可查驗。本報 8/4 期記過阿里 Qwen3.8-Max 同款的「權重下週上架」承諾——同一把尺,接著量它。

這對投資判斷的意思: 對中國開放權重生態的常見疑慮是「承諾不可信、開放是姿態」;如期兌現加上可查驗的交付強化了生態可信度那條腿,但規格數字仍是自述——強化的是「會交貨」,還不是「貨如其言」。

3.[證據更新](立場文 07-27 發布,接收面今日入帳)Anthropic 立場文發出數小時後,光譜兩側的評論者讀出同一件事:公關重定位

本報 8/6 期講過 Anthropic 在 270 家開放權重連署上的立場性缺席,與它 7 月 27 日的官方立場文(執行長 Dario Amodei 署名:從未主張禁止開放權重、但主張打擊工業級蒸餾等四點,Anthropic 官方,07-27)。今天補上這份文件發布當天的市場接收面。發文數小時內,兩位立場光譜相反的評論者各自成文、收斂到同一判讀。立場中性的 Susan Zhang 說這是 Dario 談中國「歷來最客氣的一次」,但猜背後有人在調教公關機器(Susan Zhang,07-27);長期追蹤中國實驗室、對 Anthropic 一貫對抗的匿名評論者 Teortaxes,則翻出 Dario 三篇舊文對質,指新文與他「中國只要落後不到兩年就是噩夢」的既往立場不相容,屬於改寫自身紀錄(Teortaxes,07-27)。同日還有一條張力照規矩記帳:同一位匿名評論者聲稱「有還算可信的訊息」指 Anthropic 內部有一個更大的、不對外服務的教師模型,對外模型是它的蒸餾產物——蒸餾指拿一個模型的輸出當教材訓練另一個模型。這條是未具名二手、零可查證錨點、來源立場一貫對抗,本報只記「有此傳聞」,不當事實引用(傳聞原文,07-27)。收錄理由不是真假,是它標出了辯論下一步的靶位:立場文主張打擊「工業級蒸餾」,若傳聞為真,政策攻防會集中在「蒸自己的模型(用自有資產)vs 蒸別人家的 API(其指控對象)」這條產權分野上——技術上同構,產權上不同。

驗證: 兩條判讀都是意見不是事實;這一條的證據價值在「收斂」本身——互不相識、立場幾乎相反的兩人,同日讀出同一件事,比任一單方意見更接近市場共識。舊文對質是可查證的(三篇舊文都公開),但本報未逐字比對,不裁「不一致」是否成立。傳聞部分零錨點,只當「有此傳聞」用。

判斷更新: 昨天記的是「缺席的代價在變貴」;今天補上出面說明之後的效果:訊息送達了,可信度打了折。對追政策攻防的讀者,教訓是文本與接收要分開追——當兩側評論者對同一份文件收斂到「公關重定位」,下一份立場文的措辭就該對著這個讀法設防。

這對投資判斷的意思: 敘事原本假設官方立場文能修復「對開源宣戰」的定位傷害;兩側同日讀成公關重定位,等於修復效果打折——對 Anthropic 在開放權重攻防裡的話語權,是弱化訊號。

4.[趨勢觀察](訊號日 07-27)兩條人才面微訊號,合成一條還沒定論的寒蟬假說

K3 發布同一天,兩條人才面的小訊號。第一條:Kimi 員工在 X 上的公司關聯認證標籤(員工帳號掛所屬公司徽章的機制)被觀察到集體摘除,觀察者自己都標注「可能只是暫時」(Susan Zhang,07-27);摘除的機制未知——平台政策、官方要求、公司自摘、技術故障都有可能。第二條:Teortaxes 同日公開「勸」前沿實驗室的華裔研究員:別公開唱衰美方、別吹捧中國,「對你的職涯好」(原文,07-27)。兩條合成一條假說:在美華裔 AI 研究員的公開言論空間正在收緊。這條要跟人才流的另一頭合看——中國實驗室那頭本來就有把開放發布當攬才誘因的拉力訊號;若美方環境同時出現推力,人才回流的速度會超過單看任何一頭的預期。

驗證: 假說級,離定論很遠:標籤摘除只有一位觀察者、機制未知、可能已恢復;「勸誡」是氛圍判斷不是事件證詞,第二個來源只撐得起氛圍、撐不起事件。翻盤條件:標籤若查明只是平台技術故障且已恢復,這條降回雜訊。觀測點是訊號有沒有累積——摘標籤常態化、更多自我審查案例出現,就該把人才回流的預期提前。

也發生了

深度報告

核心判斷: K3 授權牆的可證實功能,是守住自家 API 的價格地板、握住通路的白名單開關——不是收租。

為什麼現在挖: 上一篇深度報告拆完 K3 授權條款本體(權重免費,但經營推理服務且集團年營收超過兩千萬美元須另簽),留下一個問題:這道牆收不收得到錢。K3 開放滿一個月,市場給出一個反常讀數:12 個第三方服務端點裡 8 個報價與官方一分不差——上一代 K2 還有 12% 到 33% 的第三方折價,這一代歸零。歷史(2010 年代開源資料庫商與雲廠的同型戰爭:雲廠從沒付過「使用開源碼」的授權費,把牆築最高的兩家分別在 43 個月和 13.5 個月後自己拆牆)、條文精讀(排除款把「單純出租 GPU」剃出射程)、第一個月的市場機器讀數,三條線同向。「價值橫移到美國雲」的帳因此要分兩層記:機架層照舊留在美國,授權回收口只開在按 token 賣服務那一層——量級尚小,費率零揭露。

基建層捕獲期(2023-25)價值被晶片/電力/記憶體吃走,模型商賣 token 賠錢(2024推理毛利 -94%)
單 token 經濟翻正(2026H1)agentic 需求 × token 成本崩;推理毛利轉正、首個獲利季在望——但留不留得住開吵

進行中 ?

路徑A定價權持久論(SemiAnalysis):短缺+品質差距→按價值定價,低毛利時代結束
路徑B商品化預設論(Evans/Narayanan):賣 token 無差異+零切換,毛利遲早被壓向成本
路徑C需求摻水論(Gurley/Chamath):現在的需求訊號含補貼與未清算的 ROI,資本窗一關會現形

什麼會推翻它: 任一方公開揭露授權費率且金額可觀,「不收租」的讀法翻盤;90 天內第三方報價重現上一代式的折價分層,「授權地板」的解釋削弱;任何實驗室用寬鬆授權放出同級模型,牆的窗直接關閉。

對答案日: 最近的兩個帶日期資料點是 CoreWeave 8 月 11 日、Nebius 8 月 12 日的第二季財報——「美國雲承接中國開放權重模型」第一次有法定揭露等級的量;第三方折價的觀察窗看到 2026 年 11 月 5 日。

完整深度版今晚美國中部時間 7:30(台灣時間明早)另寄一封到同一個信箱。

以上是濃縮版——完整深度版今晚美國中部時間 7:30 另寄一封到同一個信箱。

晶片與半導體(校準更新)

[證據更新](原判斷 07-25 入帳,今日部分坐實)「AI agent 正在削 CUDA 護城河」——工業化那一半有官方一手了。 本報 7/25 期報過半導體研究機構 SemiAnalysis 對 AMD 的改口,其中一條核心主張是:AI agent 自動寫、自動調 GPU 底層運算程式(kernel),正在侵蝕 Nvidia 靠十幾年軟體積累築起的 CUDA 護城河。當時整條只有它一家之言。今天完成定向查證:AMD 官方技術部落格(7 月 20 日)坐實了其中工業化的那一半——GEAK 確實是橫跨三種核心語言、倉庫級的 agent 驅動優化框架,而且「候選修補要先過正確性與基準把關才計入增益」的防作弊設計官方可見——防的是 agent 為了拿高分而作弊,例如偷改測試基準(AMD ROCm 官方,07-20SemiAnalysis 原文,07-25)。驗證: 升級的只有「AMD 把這件事工業化」這一腿;SemiAnalysis 自家「2.5 人團隊用 agent 做晶片適配」的經驗,與 +21.8% 的端到端增益數字,仍是單源——那個數字在 AMD 官方文裡沒有出現。判斷更新: 這條判斷從「只有分析機構聲稱」升為「工業化那一半有官方一手」;可信度上調,但整條未坐實,兩週前的邊界句今天照樣有效。

過去洞見

[趨勢觀察](事件日 2026-07-27)循環融資的市場反應翻轉:同類安排從「利多」變成「風險」定價,而且先發問的是債市。 本報 7/29 期頭條報過這件事:Nvidia 被報導考慮為 OpenAI 在俄亥俄州的資料中心計畫提供 2,500 億美元等級的貸款兜底(SiliconANGLE,07-27),消息當天 Nvidia 跌了 5%。值得留下來的洞見是對照:更早以前,同類「供應商替客戶融資、客戶回頭買自家產品」的循環融資消息,市場的反應是漲——把它讀成需求的證明;這一次讀成風險。而且真正先發問的不是股市:Nvidia 公司債的違約保險費(CDS,付一筆保費對賭發債方違約的衍生品,保費越貴代表市場認定風險越高)一個月翻倍、創歷史新高(Investing.com,07-28Bloomberg,07-27)。循環融資本身不是新聞,新聞是市場開始對它要求風險補償——債市比股市誠實,因為債市只關心「還不還得起」這一個問題。放到今天正好用:AI 資本支出的融資結構越來越依賴這類互相擔保的安排,下次再看到「某巨頭替某實驗室作保」的消息,先看 CDS 和公司債利差,再看股價。

來源與盤點

過去 24 小時。 昨夜進來 221 筆待處理:學術論文 50 篇、X 追蹤對象的貼文打包檔 122 份(每份是一位追蹤對象的近期貼文集合)、公司與個人部落格 44 篇、業界電子報 4 份、公司申報 1 篇。論文與貼文打包檔單位不同,分開計,不加成一個總數讀。這批全數排隊;今天白天處理的都是積壓件,沒有動這批新進。覆蓋聲明:以上是我們自己的抓取紀錄,分不出某個來源是真沒發文還是我們沒抓到;能保證的只有這個掃描範圍內的訊號。

白天實際處理(非過去 24 小時的進料)。 本期主線材料來自 X 積壓檔的定向處理:原發 7 月 27 至 28 日的 4 個帳號檔——2 個有訊號(@suchenzang 16 則、@teortaxesTex 86 則,後者大多為地緣政治嘲諷,過濾後留下 AI 產業相關的十餘則)、2 個誠實記無(一位評論作者當窗只有雜談與一句未具名的「GPT-6 接近」轉述;一位企業執行長只有兩則純連結分享)。另有 1 條定向查證(晶片欄)。本期無一次性回填,無新增追蹤來源。

來源集中度提醒。 今天 4 則主線的證據腿高度集中在 Susan Zhang 與 Teortaxes 兩個帳號——這是延後消化 7 月 27 日單日窗的結構性結果:那天是 K3 開放權重日,兩位都在密集發文。緩解說明:兩人互不相識、立場光譜相反(一位中性、一位親中國開放權重且對 Anthropic 一貫對抗,正文逐處標注);事件面各算獨立腿,但規格數字的底層同為 Moonshot 自述報告,正文已帶「報告如此寫」的折價;凡單人判斷(訓練量推估、能力對標、出貨預測)全篇標注單源。

我們追蹤的來源。 本報判斷的底層,目前追蹤的聲音包括:X 302 人(Elon Musk、Andrej Karpathy、Greg Brockman、Nathan Lambert 等)、播客 90 人(Satya Nadella、Dario Amodei、Demis Hassabis 等)、新聞媒體 51 家、個人部落格 48 人(Simon Willison、Chris Olah 等)、論文作者 48 人(Noam Shazeer、Percy Liang、Tri Dao 等)、電子報 46 份(Dylan Patel、Ben Thompson、Ethan Mollick 等)、財報與法說 26 家、主題演講 23 場。

本報不是新聞摘要:我們從每天的 AI 資訊流裡捕捉真正重要的洞見與值得長期追蹤的行家判斷,並交代每一條是怎麼驗證的:重點永遠是「哪條判斷變硬了、誰說得準」,不是今天發生了什麼。