模型觀點 · 本週 (事件日 08-20)
本篇出自 2026年8月21日 晨報
先講這是誰:Z.ai(智譜)是中國的前沿模型團隊,GLM 系列開放權重模型的開發者,執行長唐杰是清華大學電腦系教授出身。他針對新版 GLM-5.3 提出兩件事(Latent Space,08-20)。第一,參數量已經不足以描述一個模型,要跟資料量、算力花在哪、誰在什麼條件下跑它一起看。第二件才是重點:模型先讀海量文本做預訓練,再用強化學習等方法做後訓練——近兩年能力躍升的主要來源是後者。而後訓練要擴大規模,難的已經不是模型本身,是環境:一個模型可以實際動手操作、要跑很多步才知道成不成功的模擬工作場域(例如給它一整套機器學習基礎設施,要它診斷訓練流程的瓶頸、實作最佳化、跑實驗,並在不弄壞正確性的前提下交出可量測的加速)。這種環境過去靠人工一個一個蓋。唐杰說 Z.ai 已經建好一條產線,把環境端到端合成出來,部分任務連獎勵訊號也一起合成;更關鍵的是打分器是在看不到參考答案的情況下被合成的,要通過三關檢查(餵標準答案要判過、餵「什麼都沒做」要判不過、餵沒解完的中間狀態也要判不過)才算數。
這支持或反駁了本報過去哪條判斷: 本報長期追蹤一條判斷——AI 能力擴張真正的約束不在算力,而在人類驗證的頻寬:機器產出得越快,能判斷「這個對不對」的人就越是瓶頸。唐杰這套說法若成立,等於機器繞過了那個瓶頸的一段。本報保留這個張力,但沒有動那條判斷的分數,理由要說清楚:①這是廠商對自家未發表方法的自述;②沒有第三方複製、沒有對照實驗、沒有任何效能數字,也就是原文沒給 GLM-5.3 的評測分數、沒給提升幅度;③原文說能力躍升「完全」(solely)來自長時程強化學習環境,那個「完全」是原文用詞,本報不認為這代表「唯一原因」。而且那三關檢查本身仍然是一個代理指標,模型仍可能找到「不真的解題也能拿分」的捷徑——那正是那條判斷所描述的失效型態。本報今天也因此主動拒收了一條由它衍生的推論(「環境可以量產,所以環境的稀缺價值會被壓掉」):唯一地基是單一廠商的自述,升格會讓一句行銷語變成本報的機制主張。
怎麼用: 如果你正在編「該不該自建訓練環境」的預算,這條材料給的不是答案,是兩個相反世界的判準——環境供給若真能自動化,靠人工蓋題庫建立的優勢會被壓縮;若只在容易驗證的領域成立,環境仍是稀缺資產,價值會往手上有真實工作流資料的一方集中。 要驗只看兩件事:別人能不能在自己的長時程測驗上重現這個提升幅度,以及那套自動打分真的擋不擋得住抄捷徑。
只留 email,隨時退訂。這是我們唯一想請你做的事。
2025 年 12 月 20 日,OpenAI 發表〈Monitoring Monitorability〉,把「思維鏈好不好監控」做成可量測指標,最關鍵的發現之一逐字是「RL op…
CyberGym 是柏克萊團隊做的公開測驗,收了 1,507 個真實漏洞、涵蓋 188 個開源專案,資料來自 Google 維運的開源模糊測試平台 OSS-Fuzz,所以那些漏洞天…
先解釋:現在的大模型多半是專家混合架構,不是每個字都跑整個大模型,而是把每個字分派給少數幾個專門的子模型,所以模型可以很大而每次只用一小塊算力。工程上常見的省錢做法是「把最不重要的…
美國艾倫人工智慧研究院 9 月 1 日發表 BenchMIRT,用試題反應理論的多維版本逐題拆一個評測到底在量什麼,這套方法本來是心理測驗用來從答題模式估能力的。它吃了 100 個…