SecondSource從一手資料重建判斷
模型觀點 · 2026年8月21日

Z.ai 執行長唐杰:post-training 真正卡住的地方已經不是模型,是環境——而他說環境和打分器都能自動合成。

模型觀點 · 本週 (事件日 08-20)

本篇出自 2026年8月21日 晨報

先講這是誰:Z.ai(智譜)是中國的前沿模型團隊,GLM 系列開放權重模型的開發者,執行長唐杰是清華大學電腦系教授出身。他針對新版 GLM-5.3 提出兩件事(Latent Space,08-20)。第一,參數量已經不足以描述一個模型,要跟資料量、算力花在哪、誰在什麼條件下跑它一起看。第二件才是重點:模型先讀海量文本做預訓練,再用強化學習等方法做後訓練——近兩年能力躍升的主要來源是後者。而後訓練要擴大規模,難的已經不是模型本身,是環境:一個模型可以實際動手操作、要跑很多步才知道成不成功的模擬工作場域(例如給它一整套機器學習基礎設施,要它診斷訓練流程的瓶頸、實作最佳化、跑實驗,並在不弄壞正確性的前提下交出可量測的加速)。這種環境過去靠人工一個一個蓋。唐杰說 Z.ai 已經建好一條產線,把環境端到端合成出來,部分任務連獎勵訊號也一起合成;更關鍵的是打分器是在看不到參考答案的情況下被合成的,要通過三關檢查(餵標準答案要判過、餵「什麼都沒做」要判不過、餵沒解完的中間狀態也要判不過)才算數。

這支持或反駁了本報過去哪條判斷: 本報長期追蹤一條判斷——AI 能力擴張真正的約束不在算力,而在人類驗證的頻寬:機器產出得越快,能判斷「這個對不對」的人就越是瓶頸。唐杰這套說法若成立,等於機器繞過了那個瓶頸的一段。本報保留這個張力,但沒有動那條判斷的分數,理由要說清楚:①這是廠商對自家未發表方法的自述②沒有第三方複製、沒有對照實驗、沒有任何效能數字,也就是原文沒給 GLM-5.3 的評測分數、沒給提升幅度;③原文說能力躍升「完全」(solely)來自長時程強化學習環境,那個「完全」是原文用詞,本報不認為這代表「唯一原因」。而且那三關檢查本身仍然是一個代理指標,模型仍可能找到「不真的解題也能拿分」的捷徑——那正是那條判斷所描述的失效型態。本報今天也因此主動拒收了一條由它衍生的推論(「環境可以量產,所以環境的稀缺價值會被壓掉」):唯一地基是單一廠商的自述,升格會讓一句行銷語變成本報的機制主張。

怎麼用: 如果你正在編「該不該自建訓練環境」的預算,這條材料給的不是答案,是兩個相反世界的判準——環境供給若真能自動化,靠人工蓋題庫建立的優勢會被壓縮;若只在容易驗證的領域成立,環境仍是稀缺資產,價值會往手上有真實工作流資料的一方集中。 要驗只看兩件事:別人能不能在自己的長時程測驗上重現這個提升幅度,以及那套自動打分真的擋不擋得住抄捷徑。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新