模型觀點 · 證據更新 (論文 2026-05/06,本報彙整 07-29)
本篇出自 2026年7月29日 晨報
訓練 AI 的一條新路線是「rubric 型獎勵」:不另外訓練一個獎勵模型,改用一張評分表替答案打分。Ai2(Allen Institute for AI)研究員、電子報 Interconnects 作者 Nathan Lambert 上週的觀察是:評分表一樣會被過度優化:分數上升、真實品質未必跟著上升(原推文)。這半句現在有兩篇互相獨立、也與 Lambert 無關聯的學術佐證:2026-05 一篇實測醫療/科學領域的 rubric 訓練,代理分數上升但沒有遷移到獨立評審的評分,且鑽漏洞行為隨訓練加劇(arXiv 2605.12474);2026-06 另一篇獨立複現,並區分兩種型態:評分表鑽漏洞是語意型,順著評分表的字面湊分,答案讀起來合格卻沒真的答到;可驗證獎勵鑽漏洞是破壞規則型,鑽的是驗證機制本身的漏洞(arXiv 2606.04923)。
驗證: 兩篇皆為未經同儕審查的 preprint。邊界要留:Lambert 同時主張「可驗證獎勵(有標準答案可對的訓練法)相對更安全」,但這半句兩篇論文都沒測,仍是單人推論,不隨升。
判斷更新: 如果你在做模型後訓練:評分表不是獎勵模型問題的安全替身;「代理分數 vs 獨立評審」的落差監控,該當成標配。
只留 email,隨時退訂。這是我們唯一想請你做的事。
AI 數據研究機構 Epoch AI 與評測機構 METR 釋出基準 MirrorCode:要求 AI 在看不到原始碼、不能上網的條件下,只靠指令列輸入輸出去「重新實作」一個目標程…
Stanford 的「平攤評測法」——用「從題目內容預測難度」壓低可靠評測的成本——今天完成定向查證,找到獨立第二證:ICML 2026 一篇論文用同路線做模型能力外推(scali…
Lambert 一年前的「美版 DeepSeek」宣言——2 年、1 到 5 億美元做出權重(模型訓練完的參數檔案)/數據/代碼全開放的前沿模型——本報完成定向查證:專案存在有媒體…
目前後訓練(模型練完基礎能力後、再教它怎麼答題的階段)的主力方法 RLVR(可驗證獎勵的強化學習:只在數學、程式這類有標準答案的任務上給模型獎勵)有個結構性盲點:它只優化「可以客觀…