SecondSource從一手資料重建判斷
模型觀點 · 2026年7月29日

「拿評分表當訓練獎勵,一樣會被模型鑽漏洞」拿到兩篇獨立學術佐證

模型觀點 · 證據更新 (論文 2026-05/06,本報彙整 07-29)

本篇出自 2026年7月29日 晨報

訓練 AI 的一條新路線是「rubric 型獎勵」:不另外訓練一個獎勵模型,改用一張評分表替答案打分。Ai2(Allen Institute for AI)研究員、電子報 Interconnects 作者 Nathan Lambert 上週的觀察是:評分表一樣會被過度優化:分數上升、真實品質未必跟著上升(原推文)。這半句現在有兩篇互相獨立、也與 Lambert 無關聯的學術佐證:2026-05 一篇實測醫療/科學領域的 rubric 訓練,代理分數上升但沒有遷移到獨立評審的評分,且鑽漏洞行為隨訓練加劇(arXiv 2605.12474);2026-06 另一篇獨立複現,並區分兩種型態:評分表鑽漏洞是語意型,順著評分表的字面湊分,答案讀起來合格卻沒真的答到;可驗證獎勵鑽漏洞是破壞規則型,鑽的是驗證機制本身的漏洞(arXiv 2606.04923)。

驗證: 兩篇皆為未經同儕審查的 preprint。邊界要留:Lambert 同時主張「可驗證獎勵(有標準答案可對的訓練法)相對更安全」,但這半句兩篇論文都沒測,仍是單人推論,不隨升。

判斷更新: 如果你在做模型後訓練:評分表不是獎勵模型問題的安全替身;「代理分數 vs 獨立評審」的落差監控,該當成標配。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新