SecondSource從一手資料重建判斷
模型觀點 · 2026年8月2日

窄領域訓練的泛化讓 Vinyals 意外,但他押的「模型當評判」正被量測打臉。

模型觀點 · 趨勢觀察 (訪談原發 2026-05-22,學術對照 2026-06/07)

本篇出自 2026年8月2日 晨報

昨夜新進的 15 篇論文尚未處理、本欄無單日增量,出一組「說法對學術」的對照。Vinyals 自陳過去一年改變的想法:在數學/寫程式這類答案可自動核對的窄領域上訓練(AI 圈稱 RLVR,可驗證獎勵的強化學習),產生的跨領域泛化「超出我的預期」;但他明說這題未決:只練數學和程式夠不夠誘發通用解題能力,「我不知道,兩邊都有可能」;他押的解方是讓模型自己當評判,打開無法自動判分的領域(Unsupervised Learning 訪談,2026-05-22 錄製)。學術量測剛好打在這個賭注上:一份 2026-07 的評測研究量到,無參考答案場景下 AI 評判系統性給分過寬,補上參考答案後判定翻轉的比例最高達 85%(arXiv 論文,2026-07);另一份 2026-06 的判分器設計研究量到,以單元測試充當判分器對特定錯誤型的偵測力可以是零,而且錯的判分器給的回饋比沒有回饋更糟(arXiv 論文,2026-06)。並列讀:「寫不出判分器的領域」正是 AI 評判目前最不可靠的領域。賭注不是不能押,是目前的量測不站在它那邊。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新