SecondSource從一手資料重建判斷
模型觀點 · 2026年7月26日

為什麼模型愈練愈會解題、卻愈寫愈不像人?MIT 給了一個機制答案,也剛好解釋了人類專家資料為什麼還缺。

模型觀點 · 本月 趨勢 (2026-07 發表)

本篇出自 2026年7月26日 晨報

目前後訓練(模型練完基礎能力後、再教它怎麼答題的階段)的主力方法 RLVR(可驗證獎勵的強化學習:只在數學、程式這類有標準答案的任務上給模型獎勵)有個結構性盲點:它只優化「可以客觀打分」的東西,對風格、結構這些說不清但重要的品質無感,於是出現輸出變單調、不自然、鑽分數漏洞等大家都見過的毛病。MIT 團隊 7 月的論文提出解法:加一個對抗式的判別器,學著分辨「人寫的」與「模型生的」,把難以量化的品質訊號回灌給訓練;自報結果是修 bug 時改動幅度顯著更小而成績持平、寫故事更像人也更多樣(arXiv,2026-07)。單一團隊自報、未經獨立複現,先當方向看。它與今日主線第 6 點是同一件事的兩面:可驗證獎勵吃不到的那些面向,目前仍要靠人類示範橋接——這正是專家資料這門生意存在的機制原因。其餘方向本週掃描範圍內無重大新論文。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新