模型觀點 · 本月 趨勢 (2026-07 發表)
目前後訓練(模型練完基礎能力後、再教它怎麼答題的階段)的主力方法 RLVR(可驗證獎勵的強化學習:只在數學、程式這類有標準答案的任務上給模型獎勵)有個結構性盲點:它只優化「可以客觀打分」的東西,對風格、結構這些說不清但重要的品質無感,於是出現輸出變單調、不自然、鑽分數漏洞等大家都見過的毛病。MIT 團隊 7 月的論文提出解法:加一個對抗式的判別器,學著分辨「人寫的」與「模型生的」,把難以量化的品質訊號回灌給訓練;自報結果是修 bug 時改動幅度顯著更小而成績持平、寫故事更像人也更多樣(arXiv,2026-07)。單一團隊自報、未經獨立複現,先當方向看。它與今日主線第 6 點是同一件事的兩面:可驗證獎勵吃不到的那些面向,目前仍要靠人類示範橋接——這正是專家資料這門生意存在的機制原因。其餘方向本週掃描範圍內無重大新論文。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…