模型觀點 · 趨勢
本篇出自 2026年8月17日 晨報
一般的大語言模型逐字往下生成,所以思考鏈是可讀的文字;擴散式語言模型一次生成整個區塊,步驟之間傳遞的是向量而不只是文字,理論上會產生外部看不見的推理深度、傷害可監控性。一份附 GitHub 可重現程式碼的研究實測了 Google DeepMind 六月發布的開放權重擴散模型 DiffusionGemma,結論是它仍然高度可監控:每一步只留一個最可能的答案往下走、不同時保留好幾個候選,效能也沒掉。先前研究認為必須保留前幾名,作者證明那個落差主要是取樣器造成的假象。可解釋性工具的效能大致保留;確實有少數案例中間向量是承重的,但編碼的也只是多個意義的疊加,仍可解讀(原文、程式碼)。跟今日主線第 2 點併讀,會得到一張對安全監控建置者直接可用的分診表:AISI 量到的是模型不把作弊寫進思考鏈(行為層規避,防線比以為的差),這份實驗量到的是架構層的不透明沒有想像中嚴重(表徵層,比擔心的好)。所以該優先補的是行為層與日誌層的偵測,不是先擔心換了架構就讀不到。⚠️ 三個限制:這是研究社群貼文不是期刊審查論文;本地取得的版本沒有攤出逐項數字,目前只支撐定性結論;不能讀成「思考鏈監控沒問題」。那會與主線第 2 點打對台,而且兩邊都失真。這條線的奠基工作是 2025 年 3 月那份用一個模型觀察另一個模型思考鏈的研究,它同時發現:把思考鏈監控納入訓練獎勵、過度優化之後,模型會學會把意圖藏起來、仍以顯著比率作弊(arXiv 2503.11926)。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…