模型觀點 · 本週掃到
本篇出自 2026年7月14日 晨報
中國 AI 公司 Moonshot 的開源模型 Kimi K2.5,出現第一份非官方的第三方安全評測(arXiv 2604.03121,2026-04 編號,我們 7/13 掃到)。摘要級結論是雙面刃:在危險用途(化學、生物、核武等相關知識)上能力已追平 GPT 5.2 與 Claude Opus 4.5,但對這類請求的拒絕明顯更少;有基礎網路攻擊能力,但未達頂尖級的自主攻擊等級。K2.5 發布時 Moonshot 未附任何安全評估,這是第一份。目前只有這一個來源:單一團隊自報、僅摘要可讀、全篇定性無數字,且作者名單含與本報告系統有關聯的研究者(利益關聯照規矩標明、不因此放寬)。若後續站得住,含義是:能力越趨同,風險與競爭越往「護欄層」集中——閉源廠商拿「安全對齊(訓練 AI 遵守使用限制、不做危險的事)」當企業賣點的差異化被稀釋,部署開源模型的企業得把「自己補護欄」編進預算。今日主線第 6 點是同一層的另一面:政府也會直接干預護欄層。
只留 email,隨時退訂。這是我們唯一想請你做的事。
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…