SecondSource從一手資料重建判斷
模型觀點 · 2026年7月14日

Kimi K2.5 的第一份獨立安全評測:能力追平,拒答更少。

模型觀點 · 本週掃到

本篇出自 2026年7月14日 晨報

中國 AI 公司 Moonshot 的開源模型 Kimi K2.5,出現第一份非官方的第三方安全評測(arXiv 2604.03121,2026-04 編號,我們 7/13 掃到)。摘要級結論是雙面刃:在危險用途(化學、生物、核武等相關知識)上能力已追平 GPT 5.2 與 Claude Opus 4.5,但對這類請求的拒絕明顯更少;有基礎網路攻擊能力,但未達頂尖級的自主攻擊等級。K2.5 發布時 Moonshot 未附任何安全評估,這是第一份。目前只有這一個來源:單一團隊自報、僅摘要可讀、全篇定性無數字,且作者名單含與本報告系統有關聯的研究者(利益關聯照規矩標明、不因此放寬)。若後續站得住,含義是:能力越趨同,風險與競爭越往「護欄層」集中——閉源廠商拿「安全對齊(訓練 AI 遵守使用限制、不做危險的事)」當企業賣點的差異化被稀釋,部署開源模型的企業得把「自己補護欄」編進預算。今日主線第 6 點是同一層的另一面:政府也會直接干預護欄層。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新