模型觀點
本篇出自 2026年8月30日 晨報
一位使用者回報 Qwen3.8-Flash 在低精度下多輪追蹤壞掉,把鍵值快取換回較高精度之後修好了(QuixiAI,08-29)。鍵值快取存的是先前每個字的向量,多輪對話靠它維持狀態;把它壓到低精度會累積誤差,而誤差在單輪推論裡看不出來、在多輪追蹤裡才爆掉。⚠️ 這是單一使用者的部署經驗,只有一個案例。但它指出的東西是普遍的:發布時的規格與價格全是單輪指標,實際部署的失效卻出現在狀態維持上,而沒有任何一家實驗室在發布時提供多輪穩定性的讀數。照著發布數字做採購決策的人,缺的就是這一項。規格與價格可以並排比,狀態維持的可靠度不能:三家追平規格,不等於買方的採購風險跟著追平。
只留 email,隨時退訂。這是我們唯一想請你做的事。
2025 年 12 月 20 日,OpenAI 發表〈Monitoring Monitorability〉,把「思維鏈好不好監控」做成可量測指標,最關鍵的發現之一逐字是「RL op…
CyberGym 是柏克萊團隊做的公開測驗,收了 1,507 個真實漏洞、涵蓋 188 個開源專案,資料來自 Google 維運的開源模糊測試平台 OSS-Fuzz,所以那些漏洞天…
先解釋:現在的大模型多半是專家混合架構,不是每個字都跑整個大模型,而是把每個字分派給少數幾個專門的子模型,所以模型可以很大而每次只用一小塊算力。工程上常見的省錢做法是「把最不重要的…
美國艾倫人工智慧研究院 9 月 1 日發表 BenchMIRT,用試題反應理論的多維版本逐題拆一個評測到底在量什麼,這套方法本來是心理測驗用來從答題模式估能力的。它吃了 100 個…