SecondSource從一手資料重建判斷
模型觀點 · 2026年8月5日

知識廣度與誠實度是兩條可以分開的軸,規模只推得動前者。

模型觀點 · 評測 趨勢觀察

本篇出自 2026年8月5日 晨報

評測機構 Artificial Analysis 的 AA-Omniscience 榜設計特殊:答錯扣分、承認不知道不扣分,所以同時量到知識廣度與「拒絕瞎編」的傾向。Teortaxes(今日主線第 1 點的同一位評論者)讀新一輪榜單的重點不在排名:知識面排最前的模型,同時是最會編造的之一(Teortaxes,07-21)。這與 Artificial Analysis 官方今年一月的方法論發現獨立同向:幻覺率與整體智能不相關,知識準確率與總參數量高度相關、與活躍參數幾乎無關(Latent Space 訪談存檔,2026-01)——換過一整批新機種後同一規律複現,一次性快照升成有時間跨度的規律。選型讀法:要冷知識與長尾事實,往大參數走;要「寧可說不知道」的可靠度,看訓練後段的配方與拒答行為——兩者是兩筆帳,拿知識最強的模型當自動評審,同時買進它的編造傾向。他的讀後摘要未附分數,引用先當方向看。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新