模型觀點 · 評測 趨勢觀察
本篇出自 2026年8月5日 晨報
評測機構 Artificial Analysis 的 AA-Omniscience 榜設計特殊:答錯扣分、承認不知道不扣分,所以同時量到知識廣度與「拒絕瞎編」的傾向。Teortaxes(今日主線第 1 點的同一位評論者)讀新一輪榜單的重點不在排名:知識面排最前的模型,同時是最會編造的之一(Teortaxes,07-21)。這與 Artificial Analysis 官方今年一月的方法論發現獨立同向:幻覺率與整體智能不相關,知識準確率與總參數量高度相關、與活躍參數幾乎無關(Latent Space 訪談存檔,2026-01)——換過一整批新機種後同一規律複現,一次性快照升成有時間跨度的規律。選型讀法:要冷知識與長尾事實,往大參數走;要「寧可說不知道」的可靠度,看訓練後段的配方與拒答行為——兩者是兩筆帳,拿知識最強的模型當自動評審,同時買進它的編造傾向。他的讀後摘要未附分數,引用先當方向看。
只留 email,隨時退訂。這是我們唯一想請你做的事。
Teortaxes 對 DeepSeek 2024 年底 V3 模型的官方揭露做雙路徑驗算:硬體路徑(卡數 × 每卡實際算力 × 秒數)和模型路徑(活躍參數 × 訓練資料量 × 標…
先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthrop…
K3 發布材料兩條線(經 Teortaxes 逐字轉引):開發後期「一個早期版本的 K3 撰寫了大多數 kernel」。kernel 是決定模型跑多快的底層加速程式,等於用上一版模…
昨夜新進的 15 篇論文尚未處理、本欄無單日增量,出一組「說法對學術」的對照。Vinyals 自陳過去一年改變的想法:在數學/寫程式這類答案可自動核對的窄領域上訓練(AI 圈稱 R…