SecondSource從一手資料重建判斷
模型觀點 · 2026年8月3日

K3 與 Opus 4.8 的「差一分」拆到任務層:能力剖面真的重合,殘差集中在數學一項。

模型觀點 · 趨勢觀察 (貼文原發 07-17)

本篇出自 2026年8月3日 晨報

先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthropic 上一代旗艦 Opus 4.8 在這張榜上只差一分。這張榜的具體讀數攤開來是:K3 57 分、Opus 4.8 56 分,同榜 GPT-5.6 為 59、Fable 5 為 60,K3 排第 3;「差一分」發生在前段班擠在四分之內的區間裡。至於這張榜的滿分刻度與各分項的加權方式,本報未入庫,能交代的只有同榜的分數與名次,拆不出總分是怎麼加起來的。Teortaxes 再把逐任務成績攤開:K3 在幾乎每一項任務上都與 Opus 4.8 相同,唯一顯著落後的是一個數學積分題項;若該項補到 DeepSeek 的 90.7 分,總分將達 78.8(Teortaxes,07-17)。這裡要提醒一件事:90.7 與 78.8 出自另一份第三方逐任務評測,Teortaxes 貼文稱該評測由第三方 Lisan 提供。Lisan 是何方——個人評測者、工具還是機構——本報未能確認,原始榜單也未取得,這兩個數字只能溯源到 Teortaxes 的轉述。這份評測與前面那個智力指數分屬兩把尺;兩把尺的刻度不能互通,所以這兩個數字既不能拿去跟智力指數的分差相減,並列也不代表它們量的是同一件事。本報的處理是:那份逐任務評測的原始榜單未入庫,加總方式是 Teortaxes 自算,本報沒有重算,這兩個數字未經核對。他順帶的判斷更值得記:「math-maxxing 似乎已不再是各家的優先項」,也就是把數學練到極致這件事正退出前沿實驗室的資源配置(同串)。驗證: 單源讀表、原始榜單未入手;「數學退場」與各家仍高調展演競賽數學的現實方向對立,可能的調和是「展演」與「訓練優先序」是兩件事,本報保留張力、不調和。判斷更新: 「K3 可當 Opus 4.8 平替」這條要換個看法:兩者的能力剖面在逐任務層真的重合,並非各有強弱、剛好互抵,所以選型別再拿單一綜合指數比價,要看逐任務的殘差落在哪一項。給做產品的人一句可操作的:需要強數學能力的產品,不能預期靠下一代通用旗艦自動變好,選型時要把數學項單獨拉出來量。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新