SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年8月3日

K3 と Opus 4.8 の「1 点差」をタスクの層まで割る:能力の輪郭は本当に重なっており、残差は数学の 1 項へ集まっている。

モデルの読み · トレンド観察 (投稿の初出は 07-17)

この記事の出典 2026年8月3日 夕刊

先に、この「1 点差」がどの物差しで測られたものかを書く。第三者の評価機関 Artificial Analysis の総合の知性の指数、つまり複数の試験を重み付けして 1 つの総点へまとめた順位表である。Kimi K3 と Anthropic の前の世代の旗艦 Opus 4.8 は、この表で 1 点しか違わない。この表の具体の読み値を並べるとこうなる。K3 が 57 点、Opus 4.8 が 56 点、同じ表で GPT-5.6 が 59、Fable 5 が 60 であり、K3 は 3 位である。「1 点差」は、先頭の集団が 4 点のなかにひしめく区間で起きている。この表の満点の目盛りと各項の重み付けの方法については、本紙は取り込んでおらず、述べられるのは同じ表の点数と順位までであって、総点がどう足し上げられているかは分解できない。Teortaxes はさらにタスクごとの成績を並べる。K3 はほとんどすべてのタスクで Opus 4.8 と同じであり、はっきり劣っているのは数学の積分の 1 項だけである。この項が DeepSeek の 90.7 点まで埋まれば、総点は 78.8 に達する(Teortaxes、07-17)。ここで注意を 1 つ。90.7 と 78.8 は別のタスクごとの第三者の評価から出ており、Teortaxes の投稿は、その評価が第三者の Lisan によるものだと述べている。Lisan が何者か——個人の評価者か、道具か、機関か——を本紙は確認できておらず、元の順位表も入手していない。この 2 つの数字は、Teortaxes の転述までしか遡れない。この評価と、先の知性の指数は別の物差しである。2 本の物差しの目盛りは通じ合わないので、この 2 つの数字を知性の指数の点差から引き算することはできず、並べたからといって、同じものを測っているわけでもない。本紙の扱いはこうである。そのタスクごとの評価の元の順位表は取り込んでおらず、合計の仕方は Teortaxes の自算であり、本紙は計算し直していない。この 2 つの数字は未照合である。彼がついでに述べた判断のほうが記録に値する。彼の言う math-maxxing、つまり数学を極めることは、もう各社の優先の事項ではないように見える、というものである。つまり数学を極限まで鍛えることが、フロンティアラボの資源の配分から退きつつある(同じスレッド)。検証: 単一のソースによる表の読み取りであり、元の順位表は入手していない。「数学の退場」は、各社がなお競技の数学を派手に見せている現実とは向きが逆である。あり得る調停は「見せること」と「学習の優先の順序」は別だというものだが、本紙は緊張をそのまま残し、調停しない。判断更新: 「K3 は Opus 4.8 の代替になる」という読みは、見方を変える必要がある。両者の能力の輪郭はタスクの層で本当に重なっており、互いに強弱があってちょうど相殺しているのではない。だから選定のときに単一の総合の指数で値段を比べるのはやめ、タスクごとの残差がどの項に落ちているかを見ること。製品を作る人へ、手を動かせる形で 1 つ。強い数学の能力が要る製品は、次の世代の汎用の旗艦が自動で良くしてくれると期待できない。選定のとき、数学の項だけを単独で取り出して測ること。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新