SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年9月3日

配備中のモデルの重みをまるごと開いて実測した人がいて、業界がよく使う節約の前提が覆った。

モデルの読み · 今週 (発表日 9 月 2 日)

この記事の出典 2026年9月3日 夕刊

先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデルは巨大でも、一回に使う計算資源は一部で済む。工程でよく使う節約の手は「最も重要でない専門家を刈り取る」ことで、その重要さを判断する代理指標としてよく使われるのが「この専門家が何回振り分けられたか」になる。独立の研究者 Alexey Fateev は RTX PRO 6000 を 4 枚使い、GLM-5.3 Flash の配備用チェックポイント(総パラメータ 320B、活性 18B)を実際に走らせ、設定ファイルを読むのではなく一項ずつ量って、二つを取り出した。一つ、振り分けられた回数と専門家の実際の重要さは、ほとんど相関しない(スピアマンの順位相関係数は −0.222)。二つ、最も重要でない 2% の専門家を捨てても、出力の系列の 64% が変わった(最も重要な 2% を捨てた場合は 79% になる)(@superalesha、09-02)。これは「刈り取って費用を下げる」という工程の筋にとって悪い知らせになる。 よく使われるあの物差しは別のものを量っており、しかも正しく量れたところで、最も重要でないひと握りが痛みなく外せるわけではない。⚠️ 本紙はこの研究者の過去の実績について資料を持たない。単一のソースによる実測であり、まだ誰も再現していない。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新