モデルの読み · 今週 (発表日 9 月 2 日)
この記事の出典 2026年9月3日 夕刊
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデルは巨大でも、一回に使う計算資源は一部で済む。工程でよく使う節約の手は「最も重要でない専門家を刈り取る」ことで、その重要さを判断する代理指標としてよく使われるのが「この専門家が何回振り分けられたか」になる。独立の研究者 Alexey Fateev は RTX PRO 6000 を 4 枚使い、GLM-5.3 Flash の配備用チェックポイント(総パラメータ 320B、活性 18B)を実際に走らせ、設定ファイルを読むのではなく一項ずつ量って、二つを取り出した。一つ、振り分けられた回数と専門家の実際の重要さは、ほとんど相関しない(スピアマンの順位相関係数は −0.222)。二つ、最も重要でない 2% の専門家を捨てても、出力の系列の 64% が変わった(最も重要な 2% を捨てた場合は 79% になる)(@superalesha、09-02)。これは「刈り取って費用を下げる」という工程の筋にとって悪い知らせになる。 よく使われるあの物差しは別のものを量っており、しかも正しく量れたところで、最も重要でないひと握りが痛みなく外せるわけではない。⚠️ 本紙はこの研究者の過去の実績について資料を持たない。単一のソースによる実測であり、まだ誰も再現していない。
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…
このシミュレータが測るのは、モデルが実際にハードウェア上で動くときの挙動であって、モデル自身の点数ではない。パデュー大学の研究チームが論文を発表し、Nvidia の Ampere、…