モデルの読み · 今週 (出来事の日 08-20)
この記事の出典 2026年8月21日 夕刊
まず誰かを書く。Z.ai(智譜)は中国のフロンティアモデルの開発チームで、GLM 系列のオープンウェイトモデル(モデルの重みを公開し、誰でも自前でホストできる方式)を出している。最高経営責任者の唐杰は、清華大学コンピュータサイエンス学科で教授を務めた人物である。彼は新版の GLM-5.3 について二つのことを述べた(Latent Space、08-20)。第一に、パラメータ数はもうモデルを言い表すのに足りない。 データの量、計算資源をどこへ使ったか、誰がどんな条件で走らせるか——それらと一緒に見る必要がある。第二のほうが本題だ。 モデルはまず膨大な文章を読んで事前学習し、そのあと強化学習などでポストトレーニングを受ける。この二年の能力の跳ね上がりは、主として後者から来ている。そしてポストトレーニングを大きくするとき、難しいのはもうモデル自体ではない。環境である。 モデルが実際に手を動かして操作でき、何手も進めてはじめて成否の分かる、模擬された仕事場のことだ(たとえば機械学習の基盤を一式渡し、訓練の流れのどこが詰まっているかを診断させ、最適化を実装させ、実験を走らせ、正しさを壊さないまま測れる高速化を出させる)。この種の環境は、これまで人が一つずつ建てていた。唐杰によれば、Z.ai はすでに一本の産線を組み上げ、環境を端から端まで合成し、一部の課題では報酬信号まで一緒に合成しているという。さらに重いのは、採点器が模範解答を見ないまま合成されているという点だ。その採点器は三つの関門を通らねばならない。模範解答を食わせれば合格と判じ、「何もしていない」を食わせれば不合格と判じ、解き終わっていない途中の状態を食わせてもやはり不合格と判じる。それではじめて数に入る。
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…