SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年8月21日

Z.ai 最高経営責任者の唐杰:ポストトレーニングで本当に詰まっているのは、もうモデルではない。環境だ——そしてその環境も採点器も自動で合成できる、と彼は言う。

モデルの読み · 今週 (出来事の日 08-20)

この記事の出典 2026年8月21日 夕刊

まず誰かを書く。Z.ai(智譜)は中国のフロンティアモデルの開発チームで、GLM 系列のオープンウェイトモデル(モデルの重みを公開し、誰でも自前でホストできる方式)を出している。最高経営責任者の唐杰は、清華大学コンピュータサイエンス学科で教授を務めた人物である。彼は新版の GLM-5.3 について二つのことを述べた(Latent Space、08-20)。第一に、パラメータ数はもうモデルを言い表すのに足りない。 データの量、計算資源をどこへ使ったか、誰がどんな条件で走らせるか——それらと一緒に見る必要がある。第二のほうが本題だ。 モデルはまず膨大な文章を読んで事前学習し、そのあと強化学習などでポストトレーニングを受ける。この二年の能力の跳ね上がりは、主として後者から来ている。そしてポストトレーニングを大きくするとき、難しいのはもうモデル自体ではない。環境である。 モデルが実際に手を動かして操作でき、何手も進めてはじめて成否の分かる、模擬された仕事場のことだ(たとえば機械学習の基盤を一式渡し、訓練の流れのどこが詰まっているかを診断させ、最適化を実装させ、実験を走らせ、正しさを壊さないまま測れる高速化を出させる)。この種の環境は、これまで人が一つずつ建てていた。唐杰によれば、Z.ai はすでに一本の産線を組み上げ、環境を端から端まで合成し、一部の課題では報酬信号まで一緒に合成しているという。さらに重いのは、採点器が模範解答を見ないまま合成されているという点だ。その採点器は三つの関門を通らねばならない。模範解答を食わせれば合格と判じ、「何もしていない」を食わせれば不合格と判じ、解き終わっていない途中の状態を食わせてもやはり不合格と判じる。それではじめて数に入る。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新