モデルの読み · 今週 (出来事の日 08-17)
この記事の出典 2026年8月18日 夕刊
ある集団が、モデルの配布基盤 Hugging Face のブログで報告した。制約条件を見る GPU の配置器(その集団の自社製品である)を作り、七つの場面でいちばん素朴な「先に来た順」の割り当てと比べた。ハードウェアは完全に同じ、仕事の中身も完全に同じで、GPU の使用率は最大 33 ポイント上がった(比べた相手の基準線は五割ほどで、クラスタの半分が遊んでいることになる)。優先度で重みをつけた産出は七つの場面すべてで上がり、最大で 105% だった。この物差しが測るのは仕事の優先度で重みづけした完了量であり、比べる相手は同じ場面での先着順の割り当てである。⚠️ この二つは別の物差しで、「効率が 105% 上がった」には変換できない。問題の形は見ておく値打ちがある。四種類の仕事が同じ GPU の束を奪い合う。訓練、バッチ推論、量子化はバッチ型で、いったん始めたら GPU を一枚まるごと途切れずに使い切る。リアルタイム推論は逆で、需要の曲線が時間の刻みごとに動く。リアルタイム推論は待てない。だから確実に空きを保証できる唯一の方法は、その日の山に合わせて一日じゅう確保しておくことだ。昼に 6 枚、未明には 2 枚しか要らない用途が、一日じゅう 6 枚を押さえる。遊んでいる 4 枚は一日じゅう、どのバッチの仕事にも回せない。使われていないが、ただでもない。 今日の中核、第 2 項と並べて読むと目に刺さる。一方では 4.25 ギガワットの計算資源に 1,050 億ドルの保証を積み、他方では同じハードウェアが割り当てを変えるだけで三割ぶん多く使える。「計算資源が足りない」のどれだけが本当の不足で、どれだけが割り当ての下手さなのか。これは資本のナラティブに効く問いだ。⚠️ この並べ読みは本紙の推論であって、この記事の主張ではない。⚠️ ほかに四つの制限も一緒に持つこと。これは発表した側が自分で計り、自分で置いた基準線であり、独立した再現もなければ、査読も通っていない。
下の一件はプレプリントではなく、中核の 1 点目で使ったあの測定の付録に載っていた読みの一組になる。単独で取り出すのは、使いどころが中核のそれとは違うからだ。
あの測定が使った道具は他人のものになる。CoT-Control という評価で、やり方は問題に「小文字だけで考えよ」「考えるあいだ、ある語を使うな」といった指示を足し、推論の軌跡がそ…
下の一件は arXiv のプレプリントではなく、ある研究チームが自社のブログで自分たちの論文を説明したものになる。同じ種類の材料がもう一つあるが、そちらは上のそのほかに起きたことの…
Multiverse Computing の CAI チームが Hugging Face で自分たちの論文を説明した。公開されている三つの安全指標をまたいで、危険な応答の率は 26…