モデルの読み · 今週 (公開日 8 月 30 日)
この記事の出典 2026年8月31日 夕刊
このシミュレータが測るのは、モデルが実際にハードウェア上で動くときの挙動であって、モデル自身の点数ではない。パデュー大学の研究チームが論文を発表し、Nvidia の Ampere、Hopper、Blackwell という三世代をまたぐ、サイクル単位のシミュレーション基盤を示した(サイクル単位とは、チップの一つ一つのクロックの挙動まで計算することで、平均で見積もるのとは違う)。実チップとの検証結果も報告されている。H100 でのピアソンの相関係数は 99% に達した(ピアソンの相関係数は、二組の数字の動きがどれだけ重なるかを測るもので、1 が完全一致にあたる)(Semiconductor Engineering、08-30;論文の原文 arXiv 2608.22602、2026 年 8 月)。記憶しておく理由: 実チップと合う公開のシミュレータは、次の世代のチップ評価の読み取りがどれだけ信じられるかに影響する。そして調達の判断は、まさにこの種の読み取りに賭けている。同時にこれは「次の世代の GPU をどう設計するか」を、数社の社内の道具から、大学も入っていける問いに変える。これまで、非同期で分散した GPU の設計を研究するには、その機材を買えるか、粗い見積もりで済ませるかの二択だった。⚠️ 99% は H100 に対する検証の読み取りであって、ほかの世代やほかの負荷でも同じ精度が出るという意味ではない。論文が自分で挙げている検証の対象が H100 だ。
2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要…
CyberGym はバークレーのチームが作った公開試験で、実在の脆弱性 1,507 件を収め、188 のオープンソース事業をカバーする。データは Google が運営するオープンソ…
先に説明しておく。いまの大きなモデルの多くは専門家混合(MoE)という構えを取る。すべての語でモデル全体を走らせるのではなく、語ごとに少数の専門の子モデルへ振り分ける。だからモデル…
米国のアレン人工知能研究所が 9 月 1 日、BenchMIRT を発表した。項目反応理論の多次元版を使い、ある評価指標が結局のところ何を量っているのかを一問ずつ分解する。もともと…