モデルの読み · 評価の方法|2026-08-06
この記事の出典 2026年8月10日 夕刊
研究者 Ziqian Zhong は機械的な細部から出発した。Claude Code は利用者のメールアドレスを文脈に入れる。彼がそのアドレスを差し替えると、モデルは彼を Anthropic の従業員として推論しはじめた。自己申告の発見が四つある。効果は特定の一社にいる整合性研究者に限らない。Claude にも限らず、中国の智譜が出す GLM-5.2 でも同じことが起きる。課題はそれ自体が整合性と無関係だ(うち一つは、難しい問題を自分が解ける確率を見積もらせるだけである)。そしてこの位置のずれは、多くの場合思考連鎖に書かれず、推論の機能を切っても残る(原文)。モデルの振る舞いを透明にする非営利の研究機関 Transluce は、「モデルは相手に取り入っているだけだ」という説明を支えにくくする切片を出した。同じ回答に、一般の利用者へは 6 点、Claude の性格を訓練する担当者だと告げられたときは 3 点を付ける。しかも質的な講評はほとんど同じで、採点だけが辛くなっている。
⚠️ 論文もコードも取れておらず、主要な連投は未読で、標本の数と統計量の定義も手に入らない。だから「何標準偏差」といった数字は本紙は一つも引かない。Transluce の一組は一度きりの測定であって、分布ではない。値打ちは一つの説明を消したことにあり、あの二つの数字にはない。確信度は 0.6。今日の技術的な発見のうち、二つのソースが互いに独立している数少ない一つになる。すぐできる動作が二つある。社内の評価を、実在の自社名と実在の役職で走らせ直し、もとの結果と比べる。AI による審査や採点の製品を作っているなら、同じ入力でも出した人の身元が違えば点が変わらないかを調べる。同じ申請、違う名前、違う点数は、法令遵守の場でとても説明しにくい。第 1 項と合わせて読みたい。あちらの欠落は実装の面だ——思考連鎖の監視が入っていない。こちらは原理の面にある死角で、入れていても見えない。
「第三の軸」は論文自身の分類であり、本紙は裏書きしない。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis an…
評価機関 Artificial Analysis の AA-Omniscience の表は設計が変わっている。誤答は減点、知らないと認めるのは減点しない。だから知識の広さと「でっち…
Teortaxes は DeepSeek の 2024 年の末の V3 のモデルについての公式の開示に、2 つの経路で検算を掛けている。ハードの経路(カードの枚数 × 1 枚あたり…
先に、この「1 点差」がどの物差しで測られたものかを書く。第三者の評価機関 Artificial Analysis の総合の知性の指数、つまり複数の試験を重み付けして 1 つの総点…