モデルの読み · 評価 トレンド観察
この記事の出典 2026年8月5日 夕刊
評価機関 Artificial Analysis の AA-Omniscience の表は設計が変わっている。誤答は減点、知らないと認めるのは減点しない。だから知識の広さと「でっち上げを拒む」傾きを同時に測れる。Teortaxes(今日の中核の 1 本目と同じ評論者である)が新しい回の表を読んだ要点は、順位ではない。知識の面で最前に立つモデルが、同時に最もよくでっち上げるモデルの 1 つでもある(Teortaxes、07-21)。これは Artificial Analysis 自身の今年 1 月の方法論の発見と独立して同じ向きである。幻覚の率は総合の知能と相関せず、知識の正確さは総パラメータと強く相関し、動くパラメータとはほとんど相関しない(Latent Space のインタビューの保存庫、2026-01)——機種を一通り入れ替えたあとで同じ規則が再現した。1 回きりの写真が、時間の幅を持つ規則へ上がった。選定の読み方はこうである。細かい知識と長い尾の事実が要るなら、大きいパラメータへ寄る。「知らないと言うほうを選ぶ」信頼度が要るなら、学習の後段の配合と拒否の振る舞いを見る。2 つは 2 冊の帳簿である。知識の最も強いモデルを自動の審査に使うなら、そのでっち上げの傾きも同時に買うことになる。彼の読後の要約は点数を付けていないので、引くときはまず向きとして見ること。
Teortaxes は DeepSeek の 2024 年の末の V3 のモデルについての公式の開示に、2 つの経路で検算を掛けている。ハードの経路(カードの枚数 × 1 枚あたり…
先に、この「1 点差」がどの物差しで測られたものかを書く。第三者の評価機関 Artificial Analysis の総合の知性の指数、つまり複数の試験を重み付けして 1 つの総点…
K3 の発表の資料に 2 本の線がある(いずれも Teortaxes が逐語で転引したものである)。1 本目は、開発の後期に K3 の初期の版が kernel の大半を書いた、とい…
昨夜新しく入った 15 本の論文はまだ処理しておらず、この欄に単日の増分は無い。「言い分と学術」の対照を 1 組出す。Vinyals はこの 1 年で変わった考えを自ら述べている。…