モデルの読み · トレンド観察 (投稿の初出は 07-17)
この記事の出典 2026年8月3日 夕刊
K3 の発表の資料に 2 本の線がある(いずれも Teortaxes が逐語で転引したものである)。1 本目は、開発の後期に K3 の初期の版が kernel の大半を書いた、というものである。kernel はモデルの走る速さを決める底層の加速のプログラムであり、前の版のモデルで次の版の土台を作ったに等しい。公式のブログは、K3 が自ら Game Boy Advance のエミュレータを作る実演を説明する箇所で、機構の説明として「recursive self-improvement」(再帰的な自己改良)という語を直接に使っている(Teortaxes、07-17)。検証: 2 つの段はいずれも逐語の引用であり、公式の原文へ戻って直接には確かめていない。同じ公式の資料から出ており、1 つのソースとして数える。ここでの「再帰的な自己改良」は、事業者の販促の文案が流用した言い方であり、指しているのは、前の版のモデルで加速のプログラムを書くのを助けさせることである。分野のなかで言う、モデルが自律的に自らの重みや構造を改良することとは同じものではなく、自律の能力の跳ね上がりが現れたことを意味しない。判断更新: 「一方だけの自主規制がフロンティアの速度を縛れるか」という命題について、いまどの信号を見るべきかが分かった。同じ事柄について、米国系には危険を考えて関連するデータの扱いを止め、抑制した研究所がある。Moonshot は逆に、それを売りとして販促の文案へ書き込んだ。今後、ある研究所が危険を考えてある種の能力へ制動を掛け、同じ時期に別の研究所が同種の能力を売りとして販促するたびに、非対称を 1 回記録する。積み上がった向きは、どんな安全の宣言よりもよく測れる。そしてオープンウェイトのモデルを選ぶとき、発行する側のこの種の能力についての開示の姿勢そのものが、デューデリジェンスの 1 項目である。
先に、この「1 点差」がどの物差しで測られたものかを書く。第三者の評価機関 Artificial Analysis の総合の知性の指数、つまり複数の試験を重み付けして 1 つの総点…
昨夜新しく入った 15 本の論文はまだ処理しておらず、この欄に単日の増分は無い。「言い分と学術」の対照を 1 組出す。Vinyals はこの 1 年で変わった考えを自ら述べている。…
AI を訓練する新しい筋のひとつが「rubric 型の報酬」である。報酬モデルを別に訓練せず、1 枚の評価表で答えに点を付ける。Ai2(Allen Institute for AI…
AI データ研究機関の Epoch AI と評価機関 METR がベンチマーク MirrorCode を公開した。ソースコードを見ず、ネットにもつながない条件で、コマンドラインの入…