SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年9月4日

OpenAI のある論文の中心的な発見が、八か月半後に同じ会社のシステムカードで相殺された。

モデルの読み · 証拠の更新 (元の論文は 2025 年 12 月 20 日/相殺する証拠は 9 月 3 日)

この記事の出典 2026年9月4日 夕刊

2025 年 12 月 20 日、OpenAI は〈Monitoring Monitorability〉を発表し、「思考の連鎖はどれだけ監視しやすいか」を測れる指標にした。最も重要な発見の一つは逐語で「RL optimization does not materially decrease monitorability even at the current frontier scale」、強化学習の最適化は、いまのフロンティア規模でも監視可能性を実質的には下げない、というものだ(arXiv 2512.18311)。ところが 2026 年 9 月 3 日の Astra システムカードは「CoT controllability for Astra especially increases over the course of RL training」と書く。制御可能性が上がるのは悪い知らせで、理由は前に書いた。本紙が読み直したうえでの処置は、あの古い判断の信頼度を下げること。ただし失効の印は付けない。 原因はまだ定まっておらず、もし能力の跳躍が主因なら、あの論文はもともと主張した範囲の中では間違っておらず、「いまの規模」が外挿の有効期限だと自分で明記してもいた。今回ほんとうに記すべき教訓は「供給元の自己申告を信じるな」ではない。 それはとうに制度が止めている。教訓はこうだ。結論に明確な適用範囲が付いているとき、他人に引かれる際に最も落とされやすいのが、まさにその範囲である。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新