SecondSource一次情報から判断を組み立てる
モデルの読み · 2026年7月28日

新ベンチマーク MirrorCode:AI が 14 時間・251 ドルで、人間なら 2〜17 週かかるソフトウェア書き換えタスクを解いた

モデルの読み · 今週 (原発表に明確な日付がなく、本紙が確認できたのは 2026 年 7 月まで;07-27 に論評経由で収録)

この記事の出典 2026年7月28日 夕刊

AI データ研究機関の Epoch AI と評価機関 METR がベンチマーク MirrorCode を公開した。ソースコードを見ず、ネットにもつながない条件で、コマンドラインの入出力だけを頼りに目標プログラムを「作り直す」ことを AI に求めるものである。結果はこうである。Opus 4.7 は、両機関が人間なら 2〜17 週かかると見積もったタスクを、14 時間・推論コスト 251 ドルで解いた。25 本の目標プログラムのうち 17 本は少なくとも一度は満点で解かれたが、8 本は一度も完璧に解かれていない。最も難しいのは、Python の検査ツール ruff といった大型の実在ソフトウェアである。著者らは、1 年前の先行モデルなら約 30% しか取れず、しかもカレンダーツール程度の単純なプログラムに限られていたと述べる(Import AI #466、07-27)。検証: 一次は 2 つの評価機関による公開発表であり、本紙は伝聞経由で収録した。判断アップデート: 「AI が週単位のソフトウェアタスクを自律的に完了できる」は、個別の逸話から体系的な計測を得た。今日の中核 2 本目と同じ枠で見れば、長時間能力の計測と長時間リスクの管理は、同じ時間線の両端である。AI のコーディングエージェントに書き換えを任せられるかを決めるなら、この分布は規模で分けて見るとよい。境界のはっきりした小型ツール系のタスクには、すでに体系的な証拠がある。ruff クラスの大型の実在ソフトウェアは、25 本のうち 8 本がいまも誰にも完璧に解かれていない。クリティカルパスには入れないでおくこと。

note で無料購読——今日の夕方から届きます

note のフォローだけ。いつでも解除できます。お願いするのはこれだけです。

note をフォローする(無料)

同じ分類の最新