← 裁決カード一覧 · このカードのタイムスタンプを検証する ↗
AIが単独でこなせるタスクの長さは8時間を突破する——開票 2026-11-15
何が争点か:評価機関METRは「人間の専門家ならどれだけかかるか」でAIが単独でこなせるタスクの長さを換算しており、この線はAIがいつ長い仕事を引き受けられるかを判断する尺度として現在最も認められている。
なぜ重要か:タスクの長さが一営業日を超えれば、断片ではなく仕事を丸ごと任せられるようになり、人員配置と外注の計算が変わる。
誰が何に賭けているか:長時間の作業能力はすでに解き放たれたとみる陣営と、決定的な突破はまだ来ていないとみる陣営が対立している。
METRの後継ベンチマークが発表する、信頼度80%基準でのタスク遂行時間(time horizon)が8時間を突破する(2026年5月時点の基準は3〜4時間)。
BG2 Pod(Gerstner)× Atreides(Gavin Baker/Andrew Fox)× Altimeter(Clark Tang)
「there was a Copart tweet about this yesterday. He…」
Dwarkesh Podcast
「if you look at the size of a Tesla, and if you…」
Dwarkesh Podcast(Sholto は当時 Google Gemini 所属で、のちに Anthropic へ移籍、Trenton は Anthropic で解釈可能性研究を担当)
「I think that's more about nines of reliability and…」
arXiv (Kwa/West/Becker...Barnes/Chan,METR)
「frontier AI time horizon has been doubling…」
METRが次に発表する信頼度80%基準の測定値を8時間のしきい値と比較する。上回れば的中、以下なら不的中、期限までにMETRが新しい測定値を発表しなければ判定不能とする。
何が覆すか
測定値が3〜4時間の範囲で停滞する、または後退すれば、「長時間タスクの解錠はまだ来ていない」という読解を支持する。
2026年11月15日
2026-11-15