SecondSourceAI産業の「判断」を届ける夕刊ブリーフ

← 裁決カード一覧 · このカードのタイムスタンプを検証する ↗

AIが単独でこなせるタスクの長さは8時間を突破する——開票 2026-11-15

審理中

AIが単独でこなせるタスクの長さは8時間を突破する——開票 2026-11-15

トレンド判断 · 判断日 2026年7月31日

背景

何が争点か:評価機関METRは「人間の専門家ならどれだけかかるか」でAIが単独でこなせるタスクの長さを換算しており、この線はAIがいつ長い仕事を引き受けられるかを判断する尺度として現在最も認められている。

なぜ重要か:タスクの長さが一営業日を超えれば、断片ではなく仕事を丸ごと任せられるようになり、人員配置と外注の計算が変わる。

誰が何に賭けているか:長時間の作業能力はすでに解き放たれたとみる陣営と、決定的な突破はまだ来ていないとみる陣営が対立している。

判断

METRの後継ベンチマークが発表する、信頼度80%基準でのタスク遂行時間(time horizon)が8時間を突破する(2026年5月時点の基準は3〜4時間)。

出典

BG2 Pod(Gerstner)× Atreides(Gavin Baker/Andrew Fox)× Altimeter(Clark Tang)
「there was a Copart tweet about this yesterday. He…」

Dwarkesh Podcast
「if you look at the size of a Tesla, and if you…」

Dwarkesh Podcast(Sholto は当時 Google Gemini 所属で、のちに Anthropic へ移籍、Trenton は Anthropic で解釈可能性研究を担当)
「I think that's more about nines of reliability and…」

arXiv (Kwa/West/Becker...Barnes/Chan,METR)
「frontier AI time horizon has been doubling…」

的中の条件

METRが次に発表する信頼度80%基準の測定値を8時間のしきい値と比較する。上回れば的中、以下なら不的中、期限までにMETRが新しい測定値を発表しなければ判定不能とする。

何が覆すか

測定値が3〜4時間の範囲で停滞する、または後退すれば、「長時間タスクの解錠はまだ来ていない」という読解を支持する。

答え合わせの日

2026年11月15日

2026-11-15