AI 能獨力做完的任務長度,11 月前會突破 8 小時——開獎 2026-11-15
這在吵什麼:評測機構 METR 用「一個人類專家要花多久」來換算 AI 能獨力做完多長的任務,這條線是目前判斷 AI 何時能接手長工作最被認可的尺。
為何重要:任務長度一旦跨過一個工作天,代表可以整件交辦而不是只給片段,人力配置與外包的算法就變了。
誰在對賭:認為長跑能力已經解鎖的一派 vs 認為關鍵突破還沒到的一派。
本報判讀:METR 後繼量尺下一次公布的讀數會突破 8 小時(以 80% 成功率的口徑計;基準是 2026 年 5 月的 3 到 4 小時,等於要兩倍到 2.7 倍的提升)。
本報信心只有三成——這是一條刻意押高的判斷,寫下來是為了讓它好被推翻。
2026-11-15 前看 METR 最新一次發布的 80% 口徑讀數:超過 8 小時算說中;等於或低於 8 小時算沒中;到期時沒有新讀數就判無法對答案。
誠實記:本報 2026-07-31 查證時,只查到舊版 METR 論文(80% 口徑約 15 分鐘量級)與泛用描述(40 分鐘到 1.1 小時),跟本報上一條判斷所稱 2026 年 5 月的 3 到 4 小時基準對不上,也無法確認是不是同一套後繼量尺。所以本條的基準沿用本報上一條判斷既有的引用,列為待核。
2026年11月15日
2026-11-15
尚未到開獎日,暫無可公開的結果。
尚未開獎——以下是我們自己寫死、會推翻這個判斷的條件(供你現在就對照,不必等開獎):
讀數停在 3 到 4 小時區間或倒退,支持「長跑能力的解鎖器還沒到」;本條獨立判斷,不影響上一條判斷其餘三條腿。
