SecondSourceAI 產業洞見 · 完整版檔案庫

深度 深度專欄 #40 · 2026年10月8日

長文件 AI 差在有沒有讀完:Harvey 讓同一批模型換個包法,盡職調查通過率平均多 39 分,讀進去的資料也從不到百分之一升到多數接近全讀

本篇重點

法律 AI 公司 Harvey 九月八日和推理平台 Baseten 發表一組實驗。他們做了上百個模擬的併購盡職調查資料室,一間最多五千份文件、約八千萬個 token,遠超過任何模型一次讀得進去的量。token 是模型切分文字的單位,常是一個詞的片段,用得越多收費越高。他們把同樣七個模型換上一種「遞迴」的包法:讓一個主代理寫程式,把資料室按類別切開,分派給許多子代理各讀一塊,再把結果匯整成備忘錄。包法是模型外面那層決定它怎麼讀、怎麼呼叫工具、什麼時候停的程式,業界叫 harness。七個模型的平均通過率從 23.3% 跳到 62.4%。通過率是評審逐條對照專家檢查清單時,備忘錄通過的條目比例。現成的通用寫程式代理 Claude Code 與 Codex,得分反而比各自的底層模型(Opus 5、GPT-5.6 Sol)放進最簡單的工具迴圈還低。

本報先前據此記下一條判斷(下稱原判斷),它由五句組成:1. 同一批模型換成任務專屬的遞迴包法,平均多 39 分;2. 現成的 Claude Code 與 Codex 反而輸給最簡單的工具迴圈;3. 拿通用代理當萬用包法是錯的預設;4. 換包法的收益大於換前沿模型(目前能力最強的那批商用模型);5. 垂直 AI 公司可守的位置,是為任務量身打造的包法,加上圍繞它後訓的開源模型。後訓是拿現成模型,用特定任務的資料或獎勵再訓練一輪。本篇逐句重驗:1、2 的數字屬實但要加口徑(第一、三節),3 要收窄(第三節),4 只對一半(第四節),5 站不住(第五節)。結論分三層。

第一,機制撐住了,而且比原句更具體:差距來自讀了多少。 Harvey 用探針量每次執行有多少資料室內容進到模型眼裡:簡單工具迴圈沒有一次超過百分之一,多數只讀到千分之一到千分之五;遞迴包法多數接近全讀。讀得越多,分數越高。

第二,「通用代理是錯的預設」只在 Harvey 的設定下成立。 Harvey 給 Claude Code 與 Codex 的是和工具迴圈相同的極簡指令,軌跡顯示兩者「提早停止閱讀」,而且有能力派子代理卻都沒派。另一組與 Harvey 無關的學術量測方向相反:四位學術研究者三月發表的論文顯示,現成的寫程式代理在多個長文本基準上平均勝過已發表的最佳成績 17.3%(原文未註明是相對提升還是百分點);據另一篇論文轉引,在其中一個基準上也勝過遞迴包法。Anthropic 五月已在 Claude Code 內建一次派出數十到數百個子代理的功能。

第三,「後訓開源模型」那一半最弱。 Harvey 自己的逐模型圖顯示,後訓過的開源主代理拿到 63.0%,低於未經後訓的前沿模型 Claude Opus 5(77.6%)、Grok 4.5、GPT-5.6 Sol,以及開源模型 GLM-5.2 放進同一包法的成績。換對包法之後,主代理用哪個模型,高低仍差約三十五到三十八分,和包法本身的效果同一個量級。包法和模型互補。

為什麼值得花二十分鐘:這條判斷的核心數字目前只有 Harvey 一家自報。本篇挑它最關鍵的兩句來檢驗:「通用代理是錯的預設」拿一篇獨立論文檢驗,站不住,收窄成「照預設設定跑的通用代理在長文件上讀得太少」;「後訓開源模型是可守位置」拿 Harvey 自己的逐模型圖檢驗,也站不住。我們也先講明白,出現什麼結果就算本篇錯了:有人在同一類資料室上,讓 Claude Code 或 Codex 開啟子代理分派重跑,若仍明顯落後專屬包法,例如差二十分以上,本篇「差距主要是沒讀完」就不成立。這個二十分的門檻是本報自設。

本篇路線分五步:① Harvey 量到了什麼;② 分數跟著讀了多少走;③ 通用代理輸在預設,不輸在能力;④ 包法比換模型重要?只對一半;⑤ 那垂直 AI 該守什麼,以及之後看哪幾個讀數。

利害揭露:本報的分析由 Anthropic 的模型協助產生,而 Anthropic 的 Claude Code 與 Claude Opus 5 是本篇評估的對象之一。

一、Harvey 量到了什麼

這組實驗的設計很乾淨:同一批模型、同一批資料室、同一套評分,只換「包法」。

三種包法:

評分方式是讓另一個模型當評審,對照專家寫的檢查清單逐條判定通過與否;範例資料室的清單有 571 條。七個模型的逐一成績(本報從 Harvey 圖檔讀出標籤,平均值與正文吻合):

模型簡單工具迴圈遞迴包法
Claude Opus 542.5%77.6%
Grok 4.522.8%68.4%
GPT-5.6 Sol16.6%67.7%
GLM-5.215.1%65.4%
Kimi K323.7%59.0%
Muse Spark 1.127.0%56.5%
DeepSeek V4 Flash15.6%42.3%
七個平均23.3%62.4%

Harvey 另外把開源模型 Qwen 放進遞迴包法當主代理並加以後訓,在 50 個保留資料室上從 29.9% 升到 63.0%;它和 GLM-5.2 的自我微調是兩個不同實驗。

現成代理(極簡指令、關掉上網,見第三節):Claude Code 24.6%(比 Opus 5 放在簡單迴圈低 17.9 分),Codex 12.0%(比 GPT-5.6 Sol 低 4.6 分)。

讀這張表之前,有三件事要先知道。資料室是模擬的,不是真實交易;評分者是模型,Harvey 沒有說明它和律師判斷的一致程度;後訓時給模型的獎勵分數,也是同一個評審打的,等於拿考官的標準來練考生。Harvey 自己稱這些是「初步探索」,文中沒有任何產品部署的說法,而且寫明離他們要的「接近滿分」還有相當距離。所以這是一組設計乾淨、但只有一家量過的研究讀數。

二、分數跟著讀了多少走

為什麼換個包法能多將近四十分?Harvey 給的答案很直接:讀的量差了幾十到幾百倍。

簡單工具迴圈「沒有一次讀超過資料室的 1%,多數讀 0.1% 到 0.5%」;遞迴包法「幾乎每次讀超過 10%,多數接近全讀」。「覆蓋率越高,通過率越高。」

盡職調查的考法決定了這件事。清單上有些項目要合併好幾份文件才找得到,有些要確認某份該有的文件不存在。要確認文件不存在的項目,只能靠讀完來證明:沒翻過的櫃子,不能說裡面沒有東西。只挑著讀的代理,在這類題目上天生拿不到分。

這也解釋了 Harvey 附錄裡一個反直覺的結果:把遞迴再加一層(子代理也能再分派),十四個資料室裡十個變差,平均掉 19 分,其中四個讀完了卻沒寫出報告。三月一篇獨立複現論文在別的基準上也看到加深遞迴的代價:加到第二層成績變差,執行時間也從 3.6 秒暴增到 344.5 秒。還有另一組研究者的論文發現:在同樣時間預算下,不靠遞迴、改讓模型自我檢查後挑選處理方式的做法,最多比遞迴包法好 22%(原文未註明口徑)。

這三條說明遞迴本身不是必要條件,層數多了還會壞事。 真正跟分數一起走的是讀了多少:Harvey 量到覆蓋率越高、通過率越高,但它只報告兩者相關,沒有排除「更強的分派同時帶來更多閱讀與更高分」這種可能。

對自己在做長文件代理的團隊,這組讀數給的診斷順序是:先量代理實際讀進了多少比例的資料、有沒有真的分派出去,再去調模型或工具。

三、通用代理輸在預設,不輸在能力

原判斷最聳動的一句是「現成的 Claude Code 與 Codex 反而輸給最簡單的工具迴圈」。數字是真的,但要看它量的是什麼。

Harvey 寫得很清楚:兩個通用代理拿到的是「與工具迴圈相同的極簡指令」,軌跡顯示它們「提早停止閱讀、寫較短的備忘錄,而且雖然有能力,兩者都沒有派出子代理」。它們輸的方式和第二節一樣:沒讀完。這是預設行為的讀數,不是能力上限的讀數。

Harvey 自己的資料裡就有對照組:開源模型 GLM-5.2 放進遞迴包法當主代理,起初也常「提早放棄、分派不足」。Harvey 從 GLM-5.2 自己表現好、讀得多的執行紀錄中挑出一批,拿來微調同一個模型;在另一組二十個資料室的小實驗上,成績從 46.1% 升到 60.1%,派出子代理的數量開始跟著資料室大小走(兩者的相關係數從 0.17 升到 0.84)。這組資料室和上表不同,數字不能直接相比。Harvey 的結論是:好的主代理該有的行為,例如把審閱完整分派出去,「從相對少量的執行紀錄就學得到,不需要特權資訊,也不需要標註過的法律知識」。

這句話最動搖原判斷。讓遞迴包法拉開差距的分派習慣,在 Harvey 的實驗裡不需要法律知識。本報據此推論,一般用途的代理原則上也學得會,但 Harvey 只在 GLM-5.2 這一個模型上驗證過。目前看得到的是模型廠已把大量分派的能力放進通用代理,還沒看到它在長文件審閱上的量測:

所以比較公平的說法是:在長文件工作上,照預設跑的通用代理會讀太少;讓它把工作分出去,它不一定輸,在別的基準上還贏了。Harvey 沒有測「開啟子代理分派的通用代理」,這正是本篇寫死的推翻條件。

四、「包法比換模型重要」:只對一半

原判斷說遞迴包法的收益「大於換前沿模型」。用 Harvey 自己的圖檢查:

讀文件的苦工可以交給便宜的小模型,但決定怎麼切、要不要讀完、怎麼把幾百條發現寫成一份備忘錄的那個主代理,模型好壞差很多。最好的成績是「最強的模型放進對的包法」:包法和模型都有貢獻,彼此互補。

成本也不像原判斷暗示的那樣單向。Harvey 寫明,換成遞迴包法讓七個模型裡六個變貴。以下是本報從 Harvey 對數刻度圖上讀出的近似值:便宜模型每個資料室從不到一美元升到約三到六美元,GPT-5.6 Sol 約二十七美元。唯一的例外是 Opus 5:它在簡單迴圈裡自己讀,一個資料室花約十八美元;改當主代理只花約七美元,還高 35 分。這些金額都落在每個資料室幾美元到二十幾美元之間。真正的成本是時間:單次執行可能要一小時以上,這類工作比較像交出去等結果的背景任務,而不是即問即答。

五、那垂直 AI 該守什麼

原判斷的結論是:垂直 AI 的可守位置在「任務專屬包法加上後訓開源編排器」,而不是轉售前沿模型或包一層通用代理。以下三點讓這個結論站不住:

1. 包法本身是公開的。 遞迴語言模型的推論函式庫以 MIT 授權開源;它也已經被做成通用框架的現成模組。Harvey 這篇文章也把做法寫得相當完整。

2. 後訓開源模型目前輸給前沿模型。 後訓過的 Qwen 主代理 63.0%,比 Opus 5 放進同一包法低 14.6 分,也低於另外三個未經後訓的模型。它的好處可能是成本與部署控制(開放權重可以自己架設),但 Harvey 沒有公布它的每室成本,所以這點目前說不出來。

3. Harvey 自己的後訓不靠私有資料,也還沒上產品。 八月發表的自有模型 Tenet(以 Kimi K3 為底,和 Fireworks 一起後訓)明寫「後訓沒有使用任何客戶資料」,相關能力將「逐步」併入產品。

那剩下什麼?從這組資料推得出的是,讓分數大幅提升的行為得靠一套訓練環境才練得出來,包括做得出模擬資料室、寫得出五百多條專家檢查清單,並把評審照清單打的分數當獎勵反覆訓練。所以稀缺的可能是那把尺——判斷盡職調查做得完不完整、對不對的評分標準,以及用它搭起來的訓練環境——而不是讀文件的程式。不過要誠實說:Harvey 的法律代理基準有一部分已經開源,這把尺有多少仍是自家的,本報沒查清楚;客戶信任、資料不外流的合約要求這類通路面的優勢,本篇也沒有量。這段是本報的推論,信心低於前四節。

聊天助手(2022)自然語言=介面
Copilot 內嵌(2023)嵌進工作流,人仍動手
編碼 agent(2024-)交整個任務,人驗收
通用 agent 平台(2026-)跨工具跨裝置辦事;底層模型可替換

進行中 ?

對立主張meta-harness 路線:廠牌中立、可組合的 agent 共通層(Databricks Omnigent 型)

本篇對本報趨勢追蹤的影響:本報追蹤「通用代理這一層最後由誰吃下」,有兩條路:模型廠自己做、底層模型可替換的通用代理平台(如 Claude Code),或廠牌中立、可換模型的第三方外層。本篇的證據讓前一條往前推了一步:在長文件工作上,量身包法和通用代理的差距主要在有沒有把工作分出去讀完,而這個能力正被模型廠放進自己的通用代理(Claude Code 的動態工作流程)。若量身包法的優勢在通用代理上消失,專攻法律、金融等單一行業的垂直 AI 公司在這一層能守的就更少;本報推論(信心低)剩下的是評分標準與通路。

方向判斷

在超出模型讀取上限的長文件工作上,品質和代理有沒有把資料讀完緊密相關:Harvey 的實驗裡,遞迴包法的代理幾乎每次讀了資料室一成以上、多數接近全讀,簡單工具迴圈的代理讀不到百分之一,兩者平均差 39 分。Harvey 報告的是兩者一起變動,沒有拆出因果。讀完靠的是把工作分派出去的習慣;Harvey 的實驗顯示這個習慣不需要法律知識、從少量執行紀錄就學得會(目前只在一個開源模型上驗證),Anthropic 也已把一次派出數百個子代理的能力放進通用代理;照預設跑的通用代理會讀太少,開啟分派之後不一定輸。換對包法之後,主代理用哪個模型仍差三十五分以上,後訓過的開源主代理也還輸給前沿模型。所以垂直 AI 公司可守的,不在包法的程式碼,目前也不在自己後訓的模型;本報推論(信心低)可守的是判斷盡職調查做得完整正確的專家評分標準,以及能拿它反覆訓練模型的模擬資料室。

之後看哪幾個讀數

1. 有沒有人讓通用代理開啟子代理分派,在長文件盡職調查上重跑。 這是本篇最直接的檢驗。可盯的地方:Harvey 部落格的後續文章、Anthropic 動態工作流程的更新。

2. Harvey 的後訓主代理是否進產品、每室成本多少。 若後訓開源主代理以明顯更低的成本拿到接近前沿的成績,第五節第二點要重寫。

3. 法律代理基準的盡職調查題組是否公開,評審和律師判斷的一致度是否公布。 尺一旦公開,「尺是稀缺的」就要收回。

什麼會推翻本篇

以下三條的檢驗期限都是 2027 年 3 月 31 日,門檻(二十分、77.6%)是本報自設的觀察線。

1. 在同類長文件盡職調查任務上,開啟子代理分派(或動態工作流程)的 Claude Code 或 Codex,仍落後專屬遞迴包法二十分以上。 本篇「差距主要是沒讀完」不成立,原判斷「通用代理是錯的預設」恢復。

2. 後訓的開源主代理在同一包法下追平或超過最好的前沿模型(例如 Harvey 正在訓練的 GLM-5.3 在保留集上不低於 Opus 5 的 77.6%)。 第四、五節「後訓開源模型目前輸給前沿」要改,原判斷的後半恢復一部分。

3. 第三方用真實資料室或律師評分重做,覆蓋率與分數的關係消失。 本篇的機制主張不成立。


本篇依據的出處

以下由本篇引用的事實紀錄機械彙整,每條是其中一個事實的出處;原件本報是否讀過、還是只讀到轉述,以正文各段的說明為準。