SecondSourceAI産業の「判断」を届ける夕刊ブリーフ

深掘り 長文書 AI の差は資料を読み切ったかどうかで決まる——Harvey の実験では、同じモデル群のハーネスを替えるだけでデューデリジェンスの合格率が平均 39 ポイント上がり、読み込む資料も 1% 未満から大半の回でほぼ全量になった · 2026年10月8日

長文書 AI の差は資料を読み切ったかどうかで決まる——Harvey の実験では、同じモデル群のハーネスを替えるだけでデューデリジェンスの合格率が平均 39 ポイント上がり、読み込む資料も 1% 未満から大半の回でほぼ全量になった

SecondSource 深掘りレポート #40

本稿の要点

法律 AI 企業の Harvey は 9 月 8 日、推論基盤の Baseten と組んだ実験を公開した。M&A のデューデリジェンスを模したデータルームを百以上つくり、1 室あたり最大 5,000 件の文書、約 8,000 万トークンを詰めた。どのモデルも一度には読み込めない量だ。トークンとは AI が文章を読み書きするときの計量単位で、数文字ごとに 1 つと数え、使うほど料金が上がる。Harvey は同じ 7 つのモデルに「再帰型」のハーネスをかぶせた。主エージェントがプログラムを書いてデータルームを種類ごとに切り分け、多数のサブエージェントに一塊ずつ読ませ、結果を集めて調査メモにまとめる方式である。ハーネスとは、モデルの外側にあって、どう読むか、いつツールを呼ぶか、いつ止めるかを決めるプログラムのことだ。7 モデルの平均合格率は 23.3% から 62.4% に跳ね上がった。合格率は、採点役が専門家のチェックリストと一項目ずつ照らし合わせ、メモが満たした項目の割合をいう。一方、既製の汎用コーディングエージェントである Claude Code と Codex は、それぞれの基盤モデル(Opus 5、GPT-5.6 Sol)を最も単純なツールループに入れたときより低い点しか取れなかった。

本誌はこの実験をもとに一つの判断を記録していた(以下「元の判断」)。中身は五つの文からなる。1. 同じモデル群をタスク専用の再帰型ハーネスに替えると平均 39 ポイント上がる。2. 既製の Claude Code と Codex は、最も単純なツールループにすら負ける。3. 汎用エージェントを万能のハーネスとして使うのは誤った初期設定だ。4. ハーネスを替える効果は、フロンティアモデル(いま最も能力の高い商用モデル群)に乗り換える効果より大きい。5. 垂直 AI 企業が守れる位置は、タスクに合わせて作り込んだハーネスと、それを軸に事後学習したオープンソースモデルの組み合わせにある。事後学習とは、既製のモデルを特定タスクのデータや報酬でもう一度訓練することだ。本稿はこの五文を一つずつ検証し直した。1 と 2 は数字こそ正しいが測定条件を書き添える必要がある(第 1 節・第 3 節)。3 は範囲を狭める(第 3 節)。4 は半分しか当たらない(第 4 節)。5 は成り立たない(第 5 節)。結論は三層になる。

第一に、メカニズムは持ちこたえ、元の文より具体的になった。差を生んでいるのは、どれだけ読んだかである。 Harvey は計測用のプローブで、各回の実行でデータルームの中身がどれだけモデルの目に入ったかを測った。単純なツールループは 1 回も 1% を超えず、大半は 0.1% から 0.5% しか読んでいない。再帰型ハーネスでは大半の回がほぼ全量を読んだ。読む量が多いほど点数も高い。

第二に、「汎用エージェントは誤った初期設定」が成り立つのは Harvey の設定の下だけだ。 Harvey が Claude Code と Codex に与えたのは、ツールループと同じ最小限の指示だった。実行記録を見ると、両者とも早々に読むのをやめ、サブエージェントを出す能力がありながら一度も出していない。Harvey と無関係な学術計測は逆の方向を指す。4 人の研究者が 3 月に出した論文によれば、既製のコーディングエージェントは複数の長文脈ベンチマークで、公表済みの最高成績を平均 17.3% 上回った(原文は相対的な伸びか、ポイント差かを明記していない)。別の論文の孫引きでは、そのうち一つのベンチマークで再帰型ハーネスにも勝っている。Anthropic は 5 月の時点で、数十から数百のサブエージェントを一度に走らせる機能を Claude Code に組み込んでいる。

第三に、いちばん弱いのは「事後学習したオープンソースモデル」の半分だ。 Harvey 自身のモデル別グラフでは、事後学習済みのオープンソース主エージェントは 63.0% にとどまる。事後学習していないフロンティアモデルの Claude Opus 5(77.6%)、Grok 4.5、GPT-5.6 Sol、さらにオープンソースの GLM-5.2 を同じハーネスに入れた成績より低い。ハーネスを正しく選んだ後でも、主エージェントにどのモデルを使うかで 35〜38 ポイントほど開く。ハーネスそのものの効果と同じ桁だ。ハーネスとモデルは補い合う関係にある。

なぜ 20 分を割く価値があるのか:この判断の中核の数字は、今のところ Harvey 1 社の自己申告しかない。本稿はそのうち最も重い二文を検証した。「汎用エージェントは誤った初期設定」は独立した論文に当てると持ちこたえず、「既定の設定で動かした汎用エージェントは長文書を読む量が少なすぎる」に狭まる。「事後学習したオープンソースモデルが守れる位置」は Harvey 自身のモデル別グラフに当てると、これも持ちこたえない。本稿が誤りだったと認める結果も先に書いておく。同種のデータルームで Claude Code か Codex にサブエージェントへの振り分けを有効にさせて再実行し、それでも専用ハーネスにはっきり負ける、たとえば 20 ポイント以上の差がつくなら、本稿の「差の主因は読み切っていないこと」は成り立たない。この 20 ポイントの線は本誌が独自に設けたものだ。

本稿は五段で進む。① Harvey は何を測ったか。② 点数は読んだ量についてくる。③ 汎用エージェントが負けたのは初期設定のせいで、能力のせいではない。④「ハーネスはモデルの乗り換えより重要」は半分だけ正しい。⑤ では垂直 AI は何を守るのか、今後どの数値を見るか。

利害開示:本誌の分析は Anthropic のモデルの支援を受けて作られている。Anthropic の Claude Code と Claude Opus 5 は、本稿で評価する対象に含まれる。

Harvey は何を測ったか

まず実験の組み立てを確かめておく。設計はきれいだ。モデルも、データルームも、採点方法も揃え、変えたのはハーネスだけである。

ハーネスは三種類ある。

採点は別のモデルが担う。専門家が書いたチェックリストと照らし、一項目ずつ合否を判定する。サンプルのデータルームでは、このリストが 571 項目ある。7 モデルの個別成績は次のとおり(本誌が Harvey のグラフ画像からラベルを読み取ったもので、平均値は本文の数字と一致する)。

モデル単純なツールループ再帰型ハーネス
Claude Opus 542.5%77.6%
Grok 4.522.8%68.4%
GPT-5.6 Sol16.6%67.7%
GLM-5.215.1%65.4%
Kimi K323.7%59.0%
Muse Spark 1.127.0%56.5%
DeepSeek V4 Flash15.6%42.3%
7 モデル平均23.3%62.4%

Harvey はこれとは別に、オープンソースの Qwen を再帰型ハーネスの主エージェントに据えて事後学習し、評価用に取り置いた 50 室で 29.9% から 63.0% に引き上げた。これは後で触れる GLM-5.2 の自己微調整とは別の実験である。

既製エージェント(最小限の指示、ウェブ検索なし。第 3 節参照)の成績は、Claude Code が 24.6%(単純なループに入れた Opus 5 より 17.9 ポイント低い)、Codex が 12.0%(GPT-5.6 Sol より 4.6 ポイント低い)だった。

この表を読む前に、三つの前提を押さえておきたい。データルームは模擬で、実際の取引ではない。採点役はモデルで、その判定が弁護士の判断とどこまで一致するかを Harvey は示していない。事後学習で与えた報酬も同じ採点役がつけた点数で、試験官の基準で受験者を鍛えているのに等しい。Harvey 自身もこの訓練実験を "initial explorations"(初期の探索)と呼び、製品に展開したとは一言も書いていない。目指す "near-perfect pass rates"(ほぼ満点の合格率)にはまだかなりの距離がある、とも明記している。つまりこれは、設計はきれいだが 1 社しか測っていない研究段階の数値である。

点数は読んだ量についてくる

では、ハーネスを替えるだけで 40 ポイント近く伸びるのはなぜか。Harvey の答えは単純で、読んだ量が数十倍から数百倍違うからだ。

"In the standard tool-loop harness, no run reads more than 1% of the data room, and most read between 0.1% and 0.5%. In the RLM harness, nearly every run reads more than 10% of the data room and most read close to all of it." "Higher coverage is associated with higher rubric criteria pass rates across this range."

>

(要旨:標準のツールループでは、データルームの 1% を超えて読んだ回は一度もなく、大半は 0.1〜0.5%。再帰型ハーネスではほぼ毎回 10% 超を読み、大半はほぼ全量を読んだ。読んだ範囲が広いほど合格率も高い。)

デューデリジェンスという試験の形が、この結果を決めている。チェックリストには、複数の文書を突き合わせないと見つからない項目がある。あるはずの文書が存在しないことを確かめる項目もある。後者は読み切ることでしか証明できない。開けていない棚について、中に何もないとは言えないからだ。拾い読みするエージェントは、この種の問題では最初から点を取れない。

Harvey の付録にある直感に反する結果も、これで説明がつく。再帰をもう一段深くし、サブエージェントにも振り分けを許すと、14 室のうち 10 室で成績が下がり、平均 19 ポイント落ちた。うち 4 室は読み終えたのに報告書を書かずに終わっている。3 月に出た独立の再現論文も、別のベンチマークで再帰を深くする代償を見ている。2 段目まで深くすると成績が落ち、実行時間は 3.6 秒から 344.5 秒に跳ね上がった。さらに別の研究者グループの論文によれば、同じ時間予算の下で、再帰に頼らずモデルに自己点検させてから処理方法を選ばせるやり方が、再帰型ハーネスを最大 22% 上回った(原文は何に対する比率かを明記していない)。

この三つの結果からわかるのは、再帰そのものは必要条件ではなく、段を重ねればかえって悪くなるということだ。 点数と一緒に動いているのは、読んだ量である。ただし Harvey が報告しているのは、カバー率が高いほど合格率も高いという相関までだ。「振り分けがうまいほど、読む量も点数も同時に増える」という可能性は排除していない。

長文書エージェントを作っているチームにとって、この数値が示す診断の順番ははっきりしている。まずエージェントが資料の何割を実際に読み込んだか、本当に振り分けたかを測る。モデルやツールの調整はその後でよい。

汎用エージェントが負けたのは初期設定のせいで、能力のせいではない

読む量が決め手だとすると、元の判断で最も刺激的だった一文も見え方が変わる。「既製の Claude Code と Codex は最も単純なツールループにすら負ける」。数字は本物だが、それが何を測ったのかを見る必要がある。

Harvey ははっきり書いている。

"We also ran two general-purpose coding agents with web tools disabled, Claude Code with Opus-5, and Codex with GPT-5.6 Sol, using the same minimal instruction as the tool-loop harness." "In the traces, both agents stop reading early and write shorter memos, and neither spawns sub-agents despite having the ability to."

二つの汎用エージェントにはツールループと同じ最小限の指示しか与えておらず、実行記録では両者とも早々に読むのをやめ、短いメモを書き、能力があるのにサブエージェントを一度も出していない。負け方は前節と同じで、読み切っていないのだ。これは既定の振る舞いを測った数値であって、能力の上限を測った数値ではない。

Harvey 自身のデータに対照群がある。オープンソースの GLM-5.2 を再帰型ハーネスの主エージェントに据えると、最初はやはり早々に投げ出し、振り分けも足りないことが多かった。Harvey は GLM-5.2 自身の実行記録のうち、成績がよく多く読んだものを選び出し、それで同じモデルを微調整した。別の 20 室で行った小規模な実験では、成績が 46.1% から 60.1% に上がり、出すサブエージェントの数もデータルームの大きさに応じて増えるようになった(両者の相関係数は 0.17 から 0.84 に上昇)。この 20 室は上の表とは別のセットなので、数字を直接比べることはできない。Harvey の結論はこうだ。

"The behaviors that make a strong root diligence agent, like exhaustive delegation, are learnable from a relatively small number of on-policy traces, with no privileged information and no labeled legal knowledge."

徹底した振り分けのような、よい主エージェントに必要な振る舞いは、比較的少ない実行記録から学べ、特権的な情報もラベル付きの法律知識もいらない、という。

元の判断をいちばん揺さぶるのはこの一文だ。再帰型ハーネスに差をつけさせた振り分けの習慣は、Harvey の実験では法律知識を必要としなかった。本誌はここから、汎用のエージェントも原則としてこれを学べると推論する。ただし Harvey が確かめたのは GLM-5.2 という一つのモデルだけだ。いま見えているのは、モデル企業が大量の振り分け能力を汎用エージェントにすでに組み込んだことまでで、それを長文書のレビューで測った数値はまだない。

だから公平な言い方はこうなる。長文書の仕事では、既定の設定で動かした汎用エージェントは読む量が少なすぎる。仕事を振り分けさせれば負けるとは限らず、別のベンチマークではむしろ勝っている。Harvey は「サブエージェントへの振り分けを有効にした汎用エージェント」を試していない。そこがまさに、本稿が先に書き定めた反証条件である。

「ハーネスはモデルの乗り換えより重要」は半分だけ正しい

汎用エージェントの話から、ハーネスとモデルの綱引きに移る。元の判断は、再帰型ハーネスの効果は「フロンティアモデルへの乗り換えより大きい」としていた。Harvey 自身のグラフで確かめる。

文書を読む地道な作業は安い小型モデルに任せられる。だが、どう切り分けるか、読み切るかどうか、数百件の発見をどう一本のメモにまとめるかを決める主エージェントは、モデルの良し悪しで大きく差がつく。最高の成績は「最も強いモデルを正しいハーネスに入れた」ときに出ている。ハーネスもモデルも効いており、両者は補い合う。

コストも、元の判断がほのめかしたほど一方向ではない。Harvey は、再帰型ハーネスに替えると 7 モデルのうち 6 モデルでコストが上がったと明記している。以下は本誌が Harvey の対数目盛りのグラフから読み取った近似値だ。安いモデルはデータルーム 1 室あたり 1 米ドル未満から約 3〜6 ドルに上がり、GPT-5.6 Sol は約 27 ドルになる。唯一の例外が Opus 5 である。単純なループで自分で読むと 1 室約 18 ドルかかるが、主エージェントに回ると約 7 ドルで済み、しかも 35 ポイント高い。どの金額も 1 室あたり数ドルから二十数ドルの範囲に収まる。本当のコストは時間のほうだ。1 回の実行に 1 時間以上かかることがあり、この種の仕事は即答型というより、預けて結果を待つバックグラウンド作業に近い。

では垂直 AI は何を守るのか

ハーネスもモデルも単独では決め手にならないとすれば、元の判断の結論が問われる。垂直 AI の守れる位置は「タスク専用のハーネスと、事後学習したオープンソースの主エージェント」にあり、フロンティアモデルの転売や汎用エージェントの薄い包装にはない、というものだった。次の三点から、この結論は成り立たない。

1. ハーネスそのものは公開されている。 再帰型言語モデルの推論ライブラリは MIT ライセンスでオープンソース化されており、汎用フレームワークの既製モジュールにもなっている。Harvey のこの記事も、やり方をかなり詳しく書いている。

2. 事後学習したオープンソースモデルは、今のところフロンティアモデルに負けている。 事後学習済みの Qwen 主エージェントは 63.0% で、同じハーネスに入れた Opus 5 より 14.6 ポイント低く、事後学習していない他の 3 モデルよりも低い。利点はコストと運用の自由かもしれない(オープンウェイト、つまりモデルの重みが公開されていて誰でも自前でホストできる)。だが Harvey はこのモデルの 1 室あたりコストを公表しておらず、その点は今のところ何とも言えない。

3. Harvey 自身の事後学習は独自データに頼っておらず、製品にもまだ入っていない。 8 月に発表した自社モデル Tenet(Kimi K3 をベースに Fireworks と共同で事後学習)について、Harvey は "We did not use any customer data in any of our post-training efforts." と明記し、関連する能力は "over time"(順次)製品に取り込むとしている。

では何が残るのか。このデータから推せるのは、点数を大きく押し上げた振る舞いは、訓練環境が一式揃って初めて鍛えられるということだ。模擬データルームを作れること、500 を超える項目の専門家チェックリストを書けること、採点役がそのリストでつけた点を報酬にして繰り返し訓練できること。だから希少なのは、文書を読むプログラムではなく、物差しのほうかもしれない。デューデリジェンスが網羅的で正しいかを判定する採点基準と、それを使って組んだ訓練環境のことだ。ただし正直に書いておく。Harvey の法律エージェント・ベンチマークは一部がすでにオープンソースになっており、この物差しのうちどれだけが自社のものとして残っているかを本誌は確かめきれていない。顧客の信頼や、データを外に出さない契約要件といった販路側の強みも、本稿では測っていない。この段は本誌の推論で、確信度は前の四節より低い。

チャットアシスタント(2022)自然言語=インターフェース
Copilot 組み込み(2023)業務フローに埋め込み、手を動かすのは人
コーディングエージェント(2024-)タスクを丸ごと渡し、人が検収
汎用エージェント基盤(2026-)ツールや端末をまたいで作業;基盤モデルは差し替え可能

進行中 ?

対立する主張メタハーネス路線:ベンダー中立で、組み合わせ可能なエージェント共通層(Databricks Omnigent 型)

本稿が本誌のトレンド追跡に与える影響:本誌は「汎用エージェントの層を最終的に誰が押さえるか」を追っており、道は二つある。モデル企業が自ら作り、基盤モデルを差し替えられる汎用エージェント基盤(Claude Code など)か、ベンダー中立でモデルを替えられる第三者の外側の層か。本稿の証拠は前者を一歩前に進めた。長文書の仕事では、作り込んだハーネスと汎用エージェントの差は主に、仕事を振り分けて読み切るかどうかにある。そしてその能力を、モデル企業は自社の汎用エージェントに組み込みつつある(Claude Code の動的ワークフロー)。作り込んだハーネスの優位が汎用エージェント上で消えれば、法律や金融など単一業界に特化した垂直 AI 企業がこの層で守れるものはさらに減る。残るのは採点基準と販路だ、と本誌は推論する(確信度は低い)。

本誌の見立て

モデルが一度に読める量を超える長文書の仕事では、品質はエージェントが資料を読み切ったかどうかと強く連動する。Harvey の実験では、再帰型ハーネスのエージェントはほぼ毎回データルームの 1 割以上を読み、大半はほぼ全量を読んだ。単純なツールループのエージェントは 1% にも届かず、両者の差は平均 39 ポイントだった。Harvey が報告しているのは両者が一緒に動くことで、因果は切り分けていない。読み切れるかどうかは、仕事を振り分ける習慣で決まる。Harvey の実験は、この習慣に法律知識はいらず、少数の実行記録から学べることを示した(確かめたのはまだオープンソースモデル 1 つだけ)。Anthropic も数百のサブエージェントを一度に出す能力を汎用エージェントに組み込んだ。既定の設定で動かした汎用エージェントは読む量が少なすぎるが、振り分けを有効にすれば負けるとは限らない。ハーネスを正しく選んだ後でも、主エージェントにどのモデルを使うかで 35 ポイント以上の差が残り、事後学習したオープンソースの主エージェントはまだフロンティアモデルに負けている。したがって垂直 AI 企業が守れるものは、ハーネスのコードにはなく、今のところ自前で事後学習したモデルにもない。守れるのは、デューデリジェンスが網羅的で正しいかを判定する専門家の採点基準と、それで繰り返しモデルを訓練できる模擬データルームだと本誌は推論する(確信度は低い)。

これから見るべき数値

1. 汎用エージェントにサブエージェントへの振り分けを有効にさせ、長文書のデューデリジェンスで再実行した例が出るか。 本稿にとって最も直接的な検証になる。見る場所は Harvey ブログの続報と、Anthropic の動的ワークフローの更新だ。

2. Harvey の事後学習済み主エージェントが製品に入るか、1 室あたりのコストはいくらか。 事後学習したオープンソースの主エージェントが明らかに安いコストでフロンティアに迫る成績を出せば、第 5 節の二点目は書き直しになる。

3. 法律エージェント・ベンチマークのデューデリジェンス問題群が公開されるか、採点役と弁護士の判断の一致度が公表されるか。 物差しが公開されれば、「希少なのは物差し」は撤回する。

この判断を覆す条件

以下の三つはいずれも検証期日を 2027 年 3 月 31 日とする。閾値(20 ポイント、77.6%)は本誌が独自に設けた観察線である。

1. 同種の長文書デューデリジェンスで、サブエージェントへの振り分け(または動的ワークフロー)を有効にした Claude Code か Codex が、なお専用の再帰型ハーネスに 20 ポイント以上負ける。 本稿の「差の主因は読み切っていないこと」は成り立たず、元の判断「汎用エージェントは誤った初期設定」が復活する。

2. 事後学習したオープンソースの主エージェントが、同じハーネスで最良のフロンティアモデルに並ぶか上回る(たとえば Harvey が訓練中の GLM-5.3 が、取り置きの評価セットで Opus 5 の 77.6% を下回らない)。 第 4・5 節の「事後学習したオープンソースモデルは今のところフロンティアに負けている」は改め、元の判断の後半が一部復活する。

3. 第三者が実際のデータルームか弁護士の採点でやり直し、カバー率と点数の関係が消える。 本稿のメカニズムの主張は成り立たない。


本記事は日本語版・英語版・中国語版と同一の調査と判断にもとづいて書かれています。出典にはリンクを付け、原文書と報道を区別し、確かめられなかった点を明記しています。

ご意見・ご感想は [email protected] までお寄せください。