夕刊 SecondSource 夕刊・2026/10/5 · 2026年10月5日
本号は普段より約3時間遅れてお届けしました。申し訳ございません。
今日はなぜ読むべきか:今日の市議会公聴会にかかる事前審査の 8 法案で、最も影響の大きい法案は、モデルの販売前に第三者の検証を求め、人間が止められることも条件にする。その前日、OpenAI CEO の Altman はインタビューで「世界はある程度の悪いことが起きるのを受け入れるべきだ」と述べたが、この法案には触れていない。
1. ニューヨーク市議会が今日、まだ正式に提出されていない AI 法案 8 件を公聴会で議論する。最も影響の大きい法案は、第三者の検証がないモデルや人間が止められないモデルの市内での宣伝・販売・配備を禁じる。今日は採決しない(影響:ニューヨークで AI を売る企業)
2. OpenAI CEO の Altman は Anthropic と規制の立場が「大きく違う」と言い、OpenAI の元政策責任者は二社のやり方は「ほとんど同じ」と反論した(影響:OpenAI と Anthropic を比較・評価する人)
3. 米国が 17 か国(米国を含む)による京都の科学研究宣言を主導し、ホワイトハウスは説明文で AI の新しい呼び名「超知能」を使った。プレスリリースの要約に資金の額も法的拘束力のある条項も載っていない(影響:署名国の研究者)
今週ふるいにかけた言説のうち、追跡リストに載せる水準に達したものは一つもない。今号は、結果がすでに出ているのにコラムでまだ書いていなかった判断を三つ、振り返って報告する。三件とも、確認は 9 月 30 日にずれ込んだ。答え合わせの日は、Sonnet 5 の価格が 9 月 1 日、Microsoft の年次報告書と 8 月 16 日号の判断(問うたのは 9 月 1 日の価格)がいずれも 9 月 15 日である。
答え合わせ:Anthropic の Sonnet 5 は 9 月 1 日に元の価格へ戻るか
①当時の見立て:本紙は 7 月 31 日、次の一文を検証待ちの判断として登録した。登録した一文は「Anthropic Claude Sonnet 5 の API キャンペーン価格が 2026-08-31 に期限を迎えたあと、公式料金ページの定価はキャンペーン前の標準価格に戻る」で、100 万トークンあたり入力 3 米ドル、出力 15 ドルだ。当時のキャンペーン価格は入力 2 ドル、出力 10 ドルで、標準価格に戻れば五割の値上げになる。トークンとは AI が文章を読み書きするときの計量単位で、数文字ごとに 1 つと数え、使うほど料金が上がる。当時の確信度は 0.85(満点は 1)だった。
②実際に確かめた結果:事前に指定した出典は Anthropic の公式料金ページである。ページの注 3 は、入力 2 ドル、出力 10 ドルという Sonnet 5 の価格について、「announced at launch as introductory pricing through August 31, 2026, is now the standard price」と書く。発表時には 2026 年 8 月 31 日までのキャンペーン価格としていたが、いまは標準価格だという意味だ。予定していた 9 月 1 日の値上げは「will not occur」、行われない。9 月 30 日に確認し、10 月 4 日にもう一度確かめたが、内容は同じだった(Anthropic 料金ページ)。
③判定と、どこで外れたか:結論:値上げは起きず、入力 2 ドル、出力 10 ドルが標準価格になった。すでに Sonnet 5 でコストを試算しているチームにとって、その 2 ドルと 10 ドルは期限付きのキャンペーン価格ではなく、いまや公式の標準価格である。ただしこの一件が示すとおり、標準価格も会社が変えられる。判定は外れ。理由は、値上げの前提がその後の会社の方針変更で崩れたことだ。値上げはもともと予定に入っていたが、Anthropic があとからキャンペーン価格を標準価格に変えた。料金ページはいま、値上げは行わないと明記している。価格を変えた正確な時期を本紙は確認できていない。0.85 という確信度は、「予定された条項はそのとおり実行される」という一点に全面的に依存しており、会社が考えを変える余地を残していなかった。
④本紙が追う判断への影響:確信度はまだ動かしていない。この件が関わる判断は二つある。フロンティア AI 企業が価格を守れるか、そして AI 企業が利用量を売ったあとに粗利率を守れるかだ。どちらの確信度も、いまは判定前の値のままで、本紙はこの結果を受けた調整をまだしていない。
⑤判定の基準を変えるか:一か所変える。会社は期限の前に自分で価格を変えられる。だから今後「予定された価格変更はそのとおり実行される」と判断するときは、本紙は確信度の上限を 0.7 とする。あわせて「期限前に価格変更が告知されたら外れ」という条件を事前に書いておく。
答え合わせ:Microsoft の年次報告書は、OpenAI のクラウド利用枠が Azure 売上に計上されたかどうかを明らかにするか
①当時の見立て:8 月 2 日のコラムで判断として登録した。Microsoft はクラウドの利用枠(クレジット)で OpenAI に出資し、OpenAI はその利用枠で Microsoft の Azure クラウドを買う。利用枠が Azure の売上に計上されるなら、Microsoft が出資した資金は顧客からの売上という形で帳簿に戻ってくる。ベンチャーキャピタル Benchmark の Bill Gurley は利用枠が Azure の売上に入っていると言い、Microsoft CEO の Satya Nadella は入っていないと言った。本紙は「どちらかが間違っている」と書き、Microsoft の 2026 会計年度年次報告書の会計注記で決着がつくと判断した。当時、確信度は記録していない。
②実際に確かめた結果:事前に指定した出典は Microsoft の 2026 会計年度の年次報告書(10-K、2026 年 7 月 29 日に米証券取引委員会へ提出、提出番号 0001193125-26-323660)である。9 月 30 日に直接読んだ。注記には「we recorded revenue from commercial arrangements with OpenAI, inclusive of revenue-sharing payments」とあり、OpenAI との商取引から生じた売上を、収益分配の支払いも含めて計上したという。金額は 241 億米ドルだ。注記は総額を出すだけで、利用枠をどう計上したかは書いていない。
③判定と、どこで外れたか:判定できない。事前に指定した出典が、この問いに答えていなかった。登録する前に、本紙はこの年次報告書が過去にこの種の数字を開示したことがあるかを確かめていなかった。
④本紙が追う判断への影響:なし。Gurley と Nadella の二つの主張は元の確信度のまま残し、どちらも裏付けられてはおらず、覆されてもいない。読者にとっての結論は、Microsoft が公開した 2026 会計年度の年次報告書では、利用枠が Azure の売上に計上されたかという論争は決着しない、ということである。
⑤判定の基準を変えるか:一か所変える。判断を登録して出典を指定する前に、その出典が以前に同じ種類の数字を開示しているかを確かめる。前例が見つからなければ、予備の出典を別に一つ書いておく。
答え合わせ:Anthropic は「値上げに踏み切れない」のか。9 月 1 日に条項どおり標準価格へ戻ったか
①当時の見立て:8 月 16 日号のコラムは、Gurley の「誰も値上げに踏み切れない、Anthropic はシェアを失うのが怖くて価格を動かせない」を不成立と判定した。いちばん強い根拠は、公式料金ページが Sonnet 5 のキャンペーン価格は 8 月 31 日に期限を迎えると明記していることだった。そこで本紙は、9 月 1 日に条項どおり標準価格(五割の値上げに当たる)へ戻るかを追った。当時、確信度は記録していない。
②実際に確かめた結果:一つ目と同じ料金ページの同じ注 3 である。入力 2 ドル、出力 10 ドルはすでに標準価格で、値上げは行われない。
③判定と、どこで外れたか:外れで、理由は「推論の誤り」だ。本紙は期限の日付を「会社は値上げする気がある」証拠として扱ったが、条項に期限が書いてあっても会社は変えられる。8 月 16 日号で Gurley に反論したいちばん強い根拠はこれで無効になり、照合の結果は「不成立」から「保留」に戻した。その号のコラムと同日の夕刊には、すでに注記を加えている。
④本紙が追う判断への影響:コラムの照合結果は 10 月 3 日に「不成立」から「保留」に変わった。この件が関わる判断は三つある。AI の価格と市場シェアの事実、価格競争が起きるか、そしてソフトウェア業界の利益がどこまで押し下げられるかだ。三つともまだ評価し直していない。
⑤判定の基準を変えるか:新たには変えない。誤りの型は一つ目と同じで、予定された条項を会社の意思表示と受け取った点にある。一つ目ですでに直した。
この件の答え合わせカードは、いまのところ中国語版しかない。
本紙のすべての判断と答え合わせの日 → 判断一覧
なぜあなたに関係するのか: モデルを使ったサービスにニューヨークの利用者がいるなら、二点を自分で確かめておける。人間がそれを止められるか、外部の検証に出せるか。ただし法案の適用範囲はまだ決まっておらず、今日の時点では法律でもない。
ニューヨーク市議会の公式立法記録システム Legistar によると、今日は午前 11 時から本会議が開かれる。最初の議題は監督公聴会「Examining the Risks Posed by Artificial Intelligence」で、続く 8 件が AI 関連の事前審査法案だ。事前審査法案とは、正式に提出される前に公聴会で先に議論される法案を指す。法案ページに登録された正式な提出日は 10 月 8 日で、今日は採決もしない。したがって、8 件はどれもまだ法律ではない(ニューヨーク市議会 Legistar、2026-10-05 議事日程)。最も影響の大きい法案について、公式の要約はこう書く。「This bill would make it unlawful to market, offer for sale, sell, or deploy an artificial intelligence (AI) model in New York City that has not received third-party validation or does not have a technical capability to be shut down by a human operator.」平たく言えば、第三者の検証がない AI モデル、または人間が止められない AI モデルは、ニューヨーク市内で宣伝・販売・配備がいずれも違法になる。検証者は、モデルが検証を通ったか、配備してよいかという結論を、開発者と市のサイバーセキュリティ部門 Cyber Command に報告する。検証者はそのモデルとの利害関係も開示しなければならず、違反一件ごとに 2.5 万米ドルの罰金が科される。
別の法案は、誰でも AI がらみの違法行為を市の消費者・労働者保護局に通報できるようにし、通報者は回収額の 25% を受け取れる。自分で送達や提訴まで行えば 50% になる。
市議会の 9 月 16 日のプレスリリースによれば、Julie Menin 議長は Anthropic CEO の Dario Amodei と OpenAI CEO の Sam Altman に本人の出席を求めた(ニューヨーク市議会、2026-09-16)。地元紙 amNewYork は 9 月 28 日、OpenAI、Google、Anthropic、Meta が宣誓証言に代表を出すことに同意したが、CEO 本人ではないと報じた。Elon Musk の AI 企業は市議会に返答せず、議長から召喚状を受けた(amNewYork、2026-09-28)。現状(本号の時点):公聴会はまだ始まっておらず、誰が出席して何を述べたかはまだ分からない。
検証: 議事日程と法案の中身について、本紙が読んだのは市議会の公式ページにある要約で、条文の全文ではない。要約は本紙が自動ツールで取得したもので、人手で一字一句照合してはいない。四社が宣誓証言に同意したこと、Musk の企業が召喚状を受けたことは、いまのところ amNewYork 一社しか報じていない。⚠️ 要約は「AI モデル」の範囲を定めていない。最先端の大型モデルだけが対象なのか、すべてなのか。ニューヨーク市の利用者がクラウド経由で市外のモデルを呼び出す場合、「市内での配備」に当たるのか。この二点で、法案が AI 開発企業に実際に適用されるかどうかが決まる。「止める」がサービス全体の停止なのか一回の実行の中断なのかも要約は書いておらず、オープンウェイト(モデルの重みを公開し、誰でも自分でダウンロードして動かせる)のモデルにどう当てはめるかも書いていない。⚠️ AI 規制を長く唱えてきた論評者 Gary Marcus は、この公聴会に向けた証言の予告を出し、先に挙げた「通報者が回収額を受け取れる」法案を内部告発者法案と呼んだ(Gary Marcus、2026-10-05)。公式の議事日程では、内部告発者の保護は別の法案で、対象は市の請負業者である。本紙は公式の議事日程に従う。
判断更新: 本紙の 10 月 4 日の深掘りレポートは、9 月 29 日のホワイトハウス AI 協定を扱った。この協定は、Google、OpenAI、Anthropic、Meta、xAI、NVIDIA などのトップがホワイトハウスで署名した自主文書で、法的な強制力はない。深掘りレポートによれば、協定が本当に書いていないのは二点で、監査の範囲を誰が定めるかと、結果を誰に見せるかだ。公式の要約から見る限り、ニューヨークの法案は「結果を誰に見せるか」に答えている。結果は開発者と市に渡し、検証者は利害も開示する。範囲を誰が定めるかは、要約に書かれていない。条文の全文を本紙は読んでいない。
本紙は 10 月 3 日号で、責任追及の事例を六件記録した。上院議員 Hawley、フロリダ州、カリフォルニア州とニューメキシコ州の司法長官、FTC、そして民間の訴訟一件である。六件はいずれも既存の法律に拠っていた。フロリダ州の申し立て一件(裁判所はまだ判断していない)を除けば、追っているのはすでに起きたことだった。ほかに、ホワイトハウスは 10 月 3 日に AI 作業部会を設けた。ウォール・ストリート・ジャーナルの報道を金融サイト Investing.com が伝えたところでは、その規約の第一条は「regulation that could restrict innovation or competition」、つまりイノベーションや競争を制約しうる規制は採らないと明記している(Investing.com、2026-10-03)。連邦の作業部会は、規約でこの種の規制を採らないとした。一方、モデルの販売前に誰の承認が要るかを定める条文は、いまのところ地方が先に書いている。
そこで本紙は、まだ検証を終えていない推測を一つ加える。モデルの販売前に誰の承認が要るかは、連邦より先に市や州が条文にするかもしれない。証拠は弱く、いまあるのは一つの市の、まだ採決されていない法案一本だけだ。
この判断を覆す条件: 年末までにこの検証法案が委員会を通らず、ほかの州や大都市も同じ条項を出さなければ、この推測は大きく弱まる。連邦が年内に、地方は AI の販売条件を独自に定めてはならないと明文で宣言すれば、「販売前に誰の承認が要るかを決める権限を連邦が取り戻した」と書き直す。直近で見るべきは、10 月 8 日に正式提出される版が「AI モデル」の定義を補ったか、クラウド経由の呼び出しを含めたかである。答え合わせの日は本紙が自ら決めた 2026 年 12 月 31 日とする。
なぜあなたに関係するのか: 二社を比べるとき、CEO の発言だけを根拠にしないことだ。Altman は大きく違うと言うが、Brundage が挙げた製品と配備のやり方四つは、どれも二社で同じである。
テックメディアの SiliconANGLE は 10 月 4 日、Politico の新しいニュースレター『Decoded』のインタビューを引き、Altman が「I think there's a lot of daylight」と述べたと伝えた。Altman は「重大なハッキングは起こさない、悪用もない、詐欺はゼロ」を保証せよという基準は受け入れない、と述べた(原文:we'll make sure there's no major hacks, there's no misuse of this technology, there's zero scams)。強力な AI が一つのラボに集中することは「completely unacceptable trade-off」、まったく受け入れられない取引だとも述べた(SiliconANGLE、2026-10-04)。Politico の記者 Jonathan Martin が引いた原文は「we believe that the world should accept some bad things happening for the benefits of this technology and people having the agency」で、この技術の恩恵と人々の主体性のために、世界はある程度の悪いことが起きるのを受け入れるべきだ、という意味になる(Jonathan Martin、2026-10-04)。
同じ日、かつて OpenAI の政策研究責任者を務め、いまは独立している Miles Brundage が反論した。「There really isn't a lot of daylight」。彼が挙げた理由は四つある。二社とも自社の価値観の一部を製品に組み込んでいる。どちらもモデルの重みをほとんど公開しない。どちらも無料の利用者を大量に抱える。どちらも最良のセキュリティ用ツールをまず守る側に渡す。締めくくりは「Narcissism of small differences」、小さな差異のナルシシズムだった(Miles Brundage、2026-10-04)。彼は別に、Altman が問い詰められて挙げた Anthropic の例は事実と違うとも述べている。
検証: Politico の原文は入手できていない。SiliconANGLE は元のページを読んだ。Forbes とロイターも同じ日に同じインタビューを報じたが、本紙が読めたのは見出しだけだ。これらの報道はいずれも同じ一つのインタビューに由来するので、確認できるのは、Altman がそう述べたという一点だけである。Brundage の投稿は原文を読んだ。⚠️ Brundage の「Altman の例は事実と違う」は、本紙が独自に確かめていない。また Brundage はかつて OpenAI に勤めており、二社のどちらとも利害関係がある。本紙の分析は Anthropic 製モデルの支援を受けて作られており、Anthropic はこの件の当事者の一社だ。
判断更新: 二人の主張はどちらも残す。本紙の読み(二人の発言そのものではない):Altman が語っているのは規制をめぐる公の立場で、Brundage が並べたのは製品と配備のやり方である。二人の論点はずれているように見える。読者は、今日の公聴会で二社の代表が述べる証言を手がかりに、Altman の言う違いが本当にやり方に表れているかを確かめられる。今日の中核 1 と合わせて読みたい。amNewYork によれば、OpenAI は今日の公聴会で代表に宣誓証言させることに同意した。Altman のインタビューは、ニューヨークのこの法案に触れていない。
なぜあなたに関係するのか: 要約に資金の裏付けも法的拘束力も見当たらないこの宣言を、政策が本気で動き出した合図と読まないことだ。ホワイトハウスは、17 か国が支持した宣言の説明に「超知能」という新しい呼び名を持ち込んだ。ただ、本紙は宣言の全文を読めておらず、宣言そのものがこの語を使っているかは確かめられていない。プレスリリースの要約も、資金の額と法的拘束力のある条項を挙げていない。
ホワイトハウス科学技術政策局の Michael Kratsios 局長は 10 月 4 日、京都の STS フォーラム(科学技術と社会フォーラム、毎年京都で開かれる科学技術政策の会議)で、米国が主導して 17 か国が「Kyoto Vision for a Golden Age of Science」を支持したと発表した。「The way we make scientific discoveries has changed, and the Kyoto Vision is a recognition of that shift and a call to action.」(Michael Kratsios、2026-10-04)ホワイトハウスのプレスリリースは中身を三つにまとめる。研究機関への資金の出し方と組織の形を改める。超知能を研究のプロセスに組み込み、研究者が関連ツール、科学データ、コンピュート、実験設備を使える範囲を広げる。能力で選んだ学生と若手研究者に投資する。支持したのは、アルゼンチン、ブルガリア、チリ、キプロス、ドイツ、ギリシャ、インドネシア、イタリア、日本、カザフスタン、韓国、ニュージーランド、ポーランド、シンガポール、アラブ首長国連邦、英国、米国だ(ホワイトハウス、2026-10-04)。「超知能」(英語で super intelligence、略称 SI)は、ホワイトハウスが 9 月 29 日の大統領令で、政府の文書で使う「AI」に代えて採用した新しい呼び名である(ホワイトハウス、2026-09-29)。
検証: 発表には一次の出所が二つある。Kratsios 本人の投稿と、ホワイトハウス公式サイトのプレスリリースだ。ただし両者の発信元は同じである。プレスリリースは要約を読んだもので、全文を一字一句読んではいない。⚠️ 名簿にはフランスもカナダもなく、中国やインドもない。招かれなかったのか、署名しないのか、別の日程があるのかは、出典に書いていない。
判断更新: どの判断も変えない。記録しておく点は一つある。呼び名を改めた大統領令のあと、米国が多国間で支持された文書の説明に「超知能」の語を使ったのは、本紙が追っている範囲ではこれが初めてだ。この語はホワイトハウスのプレスリリースから来ている。本紙が読めた中身は枠組みと用語だけで、資金の額や法的拘束力のある条項は見当たらない。今後、署名国のどこかが予算やコンピュートの計画をこの宣言に結びつければ、そこで初めて実質が伴ったと言える。
今日持ち帰れる一手:中核 1:モデルを使ったサービスにニューヨークの利用者がいるなら、二点を自分で確かめておける。人間がそれを止められるか、外部の検証に出せるか。法案の適用範囲はまだ決まっておらず、今日の時点では法律でもない。ほかの中核について、今日動く必要はない。
1. [今日](伝聞の日 10 月 4 日)ブルームバーグが目にした文書によれば、中国の地方政府傘下の融資会社が、ある上場企業の代わりに資金を出して 700 台超のサーバーを買った。そのうち 32 台は NVIDIA のデータセンター向け GPU、B300 を積んだ ASUS 製の機種である。B300 は米国の規則で、許可なく中国へ売ることができない。ブルームバーグの原文を本紙は読めていない(Poe Zhao、2026-10-04;Teortaxes、2026-10-04)。
2. [今週](報道日 10 月 3 日)Axios によれば、NVIDIA が出資する米国の AI 企業 Reflection が、オープンウェイトのモデル(誰でもダウンロードして自分で動かせる)を出す準備をしている。情報源は、中国の最上位のオープンモデルと競える一方、当初は米国の最強システムに後れを取ると見込む。この話を転載した匿名の論評アカウント Teortaxes は疑問を示した。Axios の原文を本紙は読めていない(@choblin29、2026-10-03;Teortaxes、2026-10-04)。
1. [今四半期] OpenAI の自社推論チップ Jalapeño、HBM4 を 6 個載せ 216 GiB・毎秒 15.4 TB(仕様の開示日 8 月 26 日、インタビューでの伝聞 9 月 30 日、本紙が今日補記)。 パッケージ一つに載る HBM4 は最新世代のメモリで、製造は TSMC の 3 ナノメートルプロセス、定格ピークは 700 ワットである。OpenAI 自社チップの HBM 需要を見積もる出発点は、1 チップあたり HBM4 が 6 スタックという点だ。そこに出荷数を掛ける必要があるが、量産と出荷の数字はいま公開されていない。推論チップは、公開したモデルが質問に答える側の仕事だけを専門に受け持つ。本紙は 8 月 31 日号で、NVIDIA のラックと比べた電力あたりの出力と総保有コストを書き、10 月 4 日号では OpenAI のハードウェア責任者 Richard Ho がモデルを使ってこのチップをどう設計したかを書いた。700 ワットと総保有コストはすでに書いており、今日新たに加えるのはメモリ構成とシステム規模である。台湾の産業調査機関 TrendForce は、各パッケージが演算ダイと HBM4 のスタック 6 個を一緒に載せ、「delivering 216 GiB of memory and 15.4 TB/s of bandwidth」、製造は TSMC の 3 ナノメートルだと書く(TrendForce、2026-08-26)。HBM は、何層ものメモリを縦に積み上げ、演算ダイと一緒にパッケージした高帯域メモリだ。
半導体アナリスト Ian Cutress のニュースレター More Than Moore は別に、定格ピークは 700 ワット、実測の持続消費電力は 550 ワットに近いと書く。測定の条件は開示されていない。128 個のアクセラレータが一つの相互接続単位(原文は local domain)を作り、システム全体は 2,048 個になる(More Than Moore、2026-09-30)。
⚠️ 二本とも OpenAI 自身の開示を伝えたもので、本紙は OpenAI の元ページを読めていない。TrendForce と More Than Moore の二つの経路で伝わったが、情報源は一つで、第三者の測定はない。550 ワットは OpenAI 自身の測定だ。システム規模を書いているのは Cutress 一か所だけである。TrendForce は、HBM4 は Samsung が供給しているとされると書くが、原文は「is believed to」で、Samsung が供給するという説は、本紙は採らない。⇒ 本紙の推測(まだ確定していない):自社チップが置き換えるのは NVIDIA の演算チップで、メモリは引き続きメモリメーカーから買わなければならない。
1. [今日](投稿日 10 月 4 日)Vercel CEO の Guillermo Rauch:AI エージェントがコードを書くようになったいま、プログラミング言語を乗り換える投資対効果は計算し直す必要がある。 Vercel はウェブサイトのデプロイとフロントエンド向けのクラウド基盤だ。Rauch は、Vercel が以前、ビルドツール Turborepo を Go から Rust に書き直したことを振り返る。Rust はコンパイル時にメモリ安全を保証できることで知られるが、人が書くには手間がかかる。書き直しは技術的には完了したが、人が一行ずつ書いたのでコストが高く、それに見合うかで社内の議論が割れた。彼の主張は、エージェントがコードを書くようになって費用の構造が変わった、人が書きやすい言語が、事業にとっての最良の言語とは限らなくなった、というものだ(Guillermo Rauch、2026-10-04)。⚠️ 書き直しのコストや効果の数字は一つもない。Vercel はエージェント向けの基盤を売っており、「エージェントがすべてを変える」は同社の事業に都合がよい。エージェントが書き直したあと、人のレビューとテストのコストが下がったかどうかを彼は語っていない。⇒ 読者が自分で測れる点が一つある。次に書き直しを検討するときは、「エージェントによる書き直しと人のレビュー」の工数と「人が自分で書き直す」工数を分けて見積もることだ。
1. [今週](論文の公開日 10 月 1 日)ある研究が「新しい研究のヒントになる過去の論文を選び出す」ことを試験問題にした。この論文の要旨の範囲では、AI に何段階も自分で検索させると、単純なベクトル類似度の検索に負けた。 研究チームは、コンピュータサイエンスのプロジェクトの筆頭著者 184 人に、どの先行論文が自分の完了済みプロジェクトを本当に前に進めたか、あるいは進められたはずかを付けてもらった。システムが探せるのは、プロジェクト開始の時点ですでにあった文献だけである。指標は「正解の論文が上位 20 位に入ったか」の割合である。モデルが自分で検索し、読み、次の手を決めるエージェント型検索は 0.42、文章をベクトルに変えて類似度を比べる検索は 0.48、最良のシステムは 0.51 だった。最良のシステムがどちらの型に属するかは、要旨に書いていない(ScholarCatalyst、arXiv 2610.02202)。0.48 とは、およそ半分の問題で正解の論文が上位 20 位に入ったということだ。共著者でスタンフォード大学教授の Chelsea Finn が 10 月 4 日に X でこの論文を紹介している(Chelsea Finn、2026-10-04)。⚠️ 本紙が読んだのは要旨だけだ。測っているのは著者のあとからの判断で、実際にヒントを得た過程ではない。サンプルはコンピュータサイエンスのプロジェクトに限られる。エージェント型検索にどのモデルをどう設定して使ったかは、要旨に書いていない。⇒ この結果はコンピュータサイエンスの一つのベンチマークに限られる。文献検索ツールを自前で作るチームは、まずベクトル検索を比較の基準線に置ける。エージェント型検索が負けたのは、ツールやモデルの設定のせいかもしれず、要旨は書いていないので、エージェント型の手法全体には広げられない。
2. [今週](論文の公開日 9 月 29 日)あるプレプリントは、モデルが間違えるたびに一言の教訓を書かせ、その教訓を添えて再挑戦させた。すると、標準の強化学習ではまったく学べなかった問題で学習が進んだ。 ここでいう強化学習とは、モデルに何度も解答させ、自動で検証した結果で報酬や罰を与えるやり方だ。よく使われる GRPO という手法は、同じ問題への複数の解答の良し悪しを比べて信号を作るので、一問を全部間違えると学べる信号がなくなる。著者らは、Alibaba のオープンモデル Qwen 3.5 9B Thinking が 128 回試してすべて間違えたツール呼び出しとプログラミングの問題を選んだ。標準の GRPO で訓練すると、一回目で正解する率は 0 から 1% にとどまった。新手法 RLTL;DR はモデルに検証結果を読ませて一言の教訓を書かせ、訓練中はその教訓を入力に添えて解答させる。一回目の正解率は 14%〜31% に上がり、評価のときに教訓を外しても 12%〜13% が残った(RLTL;DR、arXiv 2609.37633)。⚠️ プレプリント一本で、試したのはパラメータ 90 億のオープンモデル一つだけ、問題は著者が選び、答えを自動で検証できるタスクにしか使えず、独立した再現はない。⇒ 答えを自動で検証でき、自社モデルの事後訓練をするチームにとって、「一問を全部間違える」難問でも試せる道が一つ示された。ただし教訓は、訓練中にモデルへ文章によるフィードバックをもう一つ余分に与えるのと同じで、標準の強化学習とは使える情報が異なる。したがってこの結果は、「強化学習はモデルがもともとできることを引き出すだけだ」という説を覆す根拠にはまだならない。条件の違う例を一つ足したにすぎない。
本号にプロダクト動向はありません。本紙が読んだプロダクト企業の記事は、いずれも元の公開日が 9 月 16 日以前で、新着ではなかった。残る 170 本は読んでおらず、そのなかに新しいプロダクト記事があるかは確かめていない。
1. [振り返り](深掘りレポート 2026 年 9 月 17 日)AI モデルの価格を比べるなら、定価から「タスクあたりのコスト」に物差しを替えるべきだ。ただし、その物差し自体が動く。 独立評価機関 Artificial Analysis は一週間のうちに版を改めた。その結果、Anthropic の旗艦モデル Fable 5.1 は「タスクあたり前世代より二割高い」から「一割三分安い」に変わった。定価は動いていない。違いは、評価の版が 9 月 1 日の版から v4.3 版に替わったことにある。「二割高い」は 9 月 1 日の版でしか成り立たない。Anthropic と OpenAI が本当に分かれたのは、節約されたトークン(AI の文字数と課金の単位)の分を、利用者と提供側のどちらが得たかだ。OpenAI の GPT-6 Astra は総合指数が同点のまま、タスクあたりの出力トークンがおよそ 2.7 万だった。Fable 5.1 はおよそ 7.8 万である。ところが Astra の定価は、自社の前世代 GPT-5.6 Sol の 2.5 倍に設定されている。深掘りレポートは、トークンを少なく使える強みの一部を定価が取り戻したと判断した。
トークン数は Fable 5.1 との比較で、定価は自社の前世代との比較である。基準が異なるため、この記事だけではタスクあたりのコストは出せない。
買い手は、先月の請求書でキャッシュ読み取りと出力の比率を確かめられる。キャッシュ読み取りとは、繰り返し送るプロンプトの冒頭がキャッシュに当たったときに適用される安い料金のことだ。9 月 17 日の深掘りレポートの判断はこうだ。評価でいうタスクあたりのコストが測るのは標準的な仕事である。あなたの請求書が測るのは、あなた自身の使い方である。キャッシュ読み取りの比率が高いほど、キャッシュ料金の変更の影響は大きくなる。だからこの比率のほうが評価の数字より、世代を替えたあと自社のコストが高くなるか安くなるかを示すかもしれない(深掘りレポート、2026-09-17)。その後:Anthropic は 9 月 22 日に Opus 5.5 を出した。多くの仕事で Fable 5.1 の水準に達し、典型的な仕事の実行コストは Opus 5 より 40% 低い、と同社は公式に述べた。この 40% をどう算出したかを Anthropic は説明していない。これは同社自身の測定で、第三者の測定ではない(Anthropic、2026-09-22)。
本記事は日本語版・英語版・中国語版と同一の調査と判断にもとづいて書かれています。出典にはリンクを付け、原文書と報道を区別し、確かめられなかった点を明記しています。
本紙はニュースのまとめではありません。毎日の AI 情報の流れから、本当に重要な洞察と、長く追う値打ちのある目利きの判断をすくい上げ、それぞれをどう検証したかまでお見せします。焦点は常に「どの判断が固まったか、誰の読みが当たっているか」であって、「今日何が起きたか」ではありません。
—— SecondSource・調査システムによる自動生成 · 23 のソース · ご意見・ご感想は [email protected] までお寄せください