深度 深度專欄 #31 · 2026年9月8日
但決定權可能不在訓練,而在執行。 這個機制假設「模型會不會用你的軟體」是在訓練的時候決定的。目前檯面上唯一真的把這件事量出來的兩篇論文說,它是在執行的時候決定的,而那把整個處方換掉了。
九月五日,OpenAI 研究副總 Jerry Tworek 寫下一句話:開源軟體的意外好處,是讓模型訓練公司免費拿你的軟體去訓練「怎麼操作它」;而 Blender「可能剛剛已經贏了」3D 資產創作這個品類:理由不是它更好用,是模型更會用它。隔天,Box 執行長 Aaron Levie(Box 賣的是專有企業軟體)給了同一個機制的軟體側版本:agent 寫掉大部分軟體、agent 主要在開源上訓練、agent 因此最擅長開源工具,循環幾次,開源就成為預設。
兩個人,一個站在模型那一側,一個站在專有軟體那一側,都在說對自己不利的話。這排除掉最常見的那個可以拿來看輕它的理由:他們不是在替自家敘事鋪路。
本篇的結論是:這個機制的形狀對了,但它把決定權放錯了地方。 兩位發話者、以及順著他們推論的人,都假設「模型會不會用你的軟體」是在預訓練的時候決定的:你的東西進了語料,模型就學會了;沒進去,就沒學會。這個假設從來沒有人量過。今年有兩篇論文量了,而它們的答案是:模型第一次寫出來的操作指令,有將近三成跑不起來;但把跑不起來的那三成,連同軟體吐出來的錯誤訊息原文丟回去、最多重試兩次,可執行率從 70.2% 升到 97.4%。沒有重新訓練或補語料,靠的只是一段錯誤訊息。
換句話說,「模型比較會用開源工具」這件事裡面,真正靠訓練買到的那一項,兩次重試就能取代掉大半。而能不能重試,取決於一件跟授權條款無關的事:agent 能不能真的把你的軟體跑起來、並且讀到一句人話寫的錯誤。
本篇路線分六步:
① 先把這場爭論在爭什麼講清楚,包括本報圖上那則方向相反、從來沒有發給讀者的內部判讀。
② 把「模型比較會用它」拆成兩件會往相反方向動的事:這是本篇的關鍵拆解。
③ 那道護城河的寬度已經被量出來了,而它的單位是「重試次數」。
④ 專有廠商其實早就動手了,但他們買的是另一樣東西,而那件事沒有人講。
⑤ 一個很便宜、可是全世界沒有人跑過的對照組。
⑥ 本篇的判斷、以及什麼情況算我們錯。
這篇比九月七日晨報上的同一條多給了什麼?兩件,都指得出來。
第一,我們攻了自己為這條判斷寫下的驗證方法,它問錯了東西。 晨報那條的原句是:「若六個月內出現第一家主流專有應用程式廠商公開釋出自家操作軌跡語料或代理人工具骨架,而且把它講成分發策略而不是開發者關係,工具這一側就拿到硬證據。」我們去查了。Autodesk 是 Maya 和 3ds Max 的東家。它在 2026 年 4 月就發布了 Revit 官方 MCP 伺服器的技術預覽;Figma 是 2025 年 6 月;微軟在 2025 年 5 月乾脆把它變成一個協定層。Revit 是 Autodesk 的建築與工程 BIM 軟體,和 Blender 所在的 3D 資產創作不是同一個品類;它在本篇的角色只是「一家專有廠商釋出了 agent 操作介面」的一例,不是 Autodesk 對 Blender 的回應。但這三次釋出送出去的都是 MCP 操作介面,不是原句點名的操作軌跡語料或代理人工具骨架;原句的第二個條件,也就是廠商把它講成分發策略而不是開發者關係,本篇沒有分開數過。所以這條觀察點的問題不是它已經被推翻,是它寫得不具分辨力:它沒有規定送出物的型別。更要緊的是,它不能拿來當任何一方的證據,因為專有廠商送出去的東西,和開源工具送出去的東西不是同一樣東西,而沒有人分開來數過。
第二,我們寫死了什麼情況算我們錯,而且這一點我們自己排除不掉。 上面那個 70.2% 到 97.4% 的讀數,是在 Blender 上量的,而 Blender 的操作指令本來就大量存在於訓練語料裡。所以「重試有效」有可能只是因為模型本來就懂個七八分,只差臨門一腳。要分開這兩種解釋,需要在一個模型幾乎沒讀過的軟體上跑同一個實驗。沒有人跑過。因此本篇的判斷停在假說,不升為定論,理由不是來源不夠,是那個對照組不存在。
先把機制講清楚,因為它有一個很容易被跳過的中間步驟。也先釘一件事:Blender 是免費開源的 3D 軟體;Maya、3ds Max、Revit 則是 Autodesk 要付費授權的專有軟體。
當你叫 AI 「做一個木頭椅子的 3D 模型」,它並不是憑空長出一個 3D 檔案。今天最有效的做法是:它寫一段程式碼,那段程式碼去操作一個人類本來就在用的專業軟體,由那個軟體把椅子做出來。這件事本身就是一個判斷的轉彎:多模態研究者 Lucas Beyer 在 2026 年 7 月 25 日公開說,他兩年前「絕對不會」預測到這條路會贏。Beyer 是 SigLIP 的共同作者,前 DeepMind、現 OpenAI;他與 Tworek 同屬 OpenAI,這一則不算獨立於本篇的主錨。
於是問題變成:模型寫的那段程式碼,是操作哪一個軟體?它必須知道那個軟體的指令長什麼樣、參數叫什麼名字。而它從哪裡學會這些?最直覺的答案是:從網路上關於那個軟體的公開文字裡學的,例如教學、原始碼、討論區、腳本範例。
這就是 Tworek 那句話的機制:公開可觀測的東西,才進得了訓練分布。 你的軟體如果得先登入才能操作,模型沒讀過關於它的操作紀錄,自然不會用;Blender 什麼都攤在外面,模型就特別會用它。而當事情是交給 agent 去做的,「模型特別會用哪一個」就等於「哪一個會被選用」,因為選工具的已經不是使用者了。使用者仍然是付錢的那一方,只是不再是動手選工具的那一方:一個已經付錢買了那套軟體的客戶,讓自己的 agent 去讀取、操作他自己的檔案。這裡的 agent 指的是能自己寫程式碼、把它跑起來、看執行結果、再自己修一次的 AI 系統,不是人在操作。
這裡要交代一件事:本報圖上有一則方向相反的內部判讀,它從來沒有發給讀者,也沒有升級成本報的判斷。 那則判讀把同一個機制讀成模型公司的採集策略:實驗室爭相開源自家的 agent 工具,不是為了搶使用者,是為了讓外部使用者替他們產生訓練資料,受益者在模型那一端,使用者是在無償供料。同一個物理事實,兩種相反的價值歸屬。
本篇不打算宣布哪一邊贏,因為本篇要說的是:兩邊都建立在同一個沒被檢查過的假設上。 兩種讀法都預設,決定「模型會不會用你的工具」的那個時刻,是訓練的時刻。如果那個假設不成立,兩邊的租金分配問題就都要重問一次。
軼事容易把好幾件不同的事攪成一團,不拆開就看不清。所以第一步是拆開。
「模型比較會用 Blender」可以拆成兩種完全不同的能力:
| 這一項在問什麼 | 白話 | |
|---|---|---|
| 工具熟練度 | 模型知不知道這個軟體的指令怎麼寫、參數叫什麼 | 它會不會講這個軟體的話 |
| 領域能力 | 模型知不知道一張好椅子的結構該長什麼樣 | 它懂不懂椅子 |
分開很重要,因為兩位發話者的主張只落在第一項。Tworek 說的是「模型比較會用它」(better at using it),不是「模型比較懂 3D」。開源買到的是模型認得你的指令集,不是模型變得更有品味。
而今年六月有一篇論文,把這兩件事分別量了出來。3DCodeBench 是一個評估多模態模型能不能當「程序化 3D 建模師」的基準測試:給它文字或圖片,要它寫出程式碼,由軟體執行出 3D 物件。作者群包含 Google 的研究者,2026 年 5 月 31 日投稿,測了 12 個前沿模型、212 個物件類別。
它的兩個發現剛好落在上面兩項,而且方向相反:
所以:Blender 這個案例裡,模型確實比較會講 Blender 的話;但它做出來的椅子還是散的。 「模型最會用 Blender,所以 Blender 贏了 3D 創作」這個推論,在第二項上沒有支撐:會操作一個軟體,和能用它做出可用的東西,是兩件事,而只有第一件跟開源有關。
這已經足以讓那句「Blender 可能剛剛已經贏了」收窄一大截。但真正把機制翻過來的,是下一節。
如果「模型認得你的指令集」是開源買到的東西,那它值多少?
這個問題以前沒辦法問,因為沒人量。3DCodeBench 量了,而且量法乾淨得出乎意料。
它先讓模型一次答完,記錄有多少比例的程式碼真的能在 Blender 裡跑起來(論文叫 executability,可執行率)。然後對跑不起來的那些,做一件很簡單的事:把原本的題目、模型上一次寫的程式碼、以及軟體吐出來的錯誤訊息原文,一起塞回去,叫它再寫一次。 最多重試兩次。
要特別講清楚這個重試有多陽春,因為這是整篇的關鍵:
「Each retry is a fresh API call — not a chat continuation — whose user message contains the original task, the previous attempt's full Python code, and the truncated stderr/traceback」
每一次重試是全新的一通呼叫,不是接續的對話:模型不記得剛才發生什麼,只拿到題目、上次的程式碼、和一段被截斷的錯誤訊息。這個過程完全沒有人類介入;模型看不到算出來的圖,也不曾為此再訓練過。就是一段機器吐的錯誤文字。
結果:
「Aggregate executability across all 11×2=22 cells increases from 0.702 (single-turn) to 0.974 (multi-turn), representing a +27.2 pp improvement」
可執行率從 70.2% 變成 97.4%。 這條彙總讀數涵蓋 22 個測量格,其中模型數是 11,比前面提到的 12 個受測模型少一個;少的是哪一個、為什麼少,本報未查明。最強的幾個模型在多輪之後直接觸頂到 100%。
把這個讀數放回機制裡:所謂「開源讓模型免費學會操作你的軟體」,買到的是模型第一次就寫對的機率。而第一次寫錯的那將近三成,只要 agent 能夠把程式碼真的跑一次、拿回一句錯誤訊息、再試一到兩次,就補回來九成以上。
還有第二個獨立的讀數指向同一個方向。今年一月柏克萊、CMU 與 Max Planck 的一組研究者提出的 VIGA,是一套「寫程式—算圖—檢查—再改」的迴圈框架,論文明寫它是 training-free(不需要訓練)的,而它在自家提出的 BlenderBench 上相對於一次答完的基準線有大幅改善。兩篇論文、不同團隊、不同任務,同一個結構性結論:能讓模型看到執行結果的那個迴圈,替代掉了很大一部分本來要靠訓練買的東西。
這件事之所以重要,是因為它把決定權從一個你幾乎不能控制的時刻,搬到一個你完全能控制的時刻:
這就是本篇要主張的那個換位。而它剛好解釋了下一節那件沒有人講的事。
前面提過,晨報那條判斷寫著「若六個月內出現第一家主流專有應用程式廠商公開釋出自家操作軌跡語料或代理人工具骨架,而且把它講成分發策略而不是開發者關係,工具這一側就拿到硬證據」。已經發生的釋出不只一家,但送出去的都是 MCP 操作介面,不是原句點名的那兩樣東西:
| 誰 | 什麼時候 | 送出去的是什麼 |
|---|---|---|
| 微軟 | 2025 年 5 月 | 在 Build 大會提出「開放的 agentic web」,採用 MCP 當協定層,並推 NLWeb,這是微軟的一套規格,讓網站的每個端點預設就是一個 MCP 伺服器,官方形容它是「agentic web 的 HTML」 |
| Figma | 2025 年 6 月 | Dev Mode MCP 伺服器 beta,讓 agent 取用設計檔的資料 |
| Autodesk | 2026 年 4 月 | Revit 2027 官方公開 MCP 伺服器技術預覽 |
先解釋一下這裡的 MCP 是什麼,因為它是這一節的關鍵。MCP 是 2024 年底出現、後來被整個產業採用的一個協定,作用是讓外部的 AI 助理能夠用一套標準方式讀取或操作一個軟體。有趣的是它的來歷不是什麼大戰略:兩位 Anthropic 工程師因為受不了在桌面版和編輯器之間反覆複製貼上,花一個半月做出來的。到 2026 年,公開目錄裡登記的 MCP 伺服器接近兩萬個。
所以那個「等著看專有廠商會不會付錢進場」的問題,答案是:他們已經進場一年多了,包括 Autodesk 自己。 這件事單獨看很像是支持「工具側收租」那一方:連 Autodesk 這種按授權收費的廠商,都急著讓模型能用它的東西。
但把 Autodesk 這一項拆開看,故事完全不一樣。Autodesk 的 Revit MCP 伺服器:
換句話說,Autodesk 買的不是「讓模型學會操作 Revit」,是「讓已經付錢的客戶的 agent 能夠讀取他自己的檔案」。這兩件事在商業上差了十萬八千里,而現有的討論把它們混成一件。
把這三種東西分開,是本篇要給的那張表:
| 這一項是什麼 | 誰付得起 | Blender | Revit(BIM,非 3D 資產創作) | |
|---|---|---|---|---|
| 進得了訓練分布 | 你的操作方式大量出現在公開網路上,模型預訓練時讀得到 | 只有把東西攤開的人 | 有 | 無 |
| 進得了公開評測 | 任何研究者都能免費、大量、平行地把你的軟體跑起來當測試環境 | 只有不按席次收費的人 | 有 | 無 |
| agent 操作得動 | 有一個機器可讀的介面,讓 agent 下指令並拿到結果 | 任何人,買得到 | 有 | 部分(唯讀、綁授權;依 Autodesk 員工具名說法,官方頁面本報未能直接取得) |
第三列是可以用錢買的,而且整個產業已經買了。前兩列不是。
而第二列是本篇認為最被低估的一項,因為它決定了另一件事:誰會出現在所有人用來比較模型好壞的那些測試裡。這一點值得單獨一節。
進行中 ?
上面這張圖講的是 agent 執行層本身的競爭:誰來當那個「跨工具跨裝置幫你辦事」的指揮官。本篇要補的是這張圖底下那一層:指揮官伸手能碰到哪些工具,以及那個範圍是由什麼決定的。上圖的分岔在問誰擁有執行層;本篇在問執行層碰得到誰。
要證明「模型比較會用開源工具」,需要的實驗其實很單純:拿同一批 3D 建模任務,一組叫模型去操作 Blender,一組叫它去操作 Maya,比成功率。
這個實驗沒有人做過。
而不做的理由,不是它做不到。我們去查了目前主要的 agent 操作類基準測試,結果是一個很整齊的形狀:
「we instantiate ... on Blender 5.0 as a representative platform ... but the formulation is software-agnostic」
選 Blender 不是因為量到它比較好,是因為要挑一個來用。那個能分辨誰對誰錯的對照臂,他們有能力跑,只是沒跑。
這裡要誠實講一個會削弱上面說法的反例,因為它真的存在:專有軟體並不是不能進基準測試。 微軟自家的 Windows Agent Arena 就跑在真正的 Windows 上;哈爾濱工業大學今年四月的 WindowsWorld 涵蓋 17 個桌面應用程式,裡面包含 Word、Excel、PowerPoint 和 Acrobat,全都是要付錢的專有軟體。該測試共 181 個任務,目前最好的模型成功率約 20.44%。
所以「專有軟體進不了評測」這句話是錯的,不能這樣寫。但同一份清單裡的形狀更精確:那些測試涵蓋的專有軟體是辦公軟體,而它們納入的影像編輯工具是 GIMP 和小畫家,不是 Photoshop;3D 這一塊,是 Blender,不是 Maya。也就是說,愈是專業、愈是按席次高價授權的創作與工程軟體,愈不會出現在公開評測裡。Maya 的公開標價是每年 2,010 美元,而一個評測要平行跑上千個回合。這裡要講明底下這句是依本節邏輯推的,不是量到的現象:Photoshop 這類高價專業創作軟體的結構處境和 Autodesk 一樣。agent 比較會用 GIMP,不是因為 GIMP 比較好,是因為它進得了評測;靠授權把 agent 生態隔在門外的那一側,長期是被評測與最佳化這條迴圈從側翼繞過,不是被開源正面打敗。
這件事會自己餵自己: 沒有人在公開測試裡量你,你就不會出現在任何一張「模型最會用什麼」的比較表上;而模型公司要改善 agent 能力時,會照著這些公開測試去優化。這確實是一個對開源有利的正回饋。但請注意,它跑的迴圈是評測與最佳化,不是 Tworek 講的預訓練語料。同樣的結論,不同的機制;不同的機制要用不同的解法。
方向判斷:
決定一個軟體會不會被 agent 選用的,不是它的原始碼公不公開,而是 agent 能不能把它跑起來、並且讀得到一句機器可讀的錯誤。前者是在預訓練時決定的,慢,而且對專有軟體來說代價高到不可能;後者是在執行時決定的,可以用錢買,整個產業已經買了一年多。目前唯一把這件事量出來的讀數說,前者買到的優勢,大部分可以被兩次重試補回來。
順著這個判斷,「你的產品能不能被 agent 操作」對專有軟體的 C-suite 就不是一個要不要開源的問題。那個問題的答案永遠是不要,所以它是個假問題。真正要問的是三件具體的事:
1. agent 跑得動你的東西嗎? 有沒有一個機器可讀的介面,不必用滑鼠點。這一項產業已有現成答案(MCP),而且你的同業多半已經做了。
2. 它撞牆的時候,拿得到一句人話寫的錯誤嗎? 這是本篇最反直覺的一點:你的錯誤訊息品質,現在是一項通路資產。 那個 70.2% 到 97.4% 完全靠這個。一個回傳「Error: invalid operation」的 API,和一個回傳「參數 radius 需為正數,你給了 -1」的 API,對 agent 來說是兩種完全不同的產品。
3. 你的東西能不能被免費、平行地跑起來當測試環境? 這一項最貴,也最少人想到:它決定你會不會出現在別人用來衡量模型好壞的那些比較裡。可以考慮的形式不是開源,是一個給研究與評測用的免付費、可平行、無介面的執行層。
什麼會推翻它:
這四條裡,只有第 3 條有時間窗;第 1、2、4 條是事件觸發的:要盯的是有沒有人跑出那個實驗,不是盯一個日期。
1. 最脆的一點,而且我們自己排除不掉。 那個 70.2%→97.4% 是在 Blender 上量的,而 Blender 的操作指令大量存在於訓練語料裡。所以「重試把差距補起來」有可能只是因為模型本來就懂七八分。若有人在一個模型幾乎沒讀過的軟體上跑同一個重試實驗,而可執行率沒有跟著跳上來,那本篇的核心主張就垮:訓練分布才是真正的門檻,重試只是它的表現。這個實驗沒有人跑過;在這組對照跑出來之前,本篇維持假說,不升級。
2. 若有人真的跑了 Blender 對 Maya 的同題對照,而且在控制住模型的重試次數之後,開源那一側仍有明顯優勢,那 Tworek 的原始版本就得到它一直缺的那個讀數,本篇要退。這組對照目前不存在,本篇這一條就停在等讀數的狀態。
3. 若接下來兩季,專有廠商的 agent 介面開始從唯讀轉為可寫,而且不再綁在付費授權後面,也就是他們真的開始為了進入訓練分布而放棄收費關卡,那表示他們自己認為訓練分布才是要害,本篇對「他們買的是另一樣東西」的判讀就錯了。這個兩季的窗是本報自設的,兩位發話者都沒有給時限。
4. 反過來,若通用的圖形介面操作能力成熟到模型不需要任何特定軟體的先備知識就能操作任意程式,那「公開可觀測」整個不再是入場條件,這場爭論的兩邊會一起失效。目前這條路離成熟還很遠:今年四月那個涵蓋 17 個桌面應用的測試,最好的模型成功率約 20.44%。
最後一句留給那個最容易被跳過的地方。這整場爭論(包括本報圖上那則從未發表的相反判讀)都預設了「模型學會用什麼」是一件在遠方、在別人的訓練叢集裡、在你無法參與的時候決定的事。目前檯面上唯一的量測說,它有很大一部分是在你的軟體吐出那一行錯誤訊息的時候決定的。那一行字是你寫的。