大神觀點 · 本週 (節目發布 8 月 26 日)
本篇出自 2026年8月30日 晨報
身份要先講,因為這條的分量幾乎全在她身上:Anima Anandkumar 是加州理工學院的講座教授(數學與電腦科學),曾任 NVIDIA 的 AI 研究總監,更早在 AWS 協助建立雲端 AI 團隊,近期加入聯合國的科學諮詢委員會。⚠️ 她也是下面那條替代路線的創建者,在學術上對這條路線有利害關係。
她的論證可以自己驗算,不是意見。 工業級的物理模擬每個維度大約需要 1,000 個網格點,而問題常常是三維再加上時間;1,000 的四次方就是一兆量級的上下文長度(模型一次能讀進去多少字)。她的原話是:「別想著用 transformer 做這種規模的任何事,全世界的算力加起來都不夠。」相較之下,語言只有一個維度,而上下文長度做到百萬級就已經很吃力了(Latent Space 節目,08-26)。她的替代方案叫神經算子:一般神經網路學的是固定長度數字陣列之間的對應關係,神經算子學的是函數之間的對應關係,所以推論時可以要求任意解析度的輸出,而不是放大就糊掉。她給的讀數是:天氣模型 FourCastNet 訓練樣本約 5 萬筆,速度比傳統的數值天氣預報快數萬倍,只需要一張消費級顯示卡,2023 年秋天起在歐洲中期天氣預報中心對公眾開放。⚠️ 她說準確度「幾乎接近」傳統的數值天氣預報,但沒有給指標也沒有給差距,這是本條最弱的一環。
它支持本報過去哪條判斷: 本報 7 月 19 日那期報過一家工程模擬公司用神經網路近似昂貴的物理模擬,把一次模擬從數天壓到數分鐘,當時記的是結果、沒有機制。這條把機制補上了,而且多給一個判斷:科學模擬這條路不會收斂到跟語言模型同一種架構,因為那裡的瓶頸是複雜度曲線的形狀,不是上下文窗口的大小。可以自己核對的指標: 她點名的下一個場景是托卡馬克電漿的數位孿生(合作方英國原子能總署),她自陳比傳統模擬快一百萬倍、訓練樣本只有數千筆。
只留 email,隨時退訂。這是我們唯一想請你做的事。
Marcus 是認知科學家、紐約大學榮譽教授。他 9 月 3 日對 Astra 寫下:「One really doesn't want more capability in con…
他長期經營 AI 週報、逐條追蹤前沿實驗室的發布與安全議題,對任何一家實驗室都無商業依存。對今日主線第 1 點那場爭議,他的判斷是「玩火也是我的讀法。房子還沒燒掉。」(@TheZv…
Tomasz Tunguz 長期以公開數據寫 SaaS 與 AI 市場分析。他 8 月 31 日那篇的結論一句話:在前沿,新的稀缺不是價格,是取用權。 他列的收據都點得開:Sale…
Simon Willison 是開源網站框架 Django 的共同作者,長期公開實測 AI 工具並逐項記錄。他花了一段時間摸 OpenAI 7 月 9 日發表的 ChatGPT W…