論文與技術線:只收會改變產業判斷的那些,不做論文摘要。
78 篇
那份量測用的工具是別人的:一套叫 CoT-Control 的評測,做法是對題目附加「只用小寫思考」「思考中不得出現某個詞」這類指令,再看推理軌跡有沒有照做。結果按實驗室聚集,這三個…
Multiverse Computing 的 CAI 團隊在 Hugging Face 上說明自己的論文:跨三個公開安全基準的不安全回應率從 26.26% 降到 0.14%,單看這…
獨立評測機構 Artificial Analysis 9 月 7 日公布,OpenBMB 的 MiniCPM5-2B(2.6B 稠密參數、Apache 2.0 授權)在它的 Int…
依 Import AI 轉述的 Google DeepMind 論文:100 個 Gemini 3.1 Pro 代理人合作解 71 題,系統提示禁止作弊;57 分鐘後一個代理人發現…
Epoch AI 是追蹤 AI 算力與能力進展的獨立研究機構,它最近發表一套 AI 研發工作的分類法,仿照美國勞工部長年使用的 ONET 職業分類系統,把研發流程拆成六段:決定做什…
八月十四日本報記過一則推文:某評測者拿到另一家實驗室的開放權重旗艦 GLM-5.3 搶先版,量它找漏洞的能力,給出四個很漂亮的數字。當時本報沒有直接收下,標了三個缺口:四個數字都沒…
2025 年 12 月 20 日,OpenAI 發表〈Monitoring Monitorability〉,把「思維鏈好不好監控」做成可量測指標,最關鍵的發現之一逐字是「RL op…
CyberGym 是柏克萊團隊做的公開測驗,收了 1,507 個真實漏洞、涵蓋 188 個開源專案,資料來自 Google 維運的開源模糊測試平台 OSS-Fuzz,所以那些漏洞天…
先解釋:現在的大模型多半是專家混合架構,不是每個字都跑整個大模型,而是把每個字分派給少數幾個專門的子模型,所以模型可以很大而每次只用一小塊算力。工程上常見的省錢做法是「把最不重要的…
美國艾倫人工智慧研究院 9 月 1 日發表 BenchMIRT,用試題反應理論的多維版本逐題拆一個評測到底在量什麼,這套方法本來是心理測驗用來從答題模式估能力的。它吃了 100 個…
這套模擬器量的是模型實際跑在硬體上時的行為,不是模型本身的分數。普渡大學研究團隊發表論文,提出一套涵蓋 Nvidia Ampere、Hopper、Blackwell 三個世代的週期…
本報 8 月 28 日那期講過 GLM-5.3-Flash 的定價與效率之分;今天新的是它的旗艦版開權重,加上另外兩家的同期發布。規格的格式是「總參數/活躍參數」,三款都是 100…
一位使用者回報 Qwen3.8-Flash 在低精度下多輪追蹤壞掉,把鍵值快取換回較高精度之後修好了(QuixiAI,08-29)。鍵值快取存的是先前每個字的向量,多輪對話靠它維持…
美國東北大學(Northeastern University,波士頓的研究型大學)的四位研究者 8 月把一篇論文放上預印本平台 arXiv,名字叫 ROBBIN(原文,2026 年…
Google DeepMind 昨天宣布和外部單位完成了一次雙盲評測(Google DeepMind,08-27)。原本的兩難是: 高風險的外部評測過去只能二選一,要嘛評測方交出題…
寫 GPU 核心程式的 AI 代理賽道出現方法論轉向:編譯器從固定黑盒,變成跟著代理一起演化的活體。 ·
評測程式改寫能力的標準做法只驗「行為對不對」,不驗「遷移到底有沒有真的發生」,於是有一個很簡單的作弊法:把原本的實作複製過去,讓測試通過。一份昨天送上 arXiv(開放預印本平台)…
同一份量測裡有一段可以直接照做的內容。DP-attention 是一種把注意力計算(判斷句子裡哪些字彼此相關的步驟)按「資料平行」切開的優化,在單輪固定長度的場景通常是淨賺的;但在…
Together AI 是開放權重模型的推論服務供應商,同一天發了兩份對照,用同一套方法、同一組題目(113 個軟體工程任務、每組跑 4 次),只是對手不同。GLM-5.3 是中國…
本報帳上有一篇 2025 年 9 月發表的安全研究,OpenAI 與 Apollo Research(一家專做 AI 欺騙行為評測的獨立安全研究機構)合作:用「偷偷違規」(表面照規…
本報今天定向找了一輪獨立複製或反駁,四個命中全部上溯同一個原點:論文本體、該研究機構的專頁、OpenAI 的官方公告、以及這項研究的專屬網站。去重之後仍然只有一個來源,所以本報的內…
先講這是誰:Z.ai(智譜)是中國的前沿模型團隊,GLM 系列開放權重模型的開發者,執行長唐杰是清華大學電腦系教授出身。他針對新版 GLM-5.3 提出兩件事(Latent Spa…
一個團隊在模型託管平台 Hugging Face 的部落格報告:他們做了一個會看限制條件的 GPU 配置器(該團隊自家的產品),在七個情境上與最單純的「先到先服務」排程對比,硬體完…
一般的大語言模型逐字往下生成,所以思考鏈是可讀的文字;擴散式語言模型一次生成整個區塊,步驟之間傳遞的是向量而不只是文字,理論上會產生外部看不見的推理深度、傷害可監控性。一份附 Gi…
2025 年 3 月,OpenAI 的研究者發表過一個發現:讓較弱的模型去讀較強模型的思路鏈——也就是模型給答案前寫下的中間推理文字——抓作弊的效果遠好過只看它最後做了什麼;但如果…
Stella Biderman 是開源 AI 研究組織 EleutherAI 的執行董事。機制可解釋性指的是試圖打開模型內部、找出具體電路與運作機制的研究路線。她的主張有兩層:弱版…
蒸餾是用一個模型(老師)的輸出去訓練另一個模型(學生)。近日有一份論文被廣泛引用來證明中國的開放權重模型蒸餾自 Anthropic 的 Opus。逐段轉述該論文的 @bookwor…
8 月 10 日,Google 團隊在 arXiv 放出 AMIE(Video)——一套以 Gemini 為基礎的多 agent 系統。OSCE(客觀結構式臨床測驗)是醫學教育用的…
執行框架(harness)是包在模型外面的 agent 執行殼,負責上下文管理、工具呼叫與重試策略,Claude Code、Codex 都是。六月時一位機器學習教科書作者做了個小型…
研究者 Ziqian Zhong 從一個機械細節出發:Claude Code 會把使用者的 email 放進上下文;他把那個 email 換掉,模型就開始把他當成 Anthropi…
「第三條軸」是論文自己的分類,本報不背書。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis and End-t…
評測機構 Artificial Analysis 的 AA-Omniscience 榜設計特殊:答錯扣分、承認不知道不扣分,所以同時量到知識廣度與「拒絕瞎編」的傾向。Teortax…
Teortaxes 對 DeepSeek 2024 年底 V3 模型的官方揭露做雙路徑驗算:硬體路徑(卡數 × 每卡實際算力 × 秒數)和模型路徑(活躍參數 × 訓練資料量 × 標…
先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthrop…
K3 發布材料兩條線(經 Teortaxes 逐字轉引):開發後期「一個早期版本的 K3 撰寫了大多數 kernel」。kernel 是決定模型跑多快的底層加速程式,等於用上一版模…
昨夜新進的 15 篇論文尚未處理、本欄無單日增量,出一組「說法對學術」的對照。Vinyals 自陳過去一年改變的想法:在數學/寫程式這類答案可自動核對的窄領域上訓練(AI 圈稱 R…
訓練 AI 的一條新路線是「rubric 型獎勵」:不另外訓練一個獎勵模型,改用一張評分表替答案打分。Ai2(Allen Institute for AI)研究員、電子報 Inte…
AI 數據研究機構 Epoch AI 與評測機構 METR 釋出基準 MirrorCode:要求 AI 在看不到原始碼、不能上網的條件下,只靠指令列輸入輸出去「重新實作」一個目標程…
Stanford 的「平攤評測法」——用「從題目內容預測難度」壓低可靠評測的成本——今天完成定向查證,找到獨立第二證:ICML 2026 一篇論文用同路線做模型能力外推(scali…
Lambert 一年前的「美版 DeepSeek」宣言——2 年、1 到 5 億美元做出權重(模型訓練完的參數檔案)/數據/代碼全開放的前沿模型——本報完成定向查證:專案存在有媒體…
目前後訓練(模型練完基礎能力後、再教它怎麼答題的階段)的主力方法 RLVR(可驗證獎勵的強化學習:只在數學、程式這類有標準答案的任務上給模型獎勵)有個結構性盲點:它只優化「可以客觀…
SemiAnalysis 在同篇 AMD 實勘裡給出一組第一手工程觀察:2.5 名工程師配上 AI 編程代理,就能完成過去一整組人才做得完的新模型「發布日支援」:代理自動抓設定、跑…
Jacobian 猜想是 1939 年提出的代數幾何名題,說的是:如果一個多項式映射的「Jacobian 行列式」是非零常數,這個映射就應該可逆。Anthropic 研究員公布:在…
本報 7/22 期主線第 3 點寫過 Lambert 反駁流行蒸餾敘事的發言;今天他在播客長談裡把機制攤開:蒸餾(拿強模型的輸出當教材)確實用於監督微調階段,也就是模型「學禮貌、學…
第一份是 AlgoTune 基準。這是一個 24 人學術團隊建立的基準,收錄 154 個「寫出比標準函式庫更快的正確程式」的任務:前沿模型平均只把程式加速 1.72 倍,靠的是表層…
本報 7/21 期模型觀點介紹過這篇實測(優化 agent 流程的增益預設是一次性的,只有內建回歸控制才守得住;arXiv,2026-07);今天新的是它落在本報長期追蹤的一條路線…
RLM 框架論文的作者 Alex Zhang 提出:精心設計的任務編排(模型外圍的迴圈、工具調度邏輯)能把表面不同的任務化成相似的執行軌跡,使短任務訓練泛化到 8 至 32 倍更長…
Google DeepMind 研究副總裁 Raia Hadsell 在演講中主張:造出大語言模型的那套配方(大模型+大資料+自監督)同樣適用於世界模擬、機器人、生物、氣象,下一個…
對 2,361 個熱門開源專案、25,264 個由 AI agent 發起的 pull request(程式修改請求)的實證研究:採用高度集中,中位數專案三個月只有 1-2 個 a…
三種主流「不動模型、只優化 agent 流程」的方法被放進兩階段連續評測:固定測試上三者都贏基準線;新任務進來後分岔,有的跌破基準線、有的停止進步,只有把「回歸控制」(每次優化都驗…
Keras 作者 François Chollet 當時給「大模型只是記憶、不是推理」一支可實測的探針:模型能解位移密碼(把每個字母往後挪 n 格的入門加密),但多只在 n=3 或…
匿名獨立研究者 Gwern 以 2020 年對 scaling 假說的早期系統論證聞名,他的診斷是:網路語料裡只有 agent 行為的「描述」,沒有一步步的決策軌跡,現成模型的 a…
先講結論:用 AI 生成的資料來評測 AI,有個結構性盲點:沒有機械方法逐題驗證資料本身是對的。單一作者研究者 Serkan Ballı 給了親歷案例:他建多語評測語料時,兩段程式…
對沒有標準答案的題目,讓模型抽多個解、取多數共識的答案,再讓模型逐字學習「能走到那個答案的解法」。研究團隊(Gkountouras、Jukić、Titov)自報:在作者自選的數理推…
本報昨日 2026/7/18 期模型觀點介紹過 UCLA 系團隊的 MemCon——讓 agent「何時讀寫記憶」從手寫規則變成可學習的決策(arXiv,07-15)。把它放進本報…
Meta FAIR 系團隊三月的論文 Principia 主張:現行數學評測多半只判最終數值或選項,但真正的科學工作要求推導出公式與結構。他們做了一個 2,558 題的推導評測,本…
Oracle 07-14 以 13 人技術報告把 agent 記憶做成資料庫原生的基底層:記憶被當成完整的生命週期來管理,涵蓋抽取、整併、檢索與修剪,自報在長期記憶評測 LongM…
圖靈獎得主 Yoshua Bengio 所在團隊的論文顯示:AI agent 光憑「哪些動作被擋、哪些沒被擋」,就能推斷自己的思考過程正被監控,而且察覺力隨模型能力上升:新一代模型…
Thinking Machines 的 Inkling 被多位從業者從官方模型卡讀出一組罕見選擇,最受注目的是放棄 RoPE——現今幾乎所有大模型共用的位置編碼標準,模型靠它知道哪…
Databricks 在自家數百萬行程式庫上實測各家模型跑工程任務:Sonnet 5 每 token 比 Opus 4.8 便宜約 1.7 倍,但按「完成一個任務」算成本反而更貴—…
學術面誠實交代:本週的學術主菜就是深度報告裡那五篇同儕審查論文;昨夜新進的 50 篇 arXiv 論文,在掃過的範圍內尚無單篇達到入報門檻,不硬湊。
Claude Code 裡逾時被系統砍掉的指令,死前吐到螢幕上的殘缺輸出,會被「對話壓縮摘要」記成已確認的結果,跨工作階段傳播假陽性(arXiv 2607.13071)。病因一句話…
同一個生產程式庫、同樣的編碼代理工作各跑 28 天:提示快取(重複的程式庫上下文快取起來不重算)命中率 99.3% 時,雲端 API 有效成本壓到每百萬 token $0.57——…
新論文在困難規劃測驗上跨多個模型家族做統計分解,發現「規劃」是兩種獨立能力:判斷「這一步能不能走」的局部推理,隨模型放大與更長思考確實變好;想清楚「目標到底可不可達」的全局列舉,幾…
新證據(本週):研究者 Charles O'Neill 的受控實驗(2026-07,arXiv 2607.11020;屬尚未經同行評審的 arXiv 預印本、單一受控實驗,證據等級…
中國 AI 公司 Moonshot 的開源模型 Kimi K2.5,出現第一份非官方的第三方安全評測(arXiv 2604.03121,2026-04 編號,我們 7/13 掃到)…
華頓商學院教授 Ethan Mollick 2023 年 5 月的名文〈AI 不是好軟體,是還不錯的人〉(原文)裡兩個廣傳數字,本週逐一對回出處:「寫作生產力提升超過 30%」出自…
美國國家經濟研究局(NBER)一份工作論文(未經同儕審查,w35290)從投資數據反推:以目前的資本支出水位(美國前五大科技公司 2025 年 $380B、2026 年預測近翻倍)…
Epoch 6 月 17 日釋出一張任務分類法的第一版(原文,2026-06-17):把一家前沿 AI 公司的研究工作拆成 6 大類、60 多項任務,每項用 0 到 5 分評「現在…
編排層(orchestration layer)指的是把模型接上工具、權限、工作流的那套協調膠水。業界大會 AIEWF 的每日速記(2026-07,出處)寫得直白:「多數客製化工作…
做這份評測的是 Artificial Analysis——一家專門獨立評測各家 AI 模型、業界常引用其排行榜的第三方機構。它出了 120 個真實法律任務(跨 24 個執業領域),…
2023-10 的 SWE-bench 論文把「給一張真實 GitHub 工單、交一個能通過測試的修復」做成標準考題,當時最強模型只解出約 1.96%(arXiv,2023-10)…
模型回答問題分兩段:先一口氣讀完你的問題(吃運算),再逐字寫回覆(吃記憶體),擠同一張卡互相干擾。2023-11 的 Splitwise(arXiv)與 2024-01 的 Dis…
不是每個字都動用整顆大腦:模型裡住著許多專家小網路,每個字只叫醒幾個。2021-01 Switch Transformer 開路(arXiv),2024-12 DeepSeek-V…
時間要講清楚:這不是 2023 年的老事,而是 2024 年 9 月 o1 帶頭、2025 年 1 月 DeepSeek R1 跟進後才成主流。憑什麼說是這個配方:R1 的論文(2…
這轉向 2024 年就在一線從業者間形成共識(見主線第 5 條的六個獨立原點),2026 年已是預設。[商業] 直接對應企業知識庫問答與 agent 產品 —— 想讓 AI 懂公司…
白話講:運算單元常常在空等資料從記憶體搬過來,所以誰能把資料餵得更快誰就贏;而 HBM 這種高速記憶體全球只有少數幾家(SK海力士、三星、美光)做得出來。[商業] 算力的成本與供給…
LlamaIndex 創辦人 Jerry Liu 在訪談(2023-10-05)自承這句話:2022-11 他做 GPT Tree Index,只是為了繞開 GPT-3 的 4,0…
只留 email,隨時退訂。這是我們唯一想請你做的事。