模型觀點 · 今日 (事件日 08-12)
本篇出自 2026年8月14日 晨報
Stella Biderman 是開源 AI 研究組織 EleutherAI 的執行董事。機制可解釋性指的是試圖打開模型內部、找出具體電路與運作機制的研究路線。她的主張有兩層:弱版(在原貼裡)是預測干預結果、建立好理論,都不需要機制模型,她給了三個歷史類比——疫苗早於細菌理論、熱力學第二定律由一個持錯誤熱理論的人提出、量子力學沒有標準的機制模型;強版(在評論裡)是「大多數 mech interp 研究其實不算真正的科學」(原文)。本報把她引的那篇論文摘要調出來比了一次。 那是 arXiv 2606.06533,題為〈Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics〉,她自己掛頭名——所以那不是獨立佐證,是她自己的主張;摘要說的是「AI 的科學必須超越事後修補、去研究產生模型行為的訓練動態」,而且明確把機制可解釋性列為要檢視的進展之一,不是把它排除在科學之外(arXiv 2606.06533)。推文比論文強得多,而強出來的那一截沒有依據。 ⚠️ 本報只讀了摘要沒讀全文;這是一篇立場論文,屬於議程主張的文類,不是實證結果,引用時不得寫成「研究顯示」;三個歷史類比也沒有逐一查核。對決策的實際含意:很多「該投資可解釋性」的論證,隱含前提是「理解機制 → 才能認證、才能干預」,她主張的是那個箭頭不成立。這不等於說可解釋性沒用;是說如果你的投資理由建立在「機制理解是必要前提」上,這個理由需要換一套。 本報不判哪一邊對——我們的紀錄裡另有以機制發現為核心價值的材料,兩邊都沒被推翻,矛盾就留著。
只留 email,隨時退訂。這是我們唯一想請你做的事。
2025 年 3 月,OpenAI 的研究者發表過一個發現:讓較弱的模型去讀較強模型的思路鏈——也就是模型給答案前寫下的中間推理文字——抓作弊的效果遠好過只看它最後做了什麼;但如果…
蒸餾是用一個模型(老師)的輸出去訓練另一個模型(學生)。近日有一份論文被廣泛引用來證明中國的開放權重模型蒸餾自 Anthropic 的 Opus。逐段轉述該論文的 @bookwor…
8 月 10 日,Google 團隊在 arXiv 放出 AMIE(Video)——一套以 Gemini 為基礎的多 agent 系統。OSCE(客觀結構式臨床測驗)是醫學教育用的…
執行框架(harness)是包在模型外面的 agent 執行殼,負責上下文管理、工具呼叫與重試策略,Claude Code、Codex 都是。六月時一位機器學習教科書作者做了個小型…