模型觀點 · 趨勢觀察 (貼文原發 07-17)
本篇出自 2026年8月3日 晨報
K3 發布材料兩條線(經 Teortaxes 逐字轉引):開發後期「一個早期版本的 K3 撰寫了大多數 kernel」。kernel 是決定模型跑多快的底層加速程式,等於用上一版模型造下一版的地基。官方部落格描述 K3 自建 Game Boy Advance 模擬器的 demo 時,直接以「recursive self-improvement」(遞迴自我改進)作機制描述(Teortaxes,07-17)。驗證: 兩段皆逐字引號、未回官方原文直核;同出官方材料,算一個來源。這裡的「遞迴自我改進」是廠商行銷文案沿用的說法,指的是用上一版模型輔助寫加速程式,與領域內講的模型自主改良自身權重/架構不是同一件事,不代表已出現自主能力躍升。判斷更新: 「單邊自律能否約束前沿速度」這條命題,現在知道該盯哪個訊號了:同一件事,美系有實驗室因風險考量對相關資料採取暫停與克制,Moonshot 反向把它當賣點寫進行銷文案;往後每有一家實驗室因風險考量對某類能力踩煞車、同期另一家把同類能力當賣點行銷,就記一次不對稱,累積起來的方向比任何安全宣示都好量,而選用開放權重模型時,發行方對這類能力的揭露姿態本身就是盡職調查的一項。
只留 email,隨時退訂。這是我們唯一想請你做的事。
先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthrop…
昨夜新進的 15 篇論文尚未處理、本欄無單日增量,出一組「說法對學術」的對照。Vinyals 自陳過去一年改變的想法:在數學/寫程式這類答案可自動核對的窄領域上訓練(AI 圈稱 R…
訓練 AI 的一條新路線是「rubric 型獎勵」:不另外訓練一個獎勵模型,改用一張評分表替答案打分。Ai2(Allen Institute for AI)研究員、電子報 Inte…
AI 數據研究機構 Epoch AI 與評測機構 METR 釋出基準 MirrorCode:要求 AI 在看不到原始碼、不能上網的條件下,只靠指令列輸入輸出去「重新實作」一個目標程…