大神觀點
本篇出自 2026年7月19日 晨報
他逐份比對六家開放權重模型的技術報告,發現「可調推理力度」(讓使用者決定模型答題前想多久、想多深)的訓練配方已趨於同一套三段框架,正式從研究特性變成出廠標準(原文)。一個具體數字:Kimi 的做法在自家模型上減少約 25-30% 的生成用量,而在 Kimi 自報、未具名的內部評測上跑分幾乎不掉(經 Raschka 轉述)。這支持本報 2026/7/16 期「OpenAI 讓新一代模型漲價 2 倍」那期背後的判斷線:模型能力與成本,越來越取決於推理當下投入多少算力;現在「模型多大」與「想多久」是兩個獨立的採購旋鈕,小模型調高力度有時能追平大模型。註記:他的綜述橫跨六份一手報告,但對本報而言仍是單一來源,具體數字待回各家原始報告。
只留 email,隨時退訂。這是我們唯一想請你做的事。
Sebastian Raschka 是長期寫深度學習架構解說的技術作者,經營電子報《Ahead of AI》,與模型廠商沒有利害關係(Ahead of AI,2026-09-09)…
Evan Hubinger 是 Anthropic 對齊科學團隊的負責人;對齊是一個研究領域,目標是讓 AI 系統的行為符合人類意圖與價值。9 月 8 日他回應一名剛離職同事的長文…
對企業採購方來說,它影響的是「供應商對自己產品風險的內部評估」這一欄,而那一欄平常只能靠猜測。本報收的是「Hubinger 這樣說」,不是那個機率數字本身。 ⚠️ 那是他個人的主觀…
Zvi 9 月 7 日逐字寫:「Jakub Pachocki flat out says that no one is at a place where it would be r…