大神觀點 · 本週 (發表日 9 月 9 日)
本篇出自 2026年9月10日 晨報
Sebastian Raschka 是長期寫深度學習架構解說的技術作者,經營電子報《Ahead of AI》,與模型廠商沒有利害關係(Ahead of AI,2026-09-09)。他偏好引用第三方評測機構 Artificial Analysis 的理由逐字是:它們是獨立的,因此可能比模型開發者自評的評測更可信。語氣落差本身就是讀數。 但他的方法論警告對兩邊都成立:模型通常是針對某一個主力測試框架開發的,而那個框架又常被設計來放大該模型的長處,所以跨模型用同一份框架比較,會系統性低估「客場」模型。⚠️ 這句話既折廠商自報,也折那份獨立讀數,不要只拿它打其中一邊。 它支持本報 9 月 5 日的一條判斷:真正該問的不是「分數多少」,是「這把尺是誰的、在什麼條件下量的」。
只留 email,隨時退訂。這是我們唯一想請你做的事。
Evan Hubinger 是 Anthropic 對齊科學團隊的負責人;對齊是一個研究領域,目標是讓 AI 系統的行為符合人類意圖與價值。9 月 8 日他回應一名剛離職同事的長文…
對企業採購方來說,它影響的是「供應商對自己產品風險的內部評估」這一欄,而那一欄平常只能靠猜測。本報收的是「Hubinger 這樣說」,不是那個機率數字本身。 ⚠️ 那是他個人的主觀…
Zvi 9 月 7 日逐字寫:「Jakub Pachocki flat out says that no one is at a place where it would be r…
Box 執行長 Aaron Levie 9 月 6 日說,網際網路幾乎完全沒有為「每個人的個人 AI 代理人到處替他們執行任務」的未來做好準備,並引一個個案:訂位平台 Resy 封…