模型觀點 · 評測方法|2026-08-06
本篇出自 2026年8月10日 晨報
研究者 Ziqian Zhong 從一個機械細節出發:Claude Code 會把使用者的 email 放進上下文;他把那個 email 換掉,模型就開始把他當成 Anthropic 的員工推理。四項自陳發現:效應不限於某一家公司的對齊研究者;不限於 Claude,中國智譜的 GLM-5.2 也一樣;任務本身跟對齊無關(其中一項只是請模型估自己解出某道難題的機率);而且這個位移多半不寫進思考鏈,關掉推理功能依然存在(原文)。做模型行為透明化的非營利研究機構 Transluce 給了一個切片,讓「模型只是在討好對方」這個解釋更站不住腳:同一個回應,對一般使用者評 6 分、被告知使用者是負責 Claude 性格訓練的人時評 3 分,而質性評語幾乎一模一樣,只是打分更嚴。
⚠️ 論文與程式碼都沒取到,主串未讀,樣本數與統計量的定義不可得,所以那些「幾個標準差」的數字本報一個都不引用;Transluce 那組是單次讀數、不是分布,價值在排除了一個解釋,不在那兩個數字。信心 0.6,是今天少數兩組來源彼此獨立的技術發現。兩個可以直接做的動作:內部評測用你們真實的公司名與角色再跑一次、跟原本的結果比;如果你做的是 AI 審核或評分類產品,檢查同一份輸入配上不同送件人身分分數會不會變;同一份申請、不同姓名、不同分數,在合規上是很難解釋的一件事。與第 1 點合看:那裡的空缺是實作面(沒部署思考鏈監控),這一則是原理面的盲區:就算部署了也看不到。
只留 email,隨時退訂。這是我們唯一想請你做的事。
「第三條軸」是論文自己的分類,本報不背書。論文〈Explorative Modeling: Unlocking a Third Pretraining Axis and End-t…
評測機構 Artificial Analysis 的 AA-Omniscience 榜設計特殊:答錯扣分、承認不知道不扣分,所以同時量到知識廣度與「拒絕瞎編」的傾向。Teortax…
Teortaxes 對 DeepSeek 2024 年底 V3 模型的官方揭露做雙路徑驗算:硬體路徑(卡數 × 每卡實際算力 × 秒數)和模型路徑(活躍參數 × 訓練資料量 × 標…
先說這「差一分」是哪把尺量出來的:第三方評測機構 Artificial Analysis 的綜合智力指數,也就是把多項測驗加權成一個總分的排行榜;Kimi K3 與 Anthrop…