SecondSource從一手資料重建判斷
產品動態 · 2026年8月17日

預設值就是實質行為:一個能在筆電上跑的好模型,預設把「畫一個圓」也想成一件大工程。

產品動態 · 本週 (事件日 08-16)

本篇出自 2026年8月17日 晨報

Simon Willison(見大神觀點欄)實測阿里巴巴新發布的 Qwen 3.8 27B(Apache 2 授權、開放權重、具視覺能力,降精度壓縮(量化)後約 17 GB,塞得進一台配置合理的筆電),判定它是目前筆電級硬體上最好的本地模型之一。但它預設把推理強度開在最高檔。同一個提示(他多年來固定用的那個「鵜鶘騎腳踏車的向量圖」測試),開思考鏈花 21 分鐘、燒掉 22,276 個思考鏈 token,關思考鏈花 137 秒,時間差約 9.2 倍;⚠️ 兩次的輸出長度相近(3,223 對 3,715 個 token),差的全在思考鏈段。極端的一次是提示只有「畫一個圓的向量圖」,思考鏈開頭仍在自我加碼同心引導圓、刻度標記、漸層填充、脈動光暈。另有一個會誤導人的陷阱:他用的本地執行工具預設上下文上限只有 8,192 個 token,光思考就用完,拉到完整的 262,144 上限後問題消失(實測全文)。要今天就用的兩件事:跑本地模型時先把推理強度調降、把上下文上限拉滿,這兩個預設值決定的是實際行為,不是文件上寫了四個檔位就代表使用者拿得到四個檔位。⚠️ 這是一位開發者的第一手實測,不是基準測試;Qwen 自報相對前一代與自家閉源版本都有提升,⚠️ 那是廠商自報、目前沒有獨立驗證。

本期無過去洞見與晶片與半導體兩欄。 回顧欄的素材已經用完。

免費訂閱,明天早上就收得到

只留 email,隨時退訂。這是我們唯一想請你做的事。

同類最新