模型觀點 · 今日 (研究,事件日 08-10)
本篇出自 2026年8月12日 晨報
8 月 10 日,Google 團隊在 arXiv 放出 AMIE(Video)——一套以 Gemini 為基礎的多 agent 系統。OSCE(客觀結構式臨床測驗)是醫學教育用的標準考試設計:找受訓演員扮演標準化病人,考生輪站接受評分。這次在隨機 OSCE 下與家醫科醫師比即時視訊問診:30 位家醫科醫師、15 位標準化病人、100 個臨床情境,三臂對照(AI 視訊、AI 純文字、醫師視訊)。結果分三層強度:臨床評審在問診、診斷、處置、體徵觀察四項上給 AMIE 的評分與醫師持平或更好;病人偏好分裂:評估與解釋病情偏好 AI,建立關係與夥伴感偏好醫師;作者自列三項不足:精細解剖定位、細微情感線索、高頻動作(arXiv 2608.09861)。心臟科權威、Scripps 轉譯醫學研究所所長 Eric Topol 次日轉發並主動降溫:「當然這需要真實世界醫療的檢驗」,同時點出視訊補上了理學檢查的一部分——那是純文字問診結構上拿不到的維度(原文)。⚠️ 這是預印本、未經同儕審查、未複現,而且出題與應試是同一方:評分表與分類法都由 Google 團隊自訂,另一面是臨床評分由臨床評審員打、作者也主動列了三項失敗面,可抵掉部分疑慮;標準化病人不是真病人。本報建議把問題換掉:不要問「AI 會不會取代醫師」,要問「這兩種偏好的分裂,要怎麼設計成一個產品」——解釋病情交給 AI、建立關係留給人,這是一個具體的分工假設,可以拿去做產品設計,也可以拿去問供應商。
只留 email,隨時退訂。這是我們唯一想請你做的事。
2025 年 3 月,OpenAI 的研究者發表過一個發現:讓較弱的模型去讀較強模型的思路鏈——也就是模型給答案前寫下的中間推理文字——抓作弊的效果遠好過只看它最後做了什麼;但如果…
Stella Biderman 是開源 AI 研究組織 EleutherAI 的執行董事。機制可解釋性指的是試圖打開模型內部、找出具體電路與運作機制的研究路線。她的主張有兩層:弱版…
蒸餾是用一個模型(老師)的輸出去訓練另一個模型(學生)。近日有一份論文被廣泛引用來證明中國的開放權重模型蒸餾自 Anthropic 的 Opus。逐段轉述該論文的 @bookwor…
執行框架(harness)是包在模型外面的 agent 執行殼,負責上下文管理、工具呼叫與重試策略,Claude Code、Codex 都是。六月時一位機器學習教科書作者做了個小型…