泛用 AI 勝過臨床專用工具:Nature 研究揭醫療 AI 意外

Elponcrab
分享
泛用 AI 勝過臨床專用工具:Nature 研究揭醫療 AI 意外

在醫療領域,「特製的 AI」不一定贏過「通用的 AI」。一篇發表於《Nature Medicine》的研究發現,三款通用型前沿大型語言模型(LLM),在多項醫療基準與醫師的真實提問上,全面勝過兩款主流的臨床專用 AI 工具;而後者的表現,甚至只與 Google 搜尋的 AI 摘要相當。

三款通用模型,對上兩款臨床工具

研究把 GPT-5.2、Gemini 3.1 Pro 與 Claude Opus 4.6 三款通用模型,對上 OpenEvidence 與 UpToDate Expert AI 兩款臨床 AI 工具,評測分成三關:第一關是 500 題 MedQA,測醫學知識;第二關是 500 項 HealthBench,衡量與臨床醫師的一致性;第三關是 RCQ「真實臨床提問」基準,取自醫師在實際臨床環境中,對通用模型提出的 100 個去識別化問題,再由 12 名美國臨床醫師進行隨機、盲測的評分,合計產出 1,800 筆標註。

通用模型三關全勝,MedQA 最高 97.4%

結果是通用模型在三關全面勝出。以 MedQA 為例,Gemini 的準確率最高、達 97.4%,GPT 為 94.2%、Claude 為 90.2%;相較之下,OpenEvidence 為 89.6%、UpToDate 為 88.4%。更關鍵的是,在最貼近實務的 RCQ 上,這兩款臨床工具的表現,只與「開啟自動摘要的 Google 搜尋 AI」相當。

廣告 - 內文未完請往下捲動

對「垂直醫療 AI」的護城河是警訊

這個結果挑戰了一個常見假設:醫療這種高度專業的領域,必須用「特別打造、灌入專業資料」的 AI 才可靠。研究顯示,當通用的前沿模型本身已經夠強,專用工具若沒有明顯的加值,護城河就會被打上問號。它也點出一個監管落差:部分臨床 AI 工具已取得美國 FDA 認證,卻在測試中不敵未針對醫療特調的通用模型,凸顯現行的驗證標準,可能跟不上模型進步的速度。要提醒的是,這是一項以基準與盲測評分為主的研究,並不等於「通用模型可以直接拿來看診」;醫療現場的責任、合規與安全,仍需要更嚴謹的臨床驗證。但至少在「回答醫療問題」這件事上,通用 AI 已經追上、甚至超車了專用工具。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。