AI醫生首次在完整診療中超越人類

AI醫生MIRA,真的來上班了

各位好啊,歡迎收看最新一期的威客日報,點贊收藏關注是我更新的最大動力!

引言:衆所周知,ChatGPT通過美國醫師資格考試這件事,已經是三四年前的舊聞了。那時候到處都在喊,AI要取代醫生了。

然後呢?然後沒了。

醫院裏頭,還是那羣穿白大褂的人類在前臺跑。會答題和會上班,壓根是兩碼事。一個真實的醫生,得打開電子病歷系統、翻既往病史、開出化驗單和CT申請單、盯着檢驗科返回的數據皺眉頭、調藥量、寫醫囑、決定收住院還是讓出院。過去所有的AI醫生,連這個系統的登錄界面都沒進過。

Nature上最新點一篇論文,把這個局面徹底捅破了。

圖 | MIRA的工作流程示意圖——它可以在電子健康檔案系統中獨立完成從問診到入院的完整診療 © Nature, 2026

6月17日Nature發表:海德堡大學開發的MIRA系統,在574個真實急診病例中診斷準確率87.8%,全面碾壓7-11年經驗的專科醫生。它不是聊天AI,能直接開檢查單、開藥、安排手術,可調用85000個臨牀工具。用藥安全近乎零差錯。

一、MIRA到底是幹什麼的

MIRA全稱Medical Intelligence for Reasoning and Action。它不是一個聊天機器人。過去那些AI醫生本質上就是升級版搜索引擎——你問它肚子疼怎麼辦,它給你背一段教科書。

MIRA不一樣。

它的生存環境是一個模擬的電子病歷沙盒,完全符合HL7 FHIR國際標準。在這個沙盒裏,它可以做的事情很多:打開患者的電子病歷看一眼既往史、向患者提問、下化驗單子、申請CT或者X光、讀檢驗結果、開處方藥、安排手術、決定是收住院還是打發回家。

它手上能用的一共11種專用數字工具。把這些工具排列組合一下,能產生超過85000個操作選項。急診科醫生日常面對的種臨牀選擇數量,大概也就是這個量級。

還有一個細節。MIRA跟系統對話,不用中文也不說英文。它發出去的每一條指令都經過了標準醫學編碼——ICD、LOINC、ATC這些縮寫,是醫療信息系統之間通行的精確語言。它不是在跟人聊天,是在跟機器下指令。

圖 | 患者AI代理魯棒性評估——設計用以模擬真實患者並防止信息泄露 © Nature, 2026

二、一場挑不出毛病的人機對決

研究團隊沒有偷懶。

他們從MIMIC-IV數據庫裏翻出了574個真實急診病例,覆蓋8種疾病——闌尾炎、膽囊炎、憩室炎、胰腺炎、肺炎、尿路感染、肺栓塞、胰腺癌。每個病例都帶着真病史、真化驗、真影像、真治療結局,不是編出來的。

對手找了兩撥人。第一撥是4位拿了委員會認證的專科醫生,幹這行幹了7到11年。第二撥是6個人混編的——2個專科醫生加4個住院醫師,就是德國急診室最典型的配置。

兩邊用完全一樣的信息、走完全一樣的界面開始答題。唯一的區別是,人類醫生用圖形EHR界面點點點,MIRA走API。

還有一道小聰明。爲了不讓患者AI代理一上來就把診斷結果抖出來——如果MIRA或者人類醫生直接問“你是不是得了胰腺炎”,代理會拒絕回答,只按病歷寫的主訴來回應。這套防套話機制,連人類醫生也沒繞過去。

圖 | MIRA與人類醫生的診斷準確率對比——藍柱代表MIRA,在多數疾病中顯著領先 © Nature, 2026

三、成績單亮眼,但並非完美

總成績:MIRA 87.8%,專科醫生組78.1%,混合組71.1%。統計學上的差距很明確。

分病種看更刺激。

  • 胰腺炎,MIRA 95.2%,專科醫生78.6%。

  • 闌尾炎,MIRA 98.6%。

  • 胰腺癌也顯著超過了兩組人類醫生。

  • 唯一跟人類打平的是膽囊炎和肺栓塞。

很多人怕AI亂開檢查。數據出來,這個擔心被懟回去了。

MIRA申請的血液化驗項目,只有MIMIC-IV數據庫歷史記錄裏實際做過的五成出頭。人類醫生反而只查了28.3%——偏低到可能漏線索。影像學檢查,MIRA跟人類持平,沒有多開。

手術推薦上MIRA很猛。需要做腹腔鏡闌尾切除術的病例,一個都沒漏掉,100%準確推薦。膽囊炎患者中90.6%被推對了手術方案。整體手術推薦召回率53.5%,而專科醫生只有38.3%。

用藥安全審查是一塊硬骨頭。研究員把MIRA寫出去的468條用藥醫囑一條一條審。

結果是:藥物劑量正確率97.6%,治療週期正確率99.6%,給藥途徑是弱項也有97%

六個安全維度——藥藥相互作用、腎劑量調整、過敏匹配、QT間期延長風險、阿片類安全,全部是零嚴重差錯。

在醫院留不留這個問題上,MIRA也表現得很像一個不想被投訴的醫生。真正需要住院的患者,它一個沒漏(召回率100%)。肺栓塞方面稍微有點過度收治——寧可多收不可放過,這個態度在急診科也算說得過去。

研究團隊還試過折騰它:把患者性別換一下、讓患者堅稱自己沒事、讓患者焦慮到不行、只讓患者講德語或者法語。結果MIRA的診斷準確率一動不動。人類醫生的那些偏見,在它身上不起作用。

圖 | MIRA在疾病管理與指南遵從方面的表現——整體依從性比專科醫生高出35個百分點 © Nature, 2026

四、省流時間

這篇論文6月17日發表在Nature上,通訊作者是海德堡大學醫院的Jakob Kather。核心數據一句話講完:MIRA在574個真實急診病例上全面超越人類醫生,診斷效率更高、用藥更安全、不受偏見影響。

研究者自己態度很冷淡。他們說,MIRA不是拿來替代人類醫生的。那些重複性高又容易出錯的活兒,比如覈對用藥清單、自動組合化驗套餐、按指南生成醫囑建議都讓AI幹了,醫生能騰出手來跟病人面對面說話。

反正吧,這事至少說明了一個問題:AI用考的來證明自己,跟真正上手幹活,之間的差距沒有想象中那麼大。當然,有些抗生素上MIRA選得還不夠好,具體給藥途徑也不時寫錯,這些缺陷不是掉鏈子,是在告訴你下一步該往哪兒修。

距離它真正走進急診室,還有一段路。但至少,它已經拿到了面試資格。

碼字不易,求點贊!求收藏!求盒電!

關注我,一起學些沒用的...

--------------------------------------------------------------------------

本期參考文獻:

1. Ferber, D., Hilgers, L., Höper, C. et al. Towards autonomous medical artificial intelligence agents. Nature (2026). DOI: 10.1038/s41586-026-10675-5

2. Nature. Artificial intelligence: Medical AI models for patient management. Nature Press Release, 18 June 2026.

3. He K, et al. Towards Conversational AI for Disease Management. Nature (2026). DOI: 10.1038/s41586-026-10764-5

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com