AI医生首次在完整诊疗中超越人类

AI医生MIRA,真的来上班了

各位好啊,欢迎收看最新一期的威客日报,点赞收藏关注是我更新的最大动力!

引言:众所周知,ChatGPT通过美国医师资格考试这件事,已经是三四年前的旧闻了。那时候到处都在喊,AI要取代医生了。

然后呢?然后没了。

医院里头,还是那群穿白大褂的人类在前台跑。会答题和会上班,压根是两码事。一个真实的医生,得打开电子病历系统、翻既往病史、开出化验单和CT申请单、盯着检验科返回的数据皱眉头、调药量、写医嘱、决定收住院还是让出院。过去所有的AI医生,连这个系统的登录界面都没进过。

Nature上最新点一篇论文,把这个局面彻底捅破了。

图 | MIRA的工作流程示意图——它可以在电子健康档案系统中独立完成从问诊到入院的完整诊疗 © Nature, 2026

6月17日Nature发表:海德堡大学开发的MIRA系统,在574个真实急诊病例中诊断准确率87.8%,全面碾压7-11年经验的专科医生。它不是聊天AI,能直接开检查单、开药、安排手术,可调用85000个临床工具。用药安全近乎零差错。

一、MIRA到底是干什么的

MIRA全称Medical Intelligence for Reasoning and Action。它不是一个聊天机器人。过去那些AI医生本质上就是升级版搜索引擎——你问它肚子疼怎么办,它给你背一段教科书。

MIRA不一样。

它的生存环境是一个模拟的电子病历沙盒,完全符合HL7 FHIR国际标准。在这个沙盒里,它可以做的事情很多:打开患者的电子病历看一眼既往史、向患者提问、下化验单子、申请CT或者X光、读检验结果、开处方药、安排手术、决定是收住院还是打发回家。

它手上能用的一共11种专用数字工具。把这些工具排列组合一下,能产生超过85000个操作选项。急诊科医生日常面对的种临床选择数量,大概也就是这个量级。

还有一个细节。MIRA跟系统对话,不用中文也不说英文。它发出去的每一条指令都经过了标准医学编码——ICD、LOINC、ATC这些缩写,是医疗信息系统之间通行的精确语言。它不是在跟人聊天,是在跟机器下指令。

图 | 患者AI代理鲁棒性评估——设计用以模拟真实患者并防止信息泄露 © Nature, 2026

二、一场挑不出毛病的人机对决

研究团队没有偷懒。

他们从MIMIC-IV数据库里翻出了574个真实急诊病例,覆盖8种疾病——阑尾炎、胆囊炎、憩室炎、胰腺炎、肺炎、尿路感染、肺栓塞、胰腺癌。每个病例都带着真病史、真化验、真影像、真治疗结局,不是编出来的。

对手找了两拨人。第一拨是4位拿了委员会认证的专科医生,干这行干了7到11年。第二拨是6个人混编的——2个专科医生加4个住院医师,就是德国急诊室最典型的配置。

两边用完全一样的信息、走完全一样的界面开始答题。唯一的区别是,人类医生用图形EHR界面点点点,MIRA走API。

还有一道小聪明。为了不让患者AI代理一上来就把诊断结果抖出来——如果MIRA或者人类医生直接问“你是不是得了胰腺炎”,代理会拒绝回答,只按病历写的主诉来回应。这套防套话机制,连人类医生也没绕过去。

图 | MIRA与人类医生的诊断准确率对比——蓝柱代表MIRA,在多数疾病中显著领先 © Nature, 2026

三、成绩单亮眼,但并非完美

总成绩:MIRA 87.8%,专科医生组78.1%,混合组71.1%。统计学上的差距很明确。

分病种看更刺激。

  • 胰腺炎,MIRA 95.2%,专科医生78.6%。

  • 阑尾炎,MIRA 98.6%。

  • 胰腺癌也显著超过了两组人类医生。

  • 唯一跟人类打平的是胆囊炎和肺栓塞。

很多人怕AI乱开检查。数据出来,这个担心被怼回去了。

MIRA申请的血液化验项目,只有MIMIC-IV数据库历史记录里实际做过的五成出头。人类医生反而只查了28.3%——偏低到可能漏线索。影像学检查,MIRA跟人类持平,没有多开。

手术推荐上MIRA很猛。需要做腹腔镜阑尾切除术的病例,一个都没漏掉,100%准确推荐。胆囊炎患者中90.6%被推对了手术方案。整体手术推荐召回率53.5%,而专科医生只有38.3%。

用药安全审查是一块硬骨头。研究员把MIRA写出去的468条用药医嘱一条一条审。

结果是:药物剂量正确率97.6%,治疗周期正确率99.6%,给药途径是弱项也有97%

六个安全维度——药药相互作用、肾剂量调整、过敏匹配、QT间期延长风险、阿片类安全,全部是零严重差错。

在医院留不留这个问题上,MIRA也表现得很像一个不想被投诉的医生。真正需要住院的患者,它一个没漏(召回率100%)。肺栓塞方面稍微有点过度收治——宁可多收不可放过,这个态度在急诊科也算说得过去。

研究团队还试过折腾它:把患者性别换一下、让患者坚称自己没事、让患者焦虑到不行、只让患者讲德语或者法语。结果MIRA的诊断准确率一动不动。人类医生的那些偏见,在它身上不起作用。

图 | MIRA在疾病管理与指南遵从方面的表现——整体依从性比专科医生高出35个百分点 © Nature, 2026

四、省流时间

这篇论文6月17日发表在Nature上,通讯作者是海德堡大学医院的Jakob Kather。核心数据一句话讲完:MIRA在574个真实急诊病例上全面超越人类医生,诊断效率更高、用药更安全、不受偏见影响。

研究者自己态度很冷淡。他们说,MIRA不是拿来替代人类医生的。那些重复性高又容易出错的活儿,比如核对用药清单、自动组合化验套餐、按指南生成医嘱建议都让AI干了,医生能腾出手来跟病人面对面说话。

反正吧,这事至少说明了一个问题:AI用考的来证明自己,跟真正上手干活,之间的差距没有想象中那么大。当然,有些抗生素上MIRA选得还不够好,具体给药途径也不时写错,这些缺陷不是掉链子,是在告诉你下一步该往哪儿修。

距离它真正走进急诊室,还有一段路。但至少,它已经拿到了面试资格。

码字不易,求点赞!求收藏!求盒电!

关注我,一起学些没用的...

--------------------------------------------------------------------------

本期参考文献:

1. Ferber, D., Hilgers, L., Höper, C. et al. Towards autonomous medical artificial intelligence agents. Nature (2026). DOI: 10.1038/s41586-026-10675-5

2. Nature. Artificial intelligence: Medical AI models for patient management. Nature Press Release, 18 June 2026.

3. He K, et al. Towards Conversational AI for Disease Management. Nature (2026). DOI: 10.1038/s41586-026-10764-5

更多游戏资讯请关注:电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com