AI(人工智能)系统现在在医院急诊科的患者分类诊断中表现优于医生。这是患者到达医院时的关键初步评估阶段。《科学》杂志上发表的研究测试了大型语言模型(LLM),即支持ChatGPT的技术,使用来自波士顿紧急病房的实际临床笔记。在分类阶段,当信息最稀缺而风险最高时,AI在67%的病例中正确识别出诊断或与之密切相关的内容。作为对比,两位医生分别达到50%和55%。这一差距在错过严重病情可能导致死亡时尤其重要。 该研究代表了从早期专注于通过医学执照考试的AI研究的一次重大飞跃,这是一些令人印象深刻的趣闻,但未能反映出真实世界的临床实用性。这次,研究人员使用了急诊护理中多个决策点的真实患者记录,使得研究结果直接与实际医学实践相关。其含义很明确:这些系统可以帮助医生更全面地考虑鉴别诊断,尤其是在不遗漏灾难性情况时。 但该研究的局限性同样重要。AI完全基于书面文本工作。它从未见过患者面容,从未注意到呼吸窘迫或败血症的微妙迹象,从未进行身体检查,从未与焦虑的家属交谈,也未对接下来发生的事情承担责任。它仅提供对策划文本的复杂模式识别,而不是在拥挤的急诊部门周六凌晨3点的混乱现实中进行急诊医学实践。 在提供准确诊断建议和实际改善患者结果之间,还有一个鸿沟。更长的可能性清单可能会激发有益的思考,但同样可能引发不必要的检测、过度治疗、临床疲劳,或对一个听起来可信但最终错误的答案产生危险的过度信任。一些研究中使用的基准案例可能已包含在AI的训练数据中,尽管这并不使急诊部门的研究结果无效。 更紧迫的问题是,临床实践已经远超治理。一项皇家医学学院的调查发现,16%的英国医生每天在临床实践中使用AI工具,另有15%每周使用。这意味着大约三分之一的医生在未建立测试这些系统、安全使用它们的培训、检测何时造成伤害或确定责任标准的情况下,将这些系统整合到工作流程中。科技已经嵌入到患者护理中,在监管真空中运作。