AI(人工智能)系统现在在医院急诊科的患者分类诊断中表现优于医生。这是患者到达医院时的关键初步评估阶段。《科学》杂志上发表的研究测试了大型语言模型(LLM),即支持ChatGPT的技术,使用来自波士顿紧急病房的实际临床笔记。在分类阶段,当信息最稀缺而风险最高时,AI在67%的病例中正确识别出诊断或与之密切相关的内容。作为对比,两位医生分别达到50%和55%。这一差距在错过严重病情可能导致死亡时尤其重要。 该研究代表了从早期专注于通过医学执照考试的AI研究的一次重大飞跃,这是一些令人印象深刻的趣闻,但未能反映出真实世界的临床实用性。这次,研究人员使用了急诊护理中多个决策点的真实患者记录,使得研究结果直接与实际医学实践相关。其含义很明确:这些系统可以帮助医生更全面地考虑鉴别诊断,尤其是在不遗漏灾难性情况时。 但该研究的局限性同样重要。AI完全基于书面文本工作。它从未见过患者面容,从未注意到呼吸窘迫或败血症的微妙迹象,从未进行身体检查,从未与焦虑的家属交谈,也未对接下来发生的事情承担责任。它仅提供对策划文本的复杂模式识别,而不是在拥挤的急诊部门周六凌晨3点的混乱现实中进行急诊医学实践。 在提供准确诊断建议和实际改善患者结果之间,还有一个鸿沟。更长的可能性清单可能会激发有益的思考,但同样可能引发不必要的检测、过度治疗、临床疲劳,或对一个听起来可信但最终错误的答案产生危险的过度信任。一些研究中使用的基准案例可能已包含在AI的训练数据中,尽管这并不使急诊部门的研究结果无效。 更紧迫的问题是,临床实践已经远超治理。一项皇家医学学院的调查发现,16%的英国医生每天在临床实践中使用AI工具,另有15%每周使用。这意味着大约三分之一的医生在未建立测试这些系统、安全使用它们的培训、检测何时造成伤害或确定责任标准的情况下,将这些系统整合到工作流程中。科技已经嵌入到患者护理中,在监管真空中运作。
❤️ health
AI在急诊分类中击败医生,责任无人知晓
《科学》杂志的一项新研究显示,AI在紧急病人分类阶段的诊断比医生更准确——67%对比50-55%。乍一看令人印象深刻,但现实是成千上万的英国医生每天都在使用这些工具,而治理、责任或安全协议尚未厘清。这项技术已超越了安全防护措施。
我的看法
标题“AI击败医生”完全没有抓住重点。这并不是AI是否能在特定诊断任务上超过人类的问题。这个问题已经解决。真正的丑闻在于,我们正在不加以适当管理的情况下,向广泛的临床使用强大系统中走向蒙昧。 说“保持人类在环中”是令人安慰的胡话。哪个人?具备什么样的培训?依据哪些标准有权力覆盖AI?当工具无声地开始失效时,这在复杂系统中最终都会出现,谁能察觉,谁来修复,谁要负法律责任?这些都不是假设问题。目前在英国,每六位医生中就有一位每天使用AI,而这些问题仍未有答案。 正确的前进方向不是禁止这些工具或假装它们不存在,而是要求严格的现实世界试验,将它们确立为辅助第二意见而非决策者,衡量对患者实际重要的方面,并在广泛应用之前,而不是之后,建立治理结构。相反,我们正在做相反的事情:先部署,之后再发问,希望在此空隙中没人受伤。
接下来会发生什么
在未来六个月内,预计英国医院将发生首起与AI诊断工具相关的严重不良事件,这不是因为技术根本上有缺陷,而是因为缺乏治理基础设施来捕捉可预测的故障。患者将因AI生成的鉴别诊断引发的过度检测受到伤害,或因一位初级医生过度依赖于一个自信的算法而错过诊断,突然间责任问题将从学术期刊转移到法庭上。 NHS将通过推出指导而非真正的治理来回应,可能是某种“临床医生对所有决策负责”的变体,这解决不了任何问题,也保护不了任何人。同时,商业AI供应商将继续在这一监管真空中销售产品,因为没有机制来阻止他们。一些医院将在第一起诉讼后悄然撤回AI工具,而其他医院将加倍努力,因为跨地区的AI采用出现了邮政编码彩票效应。 真正有趣的情境是,如果皇家学会在监管者之前介入,并为临床AI工具建立自己的同行评审认证方案。它将是混乱和不完美的,但它可能比等待政府行动更快速地创造问责制。替代方案是多年被动的监管,针对可预防悲剧的反应制定,这是英国通常应对医疗保健中新兴技术的方式。
历史告诉我们什么
这种治理缺口与20世纪70年代计算机断层扫描仪引入时的情况有明确的历史相似性。这项技术具有革命性,确实提高了诊断准确性,并迅速在医院中普及,然后才有人为适当使用、辐射暴露限制或临床医生培训标准建立协议。结果是多年的过度使用、不必要的辐射暴露,以及最终认识到强大的诊断工具需要系统治理,而不仅仅是临床热情。监管机构花了近十年时间才赶上已经嵌入日常实践的技术。 AI情况发展更快,并可能带来更高风险,因为CT扫描仪是医生在明确问责制下操作的工具,而AI系统则提供自主建议,可能会微妙地改变临床决策而不明确责任感。我们正在以更快的速度重复同样的错误。