点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 山东淄博:繁花绽放激活春日“赏花经济”

  • 浙江安吉:万亩茶园 采摘正酣

独家策划

推荐阅读
人工智能时代,我们如何更好就业创业?如何推动人工智能与就业创业深度融合?第四期光明智库民生论坛,我们邀请专家共同探讨人工智能时代的就业创业这一新课题。
2026-04-09 10:28
2026年的智能驾驶行业,正经历一场意味深长的路线分化。
2026-04-09 10:24
在贵州,无人机的身影成为山地农业的新风景,展现出通用航空业赋能山地农业高质量发展的广阔前景。
2026-04-09 10:12
碳排放看不见、摸不着,却关乎每一场国际气候谈判、每一笔碳关税账单。
2026-04-09 10:09
人工智能在延伸人类能力的同时,也深刻改变着就业创业形态和劳动力市场结构。我们既拥抱着技术进步带来的无限可能,也要理性审视挑战、主动适应变革。
2026-04-09 10:08
构建“科研—科普—科创”融合闭环,让科普全程嵌入新质生产力培育链条,方能破解成果转化低效、创新协同不足等突出问题。
2026-04-09 10:02
从实验室到田间地头,辽宁省农科院为科研院所、高校、种业企业等单位提供种质资源共享服务,打通种质资源转化的“最后一公里”,让良种真正走进千家万户。
2026-04-09 09:50
北京大学先进制造与机器人学院刘珂课题组与杨林课题组合作,从折纸艺术中获得灵感,成功实现了无需外部输入的电子器件智能温度控制,相关指标刷新世界纪录。
2026-04-09 09:47
最近,中国海洋大学教授、青岛海洋生物医药研究院首席科学家于广利远赴智利,只为一株南极褐藻。2014年,青岛海洋生物医药研究院正式运行,BG136成为其孵化的第一个海洋新药项目。
2026-04-08 09:51
4月7日,贵州省贵阳市,北京积水潭医院贵州医院医生在指导患者进行脑机接口康复训练。信息多跑路、群众少跑腿的背后,是西青区紧密型医共体数据互通共享,让信息实时对接、问题协同处置。
2026-04-08 09:49
绿色获得感,源自对优美生态最直观的感受,是看得见、摸得着的民生福祉。绿色获得感,源自生态与产业共促,让绿水青山成为富民兴业的金山银山。绿色获得感,源自城乡融合发展,让良好生态空间全民共享。
2026-04-08 09:44
2月5日,自然资源部组织的中国第42次南极考察队在东南极麒麟冰下湖区域,成功完成我国首次南极冰层热水钻探试验,突破国际极地热水钻探2540米的最深纪录,标志着我国具备在90%以上的南极冰盖和全部北极冰盖开展钻探研究的能力。
2026-04-08 09:43
当前,我国已进入中度老龄化阶段,失能、失智、高龄老年人逐年增多,养老服务需求呈现专业化、多样化、个性化特征。
2026-04-08 09:41
黄色的花在春天更早绽放,是植物经历数亿年的自然进化形成的一系列生存策略。
2026-04-07 10:29
国家卫生健康委与国家中医药局近日联合印发《基层医疗卫生机构医疗质量改善三年行动方案(2026—2028年)》,部署实施基层医疗质量改善三年行动。此举旨在进一步发挥基层医疗卫生机构提供基本医疗服务作用,提高基本医疗服务规范性和同质化水平,保障基层医疗卫生机构医疗质量和医疗安全,助力实现分级诊疗“基层首诊”。
2026-04-07 10:28
今年《政府工作报告》提出,完善人才培养与经济社会发展需要适配机制。人才培养是一项复杂的系统工程,其关键是学科专业设置和调整,重点是人才培养模式改革和课程体系完善。
2026-04-07 10:23
近年来,网络信息服务业态不断革新,人工智能技术快速迭代,数字虚拟人应用场景持续拓展。多位专家表示,征求意见稿秉持“以人为本、智能向善”的理念,为全球数字虚拟人治理提供了兼具可行性与前瞻性的中国方案。
2026-04-07 10:23
不少人遇到过煮熟后弹性异常的“橡胶蛋”,便认为是人造假鸡蛋,这一说法也被李满雨否定。对比普通鸡蛋,李满雨指出,功能性鸡蛋仅在特定营养成分上有明显优势,在蛋白质、脂肪、维生素A等日常必备营养素上,二者差距微乎其微。
2026-04-07 10:22
征求意见稿提出,任何组织和个人提供、使用数字虚拟人服务,不得以丑化、污损等形式侵害他人人格权,未经特定自然人同意,不得提供足以识别特定自然人身份的数字虚拟人服务。
2026-04-03 17:59
近日,《关于加快建立长期护理保险制度的意见》(以下简称《意见》)印发。《意见》明确,用3年左右时间,基本建立适应我国基本国情的长期护理保险制度。
2026-04-03 10:07
加载更多