点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 中央军委举行晋升上将军衔仪式

  • “粤车南下”入境香港市区正式实施

独家策划

推荐阅读
我国自主设计建造的全球首制甲醇双燃料动力智能超大型油轮“凯拓”轮22日在辽宁大连成功交付。
2025-12-23 09:54
中国科学院大连化学物理研究所副研究员方光宗、研究员潘秀莲团队在乙炔氢氯化制氯乙烯研究领域取得新进展。
2025-12-23 09:53
《自然》杂志网站12月18日刊发文章,展望了2026年值得关注的科学事件,涉及人工智能(AI)、基因编辑和太空探索等多个领域。中国计划于2026年发射嫦娥七号探测器,目标是在布满岩石与陨石坑、着陆难度极大的月球南极附近着陆。
2025-12-23 09:52
9月30日,中国科学院上海应用物理研究所原所长徐洪杰去世半个月后,一场以追思和战略研讨为主题的“务虚会”在研究所召开。
2025-12-23 09:47
种子是“农业芯片”。精准设计育种这盘大棋,在科技工作者手中,正下得风生水起。
2025-12-23 03:05
12月17日,《自然》发布2025年值得关注的七大暖心科学故事,从基因编辑的多项突破,到传染病的快速防控,再到政策层面的重大胜利,都让人们为这一年感到高兴。
2025-12-22 09:57
记者21日从中国科学院大连化学物理研究所获悉,该所研究员李先锋团队在溴基多电子转移液流电池新体系研究方面取得新进展。
2025-12-22 09:56
微波加热,是维持“人造太阳”——全超导托卡马克核聚变实验装置(EAST)上亿摄氏度高温的核心技术之一。
2025-12-22 09:52
12月19日,《科学》在线发表了这项由中国科学家领衔的重要研究成果。
2025-12-22 09:50
记者了解到,作为农业科技“国家队”,近年来,该院依托西部中心,组建了高品质棉花生产模式、作物生物安全与防控等16支创新团队,把百余项技术成果转化运用到新疆这片热土。
2025-12-22 02:45
由我国多家研发单位联合完成的两项降糖减重药物Ⅲ期临床研究成果,北京时间18日在线发表于国际科学顶级学术期刊《自然》(《Nature》)。
2025-12-19 09:51
一个国际团队12月17日发表于《自然》的研究显示,70岁以上人群中,近1/10患有阿尔茨海默病。
2025-12-19 09:51
近日,“大国重器”中国天眼(FAST)又传来好消息。截至2025年11月5日,它已发现脉冲星1170颗,远超同期其他望远镜发现总数。
2025-12-19 09:48
国家自然科学基金重大非共识项目日前正式启动试点,首批遴选出3项建议资助项目,支持科研人员在国际科技竞争“无人区”开辟研究方向。
2025-12-19 09:47
《物理世界》日前公布“2025年度十大科学突破”榜单,中国科学院物理研究所/北京凝聚态物理国家研究中心张广宇团队主导的“首例二维金属制备”成果成功入选。
2025-12-19 09:45
中国科学技术大学教授潘建伟、张强等组成的研究团队与济南量子技术研究院、中国科学院半导体研究所等单位合作,通过混合集成分布式反馈激光器与薄膜铌酸锂光子芯片,成功实现了电泵浦片上集成的高亮度偏振量子纠缠光源,向集成化量子信息处理迈出重要一步。
2025-12-18 10:02
肺鱼,一种可以“绝境求生”的神奇生物,部分种类能在缺水时躲入泥中使用肺呼吸,直到雨季才复苏。借助高精度CT扫描与三维重建技术,乔妥、崔心东与团队其他成员对云南古嵴鱼展开了细致的关键形态特征观察。
2025-12-18 10:00
气温下降容易影响呼吸系统和循环系统。
2025-12-18 09:59
在这些应用成果中,人工智能大模型赋予机器人“大脑”,具身智能赋予机器人“小脑”与“四肢”,让它们学会像人一样思考和行动。蒸汽机延伸了人类的体能,计算机延伸了人类的智能,具身智能意味着一个“人机共生”的新纪元——机器人不再是冷冰冰的机器,而是生产生活中的得力伙伴。
2025-12-18 09:50
其中,“泛在操作系统”“高性能制造”“深部固体资源流态化开采”“超级微创手术”4项体系化新名词,均为我国科学家率先提出。超级微创手术经由自然腔道、隧道、穿刺通道、多腔隙通道,构建起覆盖全器官系统的技术体系。
2025-12-18 09:49
加载更多