点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 郑州:国际航空货运枢纽能级逐步提升

  • 平陆运河全线桥梁工程即将收官

独家策划

推荐阅读
人与自然和谐共生是中国式现代化的重要特征之一,守好碧海银滩,构建人海和谐的海洋生态环境是中国式现代化的题中应有之义。
2026-04-01 09:45
2021年长江十年禁渔实施以来,禁渔秩序总体平稳,退捕渔民生计有效保障,水生生物资源衰退趋势得到决定性扭转,长江水生生物完整性指数稳步提升,取得阶段性明显成效。
2026-04-01 09:44
“过去雷达网建设主要解决‘有没有’的问题,现在AI让这张网从‘能探测’升级为‘会思考’。”在张兴赢看来,“AI正在成为工程的‘第二大脑’。”
2026-04-01 09:43
硒是人体必需的微量矿质营养素。然而,我国约7亿人口存在硒摄入不足。
2026-04-01 09:42
强对流天气的形成是水汽条件、不稳定状态的大气层结构、地形等多种条件协同作用的结果,包括雷暴、短时强降水、大风、冰雹等天气现象,具有影响快、强度强、致灾性强的特点。
2026-04-01 09:39
3月30日,世界数据组织正式成立并落户北京,理事长由中国科学院院士谭铁牛担任。这不仅是对谭铁牛个人学术成就的认可,更是国际社会对中国数据发展和治理能力的充分肯定,是中国科学家提升全球科技治理话语权的生动缩影。
2026-03-31 10:23
教育部30日印发《校园食品安全“十必须”》《学校食堂工作人员“十不准”》,进一步筑牢校园食品安全防线,明确中小学、幼儿园食堂不得制售冷荤类食品、生食类食品、冷加工糕点,不得加工制作四季豆、鲜黄花菜、野生蘑菇、发芽土豆等高风险食品。
2026-03-31 10:22
30日19时00分,力箭二号遥一运载火箭在东风商业航天创新试验区发射升空,将搭载的新征程01卫星、轻舟初样试飞船和天视卫星01星顺利送入预定轨道,发射任务取得圆满成功。
2026-03-31 10:17
从政策精准发力到科技赋能支撑,从风险保障兜底到绿色理念引领,每一分努力都在为全年粮食丰收积蓄力量。
2026-03-31 10:11
交通运输部、工业和信息化部、国务院国资委、市场监管总局近日联合印发《智能航运2030行动计划》,明确“十五五”期间我国智能航运发展的总体要求、重点任务和保障措施。
2026-03-31 10:10
新当选的首届理事会召开第一次会议,选举产生组织负责人,审议通过组织重要制度和规定,标志着世界数据组织完成组建将正式投入运行。
2026-03-30 14:22
截至目前,河南5300万亩高标准农田配套了数字设施,无人机飞防作业面积突破4000万亩次,AI预判让春管从“盲目应对”转向“精准发力”。在陇原大地甘肃,AI预判延伸至春耕全链条,从良种布局到苗期管护已实现全程可控。
2026-03-30 09:38
3月27日,在北京国际科幻与未来产业博览会上,他山公司的人形机器人在展示原子动作数据采集平台精细操作场景。
2026-03-30 09:35
29日,中国科学技术发展战略研究院在2026中关村论坛年会上发布《国家创新指数报告2025》,从创新资源、知识创造、企业创新、创新绩效、创新治理5个方面构建指标体系,对世界60个国家创新能力开展评价。
2026-03-30 09:32
从供给侧层面来看,主产区作物长势稳健,设施化种植规模持续扩大,春菜上市更早、供给周期更长,市场有效供给能力稳步提升。
2026-03-30 09:31
正值插秧季节,往年这时候,田里到处都“插”满了人。现在,记者在云南红河州元阳县马街乡三合寨村看到:插秧的人不见了,山脚的大块田里,“大铁牛”(插秧机)“突突突”;而在山顶的小块田里,“小铁牛”往来穿梭。正在指导春耕生产的县农机管理站站长黄冲向记者介绍:“云南的耕地,多以山地为主。
2026-03-30 09:30
实际上本轮废旧手机回收价格上涨并非全品类普涨,不同品牌、型号、配置的废旧手机,涨幅存在显著差异。
2026-03-27 10:14
在博鳌亚洲论坛2026年年会上,一位特殊的嘉宾吸引了大家的目光——博鳌亚洲论坛史上首位数字人嘉宾ViviDora正式亮相。3月25日在博鳌亚洲论坛“人形机器人的进阶与飞跃”分论坛上拍摄的机器人。
2026-03-27 09:25
这些年,中国科技产出持续攀升——高被引论文数全球占比超30%,专利授权量连年位居世界第一。在技术经理人的“撮合”下,马鹏程团队成功在新疆、陕西、宁夏、内蒙古等地的煤化工企业完成前期中试。
2026-03-27 09:23
时间回到10年前,2016年11月15日凌晨3点,中国科学院青年创新促进会学术年会的酒店房间里,武延军与计算所研究员包云岗靠在各自的床头,越聊越兴奋。编译工具链、操作系统内核及关键基础组件等基础软件的适配,是指令集架构的生态底座,它们是所有硬件和应用软件绕不开的“基础设施”。
2026-03-27 09:35
加载更多