点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • “星”耀“北大仓”:黑土地上演别样丰收浪漫

  • 中国品牌亮相米兰时装周

独家策划

推荐阅读
9月23日,当太阳行至黄经180度时,我们迎来二十四节气中的第十六个节气——秋分。
2026-09-23 09:19
实施藏粮于地、藏粮于技战略并非抽象概念,它实实在在体现在产量、装备和技术水平的变化里。
2026-09-23 09:14
一只烂苹果长出小蘑菇,竟一路“走”向太空育种;一辆由大学生制造组装的方程式赛车,让围观者眼里放光;一台智能交作业提醒机,出自中小学生之手……这些都是发生在2026年全国科普月活动上的真实片段。
2026-09-23 08:56
油炸薯条、烘焙咖啡等食品,日常生活中很常见,但高温加工过程会产生丙烯酰胺,这是一种需要加以控制的污染物。
2026-09-23 08:55
在自然灾害面前,我们需要确保两个“安全”——生命安全和财产安全。如何最大限度减少人员伤亡和财产损失,一直是我国防灾减灾救灾工作的重点。
2026-09-23 08:53
一个优良豆类品种的诞生,至少需1代杂交、6代自交,用传统育种方式得花10年左右。10年后的“新品种”,还能满足市场需求吗?尽可能缩短育种时间,才能减少不确定性。
2026-09-22 09:18
目前,“拉索”已联合“天关”“中国天眼”“银河画卷”等不同波段天文设施形成新的队伍,对重要科学问题进行攻关。
2026-09-22 09:09
记者从中国地质大学(北京)邢立达课题组获悉,中外科学家团队在安徽下三叠统南陵湖组地层中发现巨型鲎类遗迹化石。
2026-09-22 09:01
西北大学地质学系研究员韩健等联合国内外研究学者,在距今5.18亿年的云南澄江生物群中发现了步带动物新物种——胶膜玉净虫。
2026-09-22 09:00
在甘肃科技馆的科学市集“创想驿站”,兰州市第二十二中的段延浩站在自己制作的模型前,沿着风机、太阳能板、储电仓一路介绍。
2026-09-22 08:59
“面向智能社会的科学素质:机遇、挑战与变革”
2026-09-22 08:07
2026科普中国智库论坛暨第三十二届全国科普理论研讨会
2026-09-21 17:29
棘皮动物辐射对称,具钙化骨骼和管足;半索动物两侧对称,身体柔软并保留鳃裂。由此推论,步带动物两个门类的共同祖先并非此前推测的无触手蠕虫状动物,实际上部分类群已经具有较为发达的滤食附肢。
2026-09-21 09:23
弘扬科学家精神,既要有庄重的纪念,也需要在生活中讲好具体的、鲜活的人和故事。
2026-09-21 09:18
20日,在由中国科普研究所主办的2026科普中国智库论坛暨第三十二届科普理论研讨会上,数项新成果——《国家科普能力发展报告(2024—2025)》、《中国公民科学素质报告(2025—2026)》、《科普服务高质量发展智库报告》、《鼎新致远:科普服务高质量发展的实践探索》、“科普人才培养丛书”及《中国科幻发展年鉴2026》发布。
2026-09-21 09:16
北京大学第三医院运动医学科副主任医师刘振龙对此给出了一个基本判断:“AI+医生”人机协作模式的探索,将进一步推动AI技术与专业医疗服务的融合创新。今年5月,复旦大学附属中山医院“胸部一扫多查智能体”落地应用,处理病例已超250万例。
2026-09-21 09:15
记者20日从科技部获悉,2025年度全国科普统计数据显示,我国科普经费投入稳健增长,公共财政投入发挥引领作用,2025年全国科普工作经费筹集额达243.98亿元,比2024年增长9.8%。
2026-09-21 09:08
工业和信息化部近期印发《信息通信行业发展“十五五”规划》,提出到2030年,全面建成覆盖完善、性能领先的新一代通信网,为到2035年基本实现信息通信行业现代化奠定坚实基础。新一代通信网是以6G为代表的下一代通信基础设施,是通信、感知、计算、智能深度融合的全新网络形态。
2026-09-20 09:30
2026海洋合作发展论坛日前在山东青岛举办。论坛上发布的《中国海洋发展指数报告2026》显示,2025年中国海洋发展指数为132.3,比上年增长2.5%,海洋经济高质量发展稳步推进,海洋强国建设取得新成效。
2026-09-20 02:25
工业和信息化部、国家发展改革委等十部门18日发布《医药工业发展“十五五”规划》。规划提出,到2030年,生物医药研发应用稳居世界前列,创新驱动效能充分释放,重点领域关键核心技术实现系统性突破。
2026-09-20 02:35
加载更多