点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 我国加快绘就高水平科技自立自强新图景

  • 新春走基层|雪山密林间的家国守护

独家策划

推荐阅读
蓝天、绿林、碧水、清波……冬日的广东东莞松山湖科学城,温暖、惬意。
2026-02-09 10:00
这声呼唤,穿越漫长岁月,凝结着人类对这位地球近邻永恒的好奇与梦想。而今,随着新一轮探月热潮在全球兴起,这句“去月球”已不再仅仅是浪漫的诗意表达,更成为科技前沿竞相追逐、国家实力与创新精神交汇的生动实践。
2026-02-09 09:57
特种机器人技术与数智系统创新团队成员张平点击一键启动指令后,雷达驱动、定位算法、规划与控制算法等模块被加载。在系统支持下,无人机能够精准定位、自主导航与实时避障,像一位不知疲倦的巡检员。
2026-02-09 09:53
深耕西南高原山区二十余载,于富强与真菌为伴,在种质资源保护与产业富民之间架起桥梁,把论文写进泥土中,把科研做进农户的大棚里。3年间,于富强往返昆明与水城数十趟,硬是帮着水城从零起步,建成了食用菌研究所、日产50万袋的菌种厂和鲜菇冷链物流集散中心。
2026-02-09 09:53
研究团队将这一环境效应与黑洞双星轨道偏心率的演化同时纳入统一模型,并将理论预测与北美纳赫兹引力波天文台合作组15年的观测数据进行对比分析。陈一帆表示,尽管当前的不确定性仍然较大,但该研究已经表明,引力波观测开始携带关于星系中心环境的可测信息。
2026-02-09 09:53
近日,国家管网集团西部管道公司成功完成所辖新疆段天然气、原油、成品油管道输送全生命周期碳足迹核算,获得中国质量认证中心颁发的“产品碳足迹证书”。
2026-02-06 09:18
近日,中国农业科学院蔬菜花卉研究所蔬菜分子设计育种创新团队研发出新型植物基因研究工具——对目标DNA序列的邻近空间蛋白标记系统。
2026-02-06 09:38
因为像了解自己的孩子一样了解黑土地,韩晓增有个外号——“黑土地的营养搭配师”。他带领团队精心配制出一套营养搭配的“秘方”。
2026-02-06 09:33
蚊种与病毒之间存在高度匹配关系。1901年,公共卫生与热带医学领域先驱沃尔特·里德证明,蚊子是传播黄热病的元凶。科学界传统观点认为,病毒以颗粒形式在蚊子体内传播,却始终不知道真正的“病毒受体”是什么。
2026-02-06 09:31
科技创新和产业创新的深度融合,不仅是构建现代化产业体系的战略举措,更是贯彻新发展理念、推动高质量发展、加快构建新发展格局的重要抓手。
2026-02-06 09:13
2025年我国人均粮食占有量达到508.9公斤,远超国际公认的400公斤的安全线,粮食等重要农产品供给丰富、市场平稳、储备充足。
2026-02-05 10:15
一代代南来北往的科研“候鸟”安心在三亚当起了“留鸟”,南繁热土上,他们用坚守加速农业科研进程,守护着国家粮食安全的希望。
2026-02-05 10:06
工业和信息化部等八部门近日联合印发《汽车数据出境安全指引(2026版)》,推动建立高效便利安全的汽车数据跨境流动机制,提升汽车数据出境便利化水平。
2026-02-05 10:03
月球表面的年龄是揭示其演化奥秘的基础。对于月球上未采样的区域,科学家主要依靠统计撞击坑的密度来估算年龄:区域越古老,撞击坑通常越密集。
2026-02-06 09:14
近日,内蒙古大学化学化工学院刘健教授、王艳琴副教授团队在节能制绿氢联产高附加值化学品领域取得重大突破,在《自然》子刊发表研究成果。
2026-02-05 10:01
近日,四川达州宣汉县深层海相钾盐资源分采分运攻关实验配套装置顺利完成试车,成功提取出高纯度氯化钾产品。
2026-02-05 10:01
我国互联网事业的蓬勃发展,既为“十四五”收官交出了亮眼答卷,也为“十五五”布局奠定了坚实基础。
2026-02-05 10:12
L5点位于地球的“后方”,位于该点的人造探测器无需消耗太多燃料就可以稳定长期驻留,因此“羲和二号”的设计寿命将长达7年。
2026-02-04 09:13
《月令七十二候集解》记载:“立,建始也”,“立”即“开始”之意。那么,立春的“立”,意味着怎样的开始?
2026-02-04 09:34
寒冬腊月,新春的氛围已在市井烟火中渐渐浓厚。进入寒假的第7天,在位于青岛的山东科技大学土木工程与建筑学院办公室里,教授李为腾和研究生杨光辉正在讨论工作。
2026-02-04 09:27
加载更多