点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 壶口瀑布迎来暑期旅游高峰

  • 浙江舟山:东海开渔 千帆出海

独家策划

推荐阅读
极端天气正在深刻影响各国民众的生活选择,而中国的绿色产品正在其中扮演越来越关键的角色。
2026-08-12 10:23
近日,山东省青岛市首家机器人6S体验店开业,吸引众多消费者前来参观体验。
2026-08-12 10:21
近日,中国科学院南京地质古生物研究所晚古生代研究团队副研究员要乐、王秋来与中国科学院青藏高原研究所副研究员魏强合作,首次系统揭示了地球倒数第二次大冰期的完整过程与机制。
2026-08-12 10:20
北京大学周丰教授、王旭辉研究员团队揭示极端高温影响水稻产量的新机制,相关成果于近日发表。
2026-08-12 10:16
增强科技创新体系化攻关能力,就是要以系统思维统筹国家创新体系的各类主体、各个环节、各项要素,构建安全可控、高效协同、良性循环的创新生态,提升国家创新体系整体效能。
2026-08-12 09:59
如果一个人童年时曾遭遇不幸和逆境,常让他在成年后面对风浪时,更容易陷入焦虑、抑郁等情绪障碍。目前,人们还没有能治疗童年逆境对大脑深远影响的办法,其中一个重要原因,就是过去没弄清背后的分子机制。
2026-08-11 09:41
日前发布的《加快农业农村现代化“十五五”规划》,将粮食综合生产能力确定为约束性指标,明确提出粮食综合生产能力从2025年的1.39万亿斤,提升到2030年的1.45万亿斤左右。在汶上县,2025年粮食种植面积稳定在150万亩、产量超过14亿斤;今年小麦平均亩产581.5公斤,眼下秋粮玉米长势喜人。
2026-08-11 09:39
氢能是一种来源丰富、绿色低碳、应用广泛的二次能源。氢能能量密度大,在长距离运输上有优势,被应用于公交客运、冷链运输、干线物流等场景。依托国家氢能示范城市群政策牵引,截至2025年底,我国氢燃料电池汽车累计销量近4万辆,氢燃料电池应用场景向矿卡、船舶、无人机、轨道交通等延伸。
2026-08-11 09:35
5月4日,人们在浙江省杭州市文三数字生活街区的AI黑科技市集上体验DeepSeek(深度求索)的人工智能大模型。从东南亚的政务服务到中东的能源行业,从欧美的初创企业到拉美的电商平台,中国大模型正在用实实在在的能力赢得全球用户的信赖。
2026-08-11 09:31
今年4月,上海极地考察国内基地,中国极地研究中心(中国极地研究所)极地船舶管理中心主任赵炎平望着完成考察任务的“雪龙”号,嘴角微微上扬,脸上洋溢着笑容。系统正式投运那一刻,孙宏斌说自己“很激动”,因为我国极地科考告别了40年的柴油依赖,率先迈入绿色能源新纪元。
2026-08-11 09:26
研究团队在实验室造了一个微型“知识世界”:图片是节点,关联概率是连线——像城市路网,有的路口四通八达,有的只有羊肠小道。罗欢说:“这意味着,那短短的先期接触,已经在大脑中搭起了一副以核心结构为支撑的压缩骨架。
2026-08-11 09:25
望远镜建起来后,让它们高效、智能、持续地产出高质量数据及成果,才是真正的挑战。而这道题的关键解法,就是人工智能。
2026-08-10 09:58
中国环流三号装置升级改造项目低温系统罐区14台大型储罐日前全部安装就位,标志着核聚变研究从零散单点技术攻关正式跨入多系统协同集成的工程化新阶段。
2026-08-10 09:57
近年来,我国加快布局空、海、潜一体化智能装备体系,构建起全域覆盖、自主可控的海洋立体安防网络,为海洋产业高质量发展筑牢安全屏障。
2026-08-10 09:55
当前,分散化、碎片化的创新模式已无法适应高水平科技自立自强的新要求,必须加快构建支持全面创新的体制机制,为发展新质生产力、确保2035年进入创新型国家前列提供澎湃动能。
2026-08-10 09:51
通用人工智能是人工智能发展的技术初心和前沿,是引领智能革命、重塑国家竞争力的战略制高点。新征程上,我们应勇担使命,积极探寻实现通用人工智能的中国道路。
2026-08-10 09:49
这不只是一幅地质图,还是一套中国自主的图例标准。
2026-08-07 09:48
最近不少“中国神器”在全球刷屏。这些出圈的国货新品,早已摆脱低端代工、低价走量的旧标签,折射出中国制造的创新迭代与品质跃升。国货新品不断出圈、新产业蓬勃发展的背后,是中国制造的硬核实力。
2026-08-07 09:47
今年7月,国家药监局批准全球首个选择性食欲素2型受体激动剂上市,用于治疗16岁及以上青少年和成人1型发作性睡病。5月,恒瑞医药与百时美施贵宝达成新药授权合作,确定性付款9.5亿美元……今年以来,我国新药的好消息不断。
2026-08-07 09:47
在数据要素赋能方面,2025年国家数据局发布了100个公共数据“跑起来”示范场景,联合19个部门组织举办2025年“数据要素×”大赛并发布241个典型案例。
2026-08-07 09:46
加载更多