点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 中国呼吁推动小堆创新 加强全球核能合作

  • 全球人工智能伦理论坛探讨伦理原则落地实施

独家策划

推荐阅读
据了解,该隧道盾构段长约2.9公里,采用双洞双层结构设计。如此“大块头”的装备,推进系统配置了液压浮动支撑装置,同时还配备了高精度导向系统与管片选型系统,共同保障盾构机轻巧拐弯。
2026-09-16 10:38
当前,一场以可再生能源替代化石能源、以电动汽车替代燃油车为核心的能源革命正席卷全球。车网互动的本质,是将电动汽车从单纯的“负荷”转化为兼具“负荷”与“电源”双重属性的移动储能单元。
2026-09-16 10:38
从持续性看,这些劣质、虚假或错误的信息,不只占据当下受众的注意力,还会变成AI训练的语料,形成自我循环。使清朗网络空间成为可感可及的常态,还要立足于人机协同,同步提升全社会的信息素养和核查效率。
2026-09-16 10:37
近日,南方科技大学地球与空间科学系副教授范斯腾与合作者在火星大气环流及物质输运研究方面取得重要进展。火星上的物质输运通常主要沿着平均环流进行,这与地球根本不同,后者的大气输运主要受涡流主导。
2026-09-16 10:39
艺术家描绘了星团潮汐尾上的脉冲星和接力观测的三组望远镜。此后,随着星团内部动力学演化和银河系潮汐作用持续改变成员轨道,一部分中子星会逐渐进入潮汐尾,最终脱离星团。近一个世纪后,星团潮汐尾上的这颗脉冲星,使巴德开启的两条科学线索在一个具体天体上交汇。
2026-09-16 10:39
今年入夏以来,西北太平洋与南海海域的台风仿佛开启了“流水线”模式,接连生成、登陆,引发社会广泛关注。
2026-09-15 09:35
气候变化可能进一步改变全球极端降雨、洪水和季风过程,短期水文事件对陆地塑料向河流和海洋输送的影响也可能随之变化。厘清这种“脉冲式”污染输送机制,有助于提高全球海洋塑料污染预测的准确性,并为更具针对性的塑料污染治理提供科学依据。
2026-09-15 09:27
错坚河冰崩发生点和下游传输侵蚀通道。研究指出,气候变暖背景下,喜马拉雅山地区的冰冻圈灾害正呈现频次增加与链式放大的复合态势。研究指出,此次冰崩与气候变暖影响下冰裂隙扩张、从冰面向冰内和冰床排水加剧直接相关。
2026-09-15 09:26
记者从国家药监局了解到,我国第三个脑机接口医疗器械标准于14日被批准发布。据悉,为了支持我国脑机接口医疗器械重大创新、满足产业发展急需,国家药监局采用快速程序立项和批准。
2026-09-15 09:23
工科学习与研究强调实践牵引、逻辑思维和科学方法,解决问题更是落脚点——学生可以借助AI,但不能被AI替代。工科学习,不仅是吸收知识的过程,更是应用理论、方法和工具提升学生解决工程实践问题的能力的过程。
2026-09-15 09:25
拍卖会是全国优质种公牛资源展示的舞台。与华西牛同台竞争的,不乏安格斯、西门塔尔等国内外优质牛,可近4届“标王”无一例外都花落华西牛。
2026-09-14 09:26
甲烷的“存在感”远不及二氧化碳,但增温效应不容小觑。有研究认为湖泊贡献了全球自然甲烷排放的75%,也有测算认为占比不足两成。但实际排放多少、国际模型是否适用于我国,长期缺乏本土实测验证。
2026-09-14 09:25
位于今青海省海西州格尔木市南部的布尔汗布达山山体,是当代地质学界、地理学界公认的东昆仑主干,也是青藏公路、青藏铁路的关键地标——昆仑山口所在地。
2026-09-14 09:14
近日,记者从吉林大学获悉,该校生物考古实验室在全球首次完成已灭绝古生物奥氏马的完整形态复原。
2026-09-14 09:15
2026年国家网络安全宣传周期间,光明网联合科普中国推出AI科技伦理系列科普视频,引导公众理性认知技术逻辑,秉持算法向善理念,共建网络安全生态。
2026-09-14 09:15
实现人的自由全面发展,是人工智能伦理治理的逻辑起点与价值原点。
2026-09-11 08:42
2019年,一场生态修复让一个古人类遗址——云南蝙蝠洞遗址浮出水面。之后,多支科研团队开展跨学科综合研究,让丹尼索瓦人在中国西南腹地缺失的关键地理拼图得以补充。
2026-09-11 08:51
在位于内蒙古自治区呼和浩特市和林格尔新区的人才创新谷,工作人员操作和林格尔数据中心集群多云算力资源监测与调度平台,实时监测、动态调度算力资源。
2026-09-11 09:10
人类全基因组约30亿个碱基对中,仅1%—2%编码蛋白质,其余包含不编码的“垃圾DNA”及控制基因表达时间、位置和强度的调控序列。
2026-09-11 09:07
8月也是非极地海域有记录以来最温暖的一个月。海表温度峰值达21.1℃,是有观测以来最高的海表温度。
2026-09-11 08:51
加载更多