点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 锦绣初冬

  • “世界市长对话·南京”举行 共话滨水城市未来

独家策划

推荐阅读
2025年度“十大”科普热词从科技、文化、社会等维度,综合勾勒出2025年我国科普事业发展、科技前沿动态、科学传播与社会文化融合的整体态势和核心方向。
2025-11-21 15:11
枫清科技与麒麟软件达成战略合作,双方将围绕AI技术创新、产品研发、市场拓展等方面开展深度合作,共同推动信创产业生态的完善与发展。
2025-11-21 13:13
走进国家重要野生植物种质资源库辰山中心种子冷库,零下20摄氏度的寒气扑面而来,一排排整齐编号的收纳容器中,是进入“深度睡眠”状态的各类野生植物种子。
2025-11-21 09:53
小雪时节,容易发生感冒、皮肤干燥、关节疼痛及咳嗽等不适,大多因为寒燥外袭、津液失调。
2025-11-21 09:52
当前,关于精神疾病与心理治疗,公众还有哪些常见误解?带着这些问题,本报记者采访了北京安定医院多位专家。
2025-11-21 09:49
2023年11月,“天衍”量子计算云平台正式发布,截至目前,访问量已突破3700万次,覆盖海内外60多个国家和地区的用户,实验任务数超过270万个。
2025-11-21 09:47
20日,记者从南京大学获悉,该校沈树忠院士团队的侯金波博士等人记录了湖北省通山县一处距今约5.4亿年的埃迪卡拉纪化石宝库,并将其命名为“通山特异埋藏化石库”。
2025-11-21 09:38
完成第一阶段6G技术试验,形成超过300项关键技术储备,资本加速布局6G生态……尽管6G网络预计将在2030年开始部署,但我国6G产业布局正加速铺开,呈现政策护航、技术攻坚、资本活跃的特征。
2025-11-20 09:11
谷山梁3吉瓦/12.8吉瓦时储能电站项目建成后,每年预计可向电网输送36亿千瓦时的清洁能源电力。“独立新型储能电站放电时为发电企业,充电时视同电力用户,电网的峰谷电价价差形成利润空间,吸引企业投身于此。
2025-11-20 09:11
中国第一辆蒸汽机车就诞生在我的家乡唐山。我为之骄傲。为此,大学学习机械制造与设计专业的我,毕业后,就一头扎进轨道交通检测设备研发领域。
2025-11-20 04:25
常有人说,发动机是火箭的“心脏”。而我从事的工作是,液体火箭发动机推力燃烧系统高精密产品的生产加工,所以大家都叫我“火箭心脏钻刻师”。
2025-11-20 04:25
四川全口径外送电量已超1.9万亿千瓦时。这一规模相当于江苏、浙江、安徽三省全年用电量之和,标志着四川落实“西电东送”能源战略取得丰硕成果,
2025-11-20 04:25
大国重器又传好消息!江门中微子实验(JUNO)装置建成运行仅两个月,就取得首个物理成果——测量太阳中微子振荡参数,结果比此前实验的最好精度提升了1.5~1.8倍。
2025-11-20 04:35
为促进卫星导航定位产业有序发展,维护国家地理信息安全,我国将对卫星导航定位基准站实行统一规划、统一标准、统一监管。针对目前基准站重复建设、存在数据安全隐患等主要问题,办法规定自然资源部会同有关部门制定全国基准站建设布局规划。
2025-11-19 09:52
18日,我国首个配置冷却塔的“华龙一号”核电机组——中广核山东招远核电项目1号机组顺利完成核岛第一罐混凝土浇筑,标志着该项目一期工程建设全面启动。
2025-11-19 09:51
2020年至2024年间,全球光热发电装机年复合增长率为4.24%,我国同期增长率达11.7%,显著高于全球水平;技术装备国产化率突破95%,释放出产业加速发展的强劲信号。
2025-11-19 05:35
科技创新、科学普及是实现创新发展的两翼,科普与科技创新“同等重要”。
2025-11-19 05:55
日前,由清华大学产业发展与环境治理研究中心和自然科研智讯联合编制的《国际科技创新中心指数2025》报告正式发布。
2025-11-19 05:55
新疆的孩子们在“流动科学课”上被磁悬浮演示、机器人互动、矿物标本展示等吸引了目光;甘肃张掖的科技工作者为大伙儿演示经典科普实验“火焰掌”;上海的科学家们踏上科技节的红地毯赢得公众的掌声……这些生动场景共同勾勒出“十四五”期间我国科普事业的发展印记。
2025-11-19 05:55
如今,在学习中遇到问题可以问人工智能,写作业也可以用人工智能辅助查询信息。正如这名同学所言,生成式人工智能正改变传统的以知识积累和传递为中心的教学模式。
2025-11-18 10:28
加载更多