点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • “月季花环”扮靓初夏北京

  • 宁夏贺兰:冷凉蔬菜迎丰收

独家策划

推荐阅读
从日前闭幕的第九届数字中国建设峰会可以看出,我国人工智能技术已迈过能聊天、拼参数的初级阶段,进入会干活、有价值的跃升期。好用,既是用户体验的直观标尺,也是我国人工智能从技术跟跑到创新引领、从规模扩张转向质量提升的关键抓手。
2026-05-08 09:14
4月23日,100多家仪器企业带着自己的拳头产品,参加第十九届中国科学仪器发展年会。一个是以技术创新切入的初创企业,一个是深耕多年的国产老牌厂商,纳析科技和海能技术的实践,正是国产科学仪器企业不断向上突破的缩影。
2026-05-08 09:14
记者日前从中国科学技术大学获悉:近日,该校郭光灿院士团队在实用化量子密钥分发研究方面取得重要进展。团队突破量子态制备和单光子探测技术在高速、高信噪比和集成度方面相互制约的难题,首次利用半导体单光子探测器,实现了超越超导探测系统的安全密钥率纪录。
2026-05-08 09:13
由该校基础医学院教授侯宇领衔的研究团队,首次破解多聚蛋白1在白血病干细胞中驱动免疫逃逸与自我更新的全新机制,
2026-05-08 04:35
这还是那个荒凉的沙漠吗?晴空丽日,10万株玫瑰竞相绽放,花瓣层层叠叠,点缀在沙海边缘。微风拂过,淡淡花香扑面而来……
2026-05-08 04:35
儿童科学本质教育在科学教育中有着举足轻重的作用,发展科学本质观是科学教育的核心目标之一。
2026-05-07 05:35
面对现实世界中日益复杂的预测需求,科研人员围绕大模型预测技术,走出了两大核心主线、四种具体技术路径。
2026-05-07 05:35
人工智能是德国提升国家科技创新能力、竞逐全球科技产业高点的关键领域。
2026-05-07 05:35
该校邢立达课题组与河北省区域地质调查院合作,对河北宣化土城子组两个新的恐龙足迹点展开研究,记录下该地层迄今最慢的兽脚类恐龙行迹,
2026-05-07 06:00
大型体育赛事最令人头痛的当属“最后一公里”:车停到哪里最方便?从哪个入口进场最快捷?如今,这一状况正在改变。
2026-05-07 06:00
在刚刚过去的“五一”假期,“科技游”成为了众多游客的选择。辽宁沈阳航空科技馆则以大量模拟试飞游戏,让孩子们在玩乐中感知复杂的航空技术原理。当技术赋能的展陈体验成为标配,制度与运营模式的创新则为科技馆开辟了新的增长空间。
2026-05-06 09:13
光明日报西安5月5日电 记者李洁、张哲浩5日从中国科学院地球环境研究所获悉,该所联合国内外多家科研机构进行系统研究,提出土壤温度变化是东亚新石器时代粟作农业时空演化的重要调控因素。
2026-05-06 09:10
”日前,中国科学院院士、国家卫生健康委副主任曾益新在“高原重大心肺脑疾病预警关键技术与防治策略研究”项目启动会上表示。曾益新表示,该项目聚焦发病机制、易感人群识别、精准干预、治疗方案四大核心方向,其中发病机制研究是所有工作的基础。
2026-05-06 09:09
为此研究团队开发出纳米高熵陶瓷涂层,集防结焦、耐高温腐蚀、高导热于一体,还能降低煤耗。基于光谱学科基础,研究团队把“吸热”的思路反过来,开发了辐射制冷涂层。以吸热器表面的高温太阳能吸热材料为例,这种关键光学材料一旦断供,国内光热电站将陷入被动。
2026-05-06 09:08
联合国教科文组织5日发布《量子时刻:国际量子科学技术年成果全球报告》,首次对2025年国际量子科学技术年进行了全面评估。
2026-05-06 09:01
董耀会的理想是在全国的长城沿线开发出一万个村,把长城沿线的优质农产品卖到世界各地。
2026-05-02 08:15
习近平总书记强调,要以更大力度、更实举措加强基础研究,提升我国原始创新能力,进一步打牢科技强国建设根基。
2026-05-01 18:40
加强基础研究,建设科技强国的必由之路。
2026-04-30 16:22
“AI投毒”“控评”“互踩”“人肉”“开盒”“算法黑箱”……AI时代,面对这些媒介乱象,该如何约束?
2026-04-30 09:02
近日,国家市场监管总局与教育部联合发布全国首批“专业与标准化教育融合试点单位”名单,位于江苏苏州太仓市的苏州健雄职业技术学院入选。如今,苏州健雄职业技术学院立足太仓“德企之乡”的实际需求,建校20余年来为太仓560余家德企直接输送技能人才或提供相关培训。
2026-04-30 08:59
加载更多