点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 北京中学生演绎《呐喊》《茶馆》

  • 美丽中国丨邂逅洱海的夏日时光

独家策划

推荐阅读
5月29日,中央宣传部、中国科协发布“最美科技工作者”,四川大学华西临床医学院副院长,华西医院神经内科主任医师、教授陈蕾入选。
2026-06-03 10:26
瑞士苏黎世联邦理工学院研究团队开发出一种由干细胞和磁电纳米颗粒组成的“细胞机器人”。
2026-06-03 10:24
生态环境部日前印发《海湾清洁指数评价技术方法(试行)》,旨在建立统一规范的海洋垃圾清洁程度量化评估与分级标准,推动沿海地方精准识别问题短板,压实所辖海湾的海洋垃圾治理责任,为“十五五”时期海洋垃圾治理提供重要支撑。
2026-06-03 10:21
近期,国务院印发《加快农业农村现代化“十五五”规划》(以下简称《规划》)。日前,农业农村部、国家发展改革委负责人就《规划》有关情况进行了解读。
2026-06-03 10:20
对于处于科技追赶阶段的经济体而言,基础研究投入不只是解决原创突破的问题,也是形成技术理解力、知识翻译力和产业吸纳力的必要条件。
2026-06-03 10:14
6月1日,漳州核电4号机组核岛反应堆厂房堆腔换料水池模块吊装成功,为后续核岛主线关键路径施工奠定坚实基础。
2026-06-02 10:03
1日,2026年全国粮食和物资储备科技活动周在湖北武汉启动。今年科技活动周的主题是“奋进‘十五五’ 科技护粮储”,活动发布了“十四五”期间我国粮食和物资储备领域132项优秀科技成果、应用案例。
2026-06-02 09:51
全球约有2.5亿乙肝病毒感染者,多数需要长期甚至终身服药,难以彻底停药。当病毒入侵人体细胞时,它首先要“刷卡进门”——结合细胞膜上的特定受体蛋白,才能进入细胞内部。
2026-06-02 09:48
6月1日,长征十二号乙遥一运载火箭在东风商业航天创新试验区中国商火研试发射工位点火升空,成功将千帆星座第十批组网卫星送入预定轨道,首飞任务取得圆满成功。
2026-06-02 09:46
近日,中国民航局新增内设机构低空安全司,机构职责包括起草低空民航发展规划、统筹低空安全与发展、建设低空飞行服务调度平台和低空飞行服务站体系等。这是继2024年12月国家发展改革委成立低空经济发展司之后,国家成立的第二个低空概念管理机构,与低空经济发展有着不可分割的联系。
2026-06-02 09:43
生态环境部近日联合教育部等11个部门和单位发布《中国噪声污染防治报告(2026)》。这位负责人表示,生态环境部为此持续开展噪声治理“千件万户”投诉典型案件调度,推动解决了一批群众反映强烈的噪声问题。
2026-06-01 09:55
习近平总书记深刻指出,中国式现代化要靠科技现代化作支撑,实现高质量发展要靠科技创新培育新动能。生产线上,一批核心技术加速突破,为产业升级注入强劲动能……  习近平总书记强调,实现高水平科技自立自强,是中国式现代化建设的关键。
2026-06-01 09:55
作为全球海洋科技领域最具权威性与影响力的学术盛会,已创办近60年的国际海洋技术大会,一直被誉为全球海洋科技界的“风向标”与“孵化器”。”5月27日上午,中国科学院深海科学与工程研究所副所长彭晓彤汇报由中国科学家主导的国际合作“全球深渊探索计划(GHEP)”。
2026-06-01 09:54
6月1日,由工业和信息化部批准发布的《YD/T 6770—2026 人工智能 关键基础技术 具身智能基准测试方法》正式实施,标志着具身智能评测迈入“有标可依”的新阶段。不仅如此,《人形机器人 全生命周期管理规范》标准也于近期发布,通过“一机一码”,确保产品可进行全链条管理。
2026-06-01 09:54
1975年3月27日,远在大洋彼岸的杨振宁提笔给当时的复旦大学数学系教师谷超豪写了一封信。1975年9月,谷超豪、杨振宁联合署名,在《中国科学》上发表了论文《规范场理论的若干问题》。
2026-06-01 09:54
记者从农业农村部获悉,截至5月28日17时,各地已收夏粮小麦4897万亩、当日机收面积超过1000万亩,今年全国“三夏”大规模小麦机收全面展开。
2026-05-29 09:11
垦利10-2油田位于渤海南部海域,探明原油地质储量超1亿吨,是渤海湾盆地凹陷带浅层发现的首个亿吨级岩性油田。中国海油天津公司工程技术作业中心相关负责人介绍:“垦利10-2油田钻完井作业面临井型多、层系多、开发方式多等‘三多’难点。
2026-05-29 09:09
早上8时许,四川省南充市高坪区走马镇姜家祠村村民姜萧将孩子送到村委会“农忙托管班”。为解决农忙季小孩看护缺位问题,姜家祠村因地制宜开设季节性公益“农忙托管班”,为村内适龄儿童提供免费集中托管服务。
2026-05-29 09:06
中国卫星导航定位协会近日发布《2026中国北斗时空产业发展白皮书》。所谓“北斗时空产业”,是以北斗卫星导航系统为核心,深度融合遥感地理信息、移动通信等多种技术手段的综合性产业体系。
2026-05-29 09:02
据中国载人航天工程办公室消息,神舟二十一号和神舟二十三号航天员乘组于28日进行交接仪式,两个乘组移交了中国空间站的钥匙。
2026-05-29 08:52
加载更多