点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:AI机器人会考试,不会看病
首页> 科技频道> 综合新闻 > 正文

AI机器人会考试,不会看病

来源:中国科学报2025-01-07 09:57

  一项新研究发现,虽然先进的人工智能(AI)模型在专业医学考试中得分很高,但在通过与患者交谈从而诊断疾病方面仍然不及格。1月2日,相关研究成果发表于《自然-医学》。

  美国哈佛大学的Pranav Rajpurkar说:“虽然大型语言模型在测试中的表现令人印象深刻,但在动态对话中,它们的准确性明显下降,尤其是难以进行开放式诊断推理。”

  研究人员开发出一种方法,基于模拟医患对话评估“临床AI”模型的推理能力。这些“患者”基于2000个医疗案例。这些案例主要来自美国医学委员会的专业考试。

  同样来自哈佛大学的Shreya Johri说:“模拟医患互动可以评估病史采集技能,这是临床实践的一个关键组成部分。”她表示,新的评估基准被称为CRAFT-MD,“反映了现实生活中的情况,即患者可能不知道哪些细节是至关重要的,只有在回答特定问题时才会披露重要信息”。

  CRAFT-MD基准本身依赖于AI。美国OpenAI公司的GPT-4模型在与被测试的“临床AI”的对话中扮演了“患者AI”的角色。GPT-4还通过将“临床AI”的诊断结果与每个病例的正确答案进行比较来评分。人类医学专家对这些评估进行了复核。他们还审查了对话,以检查“患者AI”的准确性,并查看“临床AI”是否成功收集了相关的医疗信息。

  多项实验表明,4种领先的大型语言模型——OpenAI的GPT-3.5和GPT-4、美国Meta公司的Llama-2-7b和法国Mistral AI公司的Mistral-v2-7b,在基于对话的基准测试中的表现远不如根据书面摘要进行诊断时的表现。

  例如,当提供结构化的病例摘要并允许从多项答案中作出选择时,GPT-4的诊断准确率高达82%,而没有多项选择时,其诊断准确率则降至49%以下。然而,当它不得不通过与模拟的患者对话进行诊断时,准确率降至26%。

  在这项研究中,通常GPT-4是表现最好的模型,GPT-3.5次之,Mistral-v2-7b排在第三位,Llama-2-7b得分最低。

  AI模型在大多数情况下未能收集完整的病史,比如GPT-4仅在71%的模拟患者对话中做到了这一点。即使AI模型收集了患者的相关病史,它们也并不总是能够作出正确的诊断。

  美国斯克利普斯研究转化研究所的Eric Topol表示,模拟患者对话代表了一种比医学考试“更有用”的评估AI临床推理能力的方法。

  Rajpurkar说,即使一个AI模型最终通过了这一基准,能够根据模拟的患者对话持续作出准确诊断,也并不一定意味着它就优于人类医生。他指出,现实世界中的医疗实践比模拟的“更混乱”,涉及管理多名患者、与医疗团队协调、进行身体检查,以及了解当地医疗情况中“复杂的社会和系统因素”。“AI是支持临床工作的强大工具,但不一定能取代经验丰富的医生的整体判断。”Rajpurkar说。 (文乐乐)

  相关论文信息:

  https://doi.org/10.1038/s41591-024-03328-5

  《中国科学报》 (2025-01-07 第2版 国际)

[ 责编:李欣哲 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 天津百年大集热闹迎新春

  • 芳容初露 雪雕高手“冰城”秀技

独家策划

推荐阅读
过去一年,怀柔科学城进入“运行为主”新阶段。2025年,怀柔科学城将持续做好“科学、科学家、科学城”三篇文章,加速形成重大科技基础设施集群效应,“十三五”时期布局的29个设施平台将全部试运行。
2025-01-08 09:43
屈膝、下蹲、从托盘上稳稳夹起6公斤的物料箱平举至胸前,倒退、转身、小步走向左后侧的无人物流车拖车旁,精准对位,低头、屈膝、弯腰,将物料箱放在拖车上,然后转身回到托盘前,继续搬运……
2025-01-08 09:36
基础设施是城市的骨骼,是城市安全与发展的“生命线”。近日,中共中央办公厅、国务院办公厅印发《关于推进新型城市基础设施建设打造韧性城市的意见》明确提出,要“推进数字化、网络化、智能化新型城市基础设施建设”。
2025-01-08 09:35
天寒地冻的小寒时节,攀西大裂谷却是另一番景象。四川省攀枝花市攀枝花苏铁国家级自然保护区内阳光灿烂,中午的气温超过20摄氏度。
2025-01-08 09:31
1月7日,记者在2025年全国知识产权局局长会议上获悉,2024年我国知识产权量质齐升。国内发明专利有效量达到475.6万件,成为世界上首个突破400万件的国家。
2025-01-08 09:30
褚智勤团队联合香港大学教授林原、北京大学教授王琦、南方科技大学助理教授李携曦,开创了一种金刚石剥离技术,可获得超薄且超柔韧的金刚石膜——它就像一张纸一样可以卷起来。
2025-01-07 09:56
科技创新是引领经济社会高质量发展的第一动力。唯有高效、顺畅地推动科技成果转化,才能让知识资本真正成为发展的不竭动力。
2025-01-07 09:51
澳大利亚国立大学6日发布消息,该校研究人员领衔编撰的《2024年全球水监测报告》显示,2024年全球气温再创纪录,全球水循环出现变化,导致更多极端天气、严重洪水与干旱。
2025-01-07 09:50
安徽工业大学教授曾杰、教授刘明凯和中国科学技术大学副教授李洪良合作,验证了一种通过界面锚定策略精准调控单原子之间距离的通用方法。
2025-01-07 09:47
全球质量最高的现代栽培种甘蔗高度复杂基因组被绘制,为今后甘蔗功能基因的挖掘提供了重要基础性支撑。
2025-01-07 09:46
人工智能技术快速发展所掀起的澎湃汹涌浪潮,在深刻改变人的存在和生活方式,给人类带来极大便利的同时,也打破了传统人机关系的界限,给人类的存在和交往带来了新的伦理挑战和道德困境。
2025-01-06 02:50
在大浪淘沙的过程中,怎样让领先的科技成果及早被市场了解?怎样让实验室成果实现大规模量产?怎样让成熟的成果匹配到合适的企业?连接科研与市场两端的技术经理人被列入“十四五”紧缺人才开发目录,技术经理人队伍建设尤其令人关注。
2025-01-06 02:15
受日冕物质抛射活动影响,2025年新年第一天,即北京时间1月1日11时开始,到1月2日2时,地球出现明显地磁活动,其中1月1日23时至2日2时发生了全球地磁指数(Kp指数)为8的特大地磁暴。
2025-01-06 09:49
中国水稻研究所稻米质量安全评估创新团队通过系统分析我国十几年来稻米食味数据后发现,育种遗传改良、田间管理优化等措施不断改善提升我国稻米食味品质。
2025-01-06 09:48
聚变工程堆中心螺管系统的建成,不仅能为未来聚变堆提供良好的实验条件,同时也为低温、材料、凝聚态物理、超导应用等其他领域提供一流的大型测试平台。
2025-01-06 09:47
经过168小时满功率连续运行考核,全球最大华龙一号核电基地、由中核集团旗下中国核电投资控股的漳州核电1号机组正式投入商业运行,标志着华龙一号批量化建设取得重大进展。
2025-01-03 09:31
社交网络的去中心化推动着信息平权,使人人都有麦克风。但这并不意味着人们可以发布虚假错误的信息。科普信息的发布与传播不能被流量为王和眼球效应所裹挟,而应坚持科学性、合法性。
2025-01-03 09:27
记者2日从中铁(上海)投资集团有限公司(以下简称“中铁上投”)了解到,全球首台高压射流—机械联合破岩盾构机“山大号”于近日在济南轨道交通6号线东仓站始发。
2025-01-03 09:22
当下,人工智能的火热让人们对其有了深刻的体会。尽管许多人并不完全了解人工智能的工作原理,但一提起人工智能,自动驾驶汽车、智能交互机器人、机器狗、无人机等已广为人知的应用便浮现在人们脑海中。
2025-01-03 09:19
实现高质量发展要靠科技创新培育新动能。如期全面建成社会主义现代化强国关键看高水平科技自立自强,进一步全面深化改革、推进中国式现代化必须大力推进科技创新。
2025-01-03 09:18
加载更多