点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:人工智能“迎战”奥数难题
首页> 科技频道> 综合新闻 > 正文

人工智能“迎战”奥数难题

来源:科技日报2024-08-05 10:11

  IMO中的问题涵盖了多个数学领域。但大多数IMO问题都是用英语编写的,需要翻译成AI能理解和验证的编程语言,才能让AI进行机器学习。

  图片来源:《自然》网站

  【今日视点】

  继击败人类围棋大师和战略棋盘游戏顶尖高手之后,谷歌“深度思维”公司人工智能(AI)系统在英国巴斯举行的2024年国际数学奥林匹克竞赛(IMO)上,仅以1分之差与金牌失之交臂,获得了银牌。这是AI选手首次登上IMO领奖台。

  英国《自然》杂志网站在7月27日的报道中指出,“深度思维”正与其他公司竞相解决数学领域的疑难问题。近年来,IMO被广泛认为是对机器学习的一个挑战,也是衡量AI系统高级数学推理能力的理想基准。AI系统在今年IMO中的精彩表现,标志着其即将再下一城:在解决数学难题方面击败世界顶尖学生。

  首登领奖台

  “深度思维”公司训练了一个专门用于解答数学奥赛考题的AI系统,成功解答了6道竞赛题中的4道,获得28分(满分42分),达到本次比赛银牌获得者的水平。

  该系统包括解答数学推理问题的模型AlphaProof和解答几何问题的模型AlphaGeometry的升级版AlphaGeometry 2。其中,AlphaGeometry 2解决了一个几何问题,而AlphaProof则解答了两个代数问题和一个数论问题。

  今年1月份,AlphaGeometry在解决欧几里得几何问题上,就已表现出奖牌级选手的水平。在今年的IMO比赛前,AlphaGeometry 2已经能够解决过去25年里83%的IMO几何问题,而其“前身”仅能解决53%。

  “深度思维”公司AI科学副总裁普什米特·科利指出,这是AI系统首次达到获IMO奖牌级别的性能。IMO主席格雷戈尔·多利纳尔也表示,AI最终将能比人类更好地解决大多数数学问题,其进步速度令人惊叹。

  几乎同一时间,软件公司Numina的科学家使用语言模型,赢得了AI数学奥林匹克奖(AIMO)的首个“进步奖”。

  但Numina团队在获奖后表示,要解决更难的数学问题,仅靠语言模型可能还不够。

  与自己对抗

  AlphaProof是一个自学习系统,其核心创新在于结合预训练语言模型与AlphaZero强化学习算法的策略。强化学习是机器学习领域一种重要的学习范式,系统可通过多次尝试找到自己的解题方法。

  这种方法需要用AI能理解和验证的语言编写大量问题,而大多数IMO问题都是用英语编写的。为解决这个问题,“深度思维”团队托马斯·赫伯特及其同事使用谷歌的大语言模型Gemini,将这些问题翻译成一种名为Lean的编程语言,以供AI进行学习。

  AlphaProof使用经过微调的Gemini模型,自动将数学问题转换为Lean语言,从而创建了一个涵盖不同难度级别的大型问题库。在强化学习阶段,系统每验证一个证明,就用它来强化AlphaProof的语言模型,提高其解决后续更具挑战性问题的能力。

  赫伯特表示,在挑战围棋游戏时,他们也采用了类似的方法:AI通过与自己对抗,来学习如何更好地玩游戏。结果显示,在某些情况下,AlphaProof能够在无限多的可能性中迈出正确的一步,展现出“灵光一闪”的能力。

  仍有改进空间

  尽管AlphaProof的表现令人印象深刻,但其速度相对较慢,解决3个问题耗费了3天时间,而人类参赛者仅需4个半小时。此外,它也未能回答两个与组合数学有关的问题。

  英国数学家约瑟夫·迈尔斯审查了AI在本次IMO比赛中给出的答案。他指出,AlphaProof采取的这些技术能否予以完善还有待观察。

  英国伦敦数学科学研究所何杨辉称,AlphaProof这样的系统对于帮助数学家证明问题很有用,但它无法帮助研究人员确定需要解决和研究的问题。

  “深度思维”团队表示,他们正继续探索多种用于推进数学推理的AI方法。未来,数学研究者将与AI合作验证假说,尝试新方法来解决长期未解决的数学难题。他们也希望AlphaProof能够通过减少错误响应,帮助改进谷歌的大型语言模型。(记者 刘 霞)

[ 责编:焦子原 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 山东青岛举行海上巡游迎接中国航海日

  • 漫画视界|警惕虚假购物、服务类诈骗

独家策划

推荐阅读
防晒,究竟该如何掌握分寸,才能在抵御伤害与拥抱健康之间找到平衡点?
2025-07-11 09:58
生命只有一次,心脏健康不容忽视。唯有提高对心梗症状的警觉性,掌握正确的急救方法,才能为生命筑起一道坚实的“心”防线。
2025-07-11 09:58
晒后背是一种传统的养生方法,符合中医“冬病夏治”的理论,其核心在于借助盛夏充沛的自然阳气,通过阳光照射背部,来提升人体自身阳气。
2025-07-11 09:58
截至7月10日,我国“北气南下”能源大通道累计输气量突破1000亿立方米,安全平稳运行超2000天,标志着这条纵贯南北的能源大动脉在保障国家能源安全、推动绿色转型方面取得重大进展。
2025-07-11 04:55
从自然资源部新一轮找矿突破战略行动办公室了解到,今年上半年,全国新发现矿产地38处,同比增长31%;新发现矿产地中,大中型矿产地25处。
2025-07-11 04:10
时下,智能手机已成为人们获取信息、社交娱乐的重要工具。多学科专家指出,当我们刷手机出现注意力极度涣散、缺乏独立思考能力、情绪化反应严重、深度学习能力下降、空虚感增加等症状时,就表明我们的大脑正在被“腐蚀”。所谓的“脑腐”,即因长期暴露于碎片化信息而引发的认知衰退与脑功能损伤。
2025-07-11 04:10
由于肉眼很难发现水污染的情况,洪水之后饮水需要特别注意,避免直接饮用自来水、山泉水、河水、湖水等。肖丹提醒,如果不适症状较为严重,出现持续高热、剧烈呕吐、严重腹泻、脱水、意识障碍等,或皮肤干燥、眼窝凹陷、少尿等情况,应及时就医。
2025-07-10 09:34
国家自然科学基金委员会近日发布消息,自然科学基金委制定重大非共识项目试点实施方案,将在2025年启动资助试点。自然科学基金委作为我国资助基础研究的主渠道,制定了一系列创新举措。
2025-07-10 09:33
嫦娥六号月球样品的相关研究成果,引起了国际学术界的高度关注。这1935.3克宝贵的月壤,使得月球样品研究进入“嫦娥时代”,开启了人类认识月球的新纪元,也为中国月球研究走向世界前列奠定了基础。 一年来,中国科学家们已经利用嫦娥六号月球样品取得许多科学突破。
2025-07-10 09:32
2024年嫦娥六号任务首次从南极-艾特肯盆地内部采回月球样品,为揭示该区域物质成因提供了直接证据。综合元素和矿物组成分析,南极-艾特肯盆地镁环物质主要为斜长石(63%~67%)和低钙辉石(25%~27%)组成的亚铁苏长岩。
2025-07-10 09:32
7月9日,在北京航天城,神舟十九号航天员蔡旭哲(中)、宋令东(右)、王浩泽在记者见面会上敬礼致意。 在神舟十九号乘组中,航天员王浩泽也是一位90后,更成为首位进驻空间站的女航天飞行工程师。
2025-07-10 09:30
随着科技创新与产业创新深度融合,人工智能技术助力建材行业向更智能、更绿色、更高端方向变革。“通过数字化转型,建材企业可基本实现研发设计数字化、生产运营一体化、客户服务敏捷化,提升决策效率、协同能力和服务水平,快速提升生产力和核心竞争力。
2025-07-09 09:40
记者8日从湖南省自然资源厅获悉,通过创新地质找矿理论,经过长期勘探,湖南省郴州市临武县鸡脚山矿区已探获超大型蚀变花岗岩型锂矿床,共提交锂矿石量4.9亿吨,氧化锂资源量131万吨。
2025-07-09 09:39
根据国家卫生健康委8日晚间发布的通知,今后“颈深淋巴管/结—静脉吻合术”将不得应用于阿尔茨海默病治疗。“颈深淋巴管/结—静脉吻合术”是将颈部深层淋巴管或淋巴结与邻近的静脉进行吻合的手术,近年来部分医疗机构将其用于治疗阿尔茨海默病,引发争议。
2025-07-09 09:39
国家发展改革委、工业和信息化部、国家能源局日前发布《关于开展零碳园区建设的通知》。支持企业对标标杆水平和先进水平,实施节能降碳改造和用能设备更新,鼓励企业建设极致能效工厂、零碳工厂。
2025-07-09 09:37
近日,中国科学院近代物理研究所科研人员依托兰州重离子加速器冷却储存环,精确测量了极缺中子原子核硅-22的质量,实验发现硅-22的质子数14是一个新幻数。
2025-07-09 09:35
国家自然科学基金委员会7日发布消息,自然科学基金委近日制定重大非共识项目试点实施方案,将在2025年启动资助试点。
2025-07-08 09:20
近日,由农业农村部南京农业机械化研究所联合有关单位研制的全自动水稻覆膜插秧技术装备在江苏省靖江市投入使用,开启了我国水稻覆膜插秧新模式。
2025-07-08 09:11
日前,全球领先的720V高压固态钠盐电池,在位于内蒙古自治区鄂尔多斯市达拉特旗的建亨奥能科技有限公司正式量产,标志着中国成为全球第三个实现固态钠盐电池商用量产的国家。
2025-07-08 09:10
从国家自然科学基金委员会获悉,该委日前制定了重大非共识项目试点实施方案,将在2025年启动资助试点。
2025-07-08 05:05
加载更多