点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:人工智能“迎战”奥数难题
首页> 科技频道> 综合新闻 > 正文

人工智能“迎战”奥数难题

来源:科技日报2024-08-05 10:11

  IMO中的问题涵盖了多个数学领域。但大多数IMO问题都是用英语编写的,需要翻译成AI能理解和验证的编程语言,才能让AI进行机器学习。

  图片来源:《自然》网站

  【今日视点】

  继击败人类围棋大师和战略棋盘游戏顶尖高手之后,谷歌“深度思维”公司人工智能(AI)系统在英国巴斯举行的2024年国际数学奥林匹克竞赛(IMO)上,仅以1分之差与金牌失之交臂,获得了银牌。这是AI选手首次登上IMO领奖台。

  英国《自然》杂志网站在7月27日的报道中指出,“深度思维”正与其他公司竞相解决数学领域的疑难问题。近年来,IMO被广泛认为是对机器学习的一个挑战,也是衡量AI系统高级数学推理能力的理想基准。AI系统在今年IMO中的精彩表现,标志着其即将再下一城:在解决数学难题方面击败世界顶尖学生。

  首登领奖台

  “深度思维”公司训练了一个专门用于解答数学奥赛考题的AI系统,成功解答了6道竞赛题中的4道,获得28分(满分42分),达到本次比赛银牌获得者的水平。

  该系统包括解答数学推理问题的模型AlphaProof和解答几何问题的模型AlphaGeometry的升级版AlphaGeometry 2。其中,AlphaGeometry 2解决了一个几何问题,而AlphaProof则解答了两个代数问题和一个数论问题。

  今年1月份,AlphaGeometry在解决欧几里得几何问题上,就已表现出奖牌级选手的水平。在今年的IMO比赛前,AlphaGeometry 2已经能够解决过去25年里83%的IMO几何问题,而其“前身”仅能解决53%。

  “深度思维”公司AI科学副总裁普什米特·科利指出,这是AI系统首次达到获IMO奖牌级别的性能。IMO主席格雷戈尔·多利纳尔也表示,AI最终将能比人类更好地解决大多数数学问题,其进步速度令人惊叹。

  几乎同一时间,软件公司Numina的科学家使用语言模型,赢得了AI数学奥林匹克奖(AIMO)的首个“进步奖”。

  但Numina团队在获奖后表示,要解决更难的数学问题,仅靠语言模型可能还不够。

  与自己对抗

  AlphaProof是一个自学习系统,其核心创新在于结合预训练语言模型与AlphaZero强化学习算法的策略。强化学习是机器学习领域一种重要的学习范式,系统可通过多次尝试找到自己的解题方法。

  这种方法需要用AI能理解和验证的语言编写大量问题,而大多数IMO问题都是用英语编写的。为解决这个问题,“深度思维”团队托马斯·赫伯特及其同事使用谷歌的大语言模型Gemini,将这些问题翻译成一种名为Lean的编程语言,以供AI进行学习。

  AlphaProof使用经过微调的Gemini模型,自动将数学问题转换为Lean语言,从而创建了一个涵盖不同难度级别的大型问题库。在强化学习阶段,系统每验证一个证明,就用它来强化AlphaProof的语言模型,提高其解决后续更具挑战性问题的能力。

  赫伯特表示,在挑战围棋游戏时,他们也采用了类似的方法:AI通过与自己对抗,来学习如何更好地玩游戏。结果显示,在某些情况下,AlphaProof能够在无限多的可能性中迈出正确的一步,展现出“灵光一闪”的能力。

  仍有改进空间

  尽管AlphaProof的表现令人印象深刻,但其速度相对较慢,解决3个问题耗费了3天时间,而人类参赛者仅需4个半小时。此外,它也未能回答两个与组合数学有关的问题。

  英国数学家约瑟夫·迈尔斯审查了AI在本次IMO比赛中给出的答案。他指出,AlphaProof采取的这些技术能否予以完善还有待观察。

  英国伦敦数学科学研究所何杨辉称,AlphaProof这样的系统对于帮助数学家证明问题很有用,但它无法帮助研究人员确定需要解决和研究的问题。

  “深度思维”团队表示,他们正继续探索多种用于推进数学推理的AI方法。未来,数学研究者将与AI合作验证假说,尝试新方法来解决长期未解决的数学难题。他们也希望AlphaProof能够通过减少错误响应,帮助改进谷歌的大型语言模型。(记者 刘 霞)

[ 责编:焦子原 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 锦绣初冬

  • “世界市长对话·南京”举行 共话滨水城市未来

独家策划

推荐阅读
2025年度“十大”科普热词从科技、文化、社会等维度,综合勾勒出2025年我国科普事业发展、科技前沿动态、科学传播与社会文化融合的整体态势和核心方向。
2025-11-21 15:11
枫清科技与麒麟软件达成战略合作,双方将围绕AI技术创新、产品研发、市场拓展等方面开展深度合作,共同推动信创产业生态的完善与发展。
2025-11-21 13:13
走进国家重要野生植物种质资源库辰山中心种子冷库,零下20摄氏度的寒气扑面而来,一排排整齐编号的收纳容器中,是进入“深度睡眠”状态的各类野生植物种子。
2025-11-21 09:53
小雪时节,容易发生感冒、皮肤干燥、关节疼痛及咳嗽等不适,大多因为寒燥外袭、津液失调。
2025-11-21 09:52
当前,关于精神疾病与心理治疗,公众还有哪些常见误解?带着这些问题,本报记者采访了北京安定医院多位专家。
2025-11-21 09:49
2023年11月,“天衍”量子计算云平台正式发布,截至目前,访问量已突破3700万次,覆盖海内外60多个国家和地区的用户,实验任务数超过270万个。
2025-11-21 09:47
20日,记者从南京大学获悉,该校沈树忠院士团队的侯金波博士等人记录了湖北省通山县一处距今约5.4亿年的埃迪卡拉纪化石宝库,并将其命名为“通山特异埋藏化石库”。
2025-11-21 09:38
完成第一阶段6G技术试验,形成超过300项关键技术储备,资本加速布局6G生态……尽管6G网络预计将在2030年开始部署,但我国6G产业布局正加速铺开,呈现政策护航、技术攻坚、资本活跃的特征。
2025-11-20 09:11
谷山梁3吉瓦/12.8吉瓦时储能电站项目建成后,每年预计可向电网输送36亿千瓦时的清洁能源电力。“独立新型储能电站放电时为发电企业,充电时视同电力用户,电网的峰谷电价价差形成利润空间,吸引企业投身于此。
2025-11-20 09:11
中国第一辆蒸汽机车就诞生在我的家乡唐山。我为之骄傲。为此,大学学习机械制造与设计专业的我,毕业后,就一头扎进轨道交通检测设备研发领域。
2025-11-20 04:25
常有人说,发动机是火箭的“心脏”。而我从事的工作是,液体火箭发动机推力燃烧系统高精密产品的生产加工,所以大家都叫我“火箭心脏钻刻师”。
2025-11-20 04:25
四川全口径外送电量已超1.9万亿千瓦时。这一规模相当于江苏、浙江、安徽三省全年用电量之和,标志着四川落实“西电东送”能源战略取得丰硕成果,
2025-11-20 04:25
大国重器又传好消息!江门中微子实验(JUNO)装置建成运行仅两个月,就取得首个物理成果——测量太阳中微子振荡参数,结果比此前实验的最好精度提升了1.5~1.8倍。
2025-11-20 04:35
为促进卫星导航定位产业有序发展,维护国家地理信息安全,我国将对卫星导航定位基准站实行统一规划、统一标准、统一监管。针对目前基准站重复建设、存在数据安全隐患等主要问题,办法规定自然资源部会同有关部门制定全国基准站建设布局规划。
2025-11-19 09:52
18日,我国首个配置冷却塔的“华龙一号”核电机组——中广核山东招远核电项目1号机组顺利完成核岛第一罐混凝土浇筑,标志着该项目一期工程建设全面启动。
2025-11-19 09:51
2020年至2024年间,全球光热发电装机年复合增长率为4.24%,我国同期增长率达11.7%,显著高于全球水平;技术装备国产化率突破95%,释放出产业加速发展的强劲信号。
2025-11-19 05:35
科技创新、科学普及是实现创新发展的两翼,科普与科技创新“同等重要”。
2025-11-19 05:55
日前,由清华大学产业发展与环境治理研究中心和自然科研智讯联合编制的《国际科技创新中心指数2025》报告正式发布。
2025-11-19 05:55
新疆的孩子们在“流动科学课”上被磁悬浮演示、机器人互动、矿物标本展示等吸引了目光;甘肃张掖的科技工作者为大伙儿演示经典科普实验“火焰掌”;上海的科学家们踏上科技节的红地毯赢得公众的掌声……这些生动场景共同勾勒出“十四五”期间我国科普事业的发展印记。
2025-11-19 05:55
如今,在学习中遇到问题可以问人工智能,写作业也可以用人工智能辅助查询信息。正如这名同学所言,生成式人工智能正改变传统的以知识积累和传递为中心的教学模式。
2025-11-18 10:28
加载更多