点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:百图生科宋乐:生物计算将成为AI的新高峰
首页> 科技频道> 综合新闻 > 正文

百图生科宋乐:生物计算将成为AI的新高峰

来源:光明网2022-06-09 13:29

  今年,百图生科首席AI科学家宋乐教授担任ICML(International Conference on Machine Learning)大会主席,作为Program Chair,全面负责大会程序委员会的组建和论文评选等管理工作。中国生物计算企业高管出任AI顶级学术会议的此类职位,也可以被视作中国生物计算行业崛起的风向标。ICML作为国际机器学习学会主办的国际会议,被公认是人工智能、机器学习领域最顶级的国际会议之一,在整个计算机科学领域享有崇高声望。

  据悉,作为全球著名的机器学习和图深度学习专家,宋乐自2008年起就在卡内基梅隆大学和乔治亚理工学院从事生物计算相关研究,利用机器学习技术对靶点挖掘、药物设计取得了一系列突破性成果。在多年学界探索之后,他于去年8月加入百图生科,“投身业界,更多是因为可观测的生物数据量越来越多,比如说蛋白质的序列数据已经超过十亿条。其次是计算能力的提升,再次是AI算法能力的积累,AI和制药领域出现了很多新的模型和方法,能够更准确的预测。当然,目前的研究仅仅是冰山一角,AI+Drug还有无比广阔的探索空间,我对这个赛道非常期待。”

  “从ICML今年收录的近千篇论文情况来看,像医学、生物学、蛋白质、药物、分子、化学等关键词在文章标题和摘要被提及次数总计超过200次,成为单一最大的研究方向之一。我们已经看到越来越多的人工智能专家在开始关注生物医药这个领域”,宋乐表示。

百图生科宋乐:生物计算将成为AI的新高峰

  百图生科首席AI科学家 宋乐

  人工智能落地已经进入“大模型”时代。大规模预训练模型使用自监督学习的方法让模型对海量无标注数据中的规律和知识进行提炼、学习,当面向任务和场景应用时,只需要少量的任务标注数据,就能通过持续微调得到在应用场景中非常好用的模型,对具体任务的赋能效果显著,大规模预训练模型在NLP、CV等多类任务上已经展现出强大的优势。

  在宋乐看来,人工智能大模型的下一个奇迹,将出现在生物计算领域,生物计算行业将出现规模最大、效果最好、价值最高的大模型,成为行业的重大基础设施,不仅彻底改写药物研发的技术能力,也将对人工智能底层技术发展起到巨大的推动作用,反哺其他行业的AI技术发展。

  “人体这个多尺度的复杂网络,加上多模态、高噪音的超大规模生物数据,需要独有的超大模型来提升研发效果,这也是百图生科在全力攻坚的事”。根据宋教授的介绍,百图生科正围绕建模免疫系统复杂运作机理的需求,构建一系列对不同生物物质、不同互作关系具有表征能力的大模型,覆盖细胞、蛋白、基因、免疫系统等多个层面,而不只局限于热门的蛋白质结构预测领域。但即使在蛋白质结构预测这个已经被AlphaFold2充分挖掘的问题上,大模型也能带来显著的提升。百图生科与百度合作开发了这个领域的大规模预训练模型模块,在没有同源序列的帮助下对蛋白质的结构预测,对标AlphaFold2预测的TM score结果,从0.3显著提高到0.67。

  “这只是起点,我们正在开发的是超过千亿参数的超大规模多模态预训练模型体系,我们把它称作BioMap X(xTrimo,Cross-modal Transformer Representation of Interactome and Multi-Omics),它将是全球最大的生物多模态预训练模型体系,可用于生物医药领域包括靶点发现和药物开发的多个环节”。利用这个大规模预训练模型的初步基础,百图生科已经在一系列具体任务问题上,特别是一些已有数据很少的问题上,收获了明显的效果。例如,围绕组合药物协同效应的预测,大幅度的超过了SOTA水平。目前,在一些实验数据很稀缺的免疫细胞上进行的靶点发现任务,也取得了良好的前期效果,即将完成验证后对外公布。

  超大规模模型是AI行业的明珠,背后需要巨大的投入和综合的底层技术能力。“药物发现问题的商业价值极高,比起其他任务场景,更能支持大规模模型的建设投入,目前百图生科作为平台型生物计算企业敢于这样做,未来一定也会有更多企业投身到这个趋势中,最终推动生物计算大模型成为AI届最亮的明珠”。

  超大规模模型建设离不开超大规模的计算资源和高性能高并发计算能力。据介绍,百图生科的团队,包括一大批百度主任架构师、阿里P9专家这样的高级人才,他们在学术上累计发表过上千篇论文,在工程上实际构建过超大规模的知识图谱、计算集群,具有丰富的计算经验。百图生科也得益于百度的助力,搭建了高弹性的超大规模计算集群,实现了大模型的高效训练。同时,大模型能力的芯片化是下一步的关键方向。百图生科正与包括百度昆仑芯科技等领先芯片企业合作,共同研发生物计算的专用芯片,通过探索与前沿生物计算算法相匹配的前沿芯片设计,将大模型和生物计算特色需求的能力固化到芯片上。

  超大规模生物数据无疑是建设大模型的另一个关键点。截止目前,百图生科的免疫图谱已经形成了超十亿级的实体数据、百亿级的互作关系数据、千亿级的关联数据,为大模型的打造提供了基础。这些海量数据的形成,来自于百图生科从创立之初就多管齐下的大投入决心和AI、生物技术能力建设。

  宋乐认为,公开数据此前一直被认为存在较高的噪音和不准确,但这正是大模型所能消化的数据燃料,也是AI知识图谱等技术在数据清洗上的优势所在。百图生科构建了大规模的挖掘引擎,从论文挖掘和知识抽提,到大规模生物数据库的清洗整合、AI提升batch effect(批次效应)消除,再到利用知识图谱推理技术发现分歧。运用高通量湿实验能力去验证,公开数据的整合挖掘仍然大有可为。

百图生科宋乐:生物计算将成为AI的新高峰

百图生科实验室自有设备拍摄的高内涵细胞视觉数据

  更关键的是海量自产数据的获得。“高通量干湿实验闭环是生物计算的未来,这也是百图生科一直打造的差异化优势,过往一年我们也在不断努力,构建了一万多平米的高通量实验室,自主研发了世界首创的免疫模拟系统,从而能产生海量的数据和高速的验证闭环。我们的系统具有对蛋白质、细胞的高通量读写能力,能实现把物理世界的生物体快速读取,获得他们的几十个参数维度,也能实现对多种蛋白、细胞的快速制备/编辑/改写,让他们能验证模型的结果,形成快速的闭环。”

  在高通量实验系统打造的过程中,百图生科融合了世界一流的生物技术团队和AI团队。生物团队中,上百位来自大药企、著名实验室的专家,参与过100个以上的新药研发项目,掌握全链条的世界领先技术,例如免疫细胞的基因编辑技术等。AI团队中,有一批在细胞视觉、运筹优化等领域经验丰富的专家,他们和生物团队融合,利用细胞视觉大大提升原有生物检测方法的参数维度、反应速度、成本优势,不仅可以带来更好的数据,还可以用于闭环控制、确保生物系统的稳定。“这就是我们自己研发的激光雷达,有独家的激光雷达能力,我们希望能成为最强大的‘自动驾驶’公司”。

  在技术能力之外,百图生科还通过强大的临床合作网络,为高通量实验能力找到更多的用武之地。“多组学数据、临床科研数据对于模型构建和算法提升帮助很大,因此公司成立之初就投入10亿元建设‘免疫图谱卓越计划’,已经与十余家中国TOP 30的医院建立了合作,一批临床医院的著名专家、院长、主任成为了我们的合作PI,我们也很快会推出‘卓越计划’二期来加速这个过程。”宋乐说。

  目前,宋乐的团队已经拥有数十名专家,累计发表了近1000篇论文,获得过300个专利,人才来源覆盖了国内外的顶级计算生物学院系,和头部的AI科技大厂。值得关注的是,这里面很多人才并没有计算生物学、生物信息学等生物相关的背景。百图生科还成立了研究院,围绕生命体精细化观测、新型蛋白质合成和细胞编辑、前沿多组学技术等方向建立了研究小组,与国内外众多一线高等院校、科研院所合作,利用公司的场景优势、生物和计算基础设施优势,与高校双轨制培养优秀人才,使其兼具研发能力和工业落地的实践精神。

  “现在的生物计算行业其实很像二十多年前互联网行业爆发的前夜,有人说21世纪是生物学的世纪,也有人说21世纪是人工智能的世纪,我觉得人工智能技术赋能下的生物医药行业,将会成为这个世纪最有潜力的方向。随着越来越多的交叉学科人才涌入这个行业,这个行业的人才竞争也会加剧,但现在还是提早上车的最好时候。”宋乐说。

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 新疆:“银龄”学员迎来毕业季

  • 贵州榕江县防汛应急响应再次提升至Ⅰ级

独家策划

推荐阅读
今年“三夏”生产,该农场配备无人驾驶系统的收割机和拖拉机、气吸播种机、精准水肥轮灌系统、自动巡田无人机等智能化装备大显身手。
2025-06-27 10:25
6月24日,国家重大科研仪器研制项目“2.5米大视场高分辨率太阳望远镜”(WeHoST)在四川稻城启动建设配套项目,预计2027年望远镜完成装调并投入试运行。
2025-06-27 10:24
古生物研究表明,包括早期犬齿兽在内的一些远古动物,脑袋为一个没有左右脑半球区分的整体,而现生哺乳动物和典型的进步颌兽类则有左右两个脑半球。
2025-06-27 10:18
6月26日21时29分,经过约6.5小时的出舱活动,神舟二十号乘组航天员陈冬、陈中瑞、王杰密切协同,在空间站机械臂和地面科研人员的配合支持下,圆满完成既定任务。
2025-06-27 10:17
北京大学马丁教授团队26日凌晨在国际学术期刊《自然》上发表一项开创性研究,成功将复杂难处理的混合废塑料变废为宝,为根治全球塑料污染顽疾提供了新的思路。
2025-06-27 10:16
近日,一组“清华学生戴头套看演出”的照片在网络引发热议。脑机接口技术的应用还面临社会伦理与隐私保护方面的争议,如何平衡科学技术创新与社会伦理、监管要求等仍是难题。
2025-06-27 10:15
据中国载人航天工程办公室消息,根据计划安排,神舟二十号航天员乘组将于近日择机实施第二次出舱活动。目前,空间站组合体运行稳定,神舟二十号航天员乘组在轨工作已满两个月,身心状态良好,已做好出舱活动各项准备工作。
2025-06-26 09:48
6600万年前,希克苏鲁伯小行星撞击地球导致非鸟类恐龙灭绝,而就在撞击点附近,一种神秘的夜蜥蜴可能是唯一幸存下来的陆生脊椎动物。白垩纪末期,一颗巨型小行星撞击了墨西哥尤卡坦半岛附近的区域,形成了一个直径超过150公里的陨石坑,导致全球大多数动植物物种灭绝。
2025-06-26 09:47
在全球面临日益严峻的生态危机之际,中国科学院院士、中国科学院生态环境研究中心研究员傅伯杰等提出了一个衡量人与自然共同繁荣程度的全球框架。论文合作作者、联合国开发计划署人类发展报告办公室主任Pedro Conceicao表示,面对当今严峻的地球系统变化,我们必须把人与自然健康、互惠的关系纳入发展愿景。
2025-06-26 09:46
黑土地被誉为“耕地中的大熊猫”,是世界上最肥沃的土壤。这项调查系统查清了我国东北典型黑土区地表基质资源“家底”,实现了东北黑土地地表基质层的首次系统调查与深度解剖。
2025-06-26 09:41
记者邱玥25日从中国海油获悉,我国首个自营超深水大气田“深海一号”二期项目全面投产。 目前,“深海一号”大气田已经达到最高产能设计状态,年产气量有望超过45亿立方米。
2025-06-26 09:40
由美国国家科学基金会和能源部支持的薇拉·C·鲁宾天文台,首次捕捉到的太空景象呈现出一场由恒星“托儿所”及邻近星系的密集星团构成的粉蓝视觉盛宴。鲁宾天文台的科学团队还开发了面向公众的工具“天空查看器”,用户可通过平移和缩放功能探索这些超高分辨率图像中的恒星和星系。
2025-06-25 09:46
中国海油25日宣布,公司在南海水域的“深海一号”大气田二期项目全面投产,标志着我国最大海上气田建成。“深海一号”大气田分一期和二期开发建设(一期于2021年6月投产),探明天然气地质储量超1500亿立方米,最大作业水深超1500米,最大井深达5000米以上,是我国迄今为止自主开发建设的作业水深最深、地层温压最高、勘探开发难度最大的深水气田。
2025-06-25 09:33
2017年启动的第二次青藏高原综合科学考察,为新一代草地植被图的绘制提供了新的契机。“我们共识别出65种主要草地类型,其中高山嵩草草甸、紫花针茅草原、矮生嵩草草甸、垂穗披碱草草甸和线叶嵩草草甸这5个群系分布最广。
2025-06-25 09:30
6月24日,“应急使命·2025”极端灾害事故场景新质救援能力检验性演习在黑龙江省东宁市、河南省濮阳市等地举行。“源网荷储”应急供电中,国家电网运用新技术、设备,实现小型水电站“黑启动”“光伏+储能”协同供电,保障重点区域电力供应。
2025-06-25 09:24
研究团队通过发育表达分析、原位杂交和免疫组化技术,在甜菜孢囊线虫早期寄生阶段鉴定出两个关键分泌效应蛋白——Hs28B03和Hs8H07。该研究首次发现,植物寄生线虫会“劫持”植物细胞的“垃圾处理系统”——泛素化系统来摧毁免疫。
2025-06-25 09:23
24日,记者从中国农业科学院棉花研究所获悉,中国农业科学院棉花研究所、西部农业研究中心棉花分子遗传改良创新团队杨作仁研究员与中国农业科学院生物技术研究所柳小庆研究员,合作创制了可生产虾青素的工程棉花。
2025-06-25 09:22
“智慧光源大脑”是国内首个同步辐射人工智能数据解析平台,能够更高效地处理同步辐射实验产生的海量复杂数据。
2025-06-24 09:43
新修订的《中华人民共和国科学技术普及法》实施半年,近日,有媒体采访多位科研人员,梳理新科普法落实效果。受访的多位科研人员表示,新科普法为科研人员开展科普工作提供了制度保障。
2025-06-24 04:50
6月初,依托东南大学共建的南京紫金山实验室发布全球首个6G广域低空覆盖的无蜂窝通智感融合外场试验网,赋能低空经济、数字能源、智能制造等应用场景,有望催生千亿级产业链,助力南京打造“6G之城”。这是东南大学勇挑硬核科技创新大梁,支撑服务新质生产力发展的生动缩影。
2025-06-24 05:00
加载更多