点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 中美“乒乓外交”55周年纪念大会暨中美青少年体育交流系列活动启动仪式在京举行

  • 长沙举行首届中药农业博览会

独家策划

推荐阅读
我们并不缺成果、人才与产业雄心,真正要补上的,是那批能将成果带过“最后一公里”的人
2026-04-10 14:38
春风送暖,踏青正当时,但接连不断的喷嚏、鼻痒、眼痒等过敏症状,却让不少人的春日心情打了折扣。
2026-04-10 10:30
“四月不减肥,五月徒伤悲。”春暖花开,网上晒运动、轻食的人多了起来。不少人把减重当作迎接春天的第一件事,尤其对很多女性而言,拥有理想身材的第一步就是减重。
2026-04-10 10:28
9日,国家卫生健康委、中央社会工作部、中央政法委等25部门联合印发《健全社会心理服务体系和危机干预机制实施方案》,部署5方面18项主要任务,明确到2030年基本健全覆盖全人群、全生命周期的社会心理服务体系和危机干预机制。
2026-04-10 09:56
新华社北京4月9日电第十四届全国人民代表大会第四次会议通过了《中华人民共和国生态环境法典》,法典单行本已由人民出版社出版,即日起在全国新华书店发行。
2026-04-10 09:56
就说春耕:老把式一手扶犁,一手扬鞭,汗水顺着脊背往下淌……  再看今朝:铁牛代替了水牛,无人机施肥撒药,手机指挥收割浇水,早已不再是新闻。相信随着越来越多的新技术、新方法走进田野,干农业会越来越安逸,农业这碗饭会越来越有嚼头。
2026-04-10 09:56
人工智能时代,我们如何更好就业创业?如何推动人工智能与就业创业深度融合?第四期光明智库民生论坛,我们邀请专家共同探讨人工智能时代的就业创业这一新课题。
2026-04-09 10:28
2026年的智能驾驶行业,正经历一场意味深长的路线分化。
2026-04-09 10:24
在贵州,无人机的身影成为山地农业的新风景,展现出通用航空业赋能山地农业高质量发展的广阔前景。
2026-04-09 10:12
碳排放看不见、摸不着,却关乎每一场国际气候谈判、每一笔碳关税账单。
2026-04-09 10:09
人工智能在延伸人类能力的同时,也深刻改变着就业创业形态和劳动力市场结构。我们既拥抱着技术进步带来的无限可能,也要理性审视挑战、主动适应变革。
2026-04-09 10:08
构建“科研—科普—科创”融合闭环,让科普全程嵌入新质生产力培育链条,方能破解成果转化低效、创新协同不足等突出问题。
2026-04-09 10:02
从实验室到田间地头,辽宁省农科院为科研院所、高校、种业企业等单位提供种质资源共享服务,打通种质资源转化的“最后一公里”,让良种真正走进千家万户。
2026-04-09 09:50
北京大学先进制造与机器人学院刘珂课题组与杨林课题组合作,从折纸艺术中获得灵感,成功实现了无需外部输入的电子器件智能温度控制,相关指标刷新世界纪录。
2026-04-09 09:47
最近,中国海洋大学教授、青岛海洋生物医药研究院首席科学家于广利远赴智利,只为一株南极褐藻。2014年,青岛海洋生物医药研究院正式运行,BG136成为其孵化的第一个海洋新药项目。
2026-04-08 09:51
4月7日,贵州省贵阳市,北京积水潭医院贵州医院医生在指导患者进行脑机接口康复训练。信息多跑路、群众少跑腿的背后,是西青区紧密型医共体数据互通共享,让信息实时对接、问题协同处置。
2026-04-08 09:49
绿色获得感,源自对优美生态最直观的感受,是看得见、摸得着的民生福祉。绿色获得感,源自生态与产业共促,让绿水青山成为富民兴业的金山银山。绿色获得感,源自城乡融合发展,让良好生态空间全民共享。
2026-04-08 09:44
2月5日,自然资源部组织的中国第42次南极考察队在东南极麒麟冰下湖区域,成功完成我国首次南极冰层热水钻探试验,突破国际极地热水钻探2540米的最深纪录,标志着我国具备在90%以上的南极冰盖和全部北极冰盖开展钻探研究的能力。
2026-04-08 09:43
当前,我国已进入中度老龄化阶段,失能、失智、高龄老年人逐年增多,养老服务需求呈现专业化、多样化、个性化特征。
2026-04-08 09:41
黄色的花在春天更早绽放,是植物经历数亿年的自然进化形成的一系列生存策略。
2026-04-07 10:29
加载更多