点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 我国在建最北高铁全线铺轨贯通

  • 超大型耙吸挖泥船"通浚"轮海试成功

独家策划

推荐阅读
近日,自然资源部发布了矿产资源节约与综合利用先进适用技术目录(2025年版),共有376项技术入选,其中新增入选186项,与2022年版相比有了大幅更新。
2025-11-26 10:26
全国科学技术名词审定委员会近日举办2025年度工作会议暨学术年会。
2025-11-26 10:24
不久前,国务院办公厅印发《关于加快场景培育和开放推动新场景大规模应用的实施意见》,首次在国家层面对场景培育开放进行系统部署。看似细微的“场景”二字,实则内蕴驱动产业变革、催生颠覆性技术的巨大能量,是撬动全局创新的重要支点。
2025-11-26 10:22
光明日报北京11月25日电 记者温源从中交集团获悉,我国自主设计建造的新一代超大型耙吸挖泥船“通浚”轮25日在中国黄海海域成功完成全部海上试验项目,顺利返航停靠江苏启东振华船厂码头。“通浚”轮是我国首艘自主设计建造的35000立方米舱容等级超大型耙吸挖泥船,最大舱容达38168立方米,位列亚洲第一、世界第二。
2025-11-26 10:15
日前,记者来到广西南宁东部新城的宁福新能源科技有限公司生产车间,这里的机械臂精准协作,生产线正全速运转,每天超10万颗电池下线发往全球。依托面向东盟的比较优势,南宁将新能源电池产业列为核心牵引性产业,以全产业链思维开展精准招商。
2025-11-26 10:13
传统无机颜料虽然色彩稳定,却因重金属添加而存在健康风险隐患。“新型稀土环保颜料的呈色策略突破了传统颜料的局限,其出现及量产不仅解决了传统颜料有毒性、环境污染等问题,还在稳定性和生产成本上展现出显著优势。
2025-11-26 10:06
《办法》明确,卫星导航定位基准站的建设和运行维护实行统一规划、统一标准、统一监管,以“合理布局、依法备案、资源共享、保障安全”为原则,必须符合国家有关法律法规、技术规范和标准。
2025-11-25 09:43
稳步提升乡村建设水平,包括优化乡村规划布局、推进基础设施提档升级、推动公共服务普惠均等、探索创新乡村建设推进方式等。
2025-11-25 09:40
机器人完成一个后空翻动作,关节转动误差需控制在0.5度以内;医疗植入人体的陶瓷关节,表面粗糙度若超过0.1微米
2025-11-25 03:05
党的二十届四中全会指出,“加快人工智能等数智技术创新,突破基础理论和核心技术,强化算力、算法、数据等高效供给”。
2025-11-25 03:05
11月24日,中国科学院国家空间科学中心召开空间科学先导专项最新亮点成果发布会,集中发布了空间科学卫星任务在宇宙暂现天体、宇宙线传播、太阳爆发等领域取得的系列重大科学突破。
2025-11-25 03:05
随着人工智能技术的飞速发展,各个领域都在发生深刻变革,教育系统也刮起了AI风。
2025-11-25 03:05
燕矶长江大桥是亚洲首个专业货运枢纽机场——鄂州花湖国际机场的重要配套工程,是鄂黄第二过江通道的重要组成部分。
2025-11-24 09:02
11月23日,由中国半导体行业协会、中国电子信息产业发展研究院主办的第二十二届中国国际半导体博览会在北京开幕。
2025-11-24 03:15
从国家管网集团西部管道有限责任公司获悉,截至11月21日,我国最长原油管道——西部原油管道实现安全平稳运行18年,累计输送原油超2亿吨。
2025-11-24 03:15
作为中国和南非两国合作推动科普教育的重要实践,中国科学技术馆与南非Sci-Bono科学中心合作建设的“倾听科学空间”21日正式向公众开放。逾百嘉宾和观众到场体验。
2025-11-24 03:15
为AI4S领域培养兼具理论素养与产业落地能力的复合型人才,同时助力企业技术创新与行业生态构建。
2025-11-24 03:15
2025年度“十大”科普热词从科技、文化、社会等维度,综合勾勒出2025年我国科普事业发展、科技前沿动态、科学传播与社会文化融合的整体态势和核心方向。
2025-11-21 15:11
枫清科技与麒麟软件达成战略合作,双方将围绕AI技术创新、产品研发、市场拓展等方面开展深度合作,共同推动信创产业生态的完善与发展。
2025-11-21 13:13
走进国家重要野生植物种质资源库辰山中心种子冷库,零下20摄氏度的寒气扑面而来,一排排整齐编号的收纳容器中,是进入“深度睡眠”状态的各类野生植物种子。
2025-11-21 09:53
加载更多