点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 探访平陆运河青年枢纽鱼道

  • 第28届上海国际电影节举办首日活动

独家策划

推荐阅读
据英国《自然》网站9日报道,美国生命生物科学公司当天宣布,首次通过细胞“部分重编程”疗法,尝试让一名青光眼患者眼部受损的衰老细胞“返老还童”。
2026-06-12 09:32
一项发表于《科学》杂志的最新研究,绘制了首张全球菌根真菌“地下网络”分布图。这是继去年《自然》杂志发表菌根真菌多样性全球分析之后,科学家首次实现对其物理密度的全球可视化。
2026-06-12 09:29
斯坦福大学数学家贾里德·杜克尔·利希特曼在社交平台X上将这种现象类比为国际象棋中的“非常规开局”,认为AI有时能跳出人类长期形成的“审美与惯例”。
2026-06-12 09:28
在前不久举行的第三十四届哈尔滨国际经济贸易洽谈会上,哈尔滨工程大学智能海洋航行器技术全国重点实验室的展台前,围满了参观者。
2026-06-12 09:27
如今,智谱的大模型已经成为全球众多顶级云服务商和知名编程平台的“默认选项”之一,深受海外开发者的欢迎。如果说智谱代表了AI通用大模型在信息空间的实力,那么北京科学智能研究院则展示了AI征服物理和微观世界的强大力量。
2026-06-12 09:26
“在洞窟里,把冷光灯打开,面对着千年壁画的那一刻,所有的烦恼都会瞬间远离,觉得能近距离接触如此杰出的艺术品,是很震撼、很幸运又很幸福的事。遵循这一“笨规矩”,于宗仁组织完成了莫高窟与甘肃省内外多处壁画彩塑保护方案与实施工作,例如莫高窟千像塔彩塑保护修复、莫高窟第196窟壁画彩塑保护修复,以及麦积山石窟部分洞窟的塑像壁画保护修缮等。
2026-06-11 10:23
国际科技出版机构施普林格·自然10日发布的自然指数2026科研领导者榜单显示,中国继续保持全球第一,2024年至2025年科研产出增长22.4%,是全球十强中唯一实现两位数增长的国家。机构表现方面,自然指数显示,中国科学院整体排名位列榜首,在除健康科学和社会科学以外的5个学科领域位居第一。
2026-06-11 10:23
量子传感是一种利用量子效应进行高精度测量的新技术。量子传感可通过增加粒子数量来提高传感性能,然而这面临一个重要挑战——量子热化。“这不仅深化了人们对量子热化这一基础科学问题的认识,也为发展新一代高灵敏度量子传感器提供了新的思路。
2026-06-11 10:23
扎根智能制造一线,很多像马遵农一样的年轻人用技术创新护航制造业转型升级。如今,基于模型的系统工程等方法已应用于飞机制造的各个环节,新工艺的研发更高效、更精准、更节约。
2026-06-11 10:23
阶段扩建,计划新增一个综合舱段,让空间站整体构型从“T”字变为“十”字。从初具规模的三舱组合,到不断扩容升级,中国空间站的成长,是中国载人航天稳步发展的缩影。
2026-06-11 10:23
6月9日16时23分,朱雀二号改进型遥六运载火箭在东风商业航天创新试验区发射升空。
2026-06-10 09:57
6月8日,火烈鸟在盐湖湿地嬉戏,成为一道亮丽风景线。
2026-06-10 09:57
日前,长江干线首个“复式航道”在安徽土桥水道和大通水道试运行,预计每日分流200余艘上行浅吃水船舶。
2026-06-10 09:52
近年,智能除锈凝胶与高相容性的新型加固材料的研发与成功应用,分别为脆弱青铜器无损清除锈蚀病害与矿化层加固提供了创新方法。
2026-06-10 09:51
为了让更多患者在关键时刻“用得上、用得起”,一群年轻的航天人坚定踏上了国产ECMO攻关之路。
2026-06-10 09:48
作为长江、黄河、澜沧江发源地,青海多年来持续推进三江源水生生物资源保护修复,持续巩固青海省高原河湖生态屏障。据悉,此次大批量土著鱼苗放流,进一步充实了黄河上游鱼类资源储备,对修复河道生物群落、改善水域生态环境具有积极作用。
2026-06-09 09:57
记者从自然资源部中国地质调查局获悉,“海洋地质六号”船近日完成深海地质调查第16航次科考任务,在深海地质环境调查、海洋探测关键技术装备研发应用等方面取得多项成果。
2026-06-09 09:56
培育新质生产力、建设现代化产业体系,是推动经济高质量发展、夯实中国式现代化产业根基的重要任务。未来产业依托前沿技术与颠覆性创新引领发展方向,赋能传统产业与新兴产业,拓展发展边界、培育全新增长点。
2026-06-09 09:52
人工智能与数智技术的发展,无疑是当下人们最为关切的议题之一。
2026-06-09 09:50
耕地是保障粮食安全的根本。当前,我国耕地质量总体呈现稳中有升良好态势,东北黑土地保护性耕作面积持续扩大,南方酸化耕地治理和北方盐碱地改造利用均取得积极进展。
2026-06-09 09:36
加载更多