点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 习近平春节前夕慰问部队

独家策划

推荐阅读
工业和信息化部等五部门近日印发《关于加强信息通信业能力建设支撑低空基础设施发展的实施意见》。加强监管能力体系建设,规划无人机专用号段,推动“一机一码一号”能力建设,探索标识解析在无人机领域的应用,形成无人机通信资源精细化管理。
2026-02-11 09:25
全球森林逐渐被快生树木主导,而稳定生态系统的慢生树种正在消失。“我们关注的是极为独特的物种,它们主要集中在生物多样性丰富、生态系统联系紧密的热带和亚热带地区。“此外,在现在和未来受到干扰的地区,非本地物种可能会加剧对光、水和养分的竞争,从而使本地树木更难生存。
2026-02-11 09:32
中国科学院动物研究所研究员王红梅带领的“灵长类胚胎发育的规律解析与体外模拟团队”,用27年的接力攻坚,把灵长类早期胚胎发育这个看不见、摸不着的“黑匣子”,变成了清晰可见的“生命剧本”。
2026-02-11 09:32
截至1月28日,“横竖都是世界第一”的贵州花江峡谷大桥累计接待游客突破130万人次,通行车辆超20万辆次,持续为区域发展注入新动能。大桥带来的发展溢出效应令人瞩目,而深入大桥肌理探查,你会发现,支撑起这座庞然大物的每根细钢丝,全部都是“中国造”。
2026-02-11 09:31
针对常见的饮食误区,杨爱明特别提醒,不建议采用“不吃主食”或“用水果代替主食”的方法来控制体重。对于肠胃功能较弱的人群,应避免过冷、过烫、过辣、过咸食物的刺激,切忌暴饮暴食,并尽量保持规律的进餐时间,以防加重原有胃肠问题。
2026-02-11 09:24
近日,市场监管总局(国家标准委)批准发布《中医体质分类与判定》推荐性国家标准。
2026-02-10 09:44
聚集相关企业300余家,机器人产业链规模超百亿元……北京亦庄,为何扎堆这么多机器人企业?
2026-02-10 09:42
“十四五”时期,我国全社会研发经费投入年均增长10%,研发经费投入强度提高0.44个百分点。
2026-02-10 09:41
日前,我科研团队在国际学术期刊《科学》发表论文《多尺度泛基因组图谱赋能混合倍性甘蔗的基因组解析》,为甘蔗高产优质育种提供了全新“基因资源地图”与核心分析工具。
2026-02-10 09:34
日前,南海区域海-气双向耦合智能大模型“飞鱼-1.0”在广东广州正式发布。“
2026-02-10 09:33
蓝天、绿林、碧水、清波……冬日的广东东莞松山湖科学城,温暖、惬意。
2026-02-09 10:00
这声呼唤,穿越漫长岁月,凝结着人类对这位地球近邻永恒的好奇与梦想。而今,随着新一轮探月热潮在全球兴起,这句“去月球”已不再仅仅是浪漫的诗意表达,更成为科技前沿竞相追逐、国家实力与创新精神交汇的生动实践。
2026-02-09 09:57
特种机器人技术与数智系统创新团队成员张平点击一键启动指令后,雷达驱动、定位算法、规划与控制算法等模块被加载。在系统支持下,无人机能够精准定位、自主导航与实时避障,像一位不知疲倦的巡检员。
2026-02-09 09:53
深耕西南高原山区二十余载,于富强与真菌为伴,在种质资源保护与产业富民之间架起桥梁,把论文写进泥土中,把科研做进农户的大棚里。3年间,于富强往返昆明与水城数十趟,硬是帮着水城从零起步,建成了食用菌研究所、日产50万袋的菌种厂和鲜菇冷链物流集散中心。
2026-02-09 09:53
研究团队将这一环境效应与黑洞双星轨道偏心率的演化同时纳入统一模型,并将理论预测与北美纳赫兹引力波天文台合作组15年的观测数据进行对比分析。陈一帆表示,尽管当前的不确定性仍然较大,但该研究已经表明,引力波观测开始携带关于星系中心环境的可测信息。
2026-02-09 09:53
近日,国家管网集团西部管道公司成功完成所辖新疆段天然气、原油、成品油管道输送全生命周期碳足迹核算,获得中国质量认证中心颁发的“产品碳足迹证书”。
2026-02-06 09:18
近日,中国农业科学院蔬菜花卉研究所蔬菜分子设计育种创新团队研发出新型植物基因研究工具——对目标DNA序列的邻近空间蛋白标记系统。
2026-02-06 09:38
因为像了解自己的孩子一样了解黑土地,韩晓增有个外号——“黑土地的营养搭配师”。他带领团队精心配制出一套营养搭配的“秘方”。
2026-02-06 09:33
蚊种与病毒之间存在高度匹配关系。1901年,公共卫生与热带医学领域先驱沃尔特·里德证明,蚊子是传播黄热病的元凶。科学界传统观点认为,病毒以颗粒形式在蚊子体内传播,却始终不知道真正的“病毒受体”是什么。
2026-02-06 09:31
科技创新和产业创新的深度融合,不仅是构建现代化产业体系的战略举措,更是贯彻新发展理念、推动高质量发展、加快构建新发展格局的重要抓手。
2026-02-06 09:13
加载更多