点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 电影《731》拍摄历程特展在哈尔滨举行

  • 安徽歙县:土楼晒秋

独家策划

推荐阅读
中国科学院大连化学物理研究所研究员陈萍、研究员曹湖军、副研究员张炜进团队在氢负离子导体开发及应用方面取得重要进展。
2025-09-18 09:52
工业遗址与科幻主题联动,带来现实与想象交错的奇妙感受;科技手段还原知名IP场景,让游客沉浸到小说里的名场面;利用独特地质地貌,打造“地球上最像火星的地方”……来一场新鲜、有趣的科幻游,成为不少人出游的选择之一。如何做好科幻与文旅深度融合,丰富旅游供给?各地因地制宜进行了探索。
2025-09-18 09:50
记者17日从中国石化新闻办获悉,部署在四川省资阳页岩气田的2口评价井测试产量均超百万立方米,其中资页2-501HF井试获日产气140.7万立方米,刷新我国页岩气测试产量最高纪录。
2025-09-18 09:44
当今中国,科学教育受到前所未有的重视—作为人才培养的根基与路径,科学教育的潜力将变成参与国际竞争、争取国际话语权的实力。
2025-09-18 09:43
日前,由中国科学院合肥物质科学研究院等离子体物理研究所牵头承担的聚变堆主机关键系统综合研究设施(CRAFT)遥操作系统测试平台通过专家组测试与验收。
2025-09-18 09:40
“科创游”是一种将科技与旅游相结合的新型旅游形式,不仅展示科技企业的生产过程和产品,还注重科技教育的普及和科技创新的体验
2025-09-17 10:23
此次大会将讨论通过“人与生物圈计划”及其世界生物圈保护区网络杭州战略行动计划,明确未来十年的发展方向、目标和行动方案
2025-09-17 10:21
人造地球卫星、载人飞船、空间站、空间探测器要“上天”进入预定轨道,运载火箭少不了。在“火箭家族”展台,长征一号至五号运载火箭模型笔直而立。
2025-09-17 10:20
在化学生物学研究中,有一种强大的“分子地图绘制技术”——邻近标记技术。在癌症免疫治疗中,免疫细胞需要足够强和足够多的“信号”才能发起攻击,但癌细胞表面的天然信号往往非常稀疏。
2025-09-17 10:18
当前,秋粮陆续进入成熟期。各地抓住最后的窗口期,落实落细各项增产措施,全力以赴抓好秋粮生产,确保秋粮丰产丰收。
2025-09-17 09:32
人工智能的浪潮正在席卷从科技到教育,乃至全社会的各个角落,中国教育界正在积极推动学习和应用人工智能,以便乘势站在时代前列。今年6月,中国工程院院士、华中科技大学校长尤政提出,人工智能和批判性思维结合形成DNA式的“双螺旋结构”,将有力推动创新。
2025-09-16 09:14
15日,在2025年国家网络安全宣传周主论坛上,《人工智能安全治理框架》2.0版正式发布。落实《全球人工智能治理倡议》,《人工智能安全治理框架》1.0版于2024年9月发布,受到国内外广泛关注。
2025-09-16 09:13
光明日报北京9月15日电 记者陈晨从农业农村部获悉,2025畜禽种业发展论坛14日在北京市平谷区举行。论坛发布了第三次全国畜禽遗传资源普查、濒危畜禽遗传资源保护成效、主要畜种分子身份证构建和遗传评估优秀种公畜等重大成果,举办了畜禽种业振兴成果展,26家单位现场推介新技术、新设备、新成果,72家单位进行专场展示。
2025-09-16 09:13
数智技术以及数智互联技术将推进青年间社会化协同与知识共享,可精准连接青年学习者,并形成跨地域的学习社群与项目协作组。总而言之,数智技术能够为青年群体参与终身学习创造良好条件,能够充分激发青年群体参与终身学习的动力,能够更好地帮助青年群体全面发展。
2025-09-16 09:12
作者:王 珩、程松泉,分别系浙江师范大学教师教育学院教授;浙江师范大学教师教育学院博士生  当前,全球教育正经历一场由人工智能技术驱动的深刻变革。唯有坚守育人初心,在伦理框架内审慎推进技术应用,才能让人工智能真正成为引领教育发展的引擎,而非解构教育本质的飓风。
2025-09-16 09:11
在合成生物学和气候变化应对领域有巨大潜力。
2025-09-16 09:11
走进展区,多款新潮文创让人爱不释手;戴上设备,苏轼笔下的诗词世界任人遨游;指尖轻点,三千年前的青铜器“触手可及”……一系列新产品、新服务、新场景在2025年中国国际服务贸易交易会文旅服务专题亮相,漫步其中,处处感受到科技与创意奔涌、文化和旅游融合的无限活力。
2025-09-15 09:54
在2025年中国国际服务贸易交易会上,一批品类丰富、兼具趣味与文化内涵的文创精品成为展会现场的“人气王”,引爆观展热潮。
2025-09-15 09:54
最大网络基础设施的建成有助于我国突破关键技术的“卡脖子”困境,形成自主可控的核心技术优势,建立起数字经济产业的第二创新生态。 (作者:戎 珂,系清华大学社会科学学院经济学研究所所长、长聘教授;田晓轩,系清华大学社会科学学院经济学研究所博士研究生)
2025-09-15 09:53
今年暑期,工厂游火爆出圈。参观名额秒空、门票收入可观、社交平台相关笔记有10多万条,工厂游俨然成了文旅界新宠。 工厂游等新型旅游业态,实现了工业与文旅的跨界融合,也为文旅经济的发展提供了新增长点。
2025-09-15 09:52
加载更多