点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 厦金大桥(厦门段)大节段钢箱梁顺利发运

  • 中国援助斯里兰卡抗洪救灾物资运抵科伦坡

独家策划

推荐阅读
“向精准要价值”,是一场从技术导向到需求导向的深刻转型。
2025-12-10 14:00
近十几年来,罗二仓团队聚焦采用环保工质,如氦气、氩气、氮气等绿色工质的热声斯特林技术,研发具有广阔应用前景的新一代热泵技术。
2025-12-10 09:39
中国科学院生物物理研究所徐涛院士课题组与纪伟研究员课题组研制出三维干涉定位显微镜(ROSE-3D),首次在单分子定位成像领域,实现了基于相机的纳米尺度三维各向同性分辨率。
2025-12-10 09:38
“细胞壁是质膜外具有一定硬度和弹性的细胞结构,广泛存在于植物、细菌和真菌中。随着研究逐渐深入,团队发现,在植物茎顶端干细胞区域,细胞壁的主要成分果胶呈现独特的“二元分布”模式。
2025-12-10 09:37
指令长张陆时隔两年半再度漫步太空,航天员武飞成为我国目前执行出舱任务最年轻的航天员。
2025-12-10 09:35
我国首个国家级陆相页岩油示范区——新疆吉木萨尔国家级陆相页岩油示范区9日完成年度170万吨原油生产任务,这一成果标志着国家级示范工程建设任务全面完成。
2025-12-10 09:34
一些不法商家钻监管漏洞,推出所谓“智驾神器”规避车辆安全监控,不仅严重威胁道路交通安全,更触碰了法律红线,扰乱了新能源汽车产业的健康发展秩序。
2025-12-09 10:11
一项新研究揭示了这些天体表面下可能发生的活动,为了解其多样地质特征的形成机制提供了线索。相关研究成果近日发表于《自然-天文学》。
2025-12-09 10:02
实验结果显示,将化合物注射给抑郁模型小鼠后,仅1小时便可观察到显著的抗抑郁效果,且无明显副作用。
2025-12-09 10:01
北京大学生命科学学院罗述金课题组与合作团队,通过古DNA研究发现,家猫直至唐代前后才通过丝绸之路商旅传入中国。
2025-12-09 09:58
7日,中国安全生产科学研究院与国家管网集团,在新疆哈密的国家管网集团管道断裂控制试验场,成功完成了我国首次全尺寸高压纯氢管道喷射火系列试验。
2025-12-09 09:57
基于这样的研究背景,柴秀娟团队近日研发出一种数字孪生驱动的智能温室采摘系统,能有效解决现代温室番茄生产密植环境下,机器人采摘效率低、易损伤植株的问题。团队成员郎一宁介绍:“首先,机器人搭载的滑轨式深度相机会沿温室逐行扫描,采集高精度的RGB-D数据。
2025-12-08 09:54
记者从国家数据局获悉,截至9月底,我国已建成高质量数据集总量超500PB(拍字节,计算机存储容量单位);7个数据标注基地引进和培育标注企业362家,标注从业人员达8.5万人,带动数据标注相关产值163亿元。
2025-12-08 09:53
“梦想”号大洋钻探船的母港在广州海洋地质调查局科考码头,出海执行作业任务时需要通过深中大桥。多年来,我们与150余家参研参建单位团结协作、集智创新,攻克了一个个技术难题,建成了这艘具有我国完全自主知识产权、全球领先的大洋钻探船。
2025-12-08 09:52
空中的昆虫堪称地球上最灵活的生物,能精准完成急转弯、急刹车和空中翻转。美国内华达大学里诺分校的航空航天工程师Hoang-Vu Phan指出,这款新设备标志着“微型机器人性能的巨大飞跃”。
2025-12-08 09:51
近日,中国科学院西安光学精密机械研究所超快光科学与技术全国重点实验室研究员姚保利团队在定量相位成像领域取得进展,提出了正交偏振复用剪切干涉技术,并研发出集成化定量相位相机Q-camera。
2025-12-08 09:50
这次经历让我开了窍:一个顶尖的技术工人,不能只满足于执行标准,更要具备在标准之外创造解决方案的能力。我带徒弟,始终坚持“手把手教技能,实打实查问题,面对面讲后果”。
2025-12-05 10:15
由此,研究团队模仿亚洲玉米螟幼虫头壳的结构特点,在实验室中成功“复刻”出具有类似仿生层状结构的水凝胶。为验证实际效果,研究团队将这种水凝胶安装在农业害虫侦查无人机的防撞支架上,并在模拟果园环境的复杂通道中进行测试。
2025-12-05 10:16
“十四五”时期,我国批准上市创新药达210个。为保证药品安全有效,药监部门对新药研发、生产、上市作出一系列严格规定,强化研发生产各环节质量管理。
2025-12-05 10:22
据中国载人航天工程办公室消息,根据计划安排,神舟二十一号航天员乘组将于近日择机实施第一次出舱活动。目前,空间站组合体运行稳定,神舟二十一号航天员乘组状态良好,已做好出舱活动各项准备工作。
2025-12-05 10:17
加载更多