点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 平坦的河南,崛起的中原

  • 我国本土发现的首块月球陨石有重要发现

独家策划

推荐阅读
“日出而作、日落而息的传统农耕图景,正在被代码、传感器和无人机重新绘制。”春日里的华中农业大学襄阳书院,校长严建兵对着身旁年轻的面孔说,“对智慧农业而言,广袤的科研一线就是前沿阵地。
2026-04-23 09:41
铈镁嫦娥石是一种新的含稀土磷酸盐矿物,属于三方晶系。据了解,铈镁嫦娥石发现于第一块坠落在我国境内的月球陨石——Pakepake005陨石。目前,铈镁嫦娥石的原型标本和等型标本分别馆藏于中国地质博物馆和中国地质科学院。
2026-04-23 09:40
崇明东滩保护区位于上海市崇明岛的最东端,是东亚—澳大利西亚候鸟迁飞路线上重要的停歇地和越冬地。工作在崇明东滩这片充满生机和希望的土地上,钮栋梁表示倍感使命光荣,责任重大。
2026-04-23 09:39
近日,中共中央办公厅、国务院办公厅印发《关于更高水平更高质量做好节能降碳工作的意见》。答:“十四五”以来,各地区、各部门深入贯彻落实党中央、国务院决策部署,认真落实全面节约战略,扎实推进全社会节能降碳,取得显著成效,“十四五”全国能耗强度和碳排放强度降低目标均顺利完成。
2026-04-23 09:39
推动伦理嵌入设计,实现伦理治理的前置化,更是推动人工智能治理范式从被动应对向主动防控、从末端整改向源头管控转型的关键抓手。唯有多措并举,方能真正筑牢人工智能伦理治理的根基,推动人工智能技术在伦理框架内规范、健康、可持续发展,让人工智能更好赋能美好生活。
2026-04-23 09:38
但我们也应该看到,我国的农机生产,尽管数量上去了,在品种的丰富性方面尚嫌不足。实践证明:精准适配的农机,是破解山地农业困境的“金钥匙”,也是农机企业开拓市场的“新空间”。
2026-04-23 09:37
当AI成为企业的核心生产力,工业时代延续百年的科层制必然走向瓦解,一套全新的、适配AI时代的组织规则正在被重新书写。
2026-04-22 14:19
2026年“5·18国际博物馆日”,首都博物馆将推出年度重磅展览——“玉米·黄金·美洲豹:玛雅与安第斯古代文明大展”,约800件珍贵文物将亮相,带观众走进美洲古代文明。
2026-04-22 09:41
中国气象局日前发布首批珍贵一级气象档案名录。中国气象局气象档案馆收藏的“1885—1944年猴矶岛海关气象月总簿”、天津市气象档案馆收藏的“1890—1931年英租界工部局工程处测候所气象统计表”、辽宁省气象档案馆收藏的“1951年中央人民政府人民革命军事委员会气象局全国气象工作会议合影(照片)”等59组气象档案被纳入首批珍贵一级气象档案名录。
2026-04-22 09:40
环节动物是地球上物种最丰富、生态分布最广的动物门类之一。现生的环节动物传统上分为多毛类(如沙蚕和浮蚕)、寡毛类(如蚯蚓)和蛭类(如蚂蟥)。
2026-04-22 09:39
近年来,随着人工智能、机器人等技术的飞快发展,我国自主研发的人形机器人“行者泰山”“天工”“青龙”等频频“破圈”。
2026-04-22 09:31
《报告》展望,未来10年,我国粮食和重要农产品综合生产能力将显著增强,多元化食物供给体系将更加完善,农产品供需将迈向高水平动态平衡新阶段。
2026-04-22 09:29
记者从生态环境部获悉:近日,我国在酒泉卫星发射中心用长征四号丙运载火箭,成功将高精度温室气体综合探测卫星发射进入预定轨道,发射任务获得圆满成功。
2026-04-21 10:34
中医药是中国古代科学的瑰宝,凝聚着中华民族几千年来的健康养生理念及实践经验。“十五五”规划明确提出,要“推进中医药传承创新”,法治作为治国理政的基本方式,能够为中医药传承创新提供坚实保障。要充分发挥法治的固根本、稳预期、利长远作用,以高水平法治赋能中医药传承创新,让中医药这一千年瑰宝在时代浪潮中焕发新的生机与活力,为健康中国建设注入强劲动能。
2026-04-21 10:31
当下,春播春管自南向北次第展开,正是决定一年收成的重要时节。广袤田畴上,各地各部门抢抓农时促生产,科技气息漫遍阡陌,一幅生机盎然的春景图全面铺展。向科技要产能,以智慧启春耕,农业新质生产力在田野间落地生势,成为做好春播春管的底气。
2026-04-21 10:29
网络上针对牛奶到底能不能空腹喝的讨论从不曾停止。如果你空腹喝牛奶后,半小时到两小时内出现腹胀、肚子咕咕叫、排气、腹泻,那很可能是乳糖不耐受。空腹喝牛奶不会“伤胃”,反而可能“养胃”。
2026-04-21 10:26
安徽合肥的科大国盾量子技术股份有限公司内,展出了各类量子移动安全应用产品。合肥近年来不断强化“沿途下蛋”机制,通过企业、资本、科技的融合,助力大科学装置诞生科技成果,并让其孵化走向市场。
2026-04-21 10:25
正值春耕关键期,河南滑县的万亩麦田里,种粮大户不再需要徒步巡查耕地,只需轻点手机,卫星遥感图便将田块边界、墒情分布与作物长势清晰呈现。
2026-04-20 09:51
在苏州大学江苏省先进负碳技术重点实验室,纳米科学技术学院博士生郁操正操作X射线光电子能谱仪,分析一块特殊的测试样品。张晓宏表示,学校将继续深化“学术大师+创新团队”模式,完善交叉课程体系,培养出更多能服务地方产业、对接国家战略、为新质生产力助力的拔尖创新人才。
2026-04-20 09:47
绿色设计不仅是实现碳达峰、碳中和目标的关键工具,更是推动产业转型升级、培育新质生产力的源头性驱动力。“十五五”规划纲要明确提出:“鼓励企业提高绿色设计和制造水平,降低产品全生命周期能源资源消耗和生态环境影响。
2026-04-20 09:44
加载更多