点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:图片、文字、语音都能理解 这个AI平台是“全能”选手
首页> 科技频道> 综合新闻 > 正文

图片、文字、语音都能理解 这个AI平台是“全能”选手

来源:科技日报2021-07-12 09:20

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  “小初,请以天宫为主题作首诗吧?”

  “天宫生殿开成,万花垂露照初。稠云不掩国志,飞天当触明霞。”

  “你能看懂这个视频吗?”

  “视频中,火箭正在发射。”

  “小初,图片中航天员正在干什么?”

  “航天员正穿着航天服站在机械臂上遨游太空。”

  ……

  7月9日,在2021世界人工智能大会(WAIC2021)上,中国科学院自动化研究所所长徐波发布了自动化所研发的跨模态通用人工智能平台——“紫东太初”。基于“紫东太初”平台打造的虚拟人“小初”在大会现场赚足了眼球。它不仅能读懂图片、看懂视频、中文续写、双语翻译,而且能吟诗作赋,生动证明了通过图片、文字、语音三种模态的关联与协同,可以有效地提升机器的理解和生成能力,让AI接近人类想象力。

  “紫东太初”平台是跨模态通用人工智能平台,以多模态大模型为核心,基于全栈国产化基础软硬件平台,可支撑全场景AI应用。“所谓跨模态是指它可以理解语音、文字和图片等多种模态信息;所谓全栈国产化是指这个平台的底层算力、模型、框架等都是自主研发的。”徐波解释道。

  多种模态预训练模型被广泛认为是从限定领域的弱人工智能迈向通用人工智能路径的探索。依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉、文本、语音三种模态统一表示,构建了三模态预训练大模型,赋予跨模态通用人工智能平台多种核心能力。

  徐波介绍,“紫东太初”兼具跨模态理解和生成能力。与单模态和图片、文字两种模态相比,“紫东太初”采用一个大模型就可以灵活支撑图片、文字以及语音的全场景AI应用,具有了在无监督情况下多任务联合学习、并快速迁移到不同领域数据的强大能力。

  “引入语音模态后的多模态预训练模型,可实现共性图片、语音和文字的空间表征和利用,并突破性地直接实现三模态的统一表示。”徐波说,特别值得强调的是,该平台首次让“以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,让AI能够在视频配音、语音播报、标题摘要、海报创作等更多场景实现应用。

  同时,研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。

  “‘紫东太初’跨模态通用人工智能平台包括三大关键技术和六大核心能力。”徐波说,三大关键技术分别是多模态理解与生成多任务统一建模、面向国产化软硬件的高效训练与部署、多模态预训练模型架构设计与优化。六大核心能力则体现为多模态统一表示与语义关联、跨模态内容转化与生成、预训练模型网络架构设计、标注受限自监督模型学习、模型适配与分布式训练、模型轻量化与推理加速。

  徐波表示,“大数据+大模型+多模态”将改变当前单一模型对应单一任务的人工智能研发范式,多模态大模型将成为不同领域的共性平台技术,是迈向通用人工智能路径的探索,具有广阔的应用前景。

  同时,全栈国产化通用人工智能平台的实践将使人工智能研发的规则发生重大变革并逐渐形成壁垒,对我国实现AI领域科技创新、占领核心技术高地具有重要的战略意义。(陆成宽)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 习近平会见文莱王储比拉

  • 习近平会见联合国教科文组织总干事阿纳尼

独家策划

推荐阅读
“请帮我检索南京附近适合亲子旅游的路线”“我想买个电热水器,请帮我推荐几款实用的”……如今,越来越多的消费者开始将AI(人工智能)当作“随身消费参谋”。从规划旅游路线到挑选酒店民宿,再到日常购物选择,很多消费者习惯先问一问AI工具,再做消费决策。
2026-05-13 09:30
在这一过程中,颠覆性技术正由潜在变量转变为关键变量,成为重塑产业结构、重构竞争格局的重要力量。颠覆性技术具有“路径替代”特征,能够深刻改变产业格局。综上所述,未来产业发展呈现出“技术跃迁—场景转化—工程化扩张”的基本路径。
2026-05-13 09:22
搭载单核180个计算比特自主超导量子芯片的“本源悟空-180”量子计算机已上线运行,开始接收全球量子计算任务。
2026-05-13 02:30
2018年,厦大教师吴彩胜带着一群厦大青年来到这里。他们发现,当地的农副产品虽然产量不小,却因缺乏检测条件,面临“好产品难认证”的困境。
2026-05-13 02:20
浦江潮涌,惠风和畅。5月12日,第十二届亚太经合组织(APEC)食品安全合作论坛(FSCF)会议在上海举行。
2026-05-13 02:25
今年5月12日是第18个全国防灾减灾日,主题是“人人讲安全、个个会应急——提高防灾减灾救灾能力”。
2026-05-12 02:40
习近平总书记在加强基础研究座谈会上强调,基础研究是整个科学体系的源头,是所有技术问题的总机关。
2026-05-12 02:40
当前,我国正处于加快建设教育强国的关键时期。教育作为强国建设、民族复兴之基,战略地位更加凸显,迎来了前所未有的发展机遇
2026-05-12 02:40
十年来,北京大学考古文博学院坚守初心、守正创新,聚焦学科、学术、话语、育人四大体系一体化建设,并以实践创新贯穿始终,让四者协同赋能
2026-05-12 02:40
回顾人类社会发展史可以发现,任何一个国家的崛起都伴随着思想文化的兴盛和知识体系的自主建构。
2026-05-12 02:40
搭载AI创作PPT、AI绘画设计等功能的智能4G无线语音鼠标,具备清洗、离心、分选、培养等功能的全自动细胞制备一体机,覆盖多层级智慧生活场景的AI智能家居……
2026-05-12 02:40
据《自然》报道,联合国正在考虑设立31项新指标,以“补充并超越”全球衡量经济增长的主要指标——国内生产总值(GDP)。古特雷斯当天在美国纽约联合国总部举行的启动仪式上发表讲话,称该报告“迈出了纠正衡量进展方面长期存在的盲点的里程碑式的一步”。
2026-05-11 08:59
在中国科学院空间科学(二期)战略性先导科技专项的统筹布局下,依托中国科学院建制化优势,院内多家单位协同攻坚,成功完成卫星研制工作。接下来,中国科学院计划通过天地联合观测,深入开展有组织、体系化的前沿研究工作,解决一批国际公认的科学难题。
2026-05-11 08:58
面对质疑,路战远和团队天天扎进地里,一边在示范田讲技术,一边用实打实的产量说话。为了把技术讲清楚,路战远团队还自掏腰包,筹集经费40多万元,设计编撰了一套《保护性耕作技术·蒙汉对照》科普画册,把复杂的技术画成生动的漫画,让17万户农牧民看着漫画、学习技术。
2026-05-11 02:45
日前从中国科学院西北高原生物研究所获悉,全球唯一聚焦高寒、高海拔、强紫外特殊生境的专业化种质资源平台——青藏高原生物种质资源库
2026-05-11 03:15
旺季收购期间,国家粮食和物资储备局强化统筹组织,细化政策措施,相机灵活开展收储调控,多措并举推动产销衔接和农企对接,积极引导各类主体入市,不断激发市场购销活力,保障收购工作顺利开展。据初步统计,累计收购中晚稻1.03亿吨、玉米2.22亿吨、大豆1299万吨。河南、湖南、黑龙江3省启动中晚稻最低收购价执行预案,累计收购最低收购价中晚稻418万吨。
2026-05-11 02:45
“人类生活在大气之中,大气变化是有规律的,可以将其变化用方程方式来表示。” 李泽椿习惯用数据和公式说话,这位中国工程院院士、天气动力和数值预报专家说话慢条斯理,从没高声过。
2026-05-09 02:15
中医强调,“未病先防、既病防变、瘥后防复”。
2026-05-09 04:05
仓廪实,天下安。习近平总书记强调,只有农业强起来,粮食安全有完全保障,我们稳大局、应变局、开新局才有充足底气和战略主动。
2026-05-09 02:15
近期,某手机芯片厂商相关漏洞被不法分子定向利用,给网上热炒的“秒解BL锁”行为敲响了警钟。
2026-05-09 11:10
加载更多