点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:浪潮信息发布“源2.0-M32”开源大模型
首页> 科技频道> 人工智能 > 正文

浪潮信息发布“源2.0-M32”开源大模型

来源:光明网2024-05-29 14:58

  5月28日,浪潮信息发布“源2.0-M32”开源大模型。“源2.0-M32”在基于“源2.0”系列大模型已有工作基础上,创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),并大幅提升了模型算力效率,模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型。

  在算法层面,源2.0-M32提出并采用了一种新型的算法结构:基于注意力机制的门控网络(Attention Router),针对MoE模型核心的专家调度策略,这种新的算法结构关注专家模型之间的协同性度量,有效解决传统门控网络下,选择两个或多个专家参与计算时关联性缺失的问题,使得专家之间协同处理数据的水平大为提升。源2.0-M32采用源2.0-2B为基础模型设计,沿用并融合局部过滤增强的注意力机制(LFA, Localized Filtering-based Attention),通过先学习相邻词之间的关联性,然后再计算全局关联性的方法,能够更好地学习到自然语言的局部和全局的语言特征,对于自然语言的关联语义理解更准确,进而提升了模型精度。

  在数据层面,源2.0-M32基于2万亿的token进行训练、覆盖万亿量级的代码、中英文书籍、百科、论文及合成数据。大幅扩展代码数据占比至47.5%,从6类最流行的代码扩充至619类,并通过对代码中英文注释的翻译,将中文代码数据量增大至1800亿token。结合高效的数据清洗流程,满足大模型训练“丰富性、全面性、高质量”的数据集需求。基于这些数据的整合和扩展,源2.0-M32在代码生成、代码理解、代码推理、数学求解等方面有着出色的表现。

  在算力层面,源2.0-M32采用了流水并行的方法,综合运用流水线并行+数据并行的策略,显著降低了大模型对芯片间P2P带宽的需求,为硬件差异较大训练环境提供了一种高性能的训练方法。针对MOE模型的稀疏专家计算,采用合并矩阵乘法的方法,模算效率得到大幅提升。

  基于在算法、数据和算力方面全面创新,源2.0-M32的性能得以大幅提升,在多个业界主流的评测任务中,展示出了较为先进的能力表现,在MATH(数学竞赛)、ARC-C(科学推理)榜单上超越了拥有700亿参数的LLaMA3大模型。

  源2.0-M32大幅提升了模型算力效率,在实现与业界领先开源大模型性能相当的同时,显著降低了在模型训练、微调和推理所需的算力开销。在模型推理运行阶段,M32处理每token所需算力为7.4GFLOPs,而LLaMA3-70B所需算力为140GFLOPs。在模型微调训练阶段,对1万条平均长度为1024 token的样本进行全量微调,M32消耗算力约0.0026PD(PetaFLOPs/s-day),而LLaMA3消耗算力约为0.05PD。M32凭借特别优化设计的模型架构,在仅激活37亿参数的情况下,取得了和700亿参数LLaMA3相当的性能水平,而所消耗算力仅为LLaMA3的1/19,从而实现了更高的模算效率。

  浪潮信息人工智能首席科学家吴韶华表示:当前业界大模型在性能不断提升的同时,也面临着所消耗算力大幅攀升的问题,对企业落地应用大模型带来了极大的困难和挑战。源2.0-M32是浪潮信息在大模型领域持续耕耘的最新探索成果,通过在算法、数据、算力等方面的全面创新,M32不仅可以提供与业界领先开源大模型相当的性能,更可以大幅降低大模型所需算力消耗。大幅提升的模算效率将为企业开发应用生成式AI提供模型高性能、算力低门槛的高效路径。M32开源大模型配合企业大模型开发平台EPAI(Enterprise Platform of AI),将助力企业实现更快的技术迭代与高效的应用落地,为人工智能产业的发展提供坚实的底座和成长的土壤,加速产业智能化进程。

  据悉,源2.0-M32将持续采用全面开源策略,全系列模型参数和代码均可免费下载使用。(柯岩)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 习近平向2024年世界互联网大会乌镇峰会视频致贺

  • 焊花璀璨,铸就制造强国之路

独家策划

推荐阅读
全海深光电缆绞车系统“海威GD11000”,日前随广州海洋地质调查局“海洋地质二号”船在我国南海完成了首个航次的深海调查任务。
2024-11-20 09:21
近日,中国科学院兰州化学物理研究所研究员何林团队与武汉大学教授雷爱文团队合作,在催化羰基化领域取得重要进展——成功利用一氧化碳或二氧化碳替代剧毒光气,高效合成含氮羰基化合物非对称脲。。
2024-11-20 09:24
这种菌能够迅速分解番茄、辣椒、娃娃菜等多种蔬菜尾菜,并具有促进作物生长、拮抗土传病原菌等功能特性。在此基础上,课题组进一步研发了“蔬菜尾菜+快速腐解菌+有机肥+功能菌”四位一体的原位还田技术。
2024-11-20 09:20
11月18日,在沪渝蓉高铁全线控制性咽喉工程崇太长江隧道内,我国盾构隧道智能建造V2.0技术体系正式在“领航号”盾构机成功应用
2024-11-20 09:19
19日,四川、重庆、贵州三省市同步首发动力型锂电池试运专列,这是我国铁路首次大规模试运输动力锂电池,将助力国产动力锂电池产品的全球流通。
2024-11-20 09:13
近年来,北京市延庆区大力发展低空经济,2023年相关产业产值达23.3亿元。天气渐冷,北京八达岭长城脚下,中关村延庆园内的低空经济产业园依旧热火朝天,一派繁忙景象。
2024-11-19 09:50
据最新一期《自然·化学》杂志报道,美国加州大学圣迭戈分校团队在最新研究中给出了一个涉及两种简单分子间反应的精妙解释。
2024-11-19 09:47
利用样地观测数据、空间分析和树线模型模拟,中国科学院青藏高原研究所研究员梁尔源等人系统分析了尼泊尔珠峰国家公园和安纳普纳保护区混交林树线,揭示了糙皮桦和喜马拉雅冷杉的种群更新动态和树线位置变化。
2024-11-19 09:46
机器人服务员、咖啡师、宠物……各种机器人让人目不暇接。自动载人飞行器,无人机、无人车、无人船……智能驾驶技术遍布“海陆空”。11月14日至16日,第二十六届中国国际高新技术成果交易会在广东深圳举行。
2024-11-19 04:55
近日,记者从湖北省神农架林区林业管理局野保科开展的陆生野生脊椎类动物普查中获悉,神农架现有陆生野生脊椎类动物710种,比原来的493种增加217种。
2024-11-19 05:00
北京时间11月15日23时13分,天舟八号货运飞船在文昌航天发射场由长征七号遥九运载火箭成功发射。自中国空间站建造以来,空间应用系统已在轨开展了百余项科学实验和应用试验,阶段性研究成果持续产出。
2024-11-18 10:27
中国科学院生物物理研究所王晓群研究员课题组、广东省智能科学与技术研究院张旭院士课题组和北京师范大学吴倩教授课题组合作,深入解析了人类背根神经节(DRG)发育过程中调控多种感觉神经元分化的多层级信号通路,并成功构建了人类DRG类器官(hDRGOs)模型。通过比较人类和小鼠的感觉神经元发育,研究人员发现两者在发育进程、基因表达谱和细胞亚型上存在差异。
2024-11-18 10:24
党的二十届三中全会提出,发展通用航空和低空经济。航空航天民航高校应发挥特色优势,形成“航空+”的多元化低空经济专业型人才培养模式,促进低空经济科技链、人才链、产业链的有机衔接。
2024-11-18 10:21
中北大学极端环境特种传感与测试创新研究团队成员正在围绕近期发射任务进行产品研发。日前,第28届“中国青年五四奖章”评选揭晓,中北大学极端环境特种传感与测试创新研究团队获“中国青年五四奖章集体”荣誉称号。
2024-11-18 10:16
据中国载人航天工程办公室消息,天舟七号货运飞船已于11月17日21时25分受控再入大气层。 天舟七号货运飞船于2024年1月17日在文昌航天发射场发射入轨,装载了航天员在轨驻留消耗品、推进剂、应用实(试)验装置等物资。
2024-11-18 10:14
一声战机轰鸣划破长空,一柄银色利剑直冲天际。此次歼-35A敢于摘掉面纱公之于众,不是因为它不再神秘,而是因为它拥有基于实力、能力、国力上的强军自信与大国自信。
2024-11-15 09:20
我国科学家目前已完成八条全球主要海沟深渊的载人深潜科考,创造多项世界载人深潜作业和科考新纪录,在深渊深海地质、生命与环境科学领域取得了一系列原创性重大发现和科考成果。
2024-11-15 09:16
我们必须坚持科技创新的战略先导地位,开辟新领域新赛道,在全球科技竞争中抢占先机,在新兴产业、未来产业发展中赢得主动权。
2024-11-15 09:12
该项技术由华中科技大学国家脉冲强磁场科学中心与东方电气集团东方电机有限公司、东莞磁脉电气科技有限公司合作完成。
2024-11-15 09:12
120公斤推力级涡喷发动机KP12可配装多用途无人机开展灾情监测、空中消防、物资投送、通讯中继等。
2024-11-15 09:11
加载更多