点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:源2.0-M32大模型发布4bit/8bit量化版
首页> 科技频道> 互联网 > 正文

源2.0-M32大模型发布4bit/8bit量化版

来源:光明网2024-08-24 10:52

  近日,浪潮信息发布源2.0-M32大模型4bit和8bit量化版,性能比肩700亿参数的LLaMA3开源大模型。4bit量化版推理运行显存仅需23.27GB,处理每token所需算力约为1.9 GFLOPs,算力消耗仅为同等当量大模型LLaMA3-70B的1/80。而LLaMA3-70B运行显存为160GB,所需算力为140GFLOPs。

  源2.0-M32量化版是“源”大模型团队为进一步提高模算效率,降低大模型部署运行的计算资源要求而推出的版本,通过采用领先的量化技术,将原模型精度量化至int4和int8级别,并保持模型性能基本不变。源2.0-M32量化版提高了模型部署加载速度和多线程推理效率,在不同硬件和软件环境中均能高效运行,降低了模型移植和部署门槛,让用户使用更少的计算资源,就能获取源2.0-M32大模型的强大能力。

源2.0-M32大模型发布4bit/8bit量化版

  源2.0-M32大模型是浪潮信息“源2.0”系列大模型的最新版本,其创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型,大幅提升了模型算力效率。

  模型量化(Model Quantization)是优化大模型推理的一种主流技术,它显著减少了模型的内存占用和计算资源消耗,从而加速推理过程。然而,模型量化可能会影响模型的性能。如何在压缩模型的同时维持其精度,是量化技术面临的核心挑战。

  源2.0-M32大模型研发团队深入分析当前主流的量化方案,综合评估模型压缩效果和精度损失表现,最终采用了GPTQ量化方法,并采用AutoGPTQ作为量化框架。为了确保模型精度最大化,一方面定制化适配了适合源2.0-M32结构的算子,提高了模型的部署加载速度和多线程推理效率,实现高并发推理;另一方面对需要量化的中间层(inter_layers)进行了严格评估和筛选,确定了最佳的量化层。从而成功将模型精度量化至int4和int8级别,在模型精度几乎无损的前提下,提升模型压缩效果、增加推理吞吐量和降低计算成本,使其更易于部署到移动设备和边缘设备上。

  评测结果显示,源2.0-M32量化版在多个业界主流的评测任务中性能表现突出,特别是在MATH(数学竞赛)、ARC-C(科学推理)任务中,比肩拥有700亿参数的LLaMA3大模型。

  源2.0-M32大模型量化版在保持推理性能的前提下,显著降低了计算资源消耗和内存占用,其采用的GPTQ量化方法通过精细调整,成功将模型适配至int4和int8精度级别。通过定制化算子优化,源2.0-M32量化版实现了模型结构的深度适配和性能的显著提升,确保在不同硬件和软件环境中均能高效运行。未来,随着量化技术的进一步优化和应用场景的拓展,源2.0-M32量化版有望在移动设备和边缘计算等领域发挥更广泛的作用,为用户提供更高效的智能服务。(科文)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 迎接英雄回家

  • 上海首条穿越长江的轨道交通工程实现全线轨道贯通

独家策划

推荐阅读
当AI成为企业的核心生产力,工业时代延续百年的科层制必然走向瓦解,一套全新的、适配AI时代的组织规则正在被重新书写。
2026-04-22 14:19
2026年“5·18国际博物馆日”,首都博物馆将推出年度重磅展览——“玉米·黄金·美洲豹:玛雅与安第斯古代文明大展”,约800件珍贵文物将亮相,带观众走进美洲古代文明。
2026-04-22 09:41
中国气象局日前发布首批珍贵一级气象档案名录。中国气象局气象档案馆收藏的“1885—1944年猴矶岛海关气象月总簿”、天津市气象档案馆收藏的“1890—1931年英租界工部局工程处测候所气象统计表”、辽宁省气象档案馆收藏的“1951年中央人民政府人民革命军事委员会气象局全国气象工作会议合影(照片)”等59组气象档案被纳入首批珍贵一级气象档案名录。
2026-04-22 09:40
环节动物是地球上物种最丰富、生态分布最广的动物门类之一。现生的环节动物传统上分为多毛类(如沙蚕和浮蚕)、寡毛类(如蚯蚓)和蛭类(如蚂蟥)。
2026-04-22 09:39
近年来,随着人工智能、机器人等技术的飞快发展,我国自主研发的人形机器人“行者泰山”“天工”“青龙”等频频“破圈”。
2026-04-22 09:31
《报告》展望,未来10年,我国粮食和重要农产品综合生产能力将显著增强,多元化食物供给体系将更加完善,农产品供需将迈向高水平动态平衡新阶段。
2026-04-22 09:29
记者从生态环境部获悉:近日,我国在酒泉卫星发射中心用长征四号丙运载火箭,成功将高精度温室气体综合探测卫星发射进入预定轨道,发射任务获得圆满成功。
2026-04-21 10:34
中医药是中国古代科学的瑰宝,凝聚着中华民族几千年来的健康养生理念及实践经验。“十五五”规划明确提出,要“推进中医药传承创新”,法治作为治国理政的基本方式,能够为中医药传承创新提供坚实保障。要充分发挥法治的固根本、稳预期、利长远作用,以高水平法治赋能中医药传承创新,让中医药这一千年瑰宝在时代浪潮中焕发新的生机与活力,为健康中国建设注入强劲动能。
2026-04-21 10:31
当下,春播春管自南向北次第展开,正是决定一年收成的重要时节。广袤田畴上,各地各部门抢抓农时促生产,科技气息漫遍阡陌,一幅生机盎然的春景图全面铺展。向科技要产能,以智慧启春耕,农业新质生产力在田野间落地生势,成为做好春播春管的底气。
2026-04-21 10:29
网络上针对牛奶到底能不能空腹喝的讨论从不曾停止。如果你空腹喝牛奶后,半小时到两小时内出现腹胀、肚子咕咕叫、排气、腹泻,那很可能是乳糖不耐受。空腹喝牛奶不会“伤胃”,反而可能“养胃”。
2026-04-21 10:26
安徽合肥的科大国盾量子技术股份有限公司内,展出了各类量子移动安全应用产品。合肥近年来不断强化“沿途下蛋”机制,通过企业、资本、科技的融合,助力大科学装置诞生科技成果,并让其孵化走向市场。
2026-04-21 10:25
正值春耕关键期,河南滑县的万亩麦田里,种粮大户不再需要徒步巡查耕地,只需轻点手机,卫星遥感图便将田块边界、墒情分布与作物长势清晰呈现。
2026-04-20 09:51
在苏州大学江苏省先进负碳技术重点实验室,纳米科学技术学院博士生郁操正操作X射线光电子能谱仪,分析一块特殊的测试样品。张晓宏表示,学校将继续深化“学术大师+创新团队”模式,完善交叉课程体系,培养出更多能服务地方产业、对接国家战略、为新质生产力助力的拔尖创新人才。
2026-04-20 09:47
绿色设计不仅是实现碳达峰、碳中和目标的关键工具,更是推动产业转型升级、培育新质生产力的源头性驱动力。“十五五”规划纲要明确提出:“鼓励企业提高绿色设计和制造水平,降低产品全生命周期能源资源消耗和生态环境影响。
2026-04-20 09:44
当前,全球具身智能产业进入从实验室研发到产业化落地的关键跃升期,成为大国科技博弈的重点领域。具身智能产业横跨人工智能、高端制造、新材料、电子信息等多元领域,唯有系统集成、协同创新才能释放最大效能。
2026-04-20 09:43
飞机即将着陆,一位怀抱婴儿的年轻妈妈突然求助——她头晕、想吐。这本书是谭先杰沉淀十多年的健康传播实践心得,也是他投身医学科普以来,对“如何做好健康科普”进行的系统性梳理。
2026-04-20 09:54
4月10日,国家网信办、国家发展改革委、工业和信息化部、公安部、市场监管总局联合公布《人工智能拟人化互动服务管理暂行办法》,自2026年7月15日起施行。”  郑庆华表示,同济大学正在推进人工智能伦理、算法治理与安全测评研究,重点攻坚用户极端情境识别、情感边界引导、未成年人身份识别等关键技术。
2026-04-20 09:47
4月19日7时30分,2026北京亦庄半程马拉松暨人形机器人半程马拉松鸣枪开跑,人形机器人与人类跑者同时从起点出发。也有专家提醒,人形机器人正步入以场景落地为核心的攻坚期,大规模量产与普及仍面临诸多挑战。
2026-04-20 09:45
记者16日从中国科学院国家空间科学中心获悉,来自该中心等单位的科研人员,通过三维数值模拟首次揭示,月球内部的金属月核在“感受”到太空磁场突变时,会像电磁感应一样产生感应电流和感应磁场,这股力量会挤压月球周围的太阳风,在月球两侧边缘形成一道特殊的“压缩带”。这项研究不仅揭示了月球导电内核在太阳风与月球相互作用中的重要作用,也为未来探测月球内部结构提供了新依据。
2026-04-17 10:30
据中国载人航天工程办公室消息,北京时间2026年4月17日01时36分,经过约5.5小时的出舱活动,神舟二十一号乘组航天员张陆、武飞、张洪章密切协同,在空间站机械臂和地面科研人员的配合支持下,圆满完成空间碎片防护装置安装、舱外设备设施巡检等任务。
2026-04-17 10:30
加载更多