点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:源2.0-M32大模型发布4bit/8bit量化版
首页> 科技频道> 互联网 > 正文

源2.0-M32大模型发布4bit/8bit量化版

来源:光明网2024-08-24 10:52

  近日,浪潮信息发布源2.0-M32大模型4bit和8bit量化版,性能比肩700亿参数的LLaMA3开源大模型。4bit量化版推理运行显存仅需23.27GB,处理每token所需算力约为1.9 GFLOPs,算力消耗仅为同等当量大模型LLaMA3-70B的1/80。而LLaMA3-70B运行显存为160GB,所需算力为140GFLOPs。

  源2.0-M32量化版是“源”大模型团队为进一步提高模算效率,降低大模型部署运行的计算资源要求而推出的版本,通过采用领先的量化技术,将原模型精度量化至int4和int8级别,并保持模型性能基本不变。源2.0-M32量化版提高了模型部署加载速度和多线程推理效率,在不同硬件和软件环境中均能高效运行,降低了模型移植和部署门槛,让用户使用更少的计算资源,就能获取源2.0-M32大模型的强大能力。

源2.0-M32大模型发布4bit/8bit量化版

  源2.0-M32大模型是浪潮信息“源2.0”系列大模型的最新版本,其创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型,大幅提升了模型算力效率。

  模型量化(Model Quantization)是优化大模型推理的一种主流技术,它显著减少了模型的内存占用和计算资源消耗,从而加速推理过程。然而,模型量化可能会影响模型的性能。如何在压缩模型的同时维持其精度,是量化技术面临的核心挑战。

  源2.0-M32大模型研发团队深入分析当前主流的量化方案,综合评估模型压缩效果和精度损失表现,最终采用了GPTQ量化方法,并采用AutoGPTQ作为量化框架。为了确保模型精度最大化,一方面定制化适配了适合源2.0-M32结构的算子,提高了模型的部署加载速度和多线程推理效率,实现高并发推理;另一方面对需要量化的中间层(inter_layers)进行了严格评估和筛选,确定了最佳的量化层。从而成功将模型精度量化至int4和int8级别,在模型精度几乎无损的前提下,提升模型压缩效果、增加推理吞吐量和降低计算成本,使其更易于部署到移动设备和边缘设备上。

  评测结果显示,源2.0-M32量化版在多个业界主流的评测任务中性能表现突出,特别是在MATH(数学竞赛)、ARC-C(科学推理)任务中,比肩拥有700亿参数的LLaMA3大模型。

  源2.0-M32大模型量化版在保持推理性能的前提下,显著降低了计算资源消耗和内存占用,其采用的GPTQ量化方法通过精细调整,成功将模型适配至int4和int8精度级别。通过定制化算子优化,源2.0-M32量化版实现了模型结构的深度适配和性能的显著提升,确保在不同硬件和软件环境中均能高效运行。未来,随着量化技术的进一步优化和应用场景的拓展,源2.0-M32量化版有望在移动设备和边缘计算等领域发挥更广泛的作用,为用户提供更高效的智能服务。(科文)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 2026北京国际商业航天展开幕

  • 杭州:逛庙会 迎腊八

独家策划

推荐阅读
我国结核病防治虽成效显著,疫情持续下降,但当前形势依然严峻,防治工作任重道远。作为一名从业30多年的结核科医生,我一直专注于结核病的临床诊治与防控,从未想过自己会与结核病防治历史结缘——直到十余年前。
2026-01-23 10:13
每到冬天,许多人都会感到手脚冰凉,即使穿得很厚,也难以真正暖和起来。为什么会有这种现象?该如何有效改善?
2026-01-23 10:06
“设立教育基金是我多年的心愿,希望为学校年轻人的培养作一点贡献。”
2026-01-23 10:01
1月22日,中科宇航将微重力金属增材制造返回式科学实验载荷交付于中国科学院力学研究所。这台由力学所自主研制的载荷,搭载于中科宇航力鸿一号遥一飞行器,于1月12日成功开展我国首次太空金属增材制造(即“3D打印”)实验。据悉,这是我国首次基于火箭平台实施太空金属增材制造返回式科学实验。
2026-01-23 09:48
团队所制备的“纤维芯片”中,电子元件(如晶体管)集成密度达10万个/厘米,通过晶体管高效互连,可实现数字、模拟电路运算等功能。而在虚拟现实领域,基于“纤维芯片”所构建的智能触觉手套适用于远程手术组织硬度感知、虚拟道具交互等场景,有望极大提升用户与虚拟环境的交互体验。
2026-01-23 09:48
扎实推进科普智库各项建设工作,为实现2035年“终结结核病流行”目标注入强劲的思想动力与坚实的行动支撑。
2026-01-22 18:44
国家能源局21日发布的数据显示,截至2025年12月底,我国电动汽车充电设施数量达2009.2万个,突破2000万大关。方案提出,到2027年底,将在全国范围内建成2800万个充电设施,提供超3亿千瓦的公共充电容量,满足超过8000万辆电动汽车充电需求,实现充电服务能力的翻倍增长。
2026-01-22 09:31
正因如此,团队创新性转向了模拟计算这一新兴赛道,成功研制出基于阻变存储器的非负矩阵分解模拟计算求解器。“这项工作为非负矩阵分解这类约束优化问题的实时求解开辟了新路径,展现了模拟计算处理现实复杂数据的巨大潜力。
2026-01-22 09:28
对于成千上万的心脏病患者来说,植入心脏起搏器是维持生命节律的重要方式。该起搏器设计极度微型化,生物相容性优异,可通过微创导管经股静脉植入心脏内部,大大降低了手术创伤。
2026-01-22 09:27
这是一种生物分子磁敏感荧光蛋白(MFP),能与磁场和无线电波相互作用,其特性正源于蛋白质内部的量子力学效应。研究团队首先开发出一种原型成像仪器,能够利用类似磁共振成像(MRI)的原理,对经过人工改造的蛋白质进行体内定位。
2026-01-22 09:44
20日,海南省脑空间信息学与脑机接口技术创新中心揭牌。据了解,海南大学近年来在全脑成像技术研发、脑图谱绘制等领域取得多项重大突破,并成功研发了高通量低功耗采集及刺激芯片、高自由度神经刺激芯片等多款脑机接口专用芯片,还构建了神经系统疾病灵长类动物模型研发技术体系,为脑科学基础与转化研究、脑机接口技术发展提供了技术支撑。
2026-01-22 09:30
光明日报北京1月21日电 记者王美莹、通讯员丁艳青从中国地震局获悉,近日,我国地震行业首个国家级与省级联动的网络安全管理平台正式建成并投入使用。目前,该平台已投入业务运行,显著提升了全国地震行业网络安全的整体防护水平,为业务平稳运行提供了坚实保障。
2026-01-22 09:29
随着中国第42次南极考察队队员陈龙耀从东南极西福尔丘陵地区裸露的岩壁敲下第一块岩石样本,中山站度夏地质考察工作正式启动。
2026-01-21 09:08
这套“地震断层模拟试验装置”由中国工程院院士、中国地震局工程力学研究所名誉所长谢礼立领衔的团队历时4年攻关研制完成,已成功通过验收。
2026-01-21 09:02
长期以来,半导体面临一个难题:我们知道下一代材料的性能会更好,却往往不知道如何将它制造出来。这项材料工艺革新解决了从第三代到第四代半导体都面临的共性散热难题,为后续的性能爆发奠定了关键基础。
2026-01-21 09:01
该团队通过对比研究嫦娥六号月球背面样品与嫦娥五号月球正面样品,发现嫦娥六号样品中的碳结构具有更明显的缺陷特征,这可能与月球背面经历的更强烈的微陨石撞击历史有关。
2026-01-21 09:00
近日,在国新办举行的新闻发布会上,海关总署相关负责人介绍,2025年中国高技术产品出口增长13.2%,工业机器人出口增长48.7%,并首次超过进口,我国成为工业机器人净出口国。
2026-01-21 08:56
2025年C919安全载客超过400万人次,而且今年又新开了广州往返南京的航线。
2026-01-20 07:00
工业和信息化部、国家发展改革委等五部门日前联合印发《关于开展零碳工厂建设工作的指导意见》。
2026-01-20 03:25
工业和信息化部日前印发最新修订的《优质中小企业梯度培育管理办法》,将科技型中小企业纳入优质中小企业梯度培育范围。办法自2026年4月1日起实施。
2026-01-20 03:20
加载更多