点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:源2.0-M32大模型发布4bit/8bit量化版
首页> 科技频道> 互联网 > 正文

源2.0-M32大模型发布4bit/8bit量化版

来源:光明网2024-08-24 10:52

  近日,浪潮信息发布源2.0-M32大模型4bit和8bit量化版,性能比肩700亿参数的LLaMA3开源大模型。4bit量化版推理运行显存仅需23.27GB,处理每token所需算力约为1.9 GFLOPs,算力消耗仅为同等当量大模型LLaMA3-70B的1/80。而LLaMA3-70B运行显存为160GB,所需算力为140GFLOPs。

  源2.0-M32量化版是“源”大模型团队为进一步提高模算效率,降低大模型部署运行的计算资源要求而推出的版本,通过采用领先的量化技术,将原模型精度量化至int4和int8级别,并保持模型性能基本不变。源2.0-M32量化版提高了模型部署加载速度和多线程推理效率,在不同硬件和软件环境中均能高效运行,降低了模型移植和部署门槛,让用户使用更少的计算资源,就能获取源2.0-M32大模型的强大能力。

源2.0-M32大模型发布4bit/8bit量化版

  源2.0-M32大模型是浪潮信息“源2.0”系列大模型的最新版本,其创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型,大幅提升了模型算力效率。

  模型量化(Model Quantization)是优化大模型推理的一种主流技术,它显著减少了模型的内存占用和计算资源消耗,从而加速推理过程。然而,模型量化可能会影响模型的性能。如何在压缩模型的同时维持其精度,是量化技术面临的核心挑战。

  源2.0-M32大模型研发团队深入分析当前主流的量化方案,综合评估模型压缩效果和精度损失表现,最终采用了GPTQ量化方法,并采用AutoGPTQ作为量化框架。为了确保模型精度最大化,一方面定制化适配了适合源2.0-M32结构的算子,提高了模型的部署加载速度和多线程推理效率,实现高并发推理;另一方面对需要量化的中间层(inter_layers)进行了严格评估和筛选,确定了最佳的量化层。从而成功将模型精度量化至int4和int8级别,在模型精度几乎无损的前提下,提升模型压缩效果、增加推理吞吐量和降低计算成本,使其更易于部署到移动设备和边缘设备上。

  评测结果显示,源2.0-M32量化版在多个业界主流的评测任务中性能表现突出,特别是在MATH(数学竞赛)、ARC-C(科学推理)任务中,比肩拥有700亿参数的LLaMA3大模型。

  源2.0-M32大模型量化版在保持推理性能的前提下,显著降低了计算资源消耗和内存占用,其采用的GPTQ量化方法通过精细调整,成功将模型适配至int4和int8精度级别。通过定制化算子优化,源2.0-M32量化版实现了模型结构的深度适配和性能的显著提升,确保在不同硬件和软件环境中均能高效运行。未来,随着量化技术的进一步优化和应用场景的拓展,源2.0-M32量化版有望在移动设备和边缘计算等领域发挥更广泛的作用,为用户提供更高效的智能服务。(科文)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 第十七届夏季达沃斯论坛在辽宁大连举行

  • 第四届链博会:人工智能赋能千行百业

独家策划

推荐阅读
瑞士巴塞尔大学科学家研制出一款多功能纳米递药机器人,由推进模块和有效载荷模块构成,两种模块可重复使用,并能够自行组装。
2026-06-24 09:58
从“双链贯通”升级为“四链融合”,折射出中国推动科技创新与产业创新深度融合的有力步伐。
2026-06-24 09:48
该成果通过改善帕金森患者最难治疗的行走障碍,开启了个性化神经调控新篇章。
2026-06-24 09:47
国家卫生健康委23日印发《营养指导员服务技术指南(试行)》,针对营养指导员提出营养监测与调查、膳食营养状况评价、营养咨询与指导、营养配餐、营养科普教育等五方面工作的技术能力要求。
2026-06-24 09:46
国家粮食和物资储备局23日发布的最新数据显示,随着夏粮陆续收获上市,旺季收购正逐步展开。
2026-06-24 09:44
瑞典哥德堡大学和查尔姆斯理工大学研究团队在人工智能(AI)应用方面取得新成果,教会一款名为SmartTrap的AI系统使用光学镊子,从而让光镊实现了全自动运行。光镊是一种利用高度聚焦的激光束来操控微小物体的技术,其操作对象包括单个DNA分子、活细胞以及其他直径远小于发丝的微观粒子。
2026-06-23 09:40
“十五五”规划纲要提出,建立健全数据产权、流通利用、收益分配、安全治理等数据要素基础制度。
2026-06-23 09:38
上午9时,随着小浪底水利枢纽3个闸门徐徐升起,巨大水流喷涌而出,在空中形成层叠奔涌的排浪,轰鸣着冲向水面——2026年度黄河调水调沙正式启动。
2026-06-23 09:35
2026年,发布《高端科学仪器创新发展行动计划》,推进“AI+”赋能仪器创新,鼓励建设全自动“黑灯”实验室等前沿科研新范式……灵心巧手(北京)科技有限公司联合创始人左家平举起一款灵巧手向记者介绍:“我们最轻的灵巧手只有370克,但它能提起50公斤重物。
2026-06-23 09:34
中国散裂中子源科学中心与港澳8所高校合作共建大湾区首台同步辐射光源,所有谱仪面向港澳全面开放,港澳用户完成实验课题超过100项,产出系列重要成果。据了解,2025年,“深圳-香港-广州”创新集群首次跃居全球创新指数第一,“澳门-珠海”集群连续两年入围全球百强,国际科技创新中心地位进一步凸显。
2026-06-23 09:30
准确来说,“原位纳米晶限域”是一种让晶体在生长过程中“长得好又长不大”的精细调控技术。科学家在材料结晶前,预先混入一种可聚合配体,它在晶体刚冒头时原位形成一张分子级的“网”,网眼便是晶体生长的唯一空间。
2026-06-23 09:29
这就是“管中窥豹”的困境,也是当前AI辅助荧光成像面临的核心难题。团队的解决思路颇具巧思:提出了一种全新的通用型荧光成像复原网络LargePNet。
2026-06-22 09:45
6月20日,中技船舶首批9艘新能源船舶集中试航仪式在广西南宁港举行。9艘船舶包含无人驾驶智慧船、商用作业船、民用休闲船,适配执法巡逻、景区观光等各类场景,助力内河航运绿色转型。新华社发
2026-06-22 09:44
法国“科技万岁”科技创新展6月20日在巴黎闭幕。法国“科技万岁”科技创新展创立于2016年,是科技创新和初创企业的重要展示平台。图为一名男子在“科技万岁”科技创新展上体验VR设备。新华社发
2026-06-22 09:44
英国《新科学家》周刊网站在近日的报道中指出,科学家正奋力探索多条有望恢复听力的道路,新一代治疗技术正在集中爆发。对于重度或极重度听力损失者,人工耳蜗植入也能极大改善他们的生活质量。
2026-06-22 09:44
在全球产业链、供应链面临复杂性和不确定性的背景下,第四届中国国际供应链促进博览会(以下简称“链博会”)如期而至。本届链博会首次设立人工智能专区以及升级的“数智科技链”,让联合国贸易和发展会议资深经济学家梁国勇高度期待。
2026-06-22 09:44
历时8年、由全球多个机构38位科学家共同完成的一项国际研究发现,线粒体并非通过简单扩散为细胞核提供能量,而是铺设“专线”供能,即通过一种此前未知的直接物理连接将能量分子定向输送至细胞核。
2026-06-18 10:33
近日,2026年上海国际养老、辅具及康复医疗博览会落幕。本次展会直观印证,人工智能既是夯实基础养老保障的务实抓手,更是释放银发经济增长潜力的核心引擎。
2026-06-18 10:32
奇索姆不会中文,叶子不会英文,但这并没有妨碍两人在短短几分钟内就交上了朋友,她们的“秘密武器”正是人工智能(AI)。
2026-06-18 10:29
高精度感知技术如何打破实验室的“围墙”,深度融入我们的日常生活?答案,就藏在量子科技与芯片工程的交汇点——让量子“住”进芯片。
2026-06-18 10:28
加载更多