点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:源2.0-M32大模型发布4bit/8bit量化版
首页> 科技频道> 互联网 > 正文

源2.0-M32大模型发布4bit/8bit量化版

来源:光明网2024-08-24 10:52

  近日,浪潮信息发布源2.0-M32大模型4bit和8bit量化版,性能比肩700亿参数的LLaMA3开源大模型。4bit量化版推理运行显存仅需23.27GB,处理每token所需算力约为1.9 GFLOPs,算力消耗仅为同等当量大模型LLaMA3-70B的1/80。而LLaMA3-70B运行显存为160GB,所需算力为140GFLOPs。

  源2.0-M32量化版是“源”大模型团队为进一步提高模算效率,降低大模型部署运行的计算资源要求而推出的版本,通过采用领先的量化技术,将原模型精度量化至int4和int8级别,并保持模型性能基本不变。源2.0-M32量化版提高了模型部署加载速度和多线程推理效率,在不同硬件和软件环境中均能高效运行,降低了模型移植和部署门槛,让用户使用更少的计算资源,就能获取源2.0-M32大模型的强大能力。

源2.0-M32大模型发布4bit/8bit量化版

  源2.0-M32大模型是浪潮信息“源2.0”系列大模型的最新版本,其创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型,大幅提升了模型算力效率。

  模型量化(Model Quantization)是优化大模型推理的一种主流技术,它显著减少了模型的内存占用和计算资源消耗,从而加速推理过程。然而,模型量化可能会影响模型的性能。如何在压缩模型的同时维持其精度,是量化技术面临的核心挑战。

  源2.0-M32大模型研发团队深入分析当前主流的量化方案,综合评估模型压缩效果和精度损失表现,最终采用了GPTQ量化方法,并采用AutoGPTQ作为量化框架。为了确保模型精度最大化,一方面定制化适配了适合源2.0-M32结构的算子,提高了模型的部署加载速度和多线程推理效率,实现高并发推理;另一方面对需要量化的中间层(inter_layers)进行了严格评估和筛选,确定了最佳的量化层。从而成功将模型精度量化至int4和int8级别,在模型精度几乎无损的前提下,提升模型压缩效果、增加推理吞吐量和降低计算成本,使其更易于部署到移动设备和边缘设备上。

  评测结果显示,源2.0-M32量化版在多个业界主流的评测任务中性能表现突出,特别是在MATH(数学竞赛)、ARC-C(科学推理)任务中,比肩拥有700亿参数的LLaMA3大模型。

  源2.0-M32大模型量化版在保持推理性能的前提下,显著降低了计算资源消耗和内存占用,其采用的GPTQ量化方法通过精细调整,成功将模型适配至int4和int8精度级别。通过定制化算子优化,源2.0-M32量化版实现了模型结构的深度适配和性能的显著提升,确保在不同硬件和软件环境中均能高效运行。未来,随着量化技术的进一步优化和应用场景的拓展,源2.0-M32量化版有望在移动设备和边缘计算等领域发挥更广泛的作用,为用户提供更高效的智能服务。(科文)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 寒冬时节塔克拉玛干治沙正酣

  • 在规范中聚起外摆经营烟火气 上海激发消费新活力

独家策划

推荐阅读
工信学堂致力于推动学生人工智能素养的全面提升,助力拔尖创新型人才培养,为我国未来工信科技人才队伍储备力量。
2026-01-12 15:41
在斯图尔特的农场,赞比亚大豆科技小院首席专家、吉林农业大学教授魏健疆手把手教会当地农户“作物—菌物—肥料”闭环生产。
2026-01-12 08:59
记者1月11日从国家数据局获悉,国家数据局将进一步研究借鉴其他领域登记制度的经验做法,不断吸收社会各界的意见建议,创新建立适应数据特点的登记制度,更好推进数据流通使用,释放数据要素价值。
2026-01-12 08:54
目前团队正牵头建设贵州省人工智能实验室,将吸引更多算力产业链上下游企业集聚贵州,助力数字经济高质量发展。
2026-01-12 08:53
为适配医保业务的新形势新要求,助力中医药产业高质量发展,近日,国家医保局修订中药饮片医保编码规则。这相当于给每一味中药饮片都配上了新的“医保身份证”。
2026-01-12 08:51
以大模型为代表的新一代人工智能技术,深度赋能医疗健康领域,在医学影像判读、疾病风险预警、辅助诊疗决策等领域展现出巨大潜力和应用价值,有力助推临床诊疗模式优化升级,
2026-01-12 03:05
这条光缆,打破了地理困局,让贵州算力真正具备了“走出去”的能力。光缆为算力的灵活调配贯通了“路”,“息壤”平台如同光缆上的“智能交通指挥中心”,将西部算力资源与东部算力需求精准匹配。
2026-01-12 08:53
8日,中国载人航天工程办公室发布2025年度《中国空间站科学研究与应用进展报告》。
2026-01-09 02:45
日前,生态环境部与国家统计局联合印发《关于发布2023年电力二氧化碳排放因子的公告》,以便于不同主体核算电力消费的二氧化碳排放量。
2026-01-09 02:45
近日,中国农业科学院农产品加工研究所联合国内外科研团队,系统揭示了小麦基因型、灌溉条件、储存方式及制粉工艺影响面团流变特性及产品质量的微观和介观机制。
2026-01-09 02:45
各地要强化标准牵引,结合相关部门人工智能终端智能化分级标准制定和产品智能化等级认定等情况,合理确定补贴品类。
2026-01-09 09:05
从中国机械工业联合会获悉,“十四五”时期是我国环保装备制造行业技术创新爆发期,产业链自主可控率超90%,核心专利数量全球第一,技术装备水平跃升,国际竞争力显著提升,国际市场占有率达23.1%。
2026-01-09 02:55
CES历来是观察前沿技术走向的重要窗口。今年,一个新词被频频提及——“物理人工智能(物理AI,Physical AI)”。
2026-01-08 18:29
从7日在京召开的全国知识产权局局长会议上了解到,根据世界知识产权组织最新发布的《2025年全球创新指数报告》,我国“综合排名进前十、单项排名‘双第一’”。
2026-01-08 02:20
近日,中央农村工作会议在北京召开。会议强调,“加强农业关键核心技术攻关和科技成果高效转化应用,因地制宜发展农业新质生产力”,为做好“三农”工作提供了重要指引。
2026-01-08 02:20
时序轮转一甲子,肇始于一间实验室的中国科技考古,历经六十载深耕求索,终从一片学术荒原,昂首跻身世界学科前沿之列。六十年来,中国科技考古依靠工作者们的汗水、智慧与坚守,写成一段传奇。
2026-01-08 02:20
冰冷坚硬的金属骨架、精确运转的齿轮电机……这,是不是你脑中的“机器人”?其实,还有一种机器人:它们没有坚硬的躯壳,而是以柔软的身体探索世界,它们并不强壮,却不会轻易损坏——这,就是软体机器人。它们像章鱼、蚯蚓、水母等自然界生物一样灵动,能够弯曲、伸展、钻入狭缝,展现出前所未有的环境适应力。
2026-01-08 02:25
近日,工业和信息化部正式公布我国首批L3级有条件自动驾驶车型准入许可,两款分别适配城市拥堵、高速路段的车型将在北京、重庆指定区域开展上路试点。
2026-01-08 02:25
“激光不是自然光,它是人类创造的‘最准的尺’‘最利的刀’,更是能为人类需求精准调光的‘魔法师’。”1月6日,科学家精神百场讲坛在扬州大学开讲,中国科学院院士、天津大学教授姚建铨向现场听众分享了自己60年的科研历程与心得。
2026-01-07 02:30
以前医生判断大脑是否健康,需要进行磁共振检查,这个检查结果用的是西方人群的参考标准。
2026-01-07 02:30
加载更多