点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:源2.0-M32大模型发布4bit/8bit量化版
首页> 科技频道> 互联网 > 正文

源2.0-M32大模型发布4bit/8bit量化版

来源:光明网2024-08-24 10:52

  近日,浪潮信息发布源2.0-M32大模型4bit和8bit量化版,性能比肩700亿参数的LLaMA3开源大模型。4bit量化版推理运行显存仅需23.27GB,处理每token所需算力约为1.9 GFLOPs,算力消耗仅为同等当量大模型LLaMA3-70B的1/80。而LLaMA3-70B运行显存为160GB,所需算力为140GFLOPs。

  源2.0-M32量化版是“源”大模型团队为进一步提高模算效率,降低大模型部署运行的计算资源要求而推出的版本,通过采用领先的量化技术,将原模型精度量化至int4和int8级别,并保持模型性能基本不变。源2.0-M32量化版提高了模型部署加载速度和多线程推理效率,在不同硬件和软件环境中均能高效运行,降低了模型移植和部署门槛,让用户使用更少的计算资源,就能获取源2.0-M32大模型的强大能力。

源2.0-M32大模型发布4bit/8bit量化版

  源2.0-M32大模型是浪潮信息“源2.0”系列大模型的最新版本,其创新性地提出和采用了“基于注意力机制的门控网络”技术,构建包含32个专家(Expert)的混合专家模型(MoE),模型运行时激活参数为37亿,在业界主流基准评测中性能全面对标700亿参数的LLaMA3开源大模型,大幅提升了模型算力效率。

  模型量化(Model Quantization)是优化大模型推理的一种主流技术,它显著减少了模型的内存占用和计算资源消耗,从而加速推理过程。然而,模型量化可能会影响模型的性能。如何在压缩模型的同时维持其精度,是量化技术面临的核心挑战。

  源2.0-M32大模型研发团队深入分析当前主流的量化方案,综合评估模型压缩效果和精度损失表现,最终采用了GPTQ量化方法,并采用AutoGPTQ作为量化框架。为了确保模型精度最大化,一方面定制化适配了适合源2.0-M32结构的算子,提高了模型的部署加载速度和多线程推理效率,实现高并发推理;另一方面对需要量化的中间层(inter_layers)进行了严格评估和筛选,确定了最佳的量化层。从而成功将模型精度量化至int4和int8级别,在模型精度几乎无损的前提下,提升模型压缩效果、增加推理吞吐量和降低计算成本,使其更易于部署到移动设备和边缘设备上。

  评测结果显示,源2.0-M32量化版在多个业界主流的评测任务中性能表现突出,特别是在MATH(数学竞赛)、ARC-C(科学推理)任务中,比肩拥有700亿参数的LLaMA3大模型。

  源2.0-M32大模型量化版在保持推理性能的前提下,显著降低了计算资源消耗和内存占用,其采用的GPTQ量化方法通过精细调整,成功将模型适配至int4和int8精度级别。通过定制化算子优化,源2.0-M32量化版实现了模型结构的深度适配和性能的显著提升,确保在不同硬件和软件环境中均能高效运行。未来,随着量化技术的进一步优化和应用场景的拓展,源2.0-M32量化版有望在移动设备和边缘计算等领域发挥更广泛的作用,为用户提供更高效的智能服务。(科文)

[ 责编:战钊 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 习近平同巴西总统卢拉共同签署联合声明

  • 习近平同巴西总统卢拉共见记者

独家策划

推荐阅读
记者20日从中国航天科技集团一院获悉,该院抓总研制的长征十号系列火箭近日成功完成整流罩分离试验,标志着该系列火箭初样研制又迈出了坚实一步。
2024-11-21 09:14
作为战略性新兴产业,低空经济产业链条长,涵盖航空器研发与制造、低空飞行基础设施建设与运营、飞行服务与保障等产业,对构建现代产业体系具有重要作用。
2024-11-21 09:12
工业革命改变了世界面貌,为人类生产生活带来深远影响。当今世界,人工智能迅猛发展,推动人类社会深度变革。在此过程中,电力行业也在逐步向数字化和智能化转型。
2024-11-21 09:10
数据显示,2023年我国低空经济规模超5000亿元,增速超过33%,2030年有望达到2万亿元。2024年以来,全国已有超过26个省(区、市)将低空经济写进政府工作报告。
2024-11-21 09:09
日前,国际学术期刊《自然·通讯》在线刊发江西省农业科学院原院长颜龙安院士团队联合河北大学杜会龙教授团队的研究成果:首个稻属最全超级泛基因组图谱绘制成功。
2024-11-21 09:09
全海深光电缆绞车系统“海威GD11000”,日前随广州海洋地质调查局“海洋地质二号”船在我国南海完成了首个航次的深海调查任务。
2024-11-20 09:21
近日,中国科学院兰州化学物理研究所研究员何林团队与武汉大学教授雷爱文团队合作,在催化羰基化领域取得重要进展——成功利用一氧化碳或二氧化碳替代剧毒光气,高效合成含氮羰基化合物非对称脲。。
2024-11-20 09:24
这种菌能够迅速分解番茄、辣椒、娃娃菜等多种蔬菜尾菜,并具有促进作物生长、拮抗土传病原菌等功能特性。在此基础上,课题组进一步研发了“蔬菜尾菜+快速腐解菌+有机肥+功能菌”四位一体的原位还田技术。
2024-11-20 09:20
11月18日,在沪渝蓉高铁全线控制性咽喉工程崇太长江隧道内,我国盾构隧道智能建造V2.0技术体系正式在“领航号”盾构机成功应用
2024-11-20 09:19
19日,四川、重庆、贵州三省市同步首发动力型锂电池试运专列,这是我国铁路首次大规模试运输动力锂电池,将助力国产动力锂电池产品的全球流通。
2024-11-20 09:13
近年来,北京市延庆区大力发展低空经济,2023年相关产业产值达23.3亿元。天气渐冷,北京八达岭长城脚下,中关村延庆园内的低空经济产业园依旧热火朝天,一派繁忙景象。
2024-11-19 09:50
据最新一期《自然·化学》杂志报道,美国加州大学圣迭戈分校团队在最新研究中给出了一个涉及两种简单分子间反应的精妙解释。
2024-11-19 09:47
利用样地观测数据、空间分析和树线模型模拟,中国科学院青藏高原研究所研究员梁尔源等人系统分析了尼泊尔珠峰国家公园和安纳普纳保护区混交林树线,揭示了糙皮桦和喜马拉雅冷杉的种群更新动态和树线位置变化。
2024-11-19 09:46
机器人服务员、咖啡师、宠物……各种机器人让人目不暇接。自动载人飞行器,无人机、无人车、无人船……智能驾驶技术遍布“海陆空”。11月14日至16日,第二十六届中国国际高新技术成果交易会在广东深圳举行。
2024-11-19 04:55
近日,记者从湖北省神农架林区林业管理局野保科开展的陆生野生脊椎类动物普查中获悉,神农架现有陆生野生脊椎类动物710种,比原来的493种增加217种。
2024-11-19 05:00
北京时间11月15日23时13分,天舟八号货运飞船在文昌航天发射场由长征七号遥九运载火箭成功发射。自中国空间站建造以来,空间应用系统已在轨开展了百余项科学实验和应用试验,阶段性研究成果持续产出。
2024-11-18 10:27
中国科学院生物物理研究所王晓群研究员课题组、广东省智能科学与技术研究院张旭院士课题组和北京师范大学吴倩教授课题组合作,深入解析了人类背根神经节(DRG)发育过程中调控多种感觉神经元分化的多层级信号通路,并成功构建了人类DRG类器官(hDRGOs)模型。通过比较人类和小鼠的感觉神经元发育,研究人员发现两者在发育进程、基因表达谱和细胞亚型上存在差异。
2024-11-18 10:24
党的二十届三中全会提出,发展通用航空和低空经济。航空航天民航高校应发挥特色优势,形成“航空+”的多元化低空经济专业型人才培养模式,促进低空经济科技链、人才链、产业链的有机衔接。
2024-11-18 10:21
中北大学极端环境特种传感与测试创新研究团队成员正在围绕近期发射任务进行产品研发。日前,第28届“中国青年五四奖章”评选揭晓,中北大学极端环境特种传感与测试创新研究团队获“中国青年五四奖章集体”荣誉称号。
2024-11-18 10:16
据中国载人航天工程办公室消息,天舟七号货运飞船已于11月17日21时25分受控再入大气层。 天舟七号货运飞船于2024年1月17日在文昌航天发射场发射入轨,装载了航天员在轨驻留消耗品、推进剂、应用实(试)验装置等物资。
2024-11-18 10:14
加载更多