点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:元脉网络加速网络创新变革 赋能AI发展
首页> 科技频道> 互联网 > 正文

元脉网络加速网络创新变革 赋能AI发展

来源:光明网2025-08-12 19:12

  8月9日,以“智联万物 网聚未来”为主题的2025 AI网络技术应用创新大会在京召开。浪潮信息旗下元脉网络副总经理陈翔发表主题为“元脉高性能AI网络,助力算力潜能释放”的演讲,详细介绍了元脉网络在AI网络上的创新与实践。

元脉网络加速网络创新变革 赋能AI发展

  元脉网络副总经理 陈翔

  AI业务规模化发展 三大挑战亟待解决

  随着人工智能技术的迅猛发展,智算中心的集群规模持续扩大,AI网络建设亟需攻克在“部署效率、系统稳定性、资源负载”三方面的挑战。

  当前,AI应用正呈现与业务深度渗透融合的态势,“如何提高部署效率、实现业务快速上线”已成为AI网络建设面临的首要问题。然而,集群规模的急速扩张,大幅提升了网络部署与调优的难度。以传统RoCE技术为例,其拥塞控制主要采用DCQCN技术,而该技术的参数需进行针对性调优,这直接导致拥塞控制部署流程复杂,进而影响业务上线效率。

  集群建设涉及 GPU、网络、光模块等大量组件及复杂协议栈,当前训练流量以大象流为主,这类流量具有同步突发特性,易因通信等待造成大量算力损耗;与此同时,卡间通信还陷入“训练规模越大,平均无故障时间越高”的悖论。据业界公开数据显示,在AI系统故障中,网络因素占比超10%,已成为制约AI技术发展的重要瓶颈。

  随着大模型框架的陆续开源,在业内激发出新一轮部署热潮。但大模型的快速部署,也让模型内部出现“训练+推理”混跑的连锁反应,在这样多任务混跑条件下部署的网络,会出现性能下降、流量相互干扰、及网络资源负载不均衡等问题。

  元脉网络打造高性能、高可靠AI Fabric方案

  为解决上述问题,元脉网络推出高性能、高可靠的AI Fabric方案。该方案由元脉RoCE技术、AI Fabric交换机、及智能运管平台三大核心组件构成,可以实现AI网络的端网一键部署、流量精准可视、故障智能预测。

  在部署效率和稳定性上,元脉网络智能运管平台ICE支持端网一键部署,可以统一纳管交换机、网卡、光模块、GPU、服务器等设备,实现拓扑配置一键校验、全网自动上线。同时,支持训前一键NCCL压力测试,将部署时间从数周缩短到数天,极大简化用户的运维部署成本。

  此外,元脉网络AI Fabric方案搭建了更先进的高精度遥测核心技术,可实现AI流量的精准可视。

  三级“可靠”加固 AI网络“安全感”拉满

  为提高智算中心集群网络的可靠性,元脉网络从“设备-链路-系统”三个维度进行可靠性加固,降低智算中心建设过程中的单点故障率,提升系统无故障训练时间,激发算力潜能。

  元脉网络AI Fabric方案内置独创的IGE智能防护引擎,硬件层面采用RAS可靠性架构设计,对所有关键部件实施冗余备份,真正实现“单一设备失效,整个系统无感运行”;软件层面采用模块化架构,将业务模块进行容器化隔离部署,确保各模块独立运行、互不干扰,同时为关键模块配备热重启与热升级功能,充分满足AI网络环境的高稳定性要求;此外,通过独立的管理监控平台OpenBMC,提供更高级别的安全防护与可靠性保障,全方位适配AI时代数据中心的管理需求。

  由于集群规模庞大,光模块数量众多,一旦光模块发生故障,将极大影响大模型的训练进程。对此,元脉网络AI Fabric方案可实现对光模块各项指标的精准监控,能够实时掌握其健康状态并提前预警,达到故障“主动预警、提前干预”的目的,有效减少训练中断的情况,降低故障带来的影响。

  在系统级可靠性设计方面,元脉网络AI Fabric方案具备多重技术优势。一是采用智能负载均衡技术,当链路发生故障时,智能负载均衡可依据全局链路状态,重新均衡AI流量,性能较传统RoCE领先2.3倍;针对单平面架构易出现单点故障的风险,方案采用多平面架构技术,为算力持续可用提供坚实保障,不仅可以实现 AI 通信零中断,更使有效训练时长占比高达99%。(张梦凡)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 昆明:东风坝开合浮桥正式对市民开放

  • 美国联邦政府再“停摆”的首日

独家策划

推荐阅读
科普资源“需求侧”井喷,“供给侧”该如何应对?
2025-09-30 02:50
从今天起,我们不妨每天给孩子留出30分钟,让他们把第一个“为什么”写下来;不妨对孩子说一句“这个问题真有意思,一起找答案”;不妨在课堂上把“解题步骤”暂时收起,让学生先猜、先试,让好奇心重新成为我们最闪耀的指南针。
2025-09-30 04:05
这个秋天,北京航空航天大学的一批新生将开启一段独特的学习旅程:从大二开始,他们将亲手参与设计一架低空飞行器,直至它真正试飞升空。想象一下,课堂上学到的公式和图纸,几年后竟能化作低空飞行器飞向蓝天,多么振奋人心!这不是科幻电影,而是北航在全国率先开设的“低空技术与工程”专业推出的“项目制人才培养”真实场景。
2025-09-30 04:05
时代浪潮奔涌,技术创新日新月异,国家发展对高素质应用型人才的需求比以往任何时候都更为迫切。由“中国制造”迈向“中国智造”,从关键技术的突破到现代产业体系的构建,处处都需要既掌握扎实理论知识,又具备卓越实践能力的青年英才。
2025-09-30 04:05
辽中凹陷位于渤海北部海域,平均水深22米。探井JZ27-6-3井钻遇油气层57.4米,完钻井深1925米。经测试,该井日产原油约500吨,日产天然气约2万立方米。
2025-09-30 04:05
2025年全国古树名木保护科普宣传周活动29日在广州启动。记者从启动仪式上获悉,为进一步加强古树名木保护,我国已启动第三次全国古树名木资源普查,并严格落实《古树名木保护条例》,按照“一树一策”“一群一策”原则,持续推进科学保护管理,推动古树名木高水平保护和高质量发展。
2025-09-30 04:05
成功攻克了近距离飞行与高精度操作难以兼顾的核心技术难题
2025-09-30 02:50
当科研人员在各自领域里突飞猛进时,科幻创作需要正视专业壁垒与认知鸿沟,更重要的是寻找方法跨越鸿沟。
2025-09-30 02:50
健全大联合、广协同、全覆盖、共建共治共享的国家科普体系,全面构筑新时代国家科普能力
2025-09-30 02:50
建设海洋强国,离不开海洋文化等软实力的支撑。
2025-09-29 09:22
2025年世界新能源汽车大会27日在海南海口开幕。大会以“产业变革与可持续发展”为主题,策划了18场会议、2场闭门会议、技术展览、科技评选和系列科普活动。
2025-09-29 05:25
国家“十四五”规划重点工程——青藏直流二期扩建工程28日正式投运,可将青海与西藏之间的输电能力提高一倍,达到120万千瓦,对于提高西藏电力供应保障能力,促进清洁能源大范围优化配置,服务建设新型电力系统具有重要意义。
2025-09-29 05:25
日前,第五届世界生物圈保护区大会在浙江杭州落下帷幕。这场十年一届的盛会首次在亚洲举行,各方代表齐聚一堂,汇聚共识,共同探讨进一步促进人与自然和谐共生、实现可持续发展的思路与举措。
2025-09-29 05:25
科普是国家创新体系的重要组成部分,是实现创新发展的基础性工作。
2025-09-29 03:15
“我们要做轻量化,就是要做轻量化生态,要建设轻量化生态系统。”在2025(第十八届)汽车轻量化大会(以下简称“大会”)上,北汽福田欧曼事业部研发中心底盘系统高级主任工程师兼公司轻量化负责人李军代表公司获得“汽车轻量化创新成果大赛卓越成果奖”,展现了中国商用车轻量化技术的最新突破。
2025-09-29 07:19
目前,我国专业技术人才超过8000万人,技能劳动者总量超过2.2亿人,其中高技能人才超过7200万人,为推动高水平科技自立自强、建设现代化产业体系提供了坚实人才支撑。
2025-09-28 09:45
9月27日20时40分,我国在太原卫星发射中心使用长征六号改运载火箭,成功将卫星互联网低轨11组卫星发射升空,卫星顺利进入预定轨道,发射任务获得圆满成功。
2025-09-28 09:39
今天,横跨贵州省贞丰县与关岭县的世界第一高桥——六安高速花江峡谷大桥正式建成通车。大桥通车后,原来需要绕行2小时的花江峡谷两岸贞丰县至关岭县,如今仅需2分钟即可直达,真正实现了“天堑变通途”。
2025-09-28 09:39
近日,2025亚太机器人世界杯青岛国际邀请赛在青岛西海岸新区举行,来自12个国家和地区的84支代表队同台竞技。在各类比赛中,人形机器人足球赛吸引了最多观众“观战”。
2025-09-28 04:15
加载更多