点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:元脉网络加速网络创新变革 赋能AI发展
首页> 科技频道> 互联网 > 正文

元脉网络加速网络创新变革 赋能AI发展

来源:光明网2025-08-12 19:12

  8月9日,以“智联万物 网聚未来”为主题的2025 AI网络技术应用创新大会在京召开。浪潮信息旗下元脉网络副总经理陈翔发表主题为“元脉高性能AI网络,助力算力潜能释放”的演讲,详细介绍了元脉网络在AI网络上的创新与实践。

元脉网络加速网络创新变革 赋能AI发展

  元脉网络副总经理 陈翔

  AI业务规模化发展 三大挑战亟待解决

  随着人工智能技术的迅猛发展,智算中心的集群规模持续扩大,AI网络建设亟需攻克在“部署效率、系统稳定性、资源负载”三方面的挑战。

  当前,AI应用正呈现与业务深度渗透融合的态势,“如何提高部署效率、实现业务快速上线”已成为AI网络建设面临的首要问题。然而,集群规模的急速扩张,大幅提升了网络部署与调优的难度。以传统RoCE技术为例,其拥塞控制主要采用DCQCN技术,而该技术的参数需进行针对性调优,这直接导致拥塞控制部署流程复杂,进而影响业务上线效率。

  集群建设涉及 GPU、网络、光模块等大量组件及复杂协议栈,当前训练流量以大象流为主,这类流量具有同步突发特性,易因通信等待造成大量算力损耗;与此同时,卡间通信还陷入“训练规模越大,平均无故障时间越高”的悖论。据业界公开数据显示,在AI系统故障中,网络因素占比超10%,已成为制约AI技术发展的重要瓶颈。

  随着大模型框架的陆续开源,在业内激发出新一轮部署热潮。但大模型的快速部署,也让模型内部出现“训练+推理”混跑的连锁反应,在这样多任务混跑条件下部署的网络,会出现性能下降、流量相互干扰、及网络资源负载不均衡等问题。

  元脉网络打造高性能、高可靠AI Fabric方案

  为解决上述问题,元脉网络推出高性能、高可靠的AI Fabric方案。该方案由元脉RoCE技术、AI Fabric交换机、及智能运管平台三大核心组件构成,可以实现AI网络的端网一键部署、流量精准可视、故障智能预测。

  在部署效率和稳定性上,元脉网络智能运管平台ICE支持端网一键部署,可以统一纳管交换机、网卡、光模块、GPU、服务器等设备,实现拓扑配置一键校验、全网自动上线。同时,支持训前一键NCCL压力测试,将部署时间从数周缩短到数天,极大简化用户的运维部署成本。

  此外,元脉网络AI Fabric方案搭建了更先进的高精度遥测核心技术,可实现AI流量的精准可视。

  三级“可靠”加固 AI网络“安全感”拉满

  为提高智算中心集群网络的可靠性,元脉网络从“设备-链路-系统”三个维度进行可靠性加固,降低智算中心建设过程中的单点故障率,提升系统无故障训练时间,激发算力潜能。

  元脉网络AI Fabric方案内置独创的IGE智能防护引擎,硬件层面采用RAS可靠性架构设计,对所有关键部件实施冗余备份,真正实现“单一设备失效,整个系统无感运行”;软件层面采用模块化架构,将业务模块进行容器化隔离部署,确保各模块独立运行、互不干扰,同时为关键模块配备热重启与热升级功能,充分满足AI网络环境的高稳定性要求;此外,通过独立的管理监控平台OpenBMC,提供更高级别的安全防护与可靠性保障,全方位适配AI时代数据中心的管理需求。

  由于集群规模庞大,光模块数量众多,一旦光模块发生故障,将极大影响大模型的训练进程。对此,元脉网络AI Fabric方案可实现对光模块各项指标的精准监控,能够实时掌握其健康状态并提前预警,达到故障“主动预警、提前干预”的目的,有效减少训练中断的情况,降低故障带来的影响。

  在系统级可靠性设计方面,元脉网络AI Fabric方案具备多重技术优势。一是采用智能负载均衡技术,当链路发生故障时,智能负载均衡可依据全局链路状态,重新均衡AI流量,性能较传统RoCE领先2.3倍;针对单平面架构易出现单点故障的风险,方案采用多平面架构技术,为算力持续可用提供坚实保障,不仅可以实现 AI 通信零中断,更使有效训练时长占比高达99%。(张梦凡)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 守护黄岩岛 青春在这里像浪花一样绽放

  • 新春临近 各地文旅市场火热

独家策划

推荐阅读
近日,一个名为Moltbook的社交平台突然走红。与普通网络平台不同的是,Moltbook上的用户都是AI智能体。
2026-02-14 09:21
全球规模最大的200万吨/年柴油吸附分离装置目前在中国石油广西石化稳定运行。
2026-02-14 09:16
大连理工大学赵珺教授带领师生团队正抓紧时间,为实现可重复使用运载火箭关键部件的“复用检测”技术突破全力冲刺。
2026-02-14 09:12
一场刷新人类对宇宙极端物理过程认知的高能事件,被中国科学卫星清晰捕获并成功解读。
2026-02-14 09:11
近日,中国计量科学研究院研制的锶原子光晶格钟NIM-Sr1正式获准校准国际标准时间,实现了我国光钟参与校准国际标准时间“零”的突破。
2026-02-14 09:10
装上智能仿生手,截肢患者可以轻松拿起水杯喝水;高位截瘫患者用意念移动电脑光标,操控轮椅,指挥机器狗取外卖……
2026-02-13 09:50
凌晨2时,南昌西动车组运用一所检修库内灯光如昼。“接触网已断电,安全措施准备完毕,申请登顶!”确认许可后,国铁南昌局电务段南昌西车载设备车间工长曹准与工友一前一后登上动车组车顶,对北斗天线进行全面“体检”。
2026-02-13 09:45
近日,广西涠洲岛海域发生渔船撞击布氏鲸事件,鲸鱼受伤的画面令人揪心。虽然撞鲸的并非观鲸船,但这起事件也给正处于旺季的观鲸游敲响警钟——负责任地观鲸,有边界地亲近,人与自然和谐共生图景才能真正长久。
2026-02-13 09:43
核光钟通过真空紫外激光诱导原子核跃迁,具备更高精度与强抗干扰能力,且可实现便携化应用。但研制核光钟的道路上的一个核心瓶颈,是无法研制出能激发核跃迁的连续波激光光源。
2026-02-13 09:42
2021年,王勤团队开始研发低成本、适用于牧场环境的马匹体形自动测定设备。王勤团队搜集了全球90个马群体、近40个品种的基因组信息,构建了包含2000多个个体的参考面板——这是目前全球规模最大的马基因组参考数据库。
2026-02-13 09:36
一纸锦旗山水间,杏林春暖绿意长。
2026-02-12 11:01
金星与地球大小相近,同样诞生于太阳系内侧,却有着截然不同的命运。
2026-02-12 09:41
科技部十司相关负责同志解读《调查处理规定》。
2026-02-12 09:38
《细胞》封面:猕猴屏状核细胞分类与全脑联接图谱。在当前脑图谱大科学计划研究目标迈进绘制非人灵长类介观脑图谱的关键阶段,中国科学家仍在进一步集聚全球力量,持续扩大“朋友圈”。
2026-02-12 09:25
据悉,在战略上,植物星球计划还将整体提升全球生物多样性保护和实现碳中和的生态能力,构建植物科学领域全球大科学命题国际合作的新格局。
2026-02-12 09:17
马年将至,作为一种兼具力量与速度的动物,马正受到格外的关注。
2026-02-12 09:12
工业和信息化部等五部门近日印发《关于加强信息通信业能力建设支撑低空基础设施发展的实施意见》。加强监管能力体系建设,规划无人机专用号段,推动“一机一码一号”能力建设,探索标识解析在无人机领域的应用,形成无人机通信资源精细化管理。
2026-02-11 09:25
全球森林逐渐被快生树木主导,而稳定生态系统的慢生树种正在消失。“我们关注的是极为独特的物种,它们主要集中在生物多样性丰富、生态系统联系紧密的热带和亚热带地区。“此外,在现在和未来受到干扰的地区,非本地物种可能会加剧对光、水和养分的竞争,从而使本地树木更难生存。
2026-02-11 09:32
中国科学院动物研究所研究员王红梅带领的“灵长类胚胎发育的规律解析与体外模拟团队”,用27年的接力攻坚,把灵长类早期胚胎发育这个看不见、摸不着的“黑匣子”,变成了清晰可见的“生命剧本”。
2026-02-11 09:32
截至1月28日,“横竖都是世界第一”的贵州花江峡谷大桥累计接待游客突破130万人次,通行车辆超20万辆次,持续为区域发展注入新动能。大桥带来的发展溢出效应令人瞩目,而深入大桥肌理探查,你会发现,支撑起这座庞然大物的每根细钢丝,全部都是“中国造”。
2026-02-11 09:31
加载更多