点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:元脉网络加速网络创新变革 赋能AI发展
首页> 科技频道> 互联网 > 正文

元脉网络加速网络创新变革 赋能AI发展

来源:光明网2025-08-12 19:12

  8月9日,以“智联万物 网聚未来”为主题的2025 AI网络技术应用创新大会在京召开。浪潮信息旗下元脉网络副总经理陈翔发表主题为“元脉高性能AI网络,助力算力潜能释放”的演讲,详细介绍了元脉网络在AI网络上的创新与实践。

元脉网络加速网络创新变革 赋能AI发展

  元脉网络副总经理 陈翔

  AI业务规模化发展 三大挑战亟待解决

  随着人工智能技术的迅猛发展,智算中心的集群规模持续扩大,AI网络建设亟需攻克在“部署效率、系统稳定性、资源负载”三方面的挑战。

  当前,AI应用正呈现与业务深度渗透融合的态势,“如何提高部署效率、实现业务快速上线”已成为AI网络建设面临的首要问题。然而,集群规模的急速扩张,大幅提升了网络部署与调优的难度。以传统RoCE技术为例,其拥塞控制主要采用DCQCN技术,而该技术的参数需进行针对性调优,这直接导致拥塞控制部署流程复杂,进而影响业务上线效率。

  集群建设涉及 GPU、网络、光模块等大量组件及复杂协议栈,当前训练流量以大象流为主,这类流量具有同步突发特性,易因通信等待造成大量算力损耗;与此同时,卡间通信还陷入“训练规模越大,平均无故障时间越高”的悖论。据业界公开数据显示,在AI系统故障中,网络因素占比超10%,已成为制约AI技术发展的重要瓶颈。

  随着大模型框架的陆续开源,在业内激发出新一轮部署热潮。但大模型的快速部署,也让模型内部出现“训练+推理”混跑的连锁反应,在这样多任务混跑条件下部署的网络,会出现性能下降、流量相互干扰、及网络资源负载不均衡等问题。

  元脉网络打造高性能、高可靠AI Fabric方案

  为解决上述问题,元脉网络推出高性能、高可靠的AI Fabric方案。该方案由元脉RoCE技术、AI Fabric交换机、及智能运管平台三大核心组件构成,可以实现AI网络的端网一键部署、流量精准可视、故障智能预测。

  在部署效率和稳定性上,元脉网络智能运管平台ICE支持端网一键部署,可以统一纳管交换机、网卡、光模块、GPU、服务器等设备,实现拓扑配置一键校验、全网自动上线。同时,支持训前一键NCCL压力测试,将部署时间从数周缩短到数天,极大简化用户的运维部署成本。

  此外,元脉网络AI Fabric方案搭建了更先进的高精度遥测核心技术,可实现AI流量的精准可视。

  三级“可靠”加固 AI网络“安全感”拉满

  为提高智算中心集群网络的可靠性,元脉网络从“设备-链路-系统”三个维度进行可靠性加固,降低智算中心建设过程中的单点故障率,提升系统无故障训练时间,激发算力潜能。

  元脉网络AI Fabric方案内置独创的IGE智能防护引擎,硬件层面采用RAS可靠性架构设计,对所有关键部件实施冗余备份,真正实现“单一设备失效,整个系统无感运行”;软件层面采用模块化架构,将业务模块进行容器化隔离部署,确保各模块独立运行、互不干扰,同时为关键模块配备热重启与热升级功能,充分满足AI网络环境的高稳定性要求;此外,通过独立的管理监控平台OpenBMC,提供更高级别的安全防护与可靠性保障,全方位适配AI时代数据中心的管理需求。

  由于集群规模庞大,光模块数量众多,一旦光模块发生故障,将极大影响大模型的训练进程。对此,元脉网络AI Fabric方案可实现对光模块各项指标的精准监控,能够实时掌握其健康状态并提前预警,达到故障“主动预警、提前干预”的目的,有效减少训练中断的情况,降低故障带来的影响。

  在系统级可靠性设计方面,元脉网络AI Fabric方案具备多重技术优势。一是采用智能负载均衡技术,当链路发生故障时,智能负载均衡可依据全局链路状态,重新均衡AI流量,性能较传统RoCE领先2.3倍;针对单平面架构易出现单点故障的风险,方案采用多平面架构技术,为算力持续可用提供坚实保障,不仅可以实现 AI 通信零中断,更使有效训练时长占比高达99%。(张梦凡)

[ 责编:蔡琳 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 2025年服贸会媒体吹风会及场馆探营活动在京举行

  • 甘肃榆中:积极开展灾后恢复工作

独家策划

推荐阅读
团队需要从头开始,设计一款“更适合日本”的机器人:体形小巧,穿行灵活,语音系统换成日语,屏幕上的动画表情还能变换。擎朗智能目前在日本已经设立200多个技术支持点,确保常规故障能在2小时内响应,24小时内修复。
2025-08-12 10:06
夏季天气炎热,很多人喜欢去游泳馆游泳。“游泳可以提高心肺耐力和身体柔韧性,改善体脂率,因此受到越来越多人的喜爱。”潘力军说,游泳如果不注意卫生,可能感染红眼病、中耳炎和胃肠道疾病,建议做好如下防护措施:  游泳前,注意自身的健康状况。
2025-08-12 10:03
近日,随着最后一笔数据在青藏高原上录入系统,三江源国家公园正式完成自然资源确权登记。2019年,《关于统筹推进自然资源资产产权制度改革的指导意见》与《关于建立以国家公园为主体的自然保护地体系的指导意见》相继出台,“依法确权”成为基石。
2025-08-12 10:02
一般认为,宇宙中的每个星系中心都有一个超大质量黑洞,而更大的星系则拥有更大的黑洞,即超巨型黑洞。Collett表示,恒星运动学被视为黑洞质量测量的“金标准”,引力透镜效应则可以帮助团队“探测到更遥远的宇宙”。
2025-08-12 10:01
中国科学院大连化学物理研究所研究员杨维慎、彭媛团队开发了一种便捷的触发式界面反应策略,实现了二维金属-有机框架膜(MOF膜)的快速制备及高效气体分离。该研究为面向应用的MOF纳米片和超薄二维MOF膜的定制化制备提供了新思路,可满足不同应用场景下的高性能分离需求。
2025-08-12 10:00
中国科学院上海天文台科研人员最近在引力波天文学领域取得了突破性发现:双黑洞并合事件可能发生在第三个致密天体的“眼皮子底下”。
2025-08-11 09:56
日前从安徽省林业局获悉,安徽扬子鳄野外种群数量创历史新高。监测数据显示,截至2025年7月20日,扬子鳄国家级自然保护区扬子鳄产卵超3800枚,扬子鳄野外种群数量超1920条。
2025-08-11 09:53
近年来,我们团队聚焦海洋多场环境耦合机制、多体结构相互作用、多尺度耦合效应等难题,开展深度产学研用合作,研发多款海工装备。
2025-08-11 09:45
在医学和生物技术领域,实现蛋白质定向进化,使其具有新功能或改进功能至关重要。为此,美国斯克利普斯研究所的科学家开发了一个可以加速蛋白质进化的合成生物学平台T7-ORACLE。
2025-08-11 09:43
近日,科学信息分析公司爱思唯尔与香港浸会大学联合发布《传承与创新:解码中医药科学发展轨迹》报告。
2025-08-11 09:41
实验室是科技创新的重要摇篮,但里边有不少危险而又昂贵的设备,可能对科研工作者人身和财产安全造成威胁。如何织密安全防护网?
2025-08-08 10:25
中国科学技术大学俞书宏院士团队成功开发出一种可闭环生物回收的纤维素基介电薄膜,能够提高电子器件的循环利用率,从而减少电子废弃物。
2025-08-08 10:16
日前,济南量子技术研究院团队与深圳国际量子研究院团队合作,在可见光集成光学领域取得重要进展:成功研制出一套新型可见光矢量光谱分析仪。
2025-08-08 10:12
中国林科院林业所林木细胞遗传研究组近日提出了研究裸子植物生长停滞可塑性的独特模型。这一成果填补了人们对裸子植物发育可塑性认识的空白。
2025-08-08 10:11
8月6日,揽月月面着陆器着陆起飞综合验证试验在位于河北省怀来县的地外天体着陆试验场圆满完成,此次试验是我国首次进行载人航天器地外天体着陆起飞试验。
2025-08-08 10:09
近日,中国科学院大连化学物理研究所研究员吴凯丰团队采用胶体量子点溶液作为增益介质,通过法布里-珀罗谐振腔耦合及双脉冲泵浦设计,开发出连续稳定工作10天以上、能量转化效率大于17%的量子点液体激光器。
2025-08-07 10:18
近日,中国农业科学院农业基因组研究所的研究团队深入解析了中亚野猪种群在跨越欧亚大陆百万年的迁徙历程中适应环境的独特遗传密码,为理解大型哺乳动物如何应对环境变化提供了全新视角。
2025-08-07 10:18
无论是钢琴家指尖流淌出的动人旋律,还是外科医生在显微镜下的精准操作,甚至是母亲为孩子系鞋带时的温柔细致……
2025-08-07 03:40
月球,地球最亲密的邻居,它的“婴儿期”是什么样的?为破解这个谜题,中国地质大学(北京)科学研究院王水炯教授团队和中国科学院地质与地球物理研究所李秋立研究员团队合作
2025-08-07 03:40
近日,国务院常务会议讨论并原则通过了《中华人民共和国耕地保护和质量提升法(草案)》(以下简称《草案》),决定将《草案》提请全国人大常委会审议。
2025-08-07 03:40
加载更多