点击右上角微信好友

朋友圈

请使用浏览器分享功能进行分享

正在阅读:《开放加速规范AI服务器设计指南》发布 应对生成式AI爆发算力挑战
首页> 科技频道> 综合新闻 > 正文

《开放加速规范AI服务器设计指南》发布 应对生成式AI爆发算力挑战

来源:光明网2023-08-11 22:06

  8月10日,在OCP China Day 2023上,《开放加速规范AI服务器设计指南》(以下简称《指南》)发布。《指南》面向生成式AI应用场景,进一步发展和完善了开放加速规范AI服务器的设计理论和设计方法,将助力社区成员高效开发符合开放加速规范的AI加速卡,并大幅缩短与AI服务器的适配周期,为用户提供最佳匹配应用场景的AI算力产品方案,把握生成式AI爆发带来的算力产业巨大机遇。

  当前,生成式AI技术飞速发展,引领了新一轮AI创新浪潮。AI大模型是生成式AI的关键底座,对生产效率提升、传统产业转型升级具有重大的价值潜力,而大模型的高效训练通常需要具备千卡以上高算力AI芯片构成的AI服务器集群支撑。

  随着生成式AI加速落地,业界对配置高算力AI芯片的AI服务器需求也不断高涨。在此背景下,全球已有上百家公司投入新型AI加速芯片的开发,AI计算芯片多元化趋势凸显。由于缺乏统一的业界规范,不同厂商的AI加速芯片存在显著差异,导致不同芯片需要定制化的系统硬件平台承载,带来更高的开发成本和更长的开发周期。

  据悉,OCP是全球基础硬件技术领域覆盖面最广、最有影响力的开源组织。2019年OCP成立OAI(Open Accelerator Infrastructure)小组,对更适合超大规模深度学习训练的AI加速卡形态进行了定义,以解决多元AI加速卡形态和接口不统一的问题。2019年底,OCP正式发布了OAI-UBB(Universal Baseboard)1.0设计规范,并随后推出了基于OAI-UBB1.0规范的开放加速硬件平台,无需硬件修改即可支持不同厂商的OAM产品。近年来,以浪潮信息为代表的系统厂商研制了多款符合开放加速规范的AI服务器,实现了开放加速AI服务器的产业化实践。

  基于在开放加速计算领域的产品研发和工程实践经验,《指南》进一步发展和完善了开放加速规范AI服务器的设计理论和设计方法,提出四大设计原则、全栈设计方法,包括硬件设计参考、管理接口规范和性能测试标准,旨在帮助社区成员更快更好地开发AI加速卡并适配开放加速AI服务器,应对生成式AI的算力挑战。

  《指南》指出,开放加速规范AI服务器设计应遵循四大设计原则,即应用导向、多元开放、绿色高效、统筹设计。在此基础上,应采用多维协同设计、全面系统测试和性能测评调优的设计方法,以提高适配部署效率、系统稳定性、系统可用性。

  多维协同设计是指系统厂商和芯片厂商在规划初期要做好全方位、多维度的协同,最大化减少定制开发内容。大模型计算系统通常是一体化高集成度算力集群,包含计算、存储、网络设备,软件、框架、模型组件,机柜、制冷、供电、液冷基础设施等。只有通过多维协同,才能实现全局最优的性能、能效或TCO指标,提高系统适配和集群部署效率。《指南》给出了从节点到集群的软硬全栈参考设计。

  全面系统测试是指异构加速计算节点通常故障率高,需要更加全面、严苛的测试,才能最大程度降低系统生产、部署、运行过程中的故障风险,提高系统稳定性,减少断点对训练持续性的影响。《指南》对结构、散热、压力、稳定性、软件兼容性等方面的测试要点进行了全面梳理。

  性能测评调优是指需要对大模型加速计算系统开展多层次的性能评测和软硬件深度调优。《指南》给出了基础性能、互连性能、模型性能测试的要点和指标,并指出了针对大模型训练和推理性能调优的要点,以确保开放加速规范AI服务器能够有效完成当前主流大模型的创新应用支撑。(战钊)

[ 责编:焦子原 ]
阅读剩余全文(

相关阅读

您此时的心情

光明云投
新闻表情排行 /
  • 开心
     
    0
  • 难过
     
    0
  • 点赞
     
    0
  • 飘过
     
    0

视觉焦点

  • 云南多条高速公路正式通车运行

  • 烧脑又好玩 智能益智玩具迎来“春天”

独家策划

推荐阅读
当日,石景山区AI for Science平台正式上线,该平台由枫清科技携手火山引擎联合打造,以AI驱动科研机构与企业的科研效率革新,降低科研门槛。
2025-12-27 20:21
记者25日从国防科技大学获悉,该校磁浮团队近日在磁悬浮试验中,成功在两秒内将吨级试验车加速至700公里/小时。测试速度打破了同类型平台全球纪录,成为全球最快的超导电动磁悬浮试验速度。
2025-12-26 10:08
12月24日,中国科学院重大科技基础设施“载人潜水器与海上作业母船”用户委员会2025年度会议披露:我国“深海勇士”号、“奋斗者”号、“蛟龙”号三大载人潜水器全年完成314次深潜,累计下潜总量达1746次,2026年将向2000次目标稳步迈进。
2025-12-26 10:05
日前,国家自然科学基金委员会在北京召开国家自然科学基金首批重大非共识项目遴选会议,标志着重大非共识项目正式启动试点。国家自然科学基金委员会将深入实施并持续优化重大非共识项目遴选机制,引导广大科研人员聚焦高水平原创性科研工作狠下功夫。
2025-12-26 09:59
其实,流感和普通感冒不是一回事,用药自然不能一概而论。流感一来往往会发高烧(体温39—40摄氏度),浑身肌肉酸痛、没力气,症状重;普通感冒多是鼻塞、流鼻涕、喉咙痛,发烧也多是低热,症状轻。
2025-12-26 09:58
一项近日发表于《科学》的研究指出,像ChatGPT 这样的人工智能(AI)工具正在大幅增加论文产量。此类文本数量的不断增加,使同行评议、资金决策和科研监督变得复杂,因为越来越难区分有意义的研究成果和低价值的内容。
2025-12-26 09:56
传统探查手段在如此深的地下几乎“失明”,无法精准捕捉地质特征。这项工程的成功实施,填补了我国超深埋输水隧洞注浆治理技术的空白,标志着我国在深埋地下工程地质探查与注浆治理领域达到国际领先水平。
2025-12-25 09:42
24日上午,随着最后一方混凝土浇筑完成,宁波舟山港六横公路大桥二期工程——青龙门特大桥双主塔成功封顶。青龙门特大桥位于浙江舟山,横跨青龙门水道,连接宁波梅山岛与舟山佛渡岛。
2025-12-25 09:45
24日,我国最大超深凝析气田——中国石油塔里木油田博孜—大北气田天然气年产量突破100亿立方米,生产凝析油91.89万吨。为攻克上述难题,塔里木油田持续攻关,推动气田开发实现从深层向超深层、从高压向超高压、从优质储层向复杂储层的三大跨越。
2025-12-25 09:44
前不久,“科学家预测恐龙复活有望实现”的话题冲上热搜,引起舆论关注。
2025-12-25 10:20
一项研究显示,科学家发现新物种的速度比以往任何时候都快——每年发现的新物种超过1.6万个,并且这一趋势没有放缓的迹象。除了医学,许多物种的适应特性还可以启发人类的发明创造,例如模仿壁虎垂直爬墙的“超强黏附”脚的材料。
2025-12-25 09:47
”这是中国科学院院士、北京航空航天大学研究生院原副院长高为炳生前在自述中留下的一句话。而在高为炳的学生看来,他之所以能在短时间内取得那么多成绩,根源就在于几十年的厚积薄发。
2025-12-25 09:46
昆虫性信息素相当于昆虫之间的“气味语言”,具有靶向性强、用量少、对环境友好等优点,是当前绿色植保的重要策略之一。
2025-12-24 10:05
作为中国科学院“十四五”重大项目之一,2022年7月27日,由中国科学院力学研究所(以下简称力学所)抓总研制的“力箭一号”火箭首飞成功。
2025-12-24 09:59
中国科学技术大学(以下简称中国科大)教授潘建伟、朱晓波、彭承志和副教授陈福升等基于超导量子处理器“祖冲之3.2号”,在码距为7的表面码上实现了低于纠错阈值的量子纠错,演示了逻辑错误率随码距增加而显著下降。
2025-12-24 09:58
为加快推进知识产权强国建设,日前,国家知识产权局会同有关部门编制完成《知识产权强国建设发展报告(2025年)》。
2025-12-24 09:57
国家能源局23日发布11月全国电动汽车充电设施数据。
2025-12-24 09:57
我国自主设计建造的全球首制甲醇双燃料动力智能超大型油轮“凯拓”轮22日在辽宁大连成功交付。
2025-12-23 09:54
中国科学院大连化学物理研究所副研究员方光宗、研究员潘秀莲团队在乙炔氢氯化制氯乙烯研究领域取得新进展。
2025-12-23 09:53
《自然》杂志网站12月18日刊发文章,展望了2026年值得关注的科学事件,涉及人工智能(AI)、基因编辑和太空探索等多个领域。中国计划于2026年发射嫦娥七号探测器,目标是在布满岩石与陨石坑、着陆难度极大的月球南极附近着陆。
2025-12-23 09:52
加载更多