随着全国一体化算力网建设、算力互联互通行动计划的稳步推进,2026 年“十五五”规划纲要对算力基础设施建设提出了更高的要求:加快国家枢纽算力设施集群建设,论证建设超大规模智算集群,推动绿色电力与算力协同布局,降低中小企业用算成本。

然而,在智算基础设施建设飞速发展、集群规模不断扩大的同时,基础设施运维的痛点也日益突显。软硬件协同断层、跨产品运维壁垒、智能运维技术应用碎片化、面向 AI 智能体的算力支撑功能缺失等问题,正成为制约产业高质量发展的关键瓶颈。

为破解上述难题龙蜥社区智算联盟以社区为平台,联合智算硬件设备商、集群软件厂商、软件集成商、科研院校单位,深入研究智算集群基础设施运维体系。联盟通过分析具体应用场景,结合实际运维痛点,总结发布了《智算集群基础设施运维通用技术要求》(以下简称“技术要求”)。该技术要求的制定旨在打通智算软硬件、跨主体运维断点,补齐 AI 智能体底层算力协同短板,为支撑智算集群基础设施稳定运行,提供运维体系架构、关键运维功能的标准化建议。

技术要求首先提出了面向用户、端到端、可异构、可扩展的智算集群基础设施运维参考架构,明确了四大设计原则:分层解耦——运维能力按对象分层,组件间松耦合,可分可合;可扩展——覆盖智算项目建设全场景与业务全流程;云原生化——支持微服务化部署;面向用户——按需提供场景化、可组装的运维解决方案。

(图/智算集群基础设施运维参考架构)

主要运维组件包括:

  • 硬件管理:提供计算、存储、网络硬件基础设施统一管理与运维功能。

  • GPU 运维:提供 GPU 关键算力资源的基础监控,故障诊断、性能压测等增强运维功能。

  • 智算集群运维:提供虚拟化、云原生智算集群软件底座平台运维管理功能。

  • 网络运维:提供多层次、多平面的网络拓扑监控,网络故障诊断、网络性能调优等增强运维功能。

  • 作业运维:提供训推任务关联模型、算子、网络以及云原生工作负载监控数据的跨域整合,从业务视角跨层联动软硬件基础设施,实现端到端运维。

该技术要求能为智算集群软硬件产品生产商、系统集成商在系统设计、产品制造、运维集成方面提供指导,为第三方测评机构实施智算集群运维体系和功能的测试与评价提供参考。

随着超大规模智算集群的建设加速和 AI 智能体技术的快速演进,智算集群基础设施运维将面临更加复杂的挑战。龙蜥社区智算联盟将持续迭代技术要求,在智能化运维、AI 智能体算力协同、绿色运维等方向深入探索,推动智算运维生态的标准化与成熟化。

《智算集群基础设施运维通用技术要求》下载链接:

https://openanolis.cn/assets/static/AI_Infra_O&M_GTR.pdf

—— 完 ——

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐