十万卡集群突破:国产算力如何跨越从“堆砌”到“融合”的工程鸿沟?

0 阅读

中国人工智能算力基础设施的发展轨迹,正在经历一场从量变到质变的深刻重构。7月10日,随着位于郑州的中科曙光宣布全国产AI超集群“曙光8000(登峰)”正式落成并接入国家超算互联网,中国AI算力正式宣告跨越“十万卡”这一历史门槛。这并非简单的数量叠加,而是一次针对大规模分布式系统复杂性的系统性工程突破。从万卡到十万卡,系统管理的难度并非线性增长,而是呈指数级爆发。网络拥塞、存储I/O瓶颈、散热功耗失控以及任务调度混乱,构成了阻碍算力规模进一步扩张的四座大山。曙光8000的落地,标志着国产算力在解决这些底层工程难题上,已经具备了全链路的自研能力和成熟的工程实践。

传统算力中心往往面临结构性的资源错配困境:专门的大模型训练集群难以胜任高精度的科学计算任务,而传统的超级计算机在面对海量非结构化数据和大参数模型训练时,效率又显得捉襟见肘。这种“两头不靠”的现状导致大量算力资源闲置或低效运行。曙光8000提出的“原生超智融合”架构,试图从根本上解决这一痛点。它不是将超算与智算中心进行物理拼接或简单的资源池化,而是在架构设计之初,就将双精度浮点运算(FP64)与低精度整数运算(如INT8)纳入统一的调度体系。这种设计理念类似于修建一条既能让重型卡车平稳行驶,又能让小型轿车快速穿梭的多车道高速公路,而非分别建造两条互不干扰的道路。这种全精度覆盖的能力,使得集群能够同时应对材料科学、气象预报等对精度要求极高的科学计算场景,以及大语言模型训练等对吞吐量和并发能力要求极致的AI场景。

十万卡集群的工程实现,是芯片、网络、存储、散热及管理系统的整体协同胜利。在这一体系中,底层算力由海光等国产芯片提供支撑,确保了核心算力的自主可控。在连接层面,ScaleFabric类IB原生RDMA高速网络的应用,极大地缓解了大规模并行计算中的通信延迟问题,实现了十万级加速卡的高可靠低延迟互联。存储方面,ParaStor分布式存储系统凭借其在2026年全球IO500榜单中取得的生产型全节点和10节点性能双榜第一的成绩,证明了其处理PB级海量数据读写的能力,为大模型训练和科学计算提供了坚实的数据底座。此外,针对高功率密度带来的散热挑战,曙光数创的液冷技术配合国产冷媒与全年自然冷却方案,显著提升了系统的能源使用效率(PUE),使得MW级的高密度部署成为可能。

算力价值的最终体现,不在于参数表的辉煌,而在于真实应用场景中的效能转化。曙光8000已在多个关键领域完成了从“跑通”到“跑好”的跨越。在生物医药领域,8万张加速卡成功完成了蛋白质折叠的全流程模拟,直接缩短了新药研发的周期;在高端制造领域,8.8万张卡完成了328万亿网格的湍流直接模拟,为航空、船舶设计提供了高精度的仿真数据支持;在基础科学研究中,9万张卡协同完成了3.16万亿个原子的DFT高精度仿真。这些成果的背后,是300余项应用的适配与验证,覆盖材料、电磁、量子、天文气象等20多个学科领域。这一数据表明,国产算力已经不再是实验室里的概念验证,而是成为了科研和产业界不可或缺的基础设施。

开放架构的引入,是曙光8000区别于传统封闭算力集群的另一大特征。AI计算生态的碎片化是行业长期面临的挑战,曙光8000通过支持多品牌AI加速卡并兼容主流开源生态,降低了开发者迁移现有模型和应用的门槛。这种开放性不仅保护了研发者的既有投入,更激发了产业链的活力,使得从芯片厂商到应用开发商,再到最终用户,都能在一个统一的平台上进行协作与创新。与北京科学智能研究院的战略合作,以及第二套全国产十万卡超智融合算力系统的启动研制,进一步印证了这一技术路线的可复制性与推广价值。

从更宏观的视角来看,曙光8000的落成是“东数西算”与国家一体化算力网战略的关键落子。郑州作为中部地区的枢纽,凭借其中间的地理位置和能源优势,承担着连接东西部算力资源的重要使命。当十万卡级的节点在全国范围内逐步铺开,并接入统一的算力调度网络时,算力将真正突破地域限制,像电力一样实现资源的优化配置与高效流动。这不仅意味着中国将建成全球规模最大、调度能力最强的算力网络,更标志着国产算力正在从跟随者转变为规则的制定者和生态的构建者。未来,随着更多应用场景的深度挖掘和算法模型的迭代优化,这一基础设施将在推动经济社会数字化转型中发挥更为深远的影响。