国产十万卡集群破局:超智融合如何重塑AI算力基础设施?
从万卡到十万卡:跨越工程复杂度的指数级鸿沟
当中国AI算力一脚油门驶入“十万卡时代”,公众的关注点往往停留在数量的叠加,但业界深知,从万卡到十万卡并非简单的线性扩容,而是一场对系统工程能力的极限压力测试。7月10日,郑州中科曙光宣布,全国产AI超集群曙光8000(登峰)正式落成,并依托国家超算互联网接入全国一体化算力网。这一里程碑事件的核心价值,不在于规模本身,而在于其验证了国产软硬件在极端规模下的协同稳定性。
规模每上一个量级,系统复杂度呈指数级增长。在十万张加速卡的规模下,网络通信的延迟抖动、存储IO的并发瓶颈、散热系统的局部热点以及调度算法的资源分配效率,任何一个环节的微小瑕疵都可能导致集群整体性能的崩塌。曙光8000的成功部署,证明了中国在大规模并行计算系统架构设计上,已经具备了从理论仿真到物理落地的完整闭环能力。这不仅是算力的提升,更是工业级系统可靠性的重大突破。
原生超智融合:打破超算与智算的结构性错配
当前AI算力基础设施面临着一个普遍存在的结构性矛盾:传统的超级计算中心擅长FP64(双精度)科学计算,而新兴的智能计算中心则专注于INT8(低精度)的大模型训练。这种“术业有专攻”导致大量算力资源存在“两头不靠”的尴尬局面——超算中心难以高效处理非结构化数据的大模型训练,智算中心则在处理复杂物理方程的科学模拟时力不从心。
曙光8000提出的解法是“原生超智融合”。这并非简单的硬件拼凑或软件层面的兼容适配,而是从底层架构设计之初,就将科学计算与大模型训练视为同一系统需求进行统一规划。通过支持从FP64到INT8的全精度覆盖,曙光8000实现了“一套系统,两种用途”。这种设计逻辑的转变,类似于修建一条既能承载重型卡车又能通行小型轿车的复合道路,其设计核心在于通用性与专用性的动态平衡。
这种架构创新的意义在于,它极大地提升了算力资源的利用率。科研机构不再需要为不同的任务维护两套独立的物理集群,而是可以通过统一的资源池化调度,根据任务特征动态分配计算资源。对于材料科学、生物医药、气象预测等既需要高精度数值模拟,又日益依赖AI加速探索的领域而言,这种融合架构提供了前所未有的灵活性。据披露,该集群已完成300余项应用适配,覆盖20多个领域,累计完成70余次万卡规模测试,数据佐证了其兼容性的真实性。
全链路自研:工程奇迹背后的硬实力支撑
十万卡集群的落地,是中科曙光三十多年工程积淀的集中爆发。从2024年系统研制到2025年工程建设,再到2026年7月全面落地,这一速度背后是全链路全国产自研能力的支撑。硬件层面的挑战主要体现在芯片、网络、存储和散热四大核心组件。
在芯片层面,以海光为代表的国产加速卡提供了底层算力支撑。虽然单卡性能可能与国际顶尖产品存在差异,但在集群规模效应下,通过优化算法和并行效率,整体算力得以释放。网络层面,ScaleFabric类IB原生RDMA高速网络解决了十万卡通信的拥堵问题,确保了大规模并行计算中的数据同步效率。存储方面,ParaStor分布式存储系统在2026全球IO500榜单中斩获生产型全节点和10节点性能双榜第一,这直接解决了大模型训练中海量数据快速读写导致的IO瓶颈。
散热则是高功率密度部署的另一大难关。曙光数创的液冷技术,通过国产冷媒和全年自然冷却策略,有效解决了MW级高功率密度部署带来的能耗与散热问题。在“双碳”目标下,算力中心的PUE(电源使用效率)成为关键指标,液冷技术的应用不仅提升了集群的运行稳定性,也显著降低了运营成本。这种从芯片到机房的全链路自研,确保了供应链的安全可控,避免了“卡脖子”风险。
从跑分到实战:验证算力的真实价值
算力基础设施的最终评判标准,不是发布会上的参数,而是真实业务场景中的表现。曙光8000在落成之初,便已在多个尖端科研领域交出了实证答卷。
在生物医药领域,集群利用8万张加速卡加速蛋白质折叠全流程模拟,显著缩短了新药研发的探索周期。蛋白质结构预测是生物学界的“圣杯”,传统方法耗时漫长,而AI加速的大规模并行模拟,使得在原子尺度上解析复杂生物分子结构成为可能。在高端制造领域,8.8万张卡完成了328万亿网格的湍流直接模拟,这一精度和规模的流体力学仿真,为航空发动机叶片设计、船舶减阻优化提供了关键数据支持,其计算难度远超常规工业软件范畴。此外,9万张卡协同完成的3.16万亿个原子的DFT(密度泛函理论)高精度仿真,也在量子计算和新材料研发中发挥了重要作用。
这些案例表明,国产算力已经具备了处理世界级科研难题的能力。更重要的是,曙光8000采用了AI计算开放架构,支持多品牌AI加速卡,兼容主流生态。这意味着开发者无需重构代码或学习封闭的工具链,现有的模型和应用可以快速迁移。这种开放性打破了单一厂商锁定,让产业链各方都能参与其中,形成了良性循环。
全国一体化算力网:从节点互联到资源流动
曙光8000落子郑州,并非偶然。郑州作为国家综合交通枢纽,拥有优越的能源条件和网络节点地位,是连接中国东西部算力的理想枢纽。这一布局的战略意图在于,通过打造十万卡级的骨干节点,强化国家算力网的承载能力。
“东数西算”工程的核心目标,是让算力像电力一样,跨区域、跨层级高效流动。曙光8000接入国家超算互联网,正是这一目标的具体实践。通过统一的标准接口和调度协议,分散在不同地域、不同架构的算力资源可以被池化,并根据需求进行动态分配。当更多十万卡级节点在全国铺开,中国将织就全球最大规模的算力调度网络。
这种网络化协作模式,解决了算力资源分布不均的问题。东部地区对实时性要求高的应用,可以利用本地算力;而计算密集、时效性要求相对较低的模型训练任务,可以调度至西部低成本能源区。曙光8000的开放架构,使得这种跨地域、跨集群的协同计算成为可能。
开放生态与标准化:走向可复制的未来
中科曙光与北京科学智能研究院达成战略合作,启动第二套全国产十万卡超智融合算力系统研制,这一动作释放出强烈的信号:曙光8000不仅仅是一个示范项目,更是一个可复制的标准方案。
标准化是产业规模化扩张的前提。通过制定统一的硬件接口、软件协议和数据格式,不同厂商的设备可以实现互联互通,不同机构的算力可以共享互通。这种标准化趋势,将降低后续算力中心建设的门槛和成本,加速国产算力在全国范围内的普及。
此外,开放生态的构建对于留住人才和激发创新至关重要。如果算力基础设施过于封闭,开发者将被锁定在特定的技术栈中,抑制创新活力。曙光8000的开放架构,允许研究人员基于标准工具链进行二次开发,这将吸引全球顶尖的AI科学家和工程师加入国产算力生态。
从长远来看,算力不仅是计算资源,更是国家竞争力的核心要素。曙光8000的落成,标志着中国在高端算力领域从“跟随”转向“并跑”甚至“领跑”。随着技术的不断迭代和生态的日益完善,中国算力将在全球人工智能和科学计算领域发挥越来越重要的作用。未来,我们看到的将不仅是单个集群的规模突破,更是整个算力网络的高效协同与智能调度,这将为中国乃至全球的科技创新提供源源不断的动力。