十万卡集群落地郑州:全国产算力如何破解工程与调度难题?

3 阅读

中国人工智能算力基础设施的建设,正在经历一场从量变到质变的深刻重构。2026年7月10日,郑州,一座名为曙光8000(登峰)的全国产AI超集群正式宣告落成。这不仅意味着中国AI算力硬件规模的突破,更标志着国产算力体系在工程化落地与规模化调度上,正式跨入了“十万卡时代”。这一里程碑式的成就,并非简单的硬件堆砌,而是对过去三十年中国高性能计算(HPC)与人工智能(AI)融合发展的系统性回答。

跨越数量级:从“加零”到“重构”的工程逻辑

在公众视野中,“十万卡”往往被简单理解为“万卡”的十倍放大。然而,在高性能计算领域,规模每上一个量级,系统复杂度并非线性增长,而是呈指数级爆发。从万卡跨越到十万卡,核心挑战不再仅仅是算力数量的增加,而是如何解决系统层面的协同效应衰减问题。

当十万张加速卡并行工作时,网络通信延迟、存储I/O瓶颈、散热能耗以及任务调度的一致性,成为了制约系统性能释放的关键变量。如果处理不当,大量的算力将被消耗在数据搬运和状态同步上,而非实际的计算任务中。中科曙光选择通过曙光8000集群,直面这一工程难题,其成功落地的背后,是对底层架构进行的一次彻底重构。

该集群的建成,依托于国家超算互联网,并同步接入全国一体化算力网。这一连接动作本身,就具有战略意义。它表明,单点的算力强大只是基础,能否将分散的算力资源编织成一张高效流动的网络,才是决定算力价值的核心。曙光8000的上线,为这一网络提供了一个具备十万卡承载能力的骨干节点,为后续更大规模的算力协同奠定了物理基础。

原生超智融合:打破超算与智算的壁垒

当前AI算力产业存在一个显著的结构性错配现象:许多算力中心建好后,要么只能跑科学计算,无法支撑大模型训练;要么只能跑AI推理,难以应对复杂的多物理场仿真。这种“两头不靠”的局面,导致大量高端算力资源闲置或低效运行。

曙光8000提出的解决方案是“原生超智融合”。这一概念并非简单的硬件拼装,而是在架构设计之初,就将超级计算与智能计算视为同一系统内的不同维度。传统思路往往是为特定任务修筑专用道路,而超智融合则是构建一条支持多车型并行的高等级公路。

具体而言,曙光8000实现了从FP64双精度浮点运算到INT8低精度整型运算的全精度覆盖。FP64是传统科学计算的核心,广泛应用于气象模拟、流体动力学等领域;而INT8及更低精度则是大模型训练和推理的主流需求。通过同一套系统同时满足这两种截然不同的计算需求,曙光8000极大地提升了算力的通用性和利用率。

这种融合带来的最大优势在于资源调度的灵活性。科研机构和产业用户不再需要为不同的任务寻找不同的算力中心,而是可以在一个统一平台上,根据任务特性动态分配资源。这种跨平台、跨架构的统一调度能力,对于优化国产算力资源配置、降低重复建设成本具有深远的行业影响。

全链路自主:工程奇迹背后的技术底座

十万卡集群的落地,离不开底层技术的全链路支撑。中科曙光在系统建设中,实现了芯片、计算、存储、网络、散热、管理及服务等环节的全面全国产自研。

在计算底层,海光等国产芯片提供了坚实的算力基础。这些芯片不仅满足高性能需求,更在指令集兼容性和生态适配上进行了深度优化,确保软件栈的无缝衔接。

在网络层面,scaleFabric类IB原生RDMA高速网络架构,解决了十万卡集群大规模并行通信的核心痛点。RDMA(远程直接内存访问)技术允许网卡直接绕过操作系统内核访问内存,大幅降低了通信延迟,提高了数据吞吐量,确保了集群内部节点间的高效协同。

在存储方面,ParaStor分布式存储系统经受住了严苛考验。在2026年全球IO500榜单中,曙光ParaStor获得了生产型全节点和10节点性能双榜第一。对于大模型训练和科学计算而言,海量数据的读写速度直接决定了训练效率和模拟精度,这一成绩证明了其存储系统在处理海量非结构化数据时的卓越能力。

此外,散热难题也是十万卡集群必须跨过的坎。中科曙光利用其在液冷技术上的核心优势,支持MW级高功率密度部署。通过采用国产冷媒和全年自然冷却技术,曙光8000在提升能效比的同时,显著降低了运营成本,为大规模算力中心的可持续运营提供了范例。

场景验证:从PPT数字到科研实证

算力建设的终极命题,不在于发布会上的峰值性能跑分,而在于真实业务场景中的表现。曙光8000在落成之初,便同步进行了多领域的真实场景验证,并取得了世界级成果。

在生物医药领域,集群利用8万张加速卡,加速了蛋白质折叠全流程模拟。蛋白质结构的精确预测是新药研发的关键环节,这一应用直接服务于靶点发现和药物设计,缩短了研发周期。

在高端制造领域,8.8万张卡完成了328万亿网格的湍流直接模拟。湍流模拟是航空、船舶等复杂流体动力学分析的核心,高精度的模拟数据对于优化飞行器设计、提升能效具有不可替代的价值。

在基础科学研究方面,9万张卡协同完成了3.16万亿个原子的DFT(密度泛函理论)高精度仿真。这类计算通常用于材料科学和量子化学研究,对理解物质微观性质至关重要。

这些案例并非孤立的数据展示,而是证明了曙光8000在承载极端复杂计算任务时的稳定性和可靠性。截至目前,该集群已完成300余项应用适配,覆盖材料、电磁、量子、生物医药、天文气象等20多个领域,累计完成70余次万卡规模算力测试。这些数据表明,国产算力已从“可用”迈向“好用”阶段。

开放生态与标准输出:从示范到普及

曙光8000的成功,不仅在于其自身性能,更在于其开放的架构设计。集群采用AI计算开放架构,支持多品牌AI加速卡,兼容主流生态。这一策略打破了单一厂商锁定的风险,降低了开发者的迁移成本。一线开发者和科研人员无需重新学习封闭的工具链,已有的模型和应用可以快速迁移上线,极大地促进了创新应用的孵化。

开放的另一层意义在于产业链的协同。通过开放架构,曙光8000吸引了上下游厂商共同参与生态建设,形成了一个良性互动的产业闭环。这种模式有助于提升整个国产算力产业链的竞争力,而非仅仅依赖单一企业的单打独斗。

值得注意的是,中科曙光已启动第二套全国产十万卡超智融合算力系统的研制与建设,并与北京科学智能研究院达成战略合作。这标志着曙光8000正在从一个示范工程,走向可复制的标准方案。未来,随着更多类似节点在全国铺开,中国将率先织成全球最大规模的算力调度网络。

战略纵深:让算力像电力一样流动

“东数西算”、“全国一体化算力网”等国家顶层设计的目标,归根结底是解决算力资源分布不均与需求错配的问题,让算力像电力一样,能够随取随用、高效流动。

曙光8000落子郑州,具有深刻的战略考量。郑州地处中国中部,交通便利,能源条件优越,网络节点地位突出,是连接东西部算力的天然枢纽。在此部署十万卡级节点,不仅满足了中部地区的算力需求,更发挥了其在国家算力网络中的骨干作用。

当这种十万卡级的节点在全国关键节点铺开,形成的将是一张覆盖全域、高效协同的算力网。这张网不仅能服务于当下的AI大模型训练和科学计算,更将为未来的量子计算、脑科学探索等前沿领域提供坚实的基础设施支持。

中国首个十万卡集群的落成,是中国算力自主可控进程中的一个重要节点。它证明了国产算力在大规模系统集成、全栈技术攻关以及复杂场景适配上,已经具备了与世界先进水平竞争的能力。然而,这仅仅是开始。如何在保持硬件性能优势的同时,进一步丰富软件生态、优化调度算法、降低使用门槛,仍是行业需要长期探索的课题。

曙光8000的示范效应,正在激发更多机构投身于算力基础设施的建设与创新。随着第二套系统的启动和生态的持续完善,中国算力产业有望从“跟随者”逐渐转变为“规则制定者”和“标准输出者”。在这一进程中,郑州节点的点亮,不仅照亮了中原大地,更为全球算力网络的发展提供了中国方案。