算力内卷破局?深扒超节点架构如何重塑国产AI下半场
算力需求的悖论与国产化的新困境
近期,GLM 5.2与Kimi K3.0的接连发布,叠加DeepSeek相关会议纪要的流出,将国内AI行业最敏感的神经——算力短缺问题再次推至前台。这一现象标志着国产大模型发展进入了一个更为复杂的深水区:尽管行业曾试图通过算法优化来“绕过”算力门槛,但现实需求的增长速度远超预期。
在过去几年中,业界形成了一种共识,即通过技术手段为算力做减法。例如,利用混合专家架构(MoE)灵活启动参数规模,可以显著减少单次推理的计算量;优化注意力机制则能有效缓解长上下文带来的显存压力。这种思路曾让“消除算力溢价”成为主流叙事,使得关于国产算力不足的担忧一度平息。然而,随着国产大模型跻身国际第一梯队,这种乐观情绪被迅速打破。Kimi K3等头部模型的出现,不仅带来了用户体验的飞跃,更引发了Token消耗量的指数级增长。面对激增的需求,算力限购与涨价成为必然,这直接证伪了“单纯依靠技术优化即可绕过算力硬件瓶颈”的逻辑。
这一现象在经济学上完美契合了“杰文斯悖论”:当技术进步提高了资源利用效率后,反而可能导致资源的总消耗量增加。大模型推理成本的下降和能力的增强,吸引了更多开发者和企业入局,应用场景从简单的问答扩展到复杂的代码生成、Agent任务执行等。以Kimi K3为例,虽然其单个Token仅激活104B参数,但面对数十次反复推理的复杂任务,后台实际的算力吞吐量呈几何级数上升。一旦需求边界被彻底打开,算力扩容便成为不可回避的必由之路。公开数据显示,2025年国内智能算力规模已达1590 ExaFLOPS,至2026年上半年更是飙升至2185 EFLOPS,同比增长177%。这种爆发式增长背后,是国产AI芯片从边缘走向舞台中央的历史性转折。

国产芯片崛起与超节点的战略卡位
在智能算力规模呈井喷式增长的背景下,国产AI芯片的崛起为行业提供了关键的“定心丸”。百度昆仑芯发布的第四代AI芯片M100,专门针对大规模推理场景尤其是MoE模型进行优化,旨在以全国产方案对标NVIDIA H20,主打高性价比推理应用。摩根大通的预测数据显示,百度昆仑芯片收入预计将从2025年的约13亿元激增至2026年的83亿元,这一增长倍数反映了市场对国产高端芯片的强烈需求。
与此同时,平头哥半导体发布的新一代AI芯片真武M890,性能较上一代提升了3倍,能够支撑更大规模的大模型训练及推理需求。官方数据显示,真武AI芯片累计出货已达56万片,服务了20多个行业的400多家客户。特别是在智能驾驶领域,真武芯片已部署超过13万卡,覆盖了小鹏、理想、蔚来等头部造车新势力。这些成就表明,国产AI芯片不仅在单点性能上取得了突破,更在生态兼容性和规模化部署上积累了深厚底蕴。
然而,单芯片性能的线性提升已不足以应对万亿参数模型的复杂需求。在此背景下,“超节点”架构应运而生,并成为国产AI芯片竞争的下一个新战场。所谓超节点,并非简单地将数张、数十张甚至数百张AI芯片物理堆叠,而是将其融合成一个具备独立计算机特征的超级计算系统。这种架构通过大幅提升系统级性能,旨在缩小与国外高端芯片在集群算力上的差距,并大幅降低单Token的推理成本。
沐曦股份研发副总裁黄向军指出,随着模型规模突破万亿参数,客观上需要更大规模的GPU通过高带宽连接在一起。特别是在MoE模型中,不同专家网络间的通信要求极低的延迟,超节点架构相比传统服务器更能满足这一需求。CHIP实验室主任罗国昭进一步解释,一个2万亿参数的MoE模型在推理过程中,不同GPU之间需要频繁交换数据。如果互联带宽不足,大量GPU将陷入“等待数据同步”的空转状态,导致理论算力无法转化为实际可用算力。因此,超节点的核心竞争力在于借助超大带宽、超低时延及软硬协同等技术优势,彻底解决“GPU不是在计算,而是在等待”的行业痛点。
大节点与小节点:技术路线的博弈
尽管超节点被视为解决当下算力紧张的最优解,但作为新兴技术架构,其在规模定义上仍存在显著分歧。不同厂商基于自身技术储备和市场定位,走出了截然不同的技术路径:一种是追求极致性能的“大节点”路线,另一种是注重经济性的“小节点”路线。
支持“节点越大越好”的观点认为,随着大模型进入万亿参数时代,上下文长度突破千万级,且并发推理持续增长,超节点走向百卡、千卡甚至万卡是必然趋势。唯有大节点,才能满足大模型在全场景下的高负载需求。昇腾是这条技术路径的典型代表。其推出的384卡超节点已销售750多套,目前迭代至1024卡超节点,实现了业界最大的256TB跨物理节点内存统一编址空间。此外,昇腾还计划推出8192卡超节点,进一步探索超节点在满配技术上的上限。这种路线的优势在于能够屏蔽底层硬件细节,向上提供统一的超大算力池,极大简化了大规模分布式训练的开发难度。
相反,主张“节点越经济越好”的一方则强调平衡。他们认为,大模型不仅需要高带宽和高性能,还需要低时延和强稳定性。对于大多数中小企业而言,配置过多的AI芯片不仅成本高昂,还可能导致算力闲置和浪费。浪潮信息是这条路线的践行者。其先推出了64卡超节点,最新产品甚至降至32卡。浪潮信息副总裁赵帅表示,内部使用万亿大模型进行AI Coding的效率远高于千亿大模型,这证明了万亿参数模型的价值。推出32卡产品,旨在降低门槛,让更多企业真正“用得起”大模型。这种小节点策略更符合当前市场碎片化、多样化的需求,有助于加速AI技术在垂直行业的落地。
生态重构与未来展望
超节点从最初的实验室概念,一跃成为国产算力破局的关键抓手,这一过程伴随着交付能力的提升和算力缺口的肉眼可见。百度、阿里巴巴、浪潮信息、沐曦科技、摩尔线程等厂商纷纷入局,为AI基础设施生态注入了新的活力。这种多元化的竞争格局,不仅推动了超节点技术的快速迭代,也促进了软硬件协同优化的深入。
然而,超节点的规模化应用仍面临诸多挑战。首先是互联技术的标准化问题。不同的芯片厂商在高速互联协议、网络拓扑结构上各有千秋,如何实现跨厂商、跨架构的超节点互联,是构建统一智算生态的关键。其次是软件栈的适配难度。超节点架构要求操作系统、编译器、深度学习框架等软件层面对底层硬件变化做出快速响应,这需要整个软件生态的深度协同。

从长远来看,超节点架构的出现,标志着AI算力竞争从“单点性能比拼”转向“系统级效能较量”。在这一新赛道上,国产芯片企业不再仅仅是硬件供应商,更是系统解决方案的提供商。通过超节点架构,国产算力有望在避免单纯依赖先进制程的同时,通过系统级优化实现性能跃升,从而在国际竞争中占据一席之地。
与此同时,随着AI应用的不断深化,算力需求将呈现更加多元化的特征。既需要能够支撑千亿参数模型训练的顶级算力,也需要能够支撑海量并发推理的边缘算力。超节点架构的灵活性,使其能够适应这种多层次的需求。未来,我们可能会看到更大规模的超节点用于基础大模型的训练,而较小规模、更具经济性的超节点用于垂直行业推理,形成“大中小”结合的算力网络。
综上所述,超节点不仅是应对当前算力短缺的技术手段,更是国产AI算力体系重构的重要契机。在国产芯片性能逐步追平国际水平的背景下,超节点架构通过系统级优化,有望成为打破算力瓶颈、推动大模型应用普及的关键力量。无论是昇腾的大节点路线,还是浪潮的小节点策略,都在以各自的方式探索这一领域的最优解。对于整个行业而言,如何在技术创新、成本控制与应用落地之间找到平衡,将是决定超节点能否真正成为国产算力“胜负手”的核心命题。