打破英伟达垄断?国产GPU直通网卡实测:吞吐翻倍、延迟减半的真相
在人工智能基础设施的演进洪流中,算力集群的互联效率正逐渐成为制约大规模模型训练与推理性能的“最后一公里”瓶颈。长期以来,英伟达凭借CUDA生态与NVLink/NVSwitch技术构建了极高的护城河,其GPU与ConnectX网卡之间的深度协同(如IBGDA技术)被视为行业标杆。然而,随着国产AI芯片性能的不断攀升,单一的芯片算力优势若无法通过高效的网络互联转化为系统级效能,终将陷入“木桶效应”的困境。近期,奇异摩尔在WAIC 2026上展示的国产GPU直通国产RDMA网卡技术方案,为我们提供了一次极具参考价值的实战对标,其数据表现令人瞩目。
要理解这一突破的意义,首先需审视当前国产算力面临的结构性矛盾。尽管单芯片算力求变屡创新高,但片内、片间、网间及集群间的互联标准长期割裂,导致系统级性能无法随节点数量线性释放。特别是在MoE(混合专家)模型等复杂场景下,专家并行通信涉及海量的All-to-All小粒度数据交换。传统架构中,数据往往需经由CPU中转指令,不仅引入了额外的延迟,更造成了CPU资源的严重开销,使得GPU在大规模并行计算中的吞吐优势被通信瓶颈所稀释。
在此背景下,IBGDA(In-Band Guided Data Acceleration或类似的高速直通机制)技术的价值得以凸显。该技术核心在于绕过CPU处理环节,让GPU能够直接发起通信请求,从而大幅降低指令中转等待时间。此前,国际方案主要依赖英伟达GPU与ConnectX网卡的深度绑定,而国产方案要实现同等能力,需克服软硬件适配的多重障碍。这要求国产GPU不仅需支持类NVSHMEM编程模型及最新的NCCL通信库,还需与国产RDMA网卡在底层协议上完成深度磨合。
本次奇异摩尔携手壁仞科技发布的IBGDA Demo,正是在这一艰难探索中取得的关键突破。测试平台基于奇异摩尔单通道400G RDMA ASIC引擎,该引擎基于Kiwi SNIC 800G平台架构设计,并兼容专为MoE模型优化的集合通信库。实测结果显示,相较于传统的IBRC方案,IBGDA在小包、高频、强同步场景下呈现出显著的代际优势。具体而言,单次小消息带宽实现质的跨越,原始小包发送及合并发送的吞吐量均大幅提升。更为关键的是,All-to-All通信延迟大幅缩短,接近翻倍提升,彻底消除了传统方案中“小包惩罚”导致的时延抖动问题。这一成果不仅证明了国产“芯+网”在底层互通上的成熟度,也为构建高性价比、低延迟的AI推理集群提供了新的技术路径。
除了互联芯片的突破,光互联技术的演进同样是超节点架构的核心议题。随着电互联受限于铜缆物理极限,带宽密度与能耗问题日益凸显,光引擎向计算核心收敛成为必然趋势。奇异摩尔参与编制的《共封装光学(CPO)技术白皮书》系统梳理了这一演进路径:从可插拔光模块到NPO,再到CPO及OIO,最终实现“光内生”。这一路径的核心收益在于缩短互联距离,省去DSP芯片,从而降低延迟、功耗及成本,提升整体算力利用率。
为了进一步突破Scale-Up网络中协议层对计算核心的负担,奇异摩尔前瞻性地布局了OSU(Optical Scale-Up)IO芯粒产品。通过与图灵量子、奇点光子等伙伴的合作,双方正在探索基于xPU-CPO及NPO的关键技术。例如,在与奇点光子展示的直连NPO光互联测试板中,奇异摩尔主芯片内部集成了模拟计算芯粒和IO芯粒的独立芯粒,这种光电融合的架构旨在突破互连速率与距离瓶颈,显著提升智算节点的规模与计算能力。
超节点时代的竞争已不再局限于单一芯片性能的比拼,而是演变为涵盖互联、整机、软件及系统协同的多变量博弈。大模型训练侧的Scaling Law、推理侧的test-time scaling以及Agent应用的爆发,共同驱动算力需求呈指数级增长。在此背景下,上海市算力网络协会等机构发起的“国产超节点生态共建倡议行动”显得尤为及时。该倡议旨在汇聚产业链上下游资源,共同制定开放、兼容的超节点互联标准,打破技术孤岛,解决体系架构定义、Scale-Up互联协议碎片化等“卡脖子”风险。
奇异摩尔此次亮相WAIC 2026,展示的不仅是一套全栈互联解决方案,更是一种生态共建的思维范式。从国产化超节点互联全栈方案的亮相,到基于OISA协议的卡间互联验证,再到IBGDA技术的实测突破,这些成果共同指向一个核心结论:国产算力基础设施正从“单点突破”迈向“系统级协同”。通过构建不绑定、可演进的系统级基础设施,芯片厂商可灵活构建超节点系统,上层应用可无缝获得横向扩展能力,从而推动国产AI产业从各自为战走向合力突围。
未来,随着超节点架构逐步成为AI算力的主流形态,互联技术将跃升为决定系统效能的关键引擎。奇异摩尔通过深耕AI互联芯片、布局CPO及OSU芯粒技术,并积极参与生态标准的制定,正在逐步构建起自主可控的算力底座。这一过程不仅是技术层面的迭代,更是产业生态的重塑。在“连片成林”的战略指引下,国产算力有望通过系统级的协同优化,真正释放出大规模集群的潜能,为全球AI算力竞争提供中国方案。