国产万卡集群实战:摩尔线程如何打破算力壁垒与模型训练瓶颈

0 阅读

在人工智能算力竞争日益白热化的当下,国产芯片能否承载前沿大模型的训练任务,一直是业界关注的焦点。2026年世界人工智能大会期间,摩尔线程公布的一组数据引发了行业深层思考:一款拥有236亿参数的混合专家(MoE)模型,在完全基于国产硬件的万卡级集群上,完成了从预训练到长窗口训练的全流程。这一成果不仅验证了硬件的物理性能,更标志着国产算力生态在软件栈协同与工程化落地层面取得了实质性突破。

传统观念中,国产芯片往往被贴上“可用但不好用”或“仅适合推理”的标签。然而,摩尔线程此次披露的核心指标——有效训练时长占比超过90%,直接挑战了这一刻板印象。在大规模分布式训练中,通信开销、故障恢复以及数值稳定性是导致效率低下的主要因素。超过九成的有效训练时间意味着集群具备极高的鲁棒性,能够在长时间运行中保持稳定的算力输出,这对于需要数周甚至数月连续训练的千亿级参数模型而言,是决定项目成败的关键基础设施能力。

值得注意的是,摩尔线程重新定义了“高精度”的内涵。在半导体行业,精度通常指代浮点运算的数值准确性,但在大模型训练语境下,摩尔线程高级副总裁董龙飞指出,真正的挑战在于“结果对齐”。即在相同的模型架构、训练数据和超参数设置下,不同硬件平台能否产出一致的训练结果。数据显示,在与国际主流GPU的对比实验中,前3万步的平均相对误差被控制在万分之六以内。这种微小的误差范围证明了国产算力平台在底层数学库和编译器优化上的成熟度,确保了模型迁移的低成本和高可靠性。

除了基础语言模型,具身智能与世界模型成为检验算力通用性的新试金石。北京大学EvoPhys团队研发的全球首个5D世界模型EvoPhys-World,全程依托MUSA软件栈在MTT S5000集群上完成全栈原生训练。该模型在WorldScore“世界生成”维度连续37天位居榜首,这不仅是中国科学家首次在本土算力设备上完成的原创性工作,更象征着“国芯训国模”进入了深水区。世界模型对时空连续性和物理规律的理解要求极高,其训练过程涉及复杂的多模态数据融合与高维张量计算,这对硬件的内存带宽和互联速度提出了严苛要求。

与此同时,北京智源研究院的RoboBrain 2.5具身大脑模型也基于摩尔线程千卡集群完成了全流程训练。这一案例验证了国产算力在处理机器人控制、视觉感知与决策规划等复杂任务时的高可用性。随着具身智能从早期的VLA(视觉-语言-动作)小参数模型向千亿级云端协同模型演进,算力需求呈现指数级增长。摩尔线程通过支持万亿参数模型的持续训练验证,展示了其在应对未来超大规模模型时的扩展潜力。

在推理侧,摩尔线程提出的PD分离异构推理方案为解决算力瓶颈提供了创新思路。传统同构集群往往面临预填充(Prefill)计算密集与解码(Decode)带宽密集的资源错配问题。通过将Prefill阶段部署在MTT S5000上,而将Decode阶段部署在国际主流GPU上,并利用优化的KV Cache调度策略,整体吞吐量提升了近两倍。董龙飞给出的算式“3台S5000+2台国际主流GPU≈9台国际主流GPU”直观地展示了异构组合的效率优势。特别是在类似OpenClaw这样频繁调用本地工具的场景中,高达90%的缓存命中率大幅降低了重复计算带来的算力浪费。

这种技术路线的选择,反映了摩尔线程对AI产业形态的独特理解。创始人张建中将AI产业划分为模型训练、词元生产和智能体生产三类“工厂”,并强调全功能GPU架构在兼容性与灵活性上的优势。与专用集成电路(ASIC)厂商不同,全功能GPU能够更好地适应快速迭代的算法架构,避免因硬件固化导致的生态隔离。目前,国产大模型从发布到硬件适配的周期已压缩至“Day 0”,部分厂商甚至在规划阶段便与硬件方同步共研,这种紧密的软硬耦合正在重塑产业链的合作模式。

面对当前算力供应紧张的现状,行业内部存在不同的声音。有人认为这是产能不足的体现,但摩尔线程方面将其视为长期基础设施建设的正常阶段。类比铁路与高速公路的发展历程,中国GPU产业尚处于起步加速期,远未达到供过于求的状态。未来十至二十年,算力将成为像电力一样的基础能源,当前的投入是为未来的智能化社会奠定基石。

从技术细节来看,MUSA软件栈的完善是支撑上述所有成就的隐形支柱。它不仅仅是一个驱动程序集合,更包含了针对大模型训练特性的通信库、算子库以及调试工具链。正是这些底层软件的不断优化,才使得上层应用能够无缝迁移,并在国产硬件上发挥出接近理论峰值的性能。对于开发者而言,这意味着不再需要为了适配特定硬件而重写大量代码,极大地降低了技术门槛。

此外,数据规模的扩大也对存储系统提出了挑战。25T以上的语料处理需要高效的数据加载与预处理机制。摩尔线程集群在高负载下的稳定表现,暗示其在存储IO优化方面同样取得了进展。这种系统级的工程能力,往往比单纯的芯片峰值算力更具实际价值,因为它决定了整个训练集群的实际产出效率。

展望未来,随着模型参数量的继续膨胀和多模态数据的深度融合,单一维度的算力提升已无法满足需求。异构计算、存算一体以及光互联等技术可能成为新的突破口。摩尔线程目前的实践表明,通过软件定义硬件、优化资源调度以及构建开放生态,国产芯片完全有能力在前沿AI领域占据一席之地。这不仅是技术的胜利,更是产业链协同创新的成果。

对于企业而言,选择国产算力不再仅仅是出于供应链安全的考量,更是基于性能与成本的综合评估。当国产平台能够提供与国际主流平台相当甚至更优的训练效果,并具备更高的定制化服务能力时,市场天平自然会发生倾斜。摩尔线程的案例为行业提供了一个可复制的范本:通过深耕底层技术、强化软硬协同、聚焦核心场景,国产芯片正在从“替代者”转变为“创新者”。

在这一进程中,学术界与产业界的紧密合作起到了催化剂的作用。无论是北大的世界模型还是智源的具身大脑,都是产学研深度融合的产物。这种合作模式加速了新技术的验证与落地,同时也为硬件迭代提供了真实的反馈数据。未来,随着更多原创性模型在国产算力平台上诞生,一个良性循环的创新生态将逐渐形成,推动中国人工智能产业迈向更高水平。