WAIC观察:为何沐曦将展台C位留给10大开源社区?
在上海世界人工智能大会(WAIC)的喧嚣中,当绝大多数算力厂商仍在拼命展示单卡浮点运算峰值、显存带宽极限或集群互联带宽时,一家名为沐曦的企业却反其道而行之。在展台最核心的C位,没有摆放硕大的GPU实物,而是并列悬挂着十个国际知名开源社区的Logo:龙蜥社区、vLLM、PyTorch基金会、SGLang、Red Hat等。这一反常规的操作并非营销噱头,而是对当前国产算力突围路径的一次深刻回答:在硬件性能逐渐趋同的当下,软件生态的厚度与开放性,才是决定算力能否真正落地的关键护城河。
软件定义的算力护城河
长期以来,业界存在一种误解,认为国产GPU的瓶颈 solely 在于硬件制造。制程工艺、架构设计、HBM堆叠,这些确实是硬指标,也是追赶者必须啃下的硬骨头。然而,真正让开发者难以迁移的,是隐藏在这些硬件之下的软件生态壁垒。NVIDIA凭借CUDA构建了一个包含数百万开发者、海量预训练模型、成熟开发库的庞大帝国。这种生态锁定效应使得更换算力平台不再仅仅是硬件替换,而是一场涉及底层代码重构、算子重写、性能调优的系统性工程。
对于大多数AI团队而言,迁移成本足以劝退绝大多数尝试。因此,国产GPU厂商的竞争焦点,早已从单纯的芯片设计延伸至全栈软件能力的构建。沐曦推出的MXMACA全栈计算软件,正是针对这一痛点提出的系统性解决方案。其核心目标非常明确:通过高度的兼容性和自动化测试体系,将开发者的迁移成本压缩至最低,甚至实现“近零成本”迁移。
数据提供了有力佐证。沐曦搭建了涵盖GitHub近5000个热门开源项目的自动化测试体系,测试结果显示,92%的项目无需修改一行代码即可在沐曦GPU上正常运行。在框架适配层面,针对PyTorch 2.8,MXMACA实现了全部2410个GPU算子的完整兼容。更令人瞩目的是其迭代速度,当主流框架发布新版本时,行业常规适配周期长达数月,而沐曦仅需一周即可完成。这种效率不仅体现在企业级测试中,更体现在其开放的验证模式中。在vLLM生态适配中,沐曦团队仅深度调试了五六十款主流模型,剩余两百多款模型通过开放给普通学生进行验证,最终仅有极少数出现适配障碍。这一现象表明,MXMACA的底层通用性已具备极高的鲁棒性,足以支撑大规模、多样化的应用需求。
Upstream First:从适配者到共建者的范式转移
然而,代码能跑起来只是第一步。在AI技术以周为单位快速迭代的今天,封闭的软件栈难以跟上开源社区的演进速度。如果坚持闭门造车,不仅响应滞后,更无法快速响应用户定制化需求。沐曦选择了一条更为艰难但更具长期价值的道路:开源共建,并确立了“Upstream First”(优先向上游贡献)的核心策略。
传统的芯片厂商软件支持模式通常是“下游适配”:等待社区发布新版本,厂商拉取源码,打补丁,编译调试,最后封装成私有版本发布给开发者。这种方式不仅效率低下,且容易形成信息孤岛。而“Upstream First”策略要求厂商直接将代码贡献给上游开源社区。这意味着,当开发者在vLLM或PyTorch社区拉取最新代码并安装时,沐曦的硬件支持已经默认包含在内。截至当前,沐曦已开源53个软件仓库,占其软件栈总量的15%至20%,且比例仍在持续扩大。
这一策略的标志性成果是沐曦成为首家与vLLM官方签署合作协议的芯片企业,且不仅是国内首家,更是美国以外全球首家。这种合作超越了简单的商业赞助,深入到软件适配、联合开发、标准制定等多个层面。沐曦的硬件因此被纳入Red Hat与vLLM的官方硬件货架,实现了从“适配者”到“共建者”的角色转变。
展台上那十个开源社区,实则勾勒了一个Token从生成到输出的完整生命周期地图。在底层操作系统与资源调度层,沐曦与龙蜥社区、Red Hat等合作,解决了内核小版本频繁升级导致驱动重新打包的行业难题,通过技术机制实现驱动对小版本变化的兼容,极大降低了终端用户的维护负担。在训练与推理框架层,依托vLLM、PyTorch、SGLang等社区,沐曦实现了性能的倍增,过去两年相关性能提升超过100%。在顶层治理与合规层,通过模力方舟降低模型分发门槛,联合木兰开源社区制定大模型分级标准,确保开源生态的安全与规范。
构建AI时代的“Android”生态
沐曦CTO杨建博士将MXMACA定位为“AI时代的Android”。这一类比极具深意。Android的成功不仅在于开源,更在于其建立了通用的应用接口和庞大的开发者网络,从而激活了亿级设备和数百万开发者。沐曦的目标同样宏大:通过持续开放核心全栈软件,打通从操作系统、大数据处理到大模型训练推理及私有化部署的全链条,构建一个通用、好用、易用的底层算力生态。
所谓“好用、易用”,沐曦给出了具体的量化指标:一个没有任何编程基础的小白用户,利用AI编程工具和完善的公开文档,可以在一个下午内完成新应用的适配与部署。这一目标并非空谈,早在2023年,沐曦便实现了让大二学生在一天内完成开源软件适配、验证和部署的案例。杨建博士预测,随着生态的完善,全球数百万GPU和AI开发从业者中,绝大多数将在一天内快速上手沐曦工具链。
这一生态愿景的长期目标是到2029年至2030年,将专属沐曦生态的开发者数量扩展至500万。为实现这一目标,沐曦在人才培养上也进行了深度布局。通过围绕TileLang编译器开设实战训练营,累计吸引500多名开发者参与;联合上海AI实验室开办书生工具链实战营,将课程与代码全面开源;并通过“揭榜挂帅”机制吸引资深算子优化人才。此外,沐曦还与多所高校合作,将8大基础课程引入课堂,并为优秀在校生提供免试实习机会,构建了从校园到职场的完整人才输送链条。
Agent浪潮下的开源协作新解
当前,AI Agent(智能体)技术正处于爆发期,被称为“类寒武纪时刻”。GitHub上AI相关项目每年翻番,各类智能体方案层出不穷。然而,这种爆发也带来了算力效率的挑战:大量Token被消耗在无效调用和缺乏优化的代码中,Token消耗增速远超底层基础设施的扩容速度。
开源协作在此背景下展现出独特优势。通过透明卷等开源技术,优化方案得以迅速传播和迭代。例如,降低单Token算力消耗的新技术一旦开源,高校团队很快即可推出演进版。这种公开的竞逐使得推理侧性能大幅提升,单卡Token产出从每秒100个跃升至200甚至300个;Agent侧通过Skill机制压缩开销,使得原本需要1000 Token预算的任务降至100 Token。这种效率的提升,本质上是开源社区集体智慧的结晶。
展台上那句“每个Token背后,都是一次开源协作”在Agent时代获得了新的注解。甚至AI自身生成的代码和Token,也在参与这场开源协作。当一个产品经理利用AI工具配合沐曦的开放文档,在用餐间隙完成模型适配时,这标志着生态已进入新阶段:不仅开发者在共建,AI代理也在参与生态的演化与优化。
综上所述,沐曦在WAIC上展示的十个开源社区,并非简单的品牌罗列,而是其战略重心的直观体现。通过构建类似Android的开放软件底座,采用Upstream First策略深度融入全球开源社区,并着眼未来Agent时代的算力效率挑战,沐曦正在探索一条区别于传统硬件厂商的差异化突围之路。在国产算力从“可用”向“好用”跨越的关键期,这种以开源协作驱动生态繁荣的模式,或许正是破解CUDA垄断、实现算力自主可控的最佳路径。每一个流畅生成的Token,都是对这套开源协作链路有效性的终极验证。