十大大厂社区扎堆参展,沐曦如何用开源重构GPU生态护城河?
在每年举办的世界人工智能大会(WAIC)上,科技巨头们往往热衷于展示最新款的超节点集群或惊艳的单卡性能指标。然而,在2026年的展会现场,一家名为沐曦的GPU展台却呈现出一种截然不同的热闹景象。这里没有单纯的硬件参数罗列,取而代之的是一系列令人熟悉的开源社区Logo:龙蜥社区、vLLM、PyTorch基金会、SGLang等十家顶级开源组织并肩而立。这种“社区大合唱”式的展示策略,不仅揭示了国产算力厂商在构建生态壁垒时的新路径,更暗示了底层软件栈在算力竞争中的决定性作用。
在算力赛道中,硬件性能的追赶往往遵循摩尔定律或技术迭代周期,制程、架构、显存带宽等指标具有明确的量化标准,通过持续投入研发,后来者有望逐步缩小与先行者的差距。然而,真正构成行业垄断地位的,是沉淀在硬件之下的软件生态护城河。以NVIDIA为例,其领先地位并非仅由单颗GPU的峰值算力支撑,而是建立在CUDA生态之上。数百万开发者多年的代码积累、调试经验以及自研模块,都高度依赖CUDA环境。对于其他硬件厂商而言,即便制造出性能相当甚至更强的芯片,若无法让开发者低成本迁移至新平台,便难以撼动现有格局。这种极高的迁移成本和生态锁定效应,使得软件生态成为比硬件更难以逾越的壁垒。
针对这一行业痛点,沐曦给出了其核心答卷:全栈计算软件MXMACA。这套软件栈的设计初衷非常明确,即最大限度地降低开发者的迁移门槛。通过覆盖编译器、算子底层函数库以及主流AI推理训练框架的全链路优化,沐曦力求实现“代码零修改”或“近零成本”迁移。为了验证这一目标的达成度,沐曦搭建了一套自动化测试体系,将GitHub上近5000个热门开源项目纳入测试范围。测试结果显示,92%的项目无需任何代码改动即可在沐曦GPU上正常运行。这种高兼容性不仅体现在静态代码层面,更延伸至动态框架的适配速度。
以PyTorch 2.8版本为例,MXMACA实现了对全部2410个GPU算子的完整兼容。在行业常规方案中,适配新版本框架往往需要数月时间,而沐曦仅用一周便完成了全部工作。在vLLM生态中,这种通用性更为显著。面对生态中两百多款大模型,沐曦团队仅对其中五六十款主流模型进行了深度调试,其余模型通过标准化测试流程即可快速验证。测试结果表明,绝大多数模型开箱即用,仅有极少数出现适配障碍。这种高效的适配能力,甚至让普通在校生也能独立完成大规模模型的验证工作,充分证明了MXMACA底层的扎实与稳定。
然而,代码的顺利运行仅仅是第一步。在AI技术迭代以周甚至以天为单位的今天,大模型厂商和云服务商面临着巨大的时间压力。任何技术创新的滞后都可能导致市场份额的流失。如果仅依靠封闭自研的软件栈进行闭门造车,不仅难以跟上行业速度,更无法灵活响应客户多样化的需求。因此,沐曦选择了一条更为激进但符合行业趋势的道路:全面拥抱开源。早在GPU产品正式量产之前,沐曦就完成了1752款开源软件的适配,并将“开源共建”确立为公司长期战略。
沐曦在开源领域的打法核心可概括为“Upstream First”策略。传统模式下,厂商通常是社区新版本的追随者,通过拉取源码、打补丁、编译调试等一系列繁琐流程实现适配。而“Upstream First”则要求厂商将支持代码直接贡献给上游社区,与社区共同迭代。这意味着,当开发者拉取最新代码时,沐曦的硬件支持已经作为默认选项存在。截至目前,沐曦已开源53个软件仓库,占其软件栈的15%至20%,并持续扩大这一比例。这一策略带来了实质性的生态红利,沐曦成为首家与vLLM官方签署合作协议的中国芯片企业,也是全球范围内除美国公司外的首家。合作不仅限于软件适配,更延伸至商业协同,沐曦的硬件正式进入Red Hat+vLLM官方硬件货架,实现了从“适配者”到“共建者”的角色转变。
展台上十大开源社区的布局,实则映射了沐曦对AI计算全生命周期的理解。在最底层的操作系统与资源调度层,龙蜥社区、Red Hat、CNCF等组织负责确保Token的稳定运行。沐曦与龙蜥社区联合解决了操作系统内核小版本频繁升级导致GPU驱动重新打包的行业难题,通过技术手段使驱动能够直接忽略小版本变化,大幅降低了终端用户的维护负担。在训练与推理框架层,vLLM、PyTorch基金会等组织提供了持续的性能迭代,过去两年该层级的性能提升均超过100%。而在生态运营与合规治理层,模力方舟与木兰开源社区则专注于降低模型分发门槛及制定行业规范,确保开源环境的安全与有序。
这种端到端的自主可控技术路线,在编译器领域得到了进一步体现。沐曦从2024年下半年起便投入共建对标OpenAI Triton的TileLang编译器。随着多款主流大模型的发布,核心算子逐渐由TileLang编写。这不仅意味着国内在并行编译与算子优化上拥有了独立技术路线,更解决了自研适配代码难以合入上游社区主干的长期困境。
除了技术层面的共建,人才培养也是沐曦生态战略的重要支柱。围绕TileLang,沐曦开展了多期实战训练营,吸引超过500名开发者参与,并计划启动“揭榜挂帅”计划以吸纳更多算子优化人才。已出版的6本配套教材中,4本已正式发行,8大基础课程已进入上交大、浙大等20余所高校。通过与上海AI实验室书生工具链合作,沐曦为学生提供了从数据收集到模型评测的全流程实战机会,所有课程代码均对外开源。对于在社区表现优异的在校生,沐曦还给出了免试入职实习的激励政策,旨在发掘并留住新生技术力量。
沐曦CTO杨建博士将这一生态愿景定义为“AI时代的Android”。其核心逻辑是通过开放全栈软件,打通从操作系统、大数据处理到大模型训练推理及私有化部署的全链条,构建一个通用、好用、易用的底层算力生态。所谓“好用”,即让非专业开发者也能在一天内完成应用的适配与部署。早在2023年,沐曦便实现了让大二学生在一天内跑通开源软件适配、验证和部署的目标。杨建博士预计,未来全球700万GPU和AI开发从业者中,至少有650万人可在一天内上手沐曦工具链。目前生态内的50万开发者只是起点,沐曦的目标是在2029至2030年将开发者数量扩展至500万。
Agent浪潮的爆发为这一生态带来了新的命题与挑战。当前Agent领域正处于类似“寒武纪生命大爆发”的阶段,各类智能体方案涌现,GitHub上AI相关项目每年翻番。然而,这种爆发伴随着低效,大量Token被消耗在无效调用中,Token消耗增速远超底层基础设施扩容速度。开源社区通过“透明卷”机制加速了优化技术的迭代。例如,一项降低单Token算力消耗的新技术开源后,高校团队迅速推出演进版,全程公开竞争。这种透明竞争使得推理侧性能显著提升,同一张GPU每秒产出的Token数从100提升至200甚至300;Agent侧通过Skill优化,使得原本需要1000块Token预算的任务,优化后仅需100块即可完成。
开源协作的威力甚至超越了传统开发者的边界。沐曦分享了一个真实案例:一家互联网公司的产品经理在用餐间隙,利用AI编程工具、自有模型权重及沐曦的公开文档,仅用一顿饭的时间便完成了模型适配。这一事件表明,生态已进入新阶段,文档的开放性与软件栈的兼容性使得非代码人员也能通过AI参与共建。展台上“每个Token背后,都是一次开源协作”的标语,由此获得了全新的注解——不仅是人类开发者的协作,连AI自主生成的Token也在参与这场开源协作。
沐曦的角色定位始终清晰:做中国开源算力生态的领军者。通过开源底座串联产学研用,让操作系统、框架、模型与应用每一环节均建立在开源共享之上。Token生成的流畅度,正是对背后整套开源协作链路有效性的最佳验证。沐曦致力于让每个Token的价值在开放、协作的生态中得到真正实现,从而在激烈的算力竞争中构建起不可复制的长期优势。