国产算力破局:商汤如何实现正毛利与万亿Token量级的跨越
打破“亏损魔咒”:国产算力的商业化拐点
在人工智能基础设施的漫长演进史中,曾流传着一句令人沮丧的行业共识:谁采购国产高端芯片,谁就在为情怀买单,注定亏损。这一观点在过去几年里几乎成为了算力市场的铁律,折射出国产硬件在性能、生态与商业闭环上的多重短板。然而,2026年的市场格局正在发生根本性逆转。商汤大装置在WAIC期间公布的成绩单,直接挑战并重塑了这一认知——其国产芯片相关业务已成功实现毛利率转正。
这一财务指标的正向转折,并非偶然的市场波动,而是技术积累与商业模式创新共同作用的结果。数据显示,商汤大装置的日均Token处理量已从年初的4000亿跃升至2.42万亿,并计划在年底前冲击10万亿大关。这种量级的增长,不仅意味着规模的扩张,更标志着国产算力在核心互联网大厂及头部模型厂商中的信任度重建。当技术可行性被商业盈利性验证时,国产AI基础设施的规模化商用元年正式到来。这不仅是商汤的突破,更是整个中国算力产业链走向成熟的重要信号。
系统层级的降维打击:异构混合推理的逻辑
要理解商汤如何实现性能与成本的双重优化,必须深入其技术内核。当前,国产大模型算法水平与世界主流已无代际差距,但底层芯片硬件至少落后国际主流高端芯片一代。这种“软硬错位”曾被视为不可逾越的天堑,但商汤选择通过系统层面的组合方案来弥合这一差距,而非被动等待硬件迭代。
其核心策略被称为“异构混合推理”。这一策略基于对大模型推理过程各阶段特征的精准洞察。在大模型推理中,Prefill(预填充)阶段是一次性吞入输入内容,对算力堆叠的吞吐量要求高;而Decode(解码)阶段则是逐字生成,需要反复读取显存中的全部上下文,对显存带宽极为敏感。将这两类性格迥异的任务强行捆绑在单一硬件上,往往导致资源浪费或性能瓶颈。
商汤大装置通过精细的任务拆解,将Decode环节交给性能更强的高端资源支撑,确保生成速度与连贯性;将Prefill环节分配给数量庞大、成本更优的国产通用芯片,利用其高吞吐量优势。这种分工使得一块高端芯片能够带动约30块国产芯片协同工作,最终效果接近单独使用高端资源,但成本大幅降低。通过这套组合拳,主流国产芯片的MFU(模型浮点运算利用率)提升了85%-152%,单位成本的Token产出效率提升了2.5倍。
全链路掌控:从“松耦合”到“端到端”整合
技术方案的落地,依赖于强大的工程化能力。将20多款不同厂商的国产芯片统一调度,绝非简单的硬件堆叠,而是一场涉及底层编译器、算子重写、框架对接及调度策略调整的庞大系统工程。商汤大装置的杀手锏在于,它没有采用行业通用的层层分包模式,而是选择了“包圆”全链路。
在传统模式中,机房、硬件、分销、服务由不同公司承担,层间摩擦与损耗巨大,且责任边界模糊导致优化动力不足。商汤则自建机房、自购硬件、自研调度系统并直接对接客户。这种端到端的掌控力,使其能够进行联合优化。早在2018年,商汤便开始积累这支由研发团队、芯片原厂及高校组成的协作班底,形成了“松耦合日常运作,紧耦合攻坚突破”的协作机制。
近期,这一体系引入了AI自动生成算子适配代码的新工具。过去需要工程师手工耗时进行的适配工作,现由AI接管,大幅压缩了跟上模型迭代速度所需的人力与时间。这种工程效率的提升,是支撑其快速适配数十款芯片并实现稳定商业盈利的关键基石。
算电协同与生态共建:超越算力的多维竞争
算力竞争的本质,最终会回归到成本与生态的较量。商汤大装置在内部优化之外,进一步将电力纳入统一调度体系。在WAIC期间发布的“算电协同Agent”,利用模型预测算力任务的耗电特征,并与电力调度系统打通,结合峰谷电价与储能设施,动态调节用电节奏。这一举措使单位电力成本的Token产出提升了80%左右,引入了TPW(Watts per Token)这一新指标,标志着数据中心运营从单纯的技术竞赛进入能源精细化管理时代。
在生态层面,商汤联合寒武纪、华为昇腾、摩尔线程等近20家国产头部厂商及科研机构,发起“国产AI基础设施生态共建计划”。通过“银河计划”,双方将共同建设Token运营中心及万卡级智算集群,并在科学智能、新材料等领域开展联合攻关。这种开放共享的模式,旨在打破单一企业的技术孤岛,构建覆盖基础算力、平台工具及科研创新的一体化服务体系。
面向未来的空间布局:从地面集群到天地协同
商汤的视野并未局限于地面数据中心。面对弱网络环境下的实时AI推理需求,商汤与国星宇航合作,探索从地面万卡集群到在轨多星协同的太空算力路径。计划到2026年完成“商汤号”算力卫星首发并网,验证星地协同计算能力;至2030年建成天地一体化AI算力星座。这一布局不仅瞄准应急救灾、远洋船舶等特定场景,更预示着算力基础设施向太空延伸的长远趋势。
与此同时,光计算与量子计算也在同步探索之中。这些看似分散的动作,实则遵循同一套核心逻辑:将多源异构资源收归己用,通过智能调度实现场景化最优组合。
窗口期后的长期主义:方法论的护城河
当前的高毛利与高增长,部分得益于供需极度失衡的市场窗口。Agent应用的爆发导致算力需求同比激增5-10倍,而供给端响应滞后,使得第三方溢出需求被商汤迅速承接。然而,随着供给端的追赶,这一红利期终将收窄。
真正留给商汤的,是过去九年沉淀下的“端到端整合、跨场景复用”的操作方法论。随着具身智能、世界模型及科学计算等新场景的兴起,单一芯片已无法满足所有需求,算力组合调度的复杂性将呈指数级上升。在这场长跑中,硬件先进性仅是入场券,能否将碎片化的资源拼合成最优解,才是决定胜负的关键。商汤大装置的实践表明,中国AI基础设施的竞争,正从单纯的硬件比拼,转向系统化调度能力的深度较量。