AI基础设施新范式:无问芯穹Agentic Infra如何重塑算力效率边界
算力供需缺口下的范式重构
在人工智能技术呈指数级进化的今天,算力供需之间的矛盾已从“量”的不足转向“质”与“效”的错位。传统的线性堆叠算力模式,面对从Pre-training到Post-training,再到Test-time及Agentic scaling这四大Scaling Law共同驱动下的模型复杂度跃升,已显得力不从心。无问芯穹联合创始人兼CEO夏立雪在2026年世界人工智能大会上指出,AI基础设施的核心决胜点在于“AI原生Agentic Infra”,即通过极致的效率服务更大规模,从而弥合日益扩大的供需鸿沟。

这一新范式的提出,标志着行业从单纯追求硬件指标转向关注资源的全链路转化效率。无问芯穹定义的AI生产力公式——AI生产力 = 智能资源规模 × Token 转化效率 × AI生产力转化效率,为这一转型提供了清晰的量化路径。基于此,无问芯穹发布了“前店后厂一中心”的战略布局,旨在通过三大核心技术能力,构建从底层硬件到上层应用的完整闭环,重新定义AI基础设施的行业标准。

算力集散中心:破解异构与碎片化难题

智能资源规模的扩大,是提升AI生产力的首要前提。然而,全球范围内存在的算力异质化、碎片化问题,使得跨地域、跨厂商的算力协同成为巨大挑战。无问芯穹的Agentic Infra自主式基础设施平台,扮演着“算力集散中心”的角色,致力于通过“多元异构、软硬协同”技术,将散落的算力资源统一汇聚、弹性调度。

该平台的核心技术在于其面向异构集群的大模型跨域训练系统。通过计算通信重叠的流水编排、自适应的通信流调度以及异构算力调度机制,实现了三位一体的全栈协同优化。这一系统已在多个极端场景下验证了其有效性:

首先,在超远距离聚合方面,无问芯穹联合中国电信完成了国内首例超过4000公里的大模型跨域混训。在新疆哈密与广东深圳两地集群间,通过优化网络传输,实现了联合训练性能165%的提升,证明了超远距离协同的可行性。

其次,在多数据中心聚合场景中,系统打通了4个不同代际、不同型号的GPU集群,协同训练近百亿参数大模型,四集群协同性能提升41%。这不仅提高了新集群的效率,更有效盘活了存量异构算力,避免了资源浪费。

最后,在混合云算力聚合方面,实现了本地私有集群与公有云算力的安全互通混训,整体性能提升68%。这一突破解决了企业客户常见的算力错配痛点,即本地资源不足与云端资源闲置并存的矛盾。

目前,这套跨域训练系统已在全国部署,触达超37,000P算力,覆盖16种主流芯片,为Agentic AI时代筑牢了坚实的底座。特别是在跨集群强化学习这一高难度场景中,通过全栈协同优化,实现了全局资源一盘棋调度,将跨域通信效率提升3-4倍,并搭建了故障无感的训练机制,实现了连续一周0中断稳定运行,为万卡级规模的持续进化提供了可能。

Token工厂:以极致效率驱动推理成本下降

如果说算力是燃料,那么Token就是AI引擎输出的能量。在Token经济时代,如何在保证质量的前提下,以极致的效率生产Token,成为基础设施竞争的关键。无问芯穹的Agentic MaaS大模型服务平台,定位为“Token工厂”,其核心目标是通过技术优化,大幅降低推理成本,提升吞吐量。

面对智能体推理场景中“上下文极长、交互轮次极多、缓存命中率极高”的“三极”特征,传统的同构集群往往“偏科”,即某些集群擅长Prefill(预填充)而另一些擅长Decode(解码)。无问芯穹首创的跨集群异构PD分离架构(PDD),精准解决了这一痛点。
PDD架构通过高性价比的广域网以太网,将分布在不同地区的同构数据中心连接起来,让算力强的集群专注Prefill任务,显存带宽高的集群专注Decode任务。这种“让硬件只做擅长事”的设计,极大提升了系统整体效率。更为关键的是,针对跨集群传输中的带宽和延迟瓶颈,无问芯穹创新性地迁移了Decode Radix Cache技术,实现了跨集群KV Cache传输数据量降低一个数量级,有效缓解了流量过载问题。

此外,PDD架构还将传统的PD分离解构为“P-RLD-MD”三级分离式推理架构。通过RelayDecode先行输出Token,掩盖了长达数十秒的以太网传输延迟,使用户侧体验无缝流畅。实测数据显示,该架构使首Token延迟(TTFT)降低51.5%,单Token成本降低37.5%。

过去一年,无问芯穹通过一系列原始技术创新,推动了推理成本10倍的下降。随着PDD架构的规模化落地,预计推理成本仍有10倍的下降空间。这种“优化即利润”的增长飞轮,正在形成“业务带技术,技术提效率,效率促增长”的正向循环,单日Token调用量已实现40倍的爆发增长。

AI生产力商店:从技术赋能到产业落地
基础设施的最终价值,体现在对千行百业的赋能程度上。无问芯穹的Agentic Infra行业解决方案,扮演着“AI生产力商店”的角色,致力于将高效的Token转化为产业认可的高质量生产力。
在文娱游戏领域,无问芯穹携手VAST的Tripo 3D大模型,打造了AGENTIC 3D GAME GEN解决方案,将分散的创意输入高效转化为可执行、可细化的3D模型,极大释放了游戏内容生产力。

在医疗健康领域,无问芯穹服务于上海瑞金医院,助力医疗大模型在运营管理、临床诊疗辅助及医学教育培训等场景的落地,提升了医疗资源的利用效率和服务质量。
在法律终端领域,无问芯穹打造了律师事务所专属AI合伙人——“律盾芯人”,联合多家顶尖律师事务所及生态合作伙伴,推动法律行业的智能化和安全升级,实现了专业法律知识的精准调用与合规应用。
在能源电力领域,无问芯穹与南网能源合作,探索基于智能体技术的智算中心能耗智能预测与协同调度,通过精准的能量管理,降低了运营成本,提升了能源利用效率。
基础设施智能体蜂群:自我进化的核心引擎
Agentic Infra不仅服务于外部应用,其自身也在经历智能化重构。无问芯穹构建了“基础设施智能体蜂群”,通过三个子集——平台管家、运维专家、算子生成,实现基础设施的自主迭代与自我优化。

平台管家智能体系统作为全局统筹者,通过自然语言交互,降低了用户驾驭复杂系统的门槛。它能够独立解决80%的日常资源运营、管理和排障问题,极大提升了用户体验。
智算集群运维智能体系统则充当7×24小时全天候值守的“运维专家团”。从告警自动闭环处置到潜在隐患的周期性巡检,该系统将运维模式从“人找问题”转变为“问题自己解决”。实证数据显示,该系统可提升运维人效5倍以上,关键故障处理效率提升6倍,为大规模智算业务提供了稳定保障。

在算子层面,KernelMind高性能算子生成智能体系统,通过五步闭环工作流,实现了从需求分析到内核生成的全流程自动化。在GLM5.2模型的实测中,该系统在NVIDIA旗舰卡上实现7.3%的性能提升,在AMD旗舰卡上更是带来39%的整体性能跃升,证明了智能体在释放硬件潜力方面的巨大价值。

迈向物理世界:具身智能的云边端协同
随着AI从数字世界向物理世界延伸,具身智能成为新的增长极。无问芯穹发布了首个面向大规模具身任务的云边端一体化管理与调度平台,统一接入云端GPU集群、边缘算力节点和机器人真机设备。
针对具身智能训练的两大核心环节,无问芯穹推出了RLinf V0.3和Mizar-Robo。RLinf V0.3支持具身智能大规模真机、跨域端云协同的强化学习训练,通过HotSwarm与端云协同训练模式,支持真机设备1000+次在线上下线且训练0中断,将近一百台真机规模的专线需求降至2Gbps以下,大幅降低了训练成本。

Mizar-Robo则依托四层协同优化,全方位释放端侧硬件潜力。在与自变量机器人WALL-OSS系列模型的联合优化中,实现了7.14倍的推理性能提升,端侧推理时延从500ms压缩至70ms,降幅达86%。这不仅保障了实时交互的流畅度,也为机器人产品的规模化商用落地提供了坚实的基础设施支撑。

结语:用智能进化智能,用生产力加速生产力

从“算力集散中心”做大资源总盘,到“Token工厂”深挖效率红利,再到“AI生产力商店”循环造血向产业输出价值,无问芯穹始终锚定“规模与效率”两大支点。其提出的“前店后厂一中心”Agentic Infra体系,不仅是对过去多年技术积淀的系统性总结,更是面向AGI时代的基础设施蓝图。

在AI基础设施的下半场竞争中,单纯的硬件堆砌已不再是护城河,真正的核心竞争力在于如何通过AI原生的智能体技术,实现基础设施的自主进化与极致效率。无问芯穹的实践表明,唯有通过“用智能进化智能,用生产力加速生产力”,才能真正实现智能无所不能,更让智能无处不在。这不仅是无问芯穹的战略方向,也是整个AI基础设施行业演进的必然趋势。
