AI SSD崛起:从存储配角到推理核心,重塑Token生成效率
过去两年,人工智能基础设施的竞争焦点高度集中于GPU数量的堆叠、芯片算力的提升、HBM带宽的扩容以及高速网络的铺设。然而,随着大模型技术向长上下文窗口、复杂逻辑推理以及多智能体(Multi-Agent)系统演进,决定一套系统能够产出多少有效Token的核心要素正在发生深刻变化。
GPU依然是算力的底座,但其实际利用率越来越不取决于浮点运算速度,而是取决于模型权重、KV Cache(键值缓存)以及MoE(混合专家)专家参数能否在精确的时间到达正确的计算节点。如果KV Cache无法及时复用,系统就必须重新执行耗时且昂贵的Prefill(预填充)过程;如果MoE专家权重没有在路由决策发生前载入内存,GPU计算单元将被迫停滞等待;如果大量推理状态长期占用昂贵的HBM,又会严重压缩并发请求数和有效批处理的规模。
在此背景下,AI基础设施正在从单纯的“堆叠计算资源”阶段,迈入“计算、网络、内存与存储数据路径深度协同”的新阶段。月之暗面(Moonshot AI)推出的Mooncake架构与NVIDIA发布的CMX(Context Memory Storage Platform)平台,构成了这一变化的两个标志性信号。二者虽尺度与实现路径不同,但共同指向一个核心趋势:推理状态已升级为AI基础设施中的一级资源,存储技术正式进入Token生成的实时主链路。
Mooncake:将KV Cache转化为独立的基础设施资源
Mooncake的产业意义远超为Kimi构建单一推理服务系统的范畴,它从根本上重构了大模型基础设施对“数据”的组织逻辑。
在传统推理节点中,GPU、CPU、DRAM和本地SSD被视为服务器内部的固定资源集合,KV Cache通常跟随请求和GPU实例绑定存在。一旦缓存被驱逐或请求发生迁移,已经完成的Prefill计算成果便失去复用价值。随着上下文长度增加,重复计算导致的GPU资源浪费呈指数级上升。
Moonshot AI与清华大学在USENIX FAST '25发表的Mooncake论文,提出了一种以KV Cache为中心的分离式架构。该架构将Prefill与Decode部署在独立的资源池中,并将GPU集群中未被充分利用的CPU、DRAM、SSD和NIC(网络接口卡)整合为分布式的KV Cache池。中央调度器Conductor不再仅依据GPU负载分发请求,而是结合KV Cache分布、缓存命中率、节点负载以及TTFT(首字延迟)、TBT(词间延迟)等服务目标,动态决定缓存复用、Prefill执行和Decode调度。
Mooncake的请求流处理逻辑体现了这一架构的先进性:可复用的Prefix KV Cache被优先送至合适的Prefill实例,新增的KV Cache随模型各层计算持续生成,并与Prefill计算过程重叠,异步流式传输至目标Decode节点。只有当缓存完整就绪后,请求才进入连续批处理阶段。Mooncake Store负责KV块的放置、复制、淘汰及生命周期管理,而Transfer Engine则通过RDMA协议、多NIC带宽聚合及拓扑感知路径选择,连接不同的计算和存储层。
这一架构将推理系统从“为GPU喂数据”转变为“围绕张量生命周期编排整条数据路径”,其核心哲学概括为“用更多存储换取更少计算”。据论文披露,在真实请求轨迹及不同TBT约束下,Mooncake相比基线系统将有效请求承载能力提升59%至498%。在生产环境中,该系统已部署于数千个节点,每日处理超过1000亿Token。
值得注意的是,Mooncake官方文档已将DRAM与SSD/NVMe明确纳入多级缓存体系,并给出了从内存向本地SSD卸载的路径:被内存淘汰的对象可在后台进入SSD,内存未命中时再从SSD回读。数据经预注册缓冲区后,由Transfer Engine送往目标DRAM或VRAM。这要求设备侧必须解决尾延迟、并行搬运、持续负载、耐久性与推理生命周期协同等难题。SSD因此不再仅仅是模型启动前的文件来源,而是成为约束TTFT、吞吐及服务等级协议(SLO)的关键推理数据层。
CMX:在HBM与共享存储之间构建G3.5层级
智能体时代进一步改变了AI基础设施的优化对象。一次复杂请求不再是一次简单的前向传播,而是包含模型调用、工具执行、记忆检索、数据访问及多轮推理的长链路。KV Cache从GPU内部的临时状态,转变为需要跨节点移动、共享和复用的基础设施数据。
在NVIDIA的分层体系中,G1为GPU HBM,保存参与当前Token生成的热KV Cache;G2为系统内存,承担交换和暂存;G3为本地SSD,承接短期可能复用的温数据;G4为面向持久化数据的共享文件或对象存储。随着智能体上下文延伸至多轮对话与跨任务状态,G1至G3的容量受限,而G4的访问时延又无法满足Decode路径的实时性要求。
为此,NVIDIA在CMX平台中引入了“G3.5”层级:一个通过以太网连接、以Flash为介质、面向KV Cache优化的Pod级上下文内存层。它主要承载短暂、派生、可重新计算但延迟敏感的推理上下文,而非取代用于长期知识存储的G4层。
CMX的价值不仅在于为GPU Pod外挂大容量SSD。Dynamo的KV块管理器与NIXL负责KV块跨层编排;DOCA Memos提供上下文缓存的通信、元数据及共享能力;BlueField-4将KV I/O、队列、预取、完整性校验及加密等操作下沉至靠近网络和NVMe Flash的位置;Spectrum-X以太网则提供RDMA数据通道。当Decode即将使用某组KV块时,系统可提前将其从CMX预置到系统内存或GPU HBM,从而减少GPU等待时间和历史上下文重算成本。
NVIDIA披露,CMX可在单个GPU Pod内提供PB级共享上下文容量,针对长上下文和智能体负载,其持续Token吞吐与功耗效率最高可达传统存储方案的5倍。尽管实际收益受模型、缓存命中率及调度策略影响,但这一产品释放的信号明确:Flash开始被GPU平台厂商定义为AI推理内存体系中的正式一层。
Mooncake与CMX并非同类产品,前者是分离式推理与分布式缓存体系,后者是Pod级上下文存储平台。但二者共同揭示了AI Infra的新边界:计算芯片负责算子执行,网络连接资源,而存储则深度参与推理状态的放置、迁移和复用。
AI SSD的自我进化:从被动存储到主动参与
将SSD纳入推理基础设施,并不意味着任意传统SSD都能稳定承担Token生成链路的任务。传统SSD设计围绕顺序带宽、随机IOPS、可靠性和单位容量成本展开,而LLM推理需要的是带有严格时序约束的数据供应。
KV Cache在Prefill阶段集中生成,并在后续对话中被反复读取;MoE模型在每一层激活部分专家,却需保存远超显存容量的专家权重。即使数据最终能从SSD读出,若未赶上模型计算窗口,GPU仍会等待。此外,NAND Flash以页读取、以块擦除的特性,以及FTL(闪存转换层)的地址映射、垃圾回收和磨损均衡机制,导致持续写入KV Cache可能引发写放大、寿命压力及不可预测的尾延迟。传统LBA排布也不知晓模型层、KV块、MoE专家及其执行次序间的关联,逻辑相邻的数据在物理介质中可能分散,不利于并行读取。
因此,AI SSD的定义不能仅停留在“更高峰值带宽”。它至少需解决两个层面问题:一是提供更低延迟、更高耐久性及更稳定尾延迟的介质与I/O能力;二是通过主控、固件、中间件及推理运行时的协同,参与数据分层、缓存管理和预测式预取。
目前市场产品主要分为两类:一是AI负载强化型企业级SSD,如英韧科技洞庭-N3X和华为OceanDisk LC 560,仍保持标准块存储形态,但针对AI集群高频缓存、模型加载及大容量数据调整性能与耐久性指标,解决底层I/O供给问题。二是“推理参与型AI SSD”,试图让SSD从被动响应块设备命令,走向参与模型权重、KV Cache和MoE专家的运行时管理。
三条推理参与型路线:节点缓存、存储侧智能与跨层协同
在推理参与型AI SSD领域,群联、江波龙和寅谱-联芸代表了三种不同的技术路径。
群联:专用缓存SSD与中间件扩展GPU空间 群联aiDAPTIV的核心产品是专用缓存SSD、内存管理中间件及工具链的组合。其目标不是提供单块高性能存储盘,而是将SSD组织成GPU显存外的高容量缓存层。当模型权重超过VRAM容量时,系统将权重切分,根据执行进度在SSD与VRAM间流式搬运,使计算部分留驻GPU附近,非活跃数据下沉至Flash。SSD还可保存被显存驱逐的KV Cache,后续相同上下文出现时取回,减少Prefill成本。群联方案的特点是产品边界清晰:专用高耐久缓存盘负责容量与持续写入(最高100 DWPD),中间件负责数据交换。这一方案将云侧“以存储扩展计算内存”思路压缩至单机或小型集群,形成直接部署路径。
江波龙:让SPU成为存储侧调度节点 江波龙的路线强调SSD主控自身的处理能力。其架构以SPU(存储处理单元)为硬件执行层,iSA(智能存储架构)为软件决策层:iSA感知推理负载并制定数据分层与预取策略,SPU负责存储控制、硬件压缩、高速缓存及具体数据搬运。江波龙WM8500 SPU采用5nm工艺,引入存内无损压缩、HLC高级缓存和混合NAND调度。HLC让SSD承接原本保存在DRAM中的温冷数据,混合NAND按冷热程度在高速缓存区与大容量介质区间分配数据。这一方案体现“存储侧智能化”,控制器不再仅执行主机标准读写请求,开始承担压缩、冷热识别、缓存划分和调度执行,重点面向AI PC、工作站和端侧智能设备。
寅谱-联芸:从AI Infra反向定义SSD数据路径 寅谱(Infplane)与联芸(Maxio)构成了另一条路线。联芸提供NAND、主控、固件及产品适配基础;寅谱则从大模型推理芯片、近存计算、操作系统和主板级协同控制出发,将计算侧的数据分层与调度技术延伸至SSD。在三者中,寅谱是唯一以AI Native而非SSD Native身份进入的企业,其背景使其对AI Infra的理解首先来自模型执行、数据流和调度,而非单盘容量或峰值IOPS。寅谱推行的software-defined chip和近存计算,通过主控、固件、运行时和系统软件协同,让芯片能力持续被定义。在AI推理中,数据是否需要驻留、何时预取、放在哪一级介质,无法仅由传统SSD主控独立决定。寅谱-联芸方案尝试贯通计算侧缓存体系、middleware、firmware、controller和NAND介质管理,围绕MoE专家、KV Cache和数值精度进行数据切分、冷热分层、并行搬运和预测式预取。其设计目标包括减少对模型文件和主流推理框架的侵入,适配不同CPU、GPU、NPU及SSD模组形态。这条路线AI Infra属性突出,把SSD视为云侧、边缘侧和端侧推理数据路径中的可调度层级,需同时处理模型、运行时、OS、固件、主控和NAND接口,研发与验证成本更高。
结语:完整数据路径的竞争
群联、江波龙和寅谱-联芸并非单纯的技术差异,代表了三种不同的AI基础设施切入方式:群联从专用缓存盘和中间件切入,强调可部署的显存与内存扩展;江波龙从SPU和iSA切入,将更多调度与压缩能力放入存储侧;寅谱-联芸从计算与存储协同切入,试图让SSD数据组织方式直接匹配模型执行过程。三者可能分别适用于工作站、AI PC、边缘设备、企业节点和云侧基础设施的不同位置。
从更长产业周期看,AI SSD的门槛不会只体现在主控规格或峰值性能。真正决定产品能否进入推理主链路的,是企业能否建立从NAND介质、FTL、固件、驱动、中间件到推理框架和整机验证的完整协作体系。模型兼容性、缓存命中率、尾延迟、预取准确率、写入寿命和跨平台适配数据,均需通过长期工程实践积累。
Mooncake和CMX已在集群与Pod层面证明推理状态值得单独组织和调度;AI SSD则将这一变化进一步带入节点和设备内部。它不会取代HBM、VRAM或DRAM,而是推动形成更细致的存储层级:最热数据留驻计算芯片附近,温数据进入DRAM或高性能Flash,冷数据下沉至大容量低成本层级,并由软硬件共同决定数据迁移时机。
当AI产业从模型能力竞赛走向大规模应用,基础设施最终需回答的问题不仅是拥有多少FLOPS,还包括每瓦电能生成多少有效Token、每张GPU有多少时间真正参与计算、一段已计算过的上下文能否低成本复用。沿着这一方向,算力、网络、内存和存储边界将日益模糊,AI SSD也有机会从外围设备进入AI Infra核心数据路径,成为决定大模型推理效率的关键变量。