AI SSD崛起:大模型推理如何重构存储与计算的协同边界

2 阅读

在过去两年中,人工智能基础设施的竞争焦点主要集中在GPU数量的扩张、芯片算力的提升、HBM带宽的突破以及高速网络的铺设上。然而,随着大语言模型逐步迈入长上下文理解、复杂逻辑推理以及多智能体协作的新阶段,决定系统有效Token产出效率的关键因素正在发生深刻变化。GPU虽然仍是算力的核心底座,但其实际利用率越来越依赖于模型权重、键值缓存(KV Cache)以及混合专家模型(MoE)专家权重能否在精确的时间点到达指定的计算节点。

如果KV Cache无法实现及时复用,系统将不得不重新执行耗时的Prefill阶段;若MoE专家权重未在路由决策前加载至内存,GPU将面临空闲等待;而当大量推理状态长期占用高带宽内存(HBM)时,并发请求的处理能力和有效批处理空间将被严重压缩。因此,AI基础设施正从单纯的“计算资源堆叠”向“计算、网络、内存与存储数据路径的深度协同”演进。月之暗面推出的Mooncake架构与NVIDIA发布的CMX平台,正是这一趋势的两个标志性信号,它们共同指向一个核心结论:推理状态正在成为AI基础设施中的一级资源,存储设备开始正式进入Token生成的实时主链路。

Mooncake架构的产业意义不仅在于为特定大模型服务提供了新的推理系统,更在于它彻底改变了大模型基础设施对“数据”的组织逻辑。传统推理节点通常将GPU、CPU、DRAM和本地SSD视为服务器内部的固定资源,KV Cache往往跟随请求和GPU实例存在。一旦缓存被驱逐或请求发生迁移,已完成的Prefill计算成果便可能失去复用价值,导致在长上下文场景下出现严重的重复计算和资源浪费。Mooncake采用以KV Cache为中心的分离式架构,将Prefill与Decode部署在不同的资源池中,并将集群中未被充分利用的CPU、DRAM、SSD和网络接口卡组织成分布式的KV Cache池。

在该架构中,中央调度器不再仅依据GPU负载分发请求,而是综合考量KV Cache分布、缓存命中率、节点负载以及首字延迟(TTFT)、每Token生成时间(TBT等服务目标,从而决定缓存复用策略、Prefill执行时机和Decode调度顺序。可复用的Prefix KV Cache被优先送至合适的Prefill实例,新生成的KV Cache随模型各层计算持续产生,并通过异步流送方式传输至目标Decode节点。只有当缓存准备就绪后,请求才进入连续批处理阶段。这种“用更多存储换取更少计算”的思路,显著提升了系统的有效请求承载能力。值得注意的是,Moonstore已将DRAM与SSD明确纳入多级缓存体系,允许内存淘汰对象后台写入SSD,并在未命中时回读,这使得SSD不再是冷数据的仓库,而是影响TTFT和吞吐率的关键推理数据层。

与此同时,NVIDIA在Agent时代背景下推出了CMX上下文内存存储平台,进一步细化了存储层级。在复杂的智能体任务中,一次请求可能涉及模型调用、工具执行、记忆检索和多轮推理,KV Cache需要从GPU内部的临时状态转变为可跨节点移动和共享的基础设施数据。NVIDIA构建了G1至G4的分层存储体系,其中G1为GPU HBM,G2为系统内存,G3为本地SSD,G4为持久化共享存储。针对G3容量有限而G4延迟过高的问题,CMX引入了基于Flash介质的“G3.5”层级,即Pod级上下文内存。它专门承载短暂、派生且延迟敏感的推理上下文,通过BlueField-4 DPU下沉KV I/O操作,结合Spectrum-X以太网提供RDMA数据通道,实现了PB级共享上下文容量。据官方数据,该方案在长上下文负载下的能效比可达传统方案的5倍,标志着Flash正式被定义为AI推理内存体系中的正式一层。

当SSD被纳入推理基础设施的核心链路后,其自身设计也面临巨大挑战。传统SSD围绕顺序带宽、随机IOPS和可靠性设计,而LLM推理需要的是带有严格时序约束的数据供应。KV Cache在Prefill阶段集中生成,随后在对话中被反复读取;MoE模型则需要在每一层激活部分专家,并保存远超当前显存容量的专家权重。如果数据读取未能赶上模型的计算窗口,GPU仍将进入等待状态。此外,NAND Flash的物理特性如页读取、块擦除以及FTL层的垃圾回收机制,可能导致写放大和难以预测的尾延迟。传统LBA排布无法感知模型层、KV块及MoE专家的执行次序,导致逻辑相关的数据在物理介质中分散,不利于并行读取。因此,AI SSD必须具备更低延迟、更高耐久性和更稳定的尾延迟表现,并通过主控、固件与推理运行时的协同,参与数据分层和预测式预取。

目前市场上的AI SSD产品逐渐分化为两类:一类是AI负载强化型企业级SSD,如英韧科技的洞庭-N3X和华为OceanDisk LC 560,它们通过优化介质和固件,解决高频缓存卸载和大容量数据加载的I/O供给问题;另一类则是“推理参与型AI SSD”,试图让存储设备从被动响应命令转向主动参与运行时管理。在这一领域,群联、江波龙和寅谱-联芸代表了三种不同的技术路线。

群联电子通过aiDAPTIV方案,将专用缓存SSD、内存管理中间件和工具链组合,把SSD组织成GPU显存之外的高容量缓存层。当模型权重超过VRAM容量时,系统将其切分并流式搬运,使活跃数据留在GPU附近,非活跃数据下沉至Flash。该方案以高达100 DWPD的耐久性专用缓存盘为基础,通过中间件实现数据交换,为工作站和小型集群提供了直接的显存扩展路径。

江波龙则强调存储侧的智能化,其架构以SPU为硬件执行层,iSA为软件决策层。iSA感知推理负载并制定分层与预取策略,SPU负责具体的数据搬运、硬件压缩和缓存管理。其WM8500 SPU采用先进工艺,引入存内无损压缩和混合NAND调度,使SSD能够承接原本保存在DRAM中的温冷数据。这种“存储侧智能”路线特别适用于AI PC和端侧智能设备,控制器不再只是执行读写,而是承担冷热识别和调度执行的角色。

寅谱与联芸的合作则代表了从AI Infra反向定义SSD数据路径的思路。作为以AI Native身份进入该领域的企业,寅谱从大模型推理芯片和系统协同出发,将计算侧的数据分层技术延伸至SSD。联芸提供主控和固件基础,寅谱则通过software-defined chip和近存计算技术,贯通计算侧缓存体系、中间件、固件和NAND介质管理。该方案围绕MoE专家、KV Cache和数值精度进行数据切分和预测式预取,旨在减少对主流推理框架的侵入,并适配多种硬件形态。这条路线研发成本高,但能更精准地匹配模型执行过程,将SSD视为云、边、端推理数据路径中的可调度层级。

这三种路线并非简单的替代关系,而是分别适用于不同场景。群联侧重于可部署的显存扩展,江波龙聚焦于存储侧的调度与压缩能力,而寅谱-联芸则致力于计算与存储的深度协同。从长远来看,AI SSD的竞争门槛不在于单盘峰值性能,而在于企业能否建立从NAND介质、FTL、固件到推理框架的完整协作体系。模型兼容性、缓存命中率、尾延迟控制和预取准确率等指标,需要通过长期的工程实践来积累。

Mooncake和CMX已在集群层面证明了推理状态单独调度的价值,而AI SSD则将这一变革带入节点和设备内部。它不会取代HBM或DRAM,而是推动形成更细致的存储层级:最热数据留在计算芯片附近,温数据进入高性能Flash,冷数据下沉至低成本层级,并由软硬件共同决定迁移时机。随着AI产业从模型能力竞赛转向大规模应用落地,基础设施的核心指标将从FLOPS转向每瓦电力生成的有效Token数及GPU的有效计算时间。在此背景下,算力、网络、内存和存储的边界日益模糊,AI SSD有望从外围设备跃升为AI基础设施核心数据路径的关键组成部分,重新定义大模型推理的经济性与效率。