跨集群推理破局:PDD架构如何让延迟减半、成本直降40%?
在大模型应用从实验走向规模化落地的关键节点,推理系统的效率与成本已成为制约行业发展的核心瓶颈。长期以来,业界普遍认同LLM推理存在两个特性迥异的阶段:计算密集型的Prefill(预填充)和访存密集型的Decode(解码)。理论上,最优解是让算力强大的芯片处理Prefill,让显存带宽高的芯片负责Decode。然而,现实中的硬件采购与维护成本高昂,且固定配比的异构集群在面对模型架构迭代时极易出现资源闲置。于是,一个极具吸引力的构想应运而生:能否利用低成本广域网以太网,将分布各地的存量同构集群连接起来,实现跨集群的异构分离式推理?这一设想虽美好,却撞上了KV Cache跨集群传输延迟与带宽限制的“叹息之墙”。
要突破这堵墙,首先需深入理解硬件性能与业务负载的底层规律。测试数据揭示了一个显著现象:硬件性能存在极度“偏科”。以某旗舰高性能GPU为基线,部分专用芯片在Prefill阶段性能仅为基线的81%,但在Decode阶段却能爆发出一倍以上的性能优势。若将其置于同构集群中混用,不仅无法发挥长板,反而拖累整体效率。更关键的是,智能体工作负载呈现出“上下文极长、缓存命中率极高、输出极短”的特征。分析显示,约90%的请求命中率超过95%,这意味着绝大多数请求只需传输极少量的增量KV Cache。然而,剩余那10%的低命中率“刺头请求”,却携带着巨大的数据包,导致网络拥堵,使得端到端延迟中KV传输占比高达43%至56%。这种极度偏斜的分布规律表明,解决延迟瓶颈无需全局优化,只需精准打击少数长尾请求即可。
基于上述洞察,PDD(Prefill-RelayDecode-MainDecode)架构应运而生。它打破了传统PD分离的二元结构,创新性地引入了第三层——中继解码实例(RLD)。整个系统被重构为三级流水线:位于主集群的P实例负责生成KV Cache;同机房的RLD实例通过高速RDMA网络瞬间接收数据;而位于远端集群的MD实例则通过广域网以太网接收数据。这一设计的精妙之处在于“接力跑”机制:当P实例完成计算后,KV Cache同时发送给RLD和MD。RLD凭借本地低延迟优势,立即开始解码并向用户输出首字,从而完美掩盖了广域网传输那数秒甚至十几秒的延迟。待MD实例接收完完整数据后,解码任务再无缝交接给它,由其后继完成大部分吐字工作。
然而,任务的无缝交接并非易事。传统做法是RLD一边解码一边将新生成的增量KV Cache传回MD,但这再次陷入网络传输的不确定性中。PDD提出了一种反直觉的高效机制——“扩展解码交接”(Extend-Decode Handoff)。在此机制下,RLD不再传输庞大的KV Cache,仅将生成的Token ID传给MD。由于Token ID数据量极小,网络开销几乎为零。MD收到ID后,利用本地算力重新计算对应的KV Cache并继续生成后续Token。尽管涉及重算,但鉴于Decode阶段计算轻量,重算100个Token的平均耗时仅约300毫秒,且波动极小。相比之下,直接传输KV Cache不仅平均耗时长,且受网络波动影响巨大。通过“只传Token,本地重算”,PDD将不可控的网络操作转化为确定性的本地计算,极大提升了系统的稳定性。
为了防止RLD成为新的系统瓶颈,PDD设计了智能的路由策略。鉴于绝大多数请求命中率高、数据包小,系统直接将这类请求通过P-MD流水线处理,绕过RLD。只有那些命中率低、必然导致传输卡顿的“刺头请求”,才被路由至P-RLD-MD流水线。实测数据显示,RLD仅承担了系统6.2%的Token生成任务,而93.8%的重活由远端MD实例包揽。这种负载分配不仅避免了RLD过载,还确保了MD端的缓存命中率与P端保持一致,防止了因请求生命周期终结于RLD而引发的恶性正反馈循环。
在真实业务场景下的压力测试进一步验证了PDD的卓越性能。以DeepSeek-V4-pro模型为例,在严格的SLA约束下,传统跨集群PD分离架构的P90首字延迟高达18.3秒,而PDD将其大幅降至9.8秒,降幅近半。更重要的是,在总成本仅微降3.5%至7.1%的情况下,PDD的有效吞吐量提升了27.8%,最终使得性价比指标提升了37.5%。这一成果证明,通过极简的局部异构配合灵活的远端分离,不仅能显著提升用户体验,更能最大化释放全域异构算力的产业价值。
PDD架构的出现,标志着大模型推理基础设施进入了一个新阶段。它不再依赖单一数据中心内昂贵的异构堆砌,而是通过软件定义的网络架构,将分散在全国乃至全球的低成本算力节点串联成一张弹性推理网。这种“极简局部异构+灵活远端分离”的模式,为应对模型快速迭代带来的资源适配难题提供了终极解法。未来,随着更多专用推理芯片的接入及MTP等优化机制的融合,跨集群推理的性价比仍有巨大提升空间。这不仅是一次技术架构的胜利,更是对云计算资源调度理念的一次深刻重塑,让每一块芯片都能在其最擅长的领域发挥极致效能。