算力接力新范式:PDD架构如何砍半延迟并降本40%?

0 阅读

在大模型应用从实验走向规模化落地的关键节点,推理系统的经济性与响应速度已成为制约行业发展的核心瓶颈。长期以来,业界普遍采用同构集群部署方案,即使用相同规格的高性能GPU同时处理预填充(Prefill)和解码(Decode)任务。然而,这种“一刀切”的资源配置方式忽视了LLM推理两个阶段截然不同的硬件需求特征:预填充阶段属于计算密集型,对算力要求极高;而解码阶段则是典型的访存密集型,更依赖显存带宽。这种资源错配不仅导致硬件性能无法充分发挥,更使得企业在面对日益增长的推理请求时,不得不承受高昂的基础设施成本。

随着智能体(Agent)应用的爆发式增长,推理负载呈现出上下文极长、缓存命中率极高但输出极短的特征。在这一背景下,简单的线性扩容已无法满足需求,跨集群、跨地域的算力协同成为必然选择。然而,当试图通过广域网连接分散各地的数据中心以实现异构算力互补时,KV Cache的大规模数据传输成为了横亘在工程实践面前的一道巨大障碍。传统的PD分离架构在跨域场景下,往往因网络延迟和带宽限制,导致首字生成时间(TTFT)大幅延长,严重损害用户体验。如何在保证低延迟的前提下,实现全域异构算力的最大化调度,成为亟待解决的技术难题。

针对这一痛点,一种名为PDD(Prefill-RelayDecode-MainDecode)的创新架构应运而生。该架构并未试图强行提升广域网的物理传输速度,而是通过重构推理链路,引入“中继解码”概念,巧妙地将网络延迟从用户感知中剥离。其核心思想在于将传统的二级PD分离扩展为三级架构:在主集群部署负责预填充的P实例和负责中继解码的RLD实例,在远端集群部署负责主解码的MD实例。P实例与RLD实例之间通过高速RDMA网络连接,确保KV Cache的微秒级传输;而RLD实例与MD实例之间则通过低成本广域网以太网连接。

这种设计的精妙之处在于“接力跑”机制。当P实例完成预填充后,KV Cache会同时发送给本地的RLD实例和远端的MD实例。由于RLD实例位于同一机房,它能几乎即时获取数据并开始生成Token,直接向用户输出内容。此时,用户已经看到了模型的回复,完全感知不到后台正在进行的跨域数据传输。尽管广域网传输可能需要数秒甚至更长时间才能将完整KV Cache送达MD实例,但这一延迟已被RLD的抢先输出所掩盖。一旦MD实例接收完毕并准备好上下文,解码任务便无缝交接给MD,由后者承担后续绝大部分的计算负载。

然而,任务的无缝交接并非易事。若采用传统方式,RLD需将新生成的增量KV Cache实时传回MD,这将再次陷入网络传输的不确定性泥潭。为此,PDD架构提出了一种反直觉的“Extend-Decode Handoff”机制。RLD仅向MD传输极小的Token ID序列,而非庞大的KV Cache数据。MD收到Token ID后,利用本地算力重新计算对应的KV Cache。虽然重算涉及额外计算,但由于解码阶段计算量相对轻量,且现代硬件对矩阵运算的高度优化,重算耗时远低于跨域传输大块数据的时间,且具有极高的确定性。这一机制将不可控的网络波动转化为可控的本地计算,从根本上解决了交接过程中的延迟抖动问题。

进一步分析发现,智能体工作负载中的缓存命中率分布呈现极度偏斜特征。绝大多数请求命中率超过95%,仅有极少数“刺头请求”携带大量未缓存的新增上下文。基于这一洞察,PDD架构设计了动态路由策略:对于高命中率请求,直接通过P-MD链路传输,因其数据量小,网络延迟可忽略不计;仅对低命中率的长尾请求启用P-RLD-MD链路,利用RLD掩盖传输延迟。这种精细化调度确保了RLD实例仅承担约6.2%的Token生成任务,避免了中继节点成为新的系统瓶颈,同时保证了远端MD实例能承接93.8%的主要负载,实现了资源的高效利用。

在实际生产环境的测试中,PDD架构展现出了显著的性能优势。相较于传统的跨集群PD分离方案,PDD将P90级别的首Token延迟降低了46%,P99延迟更是大幅下降。更重要的是,在严格的服务等级协议(SLA)约束下,PDD架构通过复用各地闲置的低成本算力节点,使得整体推理成本降低了近40%,同时有效吞吐量提升了27.8%。这一结果证明,通过软件架构的创新,完全可以突破硬件物理分布的限制,实现算力资源的时空置换。

从更宏观的视角来看,PDD架构的提出标志着大模型基础设施正在从“集中式堆砌”向“分布式协同”演进。它不再强求单一数据中心内具备完美匹配的异构硬件组合,而是允许主中心保留极简的局部异构能力,通过灵活的网络拓扑调动全球范围内的存量算力。这种“极简局部异构+灵活远端分离”的模式,极大地提升了基础设施的弹性与经济性。随着模型迭代速度的加快,固定配比的硬件集群极易面临资源闲置风险,而PDD所代表的跨集群范式,能够根据模型特性动态调整P与D的算力配比,最大化释放产业价值。

此外,该架构还为未来多模态、超长上下文模型的推理提供了可扩展的解决方案。随着上下文窗口不断扩展,KV Cache的体积呈指数级增长,跨域传输的压力将进一步加剧。PDD通过中继机制和重算策略,为应对这一挑战提供了可行的技术路径。未来,结合更先进的压缩算法、投机解码技术以及专用推理芯片,PDD架构的性价比仍有巨大的提升空间。它不仅是一项具体的技术优化,更是一种重新定义算力调度逻辑的思维范式,为构建下一代高效、低碳、经济的MaaS基础设施奠定了坚实基础。

值得注意的是,这一架构的成功落地依赖于对业务负载特征的深刻理解与精准建模。只有准确识别出流量中的“二八定律”,才能设计出如此高效的路由与交接机制。这也提示我们,在追求底层技术创新的同时,必须紧密结合上层应用场景的实际需求。未来的AI基础设施竞争,将不再是单纯硬件算力的比拼,而是系统架构对异构资源调度能力、网络延迟掩盖能力以及成本控制能力的综合较量。PDD架构的出现,无疑为这场竞赛提供了一个极具启发性的参考答案,预示着算力网络时代的全新可能。