跨集群推理破局:PDD架构如何砍半延迟并降本40%?
在大模型应用从实验走向规模化落地的关键节点,推理系统的成本结构与响应速度已成为制约行业发展的核心瓶颈。传统单一集群内的同构部署模式,虽然网络环境稳定,但难以兼顾计算密集型预填充(Prefill)与访存密集型解码(Decode阶段)对硬件资源的差异化需求。与此同时,试图在同一数据中心内构建大规模异构集群,又面临采购成本高企、资源配比僵化以及模型迭代导致的闲置风险。面对这一困境,一种更具宏观视野的技术路径逐渐清晰:利用低成本广域网以太网,将分布在全国各地的存量同构集群串联起来,实现跨地域的异构算力协同。
然而,理想丰满,现实骨感。跨集群推理最大的拦路虎在于KV Cache的跨域传输。在广域网环境下,带宽受限且延迟波动大,尤其是对于长上下文场景,庞大的键值缓存传输往往导致首字延迟(TTFT)急剧飙升,严重损害用户体验。无问芯穹团队最新发布的PDD(Prefill-RelayDecode-MainDecode)架构,正是为了攻克这一“叹息之墙”而生。该架构并未单纯依赖网络优化,而是从系统架构层面进行了重构,通过引入中继解码节点,创造性地解决了以太网环境下的传输延迟痛点,实现了延迟减半与成本大幅降低的双重突破。
要深入理解PDD架构的精妙之处,首先需洞察大模型推理背后的三个底层规律。首先是硬件性能的“极度偏科”。基准测试显示,不同芯片在Prefill和Decode阶段的表现截然不同。某些专用芯片在计算密集的Prefill阶段性能仅为旗舰GPU的81%,但在访存密集的Decode阶段却能释放出210%的性能优势。若强制其在同构集群中承担全链路任务,不仅长板无法发挥,反而会成为整体效率的短板。这为将Prefill与Decode解耦并部署在最适配硬件上提供了理论依据。
其次是前缀缓存带来的带宽红利。智能体业务具有极高的前缀缓存命中率,平均可达90%以上。通过部署RadixCache(DRC)技术,Decode端可缓存历史请求的KV Cache。当新请求命中缓存时,仅需传输增量数据,理论上可将跨集群带宽需求降低一个数量级。这一发现初步缓解了带宽压力,但并未彻底解决延迟问题。特别是在智能体工作负载呈现“上下文极长、命中率极高、输出极短”的特征下,即便数据量减少,网络传输的物理延迟依然占据端到端延迟的极大比例,成为影响用户体验的关键因素。
更为关键的洞察来自对真实业务流量分布的分析。数据显示,请求的缓存命中率分布呈极度偏斜状态:约70%-80%的请求命中率超过95%,数据包极小;仅有少数低命中率请求携带大量KV Cache。微基准测试表明,在真实偏斜分布下,绝大多数请求的传输延迟极低,只有极少数“刺头请求”会出现秒级甚至十秒级的长尾延迟。而在均匀分布假设下,网络连接池易被中等大小数据包打满,导致全面拥塞。这意味着,优化重点不应是全局降低网络延迟,而是精准消除那少部分低命中率请求带来的长尾延迟。
基于上述洞察,PDD架构提出了“P-RLD-MD”三级分离式推理模型。与传统PD两层架构不同,PDD在主集群中引入了一个中继解码实例(RLD)。RLD与负责预填充的P实例位于同一机房,通过高速RDMA网络互联,延迟仅在毫秒级;而主解码实例(MD)则位于远端集群,通过广域网以太网连接。当P实例完成Prefill后,KV Cache会同时发送给RLD和MD。由于RDMA的高速特性,RLD能几乎瞬间获取数据并立即开始解码,向用户输出首字。此时,用户感知到的延迟仅取决于本地RDMA传输,完全屏蔽了广域网的慢速传输过程。
随着后台以太网逐步将完整KV Cache传输至远端MD实例,系统面临另一个工程难题:如何将正在进行的解码任务从RLD无缝交接给MD?传统做法是RLD持续将新生成的增量KV Cache传回MD,但这仍受限于网络波动且涉及繁琐的显存拷贝。PDD采用了一种反直觉却高效的“Extend-Decode Handoff”机制:RLD仅将生成的Token ID序列发送给MD,数据量仅为KB级别,网络开销几乎为零。MD收到Token ID后,利用本地算力重新计算对应的KV Cache并继续生成后续Token。
这种“只传Token、本地重算”的策略之所以可行,源于Decode阶段的计算轻量特性。实测显示,在MD端重算100个Token的KV Cache平均耗时仅305毫秒,且标准差极小,具有高度确定性。相比之下,直接传输KV Cache不仅平均耗时更长,且受网络拥堵影响波动巨大。通过将不可控的网络传输转化为可控的本地计算,PDD成功实现了任务的平滑交接。此外,系统还设计了“追赶式”和“一次性”两种交接模式,可根据实时负载动态调整,确保用户体验的一致性。
为了避免RLD成为新的系统瓶颈,PDD采用了精细化的流水线编排策略。鉴于绝大多数请求具有高命中率,系统默认采用P-MD直连管线,仅将那些低命中率、大数据包的“刺头请求”路由至P-RLD-MD管线。实测数据证实,RLD仅承担了系统6.2%的Token生成任务,而93.8%的重负载由远端MD实例承担。这种设计不仅有效保护了RLD资源,还确保了MD端的缓存命中率与P端保持一致,避免了因生命周期终结于RLD而引发的恶性正反馈循环。
在DeepSeek-V4-pro模型上的真实业务Trace测试中,PDD架构展现了卓越的性能表现。在跨集群场景下,传统方案的P90 TTFT高达18.3秒,而PDD将其降至9.8秒,降幅达46%;P99延迟也从29.7秒降至14.4秒。更重要的是,在满足严格SLA约束(P90 TTFT < 10s)的前提下,PDD架构通过灵活调度异地低成本算力,使得单Token成本降低了37.5%,有效吞吐量提升了27.8%。这一结果证明,PDD不仅在技术上可行,更在经济上具备显著优势。
PDD架构的出现,标志着大模型推理基础设施正在从“单机房同构”向“全域异构协同”演进。它不再要求企业在单一数据中心内堆砌昂贵的异构硬件,而是通过极简的局部中继节点,激活全国乃至全球范围内的存量算力资源。这种“极简局部异构+灵活远端分离”的模式,极大地提升了资源调度的弹性与经济性,为应对模型快速迭代带来的资源闲置问题提供了全新思路。
未来,随着MaaS(Model-as-a-Service)模式的普及,推理基础设施将呈现出更加复杂的拓扑结构。多对多、多对一的跨域连接将成为常态,不同厂商、不同代际的芯片将在统一调度下各司其职。PDD架构所验证的技术路径,不仅解决了当前的延迟与成本痛点,更为构建开放、兼容、高效的大模型推理生态奠定了坚实基础。每一块芯片都能在其最擅长的领域发挥最大价值,这不仅是技术的进步,更是产业资源配置方式的深刻变革。