Agent爆发前夜:Infra为何仍死磕Token效率与缓存?

1 阅读

模型迭代加速下的工程折旧困境

当前大模型行业正处于一个看似悖论的阶段:Agent的应用形态日新月异,从工作流编排到多智能体协作,创新频率极高;然而,真正进入稳定生产环境的项目却远未达到市场预期。这种落差并非源于模型能力的不足,恰恰相反,模型能力的快速迭代反而抑制了企业对Agent的长期投入。

一个典型的Agent系统往往涉及任务拆分、提示词工程、工具接入、工作流编排及异常处理等复杂环节。团队耗时数月构建的专用工作流,可能在下一代通用模型发布后,因模型原生推理或工具调用能力的提升而被部分替代。这种不确定性极大地提高了Agent项目的工程折旧速度。企业不得不频繁评估:哪些逻辑应固化在Agent中,哪些应交由通用模型处理。

在此背景下,Agent的核心价值逐渐从“绝对能力超越”转向“场景约束、稳定输出与成本可控”。企业倾向于使用规模更小、经过行业数据微调的开源模型,在特定任务上逼近通用大模型的效果,同时显著降低推理成本。然而,应用层的快速变化使得第三方基础设施厂商难以预判通用Agent Infra的构建层级,导致当前Infra更多仍以传统推理基础设施的形式存在,聚焦于缩短API延迟、提高吞吐量和保障长链路任务的连续性。

长链路调用引发的基础设施压力

Agent系统的本质是将单一请求转化为多步骤的复杂任务流。一个用户请求可能触发模型规划、工具选择、代码执行、结果校验等多轮交互,涉及十几次甚至更多的模型调用。这种长链路特性对基础设施提出了全新挑战,核心压力最终仍落在Token的生产与交付效率上。

首先,并发量显著增加。多个Agent并行运行及子任务的并发执行,对集群调度和请求排队机制提出了更高要求。其次,上下文长度急剧膨胀。Agent需携带历史对话、系统提示、工具描述及中间执行结果,导致输入Token数量持续攀升。

更为关键的是调用链的延长对可靠性的考验。即便单次请求成功率高达99%,在连续调用数十次后,完整任务的成功率将呈现指数级下降。此外,成本结构变得极为复杂,长上下文输入、重复计算、失败重试及跨服务商切换均带来额外开销。在这些指标中,缓存命中率成为最易被低估却直接影响成本的关键变量。

KV Cache复用:成本与性能的双重杠杆

大模型推理过程可拆解为预填充(Prefill)和解码(Decode)两个阶段。Prefill阶段处理完整输入并生成KV Cache,Decode阶段则基于已有状态逐字生成输出。在代码生成或多轮对话场景中,新请求往往保留大部分历史上下文,仅新增少量内容。若能有效复用KV Cache,即可避免重复计算,大幅降低延迟与成本。

数据显示,缓存命中部分的输入成本可能仅为重新计算的十分之一。假设多轮请求中80%至90%的上下文能命中缓存,系统将同时实现延迟降低与成本节约。值得注意的是,缓存命中率从90%降至80%,看似仅下降10个百分点,但未命中比例实则翻倍。由于未命中部分需执行完整的Prefill计算,成本增幅往往远超数字表象。

这也解释了为何低价Token未必带来低总成本。若服务商频繁超时、失败或无法复用缓存,企业需不断重试,最终承担更高费用。同时,缓存机制限制了路由策略。理论上,系统可将请求发送至最空闲或低价的服务商,但若同一会话频繁切换节点,原有KV Cache将无法复用。因此,成熟的多模型路由系统需兼顾实时负载、成功率、模型质量及缓存亲和性,保持会话黏性,仅在服务持续退化时切换路径。

精细化资源规划与标准化缺失

随着推理模型通过更长思考过程换取更高准确率,企业开始尝试设置Token、时间及调用次数上限。然而,单纯设置统一上限在生产环境中并不适用,因为不同业务的输入输出比例差异巨大。

在代码生成场景中,模型需读取大量代码与上下文,但仅修改少量内容,呈现长输入、短输出特征,输入输出比例可达数十比一。而在数学推理或试卷批改中,输入较短,但模型需进行长推理与结果生成,Decode阶段压力更大。这两类任务需不同的资源配置。

若集群采用Prefill与Decode分离架构,需根据负载决定两类资源的分配比例。Prefill资源不足时,长输入请求将排队,即使Decode资源空闲也无法完成任务;反之,Decode资源不足时,输出成为瓶颈,Prefill机器亦被迫等待。虽然动态调整理论上可行,但调度与状态迁移成本高昂。对于负载稳定的大规模场景,提前了解平均输入输出长度及每分钟Token数,进行静态或半动态资源规划,更易获得稳定性能。

此外,当前Token服务缺乏统一质量标准。即便使用相同硬件、模型权重及推理框架,不同部署团队在延迟、吞吐及精度上仍存在差异。批处理策略、并行方式、算子实现、采样参数、缓存管理及量化方式均影响最终结果。量化是最典型变量,服务商可将FP8模型量化至INT8甚至INT4以减少显存占用,但精度可能下降。这些配置对用户不可见,采购时仅能比较价格,而模型能力保持度、服务稳定性及峰值排队情况需经真实测试确认。

评测体系与高可用工程要求

鉴于模型服务的“黑盒”特性,建立统一的评测体系至关重要。一个完整的Token服务评价体系应覆盖模型效果、首Token延迟(TTFT)、输出速度、请求成功率、P95/P99延迟、缓存命中率及高负载下的性能退化程度。

对于Agent而言,可靠性尤为关键。单轮聊天中98%或99%的成功率尚可接受,但在连续多步任务中,任意一次失败均可能导致流程中断。假设任务需连续调用20次,每次成功率99%,完整链路一次成功的概率仅约82%。这意味着Agent的普及迫使推理服务从“平均可用”走向真正的工程级高可用。

企业从试验转向生产,需明确服务等级目标(SLA),包括首Token延迟、输出速度、并发能力、超时比例及高分位延迟。短输入场景要求数秒内返回首Token,长上下文任务可接受更高延迟但需可预测范围。企业关注的不仅是平均延迟,更是99.5%或99.9%的请求能否满足指标。AI系统进入生产环境后,需管理的不再是模糊的“模型速度”,而是一组可拆解和测量的工程指标。

国产芯片的推理引擎与Token化交付

推理框架是连接模型与硬件的关键中间层。vLLM、SGLang等开源框架虽为主流,但最初主要围绕英伟达GPU设计。国产芯片厂商虽可移植这些框架,但“能够运行”不等于“充分发挥性能”。不同芯片在计算单元、显存层级、算子支持、指令系统及通信拓扑上存在差异,针对英伟达优化的策略在其他芯片上可能失效。

这如同为烤面包设计的烤箱改造后蒸馒头,不如重新设计蒸锅。更现实的问题是上游维护。企业在开源框架基础上进行大量底层修改后,面临代码冲突风险:合并新版本可能破坏硬件优化,停止跟进则脱离生态。因此,长期适配多种国产芯片的厂商,自研推理引擎具有工程合理性。但这需要极高的系统人才要求,涉及编译器、算子、缓存管理、Prefill/Decode分离、专家并行、计算通信重叠及集群网络等全栈优化。

国产芯片落地的核心痛点在于使用门槛。企业购买服务器后,需解决驱动、框架、算子、通信、精度及调优等问题。即使芯片价格更低,若部署周期长、稳定性不足,企业仍倾向选择生态成熟产品。推理服务正在改变这一逻辑。当算力以API和Token形式交付后,终端用户无需直接管理芯片。国产芯片与英伟达GPU在调用方式上保持一致,底层适配由专业服务商完成。

从用户视角看,采购对象由服务器变为具有明确价格、延迟和可靠性指标的模型服务。国产硬件的使用难度被封装在基础设施内部,芯片竞争由“能否运行模型”转向“单位成本稳定生产多少有效Token”。2026年以来,部分国产芯片闲置情况改善,新型号在大规模集群中甚至供应紧张。但这主要源于特定业务范围,尚不能代表整个市场。

计费逻辑分层与未来展望

随着Agent进入业务流程,行业讨论新的收费模式。按Token收费标准清晰,基础设施厂商只需对模型调用和资源负责。但企业购买Agent旨在完成任务,如代码修改、客户服务等。因此,Agent层按任务完成数量或业务效果收费更符合用户价值。对服务商而言,此模式形成直接成本优化动力:在保证结果前提下,减少调用次数、缩短上下文及选择低成本模型可提高毛利。

然而,底层基础设施层按Token或资源计量仍可能长期存在。这类似电网:基础设施提供稳定、透明电力,但不负责冰箱是否制冷。推理服务对Token价格、延迟和可靠性负责,却难直接保证上层Agent完成业务目标。未来可能形成两套并行计费逻辑:基础设施层按Token或资源收费,Agent应用层按任务、席位或结果收费。这对应不同责任边界:Infra回答服务是否稳定、便宜、可预测;Agent厂商回答任务是否真正完成。

Agent的快速发展并未让AI Infra变得不重要,反而暴露了此前被单轮对话掩盖的问题。当请求扩展为数十次调用,平均延迟变成长链路等待,偶发失败变成任务中断,低缓存命中率演变为显著成本差异,底层轻微波动被Agent放大。因此,Agent Infra当前最迫切任务并非构造全新概念层,而是先将Token转化为稳定、可评估、可规模交付的基础资源。

只有当Agent应用范式、质量标准及责任边界逐渐稳定后,独立通用的Agent Infra才可能成形。在此之前,行业竞争重点仍将落在推理效率、缓存管理、服务路由、软硬件联合优化及单位成本交付可靠Token的能力上。大模型决定能力上限,而基础设施决定这种能力能否以企业可承受成本持续运行。