Agent形态剧变下,AI Infra如何重构Token交付效率与成本边界

1 阅读

在大模型技术浪潮中,Agent(智能体)无疑是近期最为瞩目的焦点。从最初简单的工作流编排到低代码平台,再到如今具备自主规划能力的Coding Agent和多智能体协作系统,应用层的形态几乎每天都在发生剧烈变化。然而,与市场对于“Agent元年”的热切期待形成鲜明对比的是,真正能够稳定运行在生产环境中的项目依然寥寥无几。这种落差并非完全源于模型能力的不足,反而在某种程度上是因为模型迭代速度过快,导致上层应用难以形成稳定的技术范式,进而给底层基础设施带来了前所未有的不确定性。

当企业投入大量工程资源构建复杂的Agent系统时,往往面临着一种尴尬的局面:耗时数月开发的功能模块,可能随着下一代基础模型原生能力的提升而瞬间过时。模型自身在推理、工具调用及代码生成方面的增强,直接覆盖了部分原本需要由Agent工作流硬编码实现的逻辑。这种快速的技术更迭极大地提高了Agent项目的工程折旧速度,使得企业在进行长期基础设施投入时变得异常谨慎。因此,当前的AI基础设施建设的核心矛盾,已经从单纯追求算力规模,转向了如何在应用形态未定的情况下,最大化每一次模型调用的效率与可靠性。

在这种背景下,所谓的Agent Infra并没有演变成一套完全独立于传统推理设施的新架构,其本质仍然是围绕Token的生产与交付进行极致优化。对于第三方基础设施厂商而言,试图在应用层范式尚未固化之前构建通用的Agent中间件存在极高的风险。相反,专注于缩短API调用延迟、提高吞吐量、降低单次调用成本以及保障长链路任务的稳定性,才是当前最具确定性的投入方向。这意味着,基础设施的价值不再仅仅体现为提供算力,更体现为对计算过程的精细化管控。

Agent系统的引入彻底改变了模型调用的特征。在传统的聊天场景中,一次交互通常只包含一轮输入和输出,而在Agent系统中,一个复杂的用户请求会被拆解为规划、工具选择、联网搜索、代码执行、结果校验等多达数十次的子任务调用。这种长链路的执行模式将单次调用中的微小延迟和失败概率进行了指数级放大。如果单次调用的成功率为99%,那么在连续20次调用的场景下,整个任务一次性成功的概率将骤降至82%左右。因此,基础设施必须从关注平均指标转向关注高分位延迟和极端情况下的稳定性,确保在长尾请求中依然能够提供可预测的服务质量。

在诸多影响成本与性能的因素中,KV Cache的缓存命中率是一个极易被低估却至关重要的指标。大模型推理过程主要分为Prefill(预填充)和Decode(解码)两个阶段。Prefill阶段负责处理输入上下文并生成初始的键值对缓存,计算密集且耗时;而Decode阶段则基于已有缓存逐个生成输出Token,计算量相对较小。在代码生成或多轮对话等场景中,新一轮请求往往保留了上一轮的大部分上下文,仅新增少量内容。如果能够高效复用之前的KV Cache,就可以避免重复进行昂贵的Prefill计算。

数据显示,缓存命中部分的输入成本可能仅为重新计算的十分之一。假设在多轮请求中,缓存命中率从90%下降至80%,看似仅下降了10个百分点,但未命中需要重新计算的比例却从10%翻倍至20%。由于未命中部分涉及完整的Prefill计算,其带来的成本增加远超表面数字所呈现的幅度。此外,缓存机制还限制了多模型路由的策略选择。为了保持缓存亲和性,系统不能仅仅根据实时价格或负载将请求随机分发到最便宜的服务商,而需要在一定时间内保持会话黏性,只有在服务持续退化时才进行切换。这要求路由系统具备更复杂的决策能力,兼顾实时负载、成功率、模型质量与缓存状态。

不同业务场景对推理资源的需求存在显著差异,这也决定了基础设施资源配置的复杂性。以代码生成为例,模型需要读取大量的代码库、依赖关系和上下文信息,但最终输出的修改内容可能非常简短,呈现出典型的“长输入、短输出”特征,输入输出比例甚至可达数十比一。相比之下,数学推理或试卷批改等任务则往往是“短输入、长输出”,模型需要进行长时间的思维链推导,Decode阶段的计算压力巨大。

针对这两种截然不同的负载特征,采用Prefill与Decode分离的架构显得尤为必要。在这种架构下集群可以动态分配资源,专门处理输入的机器和处理输出的机器相互独立。如果Prefill资源不足,长上下文请求会排队等待,即使Decode资源空闲也无法发挥作用;反之,若Decode资源瓶颈,输出速度受限,Prefill机器也会被迫等待。对于负载相对稳定的大规模企业场景,通过提前分析平均输入长度、输出长度及每分钟Token数量,进行静态或半动态的资源规划,往往比完全动态调整更能获得稳定的性能表现。企业需要从实验阶段的粗放管理,转向生产环境的精细化运营,明确首Token延迟、输出速度、并发能力及超时比例等服务等级目标。

值得注意的是,尽管市场通常按模型名称和Token数量报价,但Token并非标准化的工业商品。即便使用相同的硬件、模型权重和推理框架,不同服务商提供的服务质量也可能天差地别。批处理策略、并行方式、算子实现、采样参数、缓存管理以及量化精度等因素,都会直接影响最终的延迟、吞吐和模型精度。特别是量化技术,服务商可能将FP8精度的模型进一步量化为INT8甚至INT4,以节省显存和算力,但这往往伴随着模型能力的潜在损失。

对于用户而言,这些底层配置通常是不可见的“黑盒”。采购前最容易比较的往往是价格,但模型是否保持原有能力、服务在峰值时是否稳定、是否存在隐性排队,只有通过真实的系统性测试才能确认。目前行业缺乏统一的质量标准,导致企业在选择服务商时面临巨大的信息不对称。一个完善的Token服务评价体系,应当覆盖模型效果、首Token延迟、输出速度、请求成功率、P95/P99延迟、缓存命中率以及高负载下的性能退化程度等多个维度。对于Agent应用而言,可靠性是生命线,任何一次底层服务的波动都可能导致上层业务流程的中断,这迫使推理服务必须从“平均可用”走向真正的工程级高可用。

在国产化替代的背景下,推理引擎的角色变得愈发关键。目前主流的开源推理框架如vLLM和SGLang,大多是基于英伟达GPU的软件栈和内存体系设计的。虽然国产芯片厂商可以通过移植让这些框架运行起来,但“能运行”并不等于“高性能”。不同芯片在计算单元、显存层级、指令系统及互联拓扑上的差异,使得直接移植往往无法发挥硬件的全部潜力。这就好比用烤面包的烤箱去蒸馒头,虽然勉强可行,但效率低下。

更现实的问题在于上游维护。如果企业在开源框架基础上进行大量的底层修改以适配特定硬件,后续在面对上游版本迭代时,将面临严重的代码冲突和维护困境。继续合并新版本可能破坏已有的硬件优化,停止跟进则会逐渐脱离开源生态。因此,对于需要长期适配多种国产芯片的厂商而言,自研推理引擎具有一定的工程合理性。但这并非简单的算子优化,而是涉及编译器、缓存管理、专家并行、计算通信重叠及集群调度的全栈系统工程设计。只有实现算法、系统软件与硬件的联合设计,才能真正突破性能瓶颈。

随着推理服务以API和Token的形式交付,国产芯片的使用门槛正在被大幅降低。终端用户不再需要直接面对复杂的驱动适配、算子开发和性能调优问题,而是直接采购具有明确价格、延迟和可靠性指标的模型服务。这种“算力Token化”的趋势,使得国产硬件的竞争焦点从“能不能运行模型”转向了“单位成本能稳定生产多少有效Token”。专业基础设施团队通过集中解决底层适配问题,将硬件差异封装为标准服务,从而推动了国产算力在实际业务中的规模化落地。

展望未来,Agent与Infra的计费模式可能会出现分化。基础设施层将继续沿用类似水电的计量方式,按Token或资源消耗收费,确保底层的稳定与透明。而Agent应用层则可能逐渐转向按任务完成数量、席位或业务结果收费。这种分层计费逻辑对应着不同的责任边界:Infra负责提供稳定、便宜、可预测的模型服务能力,而Agent厂商则负责确保最终业务目标的达成。只有当底层基础设施能够将Token转化为真正稳定、可评估的基础资源时,上层的Agent应用才能摆脱对具体模型版本的依赖,专注于业务价值的创造。在此之前,行业竞争的重心仍将牢牢锁定在推理效率、缓存管理、服务路由及软硬件联合优化之上。