Agent爆发背后:为何AI基础设施的竞争焦点仍锁定在Token交付效率?

0 阅读

模型进化悖论:Agent投资的工程折旧困境

过去一年,"智能体"(Agent)几乎成为了人工智能领域最密集的词汇。从最初的工作流编排、低代码平台,到如今的Coding Agent、多智能体协作以及具备长期自主运行能力的复杂系统,应用形态呈现出爆炸式的创新与迭代。然而,与市场预期中轰轰烈烈的"Agent元年"相比,真正能够稳定进入企业生产环境并产生实际业务价值的项目数量,依然显得相当有限。

这种落差并非单纯源于模型能力的瓶颈。恰恰相反,模型能力的快速迭代正在制造一种新的不确定性。随着大模型原生能力的增强——如更强大的推理能力、更精准的工具调用以及更复杂的代码生成能力——企业此前投入大量工程资源搭建的Agent系统,可能在一个新的模型版本发布后,其核心价值就被原生能力所覆盖或替代。这意味着,一个经过数月打磨、包含任务拆分、提示词工程、工具接入、异常处理等复杂环节的系统,面临着极高的"工程折旧"风险。

在这种背景下,企业和初创公司陷入了两难境地:哪些能力应该固化在Agent的工作流中?哪些能力未来可能会直接由通用大模型提供?这种判断的难度,极大地抑制了长期投入的决心。虽然通用模型足够强大时理论上可以替代部分专用Agent,但Agent在特定场景下依然保有不可替代的优势:稳定性、可控的成本以及对特定业务逻辑的约束能力。因此,Agent的价值不再仅仅体现为绝对能力的超越,而是体现在对特定场景的深度适配与成本控制上。然而,当前市场尚未形成一套能够跨越不同应用形态、足够稳定的Agent技术范式,这使得第三方基础设施厂商难以提前布局通用的Agent Infra。

长链路放大效应:Token指标背后的隐藏压力

尽管Agent的应用形态不断变化,但其对底层基础设施造成的压力,最终都收敛在Token的生产和交付上。在传统的单轮对话场景中,一次模型调用通常只涉及简单的输入与输出。但在Agent系统中,一个复杂的业务任务(如自动化代码调试或复杂数据分析)往往被拆解为规划、工具选择、联网搜索、代码执行、结果校验和多轮反思等多个步骤。这导致单次用户请求可能触发十几次甚至更多的模型调用。

这种"长链路"调用对基础设施提出了严峻挑战。首先,并发量显著增加。多个Agent并行运行,多个子任务同时调度,对集群的调度算法和请求排队机制提出了更高要求。其次,上下文长度持续变长。Agent需要携带历史对话、系统提示词、工具描述、代码仓库结构以及中间执行结果,使得输入Token数量呈指数级增长。最后,调用链的延长放大了失败风险。即便单次调用的成功率达到99%,在连续执行20次调用的情况下,完整任务一次成功的概率将降至约82%。这意味着,Agent的普及迫使推理服务从追求"平均可用"转向要求真正的"工程级高可用"。

在这些挑战中,缓存命中率是一个极易被低估却对成本影响巨大的指标。大模型推理主要包含Prefill(预填充)和Decode(解码)两个阶段。Prefill阶段处理用户输入并生成KV Cache,Decode阶段则基于缓存逐个生成输出Token。在代码生成或多轮对话中,新请求往往只包含少量新增内容,大部分上下文与上一轮相同。如果系统能有效复用KV Cache,不仅延迟显著降低,成本也可能仅为重新计算的十分之一。然而,缓存命中率从90%降至80%,表面看似微小,实际未命中比例翻倍,导致昂贵的Prefill计算次数激增,最终成本可能远超预期。此外,缓存命中率还限制了路由策略的选择,系统需要在价格、负载和缓存亲和性之间进行复杂的权衡,甚至需要在会话级别保持一定的"黏性",以避免缓存失效带来的性能惩罚。

精细化资源规划:超越Token上限的管理逻辑

随着推理模型通过更长的思考过程(如Chain-of-Thought)来换取更高准确率,企业开始尝试为任务设置Token、时间和调用次数上限。然而,在生产环境中,单纯设置一个统一的Token上限往往是不够的。不同业务场景的输入输出比例存在巨大差异,需要精细化的资源规划。

例如,在代码生成场景中,模型可能需要读取大量代码库、依赖关系和上下文,但最终只修改少量代码片段,呈现出"长输入、短输出"的特点,输入输出比例可能高达数十比一。而在数学推理或试卷批改场景中,输入相对简短,但模型需要进行复杂的推理和长文本生成,Decode阶段的计算压力更大。这两类任务对资源的消耗模式截然不同。

如果推理集群采用Prefill与Decode分离的架构,就需要根据业务负载比例动态分配资源。当Prefill资源不足时,长输入请求会阻塞排队,即使Decode资源空闲也无法加速;反之,若Decode资源不足,输出速度将成为瓶颈。对于大规模企业而言,简单的动态调整可能带来额外的调度开销。因此,更稳健的做法是在生产环境部署前,深入分析业务的平均输入长度、输出长度及每分钟Token吞吐量,进行静态或半动态的资源规划。

企业进入生产阶段后,关注的指标应从模糊的"模型速度"转向一组可拆解、可测量的工程指标:首Token延迟(TTFT)、输出速度、并发能力、超时比例以及高分位延迟(如P95、P99)。例如,短输入场景可能要求TTFT在秒级返回,而长上下文任务则可以容忍稍高的延迟,但必须具备可预测的范围和极高的稳定性。这种精细化的指标管理,是Agent从实验走向规模化生产的关键一步。

黑盒透明化:Token服务的标准化与评测体系

当前市场普遍按照模型名称和Token数量进行报价,容易给用户造成"相同模型、相同Token数在不同服务商之间完全等价"的错觉。但现实情况复杂得多。即便使用相同的硬件、模型权重和推理框架,不同服务商部署的服务在延迟、吞吐量和模型精度上仍可能存在显著差异。这主要源于批处理策略、并行方式、算子实现、采样参数、缓存管理以及量化方式等技术细节的不同。

其中,量化技术是最典型的变量之一。服务商为了降低显存占用和计算成本,可能将原本FP8精度的模型进一步量化为INT8甚至INT4。这对用户而言通常是不可见的"黑盒"操作。虽然在低端测试中差异不明显,但在真实高并发场景下,精度下降可能导致模型推理能力退化,或导致峰值时出现严重的排队和超时。

由于个人开发者和中小企业往往缺乏系统性的压力测试能力,市场上亟需建立统一的质量标准。行业内的评测平台(如覆盖数十家服务商、数百个模型服务的AI Ping平台)正在尝试提供延迟、吞吐和可靠性等维度的对比数据。一个成熟的Token服务体系评价标准,应涵盖模型效果、首Token延迟、输出速度、请求成功率、P95/P99延迟、缓存命中率,以及高负载下的性能退化曲线。

对于Agent而言,可靠性比单纯的速度更为重要。在连续多步任务中,任何一次失败的调用都可能导致整个流程中断或需要高昂的重试成本。因此,基础设施提供商不能仅提供"平均可用"的服务,必须建立能够抵御波动、保证高可用性的工程体系。

硬件生态重构:国产算力与推理引擎的挑战

推理框架是连接模型算法与底层硬件的关键中间层。目前,vLLM、SGLang等开源框架已成为主流,但这些框架最初主要围绕英伟达GPU的软件栈、内存体系和通信协议设计。国产芯片厂商虽然可以进行框架移植,使模型先运行起来,但"能运行"与"高性能"之间存在巨大鸿沟。

不同国产芯片在计算单元、显存层级、算子支持、指令集、芯片互联拓扑等方面存在显著差异。针对英伟达架构优化的调度和算子策略,直接移植到其他芯片上,往往无法充分发挥硬件性能,甚至可能出现严重的性能损耗。这就好比为烤面包设计的烤箱经过改造后也许能蒸馒头,但效率远不如专门设计的蒸锅。

此外,上游维护也是个大问题。如果企业基于开源框架进行大量底层修改以适配特定国产芯片,后续在合并上游新版本时,将面临复杂的代码冲突。继续跟进上游可能破坏定制优化,停止跟进则可能逐渐脱离开源生态,失去社区支持。因此,对于需要长期适配多种国产芯片的厂商,自研推理引擎具有一定的工程合理性。这需要涵盖编译器、算子库、缓存管理、Prefill/Decode分离、专家并行、计算通信重叠以及集群调度等全栈技术能力。

然而,真正具备从头研发推理引擎能力的团队屈指可数。推理引擎的优化不是简单的写几个高性能算子,而是算法、系统软件和硬件的联合设计。局部算子的优化往往会导致系统瓶颈转移到显存带宽或通信阶段。只有全链路的协同优化,才能真正决定集群的性价比。

商业模式演进:从Token计量到结果导向

随着Agent深入业务流程,计费模式也在悄然变化。传统上,基础设施层按照Token数量或计算资源进行计量收费,优点是标准清晰,厂商只需对模型调用和资源消耗负责。然而,企业购买Agent的核心诉求并非Token的数量,而是任务完成的业务价值(如代码修改、客服问题解决、数据洞察等)。

因此,在Agent应用层,按任务完成数量或业务效果收费的模式更具吸引力。这种模式对服务商形成了直接的成本优化动力:在保证结果质量的前提下,通过减少模型调用次数、优化上下文长度、选择更便宜的模型来提高毛利。但在底层基础设施层,按Token或资源消耗计量仍将是长期存在的逻辑。这类似于电力公司按度数计费,而不关心用户用电力煮咖啡还是炼钢。

这种分层计费逻辑对应着不同的责任边界:Infra层负责提供稳定、便宜、可预测的Token服务;Agent层负责确保最终业务目标的达成。未来,推理服务的核心价值将从"能不能跑"转向"单位成本能稳定生产多少有效Token"。国产芯片的机会在于,通过专业的基础设施团队将底层硬件适配、性能调优等复杂问题封装在内部,以标准化的API和Token服务形式交付,从而降低使用门槛,解决生态碎片化问题。

基础设施的回归:稳定交付Token是当务之急

Agent的快速发展并没有让AI Infra变得无关紧要,反而暴露了此前被单轮对话掩盖的底层问题。当一次请求扩展为数十次调用,平均延迟变成长链路等待,偶发失败变成任务中断,较低的缓存命中率演变为显著的成本差异,底层服务的微小波动都会被Agent成倍放大。

因此,Agent Infra当前最迫切的任务,并非构造一个全新的概念层,而是先把Token打造成真正稳定、可评估、可规模交付的基础资源。只有当Agent的应用范式、质量标准和责任边界逐渐稳定后,一套独立且通用的Agent Infra才可能真正成形。在此之前,行业的竞争焦点仍将落在推理效率、缓存管理、服务路由、软硬件联合优化,以及单位成本下可靠Token的交付能力上。大模型决定了能力的上限,而基础设施决定了这种能力能否以企业可承受的成本持续运行。