AI预算空转真相:为何80%Token是浪费?管理AI成万亿新蓝海
智能供给过剩时代的资源错配危机
当人工智能从技术奇观转化为基础设施,企业界的叙事重心正经历剧烈偏移。过去两年,资本与技术热情聚焦于基础模型的参数竞赛与算力争夺,许多企业盲目相信“智能即价值”,认为只要增加投入,就能获得等比例的回报。然而,现实数据呈现出一组令人深思的反直觉现象。Ramp Economics Lab对2.1万家美国公司的追踪显示,在AI采用两年后,高强度使用AI的企业员工规模反而增长了10.2%,而低AI支出企业则基本停滞。
这一增长并非源于AI取代了人力,而是源于人类成本相对于AI支出的结构性倒挂。数据显示,头部企业每位员工的AI支出预计将从2025年初的约2万美元激增至2026年底的22.5万美元,这一数字远超美国普通员工年薪及软件工程师薪资。这种“越用越贵”的现象揭示了一个核心痛点:80%的AI预算正处于“空转”状态。a16z投资企业Hebbia的CEO George Sivulka指出,这并非技术缺陷,而是管理缺失。在智能供给急剧扩张的背景下,缺乏管理能力的组织正在经历一场数字时代的“组织膨胀”,而真正的万亿级机会,隐藏在将混乱的智能转化为有序的生产力之中。

Token堆砌与任务定义的模糊性陷阱
组织在面对问题时,惯性反应往往是增加资源,而非重新定义问题。在工业时代,这意味着“加人”;在智能时代,这变成了“加Token”。当模型回答质量不佳时,企业的本能反应是增加推理次数、拉长上下文窗口或开启多轮对话。表面上,这是在提升智能密度,实质上,这是一种用资源冗余来掩盖任务定义不清的“人海战术”。
Token本身并非问题,问题在于企业未能区分哪些信息值得交付给AI,以及如何构建高质量的上下文。真正的上下文不仅仅是数据的堆积,而是对业务流程的清晰阐述和对任务目标的精准界定。如果任务边界模糊、目标函数缺失,更多的Token不仅不会带来智能的提升,反而会制造更昂贵的混乱。许多企业购买了海量“数字员工”,却未建立相应的管理标准,导致AI预算不断攀升,解决的业务问题却未同比增加。
这种误区导致了严重的资源错配。在缺乏明确指令的情况下,AI系统往往需要消耗数倍于必要量的Token来“猜”解意图。这种现象类似于传统企业中,因职责不清导致的无效加班。在AI语境下,无效加班变成了无效Token。因此,首要的管理动作不是采购更强大的模型,而是重构任务定义的逻辑,确保每一个Token的消耗都对应着清晰的业务价值。
Agent循环:昂贵的数字会议
当前主流的Agent系统设计普遍采用“执行-检查-修正”的循环机制。在任务定义明确、评估标准清晰的情境下,这套自我纠错机制高效且智能。然而,在复杂的现实业务场景中,这种循环往往异化为另一种形式的“无效会议”。
当目标模糊时,AI模型不得不通过反复生成、反思、推翻、再生成的过程来寻找可能的答案。这种循环本质上是用算力弥补认知的缺失。a16z提供了一组极具冲击力的测算数据:完成同样的代码库迁移任务,若指令清晰,仅需4美元;若指令含糊且依赖循环修正,成本飙升至310美元。在2026年6月Fable 5的首日测试中,同一任务的单位完成成本差距最高达到17倍。
310美元接近一个美国普通员工一整天的全包人力成本,而其交付的结果却与4美元的任务无二致。从经济学视角看,这与一群人围绕模糊议题反复开会没有任何本质区别:第一次会议无结论,于是决定召开第二次;第二次会议又需要更多人参加第三次。人类用会议消费工时,Agent用循环消费Token。两者背后的核心问题完全一致:管理者未能完成定义问题的工作。对于企业而言,削减无效的Agent循环,优化前置指令的质量,是提升ROI的关键抓手。
组织膨胀与Token效率的新定义
大型组织中普遍存在一种病理现象:流程本为解决问题而设,最终流程本身成为需要维护的问题。一个审批节点衍生出新的审批节点,一个部门为证明存在价值而制造复杂性,组织消耗大量资源维持自身运转,而非创造外部价值。AI系统正重现这一膨胀效应。
当一个Agent负责拆解任务,另一个负责执行,第三个负责检查,第四个负责评估时,系统看似完整,实则可能在彼此生成无效工作。如果没有严格的收益验证机制,每增加一层智能代理,就可能增加一倍的沟通与验证开销。人创造更多的人,Token创造更多的Token。
未来,管理AI的核心指标将从“模型能力”转向“Token效率”。优秀的AI管理者必须具备“断舍离”的勇气,善于砍掉没有价值的推理、循环和冗余上下文。Token效率将取代人力成本,成为新的组织效率衡量标准。这意味着企业需要建立严格的Token审计机制,监控每一次调用的投入产出比,确保每一单位Token都转化为可验证的业务价值,而非陷入自我指涉的数字内耗。
可扩展性优势与百倍杠杆场景
AI真正无可替代的优势在于其极致的可扩展性。复制一名优秀员工的隐性能力,传统路径几乎不可能,需要漫长的招聘、培训与磨合,且受限于个体差异。但一套被验证有效的AI工作流,可在瞬间复制一万份,边际成本趋近于零。
“人类比软件便宜”这一论断常被误解。从单次任务看,经验丰富的人类专家可能比反复试错的AI更经济;但从规模效应看,一旦企业找到有效的上下文、工作流和评估体系,优质Token的边际成本将迅速低于人力。关键在于企业能否找到具有百倍杠杆的AI场景。
上一代科技公司争夺的是“10倍工程师”,下一代企业争夺的,将是能让AI效率提升100倍的业务上下文和管理系统。这种杠杆效应不源于模型本身的参数大小,而源于组织对业务流程的深度解构与重组。企业需聚焦那些标准化程度高、知识密度大、且易于被AI理解的业务环节,通过构建高杠杆的工作流,实现生产力的指数级跃迁。
知识迁移的组织政治与激励机制
管理AI的最大障碍往往不在技术,而在组织政治。企业最有价值的知识——如资深销售的价格敏感度、客服主管的客户情绪洞察力、供应链经理的供应商信用评估——大多存储在员工的脑海中,难以被写进标准流程。AI转型要求员工将这些隐性知识显性化,转化为模型可调用的上下文。
这一过程触动了组织内部的利益结构。千百年来,掌握稀缺知识是职业安全感的来源。中世纪行会保护秘方,现代公司保护“经验”。当企业要求员工将独门方法交给AI时,即便宣称AI仅为辅助工具,员工仍能敏锐察觉到潜在的职业替代风险。没有人会无条件培养一个可能取代自己的接班人。
因此,AI落地的关键在于设计精密的知识迁移激励机制。企业需重构知识贡献的价值评估体系,将知识提取与分享纳入绩效考核,明确效率提升后的利益再分配规则。只有解决“知识归谁、贡献如何计算”的政治难题,才能打破员工的知识囤积惯性,实现隐性知识向显性资产的有效转化。
Eval评估体系:AI时代的OKR
AI在编程领域进展迅速,核心原因之一是代码天然具备客观的评估标准。然而,现实世界中大量工作缺乏明确的验收标准。因此,建立评估体系(Eval)成为AI落地的基石。Eval相当于AI的OKR,但它比传统OKR更具体,将模糊的业务判断拆解为机器可理解的规则序列。
模型能力决定AI的上限,而Eval体系决定企业能否将能力稳定转化为结果。缺乏Eval的系统如同没有导航的船只,在Token的海洋中随波逐流。企业需构建多层次的评估框架,包括事实准确性、逻辑一致性、业务合规性、用户体验等多维指标。通过持续的A/B测试与反馈闭环,不断优化提示词工程与Agent逻辑,确保AI输出的稳定性与可靠性。
转型AI:下一个万亿美元的管理机会
当前硅谷流行一种观点:传统企业因组织僵化无法完成AI转型,机会属于AI原生公司。这一观点仅说对了一半。AI原生公司虽轻且灵活,但传统企业掌握着真实客户、分销渠道、行业牌照、历史数据及未被文档化的业务经验。这些资产不会因新模型发布而贬值,反之,谁能将其转化为AI可调用的工作流,谁就能释放巨大生产力。
未来规模最大的AI公司,未必是基础模型提供商或AI原生服务商,而可能是提供“AI转型管理能力”的企业。这类公司出售的是一套持续的服务体系:梳理流程、提取知识、设计上下文、建立Eval、控制Token成本、划定人机边界,并随模型迭代不断重写业务。
Palantir等平台的崛起预示了这一趋势。其核心价值不在于软件本身,而在于将复杂组织转化为可计算系统的能力。AI时代会将此类需求放大十倍。因为AI转型并非一次性项目,而是一个持续迭代的动态过程。企业每落地一个场景,便会发现十个新场景;模型每提升一次能力,原有流程就值得重新设计。
杰文斯悖论与管理学的回归
技术越高效,对相关资源和服务的总需求反而可能越大,这是著名的杰文斯悖论。AI用得越多,需要被管理的AI也越多。这并非技术的副作用,而是智能普及的必然逻辑。
回顾历史,19世纪30年代美国铁路里程十年增长120倍,但1841年的火车相撞事故暴露了传统管理方式的极限。铁路公司随后建立了区域划分、经理层级、书面职责与汇报体系,现代企业管理由此诞生。铁路先创造了运力,后创造了管理运力的方法。
AI正在重演这一历史。大模型已将“智能供给”变为即时扩张的资源,增加一万名Agent只需调整调用规模。但供给越容易扩张,管理失效的代价就越大。在AI时代,管理反而变得空前重要。这门正在诞生的新管理学,通过系统化地解决任务定义、成本优化、知识迁移与评估体系问题,将成为继算力之后,下一个万亿级的产业机遇。