AI算力变“奶茶”?Token补贴战背后的留存逻辑与商业困局

0 阅读

从参数竞赛到“奶茶”博弈:AI行业的商业化新范式

2026年的夏天,人工智能行业出现了一个极具隐喻色彩的现象:曾经高高在上、以参数规模和榜单排名论英雄的AI巨头们,突然开始像街头奶茶店一样“发券”了。北京时间7月31日,OpenAI宣布将GPT-5.6 Luna的API价格大幅下调80%,Terra模型降价20%。与此同时,Anthropic将原本限时免费的Fable 5模型纳入高阶套餐,DeepSeek则推出了永久降价75%的V4-Pro模型,并引入峰谷定价策略。

这种变化并非孤立事件,而是一场席卷全行业的系统性调整。Token(令牌,即AI模型处理文本的基本单位)不再仅仅是技术计量的单位,它被赋予了类似“优惠券”、“续杯券”甚至“股权对赌筹码”的多重属性。OpenAI甚至向YC创业公司提出,以最高200万美元的Token额度换取股权,这种将算力直接转化为投资手段的做法,标志着AI竞争维度的根本性转移。

这场“Token奶茶大战”的核心逻辑,与外卖平台的补贴战如出一辙:表面是让用户占便宜,实质是争夺用户的消费习惯和长期留存。当模型差距缩小、迁移成本降低,技术能力逐渐沦为入场券,AI公司必须面对一个更残酷的问题——当用户可以在不同工具间无缝切换时,如何让他们留下来?

消耗模式的剧变:从“2G”到“5G”的Token焦虑

此次Token促销潮的背后,是AI用户行为模式的深刻变革。过去,用户向聊天机器人提问并获得答案,流程简单且Token消耗量相对较小,类似于“2G时代”的短信交互。然而,随着Agent(智能体)用户的暴增,单个用户消耗的额度呈指数级增长,行业正式迈入“5G时代”。

数据揭示了这一趋势的严峻性。截至2026年6月初,OpenAI的Codex每周活跃用户已超过500万,是2月桌面应用推出时的6倍以上。更值得注意的是,非开发者用户占比达到20%,且增速是开发者的3倍。编程Agent的用途已超出写代码范畴,整理资料、撰写文档和分析数据成为常见用法,部分用户甚至将全流程任务交给Agent完成。

根据OpenAI官方数据,到2026年5月,80.6%的Codex个人用户至少提交过一次相当于人类工作30分钟以上的任务,25.6%提交过相当于8小时以上的任务,超过10%的用户每周同时管理3个以上Agent。Anthropic对约40万次Claude Code会话的分析也显示,用户平均每周使用约20小时,用于写文档和分析数据的会话占比从2025年10月的10%翻倍至2026年4月的20%,平均任务价值提高了27%。

随着Agent从偶尔尝鲜进入日常工作流,额度从附赠福利变成了刚需。厂商开始争夺那些使用频率高、付费周期长的用户。截至2026年2月,Claude Code年化收入已超过25亿美元,较年初翻倍,企业订阅数量增长4倍,企业客户贡献了超过一半的收入。谁能让这批用户更频繁地使用Agent,谁就可能获得持续增长的Token收入。

无忠诚度的时代:模型趋同与迁移便利

然而,这些高价值用户并不忠诚。AI客服平台Pylon的CEO直言:“我完全看不到任何忠诚度。”

过去购买传统软件选定一家并持续付费的时代已经过去。企业现在通常会同时接入几家模型,具体任务交给哪一家,主要看效果和价格。Cursor的产品本身就是“与模型无关”的,用户可以在OpenAI、Anthropic、Google和开源模型之间自由切换。其负责人指出,过去一项任务的最佳模型可能几个月才变化一次,现在每周都可能更换好几次。

这种“花心”源于两个关键因素:模型能力的趋同和迁移成本的降低。

2026年,的里雅斯特大学、伦敦国王学院和伦敦大学学院的研究者分析了7156个由编程Agent生成的GitHub拉取请求,结果显示没有任何一个工具能在所有任务中领先。很多时候,任务类型带来的差距,比工具之间的差距还大。对用户来说,最好的模型越来越像一道动态选择题。

迁移的便利性进一步加剧了竞争。DeepSeek同时提供OpenAI和Anthropic兼容接口,MiniMax的Token套餐可以直接接入Claude Code、Cline和OpenClaw。开发者甚至不必改变原来的工作界面,只要更换底层模型,就能把任务转走。AI公司愿意进行Token补贴,争夺的是用户的长期工作流。模型一旦进入企业系统,更换成本就会迅速提高,AI产品的护城河就此建立。因此,早期补贴具有明显的入口争夺意义。

算力的悖论:一边发券,一边限流

但Token优惠与“奶茶券”有一个根本区别:奶茶多送一杯,成本相对清晰可控;但Token多送一亿,最后会转化成多少算力支出很难提前算清。算力在当下依然非常珍贵,于是出现了有趣的景象——AI公司一边发券,一边限流。

Anthropic在宣布与SpaceX达成算力合作后,Claude Code的5小时额度才得以翻倍,高峰期也不再下调限额。Fable 5恢复后,最多只能占付费用户周额度的50%,超出部分需要购买Credits。免费体验从一开始就画好了成本边界。

MiniMax的大额套餐同样不是无限使用。它同时设置5小时额度、周额度、Agent并发上限和高峰期限流,并建议生产环境使用按量付费。OpenAI此次降价同样保留着清晰的成本边界。ChatGPT和Codex的订阅价格及额度总量没有变化,只是使用Luna和Terra时扣除的额度减少。旗舰模型Sol价格未动,API新推出的Fast模式则以两倍标准价格换取最高2.5倍的速度。

Token不能无限发,用户又随时可能迁移,厂商只能把适用的人群、模型和时间切得越来越细。Anthropic用Pro、Max等档位区分额度,Max内部又分为5倍和20倍用量,达到上限后还能继续购买Credits。DeepSeek把V4拆成Flash和Pro两档,对缓存命中、普通输入和输出分别收费,高峰时段价格还会翻倍。

商业化的终极拷问:补贴退潮后,谁在裸泳?

更棘手的是,补贴能带来拉新,却很难买来忠诚。厂商希望用免费Token换来长期调用,但企业也在迅速学会“薅完就走”。Pylon一边从多家供应商手里领取免费额度,一边明确表示看不到任何忠诚度。Cursor、Zoom和Hex则把多个模型同时接入工作流,随时根据价格和效果重新分配任务。

厂商想把用户锁进一个生态,企业却在努力不被任何一家锁定。微软对数万名工程师的研究发现,编程Agent的第一次使用往往由同事带动,但后续是否持续使用,主要取决于工程师是否真的有足够的编程需求,持续使用者合并的PR数量提高约24%。真正能留下用户的,仍然是产品能否进入日常工作。

换句话说,优惠券只能把奶茶送到用户手里,不能保证他从此每天都喝。AI公司接下来要同时做两门生意:一边像消费平台一样用补贴做拉新和留存,一边像云厂商一样调配算力并守住毛利。既怕用户跑,又怕用户用得太多,实在是一种别扭的处境。

Token越送越多,用户却未必留下。用户真留下来,算力账单又会跟着上涨。最棘手的是,调用量和成本可以一起增长,收入却未必跟得上。优惠总会结束。等到各家不再靠送额度拉人,还能留住用户并把这门生意做下去的,究竟是谁?这不仅是AI行业的商业考题,更是对技术价值与商业逻辑平衡的终极拷问。