STEPS系统如何重塑十亿级推送架构:自触发智能体的三大突破

6 阅读

在移动互联网高度渗透的今天,推送通知已成为连接用户与应用的关键桥梁。然而,这一看似简单的功能背后,隐藏着复杂的权衡:既要有效唤醒沉睡用户,又要避免过度打扰导致权限关闭。传统推送系统长期受限于“被动响应”模式,难以在用户体验、业务目标与计算成本之间取得最优平衡。近期,抖音与北京大学团队提出的 STEPS(Self-Triggered End-to-end Agentic Push System) 系统,为这一难题提供了全新的解决方案。

图片

STEPS的核心创新在于将推送系统从“被驱动的流水线”转变为“自驱动的智能体闭环”。它不再依赖固定时钟或预设排期,而是让系统具备自主决策能力——不仅能判断“是否发送”,还能决定“何时再次醒来做决策”。这种范式转变不仅提升了推送效果,更显著降低了资源消耗,已在超10亿用户的抖音平台实现全量部署。

图片

传统推送系统的结构性瓶颈

图片

当前主流推送系统主要采用两种被动模式:固定间隔轮询提前排期。前者以固定频率(如每5分钟)触发全量计算,虽实现简单,但存在严重算力浪费——多数时刻并无有效推送机会;后者则基于历史数据预测未来最佳发送时间,形成排期表,但无法感知用户实时状态(如刚打开App或正在会议中),需依赖大量启发式规则进行动态调整。

图片

这两种方案的共同缺陷在于其“机械性”:系统始终是外部信号的执行者,缺乏对自身行为节奏的掌控。具体表现为三点:

图片

  • 时机被动:由时钟或排期表驱动,无法根据环境变化动态调整唤醒频率;
  • 链路静态:每次触发必走完整召回-粗排-精排流程,即使当前无高价值内容也消耗同等算力;
  • 演进困难:难以基于长期用户反馈进行策略迭代,过度依赖人工规则修正。

图片

这些限制在十亿级用户规模下被急剧放大。一次低效推送不仅浪费计算资源,更可能引发用户反感,导致不可逆的权限关闭。因此,亟需一种能主动感知、自主规划并持续进化的新型架构。

图片

STEPS的三大智能体协同机制

图片

STEPS通过构建三个相互协作的智能体,形成端到端的自触发闭环:

图片

规划智能体:生成式决策实现自主唤醒

图片

规划智能体负责回答“下一次何时醒来”这一根本问题。它以Decision Transformer为骨干网络,将推送时机预测转化为序列决策任务。关键挑战在于如何让模型真正“听懂”业务目标。传统方法将目标回报(Return-to-Go, RTG)作为普通特征输入,易被高维状态特征淹没,导致“条件忽略”——无论设定何种目标,输出几乎不变。

图片

STEPS引入门控机制(Gated-RTG),将RTG以乘性方式调制状态表征,强制模型关注目标信号。实验显示,标准DT的条件相关比值在1.0附近波动,而Gated-RTG能稳定偏离1.0,与真实数据分布高度一致。此外,系统将0-24小时划分为100个有序桶,通过有序回归平滑解码时间间隔,避免离散分类带来的精度损失。

图片

上线后,极短间隔(0-20分钟)推送占比下降35.93%,高频用户(日推>30次)比例减少9.30%,表明系统有效抑制了过度打扰。

执行智能体:基于轨迹建模的长期价值判断

执行智能体在规划智能体指定的时间点被唤醒,评估当前是否应发送推送。其核心突破在于将单次决策置于用户完整交互轨迹中考量。传统模型仅基于瞬时状态判断,忽视了推送的累积效应——用户今日已收3条通知后,第4条的边际价值必然衰减。

STEPS将用户历史行为编码为状态-动作-回报序列,使模型能理解“当前是否处于疲劳期”或“是否处于高唤醒窗口”。更重要的是,它采用价值引导学习(Value-Guided Learning):通过贝尔曼方程分别估计“发”与“不发”的长期Q值,并据此加权训练样本。这使得模型学习的不是历史行为(可能包含次优决策),而是理论上更优的策略。

日内分析揭示了模型的精细化判断能力:对历史高活但当日未活跃用户,晚间推送通过率显著上升——因其更可能被一条恰当时机的通知拉回;而对低活用户,晚间价值趋近于零,系统自动降低发送概率。

过滤智能体:轻量守门员实现动态算力分配

过滤智能体是STEPS高效性的关键保障。传统系统一旦触发即运行完整推荐链路,计算开销巨大。STEPS则在唤醒后首先由过滤智能体进行快速评估,决定是否进入昂贵的下发流程。

该智能体基于轻量强化学习模型,对不同用户群体实施差异化拦截:全勤用户(拉活价值低)拦截率达85.65%,高活用户为66.63%,低活用户为78.86%。这种价值感知的动态分支机制,使系统总体计算资源消耗降低79.42%,其中过滤智能体单独贡献74.88%的降幅。

此外,它还充当安全护栏,防止规划智能体因异常预测导致过度频繁唤醒,确保用户体验底线。

线上验证:体验、活跃与效率的三重提升

STEPS在抖音平台进行了为期14天的严格A/B测试,覆盖超10亿用户。相比生产基线,系统实现了三项关键指标的同时优化:

  • 用户活跃天数(UAD)提升0.2843%:表明推送更有效地促进了用户回访;
  • 推送权限关闭率下降1.9089%:反映打扰减少,用户体验改善;
  • 计算资源消耗降低79.42%:大幅节约服务器成本,提升系统可扩展性。

消融实验进一步验证各组件贡献:规划智能体是活跃与体验改善的主因,执行智能体放大收益,过滤智能体主导资源节约。这种模块化设计使得系统可根据业务需求灵活调整各部分权重。

值得注意的是,STEPS并未增加推送总量,而是通过更精准的时机选择与内容匹配实现效果提升。日均接收1-20条推送的用户占比增加20.31%,极端情况(0条或>30条)显著减少,体现了系统在公平性与效率间的良好平衡。

范式演进:从函数到智能体的跨越

STEPS的意义远超单一系统优化,它代表了推荐系统架构的根本性转变。传统系统本质是“输入-输出”的静态函数,而STEPS构建了一个能与环境持续交互、自主规划行动节奏的智能体闭环。这种Agentic特性体现在三个方面:

  • 自主性:系统决定自身唤醒周期,摆脱外部时钟束缚;
  • 适应性:根据实时状态动态选择计算路径,避免无效开销;
  • 进化性:通过强化学习持续对齐长期业务目标,减少人工干预。

这一思路与当前AI Agent的发展趋势高度契合。随着大模型与强化学习的融合加深,未来更多工业系统或将采用类似架构,从被动执行转向主动规划。STEPS的成功验证了该范式在超大规模场景下的可行性,为内容分发、广告投放、用户运营等领域提供了重要参考。

在算力成本日益高昂、用户体验愈发敏感的今天,STEPS所展示的“少而精”的推送哲学,或许正是下一代智能分发系统的核心方向。