2026年大模型实验室如何为智能体训练搭建强化学习环境

1 阅读

每次尝试配一台机器

传统强化学习中的“环境”通常是个内存里的模拟器——调用 reset 开始一轮尝试,用 step 执行动作,整个过程在训练进程内部完成,启动新尝试几乎零成本。CartPole 就是典型例子:小车平衡一根杆子,每步只需四个数字状态。这种设计能轻松在单个 GPU 上并行跑几千个副本。

但智能体训练完全不同。如果模型要安装软件包、运行测试套件或修改代码仓库,环境必须是一台真正的计算机:有文件系统、shell 和跨调用存活的进程。于是,“环境”从训练器内存里的对象,变成了为单次尝试专属分配、使用后即销毁的机器。从提示输入到奖励计算的完整过程,在强化学习中称为一次 rollout(回合)。

Liquid AI 在 LFM2.5 的技术博客中直白描述:“训练时,我们采样一个任务并随机选择对应的 harness(任务框架)。每次 rollout 都在独立沙箱中运行,拥有自己的运行时。”他们甚至在训练流水线里为沙箱单独设了一个模块,底层用 verl 作为强化学习框架。

规模方面,Cursor 在其 Composer 模型博客提到:“在我们的规模下,教会模型有效调用工具需要同时运行数十万个沙箱化编码环境。”为此他们重写了虚拟机调度器,适配训练任务突发的高并发需求——这套基础设施原本用于为用户提供隔离的云虚拟机。

微软 MAI-Thinking-1 报告说得最直接:“沙箱层为每个智能体任务分配一个全新容器,任务完成后立即销毁。”而 Kimi K3 则强调“百万 token 级别的智能体强化学习需持久化 rollout 和沙箱状态”。这意味着环境必须保存文件、进程和历史记录,训练系统不仅要 checkpoint 模型,还得 checkpoint 整个运行世界。他们称之为“可恢复的 microVM 沙箱,用于保留长周期模型与环境状态”。

无论模型大小(LFM2.5 仅 26 亿参数),当前主流做法都是“一回合一沙箱”:短任务用完即弃,长任务则支持快照恢复。高端场景下,并发沙箱数量可达数十万。

沙箱里装了什么

各实验室报告透露了沙箱内的任务类型,其中编程任务占绝对主流。GLM-5 提到“构建了超 1 万个可验证环境,覆盖数千个代码仓库、9 种编程语言”;MiniMax 则建立流水线,将“真实编程场景转化为多样化的可验证终端任务”。搜索类任务紧随其后,Kimi K3 训练模型执行“多步复杂信息检索:规划研究路径、逐步收集网络证据、生成可验证答案”。第三类是办公自动化,MiniMax 的环境涵盖“深度搜索、开放网络研究、知识工作者办公任务、金融分析与电子表格操作、幻灯片生成”;Kimi 甚至提供了 Gmail、Notion、Slack 等常用应用的模拟实现供智能体练习。

Cursor 和 Meta 只聚焦编程任务。Kimi 还额外提到一类独特任务:GPU 内核编写,“从单算子内核到融合 mega-kernel 不等”。

值得注意的是,任务框架(harness)本身正成为环境的一部分。Kimi 报告称“环境可实例化主流 harness,如 Kimi Code、Claude Code、Codex 等”,即在白盒环境中重建用户实际使用的智能体,包含工具接口和系统提示等模块。Liquid 则从另一角度实现:通过代理将已部署的智能体视为黑盒,透明捕获 token 级轨迹用于训练。微软研究院的 Agent Lightning 框架将此模式命名为“harnessed agentic RL”——由 harness 而非训练引擎主导环境交互循环。Polar 论文也描述了类似机制:将 harness 视为黑盒,同时重建 token 精确的训练轨迹。

Thinking Machines 的开源模型 Inkling 在训练时随机化工具集和 schema,使其对特定 harness 不敏感。最新趋势是让智能体自己构建环境:GLM-5.3 描述了一套端到端合成流水线——研究智能体将真实工作模式转化为可运行的长周期环境,裁判智能体验证任务可解性,仅当通过“oracle、空操作、无解状态”等检查后才纳入训练集。不过 Zhipu 坦言,这些流水线“仍需大量人工干预”。

开源实验室(Kimi、GLM、MiniMax、NVIDIA)详细描述了环境细节。Ai2 的 OLMo 3 甚至公开了 RL 评分基础设施的具体数据:“开发期间并行检查了 1720 万个生成代码样本”。相比之下,OpenAI、Anthropic 和 Google 几乎未透露训练环境信息——GPT-5.6 和 GPT-6 Astra 的系统卡仅列出评估环境,对 RL 训练只字未提。DeepSeek 和 Qwen 介于两者之间:前者详细说明了支持“每集群数十万沙箱”的平台架构;后者声称“在百万智能体环境中扩展强化学习”,但未说明具体任务类型。

各家自建技术栈

尽管蒸馏和 RL 算法已有通用方案,但环境基础设施方面,所有披露细节的实验室都自建了技术栈——这很合理,毕竟这是最新出现的环节,标准尚未统一。

GLM-5 使用名为 slime 的后训练基础设施,其异步设计“通过解耦生成与训练,大幅提升后训练效率”。生成引擎按自身节奏运行,训练器消费结果,互不等待。当 rollout 是启动容器、运行测试套件的耗时操作时,同步循环会让训练器卡在批次中最慢的尝试上。异步虽引入一定 stale(过时)数据,但显著提升资源利用率。

半年后的 GLM-5.3 展示了该设计的优势:环境以“数据生成”而非“训练循环修改”的方式接入 slime,“使我们在 GLM-5.2 和 5.3 迭代中无需重建训练栈即可持续增加环境”。Zhipu 创始人唐杰在 X 平台将 GLM-5.3 定位为对照实验:“与 GLM-5.2 相比,基座、架构、总参数量和激活参数量完全相同,仅用一个月扩展长周期环境和 RL 训练——收益并非边际提升。”

MiniMax 构建了 Forge 系统,支持“在统一训练循环中无缝集成白盒和黑盒(仅 API)智能体”。NVIDIA 的 Nemotron 3 Ultra 则采用“多环境 RLVR”技术,在单次训练中跨多个环境计算可验证奖励。Inkling 使用超 3000 万次 rollout 进行大规模 RL 后训练。Meta 虽未发布旗舰模型报告,但在 2025 年 Code World Model 论文中披露了内部执行服务——“每秒在隔离容器中运行数万个代码片段”。

无论命名如何,这些报告描述的都是相同四层结构:内置验证器的任务、智能体交互契约(日益等同于 harness 本身)、运行沙箱、以及异步消费 rollout 的训练器。每个披露细节的实验室都自行组装了这套栈。

SemiAnalysis 对该层工程细节的剖析印证了报告结论:“RL 训练既是算法问题,更是基础设施问题”,涉及沙箱启动延迟、故障鲁棒性等。Nathan Lambert 指出,环境是“前沿训练中最易隐藏的部分——复杂 RL 环境及智能体提示最难复制”,这解释了部分保密行为。他估算顶级实验室“单个环境投入超 1000 万美元”,符合此前提及的十亿美元级预算。他对 GLM-5.3 的总结尤为精辟:“你无法简单‘蒸馏’RL 环境、规模化运行基础设施或高效混合算法。”

开源社区的复现

部分技术栈已开源。例如 slime 和 verl 框架均开放源码,但实验室保留的核心资产是环境本身、任务数据及数十万沙箱并发所需的算力(普通开发者只能望 GPU 兴叹)。前两者正被社区逐步重建,这也是普通人能实际下载使用的部分。

任务层:Prime Intellect 的 Environments Hub 将环境视为社区制品,基于 Will Brown 开发的 verifiers 库。Harbor 解耦任务、harness 和沙箱,支持自由组合,并通过 OpenEnv 集成 TRL。Repo2RLEnv 能将任意 GitHub 仓库转化为可验证任务。

环境接口层OpenEnv 作为标准插座,通过 HTTP 实现 Gymnasium 风格契约(reset/step/state),使环境能作为 Hub 制品分发。其技术委员会已纳入 Prime Intellect、Mercor、Fleet AI 等商业环境供应商,以及 Meta-PyTorch、Hugging Face、Nvidia、Microsoft。目前 Hub 上超 4000 个 Spaces 带有 openenv 标签。Berkeley 的 SkyRL 提供 LLM 专用环境库,BrowserGym 和 TextArena 等封装器则通过同类 API 服务整类任务。

census_v3_stack_shape

沙箱层:Modal 和 E2B 等公司提供商业化沙箱服务。Moonshot 开源了 Kimi K3 底层的 AgentENV——“用于规模化运行智能体环境的分布式系统”,支持快速快照、恢复和分叉。Hugging Face 实验性的 Sandboxes 在 HF Jobs 上提供隔离云机器,SandboxPool 通过共享主机打包多个轻量 CPU 沙箱,以合理成本实现“一回合一沙箱”模式。

census_thumbnail_x_5x2_nocaption

训练器层TRL 的 GRPOTrainer 通过单参数连接白盒环境;实验性的 AsyncGRPOTrainer 则解耦 rollout 生成与训练,与 GLM-5 的 slime 设计一致。这两者已在课程演示中使用:GRPOTrainer 用于白盒 demo,异步 worker 用于黑盒 demo。RadixArk 近期发布的 Miles v0.1(slime 分支)已集成 OpenEnv、Harbor 和 verifiers,据称已在 Kimi K3、DeepSeek V4 等前沿开源模型上实战验证。

census_v1_sandbox_per_rollout

个人开发者无需实验室团队也能实验。此前有博客将 Simon Willison 的 pelican 基准封装为 OpenEnv 环境并完成训练;另一案例教模型用代码绘制水彩画,奖励函数结合人工 curated 画作池和美学评分。GPT-6 Astra 的 Blender 场景走红后,有开发者用 90 亿参数的 Qwen3.5 在 OpenEnv Blender 环境中复现,效果参差。Adithya 的 RL 环境指南 系统覆盖了从契约到前沿的完整技术栈。

census_v2_decoupled

总结

三篇系列博客揭示了完整链条:蒸馏在模型间传递知识,强化学习驱动模型朝向目标,而环境层让这些目标变得足够真实以供训练。如今开源栈已覆盖四层架构,使普通开发者能负担得起类似实验。在第四课中,我们全程使用公开工具实时训练编码智能体——从环境到最终模型全部开源。

至此,“训练智能体”系列完结。四节课视频(SFT蒸馏RLRL 环境)及配套博客均已开放。关注作者可获取后续训练项目动态,秋季还会有更多类似内容。