用强化学习训练代码模型绘制水彩画:TRL与OpenEnv的完整开源实践

0 阅读

在生成式人工智能日益追求“完美”图像的时代,一种看似“不完美”的水彩画却意外走红——由语言模型编写的JavaScript代码驱动,通过p5.brush库渲染出的花卉作品,因其手绘般的质感和独特的艺术表达引发了广泛关注。这一现象背后,隐藏着一个更深层的技术命题:我们能否让AI学会“品味”?

审美偏好的可学习性:从验证到引导

传统上,语言模型的强化学习(RL)训练依赖于可验证的奖励信号,如数学题的正确答案或代码的单元测试通过率。然而,艺术创作没有标准答案。本项目的核心挑战在于构建一个能反映人类审美的奖励机制。研究者采用了双重代理模型策略:一方面使用开源的HPSv3偏好模型,该模型基于大量人类对图像偏好的选择数据训练而成,代表了“大众平均口味”;另一方面引入一个由研究者亲自筛选的参考图像池,并通过Qwen3-VL视觉语言模型作为“成对裁判”,将候选作品与池中图像进行比较,从而编码了研究者个人的审美偏好。

这种设计巧妙地将主观审美转化为可量化的奖励信号。三个并行实验(judge-led、hps-led、hps-only)的结果清晰地展示了权重分配的影响。当个人偏好(成对裁判)权重较高时(judge-led),模型初期学习困难,奖励曲线起步低且波动大,但最终生成的作品在艺术表现力和多样性上更为突出。这证明了通过精心构建的参考池,完全可以引导模型学习并模仿特定的审美风格,而不仅仅是追求统计上的平均美感。

参考池:审美学习的基石与瓶颈

如果说奖励函数是引擎,那么参考图像池就是燃料。本项目构建了一个包含178幅水彩画的参考池,所有图像均由四个不同的开源大模型(GLM-5.2、Kimi-K3、Qwen3-Coder-Next、Qwen3.5-122B-A10B)根据真实的木槿花照片生成,并经过三轮基于视觉模型反馈的迭代优化。研究者本人对每幅最终渲染图进行了“喜爱”或“尚可”的二元评级。

这个池子的设计蕴含了深刻的考量。首先,它完全由AI生成,规避了稀缺的人类创作p5.brush作品的数据瓶颈。其次,引入两个评级层级,确保了早期较弱的策略也能获得有效的学习信号——成对裁判每次会从两个层级中各抽取两张图像作为比较基准。这种设计避免了模型因始终面对无法企及的高标准而陷入学习停滞。

然而,这也揭示了该方法的根本局限:模型的创造力被严格限定在参考池所定义的边界之内。所有训练后期的生成作品都呈现出高度的同质化,仿佛是对同一朵花的不同拍摄角度。这印证了Jason Liu的观点:“AI将瓶颈从‘制作’转移到了‘发现’。”未来若要突破此限制,必须投入更多精力去构建一个主题和风格更加多元化的参考池,这本质上是一项艺术策展工作。

技术实现:从环境搭建到训练调优

项目的成功复现离不开稳健的技术栈。整个流水线运行在Hugging Face生态之上:训练任务通过Jobs提交,RL环境和评分模型以Spaces形式部署,推理服务则由Inference Providers提供。

RL环境是连接模型与奖励的桥梁,其核心组件包括:

  • p5.brush库:模拟水彩媒介特性,如颜料渗透、纸张纹理和笔触质量。
  • 严格的方法白名单:仅允许模型使用10个特定API(如fillBleed, fillTexture),强制其专注于填充形状而非线条勾勒,以维持水彩风格。
  • 门控机制(Gate):确保生成的代码能成功编译、使用指定库、在画布上绘制有效内容,且无作弊行为(如直接在画布上写字)。

训练过程并非一帆风顺。初期遭遇了长时间的奖励曲线平坦期。关键的突破点在于对TRL的GRPOTrainer进行了四项针对性调整:

  1. 学习率:从2e-5提升至5e-5,以匹配LoRA微调的有效范围。
  2. 学习率调度器:从线性衰减改为带预热的恒定调度,避免学习率过早衰减。
  3. 奖励缩放:关闭组内缩放(scale_rewards=none),防止单个失败样本拉低整个批次的梯度信号。
  4. LoRA目标模块:针对Qwen3.5-35B-A3B的混合专家架构,将target_modules设为all-linear,确保适配器能覆盖到所有线性层。

这些调整共同解锁了模型的学习能力,使得所有三个实验组的奖励均呈现稳定上升趋势。

基础设施挑战与成本分析

本项目的一大特点是其复杂的基础设施依赖。一次完整的训练需要协调trainer、两个Spaces(环境和HPSv3评分器)、一个推理路由以及持久化的WebSocket连接。任何环节的静默失败都会污染奖励信号。例如,渲染超时或评分器无响应曾被错误地记为0分奖励,相当于用噪声训练模型。后续修复方案是让失败的rollout返回None并将其从批次中排除。

此外,还发现并修复了OpenEnv客户端的一个WebSocket缓存bug,该bug会导致远端关闭连接后后续所有调用失败。

从成本角度看,单次训练(110步)主要消耗如下:

  • 训练器:1块H200 GPU,约34小时。
  • HPSv3评分器:需在整个训练期间保持一个a100-large Space在线。
  • 环境Space:一个cpu-upgrade Space负责渲染,由于无GPU加速,软件渲染WEBGL画布成为性能瓶颈,单次渲染耗时69-96秒。
  • 成对裁判:消耗Qwen3-VL-30B模型的Inference Providers配额。

值得注意的是,评分服务的成本可能超过训练本身,因此在训练结束后应及时暂停相关Space以控制开销。

未来探索方向

尽管成功复现了原项目,但一系列值得探索的改进方向也随之浮现:

多步反馈循环是首要尝试。当前模型是在“闭眼”状态下作画,仅凭最终的一个奖励数字进行学习。而参考池中的高质量图像恰恰是通过“生成-视觉批评-再生成”的三轮迭代产生的。赋予策略模型观察自身输出并进行迭代修正的能力,有望极大提升其创作水平。

小型化模型也极具潜力。初步实验表明,一个4B参数的模型已能生成通过门控的有效草图。若能在此规模上成功应用RL,将使此类艺术创作实验的成本降低一个数量级,更具普及性。

其他方向还包括:在RL前对参考池的源代码进行监督微调(SFT)、显式奖励颜料覆盖率、动态调整参考池难度(从易到难)、谨慎扩展API白名单以增加视觉表现力等。

总而言之,这项工作不仅是一次技术复现,更是对“AI与审美”关系的一次深刻探讨。它证明了通过工程化的手段,可以将主观的人类品味注入到AI的学习过程中。而真正的艺术创新,或许仍将取决于人类策展者如何定义那个至关重要的“参考池”。