从零理解PPO与GRPO:基于考试场景的强化学习机制解析

0 阅读

在人工智能尤其是大语言模型的对齐训练中,强化学习(Reinforcement Learning, RL)已成为关键一环。然而,传统RL方法如直接最大化奖励信号,往往导致训练不稳定、策略崩溃或产生有害输出。为解决这些问题,研究者提出了PPO(Proximal Policy Optimization)及其变体GRPO(Group Relative Policy Optimization)。尽管这些方法在实践中效果显著,但其核心思想对非专业读者而言仍显抽象。本文尝试通过一个贴近生活的比喻——小学考试评分机制——逐步揭示这些技术背后的直觉逻辑。

假设你和弟弟在同一班级,每次考试后拿着分数找父亲领取零花钱。若仅以绝对分数决定奖励,会引发两大问题:一是弟弟即使从30分进步到60分,仍远低于你常考的80分,难以获得正向激励;二是你为追求更高分可能采取极端学习方式(如通宵熬夜),导致成绩剧烈波动(95分与60分交替),使奖励信号高度不稳定。这种“唯分数论”的训练方式,在强化学习中对应于直接优化期望奖励 $\mathcal{J}_{\text{naive}}(\theta) = \mathbb{E}[r(o)]$,其高方差特性严重阻碍模型收敛。

为解决此问题,父亲引入“预期分数线”机制:根据你当前水平设定基准(如你80分、弟弟40分),超出部分才给予额外奖励。这样,弟弟进步20分可获得显著激励,而你维持80分则收益有限。这一设计对应RL中的Critic(评论家),即价值函数 $V_\psi(s)$,它估计在状态 $s$ 下未来累积奖励的期望值。实际奖励与该估计值之差构成优势函数 $A_t = r_t - V_\psi(s_t)$,用于衡量某动作是否优于当前策略的平均水平。通过优化优势而非原始奖励,训练目标变为 $\mathcal{J}_{\text{adv}}(\theta) = \mathbb{E}[A(o)]$,有效降低了梯度估计的方差。

然而,新问题随之而来:若你某次超常发挥考了100分,父亲若按比例大幅增加零花钱,可能诱使你下次采取更激进的学习策略,导致成绩再次暴跌。为防止策略更新幅度过大,PPO引入Clip机制。具体而言,计算新旧策略对同一动作的概率比 $r_t(\theta) = \pi_\theta(o_t|s_t)/\pi_{\theta_{\text{old}}}(o_t|s_t)$,若该比值偏离1超过阈值 $\varepsilon$(如0.2),则将其裁剪至区间 $[1-\varepsilon, 1+\varepsilon]$。最终目标函数取裁剪前后值的较小者:$\min(r_t(\theta)A_t, \text{clip}(r_t(\theta),1-\varepsilon,1+\varepsilon)A_t)$。此举确保策略不会因单次高回报而发生剧烈偏移,维持训练稳定性。

即便如此,若仅关注分数提升,你可能铤而走险——如作弊或胁迫老师改分。类比到大模型训练,即生成虚假或有害内容以欺骗奖励模型。为此,PPO增设参考模型(Reference Model) 约束。该模型通常是监督微调后的初始策略 $\pi_{\text{ref}}$,训练中通过KL散度惩罚项 $-\beta D_{\mathrm{KL}}(\pi_\theta | \pi_{\text{ref}})$ 限制当前策略 $\pi_\theta$ 与其偏离程度。当策略试图“走捷径”时,即使奖励高,也会因KL惩罚而被抑制,从而保持行为合理性。

上述PPO框架虽有效,但在大语言模型场景面临新挑战:价值网络需与主模型同等规模才能准确评估生成序列质量,导致显存与计算开销倍增。尤其当奖励仅在序列末尾给出(如答案正确性评分)时,价值函数训练尤为困难。GRPO由此应运而生,其核心创新在于摒弃独立价值网络,转而利用策略自身生成多组候选输出构建动态基准。

具体操作如下:对同一问题,从旧策略 $\pi_{\theta_{\text{old}}}$ 中采样 $G$ 个回答(如5个),计算它们的奖励均值 $\mu$ 与标准差 $\sigma$。每个回答 $o_i$ 的优势值定义为 $A_i = (r_i - \mu)/\sigma$。若某回答奖励高于组内平均,则 $A_i > 0$,策略将被鼓励;反之则受抑制。此设计巧妙地将“组内相对表现”作为奖励基准,无需额外训练Critic。同时,GRPO保留PPO的Clip与KL惩罚机制,确保更新稳健性。

从数学形式看,GRPO目标函数为: $$ \mathcal{J}{\text{GRPO}}(\theta) = \mathbb{E}\left[ \sum{i=1}^G \left( \min\left( \frac{\pi_\theta(o_i)}{\pi_{\theta_{\text{old}}}(o_i)} A_i, \text{clip}\left(\frac{\pi_\theta(o_i)}{\pi_{\theta_{\text{old}}}(o_i)}, 1-\varepsilon, 1+\varepsilon\right) A_i \right) - \beta D_{\mathrm{KL}}(\pi_\theta | \pi_{\text{ref}}) \right) \right] $$ 其中优势 $A_i$ 完全由同批采样的奖励统计量决定。这种“自参照”机制不仅降低硬件需求,还天然适配基于比较的奖励模型(如偏好数据训练的RM),因后者本就关注输出间的相对优劣。

回看考试比喻,GRPO相当于父亲不再亲自评估你们的进步曲线,而是让你们各自做五套模拟题,以平均分为基准判断真实考试表现。弟弟若在模拟中均分50,实考60即算超常发挥;你若模拟均分85,实考88则提升有限。这种机制公平且省力,恰如GRPO在节省计算资源的同时维持训练有效性。

值得注意的是,GRPO并非万能解。当采样数 $G$ 过小时,奖励均值估计噪声较大,可能削弱优势信号;而增大 $G$ 又会提高单次训练的计算成本。实践中需在稳定性与效率间权衡。此外,标准化处理(除以标准差)虽增强数值稳定性,但在奖励分布极度偏斜时可能放大异常值影响。这些细节提示我们:算法简化需结合具体任务特性调整。

综上,从朴素奖励最大化到PPO的多重约束,再到GRPO的无价值网络设计,强化学习对齐技术正朝着更高效、更稳健的方向演进。理解这些机制背后的“为什么”,比记住公式更重要。无论是Clip防止过更新,还是参考模型遏制越界行为,本质都是在探索探索与利用、创新与守规之间的平衡。对于大模型开发者而言,选择PPO或GRPO不应仅看论文指标,更需评估自身算力条件、奖励模型特性及安全需求。未来,随着过程监督等细粒度反馈机制的发展,或许会出现融合GRPO效率与过程奖励精度的新范式,进一步推动AI对齐的实用化落地。