从 DQN 经验回放、DDDPG Actor-Critic 架构到 PPO 截断代理目标,系统梳理强化学习核心算法及其在 LLM 对齐中的应用。
强化学习(RL)是 AI 领域最接近「通用学习」范式的方法——通过与环境交互、试错、奖惩信号,让智能体自主学会复杂行为。本文从 DQN 到 PPO,从游戏到 LLM 对齐,系统梳理 RL 的发展脉络与核心算法。
强化学习的核心是智能体(Agent)-环境(Environment)交互循环:
智能体观察环境状态 s_t
↓
根据策略 π(a|s) 选择动作 a_t
↓
环境执行动作,返回奖励 r_t 和下一状态 s_{t+1}
↓
智能体更新策略(学习)
↓
循环...
策略(Policy)π:在状态 s 下选择动作 a 的概率分布。RL 的目标是找到一个最优策略 π*,最大化累积奖励。
价值函数(Value Function)V(s):从状态 s 出发,按照策略 π 能获得的期望累积奖励。用于评估「这个状态有多好」。
Q 函数(Q-Function)Q(s,a):从状态 s 出发,执行动作 a 后再按策略行事,能获得的期望累积奖励。
论文:Mnih et al., 2015, Nature, DOI: 10.1038/nature14236
2015 年,DeepMind 的 Mnih 等人在 Nature 发表论文,展示了深度 Q 网络(DQN)能在 49 款 Atari 2600 游戏上达到人类水平,其中许多游戏 AI 的表现远超人类专业玩家。
DQN 维护一个经验池,存储过去的状态转移(s, a, r, s')。训练时随机采样,打破了连续样本之间的相关性,提高了数据效率。
计算目标 Q 值时,使用一个单独的网络(每 N 步更新一次),避免了 TD 误差中的自举误差(bootstrapping error)导致的训练不稳定。
DDPG(Deep Deterministic Policy Gradient)由 Lillicrap et al. (2015) 提出,是第一个能有效处理连续动作空间的深度强化学习算法。
Actor(演员):输出确定性动作(而非概率分布)
Critic(评论家):估计 Q 值,评估 Actor 的动作有多好
论文:Schulman et al., 2017, arXiv:1707.06347
Proximal Policy Optimization(PPO,近端策略优化)由 OpenAI 的 Schulman 等人提出,迅速成为强化学习领域应用最广泛的算法。
它的核心设计哲学是:在保证策略更新的稳定性同时,最大化样本效率。
PPO 改进自早期的 TRPO(Trust Region Policy Optimization),但用了一个更简单的工程实现:
传统策略梯度方法的问题是:一次糟糕的大步更新可能让策略崩溃(从「好的策略」一下子跳到「很差的策略」)。
# 策略比率 r(θ) = π_θ(a|s) / π_{θ_old}(a|s)
# 重要性采样的比率衡量了新旧策略的差异
# PPO 目标函数(简化)
L(θ) = E[ min(
r(θ) * A, # 标准策略梯度
clip(r(θ), 1-ε, 1+ε) * A # 剪裁版本
) ]
# ε 通常取 0.2,即限制策略比率变化不超过 20%
当优势函数 A > 0(动作好于平均)时,r(θ) 被限制在 1+ε 以内,防止策略过度乐观;当 A < 0(动作差于平均)时,r(θ) 被限制在 1-ε 以上,防止策略过度悲观。
论文:Ouyang et al., 2022, InstructGPT, arXiv:2203.02155
传统的 LLM 训练分两步:预训练(Predict Next Token)+ 微调(监督微调,SFT)。但 SFT 的问题是:模型模仿的是人类给出的「示范答案」,而不是人类真正想要的答案。
RLHF(Reinforcement Learning from Human Feedback)引入了第三步:
预训练语言模型(GPT-3)
↓
SFT(监督微调):学习格式和基本能力
↓
RLHF:
1. 训练奖励模型(Reward Model):人类对输出质量排序 → 训练一个能预测「人类偏好分数」的模型
2. PPO 优化:用奖励模型作为环境,用 PPO 优化原始语言模型,使其生成人类更喜欢的输出
↓
对齐后的模型(InstructGPT)
RLHF 让 GPT-3 从一个「预测下一个词」的语言模型,变成了一个「有助益、无害、诚实」的对话助手。
关键发现(InstructGPT 论文):即使只有 1.3B 参数的模型,经过 RLHF 对齐后,其输出质量在用户评估中优于 175B 的 SFT 模型——这说明对齐的质量比规模更重要。
将 PPO 应用于 LLM 时有一个独特挑战:LLM 是自回归生成的,每一步生成 token 的动作空间是整个词表(通常 ~50,000 个词)。这使得标准的 RL 方法面临巨大的动作空间。
解决方案:用奖励模型(RM)在序列级别评估输出质量,而不是 token 级别——这将问题从「每个 token 如何优化」转变为「整条输出如何优化」。
另一个问题:PPO 的 KL 散度惩罚。为了防止 RL 优化过程中模型偏离原始能力太远,PPO 会在奖励函数中加入 KL 散度项,惩罚生成过于偏离原始模型的输出。
Soft Actor-Critic(SAC)由 Haarnoja et al. (2018) 提出,引入了最大熵(Maximum Entropy)的概念:
传统 RL 最大化期望累积奖励:π* = argmax E[ Σ r(s,a) ] SAC 最大化:π* = argmax E[ Σ r(s,a) + α H(π(·|s)) ]
其中 H(π) 是策略的熵,α 是温度参数。
最大熵的物理意义:鼓励策略在获得高奖励的同时,保持最大的随机性——换句话说,策略不只追求最优,还保持探索的倾向。这解决了 RL 中著名的「探索-利用(Exploration-Exploitation)」困境。
SAC 的另一个优点是自动温度调节:不需要手动设置 α,算法会自动平衡奖励最大化和熵最大化。
传统 RL 需要在线交互——智能体必须在环境中实时行动并收集数据。这在很多场景下是不现实的(如自动驾驶、医疗治疗)。
离线强化学习(Offline RL / Batch RL)的目标是:从已有的日志数据(由人类或旧策略生成)中学习最优策略,而不需要新的在线交互。
离线 RL 是将 RL 技术落地到现实应用的关键,但目前仍是 RL 研究中最具挑战性的子领域之一。
Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529–533. DOI: 10.1038/nature14236
Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347.
Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155.
Lillicrap, T.P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971.
Haarnoja, T., et al. (2018). Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor. arXiv:1801.01290.