飞书原文 · 源修订 27
💡
路线总课: 策略模仿“别人做了什么”,价值与强化学习研究“哪些行为长期更好”。本课从概率期望和条件回报出发,连接 Bellman、TD、Actor-Critic、Offline RL、偏好、人工纠正与大模型机器人经验学习。
学习目标
完成本课后,应能区分奖励、回报、价值、Q 与 Advantage;推导 Bellman 递推和 TD 目标;解释策略梯度与 Actor-Critic;理解离线 RL 的分布外高估;区分人工纠正、偏好学习与强化学习;判断经验学习如何改进 VLA,又如何受到世界模型和数据引擎影响。
1. 为什么专家动作仍然不够
行为克隆学习:
读法: 行为克隆让当前策略在每个状态下的动作分布接近专家策略的动作分布。
推导: 这是监督学习式的条件分布拟合;它只利用专家选择了什么,不利用动作之后的长期结果或策略自己造成的错误状态。
它告诉模型专家做了什么,但没有直接告诉模型:
- 多个可行动作中哪个长期更好。
- 失败动作为什么失败。
- 怎样从策略自己造成的错误状态恢复。
- 是否能用比专家更快或更稳的方式完成任务。
价值路线增加结果信号,使模型能够比较行为而不只复现行为。
2. 奖励、回报和价值
2.1 奖励
读法: 第 t 步奖励由当前状态、当前动作和下一状态共同决定。
推导: 奖励是单步转移的评价函数;把终止、碰撞、距离、能耗或人工偏好编码进 r,才定义了优化到底认为“好”是什么。
奖励是一步转移的评价,可以来自任务完成、距离、碰撞、能耗、人工偏好或学习出的奖励模型。奖励不是客观真理,而是设计者对任务的编码。
2.2 回报
读法: 从 t 时刻开始,把直到终点前的每一步奖励按距离当前的步数折扣后相加。
推导: 有限轨迹在 T-1 步结束,因此共有 T-t 个奖励项;gamma 控制未来相对当前的重要性。
读作:“从当前时刻开始,把未来奖励按折扣因子 加权求和。” 越大,越重视长期结果。
2.3 状态价值和动作价值
读法: 遵循策略 pi 时,从状态 s 出发的状态价值,是所有可能未来回报在该条件下的期望。
推导: 对策略采样动作、环境转移和后续轨迹取条件期望,就把随机长期结果压缩成一个状态标量。
读法: 先在状态 s 强制执行动作 a,再按策略 pi 继续时,动作价值是所得未来回报的条件期望。
推导: 相较 V,Q 多条件了首个动作,因此可以直接比较同一状态下不同动作。
它们是未来随机回报的条件期望。价值函数不是动作生成器,而是对状态或动作的长期评价。
3. Bellman 递推:把长期问题拆成一步
根据回报定义:
读法: 当前回报等于当前一步奖励,加上下一时刻回报乘折扣因子。
推导: 把有限和的第一项 r_t 拆出来,剩余项整体提取一个 gamma,即得到回报的递归定义。
两边取条件期望:
读法: 策略 pi 下当前状态动作的价值,等于即时奖励加下一状态价值的折扣期望。
推导: 把回报递归式代入 Q 的条件期望,并对下一状态和之后按 pi 采取的动作边缘化,即得到 Bellman expectation equation。
这就是 Bellman expectation equation。它说明当前动作的价值等于立即奖励加下一状态的折扣价值。
最优动作价值满足:
读法: 最优 Q 等于当前奖励加下一状态中最优后续动作价值的折扣期望。
推导: 把固定策略下的下一步期望替换为对下一状态可选动作的最大值,得到最优性 Bellman 方程。
机器人任务中的难点是状态通常部分可观测,奖励稀疏,接触结果延迟出现,而且真实交互昂贵。
4. 价值函数怎样从数据学习
4.1 Monte Carlo
等待一条轨迹结束后,用真实回报监督:
读法: Monte Carlo 价值损失是预测价值与整条真实轨迹回报之间平方误差的期望。
推导: 轨迹结束后 G_t 可直接作为监督标签,最小二乘回归的条件均值解正是期望回报;代价是长时回报方差高且必须等待结束。
目标无 bootstrap 偏差,但方差高,长时任务必须等待结束。
4.2 Temporal Difference
TD 使用一步 bootstrap 目标:
读法: TD 目标等于当前奖励,加上未终止时下一状态目标价值的折扣项。
推导: 用 Bellman 一步递推替代完整回报;d_t 为终止指示,目标网络参数 bar phi 固定得更慢,可减少自举目标的振荡。
读法: TD 损失让当前价值预测接近停止梯度后的自举目标。
推导: 这是对一步 TD 标签做回归;停止梯度避免优化器同时改变目标分支,训练仍会保留 bootstrap 带来的偏差。
读作:“让当前价值接近一步奖励加模型对下一状态价值的预测。”TD 降低方差,但目标本身依赖估计,会产生偏差和不稳定。
5. Advantage:比当前平均选择好多少
读法: Advantage 是动作价值减去同一状态下按当前策略平均得到的状态价值。
推导: 从 Q 中减去状态基线不会改变动作的相对排序,却能去掉状态本身难度造成的共同偏移,从而降低策略梯度方差。
正 Advantage 表示该动作优于策略在此状态的平均选择,负 Advantage 表示更差。Advantage 消除了不同状态基准难度,使策略更新更关注动作的相对贡献。
在机器人数据中,Advantage 可以来自 critic,也可以近似为成功概率变化、人工偏好或任务阶段评价。
6. 策略梯度与 Actor-Critic
策略希望最大化:
读法: 策略目标是从初始状态出发按策略采样整条轨迹时,初始回报的期望。
推导: 把策略参数化的轨迹分布作为随机变量,对任务回报取期望,就得到需要最大化的标量目标。
策略梯度定理给出:
读法: 每一步动作的对数概率梯度乘以该动作的 Q 价值,再沿轨迹求和并取期望。
推导: 对轨迹概率使用 log-derivative trick,将回报对参数的导数改写为动作 log 概率梯度与回报的乘积;环境转移不直接依赖 theta。
口语上:高价值动作提高概率,低价值动作降低概率。实际常用 Advantage 替代 Q:
读法: 策略更新只按动作相对同状态平均水平的 Advantage 加权,而不是使用完整 Q 的绝对尺度。
推导: 把不依赖动作的状态基线 V 从 Q 中减去,策略梯度期望不变;实际用 critic 估计 Advantage,因此这是近似式。
Actor 产生动作,Critic 估计价值。Critic 错误会直接把错误方向传给 Actor,因此校准和数据覆盖非常重要。
7. KL 正则策略改进
大型预训练策略不应在少量奖励数据上剧烈改变。可以优化:
读法: 在每个状态上,选择能提高参考策略 Advantage 期望、同时不远离参考动作分布的策略;beta 控制保守程度。
推导: 这是带 KL 信任域的策略改进目标:第一项鼓励高优势动作,第二项惩罚分布偏移。对离散动作概率做拉格朗日优化可得到下一式。
闭式最优分布具有:
读法: 新策略等于参考策略乘以优势指数权重,再除以所有动作权重之和进行归一化。
推导: 对上一 KL 正则目标加入概率和为一的约束,令每个动作概率的导数为零,解出 Gibbs 分布;beta 越小,越激进地偏向高优势动作。
它说明新策略在参考策略基础上,对高 Advantage 动作指数加权。 控制改进幅度与保守程度。
8. Offline RL 为什么困难
离线 RL 只使用固定数据集 。策略可能选择数据中几乎没有出现的动作,critic 却因为函数外推给出虚高价值,这称为 extrapolation error。
| 问题 | 机制 | 常见应对 |
|---|---|---|
| 分布外动作 | 价值网络在无数据区域外推 | 保守价值、行为约束 |
| 稀疏奖励 | 难以定位关键动作 | 阶段标签、奖励塑形、偏好 |
| 混合质量数据 | 成功和失败动作重叠 | 条件策略、重加权、价值筛选 |
| 部分可观测 | 同一图像对应不同隐藏状态 | 历史、记忆和状态估计 |
Offline RL 的目标不是简单删除失败数据,而是用结果信号识别何时、为何失败,并学习恢复或避免。
9. 人工纠正、偏好与奖励学习
| 信号 | 提供的信息 | 适合 | 局限 |
|---|---|---|---|
| 人工接管 | 错误状态下的正确动作 | 恢复策略 | 昂贵且存在干预选择偏差 |
| 成对偏好 | 轨迹 A 是否优于 B | 难以写奖励的任务 | 偏好一致性和标注成本 |
| 成功标签 | 整条轨迹结果 | 大规模结果学习 | 信用分配困难 |
| 自动指标 | 距离、速度、力、时间 | 密集反馈 | 容易奖励投机 |
奖励模型学习 或片段分数,再用于策略优化。它把人类判断变成可扩展监督,但也会把标注偏差放大。
10. 经验学习怎样连接 VLA
大型 VLA 通常先用模仿学习获得基础能力,再用部署数据改进:
- 部署当前 VLA。
- 收集自主成功、失败和人工接管。
- 训练价值、成功预测或偏好模型。
- 对轨迹或动作估计 Advantage。
- 通过重加权、条件化、蒸馏或策略优化更新 VLA。
- 重新部署并继续收集。
RECAP 是这一范式的案例。它的主模型属于 VLA 路线,但经验改进机制属于本路线。
11. 世界模型与价值学习的关系
| 世界模型 | 价值函数 |
|---|---|
| 预测未来状态或表征 | 压缩未来累计回报 |
| 可以产生想象 rollout | 可以评价 rollout 和终点 |
| 错误来自动力学预测 | 错误来自回报外推和信用分配 |
| 支持显式规划 | 支持动作排序和策略梯度 |
Dreamer 类方法在世界模型中想象未来,再训练 Actor-Critic;model-free RL 则不显式预测未来状态。两者不是互斥路线。
12. 一个两动作玩具例子
机器人在状态 可以选择“快抓”或“慢抓”。快抓成功得 1,失败得 0,成功率 0.6;慢抓成功率 0.9,但时间惩罚为 0.2。
读法: 快抓动作的期望任务回报等于成功概率 0.6 乘成功奖励 1。
推导: 失败奖励为零,因此期望回报就是成功概率乘以成功奖励。
读法: 慢抓的成功期望奖励 0.9 减去时间惩罚 0.2,得到总回报 0.7。
推导: 把同一奖励定义下的成功收益和时间成本相加,慢抓虽然更慢,但在当前权重下仍优于快抓。
若专家数据多数来自快抓,行为克隆会偏向快抓;价值学习能识别慢抓长期回报更高。如果时间惩罚增大到 0.4,最优选择又会改变。这说明策略改进取决于奖励定义。
13. 最小实验:固定数据,比较策略改进
构造一个两阶段抓取玩具环境:第一步选择快抓或慢抓,第二步根据是否抓稳选择放置或恢复。生成一份固定离线数据,其中快抓样本更多、慢抓成功率更高,并保留失败和接管轨迹。
- 在完全相同的数据上训练行为克隆、Advantage 加权行为克隆和保守离线 Q 方法。
- 固定网络容量、训练步数和奖励定义,只改变策略改进算法。
- 分别报告数据内动作准确率、真实回报、恢复成功率与碰撞率。
- 逐步删除慢抓数据,观察 critic 的分布外高估与策略退化。
- 改变时间惩罚,验证价值排序是否按奖励定义系统性改变。
- 用分桶可靠性图检查预测 Q 与真实成功率是否校准。
14. 失败模式与诊断
| 失败模式 | 诊断证据 | 处理方向 |
|---|---|---|
| 奖励投机 | 回报升高但真实成功、安全或稳定性下降 | 多指标约束、人工审计、反例回归 |
| 分布外高估 | 高 Q 动作在数据中罕见且真实执行失败 | 保守价值、行为约束、不确定性门控 |
| 信用分配错误 | 整条轨迹标签无法定位造成成败的阶段 | 阶段奖励、片段偏好、接管时间点监督 |
| Critic 失准 | 价值分桶与实际成功率不对应 | 校准、目标网络、更多覆盖和分层评测 |
| 策略遗忘 | 奖励任务提升但基础技能和语言遵循下降 | KL 正则、混合预训练数据、能力回归集 |
| 干预选择偏差 | 接管数据只覆盖人类来得及发现的错误 | 记录未干预对照、主动采样、因果分析 |
15. 可信评测
- 等量数据对照: 比较普通 SFT 与价值/Advantage 方法。
- 价值校准: 预测价值分桶与真实成功率是否一致。
- 安全指标: 碰撞、力峰值、接管率不能被平均回报掩盖。
- 任务阶段: 接近、接触、操作、释放和恢复分层报告。
- 分布外: 新物体、初始状态和动力学参数。
- 置信区间: 成功率必须报告试验次数与不确定性。
16. 本课练习
- 从回报定义推导 Bellman expectation equation。
- 解释 Monte Carlo 与 TD 的偏差-方差差异。
- 推导 Advantage baseline 为什么不改变策略梯度期望。
- 设计一个区分新增数据收益和 RL 算法收益的实验。
- 为接触任务设计奖励,并列出可能的 reward hacking。
- 说明 π0.6* 为什么同时属于 VLA 实验室和价值路线案例。
17. 论文坐标与证据边界
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| SAC | 优化期望回报与策略熵,使用连续动作 Actor-Critic | 最大熵目标可改善探索与鲁棒性 | 是在线连续控制基线,但真实机器人样本、安全和重置成本必须单独计算 |
| CQL | 在离线数据上对未被数据支持的动作价值施加保守正则 | 保守 Q 可减轻分布外高估 | 降低高估不等于自动获得更优策略;需与行为克隆及数据覆盖对照 |
| IQL | 避免显式评估数据外动作,通过 expectile value 与优势加权更新策略 | 可在无需行为策略模型的情况下进行稳定离线学习 | 性能仍受数据中优质行为覆盖限制,不能从完全缺失的技能中创造证据 |
| DAgger | 迭代收集当前策略访问状态上的专家纠正,缓解模仿分布偏移 | 在线纠正能覆盖策略自身造成的状态 | 它主要是交互式模仿而非奖励 RL,但在 Physical AI 恢复数据生产中极其重要 |
| RECAP | 利用 VLA 部署中的成功、失败和纠正数据继续改进策略 | 真实经验回流可扩展通用机器人策略能力 | 必须固定新增数据量,与普通 SFT 对照,才能识别价值机制而非数据规模带来的收益 |

