飞书原文 · 源修订 27
💡
课程定位: 本章属于“价值、奖励与经验学习”路线。RECAP 是案例,主线是理解奖励、回报、价值、Advantage、人工纠正和离线数据分别提供什么监督,以及这些信号如何与 VLA、世界模型和数据闭环连接。
1. 什么信号可以让机器人改变行为
学习目标: 完成本章后,应能区分示范动作、成功标签、逐步奖励、偏好比较、价值估计和人工纠正;能读出回报、价值和 Advantage;能从 Bellman 递推理解 critic;能推导 KL 正则策略改进;能设计区分“更多数据”和“更好学习算法”的消融。
| 监督信号 | 直接告诉模型什么 | 典型目标 | 没有直接告诉什么 |
|---|---|---|---|
| 专家动作 | 这个状态下专家做了什么 | 行为克隆 | 别的动作为什么更差 |
| 任务成功标签 | 整条轨迹是否完成任务 | 回报、价值学习 | 具体哪一步导致结果 |
| 逐步奖励 | 每个阶段的局部好坏 | 强化学习 | 奖励未编码的安全与偏好 |
| 成对偏好 | 轨迹 A 是否优于轨迹 B | 奖励模型、偏好优化 | 绝对价值尺度 |
| 人工纠正 | 错误状态下应如何恢复 | 纠正式模仿、DAgger 类方法 | 未被接管区域的动作排序 |
| 失败数据 | 策略真实会进入哪些坏状态 | 价值、分类器、数据重加权 | 失败状态的正确动作,除非附带纠正 |
这些信号可以组合。RECAP 的关键不是简单地“用失败训练”,而是把自主执行、任务结果、价值估计和人工恢复组织成一个策略改进闭环。
2. 从奖励到价值:Bellman 递推的读法
在状态 执行动作 后获得奖励 。从时刻 开始的折扣回报为:
读法: 从当前时刻开始的回报,等于当前及未来奖励按照距离当前的步数乘折扣因子后求和。
推导: 这是有限时域折扣回报的定义;gamma 越小,越强调近期结果,gamma 等于一时是不折扣的累计奖励。
读作:“从当前时刻开始,把未来奖励按距离远近折扣后相加。”状态价值和动作价值分别定义为:
读法: 状态价值是在当前状态为 s、之后按照策略 pi 行动时,未来回报的条件期望。
推导: 同一状态后仍可能因为策略采样和环境随机性产生多条轨迹,对这些轨迹的回报取平均。
读法: 动作价值是在状态 s 先执行动作 a、随后按照策略 pi 行动时,未来回报的条件期望。
推导: 把累计回报 G_t 的条件期望进一步固定当前动作 a,就得到状态动作价值 Q;它比 V 多回答了在状态 s 先执行动作 a 的长期后果。
Q 比 V 多固定了当前动作,因此可以比较同一状态下不同动作的长期结果。
它们不是已经观察到的标签,而是对未来随机结果的条件期望。Bellman 方程把长时回报拆成一步奖励和下一状态价值:
读法: 当前状态动作的价值,等于当前一步奖励加下一状态价值的折扣值,再对环境转移取条件期望。
推导: 把回报 G_t 拆成当前奖励 r_t 与 gamma 乘下一时刻回报;对下一回报条件期望就是 V。
Advantage 衡量某动作相对当前策略平均水平好多少:
读法: 动作 a 在状态 s 的优势,等于它的动作价值减去当前策略在该状态的平均价值。
推导: V 是当前策略动作分布下 Q 的平均值,因此相减得到动作相对平均选择的增量。
读作:“在状态 做动作 ,比按照当前策略的平均选择好多少。”正 Advantage 表示值得增加概率,负 Advantage 表示应降低概率。
2.1 价值函数为什么会错
critic 只能在数据覆盖的状态和动作附近可靠估计。离线数据中没有出现过的动作,价值网络可能因为函数外推而给出虚高分数。接触任务还存在严重的信用分配问题:最终失败可能由很早以前一次轻微滑动造成,而不是由最后一步动作造成。
2.2 价值学习与世界模型的关系
价值函数直接压缩未来回报,不必预测未来状态;世界模型预测动作后的未来,再由奖励或价值判断未来好坏。二者可以组合:世界模型生成想象 rollout,价值函数评价终点;也可以完全分开,model-free RL 直接学习价值和策略。
3. π0.6* 与 RECAP:大模型策略改进案例
π0.6 是 π0.5 的进一步工程化版本:更大的 Gemma 3 4B 主干、约 860M 的 Action Expert、更丰富的条件输入,并使用 Knowledge Insulation 保护 VLM 的通用知识不被机器人动作目标破坏。
Knowledge Insulation 的关键思想是:离散动作与语义监督可以训练共享主干,而连续 Flow Matching 专家的梯度不反向污染 VLM Backbone。它不是完全冻结主干,而是控制不同损失的梯度路径。
4. 为什么模仿学习会累积错误
策略执行一次小错误后,环境进入专家数据稀少的状态。继续使用原策略会使偏差扩大。解决方案不是只增加完美演示,而是收集模型真实会遇到的失败状态。
5. RECAP 的数据循环
- 用当前策略在真实机器人上执行任务。
- 收集自主成功、失败以及人工接管纠正轨迹。
- 根据任务结果训练价值函数 V(o,l)。
- 估计每个动作相对当前状态价值的优势 A(o,a,l)。
- 把优势转成条件输入,训练策略偏好高优势动作。
- 部署新策略并进入下一轮数据收集。
6. 从 KL 正则化策略改进推导 Advantage Conditioning
考虑在不偏离参考策略 π_ref 太远的条件下最大化优势:
读法: 在固定观测 o 下,寻找一个策略,使参考策略优势的期望尽可能大,同时用 beta 加权的 KL 散度惩罚它偏离参考策略。
推导: 第一项鼓励新策略选择参考策略下优势高的动作,第二项用 KL 散度惩罚偏离参考策略;beta 决定改进幅度与稳定性之间的权衡。
推导动机: 第一项推动策略选择高优势动作,第二项限制更新幅度,避免 critic 误差让大型策略一次偏离数据分布太远。
为简化读法,先写离散动作。固定观测 o,并加入概率和为一的约束:
读法: 拉格朗日函数由优势期望、负 KL 惩罚和策略概率归一化约束三部分组成。
推导: 把期望优势在离散动作上展开成加权和,把 KL 定义展开,并用拉格朗日乘子 lambda 加入所有动作概率和等于 1 的约束,就得到该目标。
对每个动作概率求偏导并令其为零:
读法: 最优点上,动作优势、策略相对参考策略的对数比和归一化乘子必须达到平衡。
推导: 对拉格朗日函数中每个 pi(a|o) 求偏导:优势项给 A,KL 项给负 beta 乘对数比加 1,归一化约束给 lambda;令导数为零得到驻点条件。
移项并指数化,所有与动作无关的项被归一化常数吸收。连续动作时把求和换成积分,结论相同。
读法: 新策略等于参考策略乘优势的指数权重,再除以观测相关的归一化常数 Z。
推导: 上一式给出比例关系;对全部动作求和或积分并令总概率为一,就得到分母 Z。beta 越小,策略越集中于高优势动作,也越容易放大 critic 误差。
RECAP 不直接对大型 Flow VLA 使用 PPO,而是把优势二值化为改进指示 I,并训练条件策略 π(a|o,I)。推理时固定请求高优势动作。
公式可视化|优势如何重加权参考策略

7. 人工纠正与强化学习的分工
| 信号 | 最擅长解决 | 局限 |
|---|---|---|
| 人工接管纠正 | 告诉模型如何从具体错误状态恢复 | 昂贵,依赖专家实时参与 |
| 任务奖励与自主试验 | 大规模区分好坏行为,提高成功率与吞吐 | 奖励稀疏,价值估计可能有偏 |
8. 必须警惕的实验问题
- 成功率提升可能同时来自新增数据,而非优势条件本身;需要与等量 SFT 数据比较。
- 价值函数错误会把偶然成功归因给错误动作,需要跨初始状态和任务阶段校准。
- 吞吐提高可能牺牲动作安全边界,应单独报告碰撞、力峰值和人工接管率。
9. 这条路线如何连接 VLA、世界模型与数据引擎
| 连接 | 机制 | 主要风险 |
|---|---|---|
| 价值 → VLA | 对动作加权、条件化或重排,提高高 Advantage 动作概率 | critic 偏差被策略放大 |
| 世界模型 → 价值 | 用想象 rollout 产生未来回报训练信号 | 模型误差污染价值 |
| VLA → 数据引擎 | 部署当前策略,收集自主成功、失败和人工接管 | 线上探索和安全成本 |
| 数据引擎 → 价值 | 提供成功标签、阶段结果和失败分布 | 标签延迟、任务定义不一致 |
| 人工纠正 → 策略 | 直接提供错误状态下的恢复动作 | 干预策略造成选择偏差 |
决定性实验
- 等量数据对照: 固定新增轨迹数量,比较普通 SFT、成功过滤、Advantage 加权和条件策略。
- 价值校准: 按预测价值分桶,比较真实成功率,报告 ECE 或可靠性曲线。
- 任务阶段分层: 分别评估接近、接触、操作、释放和恢复阶段,而不是只报告整任务成功率。
- 安全指标: 同时报告碰撞、力峰值、人工接管率和恢复时间。
- 分布外验证: 在新物体、初始状态和动力学参数上检查价值排序是否保持。
只有当等量数据对照仍显示策略改进,价值预测与真实结果校准,并且安全指标没有恶化,才能把提升归因于经验学习机制,而不是简单的数据规模增长。
练习
- 从拉格朗日乘子推导指数加权策略的闭式解。
- 设计一个区分“纠正数据收益”和“RL 收益”的消融实验。
- 解释为什么失败轨迹不应被简单删除,而应保留状态、恢复和结果信息。

