跳到正文

飞书原文 · 源修订 9

💡

机制课: 许多机器人任务难以写出完整奖励,却容易判断哪个行为更好或在失败时接管。本课统一解释轨迹偏好、奖励模型、纠正式模仿、DAgger、人类接管和安全门控。

学习目标 ​

完成本课后,应能从成对偏好推导 Bradley-Terry 奖励模型;理解偏好优化和奖励模型误差;解释 DAgger 如何修复状态分布偏移;区分示范、纠正、接管与偏好;设计人类反馈采集和安全评测。

1. 为什么不用手写奖励 ​

整理、舒适、自然和安全很难压缩成单个公式。手写奖励容易产生 reward hacking:模型完成数值指标却违背真实目标。

人类反馈的优势是能评价复杂整体行为,缺点是昂贵、有噪声、受上下文和标注者偏好影响。

2. 成对偏好 ​

给两条轨迹片段 ,标注者选择 A 更好。奖励模型给片段分数:

读法: 长度为 L 的轨迹片段总分,是奖励模型对每一步状态动作给出的局部分数之和。

推导: 这是加性轨迹奖励假设;它便于信用分配,但若整体风格或安全不能分解到单步,模型还需要片段级网络或非加性聚合。

Bradley-Terry 概率:

读法: A 优于 B 的概率由两条轨迹分数的指数归一化得到,也等于分数差经过 sigmoid。

推导: Bradley-Terry 假设两候选的偏好赔率等于分数指数之比;分子分母同除以 A 的指数即可化成 sigmoid 分数差。

读法: 偏好损失是在所有“获胜片段优于落败片段”的标注上,最小化模型所给偏好概率的负对数。

推导: 把每个成对标注视为二分类观测,对 Bradley-Terry 概率做最大似然,等价于该二元交叉熵。它只确定相对分数,给所有 R 加同一常数不改变概率。

3. 偏好数据的统计问题 ​

问题影响处理
标注者不一致奖励模型平均冲突偏好多标注、分层模型、置信度
片段难度不平衡只学明显失败主动选择边界样本
顺序和展示偏差位置影响选择随机化顺序
结果不可见标注者无法判断接触和力多视角、力曲线、任务结果
分布变化新策略产生新类型轨迹持续反馈和 OOD 检测

4. 奖励模型被策略利用 ​

策略优化会主动寻找奖励模型漏洞。即使训练集准确率高,分布外轨迹也可能得到虚高分数。

应使用:

  • 奖励 ensemble 与不确定性。
  • KL 约束保持接近参考策略。
  • 真实任务结果和硬安全约束。
  • 周期性人工复核。
  • 对抗性和反例数据。

5. 直接偏好优化与策略加权 ​

可以不显式训练奖励模型,直接增加偏好轨迹概率。抽象目标:

读法: 直接偏好优化提高获胜轨迹相对参考策略的对数概率优势,并降低落败轨迹的相对优势,再通过 sigmoid 最大化偏好似然。

推导: KL 正则最优策略满足策略与参考策略的 log 比值正比于隐式奖励;把该关系代入 Bradley-Terry 偏好概率即可消去显式奖励模型。机器人连续轨迹的 log 概率需按动作条件概率求和,并处理长度和噪声尺度。

机器人轨迹是连续动作序列,概率计算、长度归一化和动作噪声比语言 token 更复杂。也可把偏好转成轨迹权重做加权行为克隆。

6. 纠正式模仿与 DAgger ​

行为克隆只在专家状态分布训练。DAgger 让当前策略执行,由专家在它访问的状态提供动作:

  1. 训练初始策略。
  2. 部署策略访问自身状态分布。
  3. 专家为这些状态标注正确动作。
  4. 聚合新数据并重新训练。

理论上把序列误差从可能的二次累积改善为更接近线性,但实际机器人需要控制安全和专家成本。

7. 人工接管 ​

接管数据包含:

  • 接管前的失败征兆。
  • 接管触发时刻。
  • 专家恢复动作。
  • 恢复后何时交还控制。

接管不是随机发生的。人只在认为危险或失败时介入,形成 selection bias。必须把“未接管”与“安全”区分开。

8. 纠正与偏好的分工 ​

反馈最直接提供适合
完整示范从初始状态到成功的动作基础策略
局部纠正某个错误状态的恢复动作闭环恢复
成对偏好两个行为的相对好坏风格、效率、安全综合评价
成功标签整条轨迹结果价值学习和筛选
自然语言反馈失败原因和高层建议子目标、数据标注

9. 主动反馈采集 ​

不应随机让人标注所有轨迹。可优先选择:

  • 奖励模型不确定的样本。
  • 两个候选策略分歧大的样本。
  • 安全边界附近的样本。
  • 高价值但 OOD 的样本。
  • 新任务和新对象。

主动选择提高标签效率,但改变采样分布,需要在训练和评测中记录。

10. 与 VLA 和分层规划的连接 ​

人类反馈可以作用在不同层:

  • 低层动作:纠正抓取和接触。
  • Action Chunk:比较轨迹平滑与成功。
  • 技能:选择更合适的恢复技能。
  • 高层计划:比较任务顺序。
  • 视觉子目标:判断生成未来是否合理。

反馈粒度必须与模型输出粒度一致,否则信用分配模糊。

11. 最小实验与可信评测 ​

  1. 报告标注人数、一致性和每类样本数量。
  2. 奖励模型在新策略轨迹上重新验证。
  3. 比较随机标注和主动标注。
  4. 固定反馈预算,比较完整示范、纠正和偏好。
  5. 报告安全事件、接管率和恢复成功率。
  6. 检查策略是否利用奖励漏洞。

12. 失败模式与诊断 ​

失败模式诊断证据处理方向
奖励模型投机模型分数升高但真实成功、安全或人类复核下降真实结果约束、对抗样本、周期性重标注
标注者分歧同一对轨迹的选择一致率低多标注者、分层偏好、保留“不确定/平局”
接管选择偏差未接管样本被错误解释为安全样本记录可见性与反应延迟、构造未干预对照
反馈粒度错位整条轨迹偏好无法定位具体接触错误片段比较、阶段标签、动作级纠正
策略分布变化奖励模型在新策略轨迹上的准确率骤降持续查询、OOD 检测、在线校准
人类反馈延迟接管动作与触发事件时间错位精确时间同步、延迟扫描、触发前窗口标注

13. 论文坐标与证据边界 ​

工作论文事实作者解释课程判断
DAgger迭代收集当前策略访问状态上的专家动作并聚合训练集可把模仿学习的状态分布偏移从复合误差中拉回真实机器人应用必须加入安全门控、专家成本和策略混合协议
Deep RL from Human Preferences用成对片段偏好训练奖励模型,再据此优化策略人类比较可以监督难以手写奖励的复杂行为奖励模型准确率不是最终证据,必须验证新策略上的真实目标和漏洞
HG-DAgger由人类决定何时接管并提供纠正,减少持续专家标注人类门控可以兼顾安全和数据效率接管触发是有选择的观察过程,未接管不能直接作为负标签
PEBBLE结合无监督预训练、主动偏好查询和奖励学习提高反馈效率主动选择信息量高的片段可减少人工标签主动采样改变训练分布,评测需回到独立任务分布并报告标注预算
DPO在参考策略下直接用偏好对优化策略相对 log 概率,无需显式奖励模型偏好优化可化为稳定的监督式目标机器人连续轨迹需要定义密度、长度归一化与动作噪声,不能直接照搬 token 公式
RECAP利用部署成功、失败和纠正数据改进通用 VLA真实机器人经验回流可扩展基础策略应固定反馈预算与新增数据量,对比普通再训练、价值加权和偏好方法

14. 本课练习 ​

  1. 推导 Bradley-Terry 偏好概率。
  2. 设计一个奖励模型容易被利用的机器人例子。
  3. 为 DAgger 定义安全的真实机器人采集流程。
  4. 解释接管数据的选择偏差。
  5. 设计主动偏好查询策略。
  6. 比较低层动作偏好和高层计划偏好。

文章正文采用 Apache License 2.0