飞书原文 · 源修订 9
💡
机制课: 许多机器人任务难以写出完整奖励,却容易判断哪个行为更好或在失败时接管。本课统一解释轨迹偏好、奖励模型、纠正式模仿、DAgger、人类接管和安全门控。
学习目标
完成本课后,应能从成对偏好推导 Bradley-Terry 奖励模型;理解偏好优化和奖励模型误差;解释 DAgger 如何修复状态分布偏移;区分示范、纠正、接管与偏好;设计人类反馈采集和安全评测。
1. 为什么不用手写奖励
整理、舒适、自然和安全很难压缩成单个公式。手写奖励容易产生 reward hacking:模型完成数值指标却违背真实目标。
人类反馈的优势是能评价复杂整体行为,缺点是昂贵、有噪声、受上下文和标注者偏好影响。
2. 成对偏好
给两条轨迹片段 ,标注者选择 A 更好。奖励模型给片段分数:
读法: 长度为 L 的轨迹片段总分,是奖励模型对每一步状态动作给出的局部分数之和。
推导: 这是加性轨迹奖励假设;它便于信用分配,但若整体风格或安全不能分解到单步,模型还需要片段级网络或非加性聚合。
Bradley-Terry 概率:
读法: A 优于 B 的概率由两条轨迹分数的指数归一化得到,也等于分数差经过 sigmoid。
推导: Bradley-Terry 假设两候选的偏好赔率等于分数指数之比;分子分母同除以 A 的指数即可化成 sigmoid 分数差。
读法: 偏好损失是在所有“获胜片段优于落败片段”的标注上,最小化模型所给偏好概率的负对数。
推导: 把每个成对标注视为二分类观测,对 Bradley-Terry 概率做最大似然,等价于该二元交叉熵。它只确定相对分数,给所有 R 加同一常数不改变概率。
3. 偏好数据的统计问题
| 问题 | 影响 | 处理 |
|---|---|---|
| 标注者不一致 | 奖励模型平均冲突偏好 | 多标注、分层模型、置信度 |
| 片段难度不平衡 | 只学明显失败 | 主动选择边界样本 |
| 顺序和展示偏差 | 位置影响选择 | 随机化顺序 |
| 结果不可见 | 标注者无法判断接触和力 | 多视角、力曲线、任务结果 |
| 分布变化 | 新策略产生新类型轨迹 | 持续反馈和 OOD 检测 |
4. 奖励模型被策略利用
策略优化会主动寻找奖励模型漏洞。即使训练集准确率高,分布外轨迹也可能得到虚高分数。
应使用:
- 奖励 ensemble 与不确定性。
- KL 约束保持接近参考策略。
- 真实任务结果和硬安全约束。
- 周期性人工复核。
- 对抗性和反例数据。
5. 直接偏好优化与策略加权
可以不显式训练奖励模型,直接增加偏好轨迹概率。抽象目标:
读法: 直接偏好优化提高获胜轨迹相对参考策略的对数概率优势,并降低落败轨迹的相对优势,再通过 sigmoid 最大化偏好似然。
推导: KL 正则最优策略满足策略与参考策略的 log 比值正比于隐式奖励;把该关系代入 Bradley-Terry 偏好概率即可消去显式奖励模型。机器人连续轨迹的 log 概率需按动作条件概率求和,并处理长度和噪声尺度。
机器人轨迹是连续动作序列,概率计算、长度归一化和动作噪声比语言 token 更复杂。也可把偏好转成轨迹权重做加权行为克隆。
6. 纠正式模仿与 DAgger
行为克隆只在专家状态分布训练。DAgger 让当前策略执行,由专家在它访问的状态提供动作:
- 训练初始策略。
- 部署策略访问自身状态分布。
- 专家为这些状态标注正确动作。
- 聚合新数据并重新训练。
理论上把序列误差从可能的二次累积改善为更接近线性,但实际机器人需要控制安全和专家成本。
7. 人工接管
接管数据包含:
- 接管前的失败征兆。
- 接管触发时刻。
- 专家恢复动作。
- 恢复后何时交还控制。
接管不是随机发生的。人只在认为危险或失败时介入,形成 selection bias。必须把“未接管”与“安全”区分开。
8. 纠正与偏好的分工
| 反馈 | 最直接提供 | 适合 |
|---|---|---|
| 完整示范 | 从初始状态到成功的动作 | 基础策略 |
| 局部纠正 | 某个错误状态的恢复动作 | 闭环恢复 |
| 成对偏好 | 两个行为的相对好坏 | 风格、效率、安全综合评价 |
| 成功标签 | 整条轨迹结果 | 价值学习和筛选 |
| 自然语言反馈 | 失败原因和高层建议 | 子目标、数据标注 |
9. 主动反馈采集
不应随机让人标注所有轨迹。可优先选择:
- 奖励模型不确定的样本。
- 两个候选策略分歧大的样本。
- 安全边界附近的样本。
- 高价值但 OOD 的样本。
- 新任务和新对象。
主动选择提高标签效率,但改变采样分布,需要在训练和评测中记录。
10. 与 VLA 和分层规划的连接
人类反馈可以作用在不同层:
- 低层动作:纠正抓取和接触。
- Action Chunk:比较轨迹平滑与成功。
- 技能:选择更合适的恢复技能。
- 高层计划:比较任务顺序。
- 视觉子目标:判断生成未来是否合理。
反馈粒度必须与模型输出粒度一致,否则信用分配模糊。
11. 最小实验与可信评测
- 报告标注人数、一致性和每类样本数量。
- 奖励模型在新策略轨迹上重新验证。
- 比较随机标注和主动标注。
- 固定反馈预算,比较完整示范、纠正和偏好。
- 报告安全事件、接管率和恢复成功率。
- 检查策略是否利用奖励漏洞。
12. 失败模式与诊断
| 失败模式 | 诊断证据 | 处理方向 |
|---|---|---|
| 奖励模型投机 | 模型分数升高但真实成功、安全或人类复核下降 | 真实结果约束、对抗样本、周期性重标注 |
| 标注者分歧 | 同一对轨迹的选择一致率低 | 多标注者、分层偏好、保留“不确定/平局” |
| 接管选择偏差 | 未接管样本被错误解释为安全样本 | 记录可见性与反应延迟、构造未干预对照 |
| 反馈粒度错位 | 整条轨迹偏好无法定位具体接触错误 | 片段比较、阶段标签、动作级纠正 |
| 策略分布变化 | 奖励模型在新策略轨迹上的准确率骤降 | 持续查询、OOD 检测、在线校准 |
| 人类反馈延迟 | 接管动作与触发事件时间错位 | 精确时间同步、延迟扫描、触发前窗口标注 |
13. 论文坐标与证据边界
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| DAgger | 迭代收集当前策略访问状态上的专家动作并聚合训练集 | 可把模仿学习的状态分布偏移从复合误差中拉回 | 真实机器人应用必须加入安全门控、专家成本和策略混合协议 |
| Deep RL from Human Preferences | 用成对片段偏好训练奖励模型,再据此优化策略 | 人类比较可以监督难以手写奖励的复杂行为 | 奖励模型准确率不是最终证据,必须验证新策略上的真实目标和漏洞 |
| HG-DAgger | 由人类决定何时接管并提供纠正,减少持续专家标注 | 人类门控可以兼顾安全和数据效率 | 接管触发是有选择的观察过程,未接管不能直接作为负标签 |
| PEBBLE | 结合无监督预训练、主动偏好查询和奖励学习提高反馈效率 | 主动选择信息量高的片段可减少人工标签 | 主动采样改变训练分布,评测需回到独立任务分布并报告标注预算 |
| DPO | 在参考策略下直接用偏好对优化策略相对 log 概率,无需显式奖励模型 | 偏好优化可化为稳定的监督式目标 | 机器人连续轨迹需要定义密度、长度归一化与动作噪声,不能直接照搬 token 公式 |
| RECAP | 利用部署成功、失败和纠正数据改进通用 VLA | 真实机器人经验回流可扩展基础策略 | 应固定反馈预算与新增数据量,对比普通再训练、价值加权和偏好方法 |
14. 本课练习
- 推导 Bradley-Terry 偏好概率。
- 设计一个奖励模型容易被利用的机器人例子。
- 为 DAgger 定义安全的真实机器人采集流程。
- 解释接管数据的选择偏差。
- 设计主动偏好查询策略。
- 比较低层动作偏好和高层计划偏好。

