飞书原文 · 源修订 13
💡
机制课: 本课从 Semi-MDP 和 Options formalism 出发,解释技能的启动、执行、终止和高层选择,并讨论技能发现、时间抽象和跨任务复用。
学习目标
完成本课后,应能定义 Option;写出技能级 Bellman 方程;区分固定技能、学习技能和 latent skill;解释 termination learning;设计技能发现与组合泛化实验。
1. 时间抽象
普通策略每一步选择动作:
读法: 低层动作 a_t 从当前状态 s_t 条件下的策略分布中采样。
推导: 平坦策略在每个环境时间步都重新决策,所以一个长度 T 的任务需要连续作出 T 次动作选择;长时信用分配和搜索深度都随 T 增长。
层级策略选择持续多步的技能:
读法: 在第 k 个技能决策时刻,高层策略 mu 根据状态 s_{t_k} 和任务目标 g 选择一个 Option。
推导: 高层只在技能开始或结束的边界 t_k 决策;如果每个技能平均持续 tau 步,理想情况下高层决策次数约从 T 降为 T 除以 tau,但低层执行误差和终止错误仍会影响最终任务。
技能内部执行低层动作,直到 。高层只在技能边界决策,减少长时搜索深度。
2. Option 定义
读法: 一个 Option 由启动集合、技能内部策略和状态相关终止概率组成。
推导: 持续多步的技能必须回答三个问题:在哪些状态能开始、执行期间怎样产生低层动作、到达什么状态时停止。缺少任何一项,都无法形成可组合的 Semi-MDP 动作。
| 组件 | 含义 | 机器人例子 |
|---|---|---|
| 启动集 | 技能可以开始的状态 | 夹爪在杯子附近才能抓取 |
| 内部策略 | 技能中的动作策略 | 接近、闭合、抬起 |
| 终止 | 在状态 s 停止的概率 | 抓稳或确认失败 |
3. Semi-MDP 价值
技能持续 步,累积奖励:
读法: Option 从时刻 t 开始持续 tau 步时,技能内部回报是这 tau 个低层奖励的折扣和。
推导: 把普通逐步回报在 Option 覆盖的时间区间内截取,就得到技能级即时回报;第 i 个低层奖励距离技能开始 i 步,因此乘 gamma 的 i 次方。
技能价值:
读法: 在状态 s 执行 Option omega 的价值,等于技能内部折扣回报,加上技能结束状态价值按真实持续时间折扣后的条件期望。
推导: 普通 Bellman 分解跨一个低层时间步;Semi-MDP 分解跨越随机的 tau 步,因此终点价值必须乘 gamma 的 tau 次方,并对技能内部随机动作、环境转移和持续时间取期望。
折扣指数取决于真实持续时间。忽略持续时间会偏好很慢或很快的技能。

4. Option-Critic
Option-Critic 同时学习高层 Option 策略、内部策略和终止函数。终止梯度受继续当前技能和切换技能的价值差影响。
直觉:如果当前技能价值低于重新选择的价值,就提高终止概率。错误价值会导致频繁切换或技能固执。
读法: 终止参数 vartheta 的目标梯度,等于终止概率梯度与当前 Option 优势的乘积取负期望。
推导: 定义 。若当前 Option 比重新选择的平均价值更高,优势为正,梯度上升会降低终止概率;若优势为负,则提高终止概率更有利。实际实现还常加入终止成本,避免技能在价值噪声下频繁切换。
5. 技能的来源
| 来源 | 优点 | 风险 |
|---|---|---|
| 人工任务阶段 | 语义清晰 | 扩展性差 |
| 轨迹分段 | 利用示范 | 时间相似不等于功能相同 |
| 接触事件 | 物理意义强 | 需要可靠传感 |
| 互信息目标 | 自动发现多样技能 | 技能可能与任务无关 |
| 潜变量 VAE | 连续技能空间 | 塌缩和解释困难 |
| 语言标签 | 可组合可解释 | 语义与执行边界不一致 |
6. 无监督技能发现
一种目标最大化技能 与到达状态的互信息:
读法: 技能变量 z 与终止状态 S_T 的互信息,等于技能本身的熵减去看到终止状态后仍剩余的技能不确定性。
推导: 如果不同技能到达可区分的终止状态,那么从 S_T 能反推出 z,使条件熵下降、互信息上升。这个目标鼓励行为多样性,但不保证技能与下游任务、对象交互或安全约束相关。
若从最终状态可以识别技能,技能产生可区分行为。但“可区分”不保证对任务有用,机器人可能学会摆动关节而非操作对象。
7. 目标条件技能
技能可以条件于子目标:
读法: 低层动作从同时以当前状态和第 k 个子目标为条件的策略分布中采样。
推导: 把技能身份替换为目标条件后,同一个低层策略可以服务多个高层任务;高层负责提出可达到、可观测、可验收的 g_k,低层负责把状态推进到该目标附近。
高层输出目标状态或视觉目标,低层通过 goal-conditioned RL 或模仿学习到达。通用低层策略可以复用于多个高层任务。
8. 技能接口
技能之间必须共享明确接口:
- 输入状态和坐标系。
- 完成与失败条件。
- 动作、速度和控制模式。
- 对象 ownership 和夹爪状态。
- 可恢复状态。
抓取技能结束时如果没有报告“对象是否抓稳”,运输技能就可能在错误前提下开始。
9. 技能组合泛化
训练见过 A→B 和 C→D,不代表能执行 A→D。组合泛化需要:
- 技能前后状态兼容。
- 高层知道前置条件。
- 终止检测稳定。
- 低层不依赖特定上一个技能。
10. 最小实验
在同一个可重置环境中构造导航、抓取、运输、放置四个技能,并留出至少一种训练中未出现的技能顺序。固定低层控制频率、训练环境步数、网络参数量和在线规划预算,比较平坦策略、人工 Option、Option-Critic、目标条件低层策略和无监督 latent skill。
最低报告项: 整任务成功率、平均完成阶段、高层选择错误率、技能内部失败率、终止误报与漏报、切换延迟、未见组合成功率、扰动后局部恢复率,以及在相同真实环境步数下的样本效率。
- 构造导航-抓取-放置三技能任务。
- 比较平坦策略和 Option 策略。
- 改变技能终止噪声。
- 留出一种技能组合。
- 比较人工技能与 latent skill。
- 报告高层错误、技能错误和接口错误。
11. 本课练习
- 为抓取定义启动集、内部策略和终止函数。
- 推导技能级 Bellman target。
- 解释为什么固定时间窗口不是可靠技能。
- 设计一个无监督技能与任务无关的反例。
- 为技能组合定义接口契约。
- 比较语言技能 token 和连续 latent skill。
12. 主要失败模式
| 失败 | 表现 | 诊断与修正 |
|---|---|---|
| Option 塌缩 | 高层几乎总选同一个技能,其他技能从不使用 | 报告 Option 使用熵、状态覆盖和按任务阶段的选择分布 |
| 终止抖动 | 技能刚开始就停止,多个 Option 高频切换 | 检查价值噪声、终止成本、最短持续时间和切换延迟 |
| 技能固执 | 已明显失败仍不终止,直到超时 | 加入失败事件、超时终止和负优势下的终止监督 |
| 启动集失真 | 在不可执行状态调用技能,导致后续动作无意义 | 单独评测可用性分类、可达性和启动后的条件成功率 |
| 接口不兼容 | 每个技能单独成功,串联后在边界失败 | 检查坐标系、对象持有状态、速度、接触和完成谓词 |
| 持续时间偏差 | 高层偏爱过慢或过快技能,回报比较失真 | 核对 Semi-MDP 折扣、技能耗时和单位时间收益 |
| 无监督技能无任务价值 | 技能多样但只会摆动、旋转或改变无关状态 | 评测对象交互、下游可达性和少样本任务复用,而非只看互信息 |
| 高低层共同漂移 | 训练中子目标语义不断变化,低层追不上高层 | 分阶段训练、目标重标记、离策略校正或冻结一侧进行消融 |
13. 论文事实、作者解释与课程判断
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Options | 用启动集、内部策略和终止函数形式化跨多步动作,并建立 Semi-MDP 学习框架 | 时间抽象可以缩短决策链并支持知识复用 | 它给出接口而非自动解决技能发现;真实系统还需完成检测、切换稳定性和控制契约 |
| Option-Critic | 在统一架构中学习 Option 内部策略和终止函数,并给出相应梯度 | 无需人工指定终止条件也能发现有用时间抽象 | 端到端可学不保证可解释、可组合或不塌缩,必须报告 Option 使用和边界质量 |
| DIAYN | 通过技能与状态的互信息以及最大熵策略学习无监督多样技能 | 无奖励探索可以预训练可复用行为库 | 状态可区分性只是代理目标;对操作任务还需验证对象状态、接触事件和下游任务价值 |
| HIRO | 高层产生状态空间子目标,低层执行,并通过离策略校正缓解层级策略共同变化 | 目标条件层级可提高长时连续控制的样本效率 | 状态向量子目标在仿真中清晰,但视觉机器人需要解决可观测性、语义绑定和可验收性 |

