跳到正文

飞书原文 · 源修订 13

💡

机制课: 本课从 Semi-MDP 和 Options formalism 出发,解释技能的启动、执行、终止和高层选择,并讨论技能发现、时间抽象和跨任务复用。

学习目标 ​

完成本课后,应能定义 Option;写出技能级 Bellman 方程;区分固定技能、学习技能和 latent skill;解释 termination learning;设计技能发现与组合泛化实验。

1. 时间抽象 ​

普通策略每一步选择动作:

读法: 低层动作 a_t 从当前状态 s_t 条件下的策略分布中采样。

推导: 平坦策略在每个环境时间步都重新决策,所以一个长度 T 的任务需要连续作出 T 次动作选择;长时信用分配和搜索深度都随 T 增长。

层级策略选择持续多步的技能:

读法: 在第 k 个技能决策时刻,高层策略 mu 根据状态 s_{t_k} 和任务目标 g 选择一个 Option。

推导: 高层只在技能开始或结束的边界 t_k 决策;如果每个技能平均持续 tau 步,理想情况下高层决策次数约从 T 降为 T 除以 tau,但低层执行误差和终止错误仍会影响最终任务。

技能内部执行低层动作,直到 。高层只在技能边界决策,减少长时搜索深度。

2. Option 定义 ​

读法: 一个 Option 由启动集合、技能内部策略和状态相关终止概率组成。

推导: 持续多步的技能必须回答三个问题:在哪些状态能开始、执行期间怎样产生低层动作、到达什么状态时停止。缺少任何一项,都无法形成可组合的 Semi-MDP 动作。

组件含义机器人例子
启动集 技能可以开始的状态夹爪在杯子附近才能抓取
内部策略 技能中的动作策略接近、闭合、抬起
终止 在状态 s 停止的概率抓稳或确认失败

3. Semi-MDP 价值 ​

技能持续 步,累积奖励:

读法: Option 从时刻 t 开始持续 tau 步时,技能内部回报是这 tau 个低层奖励的折扣和。

推导: 把普通逐步回报在 Option 覆盖的时间区间内截取,就得到技能级即时回报;第 i 个低层奖励距离技能开始 i 步,因此乘 gamma 的 i 次方。

技能价值:

读法: 在状态 s 执行 Option omega 的价值,等于技能内部折扣回报,加上技能结束状态价值按真实持续时间折扣后的条件期望。

推导: 普通 Bellman 分解跨一个低层时间步;Semi-MDP 分解跨越随机的 tau 步,因此终点价值必须乘 gamma 的 tau 次方,并对技能内部随机动作、环境转移和持续时间取期望。

折扣指数取决于真实持续时间。忽略持续时间会偏好很慢或很快的技能。

课程画板

4. Option-Critic ​

Option-Critic 同时学习高层 Option 策略、内部策略和终止函数。终止梯度受继续当前技能和切换技能的价值差影响。

直觉:如果当前技能价值低于重新选择的价值,就提高终止概率。错误价值会导致频繁切换或技能固执。

读法: 终止参数 vartheta 的目标梯度,等于终止概率梯度与当前 Option 优势的乘积取负期望。

推导: 定义 。若当前 Option 比重新选择的平均价值更高,优势为正,梯度上升会降低终止概率;若优势为负,则提高终止概率更有利。实际实现还常加入终止成本,避免技能在价值噪声下频繁切换。

5. 技能的来源 ​

来源优点风险
人工任务阶段语义清晰扩展性差
轨迹分段利用示范时间相似不等于功能相同
接触事件物理意义强需要可靠传感
互信息目标自动发现多样技能技能可能与任务无关
潜变量 VAE连续技能空间塌缩和解释困难
语言标签可组合可解释语义与执行边界不一致

6. 无监督技能发现 ​

一种目标最大化技能 与到达状态的互信息:

读法: 技能变量 z 与终止状态 S_T 的互信息,等于技能本身的熵减去看到终止状态后仍剩余的技能不确定性。

推导: 如果不同技能到达可区分的终止状态,那么从 S_T 能反推出 z,使条件熵下降、互信息上升。这个目标鼓励行为多样性,但不保证技能与下游任务、对象交互或安全约束相关。

若从最终状态可以识别技能,技能产生可区分行为。但“可区分”不保证对任务有用,机器人可能学会摆动关节而非操作对象。

7. 目标条件技能 ​

技能可以条件于子目标:

读法: 低层动作从同时以当前状态和第 k 个子目标为条件的策略分布中采样。

推导: 把技能身份替换为目标条件后,同一个低层策略可以服务多个高层任务;高层负责提出可达到、可观测、可验收的 g_k,低层负责把状态推进到该目标附近。

高层输出目标状态或视觉目标,低层通过 goal-conditioned RL 或模仿学习到达。通用低层策略可以复用于多个高层任务。

8. 技能接口 ​

技能之间必须共享明确接口:

  • 输入状态和坐标系。
  • 完成与失败条件。
  • 动作、速度和控制模式。
  • 对象 ownership 和夹爪状态。
  • 可恢复状态。

抓取技能结束时如果没有报告“对象是否抓稳”,运输技能就可能在错误前提下开始。

9. 技能组合泛化 ​

训练见过 A→B 和 C→D,不代表能执行 A→D。组合泛化需要:

  • 技能前后状态兼容。
  • 高层知道前置条件。
  • 终止检测稳定。
  • 低层不依赖特定上一个技能。

10. 最小实验 ​

在同一个可重置环境中构造导航、抓取、运输、放置四个技能,并留出至少一种训练中未出现的技能顺序。固定低层控制频率、训练环境步数、网络参数量和在线规划预算,比较平坦策略、人工 Option、Option-Critic、目标条件低层策略和无监督 latent skill。

最低报告项: 整任务成功率、平均完成阶段、高层选择错误率、技能内部失败率、终止误报与漏报、切换延迟、未见组合成功率、扰动后局部恢复率,以及在相同真实环境步数下的样本效率。

  1. 构造导航-抓取-放置三技能任务。
  2. 比较平坦策略和 Option 策略。
  3. 改变技能终止噪声。
  4. 留出一种技能组合。
  5. 比较人工技能与 latent skill。
  6. 报告高层错误、技能错误和接口错误。

11. 本课练习 ​

  1. 为抓取定义启动集、内部策略和终止函数。
  2. 推导技能级 Bellman target。
  3. 解释为什么固定时间窗口不是可靠技能。
  4. 设计一个无监督技能与任务无关的反例。
  5. 为技能组合定义接口契约。
  6. 比较语言技能 token 和连续 latent skill。

12. 主要失败模式 ​

失败表现诊断与修正
Option 塌缩高层几乎总选同一个技能,其他技能从不使用报告 Option 使用熵、状态覆盖和按任务阶段的选择分布
终止抖动技能刚开始就停止,多个 Option 高频切换检查价值噪声、终止成本、最短持续时间和切换延迟
技能固执已明显失败仍不终止,直到超时加入失败事件、超时终止和负优势下的终止监督
启动集失真在不可执行状态调用技能,导致后续动作无意义单独评测可用性分类、可达性和启动后的条件成功率
接口不兼容每个技能单独成功,串联后在边界失败检查坐标系、对象持有状态、速度、接触和完成谓词
持续时间偏差高层偏爱过慢或过快技能,回报比较失真核对 Semi-MDP 折扣、技能耗时和单位时间收益
无监督技能无任务价值技能多样但只会摆动、旋转或改变无关状态评测对象交互、下游可达性和少样本任务复用,而非只看互信息
高低层共同漂移训练中子目标语义不断变化,低层追不上高层分阶段训练、目标重标记、离策略校正或冻结一侧进行消融

13. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
Options用启动集、内部策略和终止函数形式化跨多步动作,并建立 Semi-MDP 学习框架时间抽象可以缩短决策链并支持知识复用它给出接口而非自动解决技能发现;真实系统还需完成检测、切换稳定性和控制契约
Option-Critic在统一架构中学习 Option 内部策略和终止函数,并给出相应梯度无需人工指定终止条件也能发现有用时间抽象端到端可学不保证可解释、可组合或不塌缩,必须报告 Option 使用和边界质量
DIAYN通过技能与状态的互信息以及最大熵策略学习无监督多样技能无奖励探索可以预训练可复用行为库状态可区分性只是代理目标;对操作任务还需验证对象状态、接触事件和下游任务价值
HIRO高层产生状态空间子目标,低层执行,并通过离策略校正缓解层级策略共同变化目标条件层级可提高长时连续控制的样本效率状态向量子目标在仿真中清晰,但视觉机器人需要解决可观测性、语义绑定和可验收性

14. 课程交叉阅读 ​

D0|分层规划、技能与记忆

D2|子目标规划与具身推理

C1|从 Bellman 到 Actor-Critic

E3|Behavior Tokenizer

F0|动力学、控制与物理交互

文章正文采用 Apache License 2.0