飞书原文 · 源修订 17
💡
路线总课: 直接策略擅长短期动作,长时任务需要决定先做什么、何时切换阶段、失败后回到哪里,以及如何利用过去经验。本课统一解释子目标、技能、Options、任务图、世界模型、具身推理、记忆和测试时适应。
学习目标
完成本课后,应能解释为什么长时任务需要层级;区分高层规划、低层策略和控制器;理解 Option 与技能 token;构造语言、视觉和状态子目标;说明世界模型与价值如何支持规划;区分参数记忆、上下文记忆和测试时快速权重;设计长时任务的阶段、恢复与泛化评测。
1. 长时任务为什么不是更多动作步数
“整理桌面”可能包含识别物体、决定顺序、抓取、移动、放置、检查结果和失败恢复。随着时长增加,问题发生质变:
- 早期决策改变后续可行空间。
- 同一低层动作在不同任务阶段含义不同。
- 中间失败不一定需要从头开始。
- 策略必须记住已完成和未完成的子任务。
- 低层误差会在阶段切换时放大。
因此需要把“选择任务阶段”和“执行连续动作”分开建模。
2. 三层 Physical AI 系统
| 层 | 时间尺度 | 输出 | 主要问题 |
|---|---|---|---|
| 高层规划 | 秒到分钟 | 子目标、技能、任务图 | 接下来做哪一阶段 |
| 低层策略 | 几十毫秒到秒 | 连续动作块 | 如何完成当前子目标 |
| 反馈控制 | 毫秒 | 电机命令 | 如何稳定执行 |
层级的价值不仅是节省计算,也在于让不同时间尺度使用不同状态表示和监督信号。
3. Option:强化学习中的技能形式化
一个 Option 可以写成:
读法: 一个 Option 由启动状态集合、技能内部策略和状态相关终止概率三部分组成。
推导: 持续多步的技能必须回答“哪里能开始、期间做什么、何时结束”;只保存动作片段不足以形成可复用 Option。
| 组成 | 含义 |
|---|---|
| 启动集合:技能允许开始的状态 | 技能可以启动的状态集合 |
| 内部策略:技能执行期间的低层动作分布 | 技能内部的低层策略 |
| 终止函数:技能在当前状态停止的概率 | 技能在状态 s 终止的概率 |
高层策略选择 Option:
读法: 在第 k 个技能决策时刻,高层策略根据当前状态和任务目标选择 Option。
推导: 把低层动作空间替换为技能集合即可得到高层策略;k 表示不等间隔的 Option 决策时刻,而非每个电机周期。
低层策略持续执行,直到终止条件触发。技能学习的核心不仅是动作片段,还包括何时能用和何时应该停止。
4. 子目标可以用什么表示
| 子目标形式 | 例子 | 优点 | 风险 |
|---|---|---|---|
| 语言 | “拿起红杯子” | 可解释、容易由 VLM 生成 | 不包含精确几何和接触状态 |
| 视觉目标 | 目标图像或未来视角 | 包含空间和对象状态 | 可能生成不可达或物理错误画面 |
| 状态目标 | 物体位姿、关节配置 | 适合规划和控制 | 真实状态难以获得 |
| 技能 token | 抓取、旋转、插入 | 离散组合方便 | 技能边界可能人为且不完整 |
| 潜在向量 | 学习出的 goal embedding | 表达灵活 | 语义和可验证性弱 |
好的子目标必须同时满足可观测、可达到、能判断完成,并能让低层策略知道需要什么行为。
5. 从任务图到层级策略
任务可以表示为带条件的图:
读法: 任务图由子目标节点集合和允许转移的有向边集合组成。
推导: 把任务阶段抽象为节点,把前置条件和顺序关系抽象为边,即得到可检查、可重规划的图结构。
节点表示子目标,边表示允许的转移。高层规划器根据当前状态选择下一个节点,低层策略执行。
显式任务图适合规则清晰的流程;学习式高层策略适合任务变化大、规则难以穷举的场景。实际系统常结合两者:规则负责安全和硬约束,模型负责语义判断与柔性排序。
6. 世界模型怎样支持长时规划
世界模型提供:
读法: 低层世界模型根据当前潜在状态和单步动作预测下一潜在状态分布。
推导: 这是动作时间尺度的受控转移模型,可通过多步组合支持短期规划。
在层级规划中,动作可以替换为技能:
读法: 技能级世界模型根据当前高层状态和所选 Option,预测技能结束时的下一高层状态。
推导: 把 Option 内部的所有低层动作和随机持续时间边缘化,就得到 Semi-MDP 决策时刻之间的技能级转移。
这让规划器在技能时间尺度预测“执行抓取后物体可能在哪里”,而不必模拟每个电机周期。
世界模型可以:
- 检查子目标是否可达到。
- 比较不同技能顺序的未来结果。
- 生成视觉子目标。
- 预测失败并提前重规划。
但模型误差会被高层规划主动利用。看起来合理的未来图像不代表接触力和可执行性正确。
7. 价值函数怎样支持技能选择
技能价值写成:
读法: Option 价值等于技能持续期间的折扣奖励,加上技能结束状态价值按随机持续时间折扣后的期望。
推导: 这是 Bellman 回报在 Semi-MDP 上的版本;Option 一次跨越 T_omega 个低层时间步,因此终点价值必须乘 gamma 的 T_omega 次方。
是技能持续时间。价值函数可以比较不同子目标、决定何时放弃当前技能,并为世界模型规划的候选未来排序。
如果价值只基于最终成功,可能无法判断中间阶段;如果奖励塑形过强,则可能鼓励完成局部指标却破坏整体任务。
8. 语言思维链为什么不等于具身推理
文本计划“拿杯子 → 倒水 → 放回去”只是符号序列。具身推理还需要:
- 把语言实体绑定到当前视觉对象。
- 判断抓取点、可达性和接触状态。
- 根据执行反馈更新计划。
- 在失败时选择恢复动作。
- 处理物理约束和不可逆变化。
因此具身推理应当是观测、记忆、子目标和动作的闭环,而不是只在动作前生成一次文字解释。
9. 记忆的三种形式
| 记忆 | 存在哪里 | 更新速度 | 作用 |
|---|---|---|---|
| 参数记忆 | 模型权重 | 训练时慢更新 | 通用技能和长期知识 |
| 上下文记忆 | 历史 token、状态缓存 | 每个 episode 更新 | 记住当前任务进展 |
| 外部记忆 | 数据库、轨迹库、对象图 | 可查询和写入 | 复用过去案例 |
| 快速权重 | 测试时适配参数 | 演示后快速更新 | 针对当前环境或用户适应 |
记忆越可塑,越容易快速适应,也越容易遗忘、污染或写入错误经验。需要门控、不确定性和回滚机制。
10. 测试时适应
测试时适应希望用当前环境的人类演示或无标签观测更新模型内部状态:
读法: 测试时更新器根据旧记忆和当前上下文数据,产生更新后的快速记忆 m prime。
推导: 把演示、观测或反馈作为 inner-loop 输入,元训练学习更新规则 U,使写入后的记忆能改善后续机器人任务。
随后策略条件于更新后的记忆:
读法: 更新后的策略根据当前观测、任务目标和快速记忆产生动作分布。
推导: 把 m prime 作为额外条件即可让同一基础参数在不同环境或演示后表现不同;错误记忆也会直接改变动作,因此需要门控和回滚。
WAM-TTT 的思路是让人类视频在 inner loop 写入快速记忆,再用机器人动作任务在 outer loop 训练“怎样更新才有用”。关键证据是:只用人类侧信号更新后,机器人动作是否在真正留出的环境和任务上改善。
11. 技能如何产生
| 来源 | 方法 | 风险 |
|---|---|---|
| 人工定义 | 按任务阶段标注 | 扩展性和边界主观 |
| 动作聚类 | 按轨迹相似性发现片段 | 几何相似不等于功能相同 |
| 事件分割 | 按接触、对象变化切分 | 依赖可靠事件检测 |
| 潜变量模型 | 学习 latent skill | 难解释、可能塌缩 |
| 语言和视频 | 从演示生成阶段描述 | 语义与机器人执行不对齐 |
对操作任务,按对象交互事件划分技能通常比固定时间窗口更可靠,例如接触、抓稳、抬起、释放。
12. 一个厨房长时任务
任务:“把杯子放进洗碗机并关门。”
| 阶段 | 高层输出 | 低层策略 | 完成条件 | 恢复 |
|---|---|---|---|---|
| 定位 | 找到杯子 | 移动相机或机械臂 | 杯子置信度足够 | 换视角搜索 |
| 抓取 | 抓杯子 | 接近、闭合夹爪 | 抓稳且未滑动 | 重新放置并抓取 |
| 运输 | 移动到洗碗机 | 避障轨迹 | 到达可放置区域 | 重新规划路径 |
| 放置 | 放入架子 | 柔顺放置 | 杯子稳定且释放 | 调整姿态 |
| 关门 | 抓门并关闭 | 接触与力控 | 门状态关闭 | 重新定位把手 |
这个表揭示了长时系统需要不同的观测、策略、完成检测和恢复机制,而不是一段无限长 Action Chunk。
13. 主要失败模式
| 失败 | 表现 | 诊断 |
|---|---|---|
| 错误分解 | 子目标顺序不可行 | 任务图和前置条件 |
| 语义落地失败 | 语言指向错误对象 | 对象绑定与干预 |
| 技能接口不连续 | 阶段切换动作跳变 | 状态和动作边界 |
| 完成检测错误 | 过早或过晚切换 | 事件标签和传感器 |
| 记忆污染 | 错误演示降低表现 | 门控、置信度、回滚 |
| 模型规划幻觉 | 子目标视觉合理但不可执行 | 真实 rollout 和可达性 |
14. 可信评测
- 长时成功: 整任务成功率与平均完成阶段。
- 阶段成功: 每个技能的成功率和转移失败。
- 恢复: 扰动后恢复率、恢复时间和回退层级。
- 组合泛化: 已见技能的新顺序、新对象和新环境。
- 记忆: 正演示、无关演示和错误演示的影响。
- 规划证据: 有无世界模型、价值和搜索的消融。
- 控制边界: 阶段切换处的延迟、力峰值和动作连续性。
15. 本课练习
- 为一个五阶段任务定义 Option 的启动集、策略和终止条件。
- 比较语言子目标、视觉子目标和状态子目标。
- 画出世界模型、价值、高层规划器和低层 VLA 的接口。
- 设计一个验证“文本思维链是否真正改善闭环恢复”的实验。
- 为测试时记忆设计错误演示和无关演示对照。
- 把 π0.7 和 WAM-TTT 分别放入本路线,说明它们连接了哪些其他路线。
16. 最小实验:分层是否真的改善长时闭环
在一个可重置的五阶段桌面或厨房仿真任务中,固定低层抓取、移动和放置技能,只改变高层系统。
- 比较单一长 Action Chunk、固定任务图、高层策略选择 Option、世界模型加价值排序四种系统。
- 在第三阶段随机移动目标物体或让抓取失败,测试从局部阶段恢复而非整任务重启。
- 固定每个低层技能成功率,扫描终止检测的误报和漏报。
- 分别提供正确、无关和错误的上下文演示,测试记忆门控与回滚。
- 报告整任务成功率、平均完成阶段、恢复率、技能切换延迟和切换处力峰值。
- 固定模型调用次数和低层控制预算,区分分层结构收益与额外计算收益。
17. 论文事实、作者解释与课程判断
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Options | 用启动集、内部策略和终止函数形式化持续多步的时间抽象 | 时间抽象可支持层级强化学习和技能复用 | 形式化接口仍需解决技能从何而来、终止如何监督及真实切换稳定性 |
| SayCan | 将语言模型给出的技能可用性与机器人价值或 affordance 分数结合排序 | 语言知识与物理可行性结合可完成长时任务 | 证明的是特定技能库上的组合能力,不等同于自动发现技能或解决低层接触 |
| Inner Monologue / 闭环具身推理 | 把环境反馈重新写入语言规划上下文并重规划 | 持续反馈可改善长时计划执行 | 必须与无文本但同等状态反馈的规划器对照,才能识别语言推理本身的贡献 |
| π0.7 | 通用 VLA 支持视觉子目标等自动提示形式以增强任务可控性 | 模型可自动形成更有效的层级条件 | 主归属仍是 VLA;本路线关注子目标生成、完成检测和低层接口 |
| WAM-TTT | 利用人类侧上下文在测试时写入快速记忆,并以机器人任务监督更新机制 | 人类演示可在测试时帮助机器人适应新环境 | 关键证据是严格留出的环境、错误演示对照、更新稳定性和回滚能力 |

