跳到正文

飞书原文 · 源修订 9

🔬

论文实验室: 用“时间抽象、子目标表示、记忆更新、闭环恢复”统一比较传统层级 RL 与新型 VLA 分层系统。

统一比较框架 ​

维度问题
高层变量Option、语言、图像、技能 token 还是 latent
低层策略RL、模仿、VLA 或控制器
终止固定时长、学习终止或完成检测
未来预测无模型、价值或世界模型
记忆上下文、外部、参数或快速权重
证据长时成功、组合泛化、恢复和真实机器人

1. Options 与 Option-Critic ​

Options 给出严格的启动、内部策略和终止定义。Option-Critic 端到端学习这些组件,代表“从 RL 中学习时间抽象”的路线。

优势是数学定义清晰;挑战是自动发现的技能可能不可解释、与任务无关或频繁切换。

2. Feudal / Goal-Conditioned Hierarchy ​

高层输出状态空间或 latent 子目标,低层策略负责到达。关键问题是子目标是否可实现、是否跨任务复用,以及高层时间尺度如何选择。

3. 文本规划与具身思维链 ​

VLM 生成语言子任务或推理链,低层机器人策略执行。与传统 Options 相比,高层变量具有语义和可解释性,但缺少明确启动、终止和物理可达性。

决定性实验必须检查闭环反馈,而不只是文本计划看起来合理。

4. π0.5 的层级推理 ​

π0.5 将高层语义、异构共训练和低层动作连接。它展示了语言子任务与 VLA 的组合,但不能自动证明模型拥有显式长期规划或因果世界模型。

5. π0.7 的 Prompt 与视觉子目标 ​

π0.7 使用多样 Prompt 和生成视觉子目标,提高策略可操控性。它同时连接:

  • VLA:低层动作生成。
  • 世界模型:生成未来视觉。
  • 分层规划:高层 Prompt 和子目标。
  • 数据路线:利用带 metadata 的混合质量数据。

需要验证视觉目标是否可达、低层策略是否真正使用目标、失败时是否重新生成。

6. WAM-TTT ​

WAM-TTT 通过测试时训练让人类视频写入 fast-weight memory。其创新点是 inner loop 只使用人类侧信号,outer loop 用机器人动作任务监督更新规则。

关键假设包括人机任务对应、时间/事件对齐和记忆安全。

7. 方法对比 ​

方法高层变量终止记忆主要风险
Options离散技能显式 β通常无技能发现
Goal-conditioned状态/latent goal到达判断可选子目标不可达
文本计划语言完成检测上下文物理落地
π0.7多样 Prompt/视觉目标闭环策略上下文目标幻觉
WAM-TTT人类演示写入 memory任务策略快速权重记忆污染

8. 统一实验协议 ​

  1. 同一长时任务和低层策略。
  2. 比较无层级、固定任务图、学习 Option、语言子目标和视觉子目标。
  3. 加入中间扰动和失败恢复。
  4. 留出技能组合和任务顺序。
  5. 为记忆加入正确、无关和错误演示。
  6. 报告阶段成功、切换错误、恢复率和整任务成功。

9. 本实验室作业 ​

实验室加深|统一公式、可视化与复现 ​

把 Options、具身思维链、π0.7 与 WAM-TTT 放在同一分层决策框架中。高层变量 可以是 option、语言步骤、视觉子目标或记忆检索结果;低层策略执行:

读法: 在高层条件 z_k 保持有效期间,低层动作从以当前观测和该高层条件为输入的策略分布中采样。

推导: 无论 z_k 是 Option、语言步骤、视觉子目标还是检索记忆,低层接口都可以统一为条件策略。比较不同路线时固定 pi_low,才能把性能差异主要归因于高层表示、选择和终止机制。

高层在较慢时间尺度更新:

读法: 在第 k 个高层决策边界,高层策略根据历史状态、总任务目标和当前记忆选择新的高层条件 z_k。

推导: 高层只在边界 t_k 更新,而不是每个电机周期更新。把任务历史 h、目标 g 和记忆 m 放进条件,可统一表达任务图选择、语言重规划、视觉目标生成和测试时记忆读取。

读作:“高层根据历史、目标和记忆选择下一段可执行条件,低层把它变成连续动作。”比较论文时要问:子目标是否可达、何时终止、失败能否被检测、记忆在推理时是否真的改变行为。

最小实验:统一复现协议 ​

选择一个至少五阶段、允许中途移动对象或制造抓取失败的任务。固定低层策略、训练数据、视觉编码器、控制频率、模型调用上限和真实机器人交互步数,只替换高层为固定任务图、学习 Option、语言子目标、视觉子目标和测试时记忆五种机制。

最低报告项: 整任务成功率、平均完成阶段、非法子目标率、终止误报与漏报、切换延迟、局部恢复率、未见技能组合成功率、规划调用次数、适配计算量,以及同一失败分别归因于高层、低层、接口或完成检测的比例。

  1. 选择一个必须经过 5 个以上阶段且允许中途扰动的任务。
  2. 比较单层策略、固定任务图、学习 option、语言计划与视觉子目标。
  3. 控制低层策略相同,只替换高层表示和终止机制。
  4. 报告阶段完成率、错误恢复、重复循环、规划调用和最终成功率。

实验室练习 ​

  1. 写出 option 的启动集合、内部策略和终止函数。
  2. 解释语言计划“看起来正确”为什么不代表子目标可执行。
  3. 设计一个证明 WAM-TTT 使用当前演示而不是任务名称的干预。
  4. 比较 π0.7 视觉子目标与显式世界模型规划的边界。
  5. 给五种方法画模块边界。
  6. 为 π0.7 补写启动和完成条件。
  7. 把 WAM-TTT 写成 inner/outer loop 伪代码。
  8. 设计验证文本 CoT 是否改善真实闭环的消融。
  9. 比较视觉子目标与状态子目标。
  10. 写出每篇论文真正证明和未证明的主张。

主要失败模式 ​

失败表现统一诊断
比较不公平某路线使用更强低层、更长上下文或更多模型调用固定低层、数据、交互步数、延迟和推理预算
高层变量不可达语言或视觉子目标合理但低层无法实现前置条件、可达性检测和条件成功率
终止机制缺失子目标完成后不切换,或未完成就推进统一报告终止精确率、召回率和切换时刻误差
低层掩盖高层强低层直接完成任务,看不出高层变量是否被使用高层条件置换、遮蔽和反事实干预
文本或视觉解释旁路中间表示变化但动作不变在同一观测下干预 z_k,测量动作和结果变化
记忆污染错误演示让测试时适配持续退化错误与无关演示、门控、版本快照和回滚
只报平均成功率无法知道失败来自规划、执行、接口还是验证按阶段和模块拆分证据链,并报告置信区间

论文事实、作者解释与课程判断 ​

路线论文事实作者解释课程判断
Options / Option-Critic形式化跨多步动作,并可学习内部策略与终止时间抽象能缩短决策链并发现技能数学接口最清楚,但自动技能仍可能塌缩、不可解释或难以跨任务组合
具身语言规划SayCan、Inner Monologue 等把语言先验、可执行性与环境反馈用于技能级规划语言知识和闭环反馈可支持长时任务必须区分文本生成能力、技能库覆盖和真实物理闭环收益
π0.7通用 VLA 使用多样条件和视觉子目标等形式增强可操控性更丰富的高层条件可改善开放世界任务执行主归属仍是 VLA;本实验室只审计子目标可达性、使用性、完成检测和恢复
WAM-TTT人类侧上下文在测试时写入快速记忆,机器人任务监督更新机制测试时人类演示可帮助机器人适应需要严格留出、阶段对齐、错误演示对照以及可回滚证据

课程交叉阅读 ​

D0|分层规划、技能与记忆

D1|Options、技能与层级强化学习

D2|子目标规划与具身推理

D3|记忆与测试时适应

π0.7:视觉子目标与自动 Prompt

文章正文采用 Apache License 2.0