飞书原文 · 源修订 9
🔬
论文实验室: 用“时间抽象、子目标表示、记忆更新、闭环恢复”统一比较传统层级 RL 与新型 VLA 分层系统。
统一比较框架
| 维度 | 问题 |
|---|---|
| 高层变量 | Option、语言、图像、技能 token 还是 latent |
| 低层策略 | RL、模仿、VLA 或控制器 |
| 终止 | 固定时长、学习终止或完成检测 |
| 未来预测 | 无模型、价值或世界模型 |
| 记忆 | 上下文、外部、参数或快速权重 |
| 证据 | 长时成功、组合泛化、恢复和真实机器人 |
1. Options 与 Option-Critic
Options 给出严格的启动、内部策略和终止定义。Option-Critic 端到端学习这些组件,代表“从 RL 中学习时间抽象”的路线。
优势是数学定义清晰;挑战是自动发现的技能可能不可解释、与任务无关或频繁切换。
2. Feudal / Goal-Conditioned Hierarchy
高层输出状态空间或 latent 子目标,低层策略负责到达。关键问题是子目标是否可实现、是否跨任务复用,以及高层时间尺度如何选择。
3. 文本规划与具身思维链
VLM 生成语言子任务或推理链,低层机器人策略执行。与传统 Options 相比,高层变量具有语义和可解释性,但缺少明确启动、终止和物理可达性。
决定性实验必须检查闭环反馈,而不只是文本计划看起来合理。
4. π0.5 的层级推理
π0.5 将高层语义、异构共训练和低层动作连接。它展示了语言子任务与 VLA 的组合,但不能自动证明模型拥有显式长期规划或因果世界模型。
5. π0.7 的 Prompt 与视觉子目标
π0.7 使用多样 Prompt 和生成视觉子目标,提高策略可操控性。它同时连接:
- VLA:低层动作生成。
- 世界模型:生成未来视觉。
- 分层规划:高层 Prompt 和子目标。
- 数据路线:利用带 metadata 的混合质量数据。
需要验证视觉目标是否可达、低层策略是否真正使用目标、失败时是否重新生成。
6. WAM-TTT
WAM-TTT 通过测试时训练让人类视频写入 fast-weight memory。其创新点是 inner loop 只使用人类侧信号,outer loop 用机器人动作任务监督更新规则。
关键假设包括人机任务对应、时间/事件对齐和记忆安全。
7. 方法对比
| 方法 | 高层变量 | 终止 | 记忆 | 主要风险 |
|---|---|---|---|---|
| Options | 离散技能 | 显式 β | 通常无 | 技能发现 |
| Goal-conditioned | 状态/latent goal | 到达判断 | 可选 | 子目标不可达 |
| 文本计划 | 语言 | 完成检测 | 上下文 | 物理落地 |
| π0.7 | 多样 Prompt/视觉目标 | 闭环策略 | 上下文 | 目标幻觉 |
| WAM-TTT | 人类演示写入 memory | 任务策略 | 快速权重 | 记忆污染 |
8. 统一实验协议
- 同一长时任务和低层策略。
- 比较无层级、固定任务图、学习 Option、语言子目标和视觉子目标。
- 加入中间扰动和失败恢复。
- 留出技能组合和任务顺序。
- 为记忆加入正确、无关和错误演示。
- 报告阶段成功、切换错误、恢复率和整任务成功。
9. 本实验室作业
实验室加深|统一公式、可视化与复现
把 Options、具身思维链、π0.7 与 WAM-TTT 放在同一分层决策框架中。高层变量 可以是 option、语言步骤、视觉子目标或记忆检索结果;低层策略执行:
读法: 在高层条件 z_k 保持有效期间,低层动作从以当前观测和该高层条件为输入的策略分布中采样。
推导: 无论 z_k 是 Option、语言步骤、视觉子目标还是检索记忆,低层接口都可以统一为条件策略。比较不同路线时固定 pi_low,才能把性能差异主要归因于高层表示、选择和终止机制。
高层在较慢时间尺度更新:
读法: 在第 k 个高层决策边界,高层策略根据历史状态、总任务目标和当前记忆选择新的高层条件 z_k。
推导: 高层只在边界 t_k 更新,而不是每个电机周期更新。把任务历史 h、目标 g 和记忆 m 放进条件,可统一表达任务图选择、语言重规划、视觉目标生成和测试时记忆读取。
读作:“高层根据历史、目标和记忆选择下一段可执行条件,低层把它变成连续动作。”比较论文时要问:子目标是否可达、何时终止、失败能否被检测、记忆在推理时是否真的改变行为。
最小实验:统一复现协议
选择一个至少五阶段、允许中途移动对象或制造抓取失败的任务。固定低层策略、训练数据、视觉编码器、控制频率、模型调用上限和真实机器人交互步数,只替换高层为固定任务图、学习 Option、语言子目标、视觉子目标和测试时记忆五种机制。
最低报告项: 整任务成功率、平均完成阶段、非法子目标率、终止误报与漏报、切换延迟、局部恢复率、未见技能组合成功率、规划调用次数、适配计算量,以及同一失败分别归因于高层、低层、接口或完成检测的比例。
- 选择一个必须经过 5 个以上阶段且允许中途扰动的任务。
- 比较单层策略、固定任务图、学习 option、语言计划与视觉子目标。
- 控制低层策略相同,只替换高层表示和终止机制。
- 报告阶段完成率、错误恢复、重复循环、规划调用和最终成功率。
实验室练习
- 写出 option 的启动集合、内部策略和终止函数。
- 解释语言计划“看起来正确”为什么不代表子目标可执行。
- 设计一个证明 WAM-TTT 使用当前演示而不是任务名称的干预。
- 比较 π0.7 视觉子目标与显式世界模型规划的边界。
- 给五种方法画模块边界。
- 为 π0.7 补写启动和完成条件。
- 把 WAM-TTT 写成 inner/outer loop 伪代码。
- 设计验证文本 CoT 是否改善真实闭环的消融。
- 比较视觉子目标与状态子目标。
- 写出每篇论文真正证明和未证明的主张。
主要失败模式
| 失败 | 表现 | 统一诊断 |
|---|---|---|
| 比较不公平 | 某路线使用更强低层、更长上下文或更多模型调用 | 固定低层、数据、交互步数、延迟和推理预算 |
| 高层变量不可达 | 语言或视觉子目标合理但低层无法实现 | 前置条件、可达性检测和条件成功率 |
| 终止机制缺失 | 子目标完成后不切换,或未完成就推进 | 统一报告终止精确率、召回率和切换时刻误差 |
| 低层掩盖高层 | 强低层直接完成任务,看不出高层变量是否被使用 | 高层条件置换、遮蔽和反事实干预 |
| 文本或视觉解释旁路 | 中间表示变化但动作不变 | 在同一观测下干预 z_k,测量动作和结果变化 |
| 记忆污染 | 错误演示让测试时适配持续退化 | 错误与无关演示、门控、版本快照和回滚 |
| 只报平均成功率 | 无法知道失败来自规划、执行、接口还是验证 | 按阶段和模块拆分证据链,并报告置信区间 |
论文事实、作者解释与课程判断
| 路线 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Options / Option-Critic | 形式化跨多步动作,并可学习内部策略与终止 | 时间抽象能缩短决策链并发现技能 | 数学接口最清楚,但自动技能仍可能塌缩、不可解释或难以跨任务组合 |
| 具身语言规划 | SayCan、Inner Monologue 等把语言先验、可执行性与环境反馈用于技能级规划 | 语言知识和闭环反馈可支持长时任务 | 必须区分文本生成能力、技能库覆盖和真实物理闭环收益 |
| π0.7 | 通用 VLA 使用多样条件和视觉子目标等形式增强可操控性 | 更丰富的高层条件可改善开放世界任务执行 | 主归属仍是 VLA;本实验室只审计子目标可达性、使用性、完成检测和恢复 |
| WAM-TTT | 人类侧上下文在测试时写入快速记忆,机器人任务监督更新机制 | 测试时人类演示可帮助机器人适应 | 需要严格留出、阶段对齐、错误演示对照以及可回滚证据 |

