跳到正文

飞书原文 · 源修订 12

💡

机制课: 机器人需要记住当前任务进度、过去失败、对象位置和新演示。本课比较上下文记忆、外部记忆、参数适配与快速权重,并重点解释测试时训练和 WAM-TTT。

学习目标 ​

完成本课后,应能区分工作记忆、情节记忆、外部检索和快速权重;写出测试时适配的 inner/outer loop;分析记忆污染、遗忘和人机对齐;设计错误演示、无关演示和安全门控实验。

1. 为什么需要记忆 ​

单帧观测无法回答:

  • 哪个物体已经处理。
  • 夹爪是否刚刚滑动。
  • 之前尝试过哪种抓法。
  • 用户刚刚演示了什么。
  • 当前环境与训练环境有什么新差异。

记忆把历史信息压缩成当前决策条件。

2. 四种记忆 ​

记忆载体更新风险
上下文记忆历史 token / hidden state每步上下文长度和遗忘
外部记忆轨迹库、对象图、数据库显式写入检索错误和过期
参数记忆模型权重训练时更新慢
快速权重可塑参数或 adapter测试时污染与灾难遗忘

3. 上下文记忆 ​

策略:

读法: 当前动作从以最近 L 步观测、过去 L 步动作和任务目标为条件的策略分布中采样。

推导: 部分可观测环境中,单帧无法确定被遮挡对象、任务阶段和动作后果;把有限历史窗口加入条件能恢复部分状态信息,但窗口之外的关键事件会被截断,计算量也随 L 增长。

有限窗口简单,但早期任务状态可能被截断。RNN/Transformer hidden state 可以持续汇总,却难验证具体记住了什么。

4. 外部情节记忆 ​

检索与当前状态相似的经验:

读法: 在记忆库 M 中,选择键 k_i 与当前观测和任务编码最相似的记忆项 m_i。

推导: 编码器 E 把当前情境映射为查询向量,检索器用相似度排序历史经验。若键只编码外观,相似图像可能对应不同质量、接触或任务阶段,因此可靠检索还应包含对象身份、本体状态和失败原因。

将检索到的轨迹、失败原因或恢复技能作为策略条件。相似视觉不一定意味着相同物理状态,需要对象、任务阶段和本体 metadata。

课程画板

5. 测试时适应的双层优化 ​

Inner loop 用当前环境数据更新快速参数:

读法: 更新规则 U_eta 根据原始快速参数 phi 和当前上下文数据,产生适配后的参数 phi prime。

推导: inner loop 把演示、无标签视频或交互反馈压缩进快速权重。U_eta 可以是一到数步梯度下降、学习出的优化器或显式记忆写入器;关键是更新范围受控且可以回滚。

Outer loop 用机器人任务结果优化更新规则:

读法: 选择更新规则 eta,使它读取上下文数据 D_c 后,在独立机器人任务数据 D_r 上的期望损失最小。

推导: outer loop 必须在与写入信号分开的机器人结果上评价更新,否则更新器可能只会降低辅助损失而伤害控制。对任务和环境分布取期望,才训练出可跨情境泛化的“怎样更新”。

关键不是 inner loss 本身下降,而是更新后机器人任务表现提高。

公式可视化|测试时适应的 Inner Loop 与 Outer Loop ​

课程画板

6. 测试时训练信号 ​

信号优点风险
视频预测无需动作标签外观适配不等于行为适配
对比一致性利用多视角/时间任务相关性弱
伪动作连接状态变化伪标签偏差
人类演示任务和环境特定跨本体对齐
机器人失败匹配部署分布安全和错误写入

7. WAM-TTT 的机制 ​

World-Action Model 学习视觉、潜在动作与机器人动作的共享结构。测试时人类视频写入 fast-weight memory,机器人策略读取更新后的记忆。

Meta-training 需要:

  • Inner loop 只看人类侧信号。
  • Outer loop 用机器人动作任务判断更新是否有用。
  • 训练环境包含人类与机器人任务对应关系。

如果人机任务同步或阶段对齐不成立,记忆可能写入错误行为。

8. 记忆门控 ​

不是所有经验都应该写入。门控概率:

读法: 门控模型根据候选经验 x、不确定性 u 和当前任务 g,估计允许写入记忆的概率。

推导: 把写入决定表示为二元变量 w,可用正确性、任务相关性、安全性和回滚收益监督门控。高不确定性不必然意味着拒绝写入,但应触发更保守的验证或沙盒适配。

应考虑:

  • 演示是否与当前任务相关。
  • 模型是否理解对象和阶段。
  • 更新后小规模验证是否改善。
  • 是否可以回滚。
  • 安全边界是否保持。

9. 记忆污染与遗忘 ​

问题表现应对
错误演示快速适配后能力下降置信门控、对照验证
无关演示记忆干扰当前任务任务路由与隔离
连续用户偏好互相覆盖用户级 adapter
长期任务早期信息遗忘外部状态图
写入过多推理成本和检索噪声压缩、淘汰和摘要

10. 记忆的评测 ​

  1. 无演示基线。
  2. 正确演示。
  3. 无关演示。
  4. 错误演示。
  5. 任务阶段打乱。
  6. 对象相同但任务不同。
  7. 适配后旧任务保持。
  8. 更新回滚与安全门控。

11. 最小实验:写入记忆是否真正改善机器人任务 ​

选择一个包含新对象位置、新背景或新操作者习惯的操作任务,把同一基础策略复制为无适配、上下文窗口、外部检索、快速权重四种系统。固定基础模型、机器人训练数据、测试时可见帧数、更新步数和总推理时间。

  1. 分别提供正确演示、无关演示、错误演示、阶段打乱演示和同对象不同任务演示。
  2. 把用于写入的上下文与用于评价的机器人 rollout 严格分开。
  3. 比较全参数更新、受限层更新、显式 memory token 和只读检索。
  4. 适配后重新评测旧任务,测量遗忘和跨任务污染。
  5. 对高风险动作启用影子评估、门控拒绝和一键回滚。

最低报告项: 适配前后成功率、达到同等提升所需上下文量、错误演示造成的性能下降、无关演示敏感度、旧任务保持率、门控精确率与召回率、回滚后恢复程度、更新计算与延迟。

12. 本课练习 ​

  1. 为长时整理任务设计工作记忆字段。
  2. 比较上下文 memory 和参数适配。
  3. 写出 inner/outer loop 的数据边界。
  4. 设计错误演示的安全实验。
  5. 说明检索相似度为何需要任务和本体条件。
  6. 解释 WAM-TTT 的人机同步假设。

13. 主要失败模式 ​

失败表现诊断与修正
记忆截断长时任务早期信息离开上下文窗口后被忘记显式任务状态、摘要记忆或外部事件日志
检索错配找到外观相似但物理状态或任务阶段不同的经验把对象、任务、本体与失败原因加入键,并报告检索命中质量
错误演示污染一次错误或对抗演示持续降低后续控制写入门控、独立验证集、影子更新和可回滚快照
辅助目标投机测试时 loss 下降,但机器人成功率下降outer loop 使用独立机器人结果,报告 loss 与任务收益相关性
灾难性遗忘适应新环境后旧任务或安全技能退化限制更新参数、正则化、旧任务回放和保持率评测
人机阶段错位人类视频展示的阶段与机器人当前需求不同事件对齐、任务谓词校验和阶段打乱对照
更新漂移连续多个 episode 写入后参数逐渐离开安全区域更新范数、版本链、周期重置和最大适配预算
隐私与数据残留外部记忆保存不应长期保留的人类或环境信息最小化存储、过期策略、访问控制和可删除性

14. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
MAML通过跨任务元优化,学习能用少量梯度步骤快速适配的初始化训练目标可以直接塑造模型的可适应性它提供双层优化地基,但真实机器人还需处理更新安全、数据相关性和在线计算成本
Test-Time Training在测试样本上用自监督辅助任务更新模型,再执行主任务预测测试分布自身可以提供适应信号辅助 loss 下降不是控制改善的充分证据;机器人必须在独立 rollout 上验证收益与安全
RoboCat统一多机器人与多任务数据,并展示用新任务演示进行后续训练和数据自增强通用机器人智能体可以通过新经验持续扩展能力这更接近离线或阶段式自改进,不应与单 episode 内的测试时快速权重混为一谈
WAM-TTT用人类侧上下文在测试时写入快速记忆,并以机器人动作任务监督更新机制人类演示可以帮助机器人适应当前环境或任务关键审计项是人机任务对应、严格留出环境、错误演示对照、更新稳定性和回滚能力

15. 课程交叉阅读 ​

D0|分层规划、技能与记忆

D2|子目标规划与具身推理

人类视频没有速度标签,机器人如何学习运动

E1|视频运动与对象中心表征

G2|数据引擎、复现与版本

文章正文采用 Apache License 2.0