跳到正文

飞书原文 · 源修订 24

💡

路线总课: Physical AI 的数据不只有机器人轨迹。人类视频、手部骨架、对象变化、语言描述和失败记录都可能提供监督,但它们对应的数学对象不同。本课研究如何从这些数据中学习表征、运动、潜在动作和跨机器人可迁移结构。

学习目标 ​

完成本课后,应能区分观测监督、动作监督、状态变化监督和结果监督;解释人类视频缺少什么信息;从光流、关键点、对象中心表示和逆动力学理解运动学习;设计 Latent Action 与 Behavior Tokenizer;分析跨本体对齐的假设和失败;为人类数据进入 VLA、世界模型和分层策略设计可验证实验。

课程画板

1. 一条数据究竟包含哪些监督 ​

数据可直接观察不能直接观察可以学习的对象
机器人轨迹图像、本体状态、动作、结果专家意图、未执行的反事实动作策略、动力学、价值
人类视频图像、手和物体的变化机器人控制量、真实尺度、力与接触视觉表征、运动结构、潜在动作
语言描述任务和事件语义精确几何和控制时序任务条件、子目标、事件标签
手部骨架关键点位置和拓扑接触力、物体重量、机器人关节映射抓型、相对运动、交互阶段
失败记录状态、动作、结果或接管失败原因的完整因果链恢复策略、价值、数据重加权

“没有动作标签”不等于“没有监督”,但监督往往从直接动作变成状态变化、时序顺序或对象交互结构。

2. 人类视频的观测模型 ​

视频可以写成:

读法: 一段长度 T 的视频观测,由按时间排列的图像帧 I_1 到 I_T 组成。

推导: 相机首先记录的是像素序列,而不是世界坐标、力或机器人动作。后续所有运动、事件和潜在动作监督,都必须从这组观测中估计或借助额外传感器获得。

如果视频中有对象关键点 ,可以计算像素位移:

读法: 第 i 个图像关键点在时刻 t 的像素位移,等于下一帧位置减去当前帧位置。

推导: 关键点跟踪给出相邻帧中的二维坐标,做差即可得到屏幕上的运动方向和幅度。它是观测空间变化,不包含深度尺度、相机运动补偿或物理单位。

但像素位移不是物理速度:

读法: 世界坐标中的物理速度,不能等同于像素位移除以时间。

推导: 透视投影把三维位置压到二维像素;同样的世界速度会因深度、焦距和相机运动产生不同像素速度。只有在完成相机标定、深度估计和运动补偿后,才能把像素变化转换为有物理单位的速度估计。

因为相机运动、深度、焦距、遮挡和透视都会改变像素变化。单目视频通常只能得到相对运动或方向线索,不能直接得到机器人末端速度和力矩。

2.1 从图像到运动表征 ​

表示保留信息主要歧义
像素光流局部视觉运动相机运动与深度
人体关键点身体和手部几何遮挡、尺度、3D 深度
对象中心轨迹对象相对位移和交互对象身份和接触
视频 latent时序和语义结构解释性和控制可用性
事件标签接触、抓稳、释放等阶段标签边界与标注成本

3. 手-物交互与对象中心表示 ​

机器人更需要“手相对于物体做了什么”,而不是“整幅图像发生了多少像素变化”。对象中心表示可以写成:

读法: 手-物关系由对象坐标系中的相对位置、相对姿态和相对速度组成。

推导: 先用位置差得到手相对对象的平移,再乘对象旋转矩阵的转置,把该向量表达在对象坐标系;同理,相对旋转为对象姿态的逆乘手姿态。这样能消除场景绝对位置变化,更直接描述抓取、插入和旋转关系。

它包含相对位置、相对姿态和相对速度。相对表示对相机平移和跨场景绝对坐标变化更稳健,也更接近抓取、插入、旋转等任务的控制变量。

3.1 接触不是一个像素点 ​

交互表示至少需要考虑接触位置、接触法向、法向力、切向滑动和对象形变。视觉视频常只能提供接触事件的弱线索,需要与力觉、触觉或动作结果联合学习。

4. 从视频学习运动但不直接伪造机器人动作 ​

有三条常见路线:

路线监督目标机器人如何使用主要假设
视频预测根据过去视频帧预测下一帧或未来状态学习未来视觉和子目标视觉未来与任务未来相关
时序/对比学习正确顺序、相邻片段或跨视角一致性预训练运动表征表示能迁移到机器人任务
逆动力学根据相邻状态变化反推可能的机器人动作从状态变化反推潜在动作状态变化足以识别动作
潜在动作由相邻观测推断解释状态变化的潜在行为变量把视频变化编码成行为 token潜在动作跨本体有共享语义

关键区分是:视频可以教机器人“发生了什么变化”或“下一步应该朝哪里”,但不自动教机器人“用多大力、以什么关节轨迹和控制频率执行”。

5. Latent Action:从状态变化反推动作变量 ​

如果真实动作不可见,可以引入潜在变量:

读法: 推断模型根据相邻观测估计潜在动作 z_t,生成模型再根据当前观测和该潜在动作预测下一观测。

推导: 真实动作不可见时,可把造成状态变化的因素设为潜变量。编码器从观测对反推 z_t,解码器要求 z_t 足以解释下一状态;但任意可逆重参数化都可能得到相同预测,因此还需对象、事件或机器人动作提供语义约束。

表示导致状态变化的潜在行为。训练可以同时要求:

  • 从当前观测和 latent action 预测下一观测。
  • 相似的状态变化得到相近 latent。
  • 不同的功能事件保持可区分。
  • 机器人动作可以条件于同一 latent 产生对应变化。

但 latent action 存在不可辨识性:多个 latent 变换可以产生同样的观测预测。需要对象、时间、接触、任务结果或机器人数据提供额外约束。

6. Behavior Tokenizer 不是普通压缩器 ​

Tokenizer 把行为轨迹映射为 token:

读法: 行为 Tokenizer T 把连续轨迹 tau 编码成长度 M 的离散或连续 token 序列。

推导: 轨迹包含大量高频细节,Tokenizer 用较短序列压缩可重复的运动和事件结构。若 token 还要用于规划与跨本体复用,就不能只追求压缩率,还需保留对象变化、接触边界和任务功能。

好的行为 token 需要同时满足:

  • 重建轨迹时保留控制相关信息。
  • 相同功能行为跨速度和尺度有一定稳定性。
  • 不同功能阶段可以区分。
  • 可被语言、视觉或世界模型预测。
  • 解码后能被目标机器人执行或适配。

最低限度的重建损失:

读法: 重建损失是原轨迹与 Tokenizer 编码后再由解码器还原的轨迹之间平方误差的期望。

推导: 先用 T 把轨迹压缩为 token,再用 D 重建;最小化误差可防止 token 丢失所有运动信息。但低重建误差可能只保存抖动和绝对坐标,因此还需事件、任务、跨视角或下游控制目标约束语义。

但重建误差低不等于行为语义正确。Tokenizer 可能精确记录手腕抖动,却丢失“抓稳”和“释放”的事件边界。

7. 跨本体对齐:什么可以共享,什么必须保留差异 ​

可共享层原因仍需保留的本体差异
对象、动作意图和事件任务语义相对稳定可达性和抓取几何
相对位移和方向比绝对坐标更可迁移尺度、速度和动力学
技能阶段抓取、运输、释放具有共性关节数、末端形状和控制接口
视觉场景表征互联网数据规模大视角、传感器和任务相关细节
语言条件任务描述共享机器人能力和安全约束

跨本体学习的目标不是让人类和机器人动作数值相等,而是寻找可以在不同执行器上重新解释的中间变量。

8. 人类视频如何进入 VLA、世界模型和分层策略 ​

路线人类数据提供什么如何接入
VLA对象、语言、动作阶段和视觉先验预训练、辅助任务、latent action 条件
世界模型状态变化和未来视觉视频预测、潜在动力学、未来子目标
分层策略任务顺序、事件和技能边界高层计划、技能 token、记忆
价值学习偏好和结果比较奖励模型、成功预测和数据筛选
控制相对运动和接触阶段目标轨迹、阻抗参数和参考动作

9. 最小实验:人类视频是否真正改善跨本体策略 ​

固定同一机器人策略架构和机器人轨迹数量,比较只用机器人数据、加入原始人类视频、加入对象中心运动表征、加入 latent action、加入 behavior token 五种训练方式。人类侧数据量相同,留出新视角、新对象、新操作者和新机器人本体。

最低报告项: 机器人闭环成功率、少样本适配曲线、对象与阶段线性探针、未见本体迁移、接触任务滑动率与力峰值、人类视频时间打乱消融、外观替换消融,以及相同机器人数据量下的净收益。

人类视频展示“手拿杯子移动到架子”,机器人使用机械臂完成同一功能。

对照监督检验
只用机器人动作直接行为克隆基础成功率
加入人类视觉预训练视频时序表征新对象和新视角
加入对象相对轨迹手-物交互中间变量跨相机和尺度
加入 latent action状态变化条件少量机器人适配
加入事件/技能标签高层阶段监督长时组合和恢复

必须用等量机器人数据和任务留出,避免把数据规模或对象重复误认为跨本体表征收益。

10. 主要失败模式 ​

  • 把人类像素速度直接当作机器人控制速度。
  • 把共同词表误认为共同动作语义。
  • latent action 只编码视频外观,不编码可控变化。
  • 对象检测正确,但接触阶段和力学状态缺失。
  • 人类和机器人任务时间不同,却强行逐帧对齐。
  • 只报告表征相似度,不报告机器人闭环收益。

11. 可信评测 ​

  1. 表示线性探针:对象、阶段、相对运动是否可预测。
  2. 跨视角、跨尺度和跨本体任务留出。
  3. 少样本机器人适配效率。
  4. 动作生成的功能成功率,而非只看重建误差。
  5. 接触任务的恢复率、力峰值和滑动率。
  6. 人类视频移除、时间打乱和对象替换消融。

12. 本课练习 ​

  1. 为人类视频列出可观测量、不可观测量和可学习中间变量。
  2. 推导逆动力学条件概率与视频预测条件概率的区别。
  3. 设计一个能区分“像素预测收益”和“控制收益”的实验。
  4. 为跨机器人 Behavior Tokenizer 定义训练目标与失败模式。
  5. 用手-物相对位姿表示一个抓取阶段,并说明为什么比绝对像素更稳健。
  6. 解释 WAM-TTT、人类视频和 VLA 之间的交叉关系。

13. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
R3M从大规模第一视角人类视频预训练视觉表征,并在多类机器人下游任务中评测人类视频中的交互结构可以形成可迁移的机器人视觉表示证明的是表征预训练收益,不等于视频直接提供机器人动作或接触力
MimicPlay利用人类 play 视频提供高层引导,再用少量机器人演示学习低层操作人类行为先验可以帮助长时机器人模仿学习关键桥梁是高层运动或目标条件与机器人低层数据的组合,不能把收益全部归因于跨本体动作对齐
XSkill研究从人类与机器人视频中发现跨本体技能,并用于下游模仿共享技能表征可以连接不同执行身体必须检查技能是否保留任务功能、事件边界和对象状态,而非只在 embedding 中接近
Open X-Embodiment汇集多机器人、多任务数据并训练跨本体策略模型统一数据格式和大规模异构共训练可提升泛化共享语义不要求动作数值统一;机器人身份、动作空间和控制频率仍需显式保留

E1|视频运动与对象中心表征

E2|Latent Action 与逆动力学

E3|Behavior Tokenizer

E4|跨本体对齐与异构共训练

文章正文采用 Apache License 2.0