飞书原文 · 源修订 24
💡
路线总课: Physical AI 的数据不只有机器人轨迹。人类视频、手部骨架、对象变化、语言描述和失败记录都可能提供监督,但它们对应的数学对象不同。本课研究如何从这些数据中学习表征、运动、潜在动作和跨机器人可迁移结构。
学习目标
完成本课后,应能区分观测监督、动作监督、状态变化监督和结果监督;解释人类视频缺少什么信息;从光流、关键点、对象中心表示和逆动力学理解运动学习;设计 Latent Action 与 Behavior Tokenizer;分析跨本体对齐的假设和失败;为人类数据进入 VLA、世界模型和分层策略设计可验证实验。

1. 一条数据究竟包含哪些监督
| 数据 | 可直接观察 | 不能直接观察 | 可以学习的对象 |
|---|---|---|---|
| 机器人轨迹 | 图像、本体状态、动作、结果 | 专家意图、未执行的反事实动作 | 策略、动力学、价值 |
| 人类视频 | 图像、手和物体的变化 | 机器人控制量、真实尺度、力与接触 | 视觉表征、运动结构、潜在动作 |
| 语言描述 | 任务和事件语义 | 精确几何和控制时序 | 任务条件、子目标、事件标签 |
| 手部骨架 | 关键点位置和拓扑 | 接触力、物体重量、机器人关节映射 | 抓型、相对运动、交互阶段 |
| 失败记录 | 状态、动作、结果或接管 | 失败原因的完整因果链 | 恢复策略、价值、数据重加权 |
“没有动作标签”不等于“没有监督”,但监督往往从直接动作变成状态变化、时序顺序或对象交互结构。
2. 人类视频的观测模型
视频可以写成:
读法: 一段长度 T 的视频观测,由按时间排列的图像帧 I_1 到 I_T 组成。
推导: 相机首先记录的是像素序列,而不是世界坐标、力或机器人动作。后续所有运动、事件和潜在动作监督,都必须从这组观测中估计或借助额外传感器获得。
如果视频中有对象关键点 ,可以计算像素位移:
读法: 第 i 个图像关键点在时刻 t 的像素位移,等于下一帧位置减去当前帧位置。
推导: 关键点跟踪给出相邻帧中的二维坐标,做差即可得到屏幕上的运动方向和幅度。它是观测空间变化,不包含深度尺度、相机运动补偿或物理单位。
但像素位移不是物理速度:
读法: 世界坐标中的物理速度,不能等同于像素位移除以时间。
推导: 透视投影把三维位置压到二维像素;同样的世界速度会因深度、焦距和相机运动产生不同像素速度。只有在完成相机标定、深度估计和运动补偿后,才能把像素变化转换为有物理单位的速度估计。
因为相机运动、深度、焦距、遮挡和透视都会改变像素变化。单目视频通常只能得到相对运动或方向线索,不能直接得到机器人末端速度和力矩。
2.1 从图像到运动表征
| 表示 | 保留信息 | 主要歧义 |
|---|---|---|
| 像素光流 | 局部视觉运动 | 相机运动与深度 |
| 人体关键点 | 身体和手部几何 | 遮挡、尺度、3D 深度 |
| 对象中心轨迹 | 对象相对位移和交互 | 对象身份和接触 |
| 视频 latent | 时序和语义结构 | 解释性和控制可用性 |
| 事件标签 | 接触、抓稳、释放等阶段 | 标签边界与标注成本 |
3. 手-物交互与对象中心表示
机器人更需要“手相对于物体做了什么”,而不是“整幅图像发生了多少像素变化”。对象中心表示可以写成:
读法: 手-物关系由对象坐标系中的相对位置、相对姿态和相对速度组成。
推导: 先用位置差得到手相对对象的平移,再乘对象旋转矩阵的转置,把该向量表达在对象坐标系;同理,相对旋转为对象姿态的逆乘手姿态。这样能消除场景绝对位置变化,更直接描述抓取、插入和旋转关系。
它包含相对位置、相对姿态和相对速度。相对表示对相机平移和跨场景绝对坐标变化更稳健,也更接近抓取、插入、旋转等任务的控制变量。
3.1 接触不是一个像素点
交互表示至少需要考虑接触位置、接触法向、法向力、切向滑动和对象形变。视觉视频常只能提供接触事件的弱线索,需要与力觉、触觉或动作结果联合学习。
4. 从视频学习运动但不直接伪造机器人动作
有三条常见路线:
| 路线 | 监督目标 | 机器人如何使用 | 主要假设 |
|---|---|---|---|
| 视频预测 | 根据过去视频帧预测下一帧或未来状态 | 学习未来视觉和子目标 | 视觉未来与任务未来相关 |
| 时序/对比学习 | 正确顺序、相邻片段或跨视角一致性 | 预训练运动表征 | 表示能迁移到机器人任务 |
| 逆动力学 | 根据相邻状态变化反推可能的机器人动作 | 从状态变化反推潜在动作 | 状态变化足以识别动作 |
| 潜在动作 | 由相邻观测推断解释状态变化的潜在行为变量 | 把视频变化编码成行为 token | 潜在动作跨本体有共享语义 |
关键区分是:视频可以教机器人“发生了什么变化”或“下一步应该朝哪里”,但不自动教机器人“用多大力、以什么关节轨迹和控制频率执行”。
5. Latent Action:从状态变化反推动作变量
如果真实动作不可见,可以引入潜在变量:
读法: 推断模型根据相邻观测估计潜在动作 z_t,生成模型再根据当前观测和该潜在动作预测下一观测。
推导: 真实动作不可见时,可把造成状态变化的因素设为潜变量。编码器从观测对反推 z_t,解码器要求 z_t 足以解释下一状态;但任意可逆重参数化都可能得到相同预测,因此还需对象、事件或机器人动作提供语义约束。
表示导致状态变化的潜在行为。训练可以同时要求:
- 从当前观测和 latent action 预测下一观测。
- 相似的状态变化得到相近 latent。
- 不同的功能事件保持可区分。
- 机器人动作可以条件于同一 latent 产生对应变化。
但 latent action 存在不可辨识性:多个 latent 变换可以产生同样的观测预测。需要对象、时间、接触、任务结果或机器人数据提供额外约束。
6. Behavior Tokenizer 不是普通压缩器
Tokenizer 把行为轨迹映射为 token:
读法: 行为 Tokenizer T 把连续轨迹 tau 编码成长度 M 的离散或连续 token 序列。
推导: 轨迹包含大量高频细节,Tokenizer 用较短序列压缩可重复的运动和事件结构。若 token 还要用于规划与跨本体复用,就不能只追求压缩率,还需保留对象变化、接触边界和任务功能。
好的行为 token 需要同时满足:
- 重建轨迹时保留控制相关信息。
- 相同功能行为跨速度和尺度有一定稳定性。
- 不同功能阶段可以区分。
- 可被语言、视觉或世界模型预测。
- 解码后能被目标机器人执行或适配。
最低限度的重建损失:
读法: 重建损失是原轨迹与 Tokenizer 编码后再由解码器还原的轨迹之间平方误差的期望。
推导: 先用 T 把轨迹压缩为 token,再用 D 重建;最小化误差可防止 token 丢失所有运动信息。但低重建误差可能只保存抖动和绝对坐标,因此还需事件、任务、跨视角或下游控制目标约束语义。
但重建误差低不等于行为语义正确。Tokenizer 可能精确记录手腕抖动,却丢失“抓稳”和“释放”的事件边界。
7. 跨本体对齐:什么可以共享,什么必须保留差异
| 可共享层 | 原因 | 仍需保留的本体差异 |
|---|---|---|
| 对象、动作意图和事件 | 任务语义相对稳定 | 可达性和抓取几何 |
| 相对位移和方向 | 比绝对坐标更可迁移 | 尺度、速度和动力学 |
| 技能阶段 | 抓取、运输、释放具有共性 | 关节数、末端形状和控制接口 |
| 视觉场景表征 | 互联网数据规模大 | 视角、传感器和任务相关细节 |
| 语言条件 | 任务描述共享 | 机器人能力和安全约束 |
跨本体学习的目标不是让人类和机器人动作数值相等,而是寻找可以在不同执行器上重新解释的中间变量。
8. 人类视频如何进入 VLA、世界模型和分层策略
| 路线 | 人类数据提供什么 | 如何接入 |
|---|---|---|
| VLA | 对象、语言、动作阶段和视觉先验 | 预训练、辅助任务、latent action 条件 |
| 世界模型 | 状态变化和未来视觉 | 视频预测、潜在动力学、未来子目标 |
| 分层策略 | 任务顺序、事件和技能边界 | 高层计划、技能 token、记忆 |
| 价值学习 | 偏好和结果比较 | 奖励模型、成功预测和数据筛选 |
| 控制 | 相对运动和接触阶段 | 目标轨迹、阻抗参数和参考动作 |
9. 最小实验:人类视频是否真正改善跨本体策略
固定同一机器人策略架构和机器人轨迹数量,比较只用机器人数据、加入原始人类视频、加入对象中心运动表征、加入 latent action、加入 behavior token 五种训练方式。人类侧数据量相同,留出新视角、新对象、新操作者和新机器人本体。
最低报告项: 机器人闭环成功率、少样本适配曲线、对象与阶段线性探针、未见本体迁移、接触任务滑动率与力峰值、人类视频时间打乱消融、外观替换消融,以及相同机器人数据量下的净收益。
人类视频展示“手拿杯子移动到架子”,机器人使用机械臂完成同一功能。
| 对照 | 监督 | 检验 |
|---|---|---|
| 只用机器人动作 | 直接行为克隆 | 基础成功率 |
| 加入人类视觉预训练 | 视频时序表征 | 新对象和新视角 |
| 加入对象相对轨迹 | 手-物交互中间变量 | 跨相机和尺度 |
| 加入 latent action | 状态变化条件 | 少量机器人适配 |
| 加入事件/技能标签 | 高层阶段监督 | 长时组合和恢复 |
必须用等量机器人数据和任务留出,避免把数据规模或对象重复误认为跨本体表征收益。
10. 主要失败模式
- 把人类像素速度直接当作机器人控制速度。
- 把共同词表误认为共同动作语义。
- latent action 只编码视频外观,不编码可控变化。
- 对象检测正确,但接触阶段和力学状态缺失。
- 人类和机器人任务时间不同,却强行逐帧对齐。
- 只报告表征相似度,不报告机器人闭环收益。
11. 可信评测
- 表示线性探针:对象、阶段、相对运动是否可预测。
- 跨视角、跨尺度和跨本体任务留出。
- 少样本机器人适配效率。
- 动作生成的功能成功率,而非只看重建误差。
- 接触任务的恢复率、力峰值和滑动率。
- 人类视频移除、时间打乱和对象替换消融。
12. 本课练习
- 为人类视频列出可观测量、不可观测量和可学习中间变量。
- 推导逆动力学条件概率与视频预测条件概率的区别。
- 设计一个能区分“像素预测收益”和“控制收益”的实验。
- 为跨机器人 Behavior Tokenizer 定义训练目标与失败模式。
- 用手-物相对位姿表示一个抓取阶段,并说明为什么比绝对像素更稳健。
- 解释 WAM-TTT、人类视频和 VLA 之间的交叉关系。
13. 论文事实、作者解释与课程判断
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| R3M | 从大规模第一视角人类视频预训练视觉表征,并在多类机器人下游任务中评测 | 人类视频中的交互结构可以形成可迁移的机器人视觉表示 | 证明的是表征预训练收益,不等于视频直接提供机器人动作或接触力 |
| MimicPlay | 利用人类 play 视频提供高层引导,再用少量机器人演示学习低层操作 | 人类行为先验可以帮助长时机器人模仿学习 | 关键桥梁是高层运动或目标条件与机器人低层数据的组合,不能把收益全部归因于跨本体动作对齐 |
| XSkill | 研究从人类与机器人视频中发现跨本体技能,并用于下游模仿 | 共享技能表征可以连接不同执行身体 | 必须检查技能是否保留任务功能、事件边界和对象状态,而非只在 embedding 中接近 |
| Open X-Embodiment | 汇集多机器人、多任务数据并训练跨本体策略模型 | 统一数据格式和大规模异构共训练可提升泛化 | 共享语义不要求动作数值统一;机器人身份、动作空间和控制频率仍需显式保留 |

