跳到正文

飞书原文 · 源修订 16

💡

机制课: 视频生成模型可以预测未来外观、对象变化和视觉子目标,但“画得像”不等于“物理可执行”。本课区分无动作视频预测、动作条件视频模型、视觉子目标和基于视频的规划,并建立物理一致性与控制收益的评测标准。

学习目标 ​

完成本课后,应能区分视频预测与动作条件世界模型;解释像素似然、latent video 和 diffusion video;构造视觉子目标;分析相机、尺度、接触和不可控背景;设计从视频质量到机器人控制收益的证据链。

1. 视频模型学习哪一个条件分布 ​

1.1 无动作视频预测 ​

读法: 给定截至当前的观测历史,模型预测从下一帧到第 T 帧的未来观测联合分布。

推导: 这是纯观察序列的条件分布,未来中的行为、相机运动和外部事件都被边缘化在分布里,因此它学习相关性与运动先验,而不能单独回答某个机器人动作的干预结果。

它学习观察到的自然时间演化,动作和外部因素被隐含在视频中。适合学习运动先验,但无法回答机器人选择不同动作会怎样。

1.2 动作条件视频模型 ​

读法: 给定观测历史和从 t 到 T-1 的动作序列,模型预测从 t+1 到 T 的未来观测分布。

推导: 每个动作 a_k 影响下一观测 o_{k+1},所以 T-t 个未来帧对应 T-t 个动作。机器人主动执行且数据覆盖充分时,该条件模型才更接近可用于反事实比较的动作条件动力学。

动作成为干预变量,模型可以比较不同动作的视觉未来,更接近世界模型。

1.3 目标条件视频生成 ​

读法: 给定当前观测历史和任务目标 g,模型生成一段可能满足目标的未来视频。

推导: 把语言或目标图像作为条件可使生成结果朝目标分布集中,但动作被边缘化,因此该分布表达“可能发生什么样的过程”,不保证当前机器人存在实现它的控制序列。

给定语言或目标图像生成“应该发生的过程”,可作为高层计划,但如果没有动作条件,它不保证机器人能实现。

2. 像素空间为什么困难 ​

图像维度高,未来又有多种可能。像素 MSE:

读法: 像素损失是下一真实图像与预测图像之间逐像素平方差的期望。

推导: 若每个像素在给定历史后服从固定方差、均值为预测图像的独立高斯分布,最大似然就等价于最小化该 MSE;多峰未来会被条件均值平均成模糊画面。

会平均多个未来,产生模糊图像。生成式视频模型通过 latent、VAE、Diffusion 或 Flow 表达多峰未来,但计算成本和物理一致性仍是问题。

3. 潜在视频模型 ​

先把帧编码:

读法: 编码器 E_psi 把第 t 帧观测映射为潜在表示 z_t。

推导: 这是确定性编码定义;它用较低维表示替代像素进行生成和规划。表示是否保留深度、接触与对象身份,取决于训练目标而不是降维本身。

在 latent 中生成未来:

读法: 给定潜在历史、未来动作序列和任务目标,模型预测未来潜在视频轨迹的联合分布。

推导: 把像素视频条件分布通过编码器投影到 latent 空间,并保留与未来帧一一对应的动作区间;若不使用目标条件,可从公式中删去 g。

再解码或直接用于规划。Latent 可以减少计算,并让模型忽略无关纹理;也可能丢失接触、深度和小物体状态。

空间优势风险
像素可视化和通用监督高维、背景占容量
视觉 latent高效、可生成物理变量不明确
对象状态适合规划和因果依赖检测与跟踪
关键点/轨迹运动明确接触和外观信息不足

4. 视觉子目标 ​

高层模型生成未来目标图像 ,低层策略学习:

读法: 低层策略根据当前观测和视觉子目标图像,为当前动作给出条件分布。

推导: 这是 goal-conditioned policy 的视觉版本:把语言目标具体化为期望场景,使策略学习缩小当前图像与目标图像之间的可控差异。

视觉子目标比语言包含更具体的空间布局,但需要满足:

  • 与当前场景中的对象身份一致。
  • 物体位置和姿态可达到。
  • 不违反遮挡、碰撞和接触。
  • 低层策略能够判断距离并完成。

π0.7 的视觉子目标可放在这条交叉路线理解:主模型仍是 VLA,但使用生成未来画面作为 Prompt。

5. 从视频候选到规划 ​

给定多条候选未来 ,可以计算视觉目标分数:

读法: 第 i 条候选未来的分数,是终点图像与目标图像距离的负值,再减去整条轨迹的不可行或风险代价。

推导: 最小化视觉目标距离可写成最大化其负值;加入系数 lambda 加权的轨迹代价,使碰撞、不确定性和不可达性参与排序。该分数是设计目标,不等同于真实任务回报。

衡量与目标的距离, 衡量碰撞、不确定性或不可行性。问题是视觉相似度并不等于任务成功:杯子看起来在架子上,可能实际悬空或不稳定。

6. 物理一致性 ​

一致性检查
对象恒常性对象不能无故出现、消失或变形
几何深度、遮挡和碰撞合理
运动速度和加速度连续
接触物体变化应有合理接触原因
本体机器人姿态可达且满足关节限制
因果改变动作后未来应系统性变化

可以加入对象跟踪、深度、关键点、动作重建或动力学约束,但最终必须用真实机器人执行验证。

7. 人类视频与机器人视频 ​

人类视频提供丰富任务和交互,但缺少机器人动作。可以用于:

  • 预训练视频表征。
  • 学习高层事件和子目标。
  • 学习对象轨迹和可供性。
  • 为机器人生成视觉计划。

机器人视频提供动作条件和本体状态,能够训练因果动力学。联合训练需要对齐对象和事件,而不是强行逐帧对齐手和机械臂。

8. Video Diffusion / Flow 的生成对象 ​

视频 Diffusion 学习加噪 latent 的去噪:

读法: 先在扩散噪声时刻 tau 把真实视频 latent 与高斯噪声混合,再训练网络根据带噪 latent、噪声时刻和条件 c 预测所加噪声。

推导: 前向过程定义已知高斯扰动,反向去噪可通过噪声预测参数化训练;这里 tau 专指扩散噪声时间,不能与视频帧时间 t 混用。

读法: 在线性插值路径上,Flow 模型学习把噪声视频 latent 指向真实未来视频 latent 的速度向量。

推导: 直线路径对 tau 求导得到常向量“数据减噪声”,因此可用回归训练条件速度场;推理时积分该速度场把噪声样本运输到未来视频分布。

Diffusion 与 Flow 都能表达多峰未来,但规划时需要多次采样、长视频生成和候选评价,实时性通常比直接动作生成更困难。

9. 主要失败模式 ​

  • 生成未来视觉合理,但机器人动作不可达。
  • 模型主要预测背景和相机运动。
  • 接触变化没有力学原因。
  • 视频目标与低层策略训练分布不一致。
  • 长视频保持语义但逐渐漂移对象身份。
  • 视觉评价器奖励“看起来完成”而非真实稳定完成。

10. 评测层级 ​

层级指标不能替代
视觉质量FVD、感知距离、人类偏好物理正确
预测对象轨迹、关键事件、接触准确率规划价值
反事实改变动作后的未来差异真实执行
规划候选排序与真实回报相关性闭环成功
控制真实机器人成功率和恢复率安全与泛化

11. 最小实验 ​

  1. 训练无动作视频模型和动作条件视频模型。
  2. 对同一初始状态输入不同动作,检查未来是否可区分。
  3. 用对象轨迹评价替代纯像素指标。
  4. 生成视觉子目标,让相同低层策略执行。
  5. 加入不可达目标图像,检查门控机制。
  6. 比较视觉质量、候选排序与真实成功率的相关性。

12. 本课练习 ​

  1. 写出三种视频条件分布并解释差别。
  2. 设计一个视觉合理但物理错误的反例。
  3. 说明为什么视频世界模型需要动作条件才能支持反事实规划。
  4. 为视觉子目标定义可达性、完成和安全检查。
  5. 比较像素 latent、对象状态和关键点用于规划的优缺点。
  6. 解释 π0.7 视觉子目标同时连接 VLA、世界模型和分层规划的原因。

13. 论文坐标与证据边界 ​

视频指标、规划指标和真实控制指标必须分层报告。以下工作解决的问题不同,不应只按生成画质或单一成功率排列。

工作论文事实作者解释课程判断
Visual Foresight用动作条件视频预测和视觉 MPC 选择机器人推物动作像素级未来预测可直接支持无人工奖励的目标图像控制奠定视觉 MPC 范式;二维推物成功不能替代三维接触、力和稳定抓取证据
SV2P用随机潜变量表达视频未来的不确定性,并在机器人交互视频上评估随机视频模型比确定性预测更能覆盖多种未来多样性只有在候选排序和真实执行改善时才具有控制价值
RoboNet汇集多机器人、多视角交互数据,研究跨机器人视频预测与控制大规模异构视频可提升视觉动力学迁移是路线 E 与 B 的交叉案例;动作、本体和相机差异必须显式建模
UniPi用文本条件视频生成产生视觉计划,再通过逆动力学等接口转成动作视频可以成为跨任务、跨本体的通用计划表示高层计划空间很有吸引力,但可执行性取决于低层动作恢复、状态反馈和失败重规划
π0.7 视觉子目标通用 VLA 可使用视觉子目标等提示形式提高任务可控性生成的中间视觉状态能帮助分层执行主归属仍是 VLA;本课只研究视觉未来作为条件与子目标的世界模型交叉机制
现代具身世界模型UniSim、Genie、Cosmos 等扩大到可交互环境或大规模视频生成更大生成模型可能成为具身训练与评测环境详细比较放在 B6;是否改善真实机器人闭环仍是最终门槛

文章正文采用 Apache License 2.0