飞书原文 · 源修订 16
💡
机制课: 视频生成模型可以预测未来外观、对象变化和视觉子目标,但“画得像”不等于“物理可执行”。本课区分无动作视频预测、动作条件视频模型、视觉子目标和基于视频的规划,并建立物理一致性与控制收益的评测标准。
学习目标
完成本课后,应能区分视频预测与动作条件世界模型;解释像素似然、latent video 和 diffusion video;构造视觉子目标;分析相机、尺度、接触和不可控背景;设计从视频质量到机器人控制收益的证据链。
1. 视频模型学习哪一个条件分布
1.1 无动作视频预测
读法: 给定截至当前的观测历史,模型预测从下一帧到第 T 帧的未来观测联合分布。
推导: 这是纯观察序列的条件分布,未来中的行为、相机运动和外部事件都被边缘化在分布里,因此它学习相关性与运动先验,而不能单独回答某个机器人动作的干预结果。
它学习观察到的自然时间演化,动作和外部因素被隐含在视频中。适合学习运动先验,但无法回答机器人选择不同动作会怎样。
1.2 动作条件视频模型
读法: 给定观测历史和从 t 到 T-1 的动作序列,模型预测从 t+1 到 T 的未来观测分布。
推导: 每个动作 a_k 影响下一观测 o_{k+1},所以 T-t 个未来帧对应 T-t 个动作。机器人主动执行且数据覆盖充分时,该条件模型才更接近可用于反事实比较的动作条件动力学。
动作成为干预变量,模型可以比较不同动作的视觉未来,更接近世界模型。
1.3 目标条件视频生成
读法: 给定当前观测历史和任务目标 g,模型生成一段可能满足目标的未来视频。
推导: 把语言或目标图像作为条件可使生成结果朝目标分布集中,但动作被边缘化,因此该分布表达“可能发生什么样的过程”,不保证当前机器人存在实现它的控制序列。
给定语言或目标图像生成“应该发生的过程”,可作为高层计划,但如果没有动作条件,它不保证机器人能实现。
2. 像素空间为什么困难
图像维度高,未来又有多种可能。像素 MSE:
读法: 像素损失是下一真实图像与预测图像之间逐像素平方差的期望。
推导: 若每个像素在给定历史后服从固定方差、均值为预测图像的独立高斯分布,最大似然就等价于最小化该 MSE;多峰未来会被条件均值平均成模糊画面。
会平均多个未来,产生模糊图像。生成式视频模型通过 latent、VAE、Diffusion 或 Flow 表达多峰未来,但计算成本和物理一致性仍是问题。
3. 潜在视频模型
先把帧编码:
读法: 编码器 E_psi 把第 t 帧观测映射为潜在表示 z_t。
推导: 这是确定性编码定义;它用较低维表示替代像素进行生成和规划。表示是否保留深度、接触与对象身份,取决于训练目标而不是降维本身。
在 latent 中生成未来:
读法: 给定潜在历史、未来动作序列和任务目标,模型预测未来潜在视频轨迹的联合分布。
推导: 把像素视频条件分布通过编码器投影到 latent 空间,并保留与未来帧一一对应的动作区间;若不使用目标条件,可从公式中删去 g。
再解码或直接用于规划。Latent 可以减少计算,并让模型忽略无关纹理;也可能丢失接触、深度和小物体状态。
| 空间 | 优势 | 风险 |
|---|---|---|
| 像素 | 可视化和通用监督 | 高维、背景占容量 |
| 视觉 latent | 高效、可生成 | 物理变量不明确 |
| 对象状态 | 适合规划和因果 | 依赖检测与跟踪 |
| 关键点/轨迹 | 运动明确 | 接触和外观信息不足 |
4. 视觉子目标
高层模型生成未来目标图像 ,低层策略学习:
读法: 低层策略根据当前观测和视觉子目标图像,为当前动作给出条件分布。
推导: 这是 goal-conditioned policy 的视觉版本:把语言目标具体化为期望场景,使策略学习缩小当前图像与目标图像之间的可控差异。
视觉子目标比语言包含更具体的空间布局,但需要满足:
- 与当前场景中的对象身份一致。
- 物体位置和姿态可达到。
- 不违反遮挡、碰撞和接触。
- 低层策略能够判断距离并完成。
π0.7 的视觉子目标可放在这条交叉路线理解:主模型仍是 VLA,但使用生成未来画面作为 Prompt。
5. 从视频候选到规划
给定多条候选未来 ,可以计算视觉目标分数:
读法: 第 i 条候选未来的分数,是终点图像与目标图像距离的负值,再减去整条轨迹的不可行或风险代价。
推导: 最小化视觉目标距离可写成最大化其负值;加入系数 lambda 加权的轨迹代价,使碰撞、不确定性和不可达性参与排序。该分数是设计目标,不等同于真实任务回报。
衡量与目标的距离, 衡量碰撞、不确定性或不可行性。问题是视觉相似度并不等于任务成功:杯子看起来在架子上,可能实际悬空或不稳定。
6. 物理一致性
| 一致性 | 检查 |
|---|---|
| 对象恒常性 | 对象不能无故出现、消失或变形 |
| 几何 | 深度、遮挡和碰撞合理 |
| 运动 | 速度和加速度连续 |
| 接触 | 物体变化应有合理接触原因 |
| 本体 | 机器人姿态可达且满足关节限制 |
| 因果 | 改变动作后未来应系统性变化 |
可以加入对象跟踪、深度、关键点、动作重建或动力学约束,但最终必须用真实机器人执行验证。
7. 人类视频与机器人视频
人类视频提供丰富任务和交互,但缺少机器人动作。可以用于:
- 预训练视频表征。
- 学习高层事件和子目标。
- 学习对象轨迹和可供性。
- 为机器人生成视觉计划。
机器人视频提供动作条件和本体状态,能够训练因果动力学。联合训练需要对齐对象和事件,而不是强行逐帧对齐手和机械臂。
8. Video Diffusion / Flow 的生成对象
视频 Diffusion 学习加噪 latent 的去噪:
读法: 先在扩散噪声时刻 tau 把真实视频 latent 与高斯噪声混合,再训练网络根据带噪 latent、噪声时刻和条件 c 预测所加噪声。
推导: 前向过程定义已知高斯扰动,反向去噪可通过噪声预测参数化训练;这里 tau 专指扩散噪声时间,不能与视频帧时间 t 混用。
读法: 在线性插值路径上,Flow 模型学习把噪声视频 latent 指向真实未来视频 latent 的速度向量。
推导: 直线路径对 tau 求导得到常向量“数据减噪声”,因此可用回归训练条件速度场;推理时积分该速度场把噪声样本运输到未来视频分布。
Diffusion 与 Flow 都能表达多峰未来,但规划时需要多次采样、长视频生成和候选评价,实时性通常比直接动作生成更困难。
9. 主要失败模式
- 生成未来视觉合理,但机器人动作不可达。
- 模型主要预测背景和相机运动。
- 接触变化没有力学原因。
- 视频目标与低层策略训练分布不一致。
- 长视频保持语义但逐渐漂移对象身份。
- 视觉评价器奖励“看起来完成”而非真实稳定完成。
10. 评测层级
| 层级 | 指标 | 不能替代 |
|---|---|---|
| 视觉质量 | FVD、感知距离、人类偏好 | 物理正确 |
| 预测 | 对象轨迹、关键事件、接触准确率 | 规划价值 |
| 反事实 | 改变动作后的未来差异 | 真实执行 |
| 规划 | 候选排序与真实回报相关性 | 闭环成功 |
| 控制 | 真实机器人成功率和恢复率 | 安全与泛化 |
11. 最小实验
- 训练无动作视频模型和动作条件视频模型。
- 对同一初始状态输入不同动作,检查未来是否可区分。
- 用对象轨迹评价替代纯像素指标。
- 生成视觉子目标,让相同低层策略执行。
- 加入不可达目标图像,检查门控机制。
- 比较视觉质量、候选排序与真实成功率的相关性。
12. 本课练习
- 写出三种视频条件分布并解释差别。
- 设计一个视觉合理但物理错误的反例。
- 说明为什么视频世界模型需要动作条件才能支持反事实规划。
- 为视觉子目标定义可达性、完成和安全检查。
- 比较像素 latent、对象状态和关键点用于规划的优缺点。
- 解释 π0.7 视觉子目标同时连接 VLA、世界模型和分层规划的原因。
13. 论文坐标与证据边界
视频指标、规划指标和真实控制指标必须分层报告。以下工作解决的问题不同,不应只按生成画质或单一成功率排列。
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Visual Foresight | 用动作条件视频预测和视觉 MPC 选择机器人推物动作 | 像素级未来预测可直接支持无人工奖励的目标图像控制 | 奠定视觉 MPC 范式;二维推物成功不能替代三维接触、力和稳定抓取证据 |
| SV2P | 用随机潜变量表达视频未来的不确定性,并在机器人交互视频上评估 | 随机视频模型比确定性预测更能覆盖多种未来 | 多样性只有在候选排序和真实执行改善时才具有控制价值 |
| RoboNet | 汇集多机器人、多视角交互数据,研究跨机器人视频预测与控制 | 大规模异构视频可提升视觉动力学迁移 | 是路线 E 与 B 的交叉案例;动作、本体和相机差异必须显式建模 |
| UniPi | 用文本条件视频生成产生视觉计划,再通过逆动力学等接口转成动作 | 视频可以成为跨任务、跨本体的通用计划表示 | 高层计划空间很有吸引力,但可执行性取决于低层动作恢复、状态反馈和失败重规划 |
| π0.7 视觉子目标 | 通用 VLA 可使用视觉子目标等提示形式提高任务可控性 | 生成的中间视觉状态能帮助分层执行 | 主归属仍是 VLA;本课只研究视觉未来作为条件与子目标的世界模型交叉机制 |
| 现代具身世界模型 | UniSim、Genie、Cosmos 等扩大到可交互环境或大规模视频生成 | 更大生成模型可能成为具身训练与评测环境 | 详细比较放在 B6;是否改善真实机器人闭环仍是最终门槛 |

