跳到正文

飞书原文 · 源修订 23

💡

课程定位: 本章面向具有概率统计基础的读者,从条件概率、最大似然和潜变量模型出发,解释世界模型学习什么、为什么它不同于 VLA,以及预测模型如何通过 MPC、价值函数或想象训练转化为机器人行为。

学习目标与前置知识 ​

完成本章后,读者应能区分策略、世界模型、价值函数和规划器;能口头读出状态转移模型;能从高斯观测假设推导动力学 MSE;能解释潜在状态空间模型的 ELBO;能手写一个基于学到动力学的 MPC;能指出世界模型在接触、摩擦、延迟和部分可观测条件下的主要失效方式。

已知知识本章会用到的部分
条件概率理解下一状态依赖当前状态与动作
期望与方差理解预测误差、随机动力学与风险
最大似然从概率模型推导训练损失
KL 散度理解潜变量模型中的先验与后验对齐
梯度下降理解模型、价值函数和策略如何分别训练

先看全局:世界模型不是一条单线技术 ​

“世界模型”今天同时被控制、强化学习、表征学习、计算机视觉和生成模型社区使用。它们都在预测世界,但预测对象、动作角色和使用方式并不相同。进入公式之前,先用下面五条谱系建立坐标。

谱系核心问题典型工作怎样进入决策
经典控制与系统辨识状态如何随控制输入演化,怎样在约束下保持稳定状态空间模型、Kalman Filter、POMDP、MPC模型由估计器与优化器直接消费,滚动求解控制量
决策潜在世界模型能否在压缩状态中高效想象未来并估计回报World Models、PlaNet、Dreamer、MuZero、TD-MPC用于在线规划、树搜索或训练策略与价值函数
JEPA 预测表征能否预测抽象、决策相关的结构,而不生成每个像素Autonomous Machine Intelligence、I-JEPA、V-JEPA、V-JEPA 2先学习可预测表征,再用动作条件动力学连接规划与控制
空间智能与持久三维世界智能体能否理解对象、视角、遮挡、几何和可交互空间视觉智能、空间智能、World Labs、Marble为渲染、仿真、空间推理和规划提供可持续查询的世界表示
生成式交互环境与 World Action Models能否生成动作条件未来,并把世界预测与动作生成联合起来UniSim、Genie、Cosmos、4D-WAM作为模拟器、候选未来生成器、规划接口或动作策略

这些路线正在汇合,但不能用“都能预测未来”抹平差异。杨立昆路线强调在潜在空间预测抽象结构,避免把容量浪费在不可预测的像素细节;李飞飞路线强调智能必须建立持久、可交互的三维空间认识,而不能停留在语言或二维图像相关性。二者的交点,是一种既抽象到足以规划、又空间落地到足以干预的动作条件世界表示。

统一阅读六问: 面对任何号称世界模型的系统,都应追问:它表示什么?预测什么?动作是否作为干预变量进入模型?谁消费预测结果?预测怎样进入传感—规划—控制闭环?什么真实干预证据证明它改善了决策,而不只是让画面更逼真?

路线内分工: B5 专讲“决策潜在世界模型”谱系;B6 专讲 JEPA、空间智能与生成式模拟器如何形成现代思想谱系;B7 再进入 4D 世界状态与 World Action Models 的具体机制。

1. 世界模型到底在学习什么 ​

策略通常学习:

读法: 策略根据截至当前的观测历史和目标,为当前动作分配条件概率。

推导: 策略直接建模从可用信息到动作的条件分布,不要求显式表示未来状态。

读作:“给定截至当前的观测历史和目标,动作的条件分布是什么?”它回答现在做什么。

世界模型通常学习:

读法: 世界模型根据历史观测和当前动作,预测下一观测、即时奖励和是否终止的联合条件分布。

推导: 把环境未来拆成可观测结果、任务反馈和终止事件,统一写入动作条件预测对象。

读作:“给定历史观测和当前动作,下一观测、即时奖励以及是否终止的概率分布是什么?”它回答如果这样做,之后可能发生什么。

这两个方向不能混为一谈。VLA 可以在没有显式世界模型的情况下直接模仿动作;世界模型也可以只负责预测,必须再配合规划器、价值函数或策略,才能选择动作。

2. 从 Markov 状态到部分可观测世界 ​

2.1 Markov 假设 ​

如果状态 已经包含预测未来所需的全部信息,则:

读法: 如果当前状态已包含所有相关信息,给定当前状态和动作后,更早历史对下一状态不再提供额外信息。

推导: 这是状态充分性的条件独立假设;在机器人中,速度、接触和隐藏载荷若未进入状态,单帧观测就不满足它。

读作:“知道当前状态和当前动作后,更早的历史不再为下一状态提供额外信息。”这不是说物理世界没有历史,而是要求状态变量已经把相关历史压缩进来,例如位置之外还要包含速度、接触状态、物体是否被抓稳等。

2.2 机器人通常是部分可观测的 ​

摄像头图像 通常不是完整状态。遮挡、深度歧义、摩擦系数、外力和内部形变可能不可见。因此实际系统需要从历史构造信念状态或潜在状态:

读法: 编码器 E 根据观测历史和此前动作构造潜在状态 z_t。

推导: 历史提供被遮挡的速度、接触和物体变化信息;潜在状态是对控制有用信息的压缩,不保证等于真实物理状态。

这里的 不是“压缩图像”这么简单。一个对控制有用的潜在状态,应保留影响未来可预测性和动作选择的信息。

3. 从最大似然推导动力学损失 ​

3.1 确定性动力学 ​

最简单的模型直接预测下一状态:

读法: 动力学模型 f_phi 根据当前状态和动作,输出对下一状态的确定性预测。

推导: 这是把条件分布退化成单点预测的最简模型,适合噪声小或只关注条件均值的场景。

如果假设真实下一状态服从固定方差高斯分布:

读法: 下一状态服从均值由动力学网络给出、协方差为固定 sigma 平方乘单位矩阵的高斯分布。

推导: 把高斯负对数似然展开,固定方差后剩下预测误差平方,因此得到下一状态 MSE。

最大化对数似然等价于最小化:

读法: 动力学损失是预测下一状态与真实下一状态之间平方距离的期望。

推导: 它来自固定方差单峰高斯最大似然;多峰碰撞后果会被条件均值压成可能不存在的中间状态。

因此,下一状态 MSE 隐含了固定方差、单峰高斯的假设。碰撞后物体可能向不同方向滑动时,平均预测可能对应一个并不存在的未来。

3.2 随机动力学与不确定性 ​

更一般的模型输出完整分布:

读法: 给定当前状态和动作,下一状态不是一个点,而是一个完整的条件概率分布。

推导: 这一写法保留了条件分布的完整形式,不预先假设它必须是固定方差高斯。若选择高斯、混合密度或离散分布,只是对这个条件分布采用不同参数化。

分布宽度可能来自真实过程噪声,也可能来自模型不知道的隐藏状态;两者需要不同的传感和决策策略。

随机性可能来自真实过程噪声,也可能来自模型不知道隐藏状态。二者在工程上意义不同:前者需要风险敏感决策,后者可以通过更好的传感器、历史状态或数据覆盖降低。

4. 潜在状态空间模型与 ELBO ​

高维图像不适合直接进行长时间规划。潜在状态空间模型把观测生成和状态转移分开:

读法: 给定前 T-1 个动作,整段潜在状态和观测的联合概率由初始状态、每个状态生成观测以及动作条件状态转移三部分相乘得到。

推导: 先生成 z_1,再为每个 z_t 生成 o_t;只有 t 到 T-1 的动作会产生下一状态,因此转移乘积不能写到 T。

读作:“潜在状态按照动作条件动力学向前演化,每个潜在状态再生成观测。”真实后验 通常无法直接计算,因此引入近似后验 。

对数似然的证据下界可以写成:

读法: 观测序列的对数似然至少等于重建观测的期望对数概率,减去近似后验与动力学先验之间的 KL 距离。

推导: 把真实后验乘除进对数似然,应用 Jensen 不等式得到 ELBO;第一项要求潜在状态解释观测,第二项要求它仍接近动作条件动力学可预测的先验。

第一项要求潜在状态能够解释观测,第二项要求看见真实观测后得到的后验,不要偏离仅凭动力学预测出的先验太远。口语上,它在平衡两件事:状态要足够表达当前观测,也要能够沿动力学稳定地向未来滚动。

需要警惕:重建图像很好,不代表潜在状态适合控制。背景纹理可能占据大量表示容量,而微小接触状态却决定任务成败。控制导向世界模型通常还会预测奖励、价值、终止、关键点或可供性。

5. 从预测到行动:模型预测控制 ​

有了动力学模型,还要定义目标。给定规划长度 ,模型预测控制选择动作序列:

读法: 在模型预测的未来中,寻找长度为 H 的动作序列,使折扣奖励总和与终点价值之和最大。

推导: 模型展开每个候选动作的未来,奖励函数评价中间状态,终点价值补足有限 horizon 后的长期影响;MPC 通常只执行第一个动作再重规划。

读作:“在模型预测的未来中,寻找累计奖励加终点价值最高的动作序列。”执行时通常只执行第一个动作,然后获得新观测并重新规划,这就是 receding-horizon MPC。

5.1 CEM 的直觉 ​

  1. 初始化候选动作序列的高斯分布。
  2. 采样多条动作序列,并用世界模型展开未来。
  3. 保留回报最高的一小部分精英样本。
  4. 用精英样本重新估计动作分布的均值和方差。
  5. 重复若干轮,执行最终均值序列的第一个动作。

CEM 不要求奖励对动作可导,适合黑盒世界模型;代价是推理时需要大量模型 rollout。模型误差会随规划长度累积,因此更长规划不一定更好。

6. 世界模型的三种使用方式 ​

方式模型学习什么动作如何得到代表思路
在线规划状态转移与奖励MPC、CEM 或轨迹优化经典 model-based control、TD-MPC
想象中训练策略潜在动力学、奖励与继续概率actor 在想象 rollout 上优化Dreamer 系列
预测增强的策略未来视觉、子目标或可控变化预测结果作为策略条件视频预测、视觉子目标、world-action model

MuZero 类方法甚至不要求模型重建真实观测,而只要求潜在动力学支持奖励、价值和策略预测。这说明“世界模型”不一定要生成逼真视频;关键在于它是否保留决策需要的可预测结构。

7. 一维机器人例子:模型误差如何改变规划 ​

考虑一维小车,状态是位置和速度:

读法: 一维小车的状态由当前位置 x_t 和当前速度 v_t 两个量组成。

推导: 这是状态变量的定义。把位置与速度组合成二维状态,是因为一阶位置观测不足以确定下一位置;加入速度后,离散动力学可以由当前状态和动作递推。

把速度放进状态后,下一位置才能由当前速度预测;若只保留位置,系统通常不满足 Markov 假设。

离散动力学为:

读法: 下一时刻位置等于当前位置加上时间步长乘当前速度。

推导: 这是连续关系 dx/dt=v 的一阶欧拉离散化。

读法: 下一时刻速度等于当前速度加时间步长乘以“控制加速度减去与速度成正比的阻尼”。

推导: 连续动力学 dv/dt=a-cv 用欧拉法离散;c 越大,高速状态衰减越快。

其中 是阻尼系数。训练数据可以用线性回归估计 。如果训练数据只包含低速运动,模型可能低估高速阻力;规划器在模型中认为小车能够及时刹车,真实部署时却越过目标。这说明规划失败可能来自策略搜索,也可能来自模型在计划访问区域中的外推误差。

实验改变什么观察什么
数据覆盖逐渐增加高速样本模型误差和停车成功率是否同步改善
规划长度改变 MPC horizon短视与模型误差累积的权衡
不确定性惩罚对模型方差大的轨迹扣分安全性与任务效率的变化
闭环频率改变重新规划频率模型误差能否被新观测纠正

8. 机器人世界模型最容易忽略的物理问题 ​

问题为什么危险需要的证据
接触与摩擦微小状态误差可能造成完全不同的接触模式接触事件分层评估、力觉或触觉消融
柔顺与形变刚体状态不足以描述布料、线缆和软物体形变状态、关键点或对象中心表示
控制延迟模型按错误时间戳学习动作因果关系动作观测对齐、延迟扫描实验
相机遮挡单帧观测不满足 Markov 假设历史长度、记忆模块和多视角消融
模型利用偏差规划器会主动寻找模型错误并“钻空子”不确定性校准、真实环境验证和保守规划
长时滚动误差单步准确仍可能导致多步轨迹漂移多步 open-loop 与 closed-loop 分开报告

9. 如何判断世界模型真的对控制有用 ​

不能只报告视频看起来逼真或单步预测误差。至少应分别测量:

  1. 预测: 一步、多步、关键事件和接触状态误差。
  2. 校准: 模型置信度是否对应真实错误概率。
  3. 规划: 模型中最优的轨迹在真实环境是否仍然优。
  4. 闭环: 重新规划后能否纠正模型误差。
  5. 分布外: 新物体、新动力学参数、新视角和新任务组合。
  6. 因果干预: 改变动作、质量、摩擦或障碍位置时,预测是否按物理关系变化。

10. 本章练习 ​

  1. 用一句话分别解释 与 ,并各举一个不能互相替代的例子。
  2. 从固定方差高斯假设推导下一状态 MSE,并写出异方差高斯对应的损失。
  3. 画出潜在状态空间模型的训练计算图,标注先验、后验、重建项与 KL 项。
  4. 为一维小车实现线性动力学辨识和 CEM-MPC,比较不同 horizon。
  5. 设计一个能区分“视觉预测好”与“控制预测好”的消融实验。
  6. 解释为什么规划器可能利用世界模型的错误,并提出两种抑制方法。

本章必须形成的结论 ​

  • 策略学习“做什么”,世界模型学习“做了以后会怎样”。
  • 世界模型只有与奖励、价值、规划或策略结合后才产生决策。
  • MSE、ELBO 和 latent rollout 都来自明确的概率假设,不是任意公式。
  • 对 Physical AI 而言,决策相关的状态、接触和不确定性比像素逼真更重要。
  • 世界模型的最终证据不是生成视频,而是能否改善真实闭环决策。

原始资料 ​

文章正文采用 Apache License 2.0