飞书原文 · 源修订 28
💡
机制课: 本课承接 B0,专门解决一个问题:高维、部分可观测的机器人观测,如何被压缩成能预测未来、奖励和终止的潜在状态。重点是概率图模型、状态空间模型、滤波、ELBO 和多步 rollout。
学习目标与前置知识
需要条件概率、期望、方差和 KL 散度。完成本课后,应能区分真实状态、观测、信念状态和潜在状态;写出状态空间模型的联合分布;推导变分下界;解释单步预测准确为什么不等于长时 rollout 可用;设计预测和控制导向的表征消融。
1. 状态、观测与信念
部分可观测系统可以写成:
读法: 给定当前真实状态 s_t 和动作 a_t,下一真实状态 s_{t+1} 按环境转移分布采样。
推导: 这是受控 Markov 动力学的定义。当前状态若已包含预测未来所需的信息,则更早历史在给定 s_t、a_t 后可被条件独立性消去。
读法: 当前观测 o_t 由当前真实状态 s_t 通过观测模型随机生成。
推导: 传感器只看到真实状态经过成像、噪声和遮挡后的结果,因此观测是状态的条件随机变量,而不必等于状态本身。
策略只能看到 ,因此需要信念分布:
读法: 信念 b_t 在状态取值 s 处的概率,等于给定截至当前的全部观测和此前动作后,当前真实状态等于 s 的后验概率。
推导: 部分可观测时不能把单帧观测直接当状态;把不可见状态条件化在全部可用历史上,就得到用于决策的后验分布。
读作:“在所有历史观测和过去动作条件下,当前真实状态的后验分布。”机器人不能直接观察摩擦、遮挡后的物体和接触力时,信念比单一估计更诚实。
1.1 贝叶斯滤波
预测步骤:
读法: 预测信念等于对所有上一时刻状态积分:上一状态的信念权重乘它经动作转移到当前状态的概率。
推导: 由全概率公式,对未知的 s_{t-1} 边缘化;Markov 假设把转移项化为 p(s_t|s_{t-1},a_{t-1})。
更新步骤:
读法: 更新后的信念等于观测似然乘预测信念,再除以对所有候选状态求和或积分得到的归一化常数。
推导: 直接应用 Bayes 公式。分子提高能解释新观测的状态权重,分母 p(o_t|历史) 保证更新后的信念积分为 1。
第一步把动力学推进到当前,第二步用新观测修正。深度模型通常用 RNN、Transformer 或随机潜变量近似这一过程。
2. 状态空间模型
潜在状态空间模型分为表示、转移和观测生成:
读法: 推断模型 q_psi 根据观测历史和此前动作,为当前潜在状态 z_t 给出近似后验分布。
推导: 真实后验通常不可解析计算,因此用可训练的编码器近似贝叶斯滤波;采样形式还能表达同一观测历史对应多种隐藏状态的可能性。
读法: 潜在动力学根据当前潜在状态和动作,为下一潜在状态给出条件分布。
推导: 这是把真实受控状态转移投影到潜在空间后的模型;若 z_t 对预测充分,更早历史可由 z_t 压缩。
读法: 观测解码器根据潜在状态 z_t 生成当前观测 o_t 的条件分布。
推导: 生成模型需要说明潜变量如何解释可见数据;选择高斯、离散像素分布或感知特征分布,会分别导出不同的重建损失。
联合分布:
读法: 给定前 T-1 个动作,整段观测和潜在状态的联合概率由初始状态、T 个观测生成项与 T-1 个动作条件转移项相乘得到。
推导: 先按链式法则展开联合分布,再用状态转移的 Markov 条件独立和观测只依赖当前潜在状态的假设删去多余条件。转移乘积只能到 T-1,否则会错误引入 z_{T+1}。
3. ELBO:为什么要同时重建和预测
观测序列的对数似然:
读法: 这是在给定动作序列后,模型为整段观测序列分配的对数边缘似然。
推导: 它由联合分布对所有潜在轨迹进行边缘化得到。这个高维积分通常不可直接计算,因此需要变分下界。
引入近似后验 :
读法: 观测对数似然等于证据下界,加上近似后验与真实后验之间的 KL 散度。
推导: 在 log p(o|a) 中乘除 q(z|o,a),对 q 取期望并整理;剩余差值恰好是 KL。这里 o、z、a 代表对应的完整序列。
由于 KL 非负:
读法: 观测对数似然不小于证据下界。
推导: 上一恒等式中的 KL 散度永远非负,因此删去它只能得到不超过真实对数似然的下界;当近似后验等于真实后验时取等号。
常见形式:
读法: ELBO 等于近似后验下的观测重建对数概率,减去整段后验轨迹与动作条件动力学先验之间的 KL 距离。
推导: 把联合分布分解为观测生成项和潜在轨迹先验,并将 log p(o,z|a)-log q(z|o,a) 的期望重新组合,即得到重建项减 KL 项。
第一项是观测解释能力,第二项是后验与动力学先验的一致性。只优化重建,潜在状态可能记住背景纹理;只优化预测,状态可能丢失当前任务需要的细节。
公式可视化|ELBO 的重建项、动力学先验与后验间隙

4. 决策导向的潜在状态
世界模型不一定需要重建每个像素。更重要的是潜在状态是否保留:
- 对象位姿、速度和接触阶段。
- 与动作结果相关的隐藏因素。
- 奖励和终止的可预测信息。
- 不确定性与多种可能未来。
可增加辅助目标:
读法: 总训练损失由重建、奖励预测、终止预测和对比学习四项加权相加。
推导: 这不是概率论恒等式,而是多任务优化目标。各 lambda 把量纲和梯度规模不同的任务折算到共同目标;只有在明确联合似然假设时,部分权重才可解释为噪声方差。
辅助任务不是越多越好。每个目标都可能改变表示的偏好,应通过控制收益而非单独预测指标验证。
5. 多步 rollout 与误差累积
单步预测误差:
读法: 单步潜在误差是下一真实潜在状态与模型预测潜在状态之间的欧氏距离。
推导: 这是选定潜在坐标和二范数后的误差定义。因为潜在空间可被缩放或旋转,跨模型比较时应固定编码器或改用可解码任务指标,不能只比较该数值。
模型自己的预测会成为下一步输入:
读法: 第 k+1 步预测由模型把自己的第 k 步预测和对应动作再次向前推进得到。
推导: open-loop rollout 在第一步后不再注入真实潜在状态,因此每一步的输入分布都受此前误差影响,形成复合误差而非独立误差的简单相加。
因此多步误差不仅是单步误差的简单相加,还可能进入模型从未见过的潜在区域。训练时可以使用 scheduled sampling、短 rollout loss 或不确定性惩罚,但每种方法都有偏差与计算代价。
| 评估 | 回答的问题 |
|---|---|
| 一步预测 | 局部动力学是否正确 |
| 多步 open-loop | 模型自身 rollout 是否漂移 |
| 闭环预测 | 新观测能否修正误差 |
| 奖励预测 | 模型是否保留任务相关状态 |
| 规划收益 | 预测是否改善动作选择 |
6. 随机性与不确定性
模型不确定性有两种:
- Aleatoric: 真实物理过程本身随机,例如滑动方向和柔性形变。
- Epistemic: 训练数据不足,模型不知道自己不知道。
可以让模型预测异方差高斯:
读法: 给定当前潜在状态和动作,下一潜在状态服从均值和协方差都由网络预测的高斯分布。
推导: 对该分布做最大似然,负对数似然包含由逆协方差加权的残差项和 log det Sigma 项;前者惩罚预测错误,后者阻止模型靠无限放大方差逃避误差。
高不确定性轨迹可在规划中惩罚,但过度保守会拒绝有价值的探索。需要在仿真或真实数据上检查置信度是否校准。
7. 世界模型的三类目标
| 类型 | 目标 | 优点 | 风险 |
|---|---|---|---|
| 像素世界模型 | 生成逼真未来观测 | 可视化强、数据利用广 | 容量被背景占据 |
| 潜在动力学 | 预测控制相关状态 | 规划效率高 | 表示不可解释 |
| 决策模型 | 预测奖励、价值、策略和终止 | 直接服务决策 | 可能丢失未定义目标的信息 |
8. 失败模式与诊断
| 失败模式 | 表面症状 | 判别实验 | 处理方向 |
|---|---|---|---|
| 后验坍塌 | 解码器忽略潜变量,KL 接近零 | 遮蔽 z 后重建几乎不变 | 限制解码器、KL balancing、free bits |
| 表示被背景占据 | 重建清晰但奖励和接触预测差 | 背景替换与对象状态 probe | 对象中心、任务辅助目标、数据增强 |
| 多步漂移 | 一步误差小,长 rollout 快速失真 | 按 horizon 报告 open-loop 误差 | 多步训练、闭环重规划、不确定性约束 |
| 动作被模型忽略 | 改变动作,预测未来几乎不变 | 固定状态做动作干预 | 动作对齐、反事实数据、控制相关损失 |
| 不确定性失准 | 高置信轨迹在真实系统失败 | 可靠性曲线与覆盖率检验 | ensemble、校准、保守规划 |
| 潜在坐标不可比 | latent MSE 低但控制无提升 | 固定解码任务与同一规划器评测 | 用任务指标和闭环收益作为主证据 |
9. 最小实验
在一维带摩擦小车中,比较三种表征:真实状态、图像重建 latent、奖励预测 latent。
- 训练一步动力学模型。
- 分别测量一步和 20 步 rollout。
- 用相同 CEM 规划器比较到达目标成功率。
- 加入摩擦参数变化,测试不确定性校准。
- 报告重建误差、奖励误差、规划成功率和置信区间。
10. 本课练习
- 从贝叶斯滤波写出预测和更新两步的口语读法。
- 推导 ELBO,并解释 KL 项的方向。
- 设计一个背景重建很好但控制很差的反例。
- 比较 open-loop 与 closed-loop rollout 的误差来源。
- 为接触任务定义世界模型的状态和不确定性。
- 解释为什么 MuZero 类模型不必生成逼真视频。
11. 论文坐标与证据边界
下面区分论文明确实现的事实、作者赋予结果的解释,以及本课程据此形成的判断。论文之间的观测空间、动作空间、数据规模和评测任务不同,不能只按单一分数横向排名。
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| PlaNet / RSSM | 在潜在空间学习确定性记忆与随机状态,并在模型中规划 | 紧凑 latent 可以支持像素控制 | 奠定现代潜在世界模型的状态接口,但接触与真实机器人外推仍需单独验证 |
| Dreamer 系列 | 在学习到的 latent rollout 上训练价值和 actor | 想象训练能减少真实交互需求 | 收益依赖动力学、奖励和继续概率共同准确,不能只看重建质量 |
| MuZero | 潜在模型预测奖励、价值和策略,不重建观测 | 决策充分的模型不必逼真模拟像素 | 支持“控制充分性优先”,但任务目标变化时可能缺少未被原目标监督的信息 |
| TD-MPC2 | 联合学习潜在动力学、价值与策略先验,并在线执行短视野规划 | 可扩展的 latent planning 能覆盖多任务连续控制 | 是强模型式基线;迁移到真实机器人时仍必须报告延迟、接触和模型利用偏差 |

