跳到正文

飞书原文 · 源修订 20

💡

机制课: 本课研究世界模型不只用于规划时,还可以在模型内部生成想象轨迹,用这些轨迹训练 Actor、Critic 或技能策略。重点是 imagined rollout 的梯度路径、模型偏差、短滚动与长滚动的权衡。

学习目标 ​

完成本课后,应能区分真实 rollout 和 imagined rollout;写出 Dreamer 类方法的表示、动力学、奖励、价值和策略目标;解释梯度是否穿过世界模型;分析模型误差如何污染策略;设计真实数据与想象数据的混合训练实验。

1. 为什么在模型里学习 ​

真实机器人交互昂贵、慢且危险。若世界模型可以预测潜在状态:

读法: 世界模型根据当前潜在状态和动作,为下一潜在状态给出条件分布。

推导: 这是想象环境的状态转移接口。它来自真实轨迹上学习到的潜在动力学,而不是新采集的真实状态。

就可以在模型内部展开:

读法: 在想象 rollout 的第 k 步,模型把自己的当前预测状态和 Actor 动作推进到下一状态。

推导: 确定性情形下反复复合 f_phi 即得到多步轨迹;随机模型则需在每步采样或传播分布,因此误差与不确定性都会沿 rollout 累积。

然后用预测奖励训练策略:

读法: Actor 的 H 步想象目标,是前 H 个预测奖励的折扣和,加上第 H 步潜在状态的终点价值,并对初始状态、策略动作和模型随机性取期望。

推导: 把无限时域回报在 H 处截断,显式使用模型预测前 H 步,再用 Critic 近似余下尾部;求和到 H-1 恰好包含 H 个奖励。

这不是凭空增加数据,而是用模型假设在数据之间插值。模型错误会被想象训练反复放大。

2. 想象 rollout 的组成 ​

模块数学对象作用
表示近似后验 q:由观测历史推断潜在状态把观测映射到决策状态
动力学潜在转移分布 p:预测动作后的状态预测动作后的状态
奖励奖励预测器:估计当前状态动作的任务反馈预测任务评价
终止终止预测器:估计轨迹是否继续预测任务是否结束
ActorActor 策略:在潜在状态上选择动作在想象中选动作
CriticCritic 价值函数:估计未来回报估计未来回报

3. Critic 在想象轨迹上学习 ​

想象 TD 目标:

读法: 一步价值目标等于预测即时奖励,加上未终止概率、折扣因子与下一状态目标价值的乘积。

推导: 由 Bellman 递推把长期回报拆成当前奖励和下一状态回报;终止概率为一时不再 bootstrap,目标网络参数 bar xi 用于稳定训练。

读法: lambda-return 在一步目标价值和更长的递归回报之间按 lambda 混合,同时用继续概率控制终止后的回报。

推导: 把不同 n-step return 按几何权重加权可以整理成该递归式;lambda 为零退化为一步 TD,接近一时更依赖长想象回报。

Critic 损失:

读法: Critic 最小化自身价值预测与停止梯度后的 lambda-return 目标之间的均方误差。

推导: 把 return 当作回归监督即可得到平方损失;停止梯度算子 sg 防止 Critic 通过修改目标分支而不是价值预测来缩小误差。

如果世界模型在某区域预测错误,Critic 会把模型幻想当成未来真实回报。可以限制想象 horizon、混入真实 next state 或使用 ensemble 不确定性。

4. Actor 的梯度路径 ​

4.1 不穿过模型的策略梯度 ​

把世界模型当作环境,使用想象状态和 Advantage:

读法: 策略梯度把每一步动作的对数概率梯度,乘以该动作相对平均水平的优势,再沿想象时域求和并取期望。

推导: 对轨迹概率使用 log-derivative trick;不对世界模型求导时,模型只负责产生采样状态,Advantage 用作降低方差的回报权重。

优点是简单;缺点是模型错误只通过数据分布间接影响。

4.2 穿过模型的路径优化 ​

若动力学可导,可以让回报梯度穿过模型:

读法: Actor 参数既通过当前动作直接影响回报,也通过动作改变下一状态、再递归影响以后所有回报。

推导: 对可重参数化的策略和可导动力学使用全导数与链式法则;第二行显式保留状态递归,因此不会遗漏早期动作对后续状态的间接影响。

样本效率高,但模型的微小系统性错误可能直接变成策略的错误梯度。

公式可视化|回报梯度如何穿过动作与世界模型 ​

课程画板

5. 真实数据与想象数据的混合 ​

训练方式真实数据比例优势风险
纯真实100%不受模型幻想污染交互成本高
短想象真实初始化,短 rollout偏差较小、扩展有效长期价值有限
长想象少量真实初始化覆盖长时决策模型误差累积
不确定性门控按模型置信度选择在可信区域扩展数据置信度校准困难

6. Dreamer 类方法的抽象流程 ​

  1. 用真实轨迹训练表示、动力学、奖励和终止模型。
  2. 从真实观测编码潜在状态。
  3. 在潜在空间中由当前 Actor 展开想象轨迹。
  4. 用想象奖励训练 Critic。
  5. 让 Actor 选择能提高想象回报的动作。
  6. 在真实环境执行新策略,收集数据修正世界模型。

Dreamer 的核心不是“生成逼真视频”,而是在足够有用的潜在空间里进行可微或近似可微的决策学习。

7. 模型偏差的三种传播 ​

偏差传播方式诊断
状态表示偏差Actor 和 Critic 看到了错误状态遮挡、历史长度、表征探针
动力学偏差每一步预测误差成为下一步输入多步 open-loop 与真实 rollout
奖励偏差策略追求模型定义的伪目标模型内回报与真实成功率相关性

8. 想象学习与 VLA 的结合 ​

VLA 可以作为 Actor,世界模型生成潜在未来,Critic 对 Action Chunk 进行评价:

读法: 动作块 A_t 的价值,是世界模型预测的 H 步奖励与终点价值之和的期望;动作块恰好包含从 t 到 t+H-1 的 H 个动作。

推导: 把单步动作价值扩展为固定长度动作块,并对模型生成的未来边缘化;该分数可用于候选 Action Chunk 重排或价值引导。

这可以用于候选动作重排、价值条件化、生成策略的 guidance 或低层技能选择。它不意味着 VLA 自动变成世界模型;必须明确新增了哪一个预测对象和训练信号。

9. 最小实验 ​

  1. 用真实轨迹拟合一维带摩擦动力学。
  2. 分别训练纯真实 Actor 和 imagined Actor。
  3. 扫描 imagination horizon。
  4. 人为增加动力学偏差,观察策略性能。
  5. 加入 ensemble 不确定性门控。
  6. 比较模型内回报、真实回报和 Critic 校准。

10. 论文坐标与证据边界 ​

想象学习的关键不是生成了多少轨迹,而是这些轨迹在哪些状态动作区域可信、Actor 的梯度怎样依赖模型,以及最终是否改善真实闭环。

工作论文事实作者解释课程判断
World Models先训练视觉潜变量模型与循环动力学,再让控制器在模型中训练压缩后的梦境可支持策略学习建立了清晰范式,但早期视觉游戏结果不能直接证明复杂接触机器人的可用性
MBPO从真实状态出发生成短模型 rollout,并与真实数据混合训练策略短 rollout 可平衡模型偏差与样本扩增是检验 imagination horizon 的重要基线;机器人上要进一步处理部分可观测和状态估计误差
Dreamer 系列在 RSSM 的潜在想象轨迹上用 lambda-return 训练价值和 Actor可微潜在想象能高效学习长时行为本课的核心路线;应同时报告模型损失、价值校准和真实任务收益,不能只报告最终分数
TD-MPC2结合潜在动力学、价值学习、策略先验与在线短时规划模型学习和局部规划可以共同扩展它不等同于纯 imagined actor,适合作为“想象训练与在线规划混合”的对照路线
RECAP / 机器人经验学习使用真实部署中的成功、失败和纠正继续改进策略真实经验可以弥补离线模仿不足为想象数据提供必要对照:没有真实回流,模型偏差无法被可靠发现和修正

11. 本课练习 ​

  1. 区分 imagined state 和真实观测的统计来源。
  2. 写出带终止概率的 TD 目标。
  3. 解释穿过世界模型的梯度为什么可能放大模型错误。
  4. 设计短想象、长想象和不确定性门控三组对照。
  5. 说明 VLA、世界模型和 Critic 的联合系统中每个模块学习什么。
  6. 把 Dreamer 抽象流程映射到一个真实机器人任务。

文章正文采用 Apache License 2.0