跳到正文

飞书原文 · 源修订 21

💡

课程定位: 本课不是按公司或论文罗列“世界模型产品”,而是回答一个更重要的问题:今天几条来源不同的技术路线,怎样逐步汇合成可供 Physical AI 使用的世界模型。

学习目标 ​

完成本课后,读者应能画出五条世界模型谱系;解释杨立昆从 Autonomous Machine Intelligence 到 I-JEPA、V-JEPA、V-JEPA 2 的连续主张;解释李飞飞从视觉智能走向空间智能、持久三维世界与 World Labs 的技术动机;区分 Renderer、Simulator、Planner 与 Controller;并判断一个生成式世界模型是否真正进入了机器人闭环。

1. 为什么“世界模型”听起来越来越混乱 ​

不同社区用同一个词回答不同问题。控制研究者关心状态转移是否足以稳定系统;强化学习研究者关心模型是否能提高样本效率与长期回报;视觉研究者关心表示是否理解对象、运动与空间;生成模型研究者关心是否能产生连续、可控的未来;机器人研究者最终关心的是预测能否改变动作,并在接触、延迟和扰动下提高真实成功率。

因此,世界模型不能只按“是否预测未来”分类。更有效的比较框架是六个问题:表示什么;预测什么;动作是否作为干预变量;谁消费输出;输出怎样进入物理闭环;什么证据证明它有控制价值。

2. 五条谱系及其核心矛盾 ​

谱系主要表示主要预测输出消费者核心缺口
经典控制与系统辨识可估计的物理状态与参数动作作用后的状态转移Kalman Filter、MPC、轨迹优化器开放世界感知和模型失配
决策潜在世界模型奖励与控制相关 latentlatent、奖励、价值或策略规划器、树搜索、Actor-Critic空间可解释性与真实物理 grounding
JEPA 预测表征抽象、可预测的视觉—时序表征被遮挡区域或未来的目标表示下游识别、动作条件动力学与规划表征好不自动等于控制好
空间智能持久的对象、几何、视角与三维世界新视角、空间关系和世界变化渲染器、模拟器、空间推理与规划系统几何一致不自动包含力与接触动力学
生成式交互环境与 WAM视频、世界状态、动作或其联合 token动作条件未来和可执行动作数据引擎、规划器、策略或机器人因果动作语义、时延和真实闭环证据

这些谱系不是按时间相互替代。现代系统经常同时借用多条路线:用大规模视频学习 JEPA 或生成式先验,用三维监督获得空间结构,用机器人动作数据进行 embodiment grounding,再由 MPC、价值函数或动作头把预测变成行为。

3. 地基:从“已知动力学”到“学习内部模型” ​

经典控制早已把模型放在闭环中央。状态空间模型写成 ;状态估计器从噪声观测恢复不可直接观测的状态;MPC 在模型中搜索有限时域动作,然后只执行第一步并重新观测。这一传统给出世界模型最严格的标准:动作是干预量,模型输出由决策器消费,而且预测误差最终要用闭环稳定性、约束违反和任务结果衡量。

World Models、PlaNet、Dreamer、MuZero 与 TD-MPC 把这一思想迁移到高维观测和学习表征中。它们形成“决策世界模型”谱系,详见 B5。现代视觉世界模型真正的新问题,不是重新发明内部模型,而是如何从海量无动作或弱动作视频中学到足够一般的世界结构,再以少量机器人数据把它接入控制。

4. 杨立昆路线:预测抽象结构,而不是重建所有像素 ​

4.1 Autonomous Machine Intelligence:世界模型是分层智能的核心 ​

杨立昆在 Autonomous Machine Intelligence 架构中把感知、世界模型、短期记忆、价值模块、行动者和配置器组织为一个系统。关键主张是:智能体需要在内部预测行动后果,并用目标或代价选择行动;但未来包含大量不可预测细节,逐像素生成并不是获得常识和规划能力的必要路径。

这一主张与传统模型式控制相通,却把学习目标从人工定义状态推进到可从感知数据学习的分层表征。它也解释了 JEPA 的出发点:模型应在信息更稳定、更抽象的空间预测未来。

4.2 I-JEPA:在图像表示空间预测缺失区域 ​

I-JEPA 用上下文编码器读取可见图像区域,用目标编码器产生被遮挡区域的表示,再让预测器根据上下文和位置条件预测目标表示。抽象目标可写成:

读法: 预测器不负责复原目标区域的每个像素,而是逼近目标编码器给出的抽象表示。

它的价值在于跳过纹理、照明和随机细节,迫使表示保留对象级语义与结构。但 I-JEPA 本身主要是静态视觉表征学习:没有动作条件、没有显式奖励,也没有证明闭环控制。

4.3 V-JEPA:从空间缺失推进到视频时空预测 ​

V-JEPA 把预测目标扩展到视频时空区域。上下文必须利用运动、对象持续性和时间结构去推断被遮挡内容,因此表示比单帧特征更接近动态世界。它仍然不以生成清晰像素为首要目标,而是学习可预测的视频表示。

这里必须区分“理解动态”与“理解动作后果”。自然视频可以教会模型物体怎样移动、人怎样交互,却不能自动告诉机器人某个关节动作会造成什么结果。没有动作与本体状态,模型学习到的主要是观察动力学,而不是可干预动力学。

4.4 V-JEPA 2:从视频表征接到动作条件规划 ​

V-JEPA 2 将大规模视频自监督表示与动作条件世界模型连接,并展示 zero-shot planning 与机器人控制。这一步使 JEPA 路线第一次清晰跨过“好表征”到“可用于决策的预测模型”之间的桥:先用视频学习世界的抽象规律,再用带动作的机器人轨迹学习 ,最后在 latent 中比较候选动作。

最关键的证据不是视频 benchmark,而是固定机器人数据量后,预训练是否提高反事实动作预测、规划效率和真实任务成功率。JEPA 的优势假设是抽象表示能减少像素噪声和 rollout 成本;风险则是编码器也可能丢掉接触点、微小间隙、摩擦变化等控制关键细节。

5. 李飞飞路线:从视觉识别走向空间智能 ​

5.1 从“图里有什么”到“世界怎样存在” ​

以 ImageNet 为代表的视觉智能推动机器识别对象,但 Physical AI 需要回答更具体的问题:对象在哪里;不同视角下是否仍是同一对象;遮挡后是否持续存在;人或机器人能否绕行、抓取、推动或进入;环境改变后空间关系怎样更新。李飞飞所强调的 spatial intelligence,正是从二维识别走向三维、持久、可交互世界理解。

这条路线与 JEPA 的差异在于关注重点。JEPA 首先追问“什么表示值得预测”;空间智能首先追问“智能体必须理解什么样的世界”。前者强调预测目标的抽象层级,后者强调对象、几何、视角、持续性和可供性必须在表示中有落点。

5.2 World Labs 与 Marble:可生成、可探索、可导出的三维世界 ​

World Labs 的 Marble 展示了从文本、图像、视频或粗略布局创建三维世界,并支持视角探索以及 splat、mesh、video 等输出。它的重要性不只是“3D 内容生成”,而是把世界表示从一段固定视频提升为可从新视角查询、可持续探索的空间对象。

但 Marble 更接近通用空间世界生成与渲染基础设施,而不是已经完成的机器人动力学模型。一个场景可以在几何和外观上连贯,却仍未建模物体质量、摩擦、接触刚度、驱动器限制与控制延迟。空间智能为 Physical AI 提供必要的世界结构,但还需要动作干预和物理反馈完成 grounding。

5.3 Renderer、Simulator、Planner:有用的功能分类,而非统一学术定义 ​

World Labs 在 2026 年提出 Renderer、Simulator、Planner 的功能分类:Renderer 根据世界表示产生可观察结果;Simulator 根据动作或事件推进世界状态;Planner 在模型中比较未来并选择行为。这个分类有助于辨认一个系统实际提供什么功能,但它是工程功能学,而不是整个学术界已统一接受的世界模型定义。

功能输入输出Physical AI 的验证问题
Renderer世界状态与相机条件图像、深度或新视角跨视角几何和对象身份是否一致
Simulator当前状态与动作/事件下一状态或未来轨迹动作替换后,未来是否产生正确反事实分叉
Planner目标、候选行为与预测模型动作、子目标或计划是否提高真实闭环成功率并控制风险
Controller参考轨迹、状态反馈与约束关节位置、速度、力矩或接触力稳定性、延迟、扰动恢复和约束满足

Controller 必须单独列出,因为生成世界、模拟未来与选择计划都不能替代高频物理执行。对人形机器人尤其如此:世界模型可以给出视觉子目标或短时轨迹,但 Whole-Body Controller 仍负责平衡、接触切换、力矩限制和扰动恢复。

6. 生成式模拟器路线:从视频分布到可交互环境 ​

UniSim、Genie、Genie 2 与 Cosmos 代表另一种扩展方式:利用大规模生成模型把视频先验变成可控环境、训练数据或 Physical AI 基础设施。它们共同说明互联网视频和真实世界视频中包含丰富的对象、运动与场景变化规律,但“可控制”有多个强度等级。

路线动作从哪里来主要产物不能跳过的审计
UniSim数据中的动作或控制条件生成式交互模拟器动作语义、长时一致性、sim-to-real 收益
Genie从视频发现的潜在动作可交互生成环境潜在动作怎样对应真实本体与控制频率
Genie 2用户/智能体交互条件大规模可交互世界生成环境一致性、任务可评测性与物理可信度
Cosmos多种条件与 Physical AI 数据世界生成模型和数据基础设施合成数据偏差、条件正确性和下游闭环增益

生成逼真未来只证明模型拟合了视觉分布。要升级为控制世界模型,动作必须成为真正的干预变量:固定初始观测、替换动作时,预测世界应按物理方向分叉;预测还必须被规划器或策略消费,并最终改变真实任务结果。

7. 杨立昆与李飞飞:两条路线怎样汇合 ​

比较维度杨立昆/JEPA 脉络李飞飞/空间智能脉络汇合后的要求
首要问题预测什么抽象表示最有价值智能必须理解怎样的三维世界学习既可预测又空间落地的状态
对像素生成的态度不必重建不可预测细节渲染是查询世界的一种接口像素输出可选,世界结构不可缺
时间通过视频预测学习动态规律要求对象与空间跨视角、跨时间持续形成持久的时变三维状态
动作需额外动作条件模型连接规划需把可探索世界推进到可干预世界动作成为因果干预变量
控制缺口抽象表示可能忽略精细接触几何世界可能缺少力学与执行器约束结合本体、力觉、延迟与闭环反馈

可以把二者的交点概括为:JEPA 解决“不要预测无关细节”,空间智能解决“不能丢掉世界结构”。 对 Physical AI 而言,好的世界状态既要压缩,又要保留对象、几何、接触和可达性;既能预测自然演化,也能回答动作干预;既能服务高层规划,也能向下连接控制器。

8. 从表征到控制:必须跨过四道门 ​

  1. 可预测表征。 模型能从历史中预测对象、运动或抽象未来,而不只是记忆数据集纹理。
  2. 动作 grounding。 机器人动作、本体状态和时间对齐进入模型;动作改变时预测发生正确反事实变化。
  3. 决策接口。 预测被 MPC、搜索、价值函数、策略或动作头实际消费,而不是只用于可视化。
  4. 物理闭环。 系统在真实接触、延迟、扰动和分布外条件下提高成功率、恢复率与安全性。

任何只完成前两步的工作,都可以是优秀的世界表征或模拟器,但不应直接宣称已经获得控制可用的物理世界模型。

9. 为什么下一步自然走向 4D 与 World Action Models ​

JEPA 提供高效的预测表示,空间智能要求持久三维结构,生成式模拟器提供高容量未来生成,决策世界模型提供规划和价值接口。它们的自然汇合点,是同时处理历史观测、时变三维世界、动作与任务条件的模型。

4D 在这里指 3D + time:模型不仅生成二维视频,还要保持跨视角、跨时间的几何一致性。World Action Model 则进一步把未来世界与动作生成放进联合模型。二者解决的是“空间世界怎样变化”与“机器人怎样行动”的耦合,但仍不等于完整物理:质量、摩擦、接触力、顺应性、驱动器动态和延迟可能仍不可辨识。

B7 将具体拆解 WAM4D、X-WAM、因果可见性、异步去噪、几何监督、World–Action 一致性、Whole-Body Control 接口与真实闭环评测。本课只负责建立入口,避免与 B7 重复。

10. 一套不会被模型名字带偏的评审表 ​

问题最低证据常见误判
表示了什么探针、可视化或消融证明对象、几何、动作相关变量存在latent 维度大就等于信息完整
预测了什么多步、分层和分布外预测误差单帧清晰等于长期正确
动作是否因果固定观测改变动作、打乱动作—视频配对的干预实验输入中有 action token 就等于理解动作
谁消费输出明确规划器、价值函数、策略或控制器接口展示生成视频就称为规划
怎样进入闭环传感频率、推理延迟、重规划频率、低层控制接口离线 benchmark 可以替代执行系统
是否改善控制固定数据和计算预算的真实成功率、恢复率、安全与校准几何或视频指标提高必然带来控制收益

11. 推荐阅读顺序 ​

先读 B0 建立统一定义,再读 B1/B2 理解潜在动力学与模型式规划;用 B5 掌握 World Models、Dreamer、MuZero、TD-MPC 的决策谱系;本课用于理解 JEPA、空间智能和生成式模拟器的现代汇合;最后读 B7,进入 4D 世界状态、WAM 与 Whole-Body Control 的系统接口。

12. 主要资料 ​

13. 检查题 ​

  1. 为什么 JEPA 的“预测抽象表示”不等于已经学会机器人控制?
  2. 李飞飞所说的空间智能,相比二维视觉识别增加了哪些必须持续存在的变量?
  3. 为什么一个优秀 Renderer 不一定是 Simulator,一个优秀 Simulator 也不一定是 Planner?
  4. 设计一个实验,区分模型是在利用动作条件,还是只在延续数据集中的常见视频模式。
  5. 解释 4D 几何为什么是物理世界模型的重要条件,却不是充分条件。
  6. 在人形机器人中,世界模型、MPC 与 Whole-Body Controller 应如何分工?

文章正文采用 Apache License 2.0