飞书原文 · 源修订 21
💡
课程定位: 本课不是按公司或论文罗列“世界模型产品”,而是回答一个更重要的问题:今天几条来源不同的技术路线,怎样逐步汇合成可供 Physical AI 使用的世界模型。
学习目标
完成本课后,读者应能画出五条世界模型谱系;解释杨立昆从 Autonomous Machine Intelligence 到 I-JEPA、V-JEPA、V-JEPA 2 的连续主张;解释李飞飞从视觉智能走向空间智能、持久三维世界与 World Labs 的技术动机;区分 Renderer、Simulator、Planner 与 Controller;并判断一个生成式世界模型是否真正进入了机器人闭环。
1. 为什么“世界模型”听起来越来越混乱
不同社区用同一个词回答不同问题。控制研究者关心状态转移是否足以稳定系统;强化学习研究者关心模型是否能提高样本效率与长期回报;视觉研究者关心表示是否理解对象、运动与空间;生成模型研究者关心是否能产生连续、可控的未来;机器人研究者最终关心的是预测能否改变动作,并在接触、延迟和扰动下提高真实成功率。
因此,世界模型不能只按“是否预测未来”分类。更有效的比较框架是六个问题:表示什么;预测什么;动作是否作为干预变量;谁消费输出;输出怎样进入物理闭环;什么证据证明它有控制价值。
2. 五条谱系及其核心矛盾
| 谱系 | 主要表示 | 主要预测 | 输出消费者 | 核心缺口 |
|---|---|---|---|---|
| 经典控制与系统辨识 | 可估计的物理状态与参数 | 动作作用后的状态转移 | Kalman Filter、MPC、轨迹优化器 | 开放世界感知和模型失配 |
| 决策潜在世界模型 | 奖励与控制相关 latent | latent、奖励、价值或策略 | 规划器、树搜索、Actor-Critic | 空间可解释性与真实物理 grounding |
| JEPA 预测表征 | 抽象、可预测的视觉—时序表征 | 被遮挡区域或未来的目标表示 | 下游识别、动作条件动力学与规划 | 表征好不自动等于控制好 |
| 空间智能 | 持久的对象、几何、视角与三维世界 | 新视角、空间关系和世界变化 | 渲染器、模拟器、空间推理与规划系统 | 几何一致不自动包含力与接触动力学 |
| 生成式交互环境与 WAM | 视频、世界状态、动作或其联合 token | 动作条件未来和可执行动作 | 数据引擎、规划器、策略或机器人 | 因果动作语义、时延和真实闭环证据 |
这些谱系不是按时间相互替代。现代系统经常同时借用多条路线:用大规模视频学习 JEPA 或生成式先验,用三维监督获得空间结构,用机器人动作数据进行 embodiment grounding,再由 MPC、价值函数或动作头把预测变成行为。
3. 地基:从“已知动力学”到“学习内部模型”
经典控制早已把模型放在闭环中央。状态空间模型写成 ;状态估计器从噪声观测恢复不可直接观测的状态;MPC 在模型中搜索有限时域动作,然后只执行第一步并重新观测。这一传统给出世界模型最严格的标准:动作是干预量,模型输出由决策器消费,而且预测误差最终要用闭环稳定性、约束违反和任务结果衡量。
World Models、PlaNet、Dreamer、MuZero 与 TD-MPC 把这一思想迁移到高维观测和学习表征中。它们形成“决策世界模型”谱系,详见 B5。现代视觉世界模型真正的新问题,不是重新发明内部模型,而是如何从海量无动作或弱动作视频中学到足够一般的世界结构,再以少量机器人数据把它接入控制。
4. 杨立昆路线:预测抽象结构,而不是重建所有像素
4.1 Autonomous Machine Intelligence:世界模型是分层智能的核心
杨立昆在 Autonomous Machine Intelligence 架构中把感知、世界模型、短期记忆、价值模块、行动者和配置器组织为一个系统。关键主张是:智能体需要在内部预测行动后果,并用目标或代价选择行动;但未来包含大量不可预测细节,逐像素生成并不是获得常识和规划能力的必要路径。
这一主张与传统模型式控制相通,却把学习目标从人工定义状态推进到可从感知数据学习的分层表征。它也解释了 JEPA 的出发点:模型应在信息更稳定、更抽象的空间预测未来。
4.2 I-JEPA:在图像表示空间预测缺失区域
I-JEPA 用上下文编码器读取可见图像区域,用目标编码器产生被遮挡区域的表示,再让预测器根据上下文和位置条件预测目标表示。抽象目标可写成:
读法: 预测器不负责复原目标区域的每个像素,而是逼近目标编码器给出的抽象表示。
它的价值在于跳过纹理、照明和随机细节,迫使表示保留对象级语义与结构。但 I-JEPA 本身主要是静态视觉表征学习:没有动作条件、没有显式奖励,也没有证明闭环控制。
4.3 V-JEPA:从空间缺失推进到视频时空预测
V-JEPA 把预测目标扩展到视频时空区域。上下文必须利用运动、对象持续性和时间结构去推断被遮挡内容,因此表示比单帧特征更接近动态世界。它仍然不以生成清晰像素为首要目标,而是学习可预测的视频表示。
这里必须区分“理解动态”与“理解动作后果”。自然视频可以教会模型物体怎样移动、人怎样交互,却不能自动告诉机器人某个关节动作会造成什么结果。没有动作与本体状态,模型学习到的主要是观察动力学,而不是可干预动力学。
4.4 V-JEPA 2:从视频表征接到动作条件规划
V-JEPA 2 将大规模视频自监督表示与动作条件世界模型连接,并展示 zero-shot planning 与机器人控制。这一步使 JEPA 路线第一次清晰跨过“好表征”到“可用于决策的预测模型”之间的桥:先用视频学习世界的抽象规律,再用带动作的机器人轨迹学习 ,最后在 latent 中比较候选动作。
最关键的证据不是视频 benchmark,而是固定机器人数据量后,预训练是否提高反事实动作预测、规划效率和真实任务成功率。JEPA 的优势假设是抽象表示能减少像素噪声和 rollout 成本;风险则是编码器也可能丢掉接触点、微小间隙、摩擦变化等控制关键细节。
5. 李飞飞路线:从视觉识别走向空间智能
5.1 从“图里有什么”到“世界怎样存在”
以 ImageNet 为代表的视觉智能推动机器识别对象,但 Physical AI 需要回答更具体的问题:对象在哪里;不同视角下是否仍是同一对象;遮挡后是否持续存在;人或机器人能否绕行、抓取、推动或进入;环境改变后空间关系怎样更新。李飞飞所强调的 spatial intelligence,正是从二维识别走向三维、持久、可交互世界理解。
这条路线与 JEPA 的差异在于关注重点。JEPA 首先追问“什么表示值得预测”;空间智能首先追问“智能体必须理解什么样的世界”。前者强调预测目标的抽象层级,后者强调对象、几何、视角、持续性和可供性必须在表示中有落点。
5.2 World Labs 与 Marble:可生成、可探索、可导出的三维世界
World Labs 的 Marble 展示了从文本、图像、视频或粗略布局创建三维世界,并支持视角探索以及 splat、mesh、video 等输出。它的重要性不只是“3D 内容生成”,而是把世界表示从一段固定视频提升为可从新视角查询、可持续探索的空间对象。
但 Marble 更接近通用空间世界生成与渲染基础设施,而不是已经完成的机器人动力学模型。一个场景可以在几何和外观上连贯,却仍未建模物体质量、摩擦、接触刚度、驱动器限制与控制延迟。空间智能为 Physical AI 提供必要的世界结构,但还需要动作干预和物理反馈完成 grounding。
5.3 Renderer、Simulator、Planner:有用的功能分类,而非统一学术定义
World Labs 在 2026 年提出 Renderer、Simulator、Planner 的功能分类:Renderer 根据世界表示产生可观察结果;Simulator 根据动作或事件推进世界状态;Planner 在模型中比较未来并选择行为。这个分类有助于辨认一个系统实际提供什么功能,但它是工程功能学,而不是整个学术界已统一接受的世界模型定义。
| 功能 | 输入 | 输出 | Physical AI 的验证问题 |
|---|---|---|---|
| Renderer | 世界状态与相机条件 | 图像、深度或新视角 | 跨视角几何和对象身份是否一致 |
| Simulator | 当前状态与动作/事件 | 下一状态或未来轨迹 | 动作替换后,未来是否产生正确反事实分叉 |
| Planner | 目标、候选行为与预测模型 | 动作、子目标或计划 | 是否提高真实闭环成功率并控制风险 |
| Controller | 参考轨迹、状态反馈与约束 | 关节位置、速度、力矩或接触力 | 稳定性、延迟、扰动恢复和约束满足 |
Controller 必须单独列出,因为生成世界、模拟未来与选择计划都不能替代高频物理执行。对人形机器人尤其如此:世界模型可以给出视觉子目标或短时轨迹,但 Whole-Body Controller 仍负责平衡、接触切换、力矩限制和扰动恢复。
6. 生成式模拟器路线:从视频分布到可交互环境
UniSim、Genie、Genie 2 与 Cosmos 代表另一种扩展方式:利用大规模生成模型把视频先验变成可控环境、训练数据或 Physical AI 基础设施。它们共同说明互联网视频和真实世界视频中包含丰富的对象、运动与场景变化规律,但“可控制”有多个强度等级。
| 路线 | 动作从哪里来 | 主要产物 | 不能跳过的审计 |
|---|---|---|---|
| UniSim | 数据中的动作或控制条件 | 生成式交互模拟器 | 动作语义、长时一致性、sim-to-real 收益 |
| Genie | 从视频发现的潜在动作 | 可交互生成环境 | 潜在动作怎样对应真实本体与控制频率 |
| Genie 2 | 用户/智能体交互条件 | 大规模可交互世界生成 | 环境一致性、任务可评测性与物理可信度 |
| Cosmos | 多种条件与 Physical AI 数据 | 世界生成模型和数据基础设施 | 合成数据偏差、条件正确性和下游闭环增益 |
生成逼真未来只证明模型拟合了视觉分布。要升级为控制世界模型,动作必须成为真正的干预变量:固定初始观测、替换动作时,预测世界应按物理方向分叉;预测还必须被规划器或策略消费,并最终改变真实任务结果。
7. 杨立昆与李飞飞:两条路线怎样汇合
| 比较维度 | 杨立昆/JEPA 脉络 | 李飞飞/空间智能脉络 | 汇合后的要求 |
|---|---|---|---|
| 首要问题 | 预测什么抽象表示最有价值 | 智能必须理解怎样的三维世界 | 学习既可预测又空间落地的状态 |
| 对像素生成的态度 | 不必重建不可预测细节 | 渲染是查询世界的一种接口 | 像素输出可选,世界结构不可缺 |
| 时间 | 通过视频预测学习动态规律 | 要求对象与空间跨视角、跨时间持续 | 形成持久的时变三维状态 |
| 动作 | 需额外动作条件模型连接规划 | 需把可探索世界推进到可干预世界 | 动作成为因果干预变量 |
| 控制缺口 | 抽象表示可能忽略精细接触 | 几何世界可能缺少力学与执行器约束 | 结合本体、力觉、延迟与闭环反馈 |
可以把二者的交点概括为:JEPA 解决“不要预测无关细节”,空间智能解决“不能丢掉世界结构”。 对 Physical AI 而言,好的世界状态既要压缩,又要保留对象、几何、接触和可达性;既能预测自然演化,也能回答动作干预;既能服务高层规划,也能向下连接控制器。
8. 从表征到控制:必须跨过四道门
- 可预测表征。 模型能从历史中预测对象、运动或抽象未来,而不只是记忆数据集纹理。
- 动作 grounding。 机器人动作、本体状态和时间对齐进入模型;动作改变时预测发生正确反事实变化。
- 决策接口。 预测被 MPC、搜索、价值函数、策略或动作头实际消费,而不是只用于可视化。
- 物理闭环。 系统在真实接触、延迟、扰动和分布外条件下提高成功率、恢复率与安全性。
任何只完成前两步的工作,都可以是优秀的世界表征或模拟器,但不应直接宣称已经获得控制可用的物理世界模型。
9. 为什么下一步自然走向 4D 与 World Action Models
JEPA 提供高效的预测表示,空间智能要求持久三维结构,生成式模拟器提供高容量未来生成,决策世界模型提供规划和价值接口。它们的自然汇合点,是同时处理历史观测、时变三维世界、动作与任务条件的模型。
4D 在这里指 3D + time:模型不仅生成二维视频,还要保持跨视角、跨时间的几何一致性。World Action Model 则进一步把未来世界与动作生成放进联合模型。二者解决的是“空间世界怎样变化”与“机器人怎样行动”的耦合,但仍不等于完整物理:质量、摩擦、接触力、顺应性、驱动器动态和延迟可能仍不可辨识。
B7 将具体拆解 WAM4D、X-WAM、因果可见性、异步去噪、几何监督、World–Action 一致性、Whole-Body Control 接口与真实闭环评测。本课只负责建立入口,避免与 B7 重复。
10. 一套不会被模型名字带偏的评审表
| 问题 | 最低证据 | 常见误判 |
|---|---|---|
| 表示了什么 | 探针、可视化或消融证明对象、几何、动作相关变量存在 | latent 维度大就等于信息完整 |
| 预测了什么 | 多步、分层和分布外预测误差 | 单帧清晰等于长期正确 |
| 动作是否因果 | 固定观测改变动作、打乱动作—视频配对的干预实验 | 输入中有 action token 就等于理解动作 |
| 谁消费输出 | 明确规划器、价值函数、策略或控制器接口 | 展示生成视频就称为规划 |
| 怎样进入闭环 | 传感频率、推理延迟、重规划频率、低层控制接口 | 离线 benchmark 可以替代执行系统 |
| 是否改善控制 | 固定数据和计算预算的真实成功率、恢复率、安全与校准 | 几何或视频指标提高必然带来控制收益 |
11. 推荐阅读顺序
先读 B0 建立统一定义,再读 B1/B2 理解潜在动力学与模型式规划;用 B5 掌握 World Models、Dreamer、MuZero、TD-MPC 的决策谱系;本课用于理解 JEPA、空间智能和生成式模拟器的现代汇合;最后读 B7,进入 4D 世界状态、WAM 与 Whole-Body Control 的系统接口。
12. 主要资料
- A Path Towards Autonomous Machine Intelligence
- Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
- Revisiting Feature Prediction for Learning Visual Representations from Video
- V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
- Meta: V-JEPA 2 World Models and Benchmarks
- Fei-Fei Li: With Spatial Intelligence, AI Will Understand the Real World
- World Labs: Marble World Model
- World Labs: A Functional Taxonomy of World Models
- UniSim
- Genie
- Genie 2
- NVIDIA Cosmos
13. 检查题
- 为什么 JEPA 的“预测抽象表示”不等于已经学会机器人控制?
- 李飞飞所说的空间智能,相比二维视觉识别增加了哪些必须持续存在的变量?
- 为什么一个优秀 Renderer 不一定是 Simulator,一个优秀 Simulator 也不一定是 Planner?
- 设计一个实验,区分模型是在利用动作条件,还是只在延续数据集中的常见视频模式。
- 解释 4D 几何为什么是物理世界模型的重要条件,却不是充分条件。
- 在人形机器人中,世界模型、MPC 与 Whole-Body Controller 应如何分工?

