飞书源目录 · 源修订 91
💡
适合读者: 具备概率统计、线性代数和基础深度学习知识,希望快速建立 Physical AI 全景的算法、数据和机器人系统人员。本目录不按公司或论文发布时间组织,而按模型实际学习的数学对象划分路线。
如何使用这份目录
Physical AI 不是一条单线技术路径。直接策略、世界模型、价值学习、分层规划、数据表征、控制和系统工程分别解决不同问题,又在同一个物理闭环中组合。
所有读者先完成“公共地基”,然后选择一条主路线深入。文章的主归属只表示最适合从哪里进入,不表示它只与这一条路线有关。跨路线关系会在每个模块后明确标注。
课程统一质量标准
本课程面向具备大学概率统计、线性代数和基础深度学习知识的读者。每门机制课和论文实验室都必须通过以下门槛,才算完成。
| 门槛 | 必须回答 |
|---|---|
| 学习对象 | 模型究竟在估计分布、状态、价值、子目标、表征还是控制律 |
| 公式读法 | 每个独立公式后紧跟引用块,用口语逐项读出条件、随机变量与算子 |
| 推导 | 说明公式从哪个概率假设、定义、物理方程或优化目标得到,不允许只给结果 |
| 可视化 | 至少有一张真正降低理解成本的计算图、概率图、闭环图或曲线 |
| 最小实验 | 读者能用玩具环境复现关键现象,而不是只能相信论文结论 |
| 论文坐标 | 区分事实、作者解释和课程判断,并与同路线强基线比较 |
| 闭环风险 | 讨论分布偏移、接触、延迟、观测缺失、安全与失败恢复 |
公式统一采用“四步解释”:先给公式,再给引用格式读法,然后给推导,最后说明它在机器人闭环中的含义。
读法块示例: 这里不是重复念字母,而是说明“根据什么条件,预测什么随机量,求和或期望覆盖哪些情况”。
行内符号由本节符号表统一解释;所有承担定义、损失、动力学、更新规则或推理过程的独立公式,必须逐式提供引用读法与推导。
00|公共地基:所有路线共享的语言
核心问题: 状态、观测、动作、轨迹和策略分别是什么?训练分布为什么会在部署时改变?概率模型的损失函数怎样变成真实机器人行为?
00.1|公共地基总课
00|Physical AI 公共地基:智能体究竟在学习什么
论文与推导实验室: 行为克隆、分布偏移与 Flow Matching 深入推导
学习对象: 条件动作分布、最大似然、均方误差、多峰动作、Action Chunk 与部署分布偏移。
00.2|Physical AI 模块边界
| 模块 | 主要数学对象 | 回答的问题 |
|---|---|---|
| 策略 | 条件动作分布 | 现在应该做什么 |
| 世界模型 | 动作条件状态转移分布 | 这样做以后会发生什么 |
| 价值函数 | 状态价值与动作价值 | 未来有多好 |
| 规划器 | 候选行动序列或子目标 | 应该选择哪条路径 |
| 控制器 | 反馈控制律 | 如何稳定执行 |
路线 A|VLA 与直接策略学习
路线问题: 能否直接从视觉、语言和本体状态生成机器人动作?这条路线学习的是条件动作分布,是目前通用机器人策略和机器人基础模型的主要方向。
A0|路线总课:VLA 与直接策略学习
交叉关系: 使用路线 E 的数据和表征;可被路线 C 的价值信号继续改进;最终交给路线 F 的控制系统执行。
A1|专题实验室:动作表示与 FAST
动作表示:MSE、自回归 Token、Diffusion、Flow Matching 与 FAST
核心问题: 策略究竟输出条件均值、离散动作序列、score,还是概率流向量场?
A2|主流 VLA 谱系与架构演进
RT、Open X、Octo、OpenVLA、GR00T 与 Gemini Robotics
核心问题: 除 π 系列外,主流 VLA 如何把多任务模仿、视觉语言预训练、跨本体数据和生成式动作模块组合起来?能力提升究竟来自架构、数据还是后训练?
A3|Physical Intelligence π 系列论文实验室
| 实验室 | 文章 | 在 VLA 路线中研究什么 | 交叉路线 |
|---|---|---|---|
| A3.1|π0 | VLM 如何接上连续控制 | 多模态条件与 Action Expert | E、F |
| A3.2|FAST | 动作为什么需要 Tokenizer | 离散动作预训练与连续控制接口 | E |
| A3.3|π0.5 | 开放世界泛化如何被训练出来 | 异构共训练、层级推理与后训练 | D、E |
| A3.4|π0.6* / RECAP | 从成功、失败与纠正中改进 | 通用 VLA 如何使用部署经验继续优化 | C、G |
| A3.5|π0.7 | 从通用策略到可操控模型 | Prompt、视觉子目标、自动分层与可控性 | B、D、E |
| A3.6|OpenPI | OpenPI 实践与数据生产 | VLA 训练、数据格式和部署工程 | G |
建议顺序: A0 → A1 → A2 → π0 → π0.5 → π0.6* → π0.7。FAST 可在 π0 后独立学习。
路线 B|世界模型与模型式规划
路线问题: 能否学习动作条件下的未来变化,并在模型中比较“如果这样做会发生什么”?
B0|路线总课:世界模型与模型式规划
世界模型与规划:状态空间模型、ELBO、MPC、CEM 与想象学习
B1-B7|世界模型路线课程树
| 模块 | 核心问题 | 课程 |
|---|---|---|
| B1|状态空间与潜在动力学 | 如何从部分可观测数据构造可预测状态 | 状态空间、滤波、ELBO 与多步 rollout |
| B2|模型式规划 | 如何在学到的模型中搜索动作 | MPC、CEM、轨迹优化与风险规划 |
| B3|想象学习 | 如何用 latent rollout 训练 Actor-Critic | Dreamer、模型梯度与想象偏差 |
| B4|视频世界模型 | 视觉未来如何成为子目标和控制条件 | 视频预测、视觉规划与物理一致性 |
| B5|决策世界模型谱系 | 内部模型怎样通过想象、搜索和 MPC 产生决策 | 从 World Models、Dreamer 到 TD-MPC2 |
| B6|现代世界模型思想谱系 | JEPA、空间智能与生成式模拟器如何汇合 | 杨立昆、李飞飞与现代世界模型路线图 |
| B7|4D 世界状态与 World Action Models | 动作、未来世界和时变三维结构如何联合建模并进入物理闭环 | 从思想汇合、几何预测到可执行未来 |
推荐顺序: 先用 B0 建立五条谱系与统一比较框架;B1-B4 补齐状态、规划、想象学习和视频预测;B5 深入决策世界模型;B6 理解杨立昆的 JEPA 路线、李飞飞的空间智能路线与生成式模拟器;最后进入 B7 的 4D-WAM、Whole-Body Control 接口与闭环证据。
交叉关系: 向路线 D 提供子目标和反事实推演;向路线 C 提供想象数据;π0.7 的视觉子目标和 WAM-TTT 可作为交叉案例。
路线 C|价值、奖励与经验学习
路线问题: 机器人如何判断哪些状态和动作长期更好,并利用部署中的成功、失败、偏好和纠正改进策略?
C0|路线总课:价值、奖励与经验学习
C0|价值、奖励与经验学习:Physical AI 如何从结果中改进行为
C1-C4|价值与经验学习课程树
| 模块 | 核心问题 | 课程 |
|---|---|---|
| C1|Bellman 与 Actor-Critic | 长期结果怎样更新策略 | TD、策略梯度、Advantage 与连续控制 |
| C2|Offline RL | 固定数据怎样超越行为克隆 | 分布外高估、CQL、IQL 与 AWR |
| C3|偏好与人工纠正 | 人类反馈如何成为奖励和恢复监督 | 奖励模型、DAgger、接管与主动反馈 |
| C4|论文实验室 | 在线、离线、纠正和 VLA 经验学习如何比较 | SAC、CQL、IQL、DAgger 与 RECAP |
交叉关系: π0.6* / RECAP 主归属 VLA 论文实验室,同时是本路线的核心案例;世界模型可以为本路线提供想象 rollout。
路线 D|分层规划、技能、推理与记忆
路线问题: 长时任务如何拆成子目标?高层语言或视觉计划如何调用低层连续策略?模型如何记住演示并在测试时适应?
D0|路线总课:分层规划、技能与记忆
D0|分层规划、技能与记忆:Physical AI 如何完成长时任务
专题实验室: 物理因果与具身思维链
D1-D4|分层智能课程树
| 模块 | 核心问题 | 课程 |
|---|---|---|
| D1|Options 与层级 RL | 怎样学习可启动、可终止和可复用的技能 | Options、Semi-MDP、技能发现与组合 |
| D2|子目标与具身推理 | 语言计划怎样变成可达、可验证的闭环子目标 | 任务图、世界模型、视觉子目标与恢复 |
| D3|记忆与测试时适应 | 当前环境的新经验怎样写入策略 | 上下文、外部记忆、快速权重与 WAM-TTT |
| D4|论文实验室 | 传统层级 RL 与新型 VLA 分层系统如何比较 | Options、具身思维链、π0.7 与 WAM-TTT |
路线 E|感知、状态、数据与跨本体学习
路线问题: 机器人怎样从不完整观测中构造空间状态?没有动作标签的人类视频能提供什么?不同机器人、相机、坐标系和动作空间又如何进入共同训练?
E0|路线总课:数据、表征与跨本体学习
专题实验室: 人类视频没有速度标签
E1-E6|感知、数据与跨本体课程树
| 模块 | 核心问题 | 课程 |
|---|---|---|
| E1|视频运动与对象中心表征 | 没有动作标签时如何读取运动和交互 | 光流、关键点、手-物表示与事件 |
| E1.5|空间状态估计与三维几何 | 机器人怎样从观测历史确定自身、对象与不确定性 | Bayes filter、SE(3)、深度、对象状态与可供性 |
| E3|Latent Action 与逆动力学 | 如何从状态变化发现行为变量 | 逆模型、潜在动作、不可辨识性与适配 |
| E4|Behavior Tokenizer | 如何把行为变成可组合的语义单元 | VQ、事件边界、分层 token 与 FAST |
| E5|跨本体对齐与共训练 | 不同机器人怎样共享数据而不混淆动作 | Adapter、对象中心动作、数据混合与迁移 |
| E6|论文实验室 | 人类数据进入机器人训练的主要机制如何比较 | R3M、MimicPlay、ATM、HumanPlus 与 WAM-TTT |
交叉关系: 为路线 A 提供动作和语义监督,为路线 B 提供时序表征,为路线 D 提供演示和记忆输入。π0.5 是异构共训练案例,WAM-TTT 是人类演示适应案例。
路线 F|动力学、控制与物理交互
路线问题: 学习模型输出的动作如何稳定、安全地作用于有质量、摩擦、接触、柔顺性和延迟的真实系统?
F0|路线总课:动力学、控制与物理交互
F1-F5|动力学、接触与全身控制课程树
| 模块 | 核心问题 | 课程 |
|---|---|---|
| F1|反馈控制与稳定性 | 策略输出怎样在采样、饱和与延迟下稳定跟踪 | 状态空间、PD、Lyapunov、轨迹跟踪与策略接口 |
| F2|接触、阻抗与触觉 | 机器人如何在摩擦、碰撞和柔顺环境中“碰得对” | 接触约束、摩擦锥、力控、阻抗与触觉闭环 |
| F3|系统辨识与 Sim-to-Real | 如何估计真实动力学、处理延迟并跨过仿真差异 | 最小二乘、可辨识性、随机化、在线适应与延迟 |
| F4|人形、移动与全身控制 | 如何处理动态平衡、落脚、接触切换和全身协调 | 浮动基动力学、质心控制、Locomotion RL 与高低层接口 |
| F5|论文与工程实验室 | 经典控制、MPC、Residual RL 和鲁棒学习如何公平比较 | 从经典控制到 Residual RL 与 Sim-to-Real |
交叉关系: 路线 A、B、D 最终都必须通过本路线接受真实执行检验;本路线产生的失败和传感数据回流到路线 G 与 E。
路线 G|系统、可信评测与数据引擎
路线问题: 如何把算法变成可复现、可部署、可审计的真实机器人系统,并通过失败数据持续迭代?
G0|路线总课:系统、可信评测与数据引擎
G0|系统、可信评测与数据引擎:如何证明 Physical AI 真的有效
工程实验室: OpenPI 实践与 ArcheBase 数据生产
G1-G4|系统与可信工程课程树
| 模块 | 核心问题 | 课程 |
|---|---|---|
| G1|统计评测与不确定性 | 怎样证明提升真实存在,并知道证据有多不确定 | Wilson 区间、分层估计、校准与风险覆盖 |
| G2|数据引擎与复现 | 怎样让数据、训练和模型的全部事实可追溯 | Schema、时间同步、版本、Lineage 与质量门禁 |
| G3|部署安全与回归 | 模型上线后怎样监控、降级、接管、回滚和持续守住边界 | 安全包络、运行时监控、Canary 与事故回归 |
| G4|OpenPI 系统实验室 | 怎样从 VLA 数据与 checkpoint 走到可回滚的机器人部署 | 从数据契约、训练、推理服务到失败回流 |
补充工程案例: OpenPI 实践与 ArcheBase 数据生产
快速学习路径
| 目标 | 路径 | 完成标准 |
|---|---|---|
| 五天建立全景 | 00 → A0 → B0/C0 → D0/E0 → F0/G0 | 能从学习对象、监督信号、推理方式和闭环风险比较所有路线 |
| VLA 算法 | 00 → A0 → π 系列实验室 → C0 → F0/G0 | 能解释 VLA 训练、动作生成、经验改进和真实执行 |
| 世界模型 | 00 → B0 → C0 → D0 → F0/G0 | 能实现 latent dynamics 与 MPC,并验证真实控制收益 |
| 人类数据 | 00 → E0 → E 专题实验室 → A0 → D0 → G0 | 能设计跨本体表示、潜在动作和任务留出实验 |
| 机器人落地 | 00 → F0 → G0,同时选择 A0 或 B0 | 能定位策略、控制、数据和评测各层失败 |

