跳到正文

飞书源目录 · 源修订 91

💡

适合读者: 具备概率统计、线性代数和基础深度学习知识,希望快速建立 Physical AI 全景的算法、数据和机器人系统人员。本目录不按公司或论文发布时间组织,而按模型实际学习的数学对象划分路线。

如何使用这份目录 ​

Physical AI 不是一条单线技术路径。直接策略、世界模型、价值学习、分层规划、数据表征、控制和系统工程分别解决不同问题,又在同一个物理闭环中组合。

所有读者先完成“公共地基”,然后选择一条主路线深入。文章的主归属只表示最适合从哪里进入,不表示它只与这一条路线有关。跨路线关系会在每个模块后明确标注。

课程统一质量标准 ​

本课程面向具备大学概率统计、线性代数和基础深度学习知识的读者。每门机制课和论文实验室都必须通过以下门槛,才算完成。

门槛必须回答
学习对象模型究竟在估计分布、状态、价值、子目标、表征还是控制律
公式读法每个独立公式后紧跟引用块,用口语逐项读出条件、随机变量与算子
推导说明公式从哪个概率假设、定义、物理方程或优化目标得到,不允许只给结果
可视化至少有一张真正降低理解成本的计算图、概率图、闭环图或曲线
最小实验读者能用玩具环境复现关键现象,而不是只能相信论文结论
论文坐标区分事实、作者解释和课程判断,并与同路线强基线比较
闭环风险讨论分布偏移、接触、延迟、观测缺失、安全与失败恢复

公式统一采用“四步解释”:先给公式,再给引用格式读法,然后给推导,最后说明它在机器人闭环中的含义。

读法块示例: 这里不是重复念字母,而是说明“根据什么条件,预测什么随机量,求和或期望覆盖哪些情况”。

行内符号由本节符号表统一解释;所有承担定义、损失、动力学、更新规则或推理过程的独立公式,必须逐式提供引用读法与推导。

00|公共地基:所有路线共享的语言 ​

核心问题: 状态、观测、动作、轨迹和策略分别是什么?训练分布为什么会在部署时改变?概率模型的损失函数怎样变成真实机器人行为?

00.1|公共地基总课 ​

00|Physical AI 公共地基:智能体究竟在学习什么

论文与推导实验室: 行为克隆、分布偏移与 Flow Matching 深入推导

学习对象: 条件动作分布、最大似然、均方误差、多峰动作、Action Chunk 与部署分布偏移。

00.2|Physical AI 模块边界 ​

模块主要数学对象回答的问题
策略条件动作分布现在应该做什么
世界模型动作条件状态转移分布这样做以后会发生什么
价值函数状态价值与动作价值未来有多好
规划器候选行动序列或子目标应该选择哪条路径
控制器反馈控制律如何稳定执行

路线 A|VLA 与直接策略学习 ​

路线问题: 能否直接从视觉、语言和本体状态生成机器人动作?这条路线学习的是条件动作分布,是目前通用机器人策略和机器人基础模型的主要方向。

A0|路线总课:VLA 与直接策略学习 ​

A0|VLA 与直接策略学习:从条件模仿到机器人基础模型

交叉关系: 使用路线 E 的数据和表征;可被路线 C 的价值信号继续改进;最终交给路线 F 的控制系统执行。

A1|专题实验室:动作表示与 FAST ​

动作表示:MSE、自回归 Token、Diffusion、Flow Matching 与 FAST

核心问题: 策略究竟输出条件均值、离散动作序列、score,还是概率流向量场?

A2|主流 VLA 谱系与架构演进 ​

RT、Open X、Octo、OpenVLA、GR00T 与 Gemini Robotics

核心问题: 除 π 系列外,主流 VLA 如何把多任务模仿、视觉语言预训练、跨本体数据和生成式动作模块组合起来?能力提升究竟来自架构、数据还是后训练?

A3|Physical Intelligence π 系列论文实验室 ​

实验室文章在 VLA 路线中研究什么交叉路线
A3.1|π0VLM 如何接上连续控制多模态条件与 Action ExpertE、F
A3.2|FAST动作为什么需要 Tokenizer离散动作预训练与连续控制接口E
A3.3|π0.5开放世界泛化如何被训练出来异构共训练、层级推理与后训练D、E
A3.4|π0.6* / RECAP从成功、失败与纠正中改进通用 VLA 如何使用部署经验继续优化C、G
A3.5|π0.7从通用策略到可操控模型Prompt、视觉子目标、自动分层与可控性B、D、E
A3.6|OpenPIOpenPI 实践与数据生产VLA 训练、数据格式和部署工程G

建议顺序: A0 → A1 → A2 → π0 → π0.5 → π0.6* → π0.7。FAST 可在 π0 后独立学习。

路线 B|世界模型与模型式规划 ​

路线问题: 能否学习动作条件下的未来变化,并在模型中比较“如果这样做会发生什么”?

B0|路线总课:世界模型与模型式规划 ​

世界模型与规划:状态空间模型、ELBO、MPC、CEM 与想象学习

B1-B7|世界模型路线课程树 ​

模块核心问题课程
B1|状态空间与潜在动力学如何从部分可观测数据构造可预测状态状态空间、滤波、ELBO 与多步 rollout
B2|模型式规划如何在学到的模型中搜索动作MPC、CEM、轨迹优化与风险规划
B3|想象学习如何用 latent rollout 训练 Actor-CriticDreamer、模型梯度与想象偏差
B4|视频世界模型视觉未来如何成为子目标和控制条件视频预测、视觉规划与物理一致性
B5|决策世界模型谱系内部模型怎样通过想象、搜索和 MPC 产生决策从 World Models、Dreamer 到 TD-MPC2
B6|现代世界模型思想谱系JEPA、空间智能与生成式模拟器如何汇合杨立昆、李飞飞与现代世界模型路线图
B7|4D 世界状态与 World Action Models动作、未来世界和时变三维结构如何联合建模并进入物理闭环从思想汇合、几何预测到可执行未来

推荐顺序: 先用 B0 建立五条谱系与统一比较框架;B1-B4 补齐状态、规划、想象学习和视频预测;B5 深入决策世界模型;B6 理解杨立昆的 JEPA 路线、李飞飞的空间智能路线与生成式模拟器;最后进入 B7 的 4D-WAM、Whole-Body Control 接口与闭环证据。

交叉关系: 向路线 D 提供子目标和反事实推演;向路线 C 提供想象数据;π0.7 的视觉子目标和 WAM-TTT 可作为交叉案例。

路线 C|价值、奖励与经验学习 ​

路线问题: 机器人如何判断哪些状态和动作长期更好,并利用部署中的成功、失败、偏好和纠正改进策略?

C0|路线总课:价值、奖励与经验学习 ​

C0|价值、奖励与经验学习:Physical AI 如何从结果中改进行为

C1-C4|价值与经验学习课程树 ​

模块核心问题课程
C1|Bellman 与 Actor-Critic长期结果怎样更新策略TD、策略梯度、Advantage 与连续控制
C2|Offline RL固定数据怎样超越行为克隆分布外高估、CQL、IQL 与 AWR
C3|偏好与人工纠正人类反馈如何成为奖励和恢复监督奖励模型、DAgger、接管与主动反馈
C4|论文实验室在线、离线、纠正和 VLA 经验学习如何比较SAC、CQL、IQL、DAgger 与 RECAP

交叉关系: π0.6* / RECAP 主归属 VLA 论文实验室,同时是本路线的核心案例;世界模型可以为本路线提供想象 rollout。

路线 D|分层规划、技能、推理与记忆 ​

路线问题: 长时任务如何拆成子目标?高层语言或视觉计划如何调用低层连续策略?模型如何记住演示并在测试时适应?

D0|路线总课:分层规划、技能与记忆 ​

D0|分层规划、技能与记忆:Physical AI 如何完成长时任务

专题实验室: 物理因果与具身思维链

D1-D4|分层智能课程树 ​

模块核心问题课程
D1|Options 与层级 RL怎样学习可启动、可终止和可复用的技能Options、Semi-MDP、技能发现与组合
D2|子目标与具身推理语言计划怎样变成可达、可验证的闭环子目标任务图、世界模型、视觉子目标与恢复
D3|记忆与测试时适应当前环境的新经验怎样写入策略上下文、外部记忆、快速权重与 WAM-TTT
D4|论文实验室传统层级 RL 与新型 VLA 分层系统如何比较Options、具身思维链、π0.7 与 WAM-TTT

路线 E|感知、状态、数据与跨本体学习 ​

路线问题: 机器人怎样从不完整观测中构造空间状态?没有动作标签的人类视频能提供什么?不同机器人、相机、坐标系和动作空间又如何进入共同训练?

E0|路线总课:数据、表征与跨本体学习 ​

E0|数据、表征与跨本体学习:机器人没有动作标签时学什么

专题实验室: 人类视频没有速度标签

E1-E6|感知、数据与跨本体课程树 ​

模块核心问题课程
E1|视频运动与对象中心表征没有动作标签时如何读取运动和交互光流、关键点、手-物表示与事件
E1.5|空间状态估计与三维几何机器人怎样从观测历史确定自身、对象与不确定性Bayes filter、SE(3)、深度、对象状态与可供性
E3|Latent Action 与逆动力学如何从状态变化发现行为变量逆模型、潜在动作、不可辨识性与适配
E4|Behavior Tokenizer如何把行为变成可组合的语义单元VQ、事件边界、分层 token 与 FAST
E5|跨本体对齐与共训练不同机器人怎样共享数据而不混淆动作Adapter、对象中心动作、数据混合与迁移
E6|论文实验室人类数据进入机器人训练的主要机制如何比较R3M、MimicPlay、ATM、HumanPlus 与 WAM-TTT

交叉关系: 为路线 A 提供动作和语义监督,为路线 B 提供时序表征,为路线 D 提供演示和记忆输入。π0.5 是异构共训练案例,WAM-TTT 是人类演示适应案例。

路线 F|动力学、控制与物理交互 ​

路线问题: 学习模型输出的动作如何稳定、安全地作用于有质量、摩擦、接触、柔顺性和延迟的真实系统?

F0|路线总课:动力学、控制与物理交互 ​

动力学、控制与物理交互:从机器人方程到阻抗控制

F1-F5|动力学、接触与全身控制课程树 ​

模块核心问题课程
F1|反馈控制与稳定性策略输出怎样在采样、饱和与延迟下稳定跟踪状态空间、PD、Lyapunov、轨迹跟踪与策略接口
F2|接触、阻抗与触觉机器人如何在摩擦、碰撞和柔顺环境中“碰得对”接触约束、摩擦锥、力控、阻抗与触觉闭环
F3|系统辨识与 Sim-to-Real如何估计真实动力学、处理延迟并跨过仿真差异最小二乘、可辨识性、随机化、在线适应与延迟
F4|人形、移动与全身控制如何处理动态平衡、落脚、接触切换和全身协调浮动基动力学、质心控制、Locomotion RL 与高低层接口
F5|论文与工程实验室经典控制、MPC、Residual RL 和鲁棒学习如何公平比较从经典控制到 Residual RL 与 Sim-to-Real

交叉关系: 路线 A、B、D 最终都必须通过本路线接受真实执行检验;本路线产生的失败和传感数据回流到路线 G 与 E。

路线 G|系统、可信评测与数据引擎 ​

路线问题: 如何把算法变成可复现、可部署、可审计的真实机器人系统,并通过失败数据持续迭代?

G0|路线总课:系统、可信评测与数据引擎 ​

G0|系统、可信评测与数据引擎:如何证明 Physical AI 真的有效

工程实验室: OpenPI 实践与 ArcheBase 数据生产

G1-G4|系统与可信工程课程树 ​

模块核心问题课程
G1|统计评测与不确定性怎样证明提升真实存在,并知道证据有多不确定Wilson 区间、分层估计、校准与风险覆盖
G2|数据引擎与复现怎样让数据、训练和模型的全部事实可追溯Schema、时间同步、版本、Lineage 与质量门禁
G3|部署安全与回归模型上线后怎样监控、降级、接管、回滚和持续守住边界安全包络、运行时监控、Canary 与事故回归
G4|OpenPI 系统实验室怎样从 VLA 数据与 checkpoint 走到可回滚的机器人部署从数据契约、训练、推理服务到失败回流

补充工程案例: OpenPI 实践与 ArcheBase 数据生产

快速学习路径 ​

目标路径完成标准
五天建立全景00 → A0 → B0/C0 → D0/E0 → F0/G0能从学习对象、监督信号、推理方式和闭环风险比较所有路线
VLA 算法00 → A0 → π 系列实验室 → C0 → F0/G0能解释 VLA 训练、动作生成、经验改进和真实执行
世界模型00 → B0 → C0 → D0 → F0/G0能实现 latent dynamics 与 MPC,并验证真实控制收益
人类数据00 → E0 → E 专题实验室 → A0 → D0 → G0能设计跨本体表示、潜在动作和任务留出实验
机器人落地00 → F0 → G0,同时选择 A0 或 B0能定位策略、控制、数据和评测各层失败

文章正文采用 Apache License 2.0