跳到正文

飞书原文 · 源修订 32

💡

课程目标: 用一套统一的概率语言理解 Physical AI。完成本课后,读者不需要先知道任何机器人基础模型名称,也能判断一个方法在学习策略、世界模型、价值、表征还是控制,以及它如何进入真实物理闭环。

0. 为什么 Physical AI 需要一套不同于普通 AI 的课程 ​

语言模型输出一个错误 token,通常不会改变下一条训练输入;机器人输出一个错误动作,会改变相机视野、接触状态、物体位置和后续数据分布。Physical AI 的核心困难不是把图像和语言送进更大的网络,而是让模型在行动会改变未来观测的闭环中持续工作。

因此,任何算法都必须回答五件事:它观察什么、控制什么、从什么监督学习、推理时怎样产生动作、错误如何通过物理世界反馈回来。

1. 第一组基本对象:状态、观测、动作与轨迹 ​

1.1 状态与观测 ​

状态 是预测未来和选择动作所需的物理信息,例如物体位姿、机器人速度、接触状态和摩擦。观测 是传感器真正提供的量,例如图像、深度、力觉和关节编码器。

观测通常不是状态:

读法: 在真实状态 s_t 已知的条件下,观测 o_t 仍按照传感器模型随机产生,因此会受噪声、遮挡和视角影响。

推导: 状态是环境变量,观测是状态经过相机、深度或力传感器后的随机结果。条件分布把“同一状态可能产生不同测量”显式写出来。

如果单帧图像无法确定速度或隐藏接触,模型需要使用历史:

读法: 编码器 E 根据截至当前的全部观测,以及当前之前执行过的动作,构造当前内部状态 z_t。

推导: 单帧不能确定速度和被遮挡对象,历史观测提供时间变化,历史动作解释这些变化中哪些由机器人自己造成。z_t 是信息压缩结果,不保证等于真实物理状态。

可以理解为模型从历史构造的内部状态或信念。

1.2 动作不是天然定义的 ​

动作 可能是关节位置、关节速度、力矩、末端位姿增量、夹爪命令或阻抗参数。选择不同动作接口,相当于选择不同的学习问题。

动作定义模型需要学习系统额外依赖
关节位置目标关节配置底层位置控制器
末端位姿增量局部空间运动逆运动学与坐标系
力矩高频反馈控制动力学、力觉和安全限制
动作块短期轨迹结构执行窗口与重新规划机制

1.3 轨迹 ​

一条轨迹写成:

读法: 轨迹 tau 是从初始状态开始,按时间依次记录状态、观测、动作、奖励以及下一时刻变量的完整序列。

推导: 环境状态产生观测,策略根据可用信息选择动作,环境再转移并产生奖励;把这一闭环按时间展开,就得到轨迹。

不要把这里的 与力矩符号混淆。轨迹记录智能体和环境共同产生的时间序列,是模仿学习、强化学习、世界模型和评测共同使用的数据单位。

2. 第二组基本对象:策略、世界模型、价值与规划 ​

2.1 策略 ​

策略学习在上下文条件下的动作分布:

读法: 参数为 theta 的策略,在当前上下文 c_t 条件下,为动作 a_t 分配概率。

推导: 策略的输入不一定是真实状态,因此统一写成上下文 c_t;它可以包含观测历史、语言目标、本体状态和记忆。确定性策略可视为概率集中在单一动作的特殊情况。

上下文可以包含观测历史、语言目标和本体状态。

2.2 世界模型 ​

世界模型学习动作条件下的未来:

读法: 参数为 phi 的世界模型,根据当前状态和当前动作,预测下一状态与当前奖励的联合条件分布。

推导: 在 Markov 假设下,给定当前状态和动作后,预测下一步不再需要更早历史;若状态是模型从历史构造的潜在状态,这一假设需要通过多步预测和控制实验验证。

它回答“如果这样做,会发生什么”,而不是直接回答“应该做什么”。

2.3 价值函数 ​

价值函数学习未来累计回报的条件期望:

读法: 在状态 s 执行动作 a,随后一直按照策略 pi 行动,Q 值等于未来所有折扣奖励之和的条件期望。

推导: 先定义从当前时刻开始的折扣回报,再对策略和环境动力学产生的所有未来轨迹取条件期望。折扣因子 gamma 控制远期奖励的权重。

它回答“这个动作长期来看有多好”。

2.4 规划器 ​

规划器利用规则、世界模型、价值或搜索选择行动序列:

读法: 在所有长度为 H 加一的候选动作序列中,选择预测折扣回报期望最大的序列,并把它记为最优动作序列。

推导: 给定候选动作,世界模型或真实动力学诱导未来状态和奖励分布;对未来回报取期望,再用 arg max 选择得分最高的候选。滚动规划通常只执行前一小段,然后重新观测。

策略可以直接产生动作,规划器则显式比较候选未来。实际系统经常让规划器选择子目标,再让策略执行。

对象输入方向输出最简问题
策略世界 → 动作动作分布现在做什么
世界模型状态和动作 → 未来未来分布做了会怎样
价值状态或动作 → 回报标量评价长期有多好
规划目标和模型 → 序列动作或子目标序列走哪条路径

3. 监督信号决定模型能学到什么 ​

数据提供什么常见目标模型直接学到什么
专家动作行为克隆专家条件动作分布
下一状态或下一帧预测损失状态转移或观测生成
任务奖励价值与策略优化行为的长期好坏
成功/失败标签结果预测、价值学习轨迹或状态的成功概率
成对偏好奖励模型或偏好优化相对偏好
人工纠正纠正式模仿错误状态下的恢复动作
人类视频表征、预测、Latent Action运动与交互结构,不是机器人控制量本身

一个模型不能从监督中自动获得没有被数据和目标约束的能力。只有专家动作的数据不会自动给出反事实未来;只有下一帧预测不会自动定义任务目标;只有最终成功标签不会自动说明哪一步导致失败。

4. 从最大似然理解行为克隆 ​

专家数据集记作:

读法: 数据集 D 包含 N 个示范样本,第 i 个样本由上下文 c_i 和专家动作 a_i 组成。

推导: 把每条轨迹在时刻 t 的上下文和动作配成一个样本,再对 N 条样本编号,就得到这个经验数据集;它是后续最大似然目标的求和索引。

这里暂时把时间相关轨迹拆成监督样本;实际训练还必须记录 episode 边界,避免把相邻帧误当成独立试验。

最大似然训练:

读法: 在所有参数 theta 中,寻找一组参数,使 N 个专家动作在各自上下文下的对数概率之和最大。

推导: 若暂时把样本视为由同一数据分布产生,整份数据的似然是各样本条件概率的乘积;取对数后,乘积变成求和。arg max 表示选择使该目标最大的参数。

等价地最小化负对数似然:

读法: 行为克隆损失是在专家数据分布上,对真实动作负对数概率取平均;最小化它等价于最大化专家数据似然。

推导: 把最大化目标乘以负一,就得到最小化目标;用经验平均写成期望形式,不会改变最优参数。

如果假设动作服从固定方差高斯分布:

读法: 给定上下文 c,动作 a 服从均值由网络 mu_theta(c) 预测、协方差为固定 sigma 平方乘单位矩阵的高斯分布。

推导: 固定各动作维度方差且假设条件分布单峰、各向同性,策略只需预测条件均值。这个假设简化训练,也正是多峰动作会被平均的来源。

则负对数似然化为 MSE:

读法: 均方误差损失与真实动作和预测均值之间欧氏距离平方的期望成正比。

推导: 高斯负对数似然等于误差平方除以二倍方差,再加上只依赖固定方差的常数。固定方差时,比例系数和常数都不影响最优均值,因此最小化负对数似然等价于最小化 MSE。

因此,MSE 不是任意选择,而是单峰高斯假设的结果。多条正确轨迹存在时,条件均值可能不是任何一条可执行轨迹。

5. 为什么生成式动作模型出现 ​

如果同一上下文下存在多种正确行为,策略需要表达完整的多峰分布。主流参数化包括:

  • 自回归 Token: 学习离散动作序列的条件概率。
  • Diffusion: 学习从噪声到动作的数据 score 或去噪过程。
  • Flow Matching: 学习把简单分布搬运到动作分布的向量场。

这些方法仍然属于策略学习。它们改变的是“动作分布怎样表示和采样”,不等于自动拥有世界模型或长期价值。

6. Physical AI 最关键的闭环分布偏移 ​

训练时数据来自专家状态分布:

读法: 训练时第 t 步状态来自专家策略访问到的状态分布。

推导: 专家策略在环境动力学下不断执行并访问状态,所有这些状态的长期频率构成分布 d_expert。把它写成抽样关系,是为了强调训练样本来自专家访问到的状态,而不是均匀覆盖整个状态空间。

这个分布由专家动作与环境动力学共同产生,通常集中在成功轨迹附近。

部署时状态由模型此前动作产生:

读法: 部署时第 t 步状态来自当前学习策略 theta 自己诱导的状态分布。

推导: 部署时把 a_t 代入环境转移,再由策略继续产生后续动作,反复迭代得到 d_pi_theta。由于动作来自当前策略而非专家,哪怕每步误差很小,状态分布也会在闭环中逐步改变。

只要学习策略和专家有微小差异,二者访问的状态分布就可能随时间逐渐分开,这就是闭环分布偏移。

即使单步误差很小,只要动作让环境进入专家数据稀少的区域,之后的预测就会更差。这是行为克隆比普通监督学习更危险的地方。

不同路线用不同机制处理闭环偏移:VLA 扩大数据覆盖;经验学习收集自身失败;世界模型支持重规划;分层策略缩短低层任务;控制器抑制执行误差;数据引擎把失败重新写回训练集。

7. 一个二维玩具任务:同一问题如何被不同路线描述 ​

机器人需要从起点绕过障碍到达目标,既可以向左绕,也可以向右绕。

路线它学习或计算什么可能失败在哪里
行为克隆专家轨迹的动作分布MSE 把左右路线平均到障碍物
生成式策略左右两种动作模式采样到模式后缺少长期验证
世界模型每个动作后的未来位置模型没见过碰撞区域
价值学习候选状态或动作的到达概率分布外动作价值虚高
规划器搜索左右候选路径搜索代价或模型误差
控制器跟踪选定轨迹延迟、打滑或饱和导致偏离

这说明不同路线不是在争夺同一个公式,而是在解决同一闭环中的不同环节。

7.1 最小可复现实验 ​

在二维网格中生成两条绕障专家轨迹:左绕和右绕各占一半。先用固定方差高斯回归,再用一个能表达双峰的生成式策略,最后用一个带碰撞检测的短视规划器比较。

  1. 训练集只包含专家轨迹,测试时加入起点扰动。
  2. 画预测动作均值、采样轨迹和障碍物位置。
  3. 记录碰撞率、到达率、路径长度和推理时间。
  4. 把扰动逐渐增大,画性能随分布偏移的曲线。

这个实验把“均值动作、多峰策略、模型预测和控制跟踪”放在同一闭环中,读者可以看到每条路线到底修复了哪一种失败。

8. 如何阅读任何 Physical AI 论文 ​

  1. 观测: 模型真正看到了哪些变量?历史长度是多少?
  2. 动作: 输出接口、单位、频率和 Action Chunk 是什么?
  3. 监督: 动作、未来、奖励、偏好还是纠正?
  4. 学习对象: 策略、世界模型、价值、表征还是控制残差?
  5. 训练与推理: 训练时已知但推理时未知的量是什么?
  6. 闭环: 如何重新观测、纠错和恢复?
  7. 证据: 任务如何留出?失败如何分类?是否报告置信区间?
  8. 物理边界: 延迟、接触、摩擦、标定和安全是否被控制?

9. 本课练习 ​

  1. 分别用一句话读出 、 和 。
  2. 为一个抓取任务列出状态、观测、动作、奖励和轨迹。
  3. 从固定方差高斯假设推导 MSE。
  4. 解释为什么 Diffusion Policy 仍然是策略,而不是世界模型。
  5. 设计一个同时区分策略错误和控制器错误的实验。
  6. 选择一篇 VLA 论文,用第 8 节的八个问题完成一页审查。

结课标准 ​

读者不需要记住所有模型名称,但必须能够看到一个公式或架构后,判断它在学习哪个对象、监督从哪里来、推理如何发生,以及这个对象如何通过控制系统进入真实闭环。达到这一标准后,再进入任一技术路线都不会被论文命名牵着走。

文章正文采用 Apache License 2.0