飞书原文 · 源修订 16
💡
路线总课: 本课从零建立 VLA 路线,不围绕某一家公司或单篇论文组织。RT、Open X、Octo、OpenVLA、GR00T 等构成主流谱系,π0、FAST、π0.5、π0.6* 和 π0.7 作为连续工程案例放在课程末尾的论文实验室。
学习目标
完成本课后,应能解释直接策略学习的概率目标;区分 VLM、VLA、动作专家和控制器;比较回归、自回归 token、Diffusion 与 Flow Matching;理解多机器人共训练和后训练;判断 VLA 具有与不具有的能力;把 π 系列放回 VLA 路线而不是把它等同于整个 Physical AI。
1. 直接策略路线的核心假设
直接策略学习绕过显式规划和显式动力学辨识,直接学习:
读法: 参数为 theta 的策略,根据截至当前的观测历史、当前本体状态和语言目标,为未来 H 步动作块分配条件概率。
推导: 把未来连续 H 步动作视为一个随机向量,直接策略用多模态上下文条件化这个联合动作分布。
读作:“根据观测历史、本体状态和语言目标,生成未来一段动作。”它把感知、任务条件和动作选择压缩进同一个条件分布。
优势是推理直接、能够利用大规模示范;局限是模型主要受数据分布约束,未必能显式回答反事实、长期价值或动力学参数。
2. 从行为克隆到 VLA
2.1 行为克隆
给定机器人数据:
读法: 机器人数据集由观测历史、本体状态、语言任务和对应的未来 H 步动作块组成。
推导: 把每个机器人示范在时刻 t 的观测历史、本体状态、任务和未来动作块配成监督样本,所有样本的集合就是机器人训练数据集。
真实数据还应保留 episode、时间戳、坐标系、控制频率和 embodiment 元数据;这里只写训练所需的最小数学字段。
行为克隆最小化:
读法: 行为克隆损失是在机器人数据上,对真实动作块的负对数条件概率取平均。
推导: 最大化所有示范动作块的条件似然,取负号后得到最小化的负对数似然。
2.2 视觉语言条件
VLA 在策略条件中引入互联网预训练的视觉语言表示。VLM 提供物体、场景和语言语义,动作模块把这些表示转化成连续控制。
2.3 VLM 不等于 VLA
| 模型 | 训练对象 | 输出 |
|---|---|---|
| VLM | 图像和文本的语义关系 | 文本 token 或多模态表示 |
| VLA | 多模态上下文条件下的动作分布 | 动作 token、连续动作或轨迹 |
| 控制器 | 反馈误差与物理执行 | 电机命令或力矩 |
3. 动作分布怎样表示
3.1 单点回归
读法: 模型根据上下文 c 输出唯一预测动作,记为条件均值 mu_theta(c)。
推导: 固定方差高斯负对数似然等价于 MSE,而 MSE 的最优确定性预测是条件均值。
速度快,但固定方差高斯假设容易平均多种正确动作。
3.2 自回归动作 Token
读法: 完整动作 token 序列的概率,等于每个 token 在此前 token 和上下文条件下的概率依次相乘。
推导: 由概率链式法则展开联合分布;训练时对每个 token 使用交叉熵。
动作先经过 tokenizer 变成离散序列,能够复用语言模型交叉熵训练,但存在量化误差和串行解码延迟。
3.3 Diffusion
模型学习不同噪声尺度下的去噪方向或 score,通过多步采样得到连续动作。它适合多峰轨迹,但推理计算较高。
3.4 Flow Matching
模型学习连续时间向量场:
读法: 生成状态 x 随流时间 t 的变化率,等于模型在当前状态、时间和上下文下预测的速度场。
推导: Flow Matching 学习把简单噪声分布运输到条件动作分布的向量场,推理时对该常微分方程积分。
从简单噪声分布出发,通过积分得到条件动作样本。
| 表示 | 学习对象 | 推理 | 适合 |
|---|---|---|---|
| 回归 | 条件均值 | 一次前向 | 近单峰、低延迟 |
| 动作 Token | 离散序列概率 | 逐 token | 与 VLM 统一预训练 |
| Diffusion | score 或噪声 | 多步去噪 | 多峰连续动作 |
| Flow | 概率流向量场 | ODE 积分 | 连续动作块 |
4. Action Chunk 为什么成为主流
单步策略每次只预测 ,容易产生高频抖动,也无法表达抓取、旋转和释放之间的短期协调。Action Chunk 直接生成:
读法: 时刻 t 的动作块 A_t 由当前动作开始、连续 H 步动作组成。
推导: 从当前动作 a_t 开始,按时间顺序收集 H 个连续动作并拼成一个联合变量,就得到动作块 A_t。
长度 H 是时间尺度选择:更长动作块增加短期一致性,也延长开环执行和反馈等待。
动作块能学习短期轨迹结构并降低推理频率,但增加开环时间。真实部署通常只执行动作块前几步,再根据新观测重新生成。
5. 多机器人与多任务共训练
通用 VLA 希望使用不同机器人、相机、任务和控制频率的数据。统一训练至少需要处理:
- 不同动作维度和关节语义。
- 不同坐标系、单位和归一化。
- 不同相机布局和视觉分布。
- 不同控制频率与 Action Chunk 时间长度。
- 不同数据质量、操作风格与失败比例。
“把张量补成同一长度”不等于动作已经语义对齐。模型可能通过 embodiment id 学习多个局部策略,也可能学到可迁移的对象中心结构,需要专门实验区分。
6. 预训练、共训练与后训练
| 阶段 | 主要数据 | 主要作用 |
|---|---|---|
| 视觉语言预训练 | 互联网图文 | 语义和视觉表征 |
| 机器人预训练/共训练 | 多任务多机器人轨迹 | 广泛动作能力与条件对齐 |
| 任务后训练 | 高质量目标场景数据 | 稳定性、速度、行为风格 |
| 经验学习 | 自主成功、失败、纠正 | 修复部署分布和提高成功率 |
规模扩大能力覆盖,后训练塑造部署行为,经验学习修复策略自身产生的状态分布。三者不能用一个“数据更多”概括。
7. VLA 能学到什么,不能自动学到什么
| 可能学到 | 不能仅凭架构自动保证 |
|---|---|
| 对象与任务条件下的动作模式 | 显式物理因果模型 |
| 跨任务共享的视觉动作表征 | 长期最优性 |
| 短期动作协调和反馈纠错 | 分布外失败恢复 |
| 语言对动作的条件控制 | 任意机器人零样本迁移 |
| 数据中反复出现的操作先验 | 安全、接触稳定和控制器跟踪 |
这些缺口分别连接其他路线:反事实预测连接世界模型,长期好坏连接价值学习,任务拆解连接分层规划,跨本体连接数据表征,真实执行连接动力学和控制。
8. π 系列如何放回 VLA 路线
| 阶段 | 它在 VLA 路线中增加什么 | 不应被误解为 |
|---|---|---|
| π0 | VLM Backbone 与 Flow Action Expert | 完整 Physical AI 系统 |
| FAST | 动作 token 化与统一交叉熵预训练 | 离散动作一定优于连续动作 |
| π0.5 | 异构共训练、开放世界任务和层级条件 | 仅靠规模自动产生泛化 |
| π0.6* / RECAP | 利用部署经验和 Advantage 条件改进 | 通用在线 RL 已被解决 |
| π0.7 | 多样 Prompt、视觉子目标与可操控性 | 显式世界模型等于完整规划器 |
π 系列是 VLA 路线的一组连续工程案例。FAST 连接动作表示,RECAP 连接价值学习,π0.7 连接世界模型与分层规划,但它们的主归属仍然是 VLA。
9. 训练与推理必须分开阅读
| 阶段 | 已知信息 | 需要产生 |
|---|---|---|
| 行为克隆训练 | 观测、语言、本体、真实动作 | 动作似然或生成目标 |
| 生成策略训练 | 真实动作、噪声、时间 | 去噪方向或向量场 |
| 推理 | 观测、语言、本体、随机噪声 | 完整动作块 |
| 执行 | 生成动作和控制周期 | 真实机器人运动 |
训练时可以看到真实动作,部署时没有。读论文时如果不区分两者,很容易误解网络输入和监督来源。
10. VLA 的决定性评测
- 任务留出: 新任务组合而不只是新背景。
- 对象留出: 形状、材质和可供性变化。
- Embodiment 留出: 控制接口和运动学变化。
- 闭环恢复: 人为施加扰动后是否恢复。
- 多峰任务: 是否覆盖多种正确动作模式。
- 延迟与控制: 动作生成延迟、平滑度和碰撞率。
- 数据等量消融: 分离模型机制收益和数据规模收益。
10.1 最小可复现实验
使用同一个二维绕障数据集,固定训练样本和网络容量,分别训练单点回归、动作 token 和 Flow Matching 策略。
- 报告离线动作误差,但不把它当作最终结论。
- 闭环执行并记录到达率、碰撞率、模式覆盖率和推理延迟。
- 加入起点、障碍位置和语言表达变化,分别测分布外退化。
- 只改变 action chunk 的执行长度,观察平滑度与恢复速度的权衡。
这个实验要求读者把“动作表示更强”转化成可证伪的闭环主张。
11. 本课练习
- 画出 VLM、VLA、Action Expert 和底层控制器的边界。
- 对一个双峰绕障任务比较回归、Token、Diffusion 和 Flow。
- 为跨机器人数据定义动作 schema 和 embodiment metadata。
- 解释为什么 Action Chunk 同时改善平滑度并降低闭环纠错频率。
- 将 π0.6* 分别从 VLA 路线和价值路线解释一次。
- 设计一个能够验证“VLA 使用了语言条件而不是只识别场景”的干预实验。

