跳到正文

飞书原文 · 源修订 16

💡

路线总课: 本课从零建立 VLA 路线,不围绕某一家公司或单篇论文组织。RT、Open X、Octo、OpenVLA、GR00T 等构成主流谱系,π0、FAST、π0.5、π0.6* 和 π0.7 作为连续工程案例放在课程末尾的论文实验室。

学习目标 ​

完成本课后,应能解释直接策略学习的概率目标;区分 VLM、VLA、动作专家和控制器;比较回归、自回归 token、Diffusion 与 Flow Matching;理解多机器人共训练和后训练;判断 VLA 具有与不具有的能力;把 π 系列放回 VLA 路线而不是把它等同于整个 Physical AI。

1. 直接策略路线的核心假设 ​

直接策略学习绕过显式规划和显式动力学辨识,直接学习:

读法: 参数为 theta 的策略,根据截至当前的观测历史、当前本体状态和语言目标,为未来 H 步动作块分配条件概率。

推导: 把未来连续 H 步动作视为一个随机向量,直接策略用多模态上下文条件化这个联合动作分布。

读作:“根据观测历史、本体状态和语言目标,生成未来一段动作。”它把感知、任务条件和动作选择压缩进同一个条件分布。

优势是推理直接、能够利用大规模示范;局限是模型主要受数据分布约束,未必能显式回答反事实、长期价值或动力学参数。

2. 从行为克隆到 VLA ​

2.1 行为克隆 ​

给定机器人数据:

读法: 机器人数据集由观测历史、本体状态、语言任务和对应的未来 H 步动作块组成。

推导: 把每个机器人示范在时刻 t 的观测历史、本体状态、任务和未来动作块配成监督样本,所有样本的集合就是机器人训练数据集。

真实数据还应保留 episode、时间戳、坐标系、控制频率和 embodiment 元数据;这里只写训练所需的最小数学字段。

行为克隆最小化:

读法: 行为克隆损失是在机器人数据上,对真实动作块的负对数条件概率取平均。

推导: 最大化所有示范动作块的条件似然,取负号后得到最小化的负对数似然。

2.2 视觉语言条件 ​

VLA 在策略条件中引入互联网预训练的视觉语言表示。VLM 提供物体、场景和语言语义,动作模块把这些表示转化成连续控制。

2.3 VLM 不等于 VLA ​

模型训练对象输出
VLM图像和文本的语义关系文本 token 或多模态表示
VLA多模态上下文条件下的动作分布动作 token、连续动作或轨迹
控制器反馈误差与物理执行电机命令或力矩

3. 动作分布怎样表示 ​

3.1 单点回归 ​

读法: 模型根据上下文 c 输出唯一预测动作,记为条件均值 mu_theta(c)。

推导: 固定方差高斯负对数似然等价于 MSE,而 MSE 的最优确定性预测是条件均值。

速度快,但固定方差高斯假设容易平均多种正确动作。

3.2 自回归动作 Token ​

读法: 完整动作 token 序列的概率,等于每个 token 在此前 token 和上下文条件下的概率依次相乘。

推导: 由概率链式法则展开联合分布;训练时对每个 token 使用交叉熵。

动作先经过 tokenizer 变成离散序列,能够复用语言模型交叉熵训练,但存在量化误差和串行解码延迟。

3.3 Diffusion ​

模型学习不同噪声尺度下的去噪方向或 score,通过多步采样得到连续动作。它适合多峰轨迹,但推理计算较高。

3.4 Flow Matching ​

模型学习连续时间向量场:

读法: 生成状态 x 随流时间 t 的变化率,等于模型在当前状态、时间和上下文下预测的速度场。

推导: Flow Matching 学习把简单噪声分布运输到条件动作分布的向量场,推理时对该常微分方程积分。

从简单噪声分布出发,通过积分得到条件动作样本。

表示学习对象推理适合
回归条件均值一次前向近单峰、低延迟
动作 Token离散序列概率逐 token与 VLM 统一预训练
Diffusionscore 或噪声多步去噪多峰连续动作
Flow概率流向量场ODE 积分连续动作块

4. Action Chunk 为什么成为主流 ​

单步策略每次只预测 ,容易产生高频抖动,也无法表达抓取、旋转和释放之间的短期协调。Action Chunk 直接生成:

读法: 时刻 t 的动作块 A_t 由当前动作开始、连续 H 步动作组成。

推导: 从当前动作 a_t 开始,按时间顺序收集 H 个连续动作并拼成一个联合变量,就得到动作块 A_t。

长度 H 是时间尺度选择:更长动作块增加短期一致性,也延长开环执行和反馈等待。

动作块能学习短期轨迹结构并降低推理频率,但增加开环时间。真实部署通常只执行动作块前几步,再根据新观测重新生成。

5. 多机器人与多任务共训练 ​

通用 VLA 希望使用不同机器人、相机、任务和控制频率的数据。统一训练至少需要处理:

  • 不同动作维度和关节语义。
  • 不同坐标系、单位和归一化。
  • 不同相机布局和视觉分布。
  • 不同控制频率与 Action Chunk 时间长度。
  • 不同数据质量、操作风格与失败比例。

“把张量补成同一长度”不等于动作已经语义对齐。模型可能通过 embodiment id 学习多个局部策略,也可能学到可迁移的对象中心结构,需要专门实验区分。

6. 预训练、共训练与后训练 ​

阶段主要数据主要作用
视觉语言预训练互联网图文语义和视觉表征
机器人预训练/共训练多任务多机器人轨迹广泛动作能力与条件对齐
任务后训练高质量目标场景数据稳定性、速度、行为风格
经验学习自主成功、失败、纠正修复部署分布和提高成功率

规模扩大能力覆盖,后训练塑造部署行为,经验学习修复策略自身产生的状态分布。三者不能用一个“数据更多”概括。

7. VLA 能学到什么,不能自动学到什么 ​

可能学到不能仅凭架构自动保证
对象与任务条件下的动作模式显式物理因果模型
跨任务共享的视觉动作表征长期最优性
短期动作协调和反馈纠错分布外失败恢复
语言对动作的条件控制任意机器人零样本迁移
数据中反复出现的操作先验安全、接触稳定和控制器跟踪

这些缺口分别连接其他路线:反事实预测连接世界模型,长期好坏连接价值学习,任务拆解连接分层规划,跨本体连接数据表征,真实执行连接动力学和控制。

8. π 系列如何放回 VLA 路线 ​

阶段它在 VLA 路线中增加什么不应被误解为
π0VLM Backbone 与 Flow Action Expert完整 Physical AI 系统
FAST动作 token 化与统一交叉熵预训练离散动作一定优于连续动作
π0.5异构共训练、开放世界任务和层级条件仅靠规模自动产生泛化
π0.6* / RECAP利用部署经验和 Advantage 条件改进通用在线 RL 已被解决
π0.7多样 Prompt、视觉子目标与可操控性显式世界模型等于完整规划器

π 系列是 VLA 路线的一组连续工程案例。FAST 连接动作表示,RECAP 连接价值学习,π0.7 连接世界模型与分层规划,但它们的主归属仍然是 VLA。

9. 训练与推理必须分开阅读 ​

阶段已知信息需要产生
行为克隆训练观测、语言、本体、真实动作动作似然或生成目标
生成策略训练真实动作、噪声、时间去噪方向或向量场
推理观测、语言、本体、随机噪声完整动作块
执行生成动作和控制周期真实机器人运动

训练时可以看到真实动作,部署时没有。读论文时如果不区分两者,很容易误解网络输入和监督来源。

10. VLA 的决定性评测 ​

  1. 任务留出: 新任务组合而不只是新背景。
  2. 对象留出: 形状、材质和可供性变化。
  3. Embodiment 留出: 控制接口和运动学变化。
  4. 闭环恢复: 人为施加扰动后是否恢复。
  5. 多峰任务: 是否覆盖多种正确动作模式。
  6. 延迟与控制: 动作生成延迟、平滑度和碰撞率。
  7. 数据等量消融: 分离模型机制收益和数据规模收益。

10.1 最小可复现实验 ​

使用同一个二维绕障数据集,固定训练样本和网络容量,分别训练单点回归、动作 token 和 Flow Matching 策略。

  1. 报告离线动作误差,但不把它当作最终结论。
  2. 闭环执行并记录到达率、碰撞率、模式覆盖率和推理延迟。
  3. 加入起点、障碍位置和语言表达变化,分别测分布外退化。
  4. 只改变 action chunk 的执行长度,观察平滑度与恢复速度的权衡。

这个实验要求读者把“动作表示更强”转化成可证伪的闭环主张。

11. 本课练习 ​

  1. 画出 VLM、VLA、Action Expert 和底层控制器的边界。
  2. 对一个双峰绕障任务比较回归、Token、Diffusion 和 Flow。
  3. 为跨机器人数据定义动作 schema 和 embodiment metadata。
  4. 解释为什么 Action Chunk 同时改善平滑度并降低闭环纠错频率。
  5. 将 π0.6* 分别从 VLA 路线和价值路线解释一次。
  6. 设计一个能够验证“VLA 使用了语言条件而不是只识别场景”的干预实验。

论文实验室 ​

主流 VLA 谱系:RT、Open X、Octo、OpenVLA、GR00T 与 Gemini Robotics

π0 架构精读

FAST 与动作表示

π0.5 与开放世界泛化

π0.6*、RECAP 与经验学习

π0.7 与可操控性

文章正文采用 Apache License 2.0