飞书原文 · 源修订 66
💡
核心变化: π0.7 不再只依赖一句任务描述,而是把子任务、视觉子目标、数据质量、策略类型和控制模式都放入 Prompt,使一个通用策略可以被精确引导。
1. 为什么通用不等于可用
一个通用策略可能知道如何完成任务,但使用错误速度、错误抓取策略或错误子任务顺序。在真实部署中,用户需要控制“怎么做”,而不仅是“做什么”。π0.7 把这种控制能力称为 steerability。
💡
第 1 章交互解释器|可操控性实验室
调节任务能力、Prompt 对齐和环境扰动,区分“会完成任务”与“能按指定方式完成”。
:::2. 模型结构
π0.7 约 5B 参数,由 4B VLM Backbone、视频历史编码器和约 860M Action Expert 组成。视频历史编码器使模型不仅看当前帧,也能利用过去的动作和状态变化。
💡
第 2 章交互解释器|架构与信息流检查器
开关视频历史、视觉子目标、Metadata 和 Knowledge Insulation,观察 Token 与梯度路径。
:::3. 多样化 Prompt
| 条件 | 控制的内容 |
|---|---|
| 总任务语言 | 最终目标 |
| 当前子任务 | 下一阶段语义动作 |
| 视觉子目标 | 希望达到的具体视觉状态 |
| Episode Metadata | 数据质量、策略来源、速度或行为风格 |
| Control Mode | 自主、高层指导或人工 coaching |
💡
第 3 章交互解释器|多模态 Prompt 组合器
逐项开关五类 Prompt,观察条件完整度、动作歧义和缺失适应能力。
:::4. 视觉子目标如何产生
轻量级世界模型 根据当前观测、当前子任务和样本元数据,对未来视觉子目标进行条件生成:
读法: 未来视觉子目标 从参数为 的条件世界模型中采样;模型以当前观测 、当前子任务 和元数据 为条件,对不同候选目标图像分配概率。
推导: 同一当前观测和高层计划可能对应多个合理目标画面,因此目标生成器建模条件分布而不是单个确定图像;psi 是该生成器的参数。
低层策略再根据当前图像与目标图像之间的差异生成动作。视觉目标比文字更精确地表达姿态、位置、接触状态和环境布局。
4.1 训练样本中的视觉子目标从哪里来
先把一个机器人轨迹切成带有明确子任务的片段。对于从时刻 开始、在 结束的片段,训练样本可抽象为:
读法: 一条世界模型训练样本由四部分构成:片段开始时的观测 、当前子任务文本 、Episode Metadata ,以及监督视觉子目标 。
推导: 把目标生成所需的当前观测、细化语言、模式变量和目标图像收集成一个训练样本元组 z,便于统一定义目标数据集与损失。
论文直接把高质量子任务片段的末帧作为视觉子目标真值:
读法: 如果一个片段表示“打开冰箱门”,那么片段结束时冰箱门已经打开的图像,就是这个片段的监督视觉子目标。
推导: 在一段成功轨迹中选取子任务结束时刻 t_end,并把该时刻观测作为当前时刻的监督目标图像,就得到可从视频自动构造的目标标签。
这并不表示同一个条件下只有唯一正确图像。不同演示可能采用不同手臂姿态、接触位置或对象路径,因此数据真正定义的是条件分布:
读法: 在当前场景、当前子任务和行为元数据确定后,未来合理视觉状态仍可能有多个;每条训练片段提供的是这个条件分布中的一个样本。
推导: 训练集中的目标图像由真实成功轨迹按当前观测、细化语言和模式筛选而来,因此可视为从相应条件数据分布中抽样。
4.2 论文目标如何展开成条件 Flow Matching
论文用下面的高层目标描述世界模型训练:
读法: 在高质量子任务数据集上调整世界模型参数 psi,使条件 Flow Matching 损失的平均值最小。
推导: 工程实现不直接最大化图像密度,而是构造噪声到目标的路径并最小化速度场回归误差;理想条件下,得到的边缘流把噪声分布运输到条件视觉目标分布。
为了展开这个目标,先从简单噪声分布中采样起点,并随机选择流时间:
读法: 是与目标图像潜变量同形状的高斯噪声; 是 0 到 1 之间随机抽取的中间时刻。
推导: 条件 Flow Matching 需要随机噪声起点和随机路径时间;标准高斯提供易采样起点,均匀时间让训练覆盖从噪声到目标的整条路径。
使用最简单的线性概率路径,把噪声与真实视觉子目标连接起来:
读法: 时得到纯噪声; 时得到真实子目标;中间时刻 是二者的线性混合。
推导: 用一减 tau 和 tau 对噪声与目标图像做线性插值,自动满足 tau=0 为噪声、tau=1 为真实目标的边界条件。
对流时间求导,得到这条条件路径的目标速度:
读法: 在这条线性路径上,每一时刻都应沿“真实子目标减去起点噪声”的方向移动。更一般的概率路径可以具有随时间变化的目标速度。
推导: 对线性插值关于 tau 求导,噪声和目标在单个训练样本中视为常量,因此目标速度恒为目标图像减噪声。
4.3 世界模型究竟学习什么
令网络 读取当前带噪中间状态、流时间和全部条件,标准速度回归损失可写为:
读法: 把中间状态 交给模型,让它预测此刻应朝哪个方向变化;预测速度与真实路径速度 越接近,损失越小。
推导: 每个随机中间点都有已知目标速度 g_star 减 epsilon;对这些样本的速度预测误差取平方并求期望,就得到条件 Flow Matching 回归损失。
根据平方损失回归的基本结论,数据无限且模型容量充分时,最优速度场是条件平均速度:
读法: 当模型只知道当前位置、时间和 Prompt 时,它学习所有可能经过这里的训练路径的平均运动方向。条件 不同,得到的速度场和终点分布也不同。
推导: 固定中间位置、时间和条件后,平方损失的最优回归函数等于目标速度的条件期望;这是均方风险对预测值求导为零的结果。
💡
关键区别: 世界模型不是直接回归唯一末帧。它学习一个条件速度场,因此从不同噪声出发,可以采样出多种满足同一子任务的未来视觉状态。
4.4 推理时如何从噪声得到视觉子目标
推理时重新采样一个高斯噪声作为初始状态:
读法: 每次生成视觉子目标时,先抽取一个新的随机起点;不同起点使模型能够产生不同但合理的目标图像。
推导: 推理阶段不再有真实目标图像可用,因此重新从训练所用的基分布抽取噪声初值 x0,作为目标生成 ODE 的起点。
然后在当前观测、子任务和元数据条件下求解常微分方程:
读法: 从 开始,反复询问世界模型当前应该沿哪个方向修改图像潜变量,并按这个速度向前积分。
推导: 训练得到局部条件速度后,把它作为 ODE 右端并从 tau=0 积分到 1,就能沿学习到的流把噪声运输到目标图像空间。
积分到终点后得到一份视觉子目标样本:
读法: ODE 终点 就是生成的子目标图像 ;对初始噪声随机性进行边缘化后,所有可能终点共同构成模型的条件分布。
推导: 若条件速度场逼近目标概率路径,ODE 终点 x1 的分布就是目标生成器在当前观测、细化语言和模式条件下的分布;一次积分给出一个目标样本。
4.5 为什么需要多视角视觉子目标
π0.7 使用多视角子目标,而不是只生成一张图:
读法: 视觉子目标由 个相机视角的目标图像共同组成。第 个目标 对应该相机在近未来希望看见的场景。
推导: 多相机系统需要同时约束各视角下的目标状态,因此把 n 个视角的目标图像按固定顺序组成联合目标变量。
| 视角 | 更容易约束的内容 | 典型歧义 |
|---|---|---|
| 机器人基座或环境相机 | 对象位置、环境布局、门或抽屉的开合状态 | 难以看清夹爪与对象的局部接触 |
| 腕部相机 | 夹爪姿态、接触位置、局部对齐和抓取方式 | 视野窄,难以判断全局对象状态 |
| 多视角联合 | 同时约束对象结果与机器人末端结果 | 需要视角间保持几何和语义一致 |
4.6 为什么视觉子目标让动作学习更容易
没有视觉子目标时,策略面对的是高度欠定的问题:
读法: “打开冰箱”没有明确告诉机器人抓把手的哪一侧、手腕应该是什么姿态,也没有说明近期应该达到哪一种局部状态。
推导: 普通 VLA 直接把任务和当前视觉作为条件预测动作,这是条件策略的基本计算图;箭头表示学习映射而不是物理因果等式。
加入视觉子目标后,问题更接近逆动力学:
读法: 视觉子目标先明确“世界下一步应该变成什么样”,Action Expert 再推断从当前状态到目标状态需要哪些连续控制动作。
推导: 加入目标视觉后,策略被要求生成能把当前状态推进到目标状态的动作块;这相当于把开放任务条件进一步收窄为局部状态转移问题。
从概率角度,可以理解为视觉目标缩小了动作分布的不确定性:
读法: 在当前观测和任务文本之外,再知道子任务、视觉目标和策略元数据后,合理动作的条件熵通常会降低,动作预测问题因而更明确。这里是机制解释,不是论文直接证明的严格不等式。
推导: 条件熵满足增加条件不会提高平均不确定性;目标图像、细化语言和模式提供额外信息,因此动作在更丰富条件下的剩余熵不大于只看观测和原任务时。
4.7 官方训练设置中值得注意的数字
| 设置 | 论文数值 | 作用 |
|---|---|---|
| 加入视觉子目标的样本 | 每个 batch 约 25% | 利用视觉目标加速训练,同时保留无视觉目标运行能力 |
| 有视觉目标时丢弃子任务文本 | 30% | 让视觉目标能够替代文字表达更细的空间状态 |
| 整体丢弃 Episode Metadata | 15% | 允许测试时缺少元数据仍能工作 |
| 单个元数据字段丢弃 | 各 5% | 避免模型过度依赖某一个速度、质量或错误标签 |
| Control Mode dropout | 不使用 | 始终明确动作是 joint 还是 end-effector 控制 |
💡
交互解释器:调节子任务、速度和质量条件,观察视觉目标模式概率与潜空间概率流如何变化;切换标签可查看条件分布、Flow Matching 推演和动作策略公式。
:::5. 高层策略如何自动 Prompt 低层模型
高层语义策略根据任务、当前观测和历史子任务生成下一条子任务指令。于是 π0.7 可以在人类直接操控、自动高层规划和视觉目标引导之间切换。
5.1 完整 Prompt 如何进入低层策略
把总任务、当前子任务、视觉子目标、Episode Metadata 和控制模式合并为上下文:
读法: 描述最终任务, 描述当前语义子任务, 描述近期希望达到的视觉状态, 指定速度、质量和错误等行为属性, 指定 joint 或 end-effector 控制模式。
推导: 把原始任务、细化语言、目标、模式和其他控制变量按约定顺序组成统一条件 C_t,后续策略只需引用该条件集合。
π0.7 的低层策略学习未来动作块的条件分布:
读法: 参数为 的策略根据最近 步视频与本体状态历史,以及完整 Prompt ,对未来 步动作序列分配条件概率密度。
推导: 策略既需要最近 T 步视觉历史判断当前动态,又需要 C_t 指定任务、目标和操控模式,因此动作块分布以二者为条件。
论文用近似条件对数似然描述 VLA 的总体训练目标:
读法: 调整策略参数,使训练数据中的真实动作块在对应观测历史和完整 Prompt 条件下获得更高的条件概率。
推导: 对训练数据中每个真实动作块计算条件对数概率并取期望,选择使其最大的 theta,就是在扩展条件 C_t 下的最大似然行为克隆。
机制说明: 这是策略分布层面的最大似然目标。Flow Matching 实现并不直接计算归一化动作密度或似然下界,而是最小化条件向量场回归损失;在模型和优化充分时,生成流的终点分布逼近数据动作分布。
5.2 Action Expert 的 Flow Matching 展开
π0.7 的 Action Expert 处理固定 50 个动作 token,可以把监督动作块记为:
读法: 每个动作样本不是单步控制量,而是从当前时刻开始的 50 步联合动作序列,包含时序和多关节相关性。
推导: 论文设置使用从 t 开始的 50 步动作作为监督块,因此把连续下标 t 到 t+49 的动作定义为目标 A_t_star。
与图像世界模型类似,为动作块采样高斯噪声并构造插值:
读法: 是动作噪声与真实动作块之间的中间状态;Action Expert 要学习如何把随机动作向量连续运输成数据中的协调动作块。
推导: 动作 Flow Matching 同样从高斯噪声到真实动作块做线性插值;tau 控制中间位置,两个端点确定对应的监督速度。
对应的速度回归目标可抽象为:
读法: Action Expert 在观测历史和完整 Prompt 条件下,预测当前带噪动作块应该沿哪个方向变化,直到形成真实可执行动作序列。
推导: 线性动作路径的目标速度为 A_t_star 减 epsilon_A,网络在视觉历史和完整条件 C_t 下回归该速度;对数据、噪声和时间取期望得到训练损失。
5.3 自动 Prompt 的闭环
运行时可以把系统理解为三级条件生成:
读法: 高层语义策略根据任务和近期历史,选择当前应该执行的子任务,例如“打开冰箱门”。
推导: 细化语言不是固定规则生成,而是根据视觉历史和原任务进行条件预测,因此用分布 p_phi 表达可能的局部指令并允许采样或选择。
读法: 世界模型根据当前图像、子任务和期望行为属性,生成近期希望达到的多视角视觉状态。
推导: 目标生成器在当前观测、细化语言和模式条件下产生目标图像分布;用帽子表示推理阶段由模型生成而非数据直接提供。
读法: 低层 Action Expert 综合所有条件,采样一段连续动作块,并只执行其中较短的一部分;新观测到来后再次规划,从而形成闭环控制。
推导: 最终动作策略把感知历史、原任务、生成的细化语言、生成的目标、模式和其他控制条件联合起来,形成可操控的条件动作分布。
5.4 延迟条件下为什么仍能平滑执行
π0.7 使用训练时版本的 Real-Time Action Chunking,在训练中模拟 0 到 12 个时间步的推理延迟。机器人控制频率为 50 Hz,因此最大模拟延迟为:
读法: 每个控制周期为 20 毫秒,12 个周期对应 240 毫秒。训练时让模型见过不同延迟,可以降低新旧动作块切换时的不连续和抖动。
推导: 控制频率 50 Hz 表示每步 1/50 秒;若最多先执行 12 步再重规划,观测到下一次更新的最长开放环时间就是 12 除以 50 秒,即 0.24 秒。
💡
第 5 章交互解释器|分层闭环模拟器
观察高层子任务、世界模型视觉目标、Action Expert 和真实环境如何循环重规划。
:::6. 低质量与失败数据为什么现在更有价值
当训练样本包含质量和策略元数据时,模型可以学习“这种动作来自低质量演示”或“这种轨迹来自旧策略”。推理时指定高质量、快速或安全的条件,就能从混合数据中抽取目标行为,而不必删除所有不完美数据。
6.1 没有元数据时,坏数据如何污染动作分布
设 表示演示质量、速度、策略来源和是否发生错误等潜在行为模式。如果训练时不提供 ,模型只能学习边缘分布:
读法: 同一个观测和任务下的动作分布,是高质量演示、慢速演示、失败恢复和旧策略轨迹等不同模式的加权混合。模型不知道当前样本属于哪种模式时,只能同时拟合它们。
推导: 模式 m 是未观测离散变量,对它应用条件全概率公式:总体动作分布等于各模式下动作分布按模式概率加权求和。
当不同模式在动作空间中互相冲突时,有限容量模型可能出现模式混淆:例如既学到快速接近,也学到失败轨迹中的犹豫和回撤,却无法在推理时主动选择。
6.2 Metadata 如何把混合数据变成可选择的数据
把元数据加入 Prompt 后,策略改为学习:
读法: 模型不再只问“当前任务通常怎么做”,而是问“在指定速度、质量、错误状态和策略来源的条件下,应该怎么做”。
推导: 把模式 m 显式加入条件后,原本混合在一起的动作数据被分解成更单一的子分布,策略因此可以学习模式可控的动作生成。
推理时可以显式选择期望条件:
读法: 即使训练集包含低质量和失败轨迹,运行时也可以要求模型从“高质量且无错误”的条件动作分布中采样。
推导: 推理时把模式字段固定为高质量且无错误,相当于从条件策略中选择该数据子群对应的动作分布,而不是对所有质量和错误模式做平均。
💡
能力边界: Metadata 不能自动把失败变成成功。它成立的前提是标签可靠、不同模式具有足够数据覆盖,而且模型真正利用了条件。需要通过打乱 Metadata、反事实 Prompt 和失败模式分层评测验证。
💡
第 6 章交互解释器|混合质量数据实验室
调节高质量、旧策略与失败数据占比,对比边缘混合分布和 Metadata 条件分布。
:::7. 对涌现能力的审慎解释
论文展示了新任务组合和跨场景能力,但“涌现”应理解为多样 Prompt、数据覆盖与共享表示产生的组合泛化。除非有严格的任务组合留出和重复统计,不能把单次新颖行为直接等同于通用推理能力。

