飞书原文 · 源修订 12
🌍
核心判断: π0.5 的开放世界能力不是单一架构技巧,而是异构共训练、层级语义接口、跨具身数据和任务相关后训练共同产生的结果。
1. π0 还缺什么
π0 可以完成大量训练分布内任务,但在全新家庭、全新物体布局和长时程任务中,单靠相似机器人轨迹难以覆盖所有组合。π0.5 的目标不是简单增加任务数量,而是让模型能从不同信息源迁移知识。
2. 两阶段训练配方
阶段一:广泛共训练
模型在机器人动作、跨机器人数据、高层子任务预测、网页视觉语言数据等多种样本上联合训练。机器人动作由 FAST 编码为离散 token,与文字输出统一使用交叉熵。
阶段二:任务相关后训练
加入面向移动操作与新环境泛化的高相关数据,同时启用 Flow Matching Action Expert 生成高精度连续动作。人类监督者的语言纠正也进入训练,用自然语言指出当前应采用的子任务或策略。
3. 统一多模态训练目标
设前 M 个输出是离散文字或 FAST token,后 H 个输出由 Action Expert 表达连续动作,则总体损失可以概括为:
读法: 总损失由文本和 FAST token 的交叉熵,加上权重 alpha 乘连续动作 Flow Matching 损失组成。
推导: 模型同时学习离散语言 token 和连续动作,因此分别使用交叉熵与条件 Flow Matching 损失;alpha 用来平衡两类目标的梯度尺度和训练优先级。
推导与阶段关系: 两类输出共享多模态主干,但监督形式不同,因此用加权和联合优化。预训练阶段令 alpha 等于零,只使用离散 token;后训练阶段加入 Action Expert 并令 alpha 大于零,同时保留语义/离散目标与连续动作目标。没有对应标签的输出位置需要用 mask 排除。
交叉熵让 VLM 学习语义、子任务和离散动作知识;Flow Matching 让 Action Expert 学习连续控制。α 决定两个目标的相对影响。
4. 层级推理如何工作
- 输入当前观测 o_t 和总任务 l,例如“整理厨房”。
- 同一个模型先生成高层子任务 l_hat,例如“把盘子放入水槽”。
- 再将 l_hat 作为条件,生成低层动作块 A_t。
- 环境变化后重新预测子任务并继续执行。
读法: 模型先根据当前观测和总任务生成高层子任务,再把这个子任务作为额外条件生成低层动作块。
推导: 由条件概率链式分解,高层语义变量可以作为潜变量或显式中间输出。推理时先采样或解码子任务,再条件化动作生成,因此高层错误会传递到低层。
5. 数据异构性为什么会带来泛化
| 数据来源 | 提供的知识 |
|---|---|
| 同类机器人多环境数据 | 场景、房屋、物体和布局变化 |
| 跨具身机器人数据 | 更广的任务语义和操作经验 |
| 高层子任务标注 | 长任务分解与语义状态机 |
| 网页视觉语言数据 | 开放词汇物体与常识 |
| 语言纠正数据 | 在陌生状态下接受人类指导 |
6. 最值得警惕的因果解释
论文消融支持多种数据源共同提高新环境表现,但不能简单断言“网页知识直接产生机器人技能”。更合理的解释是:网页数据改善视觉语义与高层选择,机器人数据负责把语义落到动作。两者通过共享表示和层级接口发生迁移。
6.1 最小可证伪实验
建立任务、对象、家庭布局和机器人本体四个独立留出轴,固定目标场景机器人数据量,依次加入不同共训练来源。
- 只用目标机器人动作数据训练基线。
- 加入网页视觉语言数据,观察语义留出是否提高。
- 加入跨本体机器人数据,观察动作和技能迁移是否提高。
- 加入高层子任务与语言纠正,观察长时任务恢复是否提高。
- 比较 FAST-only、Flow-only 与 FAST 预训练加 Flow 后训练,统一模型规模和训练步数。
必须分别报告子任务选择准确率、低层执行成功率和最终长时任务成功率,才能定位收益来自语义还是控制。
7. π0.5 的真正创新
- 把高层语义预测和低层连续动作放入同一个模型训练体系。
- 利用 FAST 让机器人动作进入大规模离散共训练。
- 用 Flow Matching 专家保留高精度控制。
- 把开放世界泛化定义为数据配方与推理接口问题,而不只是模型规模问题。
推导练习
- 如果去掉高层子任务标注,哪些任务最先退化?给出可证伪预测。
- 分析错误子任务对低层动作策略的影响,以及重新规划频率的作用。
- 设计一个区分“语义泛化”和“动作泛化”的评测矩阵。
原始资料
失效模式:开放世界泛化为什么会看起来成功
| 失效模式 | 表面现象 | 决定性检查 | 修复 |
|---|---|---|---|
| 高层子任务错误 | 低层动作流畅但做错事情 | 分别评测子任务准确率与给定正确子任务后的动作成功率 | 闭环重新规划、子任务置信门禁和人工纠正 |
| 互联网语义捷径 | 熟悉场景表现好,布局变化后崩溃 | 对象、背景和指令改写的交叉留出 | 对象中心数据、反事实增强和真实机器人验证 |
| 数据混合掩盖小域退化 | 总体平均提升,某个机器人或任务下降 | 按本体、任务、数据源和失败阶段分层报告 | 重加权、条件化本体标识和关键切片门禁 |
| 长时任务误差累积 | 单个子任务成功,整任务仍失败 | 画出每阶段存活率和错误传播路径 | 缩短开放环窗口、加入完成条件和恢复策略 |

