跳到正文

飞书原文 · 源修订 9

💡

机制课: 多机器人共训练不是把动作补零。不同本体具有不同运动学、动作接口、相机和控制频率。本课研究共享表示、本体条件 adapter、归一化、数据混合与真正的跨本体迁移评测。

学习目标 ​

完成本课后,应能定义 embodiment;区分共享语义和本体特定控制;构造统一数据 schema 和 adapter;分析数据混合权重与负迁移;设计 leave-one-embodiment-out 评测。

1. Embodiment 包含什么 ​

本体 不只是机器人 ID,还包括:

  • 关节结构、自由度和工作空间。
  • 末端执行器和抓取几何。
  • 动作接口、单位和控制频率。
  • 相机、力觉和触觉。
  • 底层控制器和安全限制。

策略写成:

读法: 本体 e 的动作从以该本体观测、任务目标和本体描述为条件的共享策略分布中采样。

推导: 不同机器人观测维度和动作空间不同,显式条件 e 让共享主干知道当前运动学、执行器和控制接口。输入输出 adapter 负责形状转换,共享主干负责可迁移语义。

2. 哪些信息可以共享 ​

共享本体特定
对象、任务、语言关节和动作维度
对象相对位姿可达性和奇异位形
接触、抓稳、释放事件夹爪几何和力范围
技能顺序控制频率和延迟
视觉场景表征相机布局和标定

3. Adapter 架构 ​

课程画板

输入 adapter 对齐本体状态和视角,输出 adapter 将共享行为表示解码到本体动作。共享程度是实验问题,不是架构名称自动保证。

4. 动作归一化 ​

常见归一化:

读法: 本体 e 的第 j 个动作维度减去该本体均值,再除以标准差,得到标准化动作。

推导: 按本体统计均值和尺度可避免大数值动作主导梯度,使各维训练范围接近。但 z-score 只对齐数值分布,不对齐方向、单位、控制频率或任务功能。

或按分位数缩放。归一化使数值范围相近,但不会对齐动作功能。不同控制频率下相同数值产生不同位移,必须记录 。

5. 对象中心动作 ​

末端相对于对象的变化:

读法: 时刻 t 末端在对象坐标系中的位姿,等于对象在世界中的位姿取逆,再乘末端在世界中的位姿。

推导: 先用对象位姿的逆把世界坐标变换到对象坐标,再接上世界到末端的变换,就得到对象到末端的相对位姿。相邻时刻的该位姿变化可作为跨本体共享的对象中心动作。

比关节动作更容易跨本体共享,再由每个机器人 IK 和控制器执行。缺点是对象状态估计和可达性。

6. 数据混合 ​

总体损失:

读法: 总体损失是各本体数据分布上的期望损失按非负权重加权求和,所有权重之和为一。

推导: 混合训练等价于先按 w_e 选择本体,再从该本体数据采样。按样本量设权重会偏向大数据本体,均匀权重可能放大低质量数据,因此权重必须与目标本体、任务覆盖和质量消融共同报告。

如果按样本量混合,大数据本体主导;平均本体权重又可能过度采样低质量数据。权重可以基于任务、质量、难度和目标本体相关性。

7. 正迁移与负迁移 ​

现象原因检查
正迁移共享对象和任务结构少样本目标本体提升
负迁移动作和视角冲突单本体 vs 共训练
容量竞争共享主干不足模型规模与路由
数据捷径通过相机识别本体视角交换和本体干预
伪泛化目标本体进入预训练严格数据审计

8. 本体条件与路由 ​

显式加入 允许模型学习条件策略。Mixture-of-Experts 可以按本体或任务路由。过强路由会形成多个独立模型,失去共享;过弱共享会产生干扰。

9. 人类-机器人对齐 ​

人类没有相同动作空间,可通过:

  • 对象相对运动。
  • 事件和技能 token。
  • 视觉子目标。
  • 潜在动作。
  • 语言意图。

人类数据适合共享高层和表征,机器人数据负责真实控制落地。

10. 评测 ​

  1. Leave-one-embodiment-out。
  2. 目标本体少样本曲线。
  3. 新任务组合与新对象。
  4. 相机交换和动作 adapter 消融。
  5. 单本体、共训练和路由模型比较。
  6. 数据量、质量和权重控制。
  7. 真实机器人闭环而非离线动作误差。

11. 最小实验:共训练是否带来真正的跨本体迁移 ​

选择三个训练机器人和一个完全留出的目标机器人,统一任务语义与对象集合,但保留不同自由度、相机、末端执行器、动作空间和控制频率。比较单本体训练、动作补零、z-score 共训练、adapter 共享主干、对象中心动作和本体路由模型。

固定总数据量、目标机器人少样本数量、主干容量和推理预算。报告零样本与少样本成功率、负迁移、每本体性能、未见任务组合、对象中心动作误差、adapter 参数量,以及真实闭环结果。

12. 本课练习 ​

  1. 定义一个完整 embodiment schema。
  2. 说明动作 z-score 为什么不能实现语义对齐。
  3. 为两个机械臂设计对象中心共享动作。
  4. 构造负迁移实验。
  5. 设计 leave-one-robot-out 数据审计。
  6. 解释 π0.5 的异构共训练应如何做因果消融。

13. 主要失败模式 ​

失败表现诊断与修正
动作补零假对齐张量维度统一,但相同维度在不同机器人语义不同显式 schema、adapter 和对象中心动作
控制频率遗漏相同归一化动作产生不同实际位移记录 Delta t、动作积分方式和控制器
大本体支配总体平均提升,小数据机器人性能下降逐本体报告、权重消融和梯度贡献
负迁移加入异构数据后目标机器人比单独训练更差任务相似度、路由、adapter 容量和冲突梯度
路由完全分裂MoE 为每个机器人形成独立模型,没有共享收益专家使用、共享层消融和留出本体迁移
对象中心状态误差理论上共享的相对动作因位姿估计错误而失效标定、对象位姿置信度和可达性
数据泄漏留出机器人任务或场景在其他本体数据中重复任务、对象、场景和本体四层去重

14. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
Open X-Embodiment / RT-X汇集多机器人数据,以统一格式训练跨本体模型并评测迁移数据规模与异构共训练能形成通用机器人能力必须区分数据规模、任务覆盖和本体迁移贡献,逐本体结果比总体平均更重要
Octo使用 Open X 数据训练开源通用策略,并支持通过少量目标数据微调通用预训练策略可以快速适配新机器人和任务适配收益同时来自视觉语义、任务数据与动作接口,需用 adapter 和数据量消融拆分
π0.5通过异构共训练连接高层语义与多类机器人动作,提高开放世界泛化更丰富数据与知识迁移可扩展通用机器人策略应以留出本体、留出任务和等量目标数据证明迁移,而非只比较总数据更大的模型
XSkill学习人类与机器人视频之间的跨本体技能表示功能层技能可跨身体共享需要真实机器人解码、事件一致性和负迁移审计

15. 课程交叉阅读 ​

π0.5:开放世界泛化

E3|Behavior Tokenizer

E5|人类数据与跨本体论文实验室

文章正文采用 Apache License 2.0