飞书原文 · 源修订 9
💡
机制课: 多机器人共训练不是把动作补零。不同本体具有不同运动学、动作接口、相机和控制频率。本课研究共享表示、本体条件 adapter、归一化、数据混合与真正的跨本体迁移评测。
学习目标
完成本课后,应能定义 embodiment;区分共享语义和本体特定控制;构造统一数据 schema 和 adapter;分析数据混合权重与负迁移;设计 leave-one-embodiment-out 评测。
1. Embodiment 包含什么
本体 不只是机器人 ID,还包括:
- 关节结构、自由度和工作空间。
- 末端执行器和抓取几何。
- 动作接口、单位和控制频率。
- 相机、力觉和触觉。
- 底层控制器和安全限制。
策略写成:
读法: 本体 e 的动作从以该本体观测、任务目标和本体描述为条件的共享策略分布中采样。
推导: 不同机器人观测维度和动作空间不同,显式条件 e 让共享主干知道当前运动学、执行器和控制接口。输入输出 adapter 负责形状转换,共享主干负责可迁移语义。
2. 哪些信息可以共享
| 共享 | 本体特定 |
|---|---|
| 对象、任务、语言 | 关节和动作维度 |
| 对象相对位姿 | 可达性和奇异位形 |
| 接触、抓稳、释放事件 | 夹爪几何和力范围 |
| 技能顺序 | 控制频率和延迟 |
| 视觉场景表征 | 相机布局和标定 |
3. Adapter 架构

输入 adapter 对齐本体状态和视角,输出 adapter 将共享行为表示解码到本体动作。共享程度是实验问题,不是架构名称自动保证。
4. 动作归一化
常见归一化:
读法: 本体 e 的第 j 个动作维度减去该本体均值,再除以标准差,得到标准化动作。
推导: 按本体统计均值和尺度可避免大数值动作主导梯度,使各维训练范围接近。但 z-score 只对齐数值分布,不对齐方向、单位、控制频率或任务功能。
或按分位数缩放。归一化使数值范围相近,但不会对齐动作功能。不同控制频率下相同数值产生不同位移,必须记录 。
5. 对象中心动作
末端相对于对象的变化:
读法: 时刻 t 末端在对象坐标系中的位姿,等于对象在世界中的位姿取逆,再乘末端在世界中的位姿。
推导: 先用对象位姿的逆把世界坐标变换到对象坐标,再接上世界到末端的变换,就得到对象到末端的相对位姿。相邻时刻的该位姿变化可作为跨本体共享的对象中心动作。
比关节动作更容易跨本体共享,再由每个机器人 IK 和控制器执行。缺点是对象状态估计和可达性。
6. 数据混合
总体损失:
读法: 总体损失是各本体数据分布上的期望损失按非负权重加权求和,所有权重之和为一。
推导: 混合训练等价于先按 w_e 选择本体,再从该本体数据采样。按样本量设权重会偏向大数据本体,均匀权重可能放大低质量数据,因此权重必须与目标本体、任务覆盖和质量消融共同报告。
如果按样本量混合,大数据本体主导;平均本体权重又可能过度采样低质量数据。权重可以基于任务、质量、难度和目标本体相关性。
7. 正迁移与负迁移
| 现象 | 原因 | 检查 |
|---|---|---|
| 正迁移 | 共享对象和任务结构 | 少样本目标本体提升 |
| 负迁移 | 动作和视角冲突 | 单本体 vs 共训练 |
| 容量竞争 | 共享主干不足 | 模型规模与路由 |
| 数据捷径 | 通过相机识别本体 | 视角交换和本体干预 |
| 伪泛化 | 目标本体进入预训练 | 严格数据审计 |
8. 本体条件与路由
显式加入 允许模型学习条件策略。Mixture-of-Experts 可以按本体或任务路由。过强路由会形成多个独立模型,失去共享;过弱共享会产生干扰。
9. 人类-机器人对齐
人类没有相同动作空间,可通过:
- 对象相对运动。
- 事件和技能 token。
- 视觉子目标。
- 潜在动作。
- 语言意图。
人类数据适合共享高层和表征,机器人数据负责真实控制落地。
10. 评测
- Leave-one-embodiment-out。
- 目标本体少样本曲线。
- 新任务组合与新对象。
- 相机交换和动作 adapter 消融。
- 单本体、共训练和路由模型比较。
- 数据量、质量和权重控制。
- 真实机器人闭环而非离线动作误差。
11. 最小实验:共训练是否带来真正的跨本体迁移
选择三个训练机器人和一个完全留出的目标机器人,统一任务语义与对象集合,但保留不同自由度、相机、末端执行器、动作空间和控制频率。比较单本体训练、动作补零、z-score 共训练、adapter 共享主干、对象中心动作和本体路由模型。
固定总数据量、目标机器人少样本数量、主干容量和推理预算。报告零样本与少样本成功率、负迁移、每本体性能、未见任务组合、对象中心动作误差、adapter 参数量,以及真实闭环结果。
12. 本课练习
- 定义一个完整 embodiment schema。
- 说明动作 z-score 为什么不能实现语义对齐。
- 为两个机械臂设计对象中心共享动作。
- 构造负迁移实验。
- 设计 leave-one-robot-out 数据审计。
- 解释 π0.5 的异构共训练应如何做因果消融。
13. 主要失败模式
| 失败 | 表现 | 诊断与修正 |
|---|---|---|
| 动作补零假对齐 | 张量维度统一,但相同维度在不同机器人语义不同 | 显式 schema、adapter 和对象中心动作 |
| 控制频率遗漏 | 相同归一化动作产生不同实际位移 | 记录 Delta t、动作积分方式和控制器 |
| 大本体支配 | 总体平均提升,小数据机器人性能下降 | 逐本体报告、权重消融和梯度贡献 |
| 负迁移 | 加入异构数据后目标机器人比单独训练更差 | 任务相似度、路由、adapter 容量和冲突梯度 |
| 路由完全分裂 | MoE 为每个机器人形成独立模型,没有共享收益 | 专家使用、共享层消融和留出本体迁移 |
| 对象中心状态误差 | 理论上共享的相对动作因位姿估计错误而失效 | 标定、对象位姿置信度和可达性 |
| 数据泄漏 | 留出机器人任务或场景在其他本体数据中重复 | 任务、对象、场景和本体四层去重 |
14. 论文事实、作者解释与课程判断
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Open X-Embodiment / RT-X | 汇集多机器人数据,以统一格式训练跨本体模型并评测迁移 | 数据规模与异构共训练能形成通用机器人能力 | 必须区分数据规模、任务覆盖和本体迁移贡献,逐本体结果比总体平均更重要 |
| Octo | 使用 Open X 数据训练开源通用策略,并支持通过少量目标数据微调 | 通用预训练策略可以快速适配新机器人和任务 | 适配收益同时来自视觉语义、任务数据与动作接口,需用 adapter 和数据量消融拆分 |
| π0.5 | 通过异构共训练连接高层语义与多类机器人动作,提高开放世界泛化 | 更丰富数据与知识迁移可扩展通用机器人策略 | 应以留出本体、留出任务和等量目标数据证明迁移,而非只比较总数据更大的模型 |
| XSkill | 学习人类与机器人视频之间的跨本体技能表示 | 功能层技能可跨身体共享 | 需要真实机器人解码、事件一致性和负迁移审计 |

