飞书原文 · 源修订 13
💡
路线总课: 一个演示成功不等于一个可靠系统。本课把数据 schema、时间同步、训练复现、统计评测、失败分类、安全、部署监控和数据回流组织成完整证据链,回答“算法提升是否真实、可复现、可部署”。
学习目标
完成本课后,应能定义可训练和可审计的数据 schema;检查观测动作时间对齐;设计任务、对象、环境和动力学留出;为成功率计算不确定性;区分平均指标和失败分布;评价价值或成功概率的校准;建立部署、监控、人工接管、数据回流和再训练闭环。
1. Physical AI 的证据链

每一环都必须可追溯。缺少数据版本、控制频率或真实试验次数时,即使模型代码完整,也无法判断提升来自算法、数据、硬件还是测试协议变化。
2. 数据 schema 是算法的一部分
一条机器人 episode 至少需要:
| 类别 | 字段 | 为什么必须记录 |
|---|---|---|
| 观测 | 图像、深度、力觉、本体状态 | 定义模型真正可见的信息 |
| 动作 | 命令值、单位、坐标系、频率 | 避免跨数据源语义混乱 |
| 时间 | 传感器、推理、发送和执行时间戳 | 识别延迟与因果错位 |
| 任务 | 语言目标、对象、初始条件 | 任务分层与留出 |
| 结果 | 成功、阶段、失败原因、接管 | 价值学习和评测 |
| 本体 | 机器人、相机、控制器、标定 | 跨本体对齐与回归定位 |
| 版本 | 采集代码、模型、配置、硬件版本 | 复现和问题追踪 |
图像和动作长度一致不代表时间对齐。相机曝光、网络传输、模型推理和执行器响应可能让 实际对应更早的物理状态。
3. 时间同步与因果对齐
总延迟可以分解为:
读法: 从物理事件发生到动作真正生效的总延迟,由传感、传输、模型推理和执行器响应延迟相加得到。
推导: 对同一个样本记录每个因果阶段的进入和离开时间,相邻阶段耗时相加后,中间时间点相互抵消,只剩最终执行时刻减最初采集时刻。队列抖动和并行流水线会改变每次样本的延迟分布,因此不能只记录平均值。
训练样本应根据动作真正生效的时间构造,而不是简单按数组下标配对。可通过延迟扫描寻找使动作与状态变化最相关的偏移,但相关峰值不一定等于真实因果延迟,需要结合硬件时间戳验证。
建议同时保存:
- 观测采集时间。
- 模型开始和结束推理时间。
- 动作发送时间。
- 控制器接收和执行时间。
- 下一次可观测物理响应时间。
4. 训练复现需要完整实验契约
| 必须固定或记录 | 例子 |
|---|---|
| 数据清单 | episode ID、过滤规则、训练/验证划分 |
| 模型配置 | 骨干、动作头、历史长度、Action Chunk |
| 优化配置 | 学习率、batch、更新步数、冻结与梯度路径 |
| 随机性 | 种子、采样器、增强和初始化 |
| 推理配置 | 采样步数、温度、重规划频率 |
| 系统版本 | 代码 commit、依赖、驱动和固件 |
只保存最终 checkpoint 不足以复现。数据排序、归一化统计量、tokenizer 版本和动作适配器同样可能改变结果。
5. 成功率不是一个没有误差的数字
若独立试验 次,成功 次,成功率估计:
读法: 经验成功率等于独立试验中成功次数除以总试验次数。
推导: 把每次成功记为一、失败记为零,样本均值就是 k 除以 n。在独立同分布 Bernoulli 假设下,它也是成功概率的最大似然估计;若试验相关或成功概率随条件变化,这个单一均值会隐藏分层结构。
标准误近似:
读法: 经验成功率的近似标准误,等于估计成功率乘失败率再除以样本数的平方根。
推导: 独立 Bernoulli 变量的方差是 p 乘一减 p,n 个独立样本均值的方差再除以 n。真实 p 未知时用 p_hat 代入得到 plug-in 估计;样本小或成功率接近零和一时,正态近似会失真。
当样本很少或成功率接近 0/1 时,正态近似不可靠,应使用 Wilson 区间或 Beta-Binomial 后验。
5.1 Wilson 区间
置信水平对应 ,Wilson 中心为:
读法: Wilson 区间的中心,是经验成功率加上有限样本修正后,再除以同样的归一化因子。
推导: Wilson 区间来自反演二项比例的 score test。把关于未知 p 的标准化不等式平方并整理成一元二次不等式,其两个根的中点就是该中心。修正会把极端的零成功或全成功适度拉回内部,因此比直接正态区间稳定。
区间半径为:
读法: Wilson 区间的半宽,由置信水平 z、样本比例方差和有限样本修正共同决定。
推导: 继续求解 score test 得到的二次不等式,两个根之差的一半就是 h。最终区间为中心减 h 到中心加 h;样本数增加时修正项衰减,区间逐渐接近常见的正态近似。
报告“8/10 成功”和“80%”不同:前者让读者看到样本量和不确定性。
6. 试验不一定独立
同一天、同一物体和同一初始位姿的重复试验高度相关。把它们当作独立样本会低估方差。应按任务、对象、环境、机器人或采集批次分层,并使用分层 bootstrap 或混合效应模型。
分层报告至少包括:
- 每个任务和任务阶段。
- 对象类别与具体实例。
- 初始条件难度。
- 环境和背景。
- 机器人本体与控制器。
- 试验日期和硬件状态。
7. 训练、验证与真正的泛化留出
| 留出 | 检验什么 | 常见泄漏 |
|---|---|---|
| 对象实例 | 同类新物体 | 相同物体不同背景 |
| 任务组合 | 已见技能的新组合 | 语言改写但动作相同 |
| 环境结构 | 新空间关系 | 同一布局换纹理 |
| Embodiment | 跨机器人迁移 | 目标机器人数据进入预训练 |
| 动力学 | 质量、摩擦和柔顺变化 | 只改变视觉不改变物理 |
| 失败状态 | 闭环恢复 | 只评估专家初始状态 |
“开放世界”不能只用新物体照片证明。需要明确哪些任务结构、物理参数和控制条件未进入训练。
8. 失败分类比平均成功率更重要
| 失败层 | 例子 | 应检查的证据 |
|---|---|---|
| 感知 | 对象识别或状态估计错误 | 遮挡、视角、置信度 |
| 规划 | 选择错误子目标或顺序 | 高层决策日志 |
| 策略 | 动作模式错误 | 条件动作分布和示范覆盖 |
| 控制 | 命令正确但跟踪失败 | 目标与真实轨迹、力和饱和 |
| 系统 | 延迟、丢帧、进程异常 | 时间戳和运行日志 |
| 安全 | 碰撞、力峰值、急停 | 安全监测和接管记录 |
| 评测 | 成功判定不一致 | 标注协议和复核 |
同样的整任务失败率,可能来自完全不同的算法瓶颈。没有失败分类,新增数据和模型改动会失去方向。
9. 校准:模型知道自己不知道吗
若模型预测成功概率 ,可靠性要求预测为 0.8 的样本约有 80% 真正成功。Expected Calibration Error 可以写成:
读法: 期望校准误差把预测按置信度分桶,对每个桶的真实成功率与平均置信度之差取绝对值,再按桶样本占比加权求和。
推导: 理想校准要求预测置信度为 q 的样本约有 q 比例成功。有限数据无法在每个连续 q 上估计条件概率,因此先分成 B 个桶,用桶内准确率近似真实频率、桶内平均置信度近似预测概率,再对差异做经验加权。结果依赖分桶和样本量,不能脱离可靠性曲线单独解释。
低 ECE 对安全门控、人工接管和候选策略选择很重要。但 ECE 依赖分桶,应同时展示可靠性曲线和分布外检测结果。
10. 在线监控与安全
部署系统至少监控:
- 观测延迟、推理延迟与控制周期。
- 动作范围、速度、加速度和力矩饱和。
- 接触力、碰撞和滑动。
- 模型不确定性或成功概率。
- 任务阶段和完成检测。
- 人工接管、急停和恢复。
安全系统应独立于学习策略。策略可以提出动作,确定性安全层负责限速、工作空间、碰撞和力阈值。
11. 数据回流不是把所有失败重新训练
部署数据需要经过:
- 自动检测异常和失败。
- 按失败层分类。
- 抽取关键时间窗口。
- 补充成功、阶段、接触和人工纠正标签。
- 去重并平衡任务与难度。
- 进入专门的训练或评测集合。
- 通过回归测试后再部署。
错误标签、系统故障和策略失败不能混在同一个“失败数据”桶中,否则模型会学习错误因果关系。
12. OpenPI 在系统路线中的位置
OpenPI 提供模型、数据适配和训练基础设施,但完整系统还需要:
| OpenPI 可提供 | 团队仍需建设 |
|---|---|
| 模型实现与 checkpoint | 任务定义和真实机器人安全 |
| 数据格式与转换 | 时间同步、质量标签和版本治理 |
| 训练与推理代码 | 评测协议、监控、回滚和数据回流 |
| 基线配置 | 目标本体适配和系统验证 |
框架跑通只证明软件链路工作,不证明数据正确、算法有效或机器人可靠。
13. 最小可信实验
对一个新策略改动,最低限度应包括:
比较对象。 选择一个已部署基线和一个候选新策略,冻结数据版本、任务定义、控制器、硬件、成功判定与安全阈值。新旧模型都执行完全相同的预注册协议。
| 证据层 | 最小设置 | 发布前必须回答 |
|---|---|---|
| 训练复现 | 至少三次独立训练;保存数据清单、配置、代码、依赖与随机种子 | 提升是否超过训练方差? |
| 留出设计 | 任务、对象实例、环境结构、动力学和失败初态分层留出 | 测试集是否真的没有进入训练与调参? |
| 真实试验 | 按条件分层随机交错运行新旧模型,记录完整硬件时间戳 | 日期、温度、磨损和操作者是否成为混杂因素? |
| 系统消融 | 动作对齐前后各偏移若干帧;注入延迟、丢帧和控制器降频 | 模型提升是否依赖偶然的时序或系统配置? |
| 统计报告 | 成功次数/总次数、Wilson 区间、分层 bootstrap、失败分布和 ECE | 平均提升是否伴随尾部或校准恶化? |
| 安全门禁 | 峰值力、冲量、饱和、急停、接管率与恢复时间 | 候选策略是否在任何硬约束上回归? |
最小输出。 一张新旧模型分层成功率与置信区间图,一张失败类型堆叠图,一张延迟和动力学条件下的性能热图,一张可靠性曲线,以及一份可从模型版本追溯到数据、代码、硬件与每次真实试验的清单。
发布规则。 预先指定一个主要任务指标和全部硬安全指标。只有主要指标的区间证据支持改进、且任何安全指标没有超过回归阈值时,才允许扩大灰度;不能在看完结果后临时更换主要指标。
14. 本课练习
- 为机器人 episode 设计完整 schema,包括时间戳和版本字段。
- 计算 8/10 与 80/100 成功率的不确定性差异。
- 设计一个避免对象和任务结构泄漏的划分。
- 给十个失败视频建立感知、规划、策略、控制和系统分类。
- 为价值模型画可靠性曲线并解释 ECE。
- 设计“部署 → 失败 → 数据 → 再训练 → 回归测试”的发布门禁。
论文与工程实验室
15. 论文与基准证据矩阵
数据规模和 benchmark 分数只有在 schema、切分、评测协议与真实系统条件可追溯时才构成证据。
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Open X-Embodiment | 该工作汇集多机构、多机器人和多任务数据,并训练 RT-X 系列跨本体策略。 | 作者用统一数据格式和大规模异构混合探索跨机器人知识迁移。 | 统一 schema 是算法能力的一部分;动作语义、坐标、频率和本体元数据缺失会让规模产生伪共享。 |
| DROID | DROID 收集大规模、跨场景、跨操作者的真实机器人操作数据,并提供统一采集系统。 | 作者强调多样真实环境与标准化硬件数据管线对通用策略的重要性。 | 数据量之外还要审计场景相关性、操作者偏差、硬件版本和 train-test 实例泄漏。 |
| RoboMimic | RoboMimic 系统比较多种离线模仿学习方法、数据质量和任务设置。 | 作者用统一基准揭示算法结果对数据来源、观测和训练细节的敏感性。 | “同数据集比较”仍需锁定预处理、归一化、动作接口和评测初态,否则不是等条件消融。 |
| LIBERO | LIBERO 构建具有对象、空间、目标和长时序变化的持续机器人学习任务套件。 | 作者用结构化任务族评估知识迁移与遗忘,而不只看单任务成功率。 | 泛化声明必须说明留出的是语言表述、对象实例、空间结构还是技能组合。 |
| Guo et al.|Calibration | 该工作系统评估现代神经网络的概率校准,并比较 temperature scaling 等方法。 | 作者区分分类准确率与置信度可靠性,说明高准确模型仍可能过度自信。 | 机器人成功概率用于接管和门控前必须做条件化校准;全局 ECE 不能掩盖危险子群。 |
16. 交叉阅读
与所有算法路线连读。 VLA、世界模型、价值学习、分层规划和控制的结论都依赖同一套数据版本、留出和真实闭环协议;路线 G 不是附属工程,而是决定结论是否成立的测量系统。
与 F3 连读。 时间戳、执行器辨识和参数版本既影响 Sim-to-Real,也影响数据标签的因果正确性。
与路线 E 连读。 跨本体共训练只有在动作接口和本体元数据可追溯时才可审计;否则模型可能只记住数据源身份。
与 G1-G4 连读。 本课给出总证据链,后续分别深入统计不确定性、数据版本、部署监控和 OpenPI 系统工程。

