跳到正文

飞书原文 · 源修订 13

💡

路线总课: 一个演示成功不等于一个可靠系统。本课把数据 schema、时间同步、训练复现、统计评测、失败分类、安全、部署监控和数据回流组织成完整证据链,回答“算法提升是否真实、可复现、可部署”。

学习目标 ​

完成本课后,应能定义可训练和可审计的数据 schema;检查观测动作时间对齐;设计任务、对象、环境和动力学留出;为成功率计算不确定性;区分平均指标和失败分布;评价价值或成功概率的校准;建立部署、监控、人工接管、数据回流和再训练闭环。

1. Physical AI 的证据链 ​

课程画板

每一环都必须可追溯。缺少数据版本、控制频率或真实试验次数时,即使模型代码完整,也无法判断提升来自算法、数据、硬件还是测试协议变化。

2. 数据 schema 是算法的一部分 ​

一条机器人 episode 至少需要:

类别字段为什么必须记录
观测图像、深度、力觉、本体状态定义模型真正可见的信息
动作命令值、单位、坐标系、频率避免跨数据源语义混乱
时间传感器、推理、发送和执行时间戳识别延迟与因果错位
任务语言目标、对象、初始条件任务分层与留出
结果成功、阶段、失败原因、接管价值学习和评测
本体机器人、相机、控制器、标定跨本体对齐与回归定位
版本采集代码、模型、配置、硬件版本复现和问题追踪

图像和动作长度一致不代表时间对齐。相机曝光、网络传输、模型推理和执行器响应可能让 实际对应更早的物理状态。

3. 时间同步与因果对齐 ​

总延迟可以分解为:

读法: 从物理事件发生到动作真正生效的总延迟,由传感、传输、模型推理和执行器响应延迟相加得到。

推导: 对同一个样本记录每个因果阶段的进入和离开时间,相邻阶段耗时相加后,中间时间点相互抵消,只剩最终执行时刻减最初采集时刻。队列抖动和并行流水线会改变每次样本的延迟分布,因此不能只记录平均值。

训练样本应根据动作真正生效的时间构造,而不是简单按数组下标配对。可通过延迟扫描寻找使动作与状态变化最相关的偏移,但相关峰值不一定等于真实因果延迟,需要结合硬件时间戳验证。

建议同时保存:

  • 观测采集时间。
  • 模型开始和结束推理时间。
  • 动作发送时间。
  • 控制器接收和执行时间。
  • 下一次可观测物理响应时间。

4. 训练复现需要完整实验契约 ​

必须固定或记录例子
数据清单episode ID、过滤规则、训练/验证划分
模型配置骨干、动作头、历史长度、Action Chunk
优化配置学习率、batch、更新步数、冻结与梯度路径
随机性种子、采样器、增强和初始化
推理配置采样步数、温度、重规划频率
系统版本代码 commit、依赖、驱动和固件

只保存最终 checkpoint 不足以复现。数据排序、归一化统计量、tokenizer 版本和动作适配器同样可能改变结果。

5. 成功率不是一个没有误差的数字 ​

若独立试验 次,成功 次,成功率估计:

读法: 经验成功率等于独立试验中成功次数除以总试验次数。

推导: 把每次成功记为一、失败记为零,样本均值就是 k 除以 n。在独立同分布 Bernoulli 假设下,它也是成功概率的最大似然估计;若试验相关或成功概率随条件变化,这个单一均值会隐藏分层结构。

标准误近似:

读法: 经验成功率的近似标准误,等于估计成功率乘失败率再除以样本数的平方根。

推导: 独立 Bernoulli 变量的方差是 p 乘一减 p,n 个独立样本均值的方差再除以 n。真实 p 未知时用 p_hat 代入得到 plug-in 估计;样本小或成功率接近零和一时,正态近似会失真。

当样本很少或成功率接近 0/1 时,正态近似不可靠,应使用 Wilson 区间或 Beta-Binomial 后验。

5.1 Wilson 区间 ​

置信水平对应 ,Wilson 中心为:

读法: Wilson 区间的中心,是经验成功率加上有限样本修正后,再除以同样的归一化因子。

推导: Wilson 区间来自反演二项比例的 score test。把关于未知 p 的标准化不等式平方并整理成一元二次不等式,其两个根的中点就是该中心。修正会把极端的零成功或全成功适度拉回内部,因此比直接正态区间稳定。

区间半径为:

读法: Wilson 区间的半宽,由置信水平 z、样本比例方差和有限样本修正共同决定。

推导: 继续求解 score test 得到的二次不等式,两个根之差的一半就是 h。最终区间为中心减 h 到中心加 h;样本数增加时修正项衰减,区间逐渐接近常见的正态近似。

报告“8/10 成功”和“80%”不同:前者让读者看到样本量和不确定性。

6. 试验不一定独立 ​

同一天、同一物体和同一初始位姿的重复试验高度相关。把它们当作独立样本会低估方差。应按任务、对象、环境、机器人或采集批次分层,并使用分层 bootstrap 或混合效应模型。

分层报告至少包括:

  • 每个任务和任务阶段。
  • 对象类别与具体实例。
  • 初始条件难度。
  • 环境和背景。
  • 机器人本体与控制器。
  • 试验日期和硬件状态。

7. 训练、验证与真正的泛化留出 ​

留出检验什么常见泄漏
对象实例同类新物体相同物体不同背景
任务组合已见技能的新组合语言改写但动作相同
环境结构新空间关系同一布局换纹理
Embodiment跨机器人迁移目标机器人数据进入预训练
动力学质量、摩擦和柔顺变化只改变视觉不改变物理
失败状态闭环恢复只评估专家初始状态

“开放世界”不能只用新物体照片证明。需要明确哪些任务结构、物理参数和控制条件未进入训练。

8. 失败分类比平均成功率更重要 ​

失败层例子应检查的证据
感知对象识别或状态估计错误遮挡、视角、置信度
规划选择错误子目标或顺序高层决策日志
策略动作模式错误条件动作分布和示范覆盖
控制命令正确但跟踪失败目标与真实轨迹、力和饱和
系统延迟、丢帧、进程异常时间戳和运行日志
安全碰撞、力峰值、急停安全监测和接管记录
评测成功判定不一致标注协议和复核

同样的整任务失败率,可能来自完全不同的算法瓶颈。没有失败分类,新增数据和模型改动会失去方向。

9. 校准:模型知道自己不知道吗 ​

若模型预测成功概率 ,可靠性要求预测为 0.8 的样本约有 80% 真正成功。Expected Calibration Error 可以写成:

读法: 期望校准误差把预测按置信度分桶,对每个桶的真实成功率与平均置信度之差取绝对值,再按桶样本占比加权求和。

推导: 理想校准要求预测置信度为 q 的样本约有 q 比例成功。有限数据无法在每个连续 q 上估计条件概率,因此先分成 B 个桶,用桶内准确率近似真实频率、桶内平均置信度近似预测概率,再对差异做经验加权。结果依赖分桶和样本量,不能脱离可靠性曲线单独解释。

低 ECE 对安全门控、人工接管和候选策略选择很重要。但 ECE 依赖分桶,应同时展示可靠性曲线和分布外检测结果。

10. 在线监控与安全 ​

部署系统至少监控:

  • 观测延迟、推理延迟与控制周期。
  • 动作范围、速度、加速度和力矩饱和。
  • 接触力、碰撞和滑动。
  • 模型不确定性或成功概率。
  • 任务阶段和完成检测。
  • 人工接管、急停和恢复。

安全系统应独立于学习策略。策略可以提出动作,确定性安全层负责限速、工作空间、碰撞和力阈值。

11. 数据回流不是把所有失败重新训练 ​

部署数据需要经过:

  1. 自动检测异常和失败。
  2. 按失败层分类。
  3. 抽取关键时间窗口。
  4. 补充成功、阶段、接触和人工纠正标签。
  5. 去重并平衡任务与难度。
  6. 进入专门的训练或评测集合。
  7. 通过回归测试后再部署。

错误标签、系统故障和策略失败不能混在同一个“失败数据”桶中,否则模型会学习错误因果关系。

12. OpenPI 在系统路线中的位置 ​

OpenPI 提供模型、数据适配和训练基础设施,但完整系统还需要:

OpenPI 可提供团队仍需建设
模型实现与 checkpoint任务定义和真实机器人安全
数据格式与转换时间同步、质量标签和版本治理
训练与推理代码评测协议、监控、回滚和数据回流
基线配置目标本体适配和系统验证

框架跑通只证明软件链路工作,不证明数据正确、算法有效或机器人可靠。

13. 最小可信实验 ​

对一个新策略改动,最低限度应包括:

比较对象。 选择一个已部署基线和一个候选新策略,冻结数据版本、任务定义、控制器、硬件、成功判定与安全阈值。新旧模型都执行完全相同的预注册协议。

证据层最小设置发布前必须回答
训练复现至少三次独立训练;保存数据清单、配置、代码、依赖与随机种子提升是否超过训练方差?
留出设计任务、对象实例、环境结构、动力学和失败初态分层留出测试集是否真的没有进入训练与调参?
真实试验按条件分层随机交错运行新旧模型,记录完整硬件时间戳日期、温度、磨损和操作者是否成为混杂因素?
系统消融动作对齐前后各偏移若干帧;注入延迟、丢帧和控制器降频模型提升是否依赖偶然的时序或系统配置?
统计报告成功次数/总次数、Wilson 区间、分层 bootstrap、失败分布和 ECE平均提升是否伴随尾部或校准恶化?
安全门禁峰值力、冲量、饱和、急停、接管率与恢复时间候选策略是否在任何硬约束上回归?

最小输出。 一张新旧模型分层成功率与置信区间图,一张失败类型堆叠图,一张延迟和动力学条件下的性能热图,一张可靠性曲线,以及一份可从模型版本追溯到数据、代码、硬件与每次真实试验的清单。

发布规则。 预先指定一个主要任务指标和全部硬安全指标。只有主要指标的区间证据支持改进、且任何安全指标没有超过回归阈值时,才允许扩大灰度;不能在看完结果后临时更换主要指标。

14. 本课练习 ​

  1. 为机器人 episode 设计完整 schema,包括时间戳和版本字段。
  2. 计算 8/10 与 80/100 成功率的不确定性差异。
  3. 设计一个避免对象和任务结构泄漏的划分。
  4. 给十个失败视频建立感知、规划、策略、控制和系统分类。
  5. 为价值模型画可靠性曲线并解释 ECE。
  6. 设计“部署 → 失败 → 数据 → 再训练 → 回归测试”的发布门禁。

论文与工程实验室 ​

OpenPI 实践与 ArcheBase 数据生产

15. 论文与基准证据矩阵 ​

数据规模和 benchmark 分数只有在 schema、切分、评测协议与真实系统条件可追溯时才构成证据。

工作论文事实作者解释课程判断
Open X-Embodiment该工作汇集多机构、多机器人和多任务数据,并训练 RT-X 系列跨本体策略。作者用统一数据格式和大规模异构混合探索跨机器人知识迁移。统一 schema 是算法能力的一部分;动作语义、坐标、频率和本体元数据缺失会让规模产生伪共享。
DROIDDROID 收集大规模、跨场景、跨操作者的真实机器人操作数据,并提供统一采集系统。作者强调多样真实环境与标准化硬件数据管线对通用策略的重要性。数据量之外还要审计场景相关性、操作者偏差、硬件版本和 train-test 实例泄漏。
RoboMimicRoboMimic 系统比较多种离线模仿学习方法、数据质量和任务设置。作者用统一基准揭示算法结果对数据来源、观测和训练细节的敏感性。“同数据集比较”仍需锁定预处理、归一化、动作接口和评测初态,否则不是等条件消融。
LIBEROLIBERO 构建具有对象、空间、目标和长时序变化的持续机器人学习任务套件。作者用结构化任务族评估知识迁移与遗忘,而不只看单任务成功率。泛化声明必须说明留出的是语言表述、对象实例、空间结构还是技能组合。
Guo et al.|Calibration该工作系统评估现代神经网络的概率校准,并比较 temperature scaling 等方法。作者区分分类准确率与置信度可靠性,说明高准确模型仍可能过度自信。机器人成功概率用于接管和门控前必须做条件化校准;全局 ECE 不能掩盖危险子群。

16. 交叉阅读 ​

与所有算法路线连读。 VLA、世界模型、价值学习、分层规划和控制的结论都依赖同一套数据版本、留出和真实闭环协议;路线 G 不是附属工程,而是决定结论是否成立的测量系统。

与 F3 连读。 时间戳、执行器辨识和参数版本既影响 Sim-to-Real,也影响数据标签的因果正确性。

与路线 E 连读。 跨本体共训练只有在动作接口和本体元数据可追溯时才可审计;否则模型可能只记住数据源身份。

与 G1-G4 连读。 本课给出总证据链,后续分别深入统计不确定性、数据版本、部署监控和 OpenPI 系统工程。

文章正文采用 Apache License 2.0