飞书原文 · 源修订 18
💡
机制课: 离线 checkpoint 不是机器人产品。部署系统需要安全包络、运行时监控、异常检测、降级、人工接管、影子评测、回归门禁和可追溯回滚。本课研究如何把模型的不确定性转化为系统动作。
学习目标
完成本课后,应能建立 hazard、constraint 与 monitor 的对应关系;区分模型置信度、分布外检测和物理安全指标;设计 runtime assurance、shadow deployment、canary 与回滚;用风险预算而非平均成功率决定发布。
1. 安全不是一个损失项
机器人风险可以粗略表示为:
读法: 期望风险等于每类危险发生概率乘其后果成本,再对危险类别求和。
推导: 把总损失写成按危险事件划分的随机变量,使用全期望公式可得到各事件概率乘条件损失的加权和。该式要求危险分类足够完整且成本可比较;相关事故链、不可接受伤害和法规硬约束不能只靠平均期望稀释。
低概率高后果事件不能被大量普通成功稀释。工程上需要同时降低发生概率、限制后果、提高检测率并缩短响应时间;不可接受伤害应直接作为硬约束,而不是允许用任务收益抵消。
2. 从危险分析到运行约束
| 危险 | 可观测信号 | 运行时动作 |
|---|---|---|
| 碰撞/夹伤 | 距离、力、速度、人体区域 | 限速、停止、退让 |
| 物体掉落 | 触觉滑动、夹爪宽度、视觉 | 重抓、放置到安全区 |
| 策略失去目标 | 置信度、进度、循环轨迹 | 重新感知、请求人工 |
| 系统超时 | 推理延迟、消息年龄 | 保持、切换本地控制器 |
| 传感器异常 | 掉帧、漂移、时间戳 | 降级或终止 |
3. Safety envelope
允许状态集合记为 。简单运行时过滤器求离策略动作最近的安全动作:
读法: 在动作边界内寻找最接近策略建议的命令,同时要求模型预测的下一状态仍位于安全集合。
推导: 把策略动作看作期望命令,把关节、速度、碰撞距离和接触力等安全要求写成对下一状态的约束,再做最小改动投影。若模型、状态估计或约束遗漏有误,投影本身不保证安全,因此需要独立监控和硬件限幅。
约束可以来自关节限位、速度、碰撞距离、接触力、功率或 barrier function。安全过滤器应记录每次修改了多少策略动作;若长期大幅修正,说明策略和安全层的职责边界已经失配。
4. Control Barrier Function 直觉
用 表示安全集合。连续系统 中,希望:
读法: 安全函数沿自然动力学的变化率、控制输入能够改变的部分和一个边界恢复项之和必须非负。
推导: 对 h(x) 沿系统 x_dot=f(x)+g(x)u 求时间导数,得到梯度 h 分别乘 f 和 g u,也就是两个 Lie 导数。加入单调函数 alpha 后,约束要求系统接近边界时至少以足够速度保持或返回安全侧,从而使安全集合正向不变。
CBF 的保证依赖状态可观测、模型误差有界且优化能按时完成。真实系统还需要物理急停、独立硬件限幅和保守余量,不能把数学可行性等同于整个产品安全。

💡
交互验证|动作年龄、Canary、回滚与故障注入实验室
改变动作年龄、安全响应预算、Canary 流量和故障注入,观察何时应降级或回滚。
:::5. 模型置信度不等于安全
动作分布熵、ensemble 方差或 VLM token 概率可以作为不确定性信号,但危险还取决于速度、接触、人体距离和可恢复性。同样的低置信度,在空旷慢速移动中可能可接受,在刀具接近人体时不可接受。
因此触发规则应条件化于风险上下文:
读法: 当当前上下文中的估计伤害概率乘后果成本超过风险阈值时,系统必须介入。
推导: 同样的不确定性在低速空旷环境和人体附近具有不同后果,因此把概率预测与上下文成本结合为条件风险。阈值应由安全预算、校准误差和响应能力共同确定;高后果场景还应设置不依赖概率估计的硬禁区。
6. 在线监控的四层
- 系统健康: 延迟、掉帧、温度、GPU、网络、消息年龄。
- 物理健康: 力、速度、碰撞距离、关节余量、振动。
- 任务健康: 进度、重复动作、超时、目标是否仍存在。
- 分布健康: 输入嵌入、对象、场景、动作和失败切片漂移。
监控指标必须绑定可执行响应,否则只是仪表盘装饰。
6.1 安全响应必须跑赢伤害时间
监控不是“最终能发现”就够了。对快速碰撞或掉落,检测、决策和制动总时间必须小于从危险出现到不可逆伤害的剩余时间:
读法: 检测危险、决定响应和执行制动的总时长,必须小于危险发展到伤害所需的时间。
推导: 从危险开始计时,监控先消耗检测延迟,安全逻辑再消耗决策延迟,执行器最后消耗制动或退让时间。只有三段之和仍早于伤害时刻,软件响应才有物理意义;否则必须提前限速、扩大安全距离或使用更快的本地保护。
这个不等式应在最差而非平均延迟下验证,并计入传感器周期、队列抖动、网络超时、制动距离和负载变化。
6.2 漂移检测需要顺序统计量
对延迟、动作边界或嵌入异常分数 ell_t,可用单侧 CUSUM 累积持续偏移:
读法: 当前累计异常分数等于上一时刻累计值加新分数减容忍漂移,并截断为非负;超过阈值 H 时报警。
推导: 若正常分数均值低于参考值 nu,累计量会经常回到零;若分布发生持续上移,每一步都有正漂移并逐渐越过阈值。H 控制误报与检测延迟的权衡,必须用正常运行和故障注入数据校准。
7. 影子、Canary 与分阶段发布
| 阶段 | 模型权限 | 主要证据 |
|---|---|---|
| 离线回放 | 无控制权 | 一致性、延迟、动作边界 |
| Shadow | 只预测不执行 | 与现网策略分歧、资源占用 |
| 受控实验 | 安全场地、人工随时接管 | 真实闭环和故障响应 |
| Canary | 小机器人/小任务切片 | 线上风险与回滚能力 |
| 扩大发布 | 逐步提高覆盖 | 分层指标持续达标 |
8. 回归测试不是旧 benchmark 重跑
回归集应包括:核心能力、历史严重失败、边界条件、传感器降级、延迟注入、硬件版本和跨任务组合。每次修复都应新增能够重现该失败的测试,形成累积的“事故免疫记忆”。
9. 发布门禁
门禁应同时包含:
- 主任务效果下界,而非只看点估计。
- 任何关键安全指标不得退化。
- 历史严重失败回归必须通过。
- 推理延迟、资源和超时符合预算。
- 数据、模型、代码、固件与配置可追溯。
- 停止、降级、人工接管和回滚演练通过。
10. 事故与 Near Miss
没有造成损失的 near miss 也应记录。一次事件至少包含:时间线、模型与硬件版本、观测与动作、monitor 是否触发、人工操作、直接原因、系统原因、修复项和回归测试。根因分析不能停在“模型幻觉”这种不可操作标签。
11. 最小部署演练
演练系统。 建立回放加硬件在环环境,使现网策略、新策略、安全过滤器、独立监控器和低层控制器都按真实频率运行。所有故障注入必须记录真实发生时刻、检测时刻、响应命令和物理停止时刻。
| 故障注入 | 期望响应 | 必须测量 |
|---|---|---|
| 相机冻结、时间戳回退、力传感器漂移 | 降级感知、保持或安全停止 | 检出率、误报率、检测延迟和消息年龄 |
| 推理超时、GPU 过热、网络丢包 | 切换本地控制器并禁止陈旧动作 | 最差端到端延迟、切换空窗和控制连续性 |
| 人体进入、碰撞距离缩短、接触力突增 | 限速、退让或急停 | 响应时间预算、停止距离、峰值力和最小安全余量 |
| 目标消失、循环动作、任务超时 | 重新感知、恢复或请求人工 | 任务监控召回率、无效循环时长和接管成功率 |
| 输入嵌入和任务分布缓慢漂移 | 告警、缩小覆盖或停止扩大灰度 | CUSUM 检测延迟、误报间隔和漂移切片性能 |
| canary 指标恶化和配置不兼容 | 原子回滚模型、配置、tokenizer 与控制参数 | 回滚时间、状态恢复、版本一致性和回滚后回归 |
发布序列。 离线回放、shadow、受控实验、canary 和扩大灰度必须使用递增权限;每阶段预先定义通过、停止和回滚条件。shadow 分歧只能说明候选不同,不能替代真实闭环安全试验。
最小输出。 故障注入覆盖矩阵、检测时延分布、安全响应时间预算、风险切片仪表、shadow 分歧报告、canary 决策日志和一键回滚演练记录。
12. 失效模式
| 失效模式 | 系统性原因 | 决定性检查 | 修复 |
|---|---|---|---|
| 安全逻辑与策略同进程 | 模型卡死、内存耗尽或 GPU 故障会同时关闭保护 | 杀死策略进程并观察保护是否仍可制动 | 独立进程、独立看门狗和硬件急停链路 |
| 阈值只在开发集调过 | 真实噪声、延迟和高风险子群未进入校准 | 故障注入与分层可靠性/风险覆盖测试 | 条件化阈值、保守余量和定期再校准 |
| 急停动作本身造成掉落 | “停止”没有考虑持物、重力和当前接触状态 | 在不同姿态、负载和阶段演练停机 | 设计保持、放置安全区、受控退让等状态化降级 |
| 平均指标达标但高风险切片退化 | canary 流量未按危险上下文分层 | 按人体距离、工具、速度和任务阶段切片 | 风险加权采样和任何关键切片不得回归的门禁 |
| 回滚只切 checkpoint | 配置、tokenizer、固件和控制参数仍是新版本 | 回滚后比对完整部署 manifest | 原子发布包与事务化回滚 |
| 监控有告警但无人负责 | 没有 owner、响应时限和自动动作 | 演练夜间告警到恢复的完整时间线 | 每个 monitor 绑定 runbook、owner、SLO 和自动降级 |
13. 本课练习
- 为协作机械臂取放任务列出五类 hazard 及 monitor。
- 构造一个“模型高置信但物理高风险”的例子。
- 写出从 shadow 到 canary 的发布门禁。
- 设计相机冻结和推理超时的独立安全响应。
- 把一次物体掉落事件改写成可自动回放的回归测试。
与其他路线的关系
G3 不替代算法路线,而是约束它们的部署权限。路线 F 提供物理限制与底层保护;G1 给出统计门限;G2 保证版本可追溯;路线 C 的人工接管和失败数据可以成为下一轮学习信号。
14. 安全与运行时保障论文证据矩阵
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Sha et al.|Simplex Architecture | Simplex 架构让高性能但未完全验证的控制器与经过验证的安全控制器并存,由决策模块在必要时切换。 | 作者用独立安全基线限制在线升级的风险。 | runtime assurance 的核心是故障隔离和可切换安全后备,不是给策略再加一个损失项。 |
| Ames et al.|Control Barrier Functions | CBF 将安全集合正向不变条件转化为可在线加入控制优化的约束。 | 作者用 barrier 不等式把性能控制与安全约束组合。 | CBF 只覆盖模型和状态估计能表达的危险,必须与硬件保护、延迟预算和故障监控结合。 |
| García & Fernández|Safe RL Survey | 该综述整理修改优化准则与限制探索过程两大类安全强化学习方法。 | 作者区分训练期安全和部署期性能保证。 | 机器人上线安全不能只引用训练奖励;探索约束、运行时保护和回滚证据必须分开。 |
| Lakshminarayanan et al.|Deep Ensembles | Deep Ensembles 使用多个独立模型提升预测不确定性和校准表现。 | 作者将模型间分歧作为预测不确定性的实用近似。 | ensemble 方差是信号而非安全结论;它必须结合后果、物理状态和分布漂移校准。 |
| Geifman & El-Yaniv|Selective Classification | 选择性分类研究模型拒绝部分样本时的风险覆盖权衡。 | 作者通过置信排序降低被接受样本的错误风险。 | 机器人系统要把拒绝映射为重新感知、降级或人工接管,并计入覆盖和响应成本。 |
| Mitchell et al.|Model Cards | Model Cards 提议记录模型用途、评测条件、限制和分群性能。 | 作者用结构化文档提高部署透明度和责任边界。 | Physical AI 模型卡还应绑定控制频率、硬件、固件、安全层、回滚包和真实事故历史。 |
15. 交叉阅读
与 F1-F3 连读。 运行时安全依赖稳定性、接触限制、延迟和系统辨识,不能由高层置信度独立决定。
与 G1 连读。 阈值、canary 和灰度发布需要校准、风险覆盖和分层置信区间。
与 G2 连读。 完整回滚必须恢复模型、配置、tokenizer、固件和控制参数,并能追溯每次事件。

