跳到正文

飞书原文 · 源修订 17

💡

论文实验室: 本课不按论文逐篇摘要,而用同一个任务审问不同路线:它让模型学习什么?哪些稳定性由结构保证?哪些能力来自数据?失败时应该改策略、控制器、模型还是系统?

学习目标 ​

完成本课后,应能比较 MPC、阻抗控制、Residual RL、Domain Randomization 和在线适应;重建关键目标函数;设计等算力、等数据和等安全预算的消融;把控制指标与任务成功率放在同一证据链中。

1. 统一实验任务:有间隙与摩擦不确定性的插接 ​

任务分为接近、首次接触、搜索对准、插入和退出五个阶段。观测包括视觉、本体与腕力;动作可以是末端增量、期望力、阻抗参数或残差力矩。评测同时记录成功率、完成时间、峰值力、冲击能量、恢复次数和人工接管。

2. 五类系统到底学习什么 ​

系统主要学习对象结构性先验
轨迹优化/MPC动力学或代价模型,可不学习策略在线滚动优化与约束
阻抗控制通常不学习,人工设定机械关系反馈与柔顺结构
Residual RL基线控制器上的修正量经典控制承担主行为
Domain Randomization参数分布上鲁棒的策略仿真器与随机化支持集
在线适应动力学上下文及条件策略短历史包含可识别信息

3. MPC:在模型里反复问“接下来会怎样” ​

有限时域优化:

读法: 在预测动力学、状态安全集合和动作安全集合的约束下,选择未来 H 步控制序列,使阶段代价与终端代价之和最小。

推导: 从当前状态向前滚动动力学,候选控制序列会生成候选状态轨迹;把每一步误差、控制代价、接触风险和终端目标累加,就得到有限时域优化。每个控制周期只执行第一步并用新观测重算,因此模型误差能被反馈不断修正,但求解时间必须小于重规划周期。

MPC 可以使用人工模型,也可以学习动力学、代价或终端价值。它的结构性能力来自显式预测、候选比较和约束处理;若模型在接触模式上错误,在线重规划只能减轻而不能消除系统性偏差。

4. Residual RL:让学习只补模型缺口 ​

组合控制律:

读法: 总控制命令等于基线控制器命令加学习残差,并把残差大小限制在半径 delta 内。

推导: 先用已有模型或控制器承担可预测主行为,再把未建模摩擦、柔性和接触细节看作有限修正。对网络输出做缩放或投影即可满足残差界。这个分解降低探索范围,但不会自动保证总命令安全;基线偏差过大时,小残差无力挽救,大残差又会覆盖结构先验。

Residual RL 的关键审计量不是“加了一个网络”,而是残差占总命令的比例、饱和时间、能量贡献,以及关闭残差后哪些失败重新出现。若残差长期饱和,系统实际上正在重学全部控制。

5. 论文证据矩阵 ​

工作论文事实作者解释课程判断
Tassa et al.|Online Trajectory Optimization该工作使用在线轨迹优化与反馈控制,在模型中实时合成并稳定复杂机器人行为。作者把优化与局部反馈结合,使控制器不断基于当前状态重算,而不是离线生成一条固定轨迹。MPC 的优势来自模型、约束与反馈重规划;比较时必须计入求解延迟和模型失配。
Levine & Koltun|Guided Policy SearchGPS 使用轨迹优化产生局部控制分布,再监督训练能够从高维观测输出动作的全局策略。作者让优化器处理局部控制难题,让策略网络承担跨状态和感知输入的泛化。它不是普通行为克隆;教师轨迹的覆盖、分布一致性和真实数据预算决定最终策略能力。
Johannink et al.|Residual RLResidual RL 在已有控制器之上学习动作修正,并在真实接触丰富任务中验证。作者让先验控制器承担易建模行为,学习器专注补偿剩余误差。残差并非天然安全;必须报告残差界、饱和、基线质量和总命令约束。
Akkaya et al.|Rubik's Cube该工作通过大规模域随机化、循环策略和真实机器人手完成魔方操作。作者用广泛模拟变化和记忆应对未观测动力学与真实差异。成功证明的是特定训练分布、系统与任务上的迁移,不证明随机化范围越宽越好。
Kumar et al.|RMARMA 使用近期交互历史恢复环境上下文,并快速适应地形和动力学变化。作者用特权教师训练基策略,再让部署适应器从可用传感历史近似上下文。在线适应必须通过历史置换、参数突变和恢复时间证明,而不是只展示 latent 图。
Buchli et al.|Variable Impedance Learning该工作讨论通过学习同时获得运动轨迹与可变阻抗,使机器人适应接触和扰动。作者把阻抗作为可学习的交互策略组成,而不只学习几何轨迹。学习增益时必须约束正定性、变化率、峰值力和能量;成功率不能替代接触安全。

课程画板

6. 必须重建的三条推导 ​

6.1 LQR 与局部二次近似 ​

读法: Riccati 递推从未来价值矩阵反向计算当前价值矩阵和反馈增益,最终控制是状态乘负反馈增益。

推导: 假设下一时刻最优剩余代价仍是状态的二次型,把线性动力学代入 Bellman 方程,得到关于当前动作的二次函数。对动作求导并配方可得 K_t,再把最优动作代回得到 P_t。递推从终端代价开始向前一时刻计算,说明 LQR 是局部线性二次模型下的动态规划,而不是经验调出来的 PD。

6.2 残差动作的梯度 ​

读法: 残差策略的性能梯度,是各时刻残差动作对数概率梯度乘优势估计的期望和。

推导: 环境实际执行的是基线命令加残差命令,但似然比策略梯度只需要残差动作来自哪个概率分布。轨迹回报通过优势估计告诉模型该残差是否改善结果;基线控制器不必可微,但它会改变策略访问到的状态分布和可探索区域。

6.3 鲁棒目标 ​

读法: 选择一个策略,使它在允许参数集合中最不利的那组动力学条件下仍尽可能好。

推导: 先固定策略,在参数集合中寻找使回报最低的情况,再更新策略提高这个最低值。它与对随机参数求平均不同,会把优化压力集中到边界和对抗性组合,因此通常更保守,也更容易暴露安全集合是否定义错误。

7. 论文实验的公平比较 ​

  1. 统一观测、控制频率和动作边界。
  2. 分别报告仿真步数、真实交互次数和人工调参时间。
  3. 让所有方法遵守相同峰值力与接管门限。
  4. 在相同参数网格上画性能地形,而不是只给一个平均值。
  5. 对传感器延迟、摩擦、间隙和载荷做单因素与组合留出。
  6. 区分任务失败、控制不稳和系统超时。

8. 最小复现实验 ​

环境。 使用成熟物理引擎实现二维 peg-in-hole:孔位偏差、间隙、摩擦、接触刚度、执行器时间常数、视觉偏差和力反馈延迟均可独立设置。训练、校准和最终测试参数种子必须分离。

比较维度统一设置需要单独记账
方法固定阻抗、MPC、阻抗加 Residual RL、Domain Randomization、历史在线适应模型先验、网络参数量、求解器与手工规则
控制接口相同观测、20 Hz 高层决策、1 kHz 底层控制、相同动作和力矩边界MPC 求解时间、策略推理时间、超时与降级次数
数据预算相同真实交互上限与相同最终测试集仿真步数、真实回合、人工调参小时、失败造成的重置成本
参数测试训练内部、支持集边界、分布外与组合留出孔位、摩擦、间隙、载荷、视觉偏差和时延的性能地形
安全预算相同峰值力、冲量、力矩和人工接管阈值触发哪条保护、保护前后是否仍算成功

输出图。 至少生成训练或调参成本曲线、参数性能热图、接触力时间序列、残差占总动作比例、适应器恢复曲线,以及成功率与峰值力的 Pareto 前沿。

关键消融。 MPC 注入受控模型偏差;Residual RL 扫描残差上限并关闭基线;随机化把真实参数移出支持集;在线适应冻结或打乱历史。每个方法都要有能直接破坏其核心机制的负对照。

9. 失效模式与诊断矩阵 ​

失败模式优先怀疑决定性验证修复方向
自由空间准确,接触即振荡阻抗增益、总延迟、接触刚度扫描控制频率与环境刚度,观察相位和峰值力降低带宽、增加阻尼、补偿延迟或改接触模型
仿真稳定,真机峰值力大执行器带宽、传感滤波与刚度差系统辨识并把真实时延和执行器模型注入仿真校准模型、扩大相关随机化、收紧安全层
训练参数内好,边界崩溃随机化支持集与参数相关性连续参数网格与组合留出,不只抽随机种子更新支持集、尾部目标和真实校准协议
残差长期饱和基线方向错误或残差界过小画残差占总动作和饱和持续时间;关闭基线重测先修基线、分阶段训练或重新定义残差接口
适应器换任务就改变 latent把任务阶段误当动力学固定动力学换任务、固定任务换动力学,做交叉组合解耦上下文、加入特权教师或历史置换约束
成功率相同但一法更危险平均任务指标掩盖峰值与接管比较峰值力、冲量、CVaR、保护触发和人工接管用多目标 Pareto 与统一安全预算选方法

10. 本课练习 ​

  1. 为插接任务分别写出 MPC 代价、Residual RL 奖励和安全约束。
  2. 解释为什么同样的成功率可能对应完全不同的接触风险。
  3. 设计一个证明在线适应器利用了动力学历史而非视觉场景标签的实验。
  4. 画出平均鲁棒目标、CVaR 和最坏情况目标的差异。
  5. 给出何时应优先改控制器而不是扩大 VLA 的判断标准。

实验室结论 ​

控制与学习不是二选一。真正的问题是把哪些不确定性放入模型、把哪些结构写进控制器、把哪些剩余规律交给数据学习,并用真实闭环指标验证这个边界是否合理。

文章正文采用 Apache License 2.0