跳到正文

飞书原文 · 源修订 30

💡

路线定位: 本章属于 Physical AI 的“动力学、控制与物理交互”路线。学习模型决定做什么,控制系统决定动作命令如何稳定、安全地作用于真实机械系统。读者只需具备线性代数、概率统计和基本微积分基础。

学习目标 ​

完成本章后,应能区分运动学、动力学、轨迹和控制;能口头读出机器人动力学方程;能解释位置、速度、力矩和末端增量接口的差异;能推导 PD 控制的误差反馈;能理解阻抗控制与接触稳定性;能分析控制延迟如何改变策略数据分布;能为学习策略设计清晰的控制接口和真实机器人验证。

1. 从策略输出到真实运动之间还有什么 ​

课程画板

策略输出的“动作”通常不是电机最终施加的物理量。模型可能输出末端位姿增量,逆运动学把它转换成关节目标,伺服控制器再产生电流或力矩。任何一层的饱和、延迟和误差都会改变真实闭环。

层输入输出典型频率
任务规划语言、场景、目标子目标或技能0.1-2 Hz
学习策略图像、本体状态、子目标动作块或轨迹5-50 Hz
运动控制目标位置、速度、力关节力矩或电流100-2000 Hz
机械系统力矩、外力真实位姿与接触连续物理过程

2. 运动学:动作命令在哪个坐标系中表达 ​

关节配置记作 。正运动学把关节状态映射到末端位姿:

读法: 末端位姿 x 由关节配置 q 通过正运动学函数 f 决定。

推导: 从机器人基座开始,依次组合每个关节的刚体变换,就得到末端变换;把这串矩阵乘法记成函数 f。它只描述几何关系,不涉及质量、力或加速度。

对小变化线性化:

读法: 末端速度等于当前关节配置下的 Jacobian 乘关节速度。

推导: 对正运动学 x=f(q) 关于时间求导,用链式法则得到偏导矩阵 J(q) 与 q_dot 的乘积。J 的每一列表示对应关节单位速度对末端速度的瞬时贡献。

读作:“末端速度等于当前配置下的 Jacobian 乘以关节速度。”Jacobian 描述每个关节的微小运动如何组合成末端运动。

如果策略输出末端速度 ,一种逆运动学解为:

读法: 关节速度命令等于 Jacobian 伪逆乘期望末端速度。

推导: 求解 J q_dot 近似等于 x_dot 的最小二乘问题,可得到 Moore-Penrose 伪逆解。接近奇异位形时小奇异值会放大命令,因此工程上常使用阻尼伪逆、零空间项和速度限幅。

这里的伪逆是把末端速度需求分配到关节速度的最小二乘工具。接近奇异位形时,它可能把很小的末端命令放大成很大的关节速度,因此真实系统需要阻尼伪逆、速度限制和可达性检查。

3. 动力学方程应该怎样读 ​

刚体机器人的常见动力学形式是:

读法: 惯性、关节耦合、重力和摩擦所需力矩之和,等于执行器力矩加上外部接触力映射到关节空间的力矩。

推导: 由拉格朗日或牛顿-欧拉方程整理刚体动能、势能和非保守力,可得到左侧内部动力学项。虚功关系把末端外力映射为 J 转置乘外力;不同摩擦符号约定可把 tau_f 移到等式另一侧。

项读法物理含义
惯性项质量矩阵乘关节加速度产生加速度需要的惯性力矩
科氏力与离心力项科氏与离心项运动状态引起的耦合力矩
重力项重力补偿项抵抗重力需要的力矩
摩擦与未建模阻力摩擦与未建模阻力关节摩擦、线缆阻力等
执行器力矩执行器力矩控制器能够直接施加的输入
外部接触力映射到关节空间外部笛卡尔力映射到关节接触力对关节的影响

完整读法是:“机器人加速、关节耦合、重力和摩擦所需的总力矩,等于执行器力矩加上外部接触力映射到关节空间后的作用。”学习策略即使不知道每一项,也必须通过数据覆盖或反馈控制应对这些效应。

4. 位置、速度、力矩和末端动作接口 ​

接口模型输出底层承担什么适用与风险
关节位置关节位置目标位置伺服和动力学补偿稳定易用,但接触顺应性弱
关节速度关节速度目标速度跟踪与积分局部控制直观,延迟会累积漂移
关节力矩关节力矩目标电流环与安全限制表达能力强,但数据和安全要求高
末端增量末端位姿增量逆运动学、坐标变换、轨迹平滑操作语义清楚,存在奇异与不可达
末端力或阻抗期望力或阻抗参数力控、阻抗和接触检测适合插拔与柔顺操作,依赖力觉和高频控制

跨机器人训练时,动作空间不能只靠补零统一。相同 token 在不同机器人上可能代表不同末端速度、不同控制频率或不同安全边界。需要记录坐标系、单位、归一化方式、频率和底层控制器。

5. PD 控制:最小反馈控制器 ​

设期望位置为 ,误差为:

读法: 位置误差等于期望关节位置减去当前关节位置。

推导: 这个符号约定让正误差表示机器人尚未到达目标的方向。若改用 q 减 q_d,后续控制律的反馈符号也必须同时改变。

最简单的关节 PD 控制律:

读法: 控制力矩由位置误差的比例反馈、速度误差的微分反馈和重力补偿组成。

推导: 比例项像弹簧一样把系统拉向目标,微分项像阻尼器一样抑制相对速度,重力补偿抵消静态负载。K_p 和 K_d 通常取正定矩阵;饱和、延迟和噪声会限制可用增益。

比例项根据位置误差产生恢复力矩,微分项根据速度误差提供阻尼,重力项抵消静态负载。对一维质量系统 ,代入后得到:

读法: 一维质量在 PD 控制下的误差满足一个质量、阻尼和刚度组成的齐次二阶方程。

推导: 令目标位置恒定,则 q_dot 等于负 e_dot,q_ddot 等于负 e_ddot。把 PD 力矩代入 m q_ddot 等于 tau,移项后得到该式;其特征根决定收敛速度、振荡和阻尼比。

这与阻尼二阶系统相同。 增大通常提高刚度与响应速度, 抑制振荡。但过高增益会放大噪声、延迟和未建模柔性,导致震荡甚至不稳定。

6. 阻抗控制:不要只控制位置,也要控制交互关系 ​

接触任务中,严格跟踪位置可能产生很大的碰撞力。笛卡尔阻抗控制希望末端表现得像一个虚拟弹簧阻尼系统:

读法: 期望末端力由位置偏差产生的虚拟弹簧力和速度偏差产生的虚拟阻尼力组成。

推导: 把末端与目标之间的关系设计成弹簧阻尼器,就不再要求刚性跟踪轨迹,而是规定偏离时产生多大恢复力。接触环境也有刚度,闭环稳定性取决于机器人、控制器、采样和环境共同作用。

目标不是强迫末端瞬间到达某点,而是规定偏离目标时产生多大的恢复力。插孔、擦拭、开门和操作柔性物体时,顺应性通常比几何精度更关键。

策略可以输出目标位姿,也可以输出刚度、期望力或接触 phase。但让学习模型直接输出高频力矩,会显著增加安全风险;更常见的做法是让学习策略给出低频参考,确定性控制器执行高频稳定反馈。

7. 接触、摩擦与模式切换 ​

库仑摩擦常用摩擦锥近似:

读法: 接触面的切向摩擦力大小不能超过摩擦系数乘法向力。

推导: 库仑摩擦模型把可保持静止接触的切向力集合近似为摩擦锥。所需切向力超出边界时发生滑动;三维中 f_t 是切平面向量,f_n 应为非负法向压力。

读作:“切向摩擦力不能超过摩擦系数乘法向力。”如果所需切向力超过边界,接触会滑动。抓取成功不仅取决于末端位置,还取决于法向力、摩擦系数、接触面和物体惯量。

接触带来离散模式切换:未接触、初次碰撞、稳定接触、滑动和脱离具有不同动力学。单一平滑回归模型容易在切换点预测平均行为。需要接触事件标签、力觉、触觉、混合动力学模型或高频反馈。

8. 延迟、采样与 Action Chunk ​

如果观测延迟为 、推理时间为 、执行通信延迟为 ,动作实际作用时对应的总延迟约为:

读法: 总闭环延迟近似等于观测、模型推理和动作通信执行延迟之和。

推导: 这三段顺序发生时,动作基于 delta 秒以前的信息。若流程并行、带缓存或不同步,真实延迟还包含排队与采样相位,应使用时间戳实测分布而非只用平均值。

策略看到的是过去状态,却在未来状态上执行动作。速度越高、接触越敏感,这一错位越危险。Action Chunk 可以减少推理调用,但增加开环执行时间;频繁重规划提高纠错能力,却可能因模型延迟造成停顿和抖动。

选择收益代价
长 Action Chunk动作连续、推理调用少错误持续更久,环境变化难纠正
短 Action Chunk闭环频率高推理负载和边界抖动增加
动作重叠与平滑降低 chunk 切换突变可能延迟新策略纠错
预测未来状态补偿减少延迟错位依赖世界模型或状态估计精度

9. 学习策略与控制器如何分工 ​

方案学习模型负责确定性系统负责适用场景
策略输出位置目标语义、场景、轨迹意图IK、伺服、限速、安全通用操作与大规模数据
策略输出残差补偿模型误差基础控制与稳定性有可靠控制器的精细改进
策略输出阻抗参数按任务调节顺应性高频力控接触丰富任务
端到端力矩策略完整反馈控制硬件安全门限仿真、高频本体任务,真实部署需谨慎

合理的分工不是越端到端越先进。应根据数据频率、传感器、接触风险和可验证性选择接口。确定性控制器提供已知稳定结构,学习模型处理难以手工建模的感知、任务条件与复杂残差。

10. 系统辨识与 sim-to-real ​

动力学参数可以通过数据估计。若模型写成:

读法: 测量 y_t 被写成已知回归量 Phi_t 与未知参数 theta 的线性组合,再加测量或建模噪声。

推导: 许多机器人动力学对质量、惯量和摩擦参数是线性的,即使对状态本身非线性。把多时刻方程堆叠,就能用线性回归估计参数;epsilon 包含传感器噪声和未建模动力学。

其中 包含质量、摩擦或电机参数,最小二乘估计为:

读法: 最小二乘参数估计等于设计矩阵正规方程的逆乘观测向量。

推导: 最小化平方误差范数,对 theta 求导并令梯度为零,得到 Phi 转置 Phi 乘 theta 等于 Phi 转置 y。只有 Phi 满列秩时可直接求逆;否则应使用伪逆、正则化,并报告条件数和置信区间。

统计上需要检查可辨识性、噪声相关性和置信区间。只在缓慢自由空间运动中采样,无法可靠估计高速摩擦或接触参数。

sim-to-real 通常使用系统辨识、域随机化、在线适配和真实数据后训练。随机化范围过窄无法覆盖现实,过宽则使策略过度保守。关键不是让仿真看起来逼真,而是覆盖影响决策与控制的动力学变量。

11. 真实机器人评测 ​

层级指标回答的问题
跟踪位置、速度、力误差与频响底层是否执行了策略命令
接触峰值力、滑动率、接触稳定时间物理交互是否安全稳定
延迟感知到动作总延迟、抖动闭环时序是否匹配训练数据
任务成功率、时间、恢复率控制改动是否改善最终行为
安全碰撞、急停、人工接管率平均成功率是否掩盖风险

12. 本章练习 ​

  1. 口头解释动力学方程的每一项,并指出哪些量通常可以测量、哪些需要估计。
  2. 对一维质量系统推导 PD 闭环方程,改变 观察过冲和收敛时间。
  3. 比较同一策略使用位置控制和阻抗控制执行插孔任务时的失败模式。
  4. 设计一个延迟扫描实验,分别改变观测、推理和执行延迟。
  5. 给跨机器人数据定义完整动作 schema:坐标系、单位、频率、控制器和安全范围。
  6. 设计一个区分“策略错误”和“控制器未跟踪”的诊断实验。

13. 最小实验:策略接口如何改变真实闭环 ​

先在一维质量或两关节机械臂仿真中验证运动学、PD 和延迟,再选择一个可重复的真实插接、擦拭或开门任务。固定视觉策略和高层目标,只替换底层接口为关节位置、关节速度、末端增量、力矩和阻抗控制。

  1. 扫描 K_p、K_d、阻抗刚度、控制频率与总延迟。
  2. 加入质量、摩擦、外参和执行器增益偏差,比较系统辨识与域随机化。
  3. 在接触前、初次碰撞、稳定接触和滑动阶段分别统计误差。
  4. 固定策略输出,记录命令动作与实际执行动作的差异。
  5. 比较单步重规划与不同长度 Action Chunk。

最低报告项: 任务成功率、跟踪误差、超调、收敛时间、力峰值、滑动率、能耗、饱和比例、紧急停止、端到端延迟分布,以及策略错误与控制器跟踪错误的分解。

14. 主要失败模式 ​

失败表现诊断与修正
坐标系或单位错误方向相反、尺度异常或跨机器人失效显式 from/to、单位、频率和端到端标定
Jacobian 奇异小末端命令产生巨大关节速度奇异值、阻尼伪逆、零空间与限幅
高增益与延迟振荡静态测试正常,高速或网络延迟下发散延迟扫描、频率响应和增益裕度
动作饱和控制器无法实现策略命令,误差长期积累记录饱和率、抗积分饱和和可达性过滤
接触模式平均化碰撞、稳定接触和滑动被回归成模糊动作事件标签、混合动力学与高频反馈
摩擦锥违规抓取位置正确但物体滑落法向力、切向力、摩擦裕度和触觉
Action Chunk 开环过长扰动后继续执行过时动作chunk 长度扫描、异步重规划和中断机制
系统辨识不可辨识参数拟合误差低,换轨迹后失效激励覆盖、设计矩阵条件数和置信区间
仿真随机化范围错误过窄不覆盖现实,过宽使策略过度保守真实残差、参数敏感度和逐项随机化消融

15. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
Operational Space Control在任务空间构造动力学与控制律,把末端任务力映射到关节力矩机器人可以直接围绕末端任务设计动态行为提供接触与任务空间控制地基,但依赖模型、状态估计和稳定实现
Residual RL让学习策略在已有控制器动作上叠加残差,利用先验结构同时修正模型误差确定性控制与学习残差可以互补残差范围、安全约束和基线控制器质量决定可部署性,不能只看最终奖励
Domain Randomization在仿真中随机化视觉或动力学参数,以提高现实分布覆盖足够多样的仿真可让现实成为训练分布的一部分随机化变量必须与控制敏感度匹配,并用真实残差验证范围
Dactyl结合大规模仿真随机化和强化学习完成真实灵巧手操作复杂接触技能可通过仿真规模和随机化迁移它证明特定系统工程路线可行,不代表所有任务都能靠更宽随机化解决

16. 课程交叉阅读 ​

F1|反馈控制与稳定性

F2|接触、阻抗、力控与触觉

F3|系统辨识、延迟与 Sim-to-Real

F4|人形、移动与全身控制

本章必须形成的结论 ​

  • 策略输出不是物理动作的终点,而是控制系统的参考输入。
  • 动作接口决定数据分布、跨机器人语义和安全边界。
  • 接触、延迟和底层控制会改变学习策略实际面对的闭环分布。
  • 世界模型、VLA 和分层规划最终都必须通过动力学与控制路线接受真实检验。
  • 对真实机器人,稳定结构与学习能力的合理组合通常优于无法验证的全端到端堆叠。

推荐资料 ​

文章正文采用 Apache License 2.0