飞书原文 · 源修订 23
💡
机制课: 自由空间里,位置误差通常意味着“还没到”;接触发生后,同样的位置误差可能意味着“正在把环境越推越狠”。本课研究策略、控制器、传感器与接触动力学怎样组成稳定的物理闭环。
学习目标
完成本课后,应能读懂接触约束、摩擦锥、力控制和阻抗控制公式;推导一维环境接触下的等效刚度;解释为什么触觉不是多一个输入通道,而是接触状态的高频观测;设计插接、擦拭或柔性抓取的最小实验。
1. 接触改变了问题的数学类型
自由运动满足刚体动力学:
读法: 自由空间中,惯性、关节耦合和重力所需力矩之和等于执行器力矩。
推导: 由拉格朗日或牛顿-欧拉方程整理刚体动能和势能得到。这里省略摩擦与外力,用来和接触后的方程比较。
读作:“惯性、科氏与离心项、重力共同消耗执行器力矩。”接触后还要加入环境施加的广义力:
读法: 接触后,除执行器力矩外,还加入接触力通过接触 Jacobian 转置映射到关节空间的广义力矩。
推导: 虚功关系给出关节虚位移与接触点虚位移的映射,因此接触力对关节做功等价于 J_c 转置乘 lambda。lambda 与运动共同未知,并受接触模式约束。
这项说明了接触力并不会直接等于某个关节的力矩,而要按照接触点运动对各关节的敏感度重新分配。未知量不再只有运动,还包括接触力和接触模式。
1.1 单侧约束
设物体到表面的间隙为 ,则理想刚性接触满足:
读法: 间隙和法向接触力都非负,并且二者不能同时为正。
推导: 若有间隙,物体未碰到表面,法向力必须为零;若产生推力,间隙必须为零。乘积为零把这两种互斥模式写成互补条件,理想表面不会产生拉力。
读作:“要么有间隙而法向力为零,要么间隙为零而允许产生推力;表面不会主动把物体吸过去。”这叫互补条件,说明接触是模式切换而不是普通平滑回归。
2. 摩擦锥与滑动
库仑摩擦的简化条件是:
读法: 切向接触力大小不能超过摩擦系数乘法向接触力。
推导: 库仑静摩擦能提供的切向力集合构成摩擦锥。需求在锥内时可粘着,达到边界后进入滑动;lambda_n 必须非负。
读作:“可用切向摩擦力不能超过摩擦系数乘法向力。”落在摩擦锥内部可以粘着,触及边界后容易滑动。策略只预测末端位姿,却不知道 、法向力和接触姿态时,同一动作可能稳定抓住,也可能瞬间打滑。

3. 纯位置控制为什么会“顶死”
一维位置控制器可写成:
读法: 位置控制力由目标与当前位置的比例误差减去速度阻尼项组成。
推导: 目标固定时,比例项像刚度 K_p 的弹簧,微分项抵抗运动。自由空间中它推动质量到目标;碰到环境后,未消除的位置误差会持续转化为接触力。
若环境近似为弹簧 ,静态平衡时 。忽略速度项:
读法: 静态平衡时,机器人虚拟弹簧的推力等于环境弹簧的反力。
推导: 速度为零时阻尼项消失,机器人控制力为 K_p(x_d-x),环境压缩量为 x-x_e、反力大小为 K_e(x-x_e)。平衡要求两者大小相等。
整理得:
读法: 接触平衡位置是机器人目标和环境表面位置按各自刚度加权的平均。
推导: 展开平衡方程,把含 x 的项移到同一侧,得到 (K_p+K_e)x=K_p x_d+K_e x_e,再除以总刚度。
接触力为:
读法: 接触力等于两个刚度串联后的等效刚度,乘目标穿入环境表面的位移。
推导: 把平衡位置代入任一弹簧力,得到乘积除以刚度和。该系数是串联弹簧等效刚度,说明任一侧很软都会限制接触力。
这个推导揭示:目标位置穿入表面越深,力越大;机器人和环境刚度越高,小小的定位误差也会产生大力。高精度位置跟踪并不等于安全交互。
4. 阻抗控制:指定“像什么机械系统”
阻抗控制希望误差满足:
读法: 采用实际位置减目标位置作为误差时,外力驱动一个具有期望质量、阻尼和刚度的虚拟机械系统。
推导: 阻抗控制不直接指定唯一力或位置,而是设计外力与运动误差的动态关系。M_d、D_d、K_d 为正定时形成可调的惯性、耗散和恢复特性。
读作:“外力推动机器人时,机器人表现得像具有期望质量、阻尼和刚度的虚拟弹簧阻尼系统。”它不直接要求力等于某个数,而是规定力与位移之间的动态关系。
在任务空间中常用:
读法: 任务空间的弹簧、阻尼和前馈力通过 Jacobian 转置映射为关节力矩,再加重力补偿。
推导: 先在末端空间构造期望广义力,再用虚功关系 J 转置映射到关节。该简化式忽略完整操作空间惯性解耦,工程实现需考虑动力学补偿、限幅和奇异位形。
公式可视化|阻抗参数如何塑造接触响应

其中,前馈力用于表达已知的支撑、载荷或期望接触力;任务空间刚度与阻尼决定机器人在各方向上的柔顺程度。插孔时可以让轴向推进受限、横向保持柔顺;擦拭时可以让切向跟踪轨迹、法向维持压力。
5. 混合位置与力控制
用选择矩阵 指定位置控制子空间, 指定力控制子空间:
读法: 选择矩阵 S 对应的方向使用位置控制,互补子空间使用力控制,两者相加形成任务空间命令。
推导: 若 S 是投影矩阵,S 与 I-S 把任务空间拆成互补方向。例如擦拭时切向追轨迹、法向追压力;S 必须在与接触几何对齐的坐标系中定义。
读作:“有些方向追位置,有些方向追接触力。”关键不是公式,而是坐标系必须跟接触几何对齐。若表面法向估计错了,所谓法向力控制会同时推向切向,引发打滑。
6. 触觉究竟提供什么
| 信号 | 直接可见 | 常见推断 |
|---|---|---|
| 六维力/力矩 | 合力与合力矩 | 碰撞、载荷、接触方向 |
| 指尖阵列 | 压力分布 | 接触位置、面积、偏心 |
| 视触觉图像 | 表面形变纹理 | 滑动、局部几何、剪切 |
| 电机电流 | 驱动力代理量 | 异常阻力和碰撞 |
触觉的优势是采样快且直接响应接触,局限是局部、漂移、滞后和传感器域差异。策略可以用触觉选择接触模式,底层控制器则应用高频力反馈稳定执行。
7. 学习策略应输出什么
| 输出接口 | 策略学习什么 | 主要风险 |
|---|---|---|
| 末端位姿 | 几何目标 | 接触力由误差间接产生 |
| 期望力 | 接触强度 | 接触坐标和模式必须可靠 |
| 阻抗参数 | 刚度、阻尼、平衡点 | 参数范围可能破坏稳定性 |
| 技能或模式 | 接近、搜索、插入、退出 | 切换条件错误 |
工程上常采用“低频策略给目标与模式,高频控制器保证稳定”的分层接口。直接让神经网络输出力矩不是不可能,但会把采样、稳定性、安全和硬件差异全部压入数据。
8. 最小可视化实验:一维接触
系统模型。 用质量块表示末端,用单侧 Kelvin-Voigt 元件表示墙面。控制周期固定为 1 ms,策略或目标更新周期固定为 50 ms,使“低频决策、高频控制”的接口可被单独观察。
读法: 质量块的加速度由控制力减去环境反力决定;只有穿过墙面位置时才产生压缩量,环境反力由压缩弹簧和接触阻尼共同给出,并被限制为不能拉动物体。
推导: 先由牛顿第二定律写出质量乘加速度等于合力,再用非负压缩量表达单侧接触。Kelvin-Voigt 模型把弹性力与耗散力相加;外层最大值排除理想接触面的拉力。它不是精确材料模型,但足以暴露刚度、阻尼、延迟与峰值力之间的关系。
| 实验维度 | 设置 | 要回答的问题 |
|---|---|---|
| 控制器 | 高刚度位置、低刚度位置、阻抗、法向力控制 | 性能差异来自目标接口还是来自反馈结构? |
| 环境 | 软、中、硬三档墙面刚度;两档接触阻尼 | 同一控制参数能否跨材料保持稳定? |
| 时序 | 0、10、30 ms 反馈延迟;无抖动与随机抖动 | 稳定裕度是否被延迟侵蚀? |
| 观测 | 无噪声、力偏置、时间戳错位、触觉丢帧 | 控制器是在利用接触信号,还是在追逐伪信号? |
记录量。 每次运行保存位置、速度、控制力、环境力和接触状态。至少报告峰值接触力、稳态力误差、2% 稳定时间、振荡次数、最大穿透量,以及控制器向接触方向注入的机械功。
最小消融。 在同一条轨迹上依次屏蔽触觉、打乱触觉时间顺序、加入固定零漂,并保持视觉和动作完全不变。若策略真的利用了触觉,屏蔽与置换应产生不同且可解释的退化,而不只是随机波动。
判读标准。 高位置增益通常减少自由空间误差,却会在硬环境中放大峰值力;阻尼不足表现为接触后的多次过零和反复弹跳;延迟增加时,同一组参数可能从衰减振荡变成发散振荡。若加入触觉后平均成功率提高、但峰值力和方差同时恶化,不能把结果简单解释为“触觉有效”。
9. 失效模式
| 失败模式 | 可观测征兆 | 根因 | 验证与修复 |
|---|---|---|---|
| 视觉说“抓住”,物体仍在滑 | 切向触觉持续变化,抓取位姿变化很小 | 视觉缺少局部剪切与微滑信息 | 做触觉屏蔽和置换消融;加入滑动分类或抓力闭环 |
| 零漂被当作持续接触 | 空载时仍有稳定非零力,接触阈值长期触发 | 传感器偏置、温漂或安装预载 | 每回合空载标定;在线估计偏置;阈值使用滞回 |
| 仿真抓稳、真机打滑 | 相同法向力下切向速度更大 | 摩擦、表面顺应性和触觉域不匹配 | 跨材料测试;随机化摩擦与顺应性;用真实接触数据校准 |
| 阻抗参数越界 | 峰值力陡升、关节饱和、接触后高频振荡 | 策略直接输出不受约束的刚度或阻尼 | 限制参数范围和变化率;投影到正定集合;增加力与功率屏障 |
| 触觉与动作错时 | 模型在动作发生前预测“接触”,或纠正方向相反 | 时钟不同步、缓存延迟、重采样错误 | 记录硬件时间戳;做延迟扫描;以因果窗口重新对齐 |
| 成功率高但接触不安全 | 任务完成,峰值力、冲量或材料损伤超限 | 奖励和评测只关心终态 | 同时报告成功、峰值力、冲量、能量和安全越界率 |
10. 本课练习
- 推导机器人弹簧与环境弹簧串联时的等效刚度。
- 为擦桌任务定义切向位置、法向力的混合控制坐标系。
- 解释为什么触觉对滑动检测有价值,但不能替代全局视觉。
- 设计一个验证“策略真的使用触觉”的传感器置换实验。
- 为学习阻抗参数设置稳定性与安全约束。
与其他路线的关系
路线 A 产生动作或阻抗目标;路线 B 可以预测接触后果;路线 C 可用成功、峰值力和损伤定义价值;路线 D 管理接近、接触、恢复等模式;路线 G 负责同步、阈值、监控和回归测试。
11. 论文证据矩阵
下面把“论文报告了什么”“作者怎样解释机制”和“本课程据此做出的教学判断”分开,避免把课程归纳误写成论文原话。
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Operational Space Control | Khatib 在操作空间中建立任务坐标的动力学与力控制形式,并处理运动与力的统一表达。 | 作者把末端任务变量视为控制设计的自然空间,而不是先在关节空间追踪再间接得到末端行为。 | VLA 若输出末端目标或力,仍需要明确它通过怎样的任务空间动力学接口落到关节力矩。 |
| Hybrid Position/Force Control | Raibert 与 Craig 将任务坐标拆成位置控制方向和力控制方向,用于受约束操作。 | 作者强调控制方向必须与任务和接触约束一致。 | 选择矩阵不是固定模板;表面法向估计错误会把“法向力控制”变成同时推挤和打滑。 |
| Vision and Touch for Grasping | Calandra 等在抓取与再抓取实验中联合使用视觉和触觉,并比较了不同感知组合。 | 作者把触觉视为接触后补足视觉不确定性的信号,尤其用于判断抓取结果并触发再抓取。 | “多模态”只有在传感器消融、置换和时序测试中出现机制一致的退化,才说明策略真正使用了触觉。 |
| Residual Reinforcement Learning | Johannink 等让学习策略在已有控制器输出之上学习残差,并在真实机器人接触任务中验证。 | 作者用先验控制结构承担可预测部分,让学习集中处理模型误差和难以手工建模的接触效应。 | 对接触丰富任务,策略未必应该重学全部力矩;学习目标可以是对稳定控制器的有限纠偏。 |
12. 交叉阅读
先读 F1。 反馈、稳定性与采样延迟决定本课控制器能否安全闭环;没有 F1 的稳定性语言,很容易把“柔顺”误解成简单降低增益。
再连到路线 A。 VLA 可以输出位姿、力、阻抗参数或接触技能。输出接口不同,策略实际学习的问题和所承担的稳定性责任也不同。
再连到路线 B 与 C。 世界模型可以预测接触后果,价值学习可以把成功、峰值力、损伤与恢复成本共同写入目标,但预测误差和奖励遗漏都会转化为真实接触风险。
最后连到 F3 与路线 G。 摩擦、延迟、传感器偏置和材料顺应性都属于系统辨识与 Sim-to-Real 问题;上线后必须通过时间同步、阈值监控、回归任务和安全越界率持续验证。

