跳到正文

飞书原文 · 源修订 21

💡

机制课: 机械臂通常固定在基座上,人形和移动机器人必须同时处理平衡、落脚、碰撞、接触切换和全身协调。高层 VLA 不能直接替代千赫兹级的全身控制。

学习目标 ​

完成本课后,应能读懂浮动基动力学、质心动力学、接触约束和运动模仿目标;区分 model-based whole-body control、学习式 whole-body control model、Behavior Foundation Model、强化学习运动技能和 VLA 高层指令;理解 privileged learning、跨本体训练、domain randomization 和 sim-to-real 在人形控制中的作用。

1. 浮动基系统没有固定支点 ​

读法: 机器人全身的惯性和重力、科氏等偏置项,由可驱动关节力矩和所有接触点传回的广义接触力共同平衡。

推导: 从拉格朗日刚体动力学出发;选择矩阵 S 表示浮动基没有直接执行器,脚底和手部接触通过 Jacobian 转置把环境力映射到广义坐标。

2. 质心动力学:全身运动的低维骨架 ​

读法: 机器人质量乘质心加速度,等于所有接触力与重力的合力。

推导: 对机器人所有刚体应用牛顿第二定律并求和,内部关节力成对抵消,只剩外部接触力和重力。

角动量变化满足:

读法: 绕质心角动量的变化率,等于每个接触力相对质心产生的力矩,加上该接触点施加的外力偶,再对所有接触求和。

推导: 对全身每个刚体的角动量方程求和,内部关节力矩成对抵消,只剩外部接触的力矩。接触力 f_i 的力臂是接触位置 r_i 减质心 c;若足底或手部还能传递纯力偶,则额外加入 tau_i。

这两式解释了为什么落脚位置、接触力和上肢摆动都会影响平衡。

2.1 ZMP 与捕获点:低维平衡指标的适用边界 ​

在线性倒立摆近似中,假设质心高度近似不变、角动量变化较小,地面零力矩点可写成:

读法: 水平面的 ZMP 位置等于质心水平位置,减去质心高度除以重力加速度,再乘质心水平加速度。

推导: 把机器人简化为固定高度的点质量,对地面支撑点取力矩平衡。水平惯性力与重力共同决定合力作用线和地面的交点,整理后得到该式。ZMP 落在支撑多边形内是这组假设下的可实现条件,不是任意三维动作的充分稳定性证明。

若当前落脚点不足以消除发散运动,需要通过下一步落脚位置改变支撑。线性倒立摆的捕获点为:

读法: 捕获点等于当前质心水平位置,加上质心水平速度除以倒立摆自然频率;自然频率由重力与质心高度决定。

推导: 固定高度线性倒立摆的水平动力学可分成收敛模态与发散模态。把位置与速度组合成 xi 后,xi 表示若把支撑点放在那里,可使发散模态被停止的理想位置。真实机器人还受步长、摩擦、摆腿时间和角动量限制,因此它是落脚启发,不是无条件可达点。

公式可视化|ZMP、捕获点与下一步落脚 ​

课程画板

这两个指标的价值是把全身平衡压缩成可解释的低维量;它们的风险是让人忘记假设。快速上身摆动、手部支撑、可变质心高度和强接触冲击都要求回到完整质心动量或全身动力学。

3. 接触计划决定系统能否实现动作 ​

脚不打滑需要满足摩擦约束:

读法: 切向接触力不能超过摩擦系数乘法向力,并且地面只能推机器人,不能把机器人向下拉。

推导: 这是库仑摩擦锥与单侧接触约束。运动策略若要求超出摩擦锥的水平加速度,即使关节轨迹在动画中合理,真实机器人也会滑倒。

4. Whole-body control 如何组合多个任务 ​

一种常见形式是带约束二次规划:

读法: 在满足浮动基动力学、接触点不加速、摩擦可行和执行器力矩上下限的条件下,寻找关节加速度、力矩与接触力,使各任务空间目标的加权加速度误差最小。

推导: 任务空间二阶运动学给出末端加速度等于 Jacobian 乘关节加速度再加 Jacobian 变化项。把质心、躯干、手脚等目标写成二次误差,同时加入全身动力学、固定接触、摩擦锥和力矩限制,就得到约束二次规划。若任务具有不可妥协的优先级,应使用层级 QP,而不是只靠极端权重近似。

5. 强化学习运动策略学什么 ​

低层运动策略通常学习:

读法: 低层运动策略根据当前机载观测、运动命令和估计的环境上下文,生成这一时刻的动作。

推导: 把机器人运动写成部分可观测决策过程:o_t 包含本体状态、接触与可用外感知,c_t 指定目标速度、姿态或技能,z_t 概括地形、载荷和动力学差异。策略学习的是这些条件到动作分布的映射;动作可以是关节目标、增量或受约束力矩。

动作可能是目标关节位置、关节增量或力矩。奖励综合速度跟踪、姿态、能耗、平滑、足端滑动和摔倒惩罚。奖励设计实际定义了“走得像什么”。

6. 模仿学习与 DeepMimic 路线 ​

运动模仿常把参考动作与任务目标结合:

读法: 每一步奖励由姿态、速度、末端位置和质心跟踪等奖励按权重相加。

推导: 这是多目标代价的加权标量化。权重改变最优行为:过度重视姿态会牺牲抗扰恢复,过度重视速度会产生不自然或高冲击步态。

7. Privileged learning 与在线适应 ​

仿真教师可看到真实地形、摩擦和外力,部署策略只能看到机载传感器。适应器从历史估计环境上下文:

读法: 适应器根据最近一段观测和动作历史,估计当前地形、载荷或动力学的隐含上下文。

推导: 未知物理参数会在过去动作造成的状态变化中留下痕迹。只要历史具有足够激励,模型就可能辨识对控制有用的上下文。

8. 从 RMA 到现代人形策略 ​

路线核心机制评审重点
DeepMimic参考动作模仿与任务奖励动作质量与扰动恢复
RMA特权教师与快速环境适应动力学突变和范围外参数
大规模 locomotion RL并行仿真、随机化、课程学习真实地形与接触冲击
人形全身模仿人体动作数据重定向到机器人可实现性、平衡与形态差异
高层 VLA + 低层技能语言/视觉子目标调用运动技能接口频率、失败检测与安全切换

8.1 Whole-body control model 与 Behavior Foundation Model ​

学习式 whole-body control model 通常以本体状态、接触状态、参考动作或高层命令为条件,直接输出关节目标或力矩。它学习的是“怎样让整个身体稳定、协调地执行参考或命令”,不是“动作之后世界会怎样变化”。因此它属于策略与控制模型,而不是路线 B 中的世界模型。

Behavior Foundation Model(BFM)。 这一名称强调用大规模、异质的人体与机器人运动数据训练可复用的全身行为先验。近期工作开始同时扩大动作数据多样性、策略容量和在线 rollout 数量,使单个控制模型覆盖更多运动风格、身体部位协同与控制条件。但“大模型”并不自动带来接触可行性;稳定性仍依赖高频反馈、状态估计、执行器模型和真实硬件验证。

代表路线主要扩展轴关键边界
HoloMotion-1用野外视频重建、动作捕捉和内部数据组成混合运动语料,训练零样本全身动作跟踪模型动作覆盖扩大不等于足底接触、力矩峰值和长时热负载可部署
XHugWBC通过物理一致的形态随机化与语义对齐的观测/动作空间,训练跨人形本体的单一控制策略必须在未见机器人、真实执行器差异和接触分布外条件下验证零样本迁移
Scaling BFM联合扩展参考动作多样性、on-policy rollout 和 Humanoid Transformer 容量需要控制数据、模型规模和训练计算量,才能判断收益来自哪个 scaling 轴
ReactiveBFM把生成式动作规划与高频跟踪闭环连接,通过前缀采样和异步重规划学习误差恢复规划器与控制器之间的暴露偏差、延迟和状态误差仍是决定性风险

正确接口。 BFM 或学习式 WBC 可作为“运动小脑”,接收速度、姿态、末端轨迹、文本生成的动作参考或技能 token;经典 WBC/QP 仍可作为约束投影、安全层或故障回退。评测应分开报告参考跟踪、扰动恢复、跨动作泛化、跨本体迁移、接触与硬件约束,而不是用展示视频替代控制证据。

9. VLA 与全身控制的正确边界 ​

高层模型适合输出目标物体、导航点、身体姿态、技能 token 或短时末端轨迹;低层系统负责动态平衡、足端接触和力矩跟踪。让 VLA 直接以低频视觉输入输出全身力矩,会把稳定性、延迟和硬件差异全部交给数据承担。

课程画板

10. 最小实验 ​

两级模型。 先用线性倒立摆验证 ZMP、捕获点和落脚恢复,再用带浮动基、双脚接触和关节力矩限制的简化双足模型验证全身控制接口。两级模型共享同一组高层速度和转向命令。

实验维度设置要回答的问题
控制结构开环参考轨迹、模型式 MPC/WBC、RL 技能、RL 技能加 WBC 安全层平衡来自参考动作、反馈模型、学习策略还是约束投影?
接触条件摩擦、地面高度、顺应性、足底碰撞恢复系数动作在动力学上可行,还是只在标称接触模型中可行?
硬件条件载荷、关节增益、力矩饱和、控制延迟和观测丢帧Sim-to-Real 退化来自模型、执行器还是时序?
扰动不同方向、幅值、持续时间和相位的推力;踏空与绊碰策略会踝部修正、髋部修正、调整落脚还是请求高层重规划?
接口频率高层命令 2、5、10、20 Hz;低层控制保持 500 Hz高层更新过慢或切换过快分别怎样破坏闭环?

记录量。 除成功率和速度误差外,必须报告摔倒率、恢复时间、额外落脚次数、ZMP/足底支持越界、足端滑移、峰值接触力、峰值与均方根力矩、机械功率、关节限位次数和温升代理量。

关键消融。 固定高层命令只替换低层控制器;固定低层控制器只改变高层更新频率;冻结适应上下文并打乱历史;把人体参考动作换成同任务但不同风格的动作。这样才能区分任务理解、运动风格、动力学适应与稳定控制各自贡献。

11. 失效模式 ​

失败模式可观测征兆根因验证与修复
仿真接触过软或无延迟真机出现脚底高频抖动、冲击峰值和力矩饱和接触刚度、执行器带宽与控制时序不匹配回放真实时间戳与力信号;扫描接触和延迟参数;降低带宽并增加阻尼
人体动作不可重定向视觉上相似,但脚滑、关节撞限位或质心越界忽略形态、质量分布、关节范围和接触时序差异加入动力学可行性优化;报告参考误差与接触可行性而非只看视频
平均速度达标但硬件不可部署峰值力矩、功率、温升或齿轮冲击长期超限奖励只优化任务性能和短回合能耗加入硬件约束;长时运行;报告峰值、分位数和热模型
高层命令切换过快技能尚未进入稳定相位就被打断,接触计划反复翻转接口没有最小驻留时间、完成条件和安全切换状态加入技能握手、滞回和可中断状态;做命令频率扫描
恢复策略方向过拟合训练方向推扰可恢复,斜向、持续推力或踏空立即失败扰动课程只覆盖有限方向、相位与持续时间分层随机化扰动;按方向和相位报告性能曲面
VLA 直接承担低层稳定视觉帧率下降或网络抖动时全身力矩同步失稳低频语义模型与高频接触控制责任未分层让 VLA 输出目标或技能;本体与力反馈留在高频技能/WBC 闭环

12. 本课练习 ​

  1. 从全身牛顿方程推导质心线动量方程。
  2. 解释为什么关节轨迹相似不保证接触力可实现。
  3. 为“向前走并拿起物体”划分 VLA、运动策略与 whole-body control 的职责。
  4. 设计一个检验适应器是否真正识别摩擦变化的实验。
  5. 为人形策略定义成功率之外的五个安全与硬件指标。

13. 论文证据矩阵 ​

下面把经典平衡控制、全身控制、模仿学习、快速适应与现代人形全身模仿放在同一证据链中。

工作论文事实作者解释课程判断
Kajita et al.|ZMP Preview Control该工作在线性倒立摆模型上使用 ZMP 参考与预览控制生成双足行走质心轨迹。作者利用未来 ZMP 参考改善当前质心控制,而不是只做瞬时误差反馈。ZMP 是强有用的低维模型,但必须明确固定质心高度和小角动量等假设。
Sentis & Khatib|Whole-Body Control该路线用操作空间与任务优先级组织浮动基机器人多个全身行为和接触约束。作者把复杂行为分解为具有优先级的任务,同时保持动力学一致性。WBC 学的不是语义任务;它把上层目标投影为满足接触、力矩和优先级约束的瞬时命令。
Peng et al.|DeepMimicDeepMimic 将参考动作模仿奖励与任务奖励结合,学习多种动态角色技能并展示扰动恢复。作者用参考动作提供运动先验,同时保留强化学习对任务和恢复的优化空间。模仿质量与物理鲁棒性是两个指标;像人不等于接触力、能耗和硬件负载可部署。
Hwangbo et al.|Dynamic Legged Skills该工作通过大规模仿真训练与系统建模把动态四足运动策略部署到真实机器人。作者强调执行器建模、随机化和高频控制对真实动态技能的重要性。Sim-to-Real 的瓶颈常在执行器和时序,不应把成功归因于网络结构本身。
Kumar et al.|RMARMA 通过近期交互历史估计环境上下文,使四足策略快速适应地形和动力学变化。作者用特权教师训练基策略,再让部署适应模块从可用历史恢复上下文。适应的证据应是参数突变后的恢复和历史消融,而不是 latent 聚类图。
Fu et al.|HumanPlusHumanPlus 使用人体动作数据和分层学习,使人形机器人执行影随、模仿与多类全身任务。作者把人体先验转移到人形控制,并用低层运动能力支撑高层任务模仿。现代人形路线正在把“可行运动先验”与“任务语义”连接起来,但仍依赖稳定低层、重定向和真实安全验证。
HoloMotion-1以大规模混合运动语料训练人形运动基础模型,并面向零样本全身动作跟踪。野外视频重建运动可显著扩大 MoCap 之外的行为覆盖。应同时审计重建噪声、接触可行性、动作长尾和真机硬件负载。
XHugWBC通过形态随机化和跨机器人语义接口训练单一跨本体全身控制策略。共享控制模型可把多种人形机器人的结构差异吸收到统一策略中。未见本体真机迁移、执行器带宽差异和安全退化比仿真平均分更关键。
Scaling BFM / ReactiveBFM前者研究行为数据、rollout 与模型容量协同扩展;后者把动作生成和高频跟踪组成反应式闭环。全身控制基础模型可从“复现参考”走向多条件、可恢复和实时重规划。必须拆分规划、跟踪与恢复贡献,并报告延迟、跟踪偏差、摔倒率和真实扰动测试。

13.1 主要资料 ​

14. 交叉阅读 ​

与 F1、F2 连读。 全身稳定性最终仍是反馈、延迟和接触问题;质心指标不能替代足底力、摩擦和执行器带宽。

与 F3 连读。 现代 locomotion RL 的真实能力高度依赖执行器辨识、随机化、历史适应和时间同步。

与路线 A、D 连读。 VLA 负责语义目标和技能调用,层级规划负责长时序切换,低层技能与 WBC 负责动态平衡和瞬时接触可行性。

与路线 E 连读。 人体视频和动作捕捉提供运动先验,但跨本体重定向必须尊重人形机器人的形态、质量、关节、接触和硬件限制。

文章正文采用 Apache License 2.0