飞书原文 · 源修订 35
💡
机制课: 仿真与真实世界的差异不是一个抽象的“domain gap”,而是质量、摩擦、柔顺性、执行器、传感器、延迟和未建模扰动的联合误差。本课把这些误差拆成可测量、可估计、可随机化和可补偿的对象。
学习目标
完成本课后,应能建立参数化动力学模型;推导最小二乘系统辨识;解释可辨识性、持续激励和闭环偏差;计算延迟造成的相位损失;区分 domain randomization、在线适应、残差学习与数字孪生。
1. 系统辨识在估计什么
把动力学写成参数化形式:
读法: 下一时刻状态由当前状态、控制输入和物理参数经过动力学函数共同决定,再叠加过程噪声与未建模扰动。
推导: 从连续动力学对一个采样周期积分,可得到离散状态转移。质量、惯量、摩擦和执行器参数放入 theta;离散化误差、外部扰动和没有显式建模的效应合并进 w_t。辨识的目标是用数据缩小 theta 的不确定性,而不是假设 w_t 会自动消失。
这里应把缓慢变化、可复用的物理参数与快速、不可预测的扰动分开。若把所有误差都塞进参数,估计会随数据段漂移;若全部当作噪声,又无法校准仿真和控制器。
辨识不是为了追求一份完美物理真相,而是得到对控制和预测足够有用、并且不确定性可描述的模型。
2. 线性回归形式与最小二乘
许多刚体动力学可整理成:
读法: 时刻 t 的测量量等于已知回归矩阵乘未知参数,再加测量误差。
推导: 许多刚体逆动力学虽然对状态是非线性的,但对质量、惯量和摩擦系数等物理参数可以线性重排。把由位置、速度、加速度和输入构成的已知项放进 Phi_t,把待估物理系数放进 theta,就得到线性参数回归。
把多时刻样本逐行堆叠后,就得到一个统一回归问题。接下来最小化全部样本的平方残差,以寻找最能解释这批数据的参数。
读法: 参数估计选择使全部预测残差平方和最小的那组参数。
推导: 把每个时刻的回归方程堆叠后,残差为 y-Phi theta。若误差独立、零均值且具有相同高斯方差,最大化数据似然等价于最小化残差平方和;噪声方差不同或相关时应改用加权最小二乘。
对目标求导并令其为零:
读法: 残差平方和对参数的梯度等于负二倍回归矩阵转置乘残差;最优点令该梯度为零。
推导: 展开二次目标得到 y 转置 y 减二倍 theta 转置 Phi 转置 y,再加 theta 转置 Phi 转置 Phi theta。逐项对 theta 求导并令其为零,得到正规方程。
只有当信息矩阵满秩且数值条件良好时,每个待估参数方向才被数据充分约束,闭式解才具有清晰的辨识意义。
读法: 当信息矩阵可逆时,最小二乘参数等于正规方程的闭式解。
推导: 由梯度为零得到 Phi 转置 Phi 乘 theta 等于 Phi 转置 y;若 Phi 转置 Phi 满秩可逆,两侧左乘其逆矩阵即可。若矩阵奇异或病态,应使用伪逆、正则化或重新设计激励,而不能把数值结果当成已辨识的物理真值。
若机器人只执行一种缓慢运动,惯性效应可能很弱,摩擦与负载又可能相互补偿。此时即使轨迹拟合得很好,单个物理参数仍可能没有被真正区分。
3. 可辨识性与持续激励
可辨识性问的是:不同参数是否会在观测中产生可区分的影响。持续激励要求输入覆盖足够丰富的频率和方向,使信息矩阵:
读法: 在同方差高斯噪声下,参数的 Fisher 信息矩阵等于回归矩阵转置乘自身,再除以噪声方差。
推导: 高斯回归的对数似然二阶曲率由 Phi 转置 Phi 决定;噪声越小,单位数据携带的信息越多。小特征值对应几乎没有被激励的参数方向,条件数很大意味着某些参数组合难以区分。
具有良好条件数。随机乱动不必然是好激励;它可能触碰安全边界,却仍遗漏关键工作区间。更好的实验是在安全范围内设计多频正弦、chirp 或任务相关轨迹。
4. 闭环数据为什么会产生偏差
控制器会根据测量噪声改变输入,因此 与噪声可能相关。普通最小二乘默认回归量与误差独立,闭环下这个条件可能不成立。解决路径包括工具变量、预测误差法、联合状态参数估计或专门的开环辨识实验。
5. 延迟不是“慢一点”
总闭环延迟可拆为:
读法: 一次反馈样本从物理事件到执行器响应的闭环延迟,由感知、编码、推理、通信和执行器等阶段的时间共同构成。
推导: 沿同一个样本的因果链逐段记录时间戳,相邻阶段的时间差相加会望远镜式化简为最终执行时刻减最初感知时刻。流水线并行不等于单个样本没有延迟,因此还要单独统计排队和抖动。
纯延迟在频域中贡献:
读法: 持续时间为 tau 的纯延迟,在拉普拉斯域中等价于乘上指数因子 e 的负 s tau 次方。
推导: 若输出是输入的时间平移,即 y(t)=x(t-tau),拉普拉斯变换的时移性质给出 Y(s)=e^{-s tau}X(s),所以纯延迟的传递函数就是该指数项。
沿频率响应考察纯延迟时,它不改变正弦信号的幅值,却会引入随频率线性增加的相位滞后。
读法: 角频率为 omega 的信号经过纯延迟后,额外相位滞后等于负的角频率乘延迟时间。
推导: 把 s 替换为 j omega,可得 e 的负 j omega tau 次方。根据欧拉公式,它的幅值为一、相角为负 omega tau,因此延迟不衰减正弦幅值,却会直接消耗相位裕度。
例如,10 Hz 运动对应约 62.8 rad/s 的角频率;50 ms 纯延迟会带来约 -3.14 rad,也就是 -180 度的额外相位。实际闭环会在达到这个极端之前就因原有相位裕度耗尽而失稳,因此“平均延迟只有几十毫秒”不是充分的安全判断。

💡
交互验证|反馈控制、接触与 Sim-to-Real 实验室
改变反馈增益、延迟和域随机化覆盖,观察闭环稳定性、接触超调与真实迁移鲁棒性的冲突。
:::6. Sim-to-Real 的五种主要路线
| 路线 | 学习或调整什么 | 适用条件与关键验证 |
|---|---|---|
| 系统辨识 | 质量、惯量、摩擦、执行器和延迟等模型参数 | 模型结构可信且参数可观测;必须报告可辨识性、置信区间和跨轨迹预测误差 |
| Domain Randomization | 对参数分布鲁棒的策略 | 随机化支持集覆盖真实系统;必须分别测试分布内部、边界和分布外 |
| 在线适应 | 由近期历史推断的动力学上下文或快速参数 | 部署时存在可辨认的响应差异;必须做历史置换、参数突变和适应时间测试 |
| 残差学习 | 基线模型或控制器未解释的有限纠偏 | 已有稳定基线且残差受限;必须验证关闭残差后的退化和越界保护 |
| 数字孪生 | 与具体资产、标定、时钟、软件版本和运行数据持续同步的模型状态 | 需要长期运维、诊断和回放;必须证明模型更新可追溯,不把一次离线高保真仿真误称为孪生 |
数字孪生不是第五种神经网络。 它是把系统辨识、资产身份、时间同步、参数版本、仿真和真实运行证据连成持续更新的工程对象。高保真模拟器若不能说明对应哪台机器人、哪版固件、哪次标定和哪段数据,只是模拟器,不是可审计的数字孪生。
7. Domain Randomization 的统计解释
训练目标可写为:
读法: 选择一个策略,使它在训练参数分布采样出的各种动力学环境上的平均回报最大。
推导: 把未知真实动力学看作参数随机变量,训练时反复从 p_train 采样参数并估计回报,样本回报均值就是该期望的 Monte Carlo 估计。这个目标优化的是训练分布平均值,不自动控制分布外系统或低概率尾部失败。
这个目标只保证训练参数分布上的平均表现。随机化太窄会漏掉真实系统,太宽会把大量训练预算花在不可能出现的组合上,并可能迫使策略变得过度保守。
风险敏感版本可以优化低分位数或最坏情况:
读法: 选择一个策略,使最差 alpha 比例动力学条件下的平均回报尽可能高。
推导: 先按回报从低到高排列参数样本,再对最低的 alpha 比例求平均;这就是本课采用的 lower-tail CVaR 约定。它把梯度压力集中到尾部失败,但仍依赖训练分布是否覆盖真实风险。
它更关注参数尾部的失败,而不是只提高平均回报。
8. 在线适应与隐变量
用最近历史估计动力学上下文:
读法: 适应编码器根据最近一段观测和动作历史,压缩出当前动力学上下文 z_t。
推导: 质量、载荷、摩擦和执行器状态在单帧观测中通常不可见,但会通过一段动作后的响应留下证据。把这些隐藏参数视为部分可观测状态,历史编码器近似其后验摘要;它可以用特权参数监督,也可以只通过策略回报或预测损失端到端学习。
部署策略同时以当前观测和动力学上下文为条件。上下文不一定对应可解释的质量或摩擦,它只需保留对行为有用的响应信息。真正的检验是面对参数突变、载荷变化和新硬件时能否快速恢复,而不是 latent 可视化是否看起来分群。
9. Action Chunk 与延迟的权衡
长动作块减少推理调用和网络抖动,却增加两次反馈重规划之间的开环时间。设模型每次预测 H 步,只执行前 h 步:
读法: 重规划周期等于实际执行的动作步数乘单步控制间隔,并且执行步数不能超过本次预测长度。
推导: 相邻控制命令间隔为 Delta t,连续执行 h 个命令后才再次调用策略,因此两次重规划之间经过 h 个采样周期。H 决定可供选择的预测视野,h 决定实际开环长度;增大 H 不必然降低反馈频率,增大 h 才会。
选择 h 时要同时考虑推理吞吐、环境变化速度、接触事件频率与闭环恢复需求。工程上应分别记录预测长度、执行长度和端到端延迟,不能只报告“chunk size”。
10. 最小实验
被控对象。 模拟一维小车,真实参数包含质量、库仑摩擦、粘性摩擦、执行器一阶时间常数、传感器低通和可变延迟。仿真训练时只允许访问训练分布,测试脚本单独保存真实参数,防止隐式泄漏。
| 实验阶段 | 设置 | 要回答的问题 |
|---|---|---|
| 辨识激励 | 恒速、单频正弦、多频正弦、chirp、任务轨迹 | 哪些参数方向未被激励?条件数与参数误差是否一致? |
| 数据闭环 | 开环安全轨迹、闭环控制轨迹、带工具变量的估计 | 普通最小二乘是否因输入与噪声相关而产生偏差? |
| 策略路线 | 标称模型、辨识校准、随机化、历史适应、受限残差 | 性能来自更准的模型、分布鲁棒性、快速推断还是纠偏接口? |
| 测试分层 | 训练分布内部、支持集边界、分布外、运行中参数突变 | 平均泛化、尾部鲁棒性和在线恢复能否被区分? |
| 延迟扫描 | 固定平均延迟,独立改变抖动、丢帧和重规划周期 | 真正破坏闭环的是平均延迟、方差,还是开环动作块长度? |
记录量。 辨识阶段报告参数偏差、置信区间覆盖率、信息矩阵条件数、一步预测误差和长时滚动误差;控制阶段报告平均回报、最差 10% 回报、越界率、稳定时间和适应到新参数所需的物理时间。
关键消融。 冻结适应上下文、打乱历史顺序、错置时间戳、把真实参数移出随机化支持集、逐步放宽残差幅值。每个消融只改变一个机制,才能判断模型是在辨识动力学、记忆任务阶段,还是依靠基线控制器兜底。
11. 失效模式
| 失败模式 | 可观测征兆 | 根因 | 验证与修复 |
|---|---|---|---|
| 真实参数不在随机化支持集 | 训练内部稳定,边界外性能突然断崖式下降 | 支持集由拍脑袋范围定义,遗漏执行器或时延耦合 | 画参数性能曲面;用真实数据更新范围;保留分布外测试 |
| 参数不可辨识 | 拟合误差很小,参数估计随数据段剧烈变化 | 激励不足或多个参数只以组合形式影响观测 | 检查奇异值和条件数;重新设计多频或任务相关激励 |
| 观测管线不一致 | 仿真状态策略很好,接入真实滤波与时间戳后失稳 | 训练未模拟低通、量化、丢帧、缓存和延迟抖动 | 把完整观测管线纳入回放和随机化;逐项延迟扫描 |
| 残差覆盖基线 | 残差幅值持续饱和,关闭基线后行为几乎不变 | 学习器实际上重学了全部控制,失去结构保护 | 约束残差幅值、变化率和能量;报告残差占总命令比例 |
| 适应器混淆任务与动力学 | 更换目标时 latent 跳变,载荷突变却反应迟钝 | 历史同时包含任务阶段和动力学信息,监督目标不充分 | 交叉组合任务与参数;做历史置换;加入特权动力学教师或解耦损失 |
| 平均值掩盖尾部崩溃 | 均值提高,但少数参数区域发生高代价失稳 | 训练与报告只优化期望回报 | 报告最差分位数、CVaR、越界率和参数条件化曲线 |
12. 本课练习
- 从最小二乘目标推导正规方程。
- 解释为什么单一恒速轨迹难以同时辨识质量和库仑摩擦。
- 计算 10 Hz 运动在 50 ms 延迟下的相位损失。
- 设计一个覆盖质量、摩擦、视觉延迟和执行器增益的随机化分布。
- 比较系统辨识、随机化和在线适应各自最关键的验证集。
与其他路线的关系
路线 B 学习的世界模型也可用于动力学预测,但 F3 更强调可控制、可辨识和真实时延;路线 A/D 的策略接口决定误差是否能被底层吸收;路线 G 负责参数、固件、延迟与数据版本的证据链。
13. 论文证据矩阵
Sim-to-Real 文献常把“随机化很多”“适应很快”直接等同于“真实可靠”。下面把实验事实、作者机制解释和课程判断拆开。
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| Ljung|System Identification | 系统辨识理论系统讨论了模型结构、实验设计、预测误差、闭环数据与估计不确定性。 | 作者把辨识视为“数据、模型集合与选择准则”的联合问题,而不是单独套一个最小二乘公式。 | 参数拟合误差低不等于可用于控制;还要验证可辨识性、残差结构和任务相关预测。 |
| Peng et al.|Dynamics Randomization | 该工作在模拟训练中随机化动力学参数,并把策略迁移到真实机器人控制任务。 | 作者用参数变化迫使策略学习对模型误差不敏感的行为,而不是依赖单一标称模型。 | 随机化有效的核心不是范围越宽越好,而是支持集、联合相关性和真实系统覆盖是否可信。 |
| Chebotar et al.|SimOpt | SimOpt 利用真实轨迹与模拟轨迹的差异迭代调整模拟参数分布,形成闭环校准。 | 作者把少量真实经验用于更新随机化分布,而不是直接在真机上重新学习全部策略。 | 这是“辨识分布”而非只辨识单点参数;评估必须防止真实校准集与最终测试集混用。 |
| Kumar et al.|Rapid Motor Adaptation | RMA 使用近期交互历史推断环境上下文,并在四足机器人上展示对地形和动力学变化的快速适应。 | 作者把部署策略拆成基策略和适应模块,训练时可利用特权环境信息,部署时只用历史观测。 | latent 是否聚类并不重要;关键证据是参数突变后的恢复时间、历史置换退化和新硬件测试。 |
| Johannink et al.|Residual RL | Residual RL 在已有控制器之上学习修正,并用于真实接触丰富任务。 | 作者让先验控制器承担易建模部分,让学习处理剩余误差。 | 残差路线只有在幅值、能量和安全边界受控时才保留工程意义,否则只是换接口的端到端控制。 |
14. 交叉阅读
与 F1、F2 连读。 辨识误差和延迟最终通过稳定裕度、峰值力和接触振荡暴露出来;模型预测误差必须落回闭环指标,而不是只看离线损失。
与路线 A 连读。 Action Chunk 能降低推理调用频率,却延长开环执行窗口;VLA 的动作接口决定延迟和模型误差由策略还是底层控制器承担。
与路线 B 连读。 世界模型学习高维潜在动力学,系统辨识强调可激励、可验证和不确定性。两者可以共享数据,但不能用漂亮的视频预测替代控制相关验证。
与路线 G 连读。 真正的数字孪生依赖机器人身份、标定、固件、时钟、数据和参数版本的证据链;缺少这些系统信息,Sim-to-Real 结果不可复现,也无法定位回归。

