跳到正文

飞书原文 · 源修订 26

🔁

核心判断: 物理因果改变模型所表示的世界结构,具身思维链改变模型在执行过程中如何使用这些结构。真正的具身推理不是输出语言解释,而是完成“观察—预测—行动—验证—修正”的物理闭环。

本文是《从机器人控制到 Flow Matching:π 系列的数学地基》的专题延伸。

1. 从条件模仿到因果干预 ​

普通行为克隆学习:

读法: 策略 pi theta 在当前观测 o_t 和语言指令 l 的条件下,对动作块 A_t 给出一个概率分布。

推导: 行为克隆把专家数据中的动作块视为监督标签,最大化专家动作的条件似然;因此策略学到的是训练分布中“看到这种观测和指令时,专家通常怎样做”。

它回答:在类似观测和任务条件下,专家通常执行什么动作。

加入物理因果后,还需要学习动作如何改变世界:

读法: 在当前状态 s_t 下,主动施加动作 a_t 后,因果模型 p_phi 对下一状态 s_{t+1} 给出的分布。

推导: 条件分布 可能混入“什么状态下专家会选这个动作”的选择偏差;do 算子把动作视为外部干预,要求模型回答同一状态下换一个动作会造成什么结果。机器人随机试验或可控仿真能直接提供这种干预数据。

这里的 表示动作是机器人主动施加到环境中的干预,而不是数据中偶然观察到的相关变量。

变化的核心是:策略不再只拟合动作,而是需要在动作选择中考虑状态变化、任务收益、风险和不确定性。

2. 什么是机器人中的物理因果 ​

机器人中的物理因果不是抽象哲学,而是三个可以实验验证的问题:

  1. 干预: 机器人执行某个动作后,环境是否按预测变化?
  2. 机制: 状态变化是通过接触、力、摩擦、约束还是对象关系产生?
  3. 反事实: 如果动作、接触点或物体属性不同,结果是否会不同?

结构化动力学 ​

真实系统可以写成:

读法: 下一时刻状态等于动力学函数 F 作用于当前状态、动作和未建模因素 xi_t。

推导: 物理系统的下一状态不仅取决于机器人做了什么,也取决于当前状态和摩擦、延迟、外力等扰动;把这些未完全观测因素收进 xi_t,就得到最基本的受控状态转移式。

其中 包含未完全观测的摩擦、质量、顺应性、控制延迟和外界扰动。

对象中心形式可以进一步写为:

读法: 对象 j 的下一状态由它当前的状态、机器人动作、接触关系、物理属性和扰动共同决定。

推导: 把整体状态拆到对象层后,同一动作是否改变对象取决于是否接触以及对象的质量、摩擦和材质。这样的对象中心分解比单纯预测整幅图像更容易表达“哪个动作通过什么接触改变了哪个对象”。

这里:

  • :对象 的位置、姿态与状态;
  • :机器人与对象的接触关系;
  • :质量、摩擦和材质等物理属性。

相关性与因果性的差别 ​

观察到“手向上移动时杯子也向上”只是一种相关性。要形成因果模型,还要区分:

  • 没有接触时,手向上不会带动杯子;
  • 夹持力不足时,杯子可能滑落;
  • 接触点不同会改变杯子旋转;
  • 杯子质量变化会改变所需力和速度。

📌

物理因果的最低标准: 模型必须能够预测干预结果,并在物理条件被改变时相应改变预测,而不只是复述训练数据中的共现规律。

3. 什么是具身思维链 ​

具身思维链不是把内部推理翻译成一段文字,而是机器人在物理环境中循环执行:

状态记忆 ​

机器人维护 belief state:

读法: 当前信念状态 b_t 由上一时刻信念、当前观测和上一动作更新得到。

推导: 单帧观测无法直接给出被遮挡对象、接触是否稳定或任务进展;因此系统用上一信念保存历史,再用已执行动作预测变化,并用新观测纠正预测。Update 可以是贝叶斯滤波器,也可以是循环网络或 Transformer。

可以包含对象状态、接触状态、任务阶段、历史动作和不确定性。

子目标推理 ​

读法: 规划器根据当前信念状态 b_t 和语言任务 l,选择当前子目标 g_t。

推导: 长时任务不能只依赖原始指令;规划器必须结合已经完成的阶段、当前物理状态和不确定性,把全局任务压缩为此刻可执行且可验证的局部目标。

例如“把杯子放到托盘”可以分解为:

text
定位杯子
→ 选择抓取区域
→ 建立稳定接触
→ 抬升并避障
→ 移动到托盘
→ 放置
→ 验证 cup_on_tray

闭环动作 ​

读法: 动作 a_t 从以当前信念状态和子目标为条件的策略分布中采样。

推导: 高层规划给出要达到的局部结果,低层策略再结合当前状态产生动作。写成 pi_theta 的点分布可以避免把已采样的 a_t 同时误写成分布自变量。

每次执行后,机器人必须检查真实结果,而不是假设计划已经成功。

4. 两者如何共同改变策略模型 ​

物理因果定义“世界如何响应动作”,具身思维链定义“机器人如何反复使用这些响应规律”。两者结合后,策略从直接映射变为模型辅助决策:

读法: 在长度 H 的候选动作序列中,选择世界模型预测的任务收益减去风险代价后期望值最大的那一条。

推导: 对每条候选动作序列,世界模型产生未来状态分布;效用 U 衡量子目标进展,C 衡量碰撞、能耗、力和其他风险。对预测的不确定未来取期望,再最大化净效用,就得到模型式动作选择。

其中:

  • :动作条件世界模型或对象状态转移模型;
  • :任务进展和最终成功收益;
  • :碰撞、能耗、速度、力矩和风险代价。

模型结构通常增加四个组件:

  1. 对象中心状态或 belief encoder;
  2. 动作条件状态转移模型;
  3. 子目标或任务图模块;
  4. 结果验证和失败恢复模块。

它不一定需要完整的像素级世界模型。对机器人控制而言,预测“是否接触、对象是否移动、任务谓词是否改变”通常比生成逼真视频更直接。

5. 对数据、Tokenizer 与训练目标的影响 ​

数据发生的变化 ​

普通示范数据因果与具身数据
成功轨迹成功、失败、扰动与恢复
观测与动作观测、动作、接触、状态变化和结果
固定环境主动改变质量、摩擦、位置和对象实例
动作标签动作前提、预期后果和完成条件

Tokenizer 发生的变化 ​

只编码人体或机器人运动:

text
[MOVE_LEFT] [ROTATE_WRIST] [CLOSE_GRIPPER]

升级为对象中心的因果事件:

text
[APPROACH cup]
[CONTACT cup stable]
[GRASP cup]
[CAUSE cup_follows_hand]
[VERIFY cup_lifted]
[FAIL slip]
[RECOVER regrasp]

Token 不只表示“做了什么”,还表示:

  • 动作发生的前提;
  • 动作作用于哪个对象;
  • 预期造成什么状态变化;
  • 结果是否符合预期;
  • 失败后进入什么恢复状态。

训练目标发生的变化 ​

读法: 总损失由行为克隆、动力学预测、物理事件、子目标完成和失败恢复五项加权相加。

推导: 行为克隆只监督“做什么”;其余辅助目标分别监督“会发生什么、发生了什么事件、目标是否完成、失败后怎样继续”。各 lambda 为非负权重,用验证集或梯度尺度平衡,不能把这条式子理解为所有系统都必须采用同一组固定权重。

  • :模仿专家动作;
  • :预测动作后的状态变化;
  • :预测接触、抓取和释放事件;
  • :判断子目标和任务谓词是否完成;
  • :从失败状态恢复。

6. 文本思维链为什么不等于具身推理 ​

语言模型可能生成:

杯子可能滑落,所以应该减小速度并增加夹持力。

这句话听起来合理,但只有在以下信息真正进入控制闭环时,才构成具身推理:

  • 模型能够观测或估计接触和滑移;
  • “增加夹持力”能够映射为机器人可执行控制;
  • 机器人执行后再次检查杯子是否稳定;
  • 结果不符合预期时会重新规划。
文本思维链具身思维链
输出语言步骤维护可执行状态和子目标
可能是事后解释动作前预测、动作后验证
不需要真实反馈必须接收视觉、触觉或力觉反馈
错误不一定影响下一步预测误差必须触发状态更新和恢复
语言正确即可以物理任务成功为最终指标

❗

判定原则: 如果删除生成的文字后,机器人动作完全不变,那么这段 CoT 很可能只是解释层,而不是控制机制的一部分。

7. 如何验证模型真的学到了物理因果 ​

不能只用动作预测误差证明物理因果。需要主动干预训练分布中的变量,并检查模型是否按机制变化。

干预实验应观察到的变化排除的伪相关
改变物体质量调整速度、加速度或夹持策略只按外观选择动作
改变摩擦改变夹持力、接触时间或抓型把固定轨迹当成机制
移动接触点预测对象平移和旋转结果变化只记忆手部轨迹
更换外观但保持物理属性行为基本保持背景和颜色泄漏
相同外观、改变内部重量根据交互反馈更新 belief只依赖第一帧视觉
执行中施加扰动检测偏差并恢复开环播放动作序列

需要报告的指标 ​

  • 动作后果预测误差;
  • 对象状态和接触事件准确率;
  • 任务完整成功率;
  • 扰动后的恢复成功率和恢复时间;
  • 物理属性 OOD 泛化;
  • 因果变量干预前后的策略敏感性;
  • 不相关视觉变化下的策略稳定性。

最小反事实测试是:保持图像语义相近,只改变一个物理因素,检查模型是否改变动作;再保持物理因素不变,只改变外观,检查模型是否保持动作。

8. 与 WAM-TTT、世界模型和 Behavior Tokenizer 的关系 ​

方法主要解决什么仍缺少什么
WAM-TTT将人类视频写入测试时 fast-weight memory显式对象因果、接触和可解释恢复状态
像素世界模型预测未来视觉或视频视觉逼真不保证动作和接触物理正确
对象世界模型预测对象状态、关系和事件变化需要可靠对象和接触表示
Behavior Tokenizer将行为压缩为可组合事件和技能需要动作后果和物理验证来获得因果语义
具身思维链组织观察、子目标、预测、行动和恢复必须与真实控制和反馈闭环绑定

它们可以组合为:

text
人类与机器人多模态数据
→ 对象 / 接触 / 事件 Tokenizer
→ 对象中心因果世界模型
→ 具身任务图与子目标
→ Action Expert
→ 视觉 / 力觉反馈
→ 验证与恢复

WAM-TTT 更接近“如何快速吸收人类行为记忆”;物理因果与具身思维链进一步解决“为什么动作有效、结果是否符合预期、失败后如何修正”。

9. 最小可实现系统 ​

完整物理因果系统成本很高。一个务实的最小版本不需要先生成高保真视频,也不需要重建所有力学参数。

最小系统 ​

  1. 从视觉和本体信号构建对象中心 belief state;
  2. 识别 approach、contact、grasp、release、state-change 和 failure;
  3. 预测候选动作是否改变目标对象状态;
  4. 用任务谓词选择当前子目标;
  5. 执行短动作块并检查结果;
  6. 预测失败时重新感知、重新抓取或重新规划。

对应的最小闭环为:

读法: 系统从当前信念得到子目标,为候选动作预测各自的下一状态,选出动作 a_t,观察真实结果,再更新下一信念。

推导: 下一状态预测必须以候选动作为条件,不能在动作尚未给定时先产生唯一的 hat s_{t+1}。把候选动作与各自预测结果成对比较后执行其中一个,才形成因果预测进入控制决策的闭环。

✅

阶段小结: 物理因果让机器人从“专家通常怎么做”前进到“我的动作会造成什么”;具身思维链让机器人从“一次性输出动作”前进到“持续观察、预测、执行、验证和恢复”。只有当预测与真实物理反馈共同改变后续动作时,两者才真正进入机器人智能。

10. 主要失败模式 ​

失败表面现象真正需要检查的证据
把相关性当因果训练分布内动作预测准确,改变质量或摩擦后立即失效单变量物理干预与反事实预测误差
动作没有进入预测不同候选动作得到几乎相同的未来动作置换、动作消融与敏感度曲线
视觉捷径依赖颜色、背景或操作者身份选择动作外观保持物理不变与物理改变外观相近的成对测试
状态估计错误规划逻辑合理,但基于错误对象、遮挡状态或接触判断belief 校准、对象绑定准确率和接触事件检测
模型被规划器利用模型平均误差不大,搜索却找到不真实的高收益未来计划分布上的误差、真实 rollout 复核和不确定性约束
文字解释与控制脱钩思维链很完整,删除或打乱文字后动作不变控制等预算下的文本消融和状态反馈对照
完成检测漂移过早推进任务阶段或在已完成阶段反复动作任务谓词精确率、召回率与切换时刻误差
恢复策略只会重启局部失败后整任务清零,长时成功率迅速下降局部恢复率、回退层级和恢复成本

11. 最小实验:模型是否真的使用物理因果 ​

选择一个可重复的推、抓或倾倒任务,训练数据中让物体外观与物理属性高度相关,例如红色物体通常较轻、蓝色物体通常较重。测试时构造四组配对条件。

  1. 同外观、改物理: 保持图像和任务语义近似,只改变质量、摩擦或接触点。
  2. 同物理、改外观: 保持动力学参数不变,只改变颜色、纹理和背景。
  3. 动作干预: 从同一初始状态执行不同动作,比较预测后果与真实后果。
  4. 闭环扰动: 执行中途移动物体或制造滑落,检查系统是否更新 belief、重选子目标并恢复。

比较四类系统:纯行为克隆、带动力学辅助损失的策略、使用世界模型但不开搜索的策略、使用世界模型进行候选动作比较的闭环系统。固定训练数据量、视觉骨干、策略容量、控制频率和推理预算。

最低报告项: 动作成功率、干预后果预测误差、物理属性变化下的动作敏感度、外观变化下的动作不变性、模型校准误差、扰动恢复率、计划分布与普通测试分布上的模型误差。

判定: 只有当模型在物理因素变化时按机制改变预测和动作、在纯外观变化时保持行为,并且这些预测实际改善闭环结果,才有证据说明物理因果进入了策略决策。

12. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
CausalWorld提供可控制质量、摩擦、尺寸等变量的机器人操作环境,用于因果结构与迁移评测系统化干预有助于研究结构泛化,而不只是在固定分布上拟合它提供了合格的因果压力测试,但仿真变量可控不等于真实机器人已解决因果辨识
SayCan把语言模型的技能先验与机器人 affordance 或价值分数结合,选择可执行技能语言知识与物理可行性联合排序可支持长时任务证明的是给定技能库上的组合与落地,不等同于学习连续动力学或自动发现因果机制
Inner Monologue把成功检测、场景描述等环境反馈写回语言规划上下文并重复规划闭环环境反馈能改善长时计划执行关键贡献是反馈进入重规划;是否必须使用自然语言,应与同等状态反馈的非文本规划器对照
世界模型路线学习动作条件转移,并可用于想象训练或在线规划预测未来可提高数据效率与决策质量高像素保真不是物理因果的充分条件;计划分布上的机制正确性和真实闭环收益更重要

13. 本课练习与交叉阅读 ​

  1. 解释为什么动作预测准确率高,仍不能证明模型学到了动作的因果效果。
  2. 为抓取任务画出状态、动作、接触、物理属性和结果之间的因果图,并指出可能的混杂变量。
  3. 设计一个“同外观改物理”和一个“同物理改外观”的成对测试。
  4. 给出一个文本思维链看似正确、但真实控制会失败的例子,并设计能发现它的消融实验。
  5. 比较像素世界模型、对象中心世界模型和任务谓词模型各自适合回答的物理问题。

B0|世界模型与模型式规划

D0|分层规划、技能与记忆

D2|子目标规划与具身推理

E2|Latent Action 与逆动力学

F0|动力学、控制与物理交互

文章正文采用 Apache License 2.0