飞书原文 · 源修订 26
🔁
核心判断: 物理因果改变模型所表示的世界结构,具身思维链改变模型在执行过程中如何使用这些结构。真正的具身推理不是输出语言解释,而是完成“观察—预测—行动—验证—修正”的物理闭环。
本文是《从机器人控制到 Flow Matching:π 系列的数学地基》的专题延伸。
1. 从条件模仿到因果干预
普通行为克隆学习:
读法: 策略 pi theta 在当前观测 o_t 和语言指令 l 的条件下,对动作块 A_t 给出一个概率分布。
推导: 行为克隆把专家数据中的动作块视为监督标签,最大化专家动作的条件似然;因此策略学到的是训练分布中“看到这种观测和指令时,专家通常怎样做”。
它回答:在类似观测和任务条件下,专家通常执行什么动作。
加入物理因果后,还需要学习动作如何改变世界:
读法: 在当前状态 s_t 下,主动施加动作 a_t 后,因果模型 p_phi 对下一状态 s_{t+1} 给出的分布。
推导: 条件分布 可能混入“什么状态下专家会选这个动作”的选择偏差;do 算子把动作视为外部干预,要求模型回答同一状态下换一个动作会造成什么结果。机器人随机试验或可控仿真能直接提供这种干预数据。
这里的 表示动作是机器人主动施加到环境中的干预,而不是数据中偶然观察到的相关变量。
变化的核心是:策略不再只拟合动作,而是需要在动作选择中考虑状态变化、任务收益、风险和不确定性。
2. 什么是机器人中的物理因果
机器人中的物理因果不是抽象哲学,而是三个可以实验验证的问题:
- 干预: 机器人执行某个动作后,环境是否按预测变化?
- 机制: 状态变化是通过接触、力、摩擦、约束还是对象关系产生?
- 反事实: 如果动作、接触点或物体属性不同,结果是否会不同?
结构化动力学
真实系统可以写成:
读法: 下一时刻状态等于动力学函数 F 作用于当前状态、动作和未建模因素 xi_t。
推导: 物理系统的下一状态不仅取决于机器人做了什么,也取决于当前状态和摩擦、延迟、外力等扰动;把这些未完全观测因素收进 xi_t,就得到最基本的受控状态转移式。
其中 包含未完全观测的摩擦、质量、顺应性、控制延迟和外界扰动。
对象中心形式可以进一步写为:
读法: 对象 j 的下一状态由它当前的状态、机器人动作、接触关系、物理属性和扰动共同决定。
推导: 把整体状态拆到对象层后,同一动作是否改变对象取决于是否接触以及对象的质量、摩擦和材质。这样的对象中心分解比单纯预测整幅图像更容易表达“哪个动作通过什么接触改变了哪个对象”。
这里:
- :对象 的位置、姿态与状态;
- :机器人与对象的接触关系;
- :质量、摩擦和材质等物理属性。
相关性与因果性的差别
观察到“手向上移动时杯子也向上”只是一种相关性。要形成因果模型,还要区分:
- 没有接触时,手向上不会带动杯子;
- 夹持力不足时,杯子可能滑落;
- 接触点不同会改变杯子旋转;
- 杯子质量变化会改变所需力和速度。
📌
物理因果的最低标准: 模型必须能够预测干预结果,并在物理条件被改变时相应改变预测,而不只是复述训练数据中的共现规律。
3. 什么是具身思维链
具身思维链不是把内部推理翻译成一段文字,而是机器人在物理环境中循环执行:
状态记忆
机器人维护 belief state:
读法: 当前信念状态 b_t 由上一时刻信念、当前观测和上一动作更新得到。
推导: 单帧观测无法直接给出被遮挡对象、接触是否稳定或任务进展;因此系统用上一信念保存历史,再用已执行动作预测变化,并用新观测纠正预测。Update 可以是贝叶斯滤波器,也可以是循环网络或 Transformer。
可以包含对象状态、接触状态、任务阶段、历史动作和不确定性。
子目标推理
读法: 规划器根据当前信念状态 b_t 和语言任务 l,选择当前子目标 g_t。
推导: 长时任务不能只依赖原始指令;规划器必须结合已经完成的阶段、当前物理状态和不确定性,把全局任务压缩为此刻可执行且可验证的局部目标。
例如“把杯子放到托盘”可以分解为:
定位杯子
→ 选择抓取区域
→ 建立稳定接触
→ 抬升并避障
→ 移动到托盘
→ 放置
→ 验证 cup_on_tray闭环动作
读法: 动作 a_t 从以当前信念状态和子目标为条件的策略分布中采样。
推导: 高层规划给出要达到的局部结果,低层策略再结合当前状态产生动作。写成 pi_theta 的点分布可以避免把已采样的 a_t 同时误写成分布自变量。
每次执行后,机器人必须检查真实结果,而不是假设计划已经成功。
4. 两者如何共同改变策略模型
物理因果定义“世界如何响应动作”,具身思维链定义“机器人如何反复使用这些响应规律”。两者结合后,策略从直接映射变为模型辅助决策:
读法: 在长度 H 的候选动作序列中,选择世界模型预测的任务收益减去风险代价后期望值最大的那一条。
推导: 对每条候选动作序列,世界模型产生未来状态分布;效用 U 衡量子目标进展,C 衡量碰撞、能耗、力和其他风险。对预测的不确定未来取期望,再最大化净效用,就得到模型式动作选择。
其中:
- :动作条件世界模型或对象状态转移模型;
- :任务进展和最终成功收益;
- :碰撞、能耗、速度、力矩和风险代价。
模型结构通常增加四个组件:
- 对象中心状态或 belief encoder;
- 动作条件状态转移模型;
- 子目标或任务图模块;
- 结果验证和失败恢复模块。
它不一定需要完整的像素级世界模型。对机器人控制而言,预测“是否接触、对象是否移动、任务谓词是否改变”通常比生成逼真视频更直接。
5. 对数据、Tokenizer 与训练目标的影响
数据发生的变化
| 普通示范数据 | 因果与具身数据 |
|---|---|
| 成功轨迹 | 成功、失败、扰动与恢复 |
| 观测与动作 | 观测、动作、接触、状态变化和结果 |
| 固定环境 | 主动改变质量、摩擦、位置和对象实例 |
| 动作标签 | 动作前提、预期后果和完成条件 |
Tokenizer 发生的变化
只编码人体或机器人运动:
[MOVE_LEFT] [ROTATE_WRIST] [CLOSE_GRIPPER]升级为对象中心的因果事件:
[APPROACH cup]
[CONTACT cup stable]
[GRASP cup]
[CAUSE cup_follows_hand]
[VERIFY cup_lifted]
[FAIL slip]
[RECOVER regrasp]Token 不只表示“做了什么”,还表示:
- 动作发生的前提;
- 动作作用于哪个对象;
- 预期造成什么状态变化;
- 结果是否符合预期;
- 失败后进入什么恢复状态。
训练目标发生的变化
读法: 总损失由行为克隆、动力学预测、物理事件、子目标完成和失败恢复五项加权相加。
推导: 行为克隆只监督“做什么”;其余辅助目标分别监督“会发生什么、发生了什么事件、目标是否完成、失败后怎样继续”。各 lambda 为非负权重,用验证集或梯度尺度平衡,不能把这条式子理解为所有系统都必须采用同一组固定权重。
- :模仿专家动作;
- :预测动作后的状态变化;
- :预测接触、抓取和释放事件;
- :判断子目标和任务谓词是否完成;
- :从失败状态恢复。
6. 文本思维链为什么不等于具身推理
语言模型可能生成:
杯子可能滑落,所以应该减小速度并增加夹持力。
这句话听起来合理,但只有在以下信息真正进入控制闭环时,才构成具身推理:
- 模型能够观测或估计接触和滑移;
- “增加夹持力”能够映射为机器人可执行控制;
- 机器人执行后再次检查杯子是否稳定;
- 结果不符合预期时会重新规划。
| 文本思维链 | 具身思维链 |
|---|---|
| 输出语言步骤 | 维护可执行状态和子目标 |
| 可能是事后解释 | 动作前预测、动作后验证 |
| 不需要真实反馈 | 必须接收视觉、触觉或力觉反馈 |
| 错误不一定影响下一步 | 预测误差必须触发状态更新和恢复 |
| 语言正确即可 | 以物理任务成功为最终指标 |
❗
判定原则: 如果删除生成的文字后,机器人动作完全不变,那么这段 CoT 很可能只是解释层,而不是控制机制的一部分。
7. 如何验证模型真的学到了物理因果
不能只用动作预测误差证明物理因果。需要主动干预训练分布中的变量,并检查模型是否按机制变化。
| 干预实验 | 应观察到的变化 | 排除的伪相关 |
|---|---|---|
| 改变物体质量 | 调整速度、加速度或夹持策略 | 只按外观选择动作 |
| 改变摩擦 | 改变夹持力、接触时间或抓型 | 把固定轨迹当成机制 |
| 移动接触点 | 预测对象平移和旋转结果变化 | 只记忆手部轨迹 |
| 更换外观但保持物理属性 | 行为基本保持 | 背景和颜色泄漏 |
| 相同外观、改变内部重量 | 根据交互反馈更新 belief | 只依赖第一帧视觉 |
| 执行中施加扰动 | 检测偏差并恢复 | 开环播放动作序列 |
需要报告的指标
- 动作后果预测误差;
- 对象状态和接触事件准确率;
- 任务完整成功率;
- 扰动后的恢复成功率和恢复时间;
- 物理属性 OOD 泛化;
- 因果变量干预前后的策略敏感性;
- 不相关视觉变化下的策略稳定性。
最小反事实测试是:保持图像语义相近,只改变一个物理因素,检查模型是否改变动作;再保持物理因素不变,只改变外观,检查模型是否保持动作。
8. 与 WAM-TTT、世界模型和 Behavior Tokenizer 的关系
| 方法 | 主要解决什么 | 仍缺少什么 |
|---|---|---|
| WAM-TTT | 将人类视频写入测试时 fast-weight memory | 显式对象因果、接触和可解释恢复状态 |
| 像素世界模型 | 预测未来视觉或视频 | 视觉逼真不保证动作和接触物理正确 |
| 对象世界模型 | 预测对象状态、关系和事件变化 | 需要可靠对象和接触表示 |
| Behavior Tokenizer | 将行为压缩为可组合事件和技能 | 需要动作后果和物理验证来获得因果语义 |
| 具身思维链 | 组织观察、子目标、预测、行动和恢复 | 必须与真实控制和反馈闭环绑定 |
它们可以组合为:
人类与机器人多模态数据
→ 对象 / 接触 / 事件 Tokenizer
→ 对象中心因果世界模型
→ 具身任务图与子目标
→ Action Expert
→ 视觉 / 力觉反馈
→ 验证与恢复WAM-TTT 更接近“如何快速吸收人类行为记忆”;物理因果与具身思维链进一步解决“为什么动作有效、结果是否符合预期、失败后如何修正”。
9. 最小可实现系统
完整物理因果系统成本很高。一个务实的最小版本不需要先生成高保真视频,也不需要重建所有力学参数。
最小系统
- 从视觉和本体信号构建对象中心 belief state;
- 识别 approach、contact、grasp、release、state-change 和 failure;
- 预测候选动作是否改变目标对象状态;
- 用任务谓词选择当前子目标;
- 执行短动作块并检查结果;
- 预测失败时重新感知、重新抓取或重新规划。
对应的最小闭环为:
读法: 系统从当前信念得到子目标,为候选动作预测各自的下一状态,选出动作 a_t,观察真实结果,再更新下一信念。
推导: 下一状态预测必须以候选动作为条件,不能在动作尚未给定时先产生唯一的 hat s_{t+1}。把候选动作与各自预测结果成对比较后执行其中一个,才形成因果预测进入控制决策的闭环。
✅
阶段小结: 物理因果让机器人从“专家通常怎么做”前进到“我的动作会造成什么”;具身思维链让机器人从“一次性输出动作”前进到“持续观察、预测、执行、验证和恢复”。只有当预测与真实物理反馈共同改变后续动作时,两者才真正进入机器人智能。
10. 主要失败模式
| 失败 | 表面现象 | 真正需要检查的证据 |
|---|---|---|
| 把相关性当因果 | 训练分布内动作预测准确,改变质量或摩擦后立即失效 | 单变量物理干预与反事实预测误差 |
| 动作没有进入预测 | 不同候选动作得到几乎相同的未来 | 动作置换、动作消融与敏感度曲线 |
| 视觉捷径 | 依赖颜色、背景或操作者身份选择动作 | 外观保持物理不变与物理改变外观相近的成对测试 |
| 状态估计错误 | 规划逻辑合理,但基于错误对象、遮挡状态或接触判断 | belief 校准、对象绑定准确率和接触事件检测 |
| 模型被规划器利用 | 模型平均误差不大,搜索却找到不真实的高收益未来 | 计划分布上的误差、真实 rollout 复核和不确定性约束 |
| 文字解释与控制脱钩 | 思维链很完整,删除或打乱文字后动作不变 | 控制等预算下的文本消融和状态反馈对照 |
| 完成检测漂移 | 过早推进任务阶段或在已完成阶段反复动作 | 任务谓词精确率、召回率与切换时刻误差 |
| 恢复策略只会重启 | 局部失败后整任务清零,长时成功率迅速下降 | 局部恢复率、回退层级和恢复成本 |
11. 最小实验:模型是否真的使用物理因果
选择一个可重复的推、抓或倾倒任务,训练数据中让物体外观与物理属性高度相关,例如红色物体通常较轻、蓝色物体通常较重。测试时构造四组配对条件。
- 同外观、改物理: 保持图像和任务语义近似,只改变质量、摩擦或接触点。
- 同物理、改外观: 保持动力学参数不变,只改变颜色、纹理和背景。
- 动作干预: 从同一初始状态执行不同动作,比较预测后果与真实后果。
- 闭环扰动: 执行中途移动物体或制造滑落,检查系统是否更新 belief、重选子目标并恢复。
比较四类系统:纯行为克隆、带动力学辅助损失的策略、使用世界模型但不开搜索的策略、使用世界模型进行候选动作比较的闭环系统。固定训练数据量、视觉骨干、策略容量、控制频率和推理预算。
最低报告项: 动作成功率、干预后果预测误差、物理属性变化下的动作敏感度、外观变化下的动作不变性、模型校准误差、扰动恢复率、计划分布与普通测试分布上的模型误差。
判定: 只有当模型在物理因素变化时按机制改变预测和动作、在纯外观变化时保持行为,并且这些预测实际改善闭环结果,才有证据说明物理因果进入了策略决策。
12. 论文事实、作者解释与课程判断
| 工作 | 论文事实 | 作者解释 | 课程判断 |
|---|---|---|---|
| CausalWorld | 提供可控制质量、摩擦、尺寸等变量的机器人操作环境,用于因果结构与迁移评测 | 系统化干预有助于研究结构泛化,而不只是在固定分布上拟合 | 它提供了合格的因果压力测试,但仿真变量可控不等于真实机器人已解决因果辨识 |
| SayCan | 把语言模型的技能先验与机器人 affordance 或价值分数结合,选择可执行技能 | 语言知识与物理可行性联合排序可支持长时任务 | 证明的是给定技能库上的组合与落地,不等同于学习连续动力学或自动发现因果机制 |
| Inner Monologue | 把成功检测、场景描述等环境反馈写回语言规划上下文并重复规划 | 闭环环境反馈能改善长时计划执行 | 关键贡献是反馈进入重规划;是否必须使用自然语言,应与同等状态反馈的非文本规划器对照 |
| 世界模型路线 | 学习动作条件转移,并可用于想象训练或在线规划 | 预测未来可提高数据效率与决策质量 | 高像素保真不是物理因果的充分条件;计划分布上的机制正确性和真实闭环收益更重要 |
13. 本课练习与交叉阅读
- 解释为什么动作预测准确率高,仍不能证明模型学到了动作的因果效果。
- 为抓取任务画出状态、动作、接触、物理属性和结果之间的因果图,并指出可能的混杂变量。
- 设计一个“同外观改物理”和一个“同物理改外观”的成对测试。
- 给出一个文本思维链看似正确、但真实控制会失败的例子,并设计能发现它的消融实验。
- 比较像素世界模型、对象中心世界模型和任务谓词模型各自适合回答的物理问题。

