跳到正文

飞书原文 · 源修订 8

💡

机制课: VLA 可以直接从图像输出动作,但物理闭环仍隐含地需要位置、姿态、速度、遮挡和不确定性。本课建立从 Bayes 滤波、SE(3)、深度与点云到对象中心状态和可供性的统一语言。

学习目标 ​

完成本课后,应能区分观测与状态;推导 Bayes filter 的预测和校正;读懂位姿、坐标变换、深度反投影和对象中心表示;解释端到端策略为何仍需要状态可辨识性;设计遮挡、相机变化与标定误差实验。

1. 图像不是状态 ​

机器人真正需要的状态可能包括自身位姿、关节速度、对象六自由度姿态、接触模式和障碍物,而相机只提供这些变量经过投影、遮挡和噪声后的观测:

读法: 当前观测由当前真实状态通过观测模型随机产生。

推导: 同一状态在不同光照和相机下产生不同图像;同一图像也可能对应不同深度和遮挡关系,因此必须用概率分布表达不确定性。

2. Bayes filter:历史怎样变成信念状态 ​

预测步骤:

读法: 把上一步所有可能状态,按照动作条件动力学传播到当前时刻并加总,得到看新观测之前的预测信念。

推导: 由全概率公式,对未知的上一状态积分;动力学给出从上一状态到当前状态的条件概率。

校正步骤:

读法: 用当前观测在每个候选状态下出现的可能性,重新加权预测信念,再通过归一化常数使概率和为一。

推导: 直接应用 Bayes 公式;先验是预测信念,似然是观测模型,后验是校正后的信念状态。

3. Kalman filter 是线性高斯特例 ​

读法: 状态按线性动力学和控制输入演化,并叠加过程噪声;观测是状态的线性投影,并叠加观测噪声。

推导: 把非线性动力学在工作点附近近似为矩阵 A 和 B,把传感器近似为矩阵 C;若过程噪声和观测噪声都是高斯,线性变换与高斯乘积仍为高斯,所以信念只需维护均值和协方差。

在线性高斯假设下,信念始终是高斯分布,只需维护均值和协方差。非线性系统使用 EKF/UKF,强多峰和离散接触模式常需要粒子滤波或学习滤波器。

4. 三维位姿与 SE(3) ​

刚体位姿用齐次变换表示:

读法: 矩阵 T 由三维旋转 R 和三维平移 t 组成,用来把一个坐标系中的点转换到另一个坐标系。

推导: 三维点先旋转再平移。引入齐次坐标后,旋转和平移可以合并为一次矩阵乘法,连续坐标变换则通过矩阵相乘组合。

5. 从像素和深度反投影到三维 ​

针孔相机中,像素 和深度 对应相机坐标:

读法: 像素相对主点的偏移,乘以深度,再除以焦距,得到相机坐标系中的横向和纵向位置。

推导: 由相似三角形,归一化成像坐标等于三维坐标除以深度;移项即可得到反投影公式。深度误差会随距离直接放大三维位置误差。

公式可视化|从像素和深度到世界坐标 ​

课程画板

6. 点云、体素、占据与神经场 ​

表示优势限制
点云保留直接三维测量稀疏、无规则、遮挡明显
体素/占据网格碰撞与空间查询方便高分辨率成本大
TSDF适合表面融合与重建动态场景困难
NeRF/Gaussian Splatting视图合成和连续场景表示控制所需几何与实时更新需额外验证
对象中心状态便于任务组合和关系推理依赖稳定检测、跟踪和身份保持

7. 对象中心状态与可供性 ​

策略不一定需要完整场景重建,可能只需任务相关状态:

读法: 潜在状态由 N 个对象组成;每个对象包含类别或语义、三维位姿、速度以及与任务相关的关系或属性。

推导: 把整幅场景拆成对象集合,可以让状态随对象数量扩展,并把抓取、遮挡和相互关系挂到具体实体上。类别 c、位姿 T、速度 v 和关系 r 是一个最小示例,真实系统还需为每项附带置信度或分布。

可供性不是对象的固定标签,而是对象、动作主体和任务共同决定的可行动关系。例如杯把“可抓”取决于夹爪大小、接近方向和当前遮挡。

8. 端到端 VLA 是否还需要状态估计 ​

端到端模型可以把状态估计隐含在 Transformer 的上下文中,但不会消除可观测性问题。相机看不到背面、单帧无法确定速度、遮挡会让对象身份不确定。显式状态估计的价值是可调试、可校准和可用于安全约束;隐式状态的价值是减少人工建模并利用大规模数据。

9. 视觉表征与几何表征的边界 ​

DINO、R3M、VC-1 等视觉表征可以提供语义和对应关系;深度、SLAM、DUSt3R 类几何模型提供相机与三维结构。语义相似不保证度量距离正确,几何准确也不保证知道对象用途。Physical AI 通常需要两者结合。

课程画板

10. 最小实验 ​

  1. 用一维位置与带噪观测实现 Bayes/Kalman filter,画先验、似然和后验。
  2. 让物体短时遮挡,比较单帧策略与带历史状态估计的策略。
  3. 对相机外参加入小扰动,测量末端定位和抓取成功率下降。
  4. 分别使用纯视觉 embedding、显式三维坐标和二者融合做目标抓取。
  5. 设计对象交换实验,验证模型是否保持对象身份而非只记像素位置。

11. 本课练习 ​

  1. 从 Bayes 公式推导预测和校正两步。
  2. 解释单目单帧为什么不能唯一恢复绝对深度。
  3. 写出 base、camera、tool 与 object 四个坐标系的变换链。
  4. 构造语义正确但几何错误会导致抓取失败的例子。
  5. 为遮挡后的对象重现设计不确定性评测。

12. 主要失败模式 ​

失败表现诊断与修正
观测混同状态遮挡后立即忘记对象,单帧歧义导致动作跳变历史信念、对象持续性和不确定性
滤波器过度自信均值看似稳定,真实状态已离开协方差范围创新残差、覆盖率和噪声参数校准
线性化失效大旋转、碰撞或离散接触切换时 EKF 发散UKF、粒子滤波、混合模式或重初始化
坐标系方向错误视觉定位正确但机械臂向相反方向运动明确每个 T 的 from/to 语义并做闭环标定测试
深度尺度或外参漂移抓取点随距离和时间系统偏移尺度真值、重投影误差和在线标定
对象身份交换相似对象交叉后状态和任务历史互换身份一致性、数据关联和多假设跟踪
语义正确、几何错误识别到目标类别但位姿不足以抓取或插接度量位姿、可达性与真实控制误差
几何准确、任务无关重建场景很完整,却没有改善策略任务相关对象状态、策略消融与计算预算

13. 论文事实、作者解释与课程判断 ​

工作论文事实作者解释课程判断
Kalman Filter在线性高斯系统中递推计算状态后验均值和协方差历史动力学与当前观测可以按不确定性最优融合它是理解 belief state 的地基,但接触、多峰遮挡和错误数据关联超出其基本假设
ORB-SLAM3统一视觉、视觉惯性和多地图 SLAM,估计相机轨迹与地图几何跟踪和重定位可提供稳定空间参照相机定位不等于对象状态与任务可供性,策略仍需对象级语义和动态关系
DUSt3R从图像对直接回归点图并完成三维重建与对应学习式几何可弱化传统相机标定和匹配流程重建精度与尺度稳定性必须在机器人坐标和控制任务中复核
DINOv2 / VC-1通过大规模预训练获得可迁移的视觉语义表征通用视觉特征可支持多种具身下游任务语义对应不是度量几何;Physical AI 通常需要语义、几何和本体状态融合

14. 课程交叉阅读 ​

E1|视频运动与对象中心表征

E2|Latent Action 与逆动力学

B0|世界模型与模型式规划

F0|动力学、控制与物理交互

建议把经典 SLAM/Kalman 教材与 R3M、VC-1、DINOv2、DUSt3R、对象中心学习和 3D 视觉语言模型对照阅读。课程关注的是这些方法向策略提供什么状态信息,而不是把感知 benchmark 本身当作机器人成功。

文章正文采用 Apache License 2.0