数码影音频道 频道

CD-LAM因果去偏世界模型:让机器人真正"听懂"指令,动作误差下降超30%

“AI摘要”

Aether AI与UCSD联合提出CD-LAM,从因果层面解决具身世界模型“无视动作指令”的行业痛点。传统隐动作模型(LAM)因受视觉混杂因素污染,导致画面流畅但动作控制失效。CD-LAM通过三步去偏训练:具身中心重建、动作中心对比学习和隐空间校准,从源头净化隐动作表征。实验显示,14B模型动作误差下降30.4%,2B模型下降34.8%,后训练仅需3000-6000步,训练开销仅为传统方案的10%。该方法还设计了专用动作误差指标FDCE,强调因果性对具身世界模型的核心价值。

  机器人下达"向前推抽屉"的指令,它生成的画面里抽屉原地不动,机械臂却自顾自画了一个圈——这是长期困扰具身世界模型的行业痛点。Aether AI与UCSD联合提出的CD-LAM从因果层面根治这一问题,动作误差下降超30%,后训练开销仅为传统方案的10%。

  机器人"脑补"的病根,藏在隐动作表征里

  具身世界模型就像一个AI大脑里的模拟器:输入当前画面和将要执行的动作,它能预测出动作发生后的下一帧画面。有了这个能力,机器人可以先在"脑子里"排练一遍,再决定怎么动手。

  为了让模型在大量无标注的人类视频上预训练,研究者设计了一种叫隐动作模型(Latent Action Model,LAM)的工具。它不直接读取机械臂的电机指令,而是从视频画面的变化中反推"大概发生了什么动作",提取隐动作表征作为伪标签供世界模型学习。之后再用少量带真实动作数据的机器人视频做后训练,模型就能适配真实控制指令。

  Aether AI与加州大学圣地亚哥分校(UCSD)联合研究发现,这条路线训练出的世界模型有一个根本性问题:画面足够流畅,但给定的动作控制信号常被无视。通过因果分析,团队发现问题的根源在于隐动作模型受到了视觉混杂因素的污染。

  现有LAM大多以视频重建为训练目标,不会区分画面变化究竟由机器人动作、镜头移动还是光照变化造成。为了把下一帧重建得更像,模型可能把场景上下文、背景连续性和物体外观等信息一并编码进"隐动作"。输入两张完全相同的画面,模型也能产生非零的隐动作;单纯移动镜头,隐动作就会明显改变。当隐动作夹带背景和场景信息时,世界模型可能只靠画面连续性预测下一帧,而忽略真正的控制指令。

  干预测试揭示因果污染

  团队设计了两类干预测试来验证这一发现。

  在"静止指令测试"中,固定初始画面并将后续机器人动作全部设为零。理想情况下机械臂应当保持静止,但基线模型生成的机械臂仍然明显运动。在"目标动作测试"中,保持初始画面不变,将动作输入替换为另一段视频中的动作序列,理想情况下生成轨迹应跟随新的动作变化,但基线模型的结果几乎没有随之改变。

  因换了,果没变——因果关系被污染了。

  三步去偏:从源头净化隐动作

  CD-LAM(Causally Debiased Latent Action Model,因果去偏隐动作模型)的解决思路简洁明确:不改动世界模型的主体架构、隐动作维度或动作接口,而是从模型上游净化LAM输出的隐动作表征。

  整个训练流程分为三步。第 一步,去偏LAM训练,引入三个专属训练目标:具身中心重建将重建损失的权重偏向机械臂和被操作物体的前景区域;动作中心对比学习将同一类动作的隐动作拉近、不同类的推远;隐空间校准把静止状态压向原点,确保没有动作时隐动作也接近零。

  第二步,用清理后的隐动作作为条件训练世界模型。第三步,用带真实控制指令的机器人数据进行后训练,通过轻量适配层将控制指令接入同一隐动作空间。整个后训练仅需3000至6000步微调。

  实验结果显示,14B规模的模型动作误差下降了30.4%,2B规模模型下降了34.8%,画面质量指标PSNR同步提升0.75到1.0 dB。更关键的是,CD-LAM仅用约3000步更新就达到了基线模型训练5万步的同等性能,训练加速超过10倍。

  因果性成为具身世界模型核心共识

  CD-LAM所代表的"因果去偏"方向并非孤例。在2026年WAIC大会上,清华大学李升波教授明确提出,面向物理世界的具身世界模型必须满足因果性要求——改变动作输入,后续状态应产生可解释的差异,且严格遵循时序优先的因果逻辑。

  产业端也在呼应同一条线索。大晓机器人等头部具身智能企业公开表示,物理逻辑与因果推理的缺失是当前机器人落地的核心障碍之一。CD-LAM仅用10%的训练开销即可完成动作适配,瞄准的正是这个行业痛点。

  研究还发现一个隐藏问题:传统的画面质量指标PSNR对动作误差的解释力很弱——画面像不等于动作对。为此,团队专门设计了面向具身操作的动作误差指标FDCE,通过跟踪机械臂和被操作物体前景点的运动轨迹来计算偏差。

  目前CD-LAM的论文、代码与模型权重已全部开源。第 一作者为UCSD博士生Yufan Wei,研究完成于Aether AI实习期间。

0
相关文章