清华腾讯港科大联合发布可交互世界模型GeniWorld,机器人真机成功率提至69%
8 月 11 日,清华大学深圳国际研究生院、腾讯 Robotics X、香港科技大学与深圳技术大学研究团队联合提出可交互世界模型 GeniWorld。该模型利用 URDF(统一机器人描述格式)渲染技术,将机器人的动作指令转化为与真实相机视角对齐的机器人运动画面,使世界模型能提前预判并控制机器人动作。结合 GeniWorld 合成数据后,π0 VLA 模型在挑战性场景下的真机总体成功率从 40.8% 提升至 69.0%。
通用机器人策略的最新进展已展现出多任务能力,但在复杂且未见的未知环境中,其鲁棒性依然有限。背景、物体实例、空间布局以及任务配置的变化,都可能导致性能大幅下降。若通过扩展机器人学习与评估来覆盖这些变化,通常需要构建新的物理环境,不仅成本高昂,还严重限制了场景多样性。GeniWorld 的提出,正是为这一数据与场景瓶颈寻找一条低成本的替代路径。
工作原理:让机器人在「想象空间」中预演未来
GeniWorld 是一个基于具身视觉动作条件化的可泛化交互式世界模型,能够与策略及人类操作员实现闭环交互。即使只有有限的演示数据,该模型也能在多样化场景中展现泛化能力,并生成新的行为。
· 动作转换:针对目标机器人系统,先由构型运动学模型将数值动作序列转换为密集的机器人运动序列
· 视觉化动作:基于预训练视频生成模型,通过 URDF 渲染技术将动作转化为「视觉化动作表示」,再编码为隐空间表示并与带噪声的视频 Latent 拼接
· 未来预测:拼接后的复合表示输入因果扩散 Transformer,通过流匹配预测未来视频;推理阶段以初始场景图像为第 一帧,利用 KV 缓存维护历史上下文
实验表明,与数值动作、投影末端执行器姿态、投影骨架动作相比,视觉动作实现了更快的收敛速度和持续领先的性能,说明视觉动作通过利用预训练视频模型的生成先验,提供了更有效的输入模态。
实验设置:两种评估标准下均居首位
为评估 GeniWorld 的生成保真度、泛化能力与数据合成能力,研究团队基于 RoboTwin2.0 构建了 Clean-to-Clean 与 Clean-to-Random 两种设置:前者遵循标准 WorldArena 协议,50 个任务共产生 2250 个训练 Episode 与 250 个留出测试 Episode;后者用于零样本域外评估,直接在场景外观、物体实例、物体摆放和空间布局大幅调整的 250 个 Episode 上评估。
在 PSNR、SSIM、LPIPS、FID、FVD 与 EWM Score 等视觉预测质量指标下,GeniWorld 与 Ctrl-World、IRASim、EnerVerse-AC 等基线对比,两种设置下均实现了最高生成质量:Clean-to-Clean 上 EWMScore 达 61.80,Clean-to-Random 上达 63.54,均明显领先其余模型。
真机验证:总体成功率从 40.8% 提升至 69.0%
在真机验证上,研究团队使用双臂 Xtrainer 机器人系统构建实验平台,将机器人 URDF 模型集成至 Isaac Sim 进行运动控制,并复刻物理相机搭建,以渲染出视觉一致的观测数据。团队让 π0 VLA 模型在移碗、折毛巾、放置马克杯和开抽屉四个代表性操纵任务上训练,每个任务仅使用 25 条演示轨迹,通过 Xtrainer 遥操作系统采集演示数据。
训练数据采集期间,团队保持桌面环境干净整洁,但会在不同 Episode 之间随机化被操纵物体的位姿,例如空间重新排列、替换成未见过的物体实例、放置随机物体或改变环境照明。结果显示,Spatial-Gen 将空间重新排列下的成功率从 37.5% 提升至 62.5%,Diverse-Gen 在干扰项、新实例与光照变化下带来更高增益;结合两种数据源后,空间重排下达到 70.0%,有干扰项时达到 72.5%,新实例上达到 70.0%,光照变化下达到 52.5%,总体成功率从 40.8% 提升至 69.0%。
前景与挑战:从实验室成果到产业落地仍有距离
从仿真到真实、从有限演示到泛化部署,数据稀缺始终是制约具身智能规模化落地的核心瓶颈之一。GeniWorld 的探索表明,可泛化世界模型为这一难题提供了一条可行路径,让机器人在「想象空间」中预演未来,以合成数据弥补现实数据采集的高昂成本,无需手动搭建场景即可有效缓解机器人策略学习中的数据匮乏问题。
真机验证中 69.0% 的总体成功率印证了这一方向的潜力。不过泛化世界模型距离产业化落地仍存在不小差距,实验室成果仅是起点,能否经受真实场景的长期考验,才是决定其技术价值的关键。