τ0-VLA发布:双系统架构+世界模型推演,让机器人学会先想再做
2026 WAIC刚刚落幕,具身智能领域一个趋势逐渐清晰:竞争焦点正从"让机器人学会一个动作"转向"让机器人完成一项任务"。然而从"会动作"到"会做事"之间,仍存在一道巨大鸿沟——真实世界中的任务很少是孤立动作,往往包含长达数分钟、数十个连续步骤。
上海创智学院罗剑岚团队与智元机器人具身研究中心近日联合发布的τ0-VLA为此提出新思路。该模型采用"慢思考-快执行"分层VLA架构,将高层任务规划与低层动作执行解耦,并首次将测试时计算与世界模型推演引入具身智能上层决策。
τ0-VLA的核心创新在于双系统设计:高层"慢思考"系统负责理解用户目标、拆解复杂任务、通过任务记忆跟踪执行状态;低层"快执行"系统则将子任务转化为稳定、实时的全身动作。高层系统内置四大协同模块——候选任务生成、世界模型推演、价值评估和反思——构建了全新的子任务级束搜索机制。
与传统VLA模型"看一眼、做一下"的反应式决策不同,τ0-VLA让机器人在行动前投入算力进行长思考:面对任务时不会立即选择动作,而是先对不同方案进行未来状态预测,由世界模型回答"如果执行这个动作,未来世界会变成什么样"。
τ0-VLA是当前最大规模真机数据预训练的具身基础模型,预训练共使用40115小时真实物理世界交互数据,其中包含超2万小时真机数据,覆盖AGIBOT G1、ARX AC One和Franka等多个机器人平台。实验表明,引入层级规划系统后,τ0-VLA在全屋清洁、烹饪、制作奶茶等长程任务中的平均成功率从27.5%提升至45.0%,显著优于π0.5、GR00T N1.7等主流VLA模型。
团队此前已发布面向真实世界的大规模后训练强化学习系统LWD和预训练具身世界模型τ0-WM。τ0-VLA将三者组织到统一的长程任务框架中,形成"预训练→世界模型预演→VLA执行→数据回流"的持续进化闭环。