自变量发布HOST机器人框架:看29秒人类视频即学会新技能,学习速度暴涨500倍
自变量机器人与北京理工大学、清华大学联合发布并开源了一项名为HOST(Human-to-robot One-Shot Skill Acquisition)的机器人学习框架。这项技术的核心突破在于:机器人只需观看一段平均29秒的普通人类演示视频,即可在不更新模型参数、不采集新遥操作数据的情况下执行全新任务。
研究团队在双臂机器人平台上测试了50项训练阶段从未见过的任务,包括放水果、堆碗、擦盘子、插笔和叠袜子等日常家务场景。HOST在主要测试任务中的平均成功率达到了62%,且在所有50项新任务中均有成功记录。
与当前最强的监督微调方案相比,HOST的优势是压倒性的。传统方案需要专业人员通过遥操作控制机械臂反复执行50次同一任务,从数据采集到训练完成通常耗时约4小时。HOST将所需示范数量降至五十分之一,技能获取时间较最快的SFT(监督微调)基线缩短约507倍。
核心技术架构:双专家MoT
HOST之所以能实现"看一遍就会",关键在于其独特的技术路线——不再试图让机器人直接模仿人类动作,而是采用了"先想象结果、再反推动作"的思路。
研究团队设计了一个双专家MoT(Mixture of Transformers)架构,包含两个分工明确的大脑。"视觉大脑"负责理解视频内容、定位任务进度并预测未来场景——将人类完成任务的画面转换为机器人视角下应该看到的画面。"动作大脑"则负责将脑补出的机器人画面变成现实,计算机械臂如何运动才能到达目标状态。
这种设计巧妙地绕过了人机身体结构差异带来的困难。人类手掌可以贴合杯壁,机器人的夹爪需要寻找合适的夹取位置;人类捏住袜子一角即可,机械臂还要考虑夹爪开合、运动角度和双臂配合。HOST不强行模仿人类手臂的角度,只盯着需要实现的最终效果,从结果反推动作。
在任务进度同步方面,HOST采用了动态时间规整算法,将视频画面和机器人动作映射到同一向量空间中进行对齐。无论人类用时2秒还是机器人用时5秒,只要双方都进入了相同的子任务状态,进度就算同步。这一设计使进度误差从0.079骤降至0.006,缩小了超过一个数量级。
预训练基础
HOST的"单样本学习"能力并非凭空而来。在出厂前,基础模型经历了两个阶段的大规模训练:第 一阶段使用193462条机器人轨迹及对应的执行视频(涵盖229项任务),让模型学会从任务视频中预测结果;第二阶段加入5847段人类视频与机器人轨迹的配对数据,让模型学会将人类执行任务的画面翻译为机器人视角。
先利用规模更大的机器人数据建立任务理解和动作预测能力,再用数量相对较少的人机配对数据完成跨域迁移,这个两阶段策略大幅降低了对昂贵人机配对数据的依赖。