数码影音频道 频道

自变量发布HOST机器人框架:看29秒人类视频即学会新技能,学习速度暴涨500倍

“AI摘要”

HOST是由自变量机器人与北京理工大学、清华大学联合开发的开源机器人学习框架,核心创新在于机器人仅通过观看约29秒的人类演示视频即可执行新任务,无需更新模型参数或采集新数据。在50项未见过的日常家务测试中,HOST平均成功率62%,示范需求降至传统方案的1/50,技能获取时间比最快的监督微调基线缩短约507倍。其技术关键在于双专家MoT架构,通过“视觉大脑”预测机器人视角画面和“动作大脑”反推动作,绕过人机结构差异,并采用动态时间规整算法实现任务进度同步(误差从0.079降至0.006)。基础模型经过两阶段预训练,分别使用193462条机器人轨迹和5847段人机配对数据,大幅降低对昂贵配对数据的依赖。

自变量机器人与北京理工大学、清华大学联合发布并开源了一项名为HOST(Human-to-robot One-Shot Skill Acquisition)的机器人学习框架。这项技术的核心突破在于:机器人只需观看一段平均29秒的普通人类演示视频,即可在不更新模型参数、不采集新遥操作数据的情况下执行全新任务。

研究团队在双臂机器人平台上测试了50项训练阶段从未见过的任务,包括放水果、堆碗、擦盘子、插笔和叠袜子等日常家务场景。HOST在主要测试任务中的平均成功率达到了62%,且在所有50项新任务中均有成功记录。

与当前最强的监督微调方案相比,HOST的优势是压倒性的。传统方案需要专业人员通过遥操作控制机械臂反复执行50次同一任务,从数据采集到训练完成通常耗时约4小时。HOST将所需示范数量降至五十分之一,技能获取时间较最快的SFT(监督微调)基线缩短约507倍。

核心技术架构:双专家MoT

HOST之所以能实现"看一遍就会",关键在于其独特的技术路线——不再试图让机器人直接模仿人类动作,而是采用了"先想象结果、再反推动作"的思路。

研究团队设计了一个双专家MoT(Mixture of Transformers)架构,包含两个分工明确的大脑。"视觉大脑"负责理解视频内容、定位任务进度并预测未来场景——将人类完成任务的画面转换为机器人视角下应该看到的画面。"动作大脑"则负责将脑补出的机器人画面变成现实,计算机械臂如何运动才能到达目标状态。

这种设计巧妙地绕过了人机身体结构差异带来的困难。人类手掌可以贴合杯壁,机器人的夹爪需要寻找合适的夹取位置;人类捏住袜子一角即可,机械臂还要考虑夹爪开合、运动角度和双臂配合。HOST不强行模仿人类手臂的角度,只盯着需要实现的最终效果,从结果反推动作。

在任务进度同步方面,HOST采用了动态时间规整算法,将视频画面和机器人动作映射到同一向量空间中进行对齐。无论人类用时2秒还是机器人用时5秒,只要双方都进入了相同的子任务状态,进度就算同步。这一设计使进度误差从0.079骤降至0.006,缩小了超过一个数量级。

预训练基础

HOST的"单样本学习"能力并非凭空而来。在出厂前,基础模型经历了两个阶段的大规模训练:第 一阶段使用193462条机器人轨迹及对应的执行视频(涵盖229项任务),让模型学会从任务视频中预测结果;第二阶段加入5847段人类视频与机器人轨迹的配对数据,让模型学会将人类执行任务的画面翻译为机器人视角。

先利用规模更大的机器人数据建立任务理解和动作预测能力,再用数量相对较少的人机配对数据完成跨域迁移,这个两阶段策略大幅降低了对昂贵人机配对数据的依赖。

0
相关文章