世界模型有触觉了:智在无界发布Being-H0.8,50万小时视频训出首个隐式触觉世界动作模型
7月28日消息,BeingBeyond智在无界正式发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8。该模型在预训练阶段就能教会机器人提前判断将怎样接触物体,并在真正接触后根据触觉反馈及时调整动作,在真实双臂机器人实验中完成了包中取物、毛笔写字、挤牙膏、夹薯片等高难度精巧任务。
Being-H0.8核心创新在于首次把触觉模态纳入隐空间表示。其由四个核心模块组成:Mixture of Transformers(MoT)负责预测交互后果、慢-快动作专家负责执行与实时调整、通用触觉编码器负责统一触觉输入、TopoHand负责统一动作空间。模型并不在像素层面重建未来画面,而是在隐空间中预测与任务相关的交互后果。
数据层面,智在无界汇聚了超过50万小时的第 一人称视频数据,据称为目前国内规模最大的人类操作视频数据池。团队搭建了完整的数据处理管线:通过TactoHand从普通人类视频中恢复接触位置和邻近关系,引入压力手套数据补充物理压力信息,再通过通用触觉编码器将不同来源、粒度的触觉信号统一为固定格式token,形成UniHand3.0训练数据集。
BeingBeyond成立于2025年5月,创始人卢宗青为北京大学计算机学院长聘副教授、智源学者。从Being-H0到H0.8,团队经历了"验证人类视频能不能用→规模化使用→高质量使用"三个阶段,此次H0.8标志着数据路线完成关键转向。
0
相关文章