数码影音频道 频道

世界模型有触觉了:智在无界发布Being-H0.8,50万小时视频训出首个隐式触觉世界动作模型

“AI摘要”

7月28日,智在无界发布全球首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8。该模型在预训练阶段即能预测接触方式,并依据触觉反馈实时调整动作,成功完成包中取物、毛笔写字等复杂任务。核心创新在于首次将触觉模态纳入隐空间表示,由Mixture of Transformers、慢-快动作专家、通用触觉编码器和TopoHand四模块组成。数据方面,团队汇聚超50万小时第 一人称视频,通过TactoHand恢复接触信息,并引入压力手套数据,形成UniHand3.0训练集。公司成立于2025年5月,创始人卢宗青表示,H0.8标志着数据路线完成关键转向。

7月28日消息,BeingBeyond智在无界正式发布首个基于人类视频数据的隐式触觉世界动作模型Being-H0.8。该模型在预训练阶段就能教会机器人提前判断将怎样接触物体,并在真正接触后根据触觉反馈及时调整动作,在真实双臂机器人实验中完成了包中取物、毛笔写字、挤牙膏、夹薯片等高难度精巧任务。

Being-H0.8核心创新在于首次把触觉模态纳入隐空间表示。其由四个核心模块组成:Mixture of Transformers(MoT)负责预测交互后果、慢-快动作专家负责执行与实时调整、通用触觉编码器负责统一触觉输入、TopoHand负责统一动作空间。模型并不在像素层面重建未来画面,而是在隐空间中预测与任务相关的交互后果。

数据层面,智在无界汇聚了超过50万小时的第 一人称视频数据,据称为目前国内规模最大的人类操作视频数据池。团队搭建了完整的数据处理管线:通过TactoHand从普通人类视频中恢复接触位置和邻近关系,引入压力手套数据补充物理压力信息,再通过通用触觉编码器将不同来源、粒度的触觉信号统一为固定格式token,形成UniHand3.0训练数据集。

BeingBeyond成立于2025年5月,创始人卢宗青为北京大学计算机学院长聘副教授、智源学者。从Being-H0到H0.8,团队经历了"验证人类视频能不能用→规模化使用→高质量使用"三个阶段,此次H0.8标志着数据路线完成关键转向。

0
相关文章