数码影音频道 频道

TriWorldBench:北大清华等五校联合发布首个三视角具身世界模型评测榜单

“AI摘要”

北京大学、清华大学等高校联合推出TriWorldBench Challenge,发布首个面向机器人三视角世界模型的评测榜单。该榜单针对机器人操作场景中的头部、左腕和右腕三视角视频生成与理解能力,包含500个三视角同步episode,覆盖50个任务。评测围绕三视角一致性、任务对齐、物理与3D一致性、运动质量、时序一致性和视觉质量六个维度,汇总19项评测信号,以TWB-Score为总分。系统通过STATE标注识别动作阶段和运动状态,确保模型理解动态物理世界,而非仅生成“看起来真实”的视频。该榜单为研发团队提供“体检报告”,帮助定位模型改进方向。

  当三个摄像头"看到"的不是同一个世界

  当机器人拥有多个摄像头,它看到的世界是否仍然保持一致?头部摄像头看到机器人正在抓取一个物体,腕部摄像头却显示机械臂还没有移动;一个视角中物体已经被放置完成,另一个视角中物体仍停留在原位。这些看似细微的偏差,意味着模型生成的可能不是同一个真实世界。

  一个新的问题随之出现:如何判断一个世界模型是否真正理解了机器人所处的世界?

  近日,北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起TriWorldBench Challenge,正式推出首个面向机器人三视角世界模型的评测榜单。该榜单聚焦机器人操作场景中的头部视角(head view)、左腕视角(left-wrist view)和右腕视角(right-wrist view)的多视角视频生成与理解能力。

  从"生成视频"到"理解世界"的评测范式转变

  过去,视频生成模型的评价更多关注画面是否清晰、内容是否符合描述、视频是否连续流畅。但对于具身世界模型而言,仅仅生成一段"看起来真实"的视频远远不够——机器人需要面对的是一个动态、连续、具有物理规律的世界。

  TriWorldBench基准包含500个三视角同步episode,覆盖50个机器人操作任务。系统围绕三视角一致性、任务对齐、物理与3D一致性、运动质量、时序一致性和视觉质量六个维度,汇总19项评测信号,并以TWB-Score作为榜单总分。

  评测体系的核心设计在于"三视角一致性"。每个生成视角先与对应的真值相机进行对照,再通过头部-腕部语义判断和联合三视角问答,检查机械臂状态、动作阶段、接触关系以及目标物体是否相互兼容。评测并不要求视角差异巨大的头部画面与腕部画面在像素上相同,而是判断它们能否共同解释同一次操作。

  指标分配上也体现了精心设计:头部视角更适合判断任务指令、全局进度、机械臂轨迹和最终结果;腕部视角更适合观察接触、抓取稳定性、滑移和局部几何。这样既不会让腕部遮挡影响全局任务判断,也不会让清晰的头部画面掩盖夹爪附近的失败。

  STATE标注:让评测知道何时该动、何时该稳

  TriWorldBench从参考机器人轨迹中构建了STATE标注,识别当前动作阶段、活动机械臂,以及每个视角预期处于运动还是静止状态。该动的腕部如果长时间冻结会被扣分,不该动的相机出现多余运动同样会被识别。由此,"稳定"不再等同于"全程不动","运动丰富"也不再天然代表模型理解了任务。

  在VLM语义评测中,评测协议会先与人类专家的打分和排序进行对齐,再冻结规则用于正式测试。榜单除了报告TWB-Score总分,还保留了六大维度、单项指标、逐视角、头部-腕部配对和联合三视角的细分结果。研究团队不仅能看到排名,还能判断问题究竟出在任务、运动、画质,还是三个摄像头之间的世界状态没有对上。

  这让TriWorldBench更像一套面向研发的"体检报告":它不只回答谁更强,也帮助解释模型下一步应该改进哪里。TriWorldBench Challenge已面向全球相关研究团队开放报名,涵盖具身世界模型、具身智能、视频生成模型和多视角生成与理解方向的团队均可通过统一的数据和评测体系参与挑战。

0
相关文章