数码影音频道 频道

Video Rebirth选择视频原生路线:在世界模型热潮中走出第三条路

“AI摘要”

2026年,AI公司Video Rebirth推出视频原生世界模型Olympus,实现实时可交互的3D场景生成,用户可操控角色在AI生成的虚拟世界中移动、跳跃和探索。该模型聚焦三个一致性:物理一致性(物体运动连贯)、声画同步一致性(动作与声音匹配)和长程记忆一致性(场景状态可持久保留)。Olympus基于BACH视频引擎,通过因果建模和自回归蒸馏等技术训练,在AMD MI350上部署运行。Video Rebirth选择视频显式路线,以视频为载体学习世界规律,目标是为数字和物理世界提供统一模拟能力,成为通往现实世界AI的关键路径。

2026年,世界模型已成为人工智能领域最受关注的方向之一。当行业竞争的焦点从"是否进入世界模型"转向"以何种技术路径实现世界模型",AI基础模型公司Video Rebirth(重生视界)选择了一条独特的路径——视频原生(video-native):以视频作为理解与生成世界的基础载体,构建实时、可交互的世界模型Olympus。

一个"可以走进去"的世界

体验Olympus的方式更像是玩一个由AI实时生成的游戏。用户进入一个实时生成的3D场景,用移动、跳跃等按键操控角色,避开障碍、攀爬树木和山体,画面随着操作即时生成、即时响应。

Olympus最直接的特质是"实时可交互":下达指令的瞬间,世界便立刻呈现并回应。但它的野心不止于此——Olympus瞄准的是一个统一的世界模型(unified world model),用同一套底层能力同时覆盖数字世界与物理世界,既能服务数字环境里的交互,也面向机器人、自动驾驶等需要与真实物理世界打交道的场景。

三个一致性构筑差异化壁垒

Video Rebirth真正押注的差异化落在三个"一致性"上。

第 一是逼真的物理一致性。在Olympus生成的世界里,角色能完成避障、攀爬等连续动作,物体的运动与场景结构在不同视角和连续动作中保持一致。世界模型最难的从来不是把某一帧画好,而是让整个世界在持续的交互中始终"讲得通"。

第二是声画同步的一致性。角色在草地上走动的脚步声、起跳落地的声响、奔跑时的喘息,画面里发生的每一个动作都有与之贴合的声音。这类细节决定了"走进一个世界"的沉浸感是否完整。

第三是长程记忆一致性。Olympus能让用户离开一处环境后再次回来时,场景依然保持离开时的样子,这种"记得住"的能力是长时间交互体验的关键。

技术内核:建立在BACH引擎之上

Olympus建立在Video Rebirth的视频生成引擎BACH之上。2026年5月,BACH通过Artificial Analysis Video Arena的独立盲测,首次登榜便位列全球第6,是榜单上排名最高的初创公司模型。

Olympus的训练经历三个阶段:先在大规模可交互场景数据上做领域微调,再引入因果建模与控制注入(Causal Teacher),最后通过自回归蒸馏提升生成效率和连贯性。Olympus不靠显式编码物理公式,而是从海量视频数据中隐式学习物体如何下落、碰撞以及光如何变化等规律。

在推理层面,Olympus同时采用多卡并行、状态缓存和异步计算等多项加速策略,支撑起实时流畅的交互体验。此外,Olympus也是已知最早在AMD MI350系列上完成部署并运行的世界模型,288GB HBM3E超大显存为长时序、高并发交互提供了理想的硬件承载。

通往世界模型的三条路

业界通往世界模型的大致有三条路径:一是三维显式路线,以World Labs为代表,先把世界还原为三维空间再生成和模拟;二是视频隐式路线,在抽象表征空间里进行预测而不直接生成可视化输出;Video Rebirth走的是第三条——视频显式路线,以视频为原生载体,直接从海量视频里学习世界运转规律并生成显式、可交互的世界。

Video Rebirth创始人兼CEO刘威博士判断:大语言模型的终局是coding agent,世界模型的终局是simulation agent。前者服务数字世界,后者服务物理世界。当一个模型能够模拟物理世界,下一步自然是让智能体学会在这个世界里行动——这正是世界模型被视为通往现实世界AI关键路径的原因。

0
相关文章