数码影音频道 频道

MiniMax发布全模态统一模型H3并宣布开源,性能逼近闭源最强旗舰

“AI摘要”

MiniMax于2026年7月31日发布新一代多模态生成模型MiniMax H3,并宣布近期开源,被视为与DeepSeek R1开源同等重要的时刻。H3是首个真正意义上的“全模态”统一模型,能力接近闭源最强模型。实测中,H3与Seedance 2.0性能相当,但生成速度更快,价格仅为同类旗舰的三分之一。它支持原生多模态理解与生成,可处理文字、图片、音频、视频等输入,并自动补齐缺失模态。H3还具备强大的广义编辑能力,如配音、改台词和精确执行复杂灯光指令。MiniMax通过Contextual Omni Representation等四项核心工作重构架构,旨在消除模态隔离,推动多模态领域整体进步。

2026年7月31日,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布近期开源。在我们看来,这可能是一个和DeepSeek R1开源时同样重要的时刻——开源领域终于有了一个真正意义上的"全模态"统一模型,且能力无限逼近了闭源最强模型。

在我们的实测中,H3是一个和Seedance 2.0能打得有来有回的模型,生成速度更快,价格也更低(官方定价0.8元/秒,仅为业内同类旗舰的三分之一)。

H3支持原生的多模态理解与生成,用户可以上传文字、图片、音频、视频等多种输入,也可以直接让H3生成缺失的那个模态。例如,上传一段动画作为参考视频、一张街景作为参考图片,H3会识别球状屏幕的几何特性并让人物运动遵循球面变形规律,同时自动补齐音频。

在编辑能力方面,H3表现出强大的广义编辑能力。给视频里的人物配音、改变台词,H3能同时适配音色和嘴形。在导演级指令跟随测试中,H3能精确执行复杂的灯光变化指令——烛光、硬光、彩虹折射、红蓝对打、金色逆光依次出现且过渡平滑。

MiniMax对H3进行了彻底的架构重构,提出了Contextual Omni Representation、H3-VAE、H3-Omni Transformer和In-context Regeneration四项核心工作。其核心设计理念是尽可能早地去掉任务、能力、模态之间的"隔离",用语言统一所有任务的中间层,从而长出更泛化的多模态能力。

MiniMax官方博客写道:"长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。"H3的开源将推动整个多模态领域共同迈上一个台阶。

0
相关文章