今天,我们正式发布 MiniMax H3,一款通用多模态生成模型。H3 能够统一理解文本、图像、视频和音频的上下文,生成带有原生立体声的视频,最长 15 秒、2K 分辨率。
早期测试显示,H3 已具备支撑广泛商业内容创作场景的能力,在指令遵循、精准的文字与品牌渲染,以及 V2V 动作迁移方面表现出色。凭借精确、可控的多模态生成与编辑能力,H3 专为广告、品牌营销、电商、产品设计、UI/UX、游戏等领域而打造。
基于 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 和 In-Context Regeneration 等核心技术,H3 实现了行业领先的性价比。我们默认提供 2K 分辨率输出。在 2K 分辨率下,H3 的每秒价格不到主流模型的三分之一;在 768p 分辨率下,则不到主流模型 720p 价格的一半。
闭源模型长期以来主导着视频生成领域,与大型语言模型等领域相比,迭代速度更慢,生态系统也不够开放。为了支持开源社区、加速与更广泛的 AI 硬件实现兼容,并让用户更轻松地构建自己的定制版本,我们计划在近期开放模型权重(具体须遵守适用的法律法规)。硬件兼容性从 H3 设计的最初阶段起就是核心考量。
H3 模型亮点
1. 多模态上下文理解
真正的创意工作需要融合跨模态的复杂信息,将图像、音频、视频等作为输入来源。例如,下面这个镜头的提示词是:"参考视频 1 中的希区柯克式运镜,让图像 2 中的角色演唱,并让人声与音频 3 匹配。"只需用文字描述上下文与目标视频之间的关系,H3 就能自主完成复杂的全模态理解。
多模态输入

视频 1

图像 2

音频 3
H3 生成的视频

2. 2K 画质表现

3. 原生立体声

H3 应用场景
1. 电影开场片头

2. 产品网站

3. 动态海报

4. 广告与电商

H3 的设计理念
打破任务边界:从专用到通用
我们已开发了两代模型:Hailuo 01 从零搭建了整个系统,Hailuo 02 则专注于改进核心组件,如架构效率、数据质量和规模。
在设计 H3 时,我们意识到了此前生成模型在任务边界上的局限性:图像生成通常被拆分为 T2I、编辑、主体参考、动作参考、风格参考等各自独立的专家模型;音频生成中的语音、音效和音乐在很大程度上被作为独立领域研究;视频生成则进一步碎片化为文生视频、图生视频、首尾帧、主体参考、动作参考、语音参考、视频编辑等任务,图像、视频和音频之间同样存在清晰的边界。
这些彼此割裂的任务、能力和模态,在实践中限制了创作自由,也在训练层面制约了模型的泛化能力。两者都指向巨大的变革空间——应用范式和训练范式皆是如此。因此,指导 H3 开发的第一条原则就是跨任务的统一与泛化。
基于此,以下是 H3 预训练范式的简要概览:
1. 数据与任务
文生图
文生视频
*联合生成音频,所有音频输出均为原生立体声
原生多镜头建模*
文生音频
语音、音效、音乐不再分离——全部联合建模
2. 通用参考与编辑
图生图参考与编辑
图生视频参考与编辑
音频到音频参考与编辑
音视频到音视频参考与编辑
在我们的设计中,"通用参考与编辑"意味着:
- 完全基于真实自然数据构建,具备强大的数据可扩展性。
- 参考与编辑的关系通过自然语言表达,而非局限于固定的任务集;语言(或更广泛地说,智能结构)是通向泛化的桥梁。
3. 架构
尽可能早地融合多样化的数据类型和任务——正确的混合比例是关键。
4. 训练策略
在训练中尽可能早地融合多样化的数据类型和任务——正确的混合比例是关键
这些选择都指向同一个目标:让 H3 从预训练阶段起就具备广泛的多模态上下文理解与生成能力。
前面我们谈到了训练范式的转变,那么视频模型的应用格局又在发生怎样的变化?
我们看到创作者开始直接用自然语言描述意图,而不再只是输入简单的视觉提示词。随着多模态理解、指令遵循和复杂任务执行能力的持续提升,视频模型将能更完整地把握创作意图、应对更复杂的内容需求,并逐步从"生成片段"走向真正参与整个内容生产流程。
H3 的技术选择
H3 的设计理念很简单——但构建它的过程绝非如此。从 Hailuo-01 到 Hailuo-02 再到 H3,每一代的工程复杂度都比上一代增长了约 10 倍。
下面简要介绍 H3 的部分核心技术:
1. H3-Contextual Omni Representation(上下文全模态表征)
在构建 H3 的工程中,我们做得最重要的事情之一就是强化其描述生成(captioning)能力。
- 引入多模态上下文进一步拓宽了"描述(caption)"需要覆盖的范围——我们不再只是描述目标视频,还要描述上下文与目标视频之间的关系,甚至上下文内部各元素之间的关联。
- 我们需要同时描述视频和音频,而这种音视频关系在多镜头场景下会变得更加复杂。
- 这本质上是一种 Contextual Omni Representation(上下文全模态表征)——语言在其中充当可泛化的桥梁和解释器,将"任务"统一为一种开放的描述性形式。这正是 H3 强大指令遵循能力的根源。
- 为了实现这一点,我们构建了专门的模型和全模态理解流水线。大多数源素材需要约 100K token 的推理量,最终蒸馏为平均约 4K token。
2. H3-VAE:架构效率的大幅提升
H 系列一直在持续推动 tokenizer(分词器)技术的发展。在 H3 中,我们彻底重构了此前的 tokenizer,在重建质量和可学习性方面取得了全面提升,让 H3 在效率上具备了竞争优势。其高压缩比还带来了 4 倍的有效序列长度增益,大幅降低了训练和推理成本,也是我们原生支持 2K 分辨率的关键技术。
3. H3-Omni Transformer:为任务泛化而生的架构
遵循 H3"架构服务于任务"的设计理念,通用性和效率是仅有的两个目标。值得注意的是,我们放弃了 Hailuo-02 的架构——尽管它曾为我们带来显著的架构优势——因为它会为一个围绕任务泛化构建的模型引入不必要的复杂性。我们相信任务泛化是不可逆转的趋势,架构上的技巧应当让位于模型本身的定义方式。
在 H3 中,多模态上下文的引入使序列长度的方差扩大了三倍,理解和生成的计算负载也变得更加异构。我们采用了将理解与生成工作负载分离的训练架构,分别优化各自的硬件利用率,同时在单样本异构计算与跨样本负载均衡之间进行联合平衡。整体而言,训练吞吐量提升了近 30%。
4. H3-In-context Regeneration(上下文内再生成)
为了实现 H3 的 2K 输出,我们没有使用传统的专用超分辨率模块,而是让 H3 基础模型在上下文内重新生成自己的低分辨率输出。这带来了两大优势:第一,再生成过程最大程度地复用了 H3 基础模型已有的生成能力;第二,上下文内方式让它能够再次调用原始多模态上下文来生成高分辨率输出,从而恢复那些传统超分辨率只能"猜测"、且往往无法还原的细节,比如小字号文字和精细纹理。
In-Context Regeneration 本身就是任务泛化的另一种体现。
我们很快将发布完整的 H3 技术报告,期待听到你的反馈。
我们的愿景与下一步计划
语言、图像、视频和音频是人类体验的基本模态。它们彼此深度关联,是我们与世界交互的主要界面。它们共同构成的多模态上下文,能够高效地传递海量信息,而表达和分享信息的能力本身就是一种生产力。
对于多模态理解与生成,我们将语言视为一种可泛化、可扩展的计算系统。正因如此,我们相信多模态智能应当深深植根于语言。
H3 仍有成长空间,以下是我们在未来版本中的优先方向:
- 强大的多模态理解是高质量生成的基础,而这方面仍有很大的提升空间。在下一代 H 系列中,我们计划整合 M 系列模型的能力。
- H3 当前的模型规模在多项能力上仍有提升空间。扩展规模是一条清晰的前进路径,我们相信更强的任务泛化能力将帮助我们充分释放其潜力。
- 某些场景下的视觉细节仍有改进空间。我们将继续朝着更高分辨率和更逼真的视觉效果迈进。
智能,与每一个人同在。





