Aujourd'hui, nous lançons MiniMax H3, un modèle de génération multimodale polyvalent. H3 comprend un contexte unifié couvrant texte, images, vidéo et audio, et génère des vidéos avec un son stéréo natif, jusqu'à 15 secondes en résolution 2K.
Les premiers tests montrent que H3 est prêt pour la création de contenu commercial dans une large gamme de cas d'usage, excellant dans le suivi d'instructions, le rendu précis du texte et des marques, et le transfert de mouvement V2V. Grâce à une génération et une édition multimodales précises et contrôlables, H3 est conçu pour la publicité, le branding, le e-commerce, le design produit, l'UI/UX, le jeu vidéo, et bien plus encore.
Porté par des technologies telles que Contextual Omni Representation, H3-VAE, H3-Omni Transformer et In-Context Regeneration, H3 offre un rapport prix-performance leader du secteur. Nous proposons la résolution 2K par défaut. En 2K, le prix par seconde de H3 représente moins d'un tiers de celui des modèles grand public, et en 768p, moins de la moitié du prix du 720p de ces modèles.
Les modèles closed-source dominent depuis longtemps la génération vidéo, avec une itération plus lente et un écosystème moins ouvert que des domaines comme celui des grands modèles de langage. Pour soutenir la communauté open-source, accélérer la compatibilité avec un plus large éventail de matériel IA, et permettre aux utilisateurs de créer plus facilement leurs propres versions personnalisées, nous prévoyons d'ouvrir les poids du modèle dans les prochains jours, sous réserve des lois et réglementations applicables. La compatibilité matérielle a été une considération clé dès les premières étapes de la conception de H3.
Points forts du modèle H3
1. Compréhension du contexte multimodal
Un vrai travail créatif exige de fusionner des informations complexes issues de différentes modalités, en intégrant images, audio, vidéo et plus encore comme sources d'entrée. Par exemple, le prompt pour le plan ci-dessous est : « Reprends le mouvement de caméra hitchcockien de la Vidéo 1, fais chanter le personnage de l'Image 2, avec un chant qui correspond à l'Audio 3. » Il suffit de décrire en mots la relation entre le contexte et la vidéo cible. H3 gère seul la compréhension complexe de l'ensemble des modalités.
Entrée multimodale

Vidéo 1

Image 2

Audio 3
Vidéo générée par H3

2. Performance 2K

3. Son stéréo natif

Cas d'usage de H3
1. Génériques d'ouverture de film

2. Site web produit

3. Affiche animée

4. Publicité & E-commerce

La philosophie de conception de H3
Repousser les frontières entre les tâches : du spécialisé au polyvalent
Nous avons développé deux générations précédentes de modèles : Hailuo 01 a bâti le système de zéro, et Hailuo 02 s'est concentré sur l'amélioration des composants clés comme l'efficacité architecturale, la qualité des données et l'échelle.
Lors de la conception de H3, nous avons identifié les limites des modèles génératifs précédents autour des frontières entre tâches : la génération d'images était généralement répartie entre des modèles experts distincts pour le T2I, l'édition, la référence de sujet, la référence de mouvement et la référence de style ; la voix, les effets sonores et la musique dans la génération audio étaient largement étudiés comme des domaines séparés ; et la génération vidéo était encore plus fragmentée entre texte-vers-vidéo, image-vers-vidéo, première-et-dernière-image, référence de sujet, référence de mouvement, référence vocale, édition vidéo, etc., avec des frontières nettes entre image, vidéo et audio également.
Ces tâches, capacités et modalités cloisonnées ont limité la liberté créative en pratique. Et, côté entraînement, elles ont plafonné la capacité de généralisation du modèle. Les deux montrent qu'il y a une grande marge de changement, tant dans le paradigme d'application que dans le paradigme d'entraînement. Le premier principe ayant guidé le développement de H3 a donc été l'unification et la généralisation à travers les tâches.
Sur cette base, voici un bref aperçu du paradigme de pré-entraînement de H3 :
1. Données et tâches
Texte-vers-image
Texte-vers-vidéo
Avec un audio généré conjointement, toutes les sorties audio sont en stéréo natif
Modélisation native multi-plans*
Texte-vers-audio
Aucune séparation entre voix, effets sonores et musique — tout est modélisé conjointement
2. Référence et édition généralisées
Référence et édition image-vers-image
Référence et édition image-vers-vidéo
Référence et édition audio-vers-audio
Référence et édition audio-vidéo-vers-audio-vidéo
Dans notre conception, « référence et édition généralisées » signifie :
- Entièrement construit à partir de données réelles et naturelles, offrant une forte scalabilité des données.
- Des relations de référence et d'édition exprimées en langage naturel plutôt que confinées à un ensemble fixe de tâches ; le langage (ou la structure d'intelligence, au sens large) est le pont vers la généralisation.
3. Architecture
Fusionner les types de données et les tâches diversifiées le plus tôt possible — le bon ratio de mélange est essentiel.
4. Stratégie d'entraînement
Fusionner les types de données et les tâches diversifiées le plus tôt possible lors de l'entraînement — le bon ratio de mélange est essentiel
Ces choix convergent tous vers le même objectif : donner à H3 de larges capacités de compréhension du contexte multimodal et de génération dès l'étape de pré-entraînement.
Nous avons évoqué plus haut le changement de paradigme d'entraînement. Comment le paysage applicatif des modèles vidéo évolue-t-il également ?
Nous voyons les créateurs décrire leur intention directement en langage naturel, plutôt que de simplement saisir un prompt visuel simple. À mesure que la compréhension multimodale, le suivi d'instructions et l'exécution de tâches complexes s'améliorent, les modèles vidéo pourront saisir une intention créative plus complète, répondre à des besoins de contenu plus complexes, et passer progressivement de la « génération d'un clip » à une véritable participation à l'ensemble du processus de production de contenu.
Les choix techniques de H3
La philosophie de conception de H3 est simple — mais sa construction a été tout sauf simple. De Hailuo-01 à Hailuo-02 puis H3, la complexité technique de chaque génération a été multipliée par environ 10 par rapport à la précédente.
Un aperçu de quelques technologies clés de H3 :
1. H3-Contextual Omni Representation
L'une des choses les plus importantes que nous avons accomplies dans l'ingénierie de H3 a été de renforcer sa capacité de captioning.
- L'introduction du contexte multimodal a élargi ce que la notion de « caption » doit couvrir : nous ne décrivons plus seulement la vidéo cible, mais la relation entre le contexte et la vidéo cible, et même les relations entre les éléments du contexte lui-même.
- Nous devons décrire conjointement la vidéo et l'audio, et cette relation audiovisuelle devient encore plus complexe sur plusieurs plans.
- Il s'agit fondamentalement d'une forme de Contextual Omni Representation, où le langage agit comme un pont généralisable et un interprète, unifiant les « tâches » en une forme descriptive ouverte. C'est la racine de la large capacité de suivi d'instructions de H3.
- Pour y parvenir, nous avons construit des modèles dédiés et un pipeline de compréhension toutes modalités. La plupart des sources nécessitent environ 100 000 tokens d'inférence, distillés jusqu'à une moyenne d'environ 4 000 tokens.
2. H3-VAE : un gain majeur en efficacité architecturale
La série H a continuellement fait progresser la technologie des tokenizers. Avec H3, nous avons entièrement repensé notre tokenizer précédent, obtenant des gains généralisés en qualité de reconstruction et en apprentissabilité, ce qui donne à H3 un avantage compétitif en efficacité. Son taux de compression élevé offre également un gain de 4x sur la longueur de séquence effective, réduisant considérablement les coûts d'entraînement et d'inférence, et c'est la technologie clé derrière notre support natif de la résolution 2K.
3. H3-Omni Transformer : une architecture conçue pour la généralisation des tâches
Conformément à la philosophie de conception de H3 selon laquelle « l'architecture doit servir la tâche », la généralité et l'efficacité étaient les deux seuls objectifs. Notamment, nous avons mis de côté l'architecture Hailuo-02, malgré les avantages architecturaux significatifs qu'elle nous avait apportés, car elle aurait introduit une complexité inutile pour un modèle construit autour de la généralisation des tâches. Nous croyons que la généralisation des tâches est une tendance irréversible, et que les astuces architecturales doivent céder la place à la façon dont le modèle est défini.
Dans H3, l'introduction du contexte multimodal a triplé la variance de la longueur des séquences, et les charges de calcul pour la compréhension et la génération sont devenues nettement plus hétérogènes. Nous avons adopté une architecture d'entraînement qui sépare les charges de travail de compréhension et de génération, optimisant l'utilisation du matériel pour chacune, tout en équilibrant conjointement le calcul hétérogène par échantillon et la répartition de charge entre échantillons. De bout en bout, cela a augmenté le débit d'entraînement de près de 30 %.
4. H3-In-context Regeneration
Pour la sortie 2K de H3, au lieu d'utiliser un module de super-résolution dédié conventionnel, nous faisons régénérer par le modèle de base H3 sa propre sortie basse résolution en contexte. Cela présente deux avantages : premièrement, le processus de régénération réutilise au maximum la capacité générative déjà intégrée dans le modèle de base H3 ; deuxièmement, l'approche en contexte lui permet de s'appuyer à nouveau sur le contexte multimodal d'origine pour produire une sortie haute résolution, récupérant des détails que la super-résolution traditionnelle ne peut que « deviner » et souvent ne peut pas restaurer, comme les petits textes et les détails fins.
In-Context Regeneration est elle-même une autre expression de la généralisation des tâches.
Nous partagerons bientôt le rapport technique complet de H3. Nous serions ravis d'avoir vos retours.
Notre vision & la suite
Le langage, les images, la vidéo et l'audio sont des modalités fondamentales de l'expérience humaine. Ils sont profondément interconnectés et constituent nos principales interfaces avec le monde. Ensemble, ils forment des contextes multimodaux capables de communiquer efficacement une vaste gamme d'informations, et la capacité d'exprimer et de partager l'information est elle-même une forme de productivité.
Pour la compréhension et la génération multimodales, nous considérons le langage comme un système computationnel généralisable et évolutif. C'est pourquoi nous croyons que l'intelligence multimodale doit être profondément ancrée dans le langage.
H3 a encore une marge de progression, et voici nos priorités pour les versions futures :
- Une compréhension multimodale solide est le fondement d'une génération de haute qualité, et il y a une marge d'amélioration significative. Dans la prochaine génération de la série H, nous prévoyons d'intégrer les capacités de nos modèles de la série M.
- La taille actuelle du modèle H3 laisse une marge de progression sur plusieurs capacités. Le scaling est une voie claire, et nous croyons qu'une meilleure généralisation des tâches nous permettra de libérer pleinement son potentiel.
- Le détail visuel peut encore être amélioré dans certains scénarios. Nous continuerons à progresser vers des résolutions plus élevées et une meilleure fidélité visuelle.
L'intelligence avec tous.





