Hoy lanzamos MiniMax H3, un modelo de generación multimodal de propósito general. H3 comprende contexto unificado en texto, imágenes, video y audio, generando video con sonido estéreo nativo, de hasta 15 segundos en resolución 2K.
Las primeras pruebas muestran que H3 está listo para la creación de contenido comercial en una amplia gama de casos de uso, destacándose en el seguimiento de instrucciones, el renderizado preciso de texto y marcas, y la transferencia de movimiento V2V. Con generación y edición multimodal precisa y controlable, H3 está diseñado para publicidad, branding, comercio electrónico, diseño de productos, UI/UX, videojuegos y más.
Impulsado por tecnologías como Contextual Omni Representation, H3-VAE, H3-Omni Transformer e In-Context Regeneration, H3 ofrece una relación precio-rendimiento líder en la industria. Ofrecemos resolución 2K por defecto. En 2K, el precio por segundo de H3 es menos de un tercio del de los modelos convencionales, y en 768p, es menos de la mitad del precio de los modelos convencionales en 720p.
Los modelos de código cerrado han dominado durante mucho tiempo la generación de video, con una iteración más lenta y un ecosistema menos abierto que campos como los grandes modelos de lenguaje. Para apoyar a la comunidad de código abierto, acelerar la compatibilidad con una gama más amplia de hardware de IA y facilitar que los usuarios creen sus propias versiones personalizadas, planeamos abrir los pesos del modelo en los próximos días, sujeto a las leyes y regulaciones aplicables. La compatibilidad de hardware ha sido una consideración clave desde las primeras etapas del diseño de H3.
Aspectos destacados del modelo H3
1. Comprensión de contexto multimodal
El trabajo creativo real requiere combinar información compleja entre modalidades, incorporando imágenes, audio, video y más como fuentes de entrada. Por ejemplo, el prompt para el plano a continuación es: "Toma como referencia el movimiento de cámara de Hitchcock del Video 1, haz que el personaje de la Imagen 2 cante, con las voces coincidiendo con el Audio 3." Solo describe con palabras la relación entre el contexto y el video objetivo. H3 se encarga por sí solo de la compleja comprensión de todas las modalidades.
Entrada multimodal

Video 1

Imagen 2

Audio 3
Video generado por H3

2. Rendimiento 2K

3. Sonido estéreo nativo

Casos de uso de H3
1. Títulos de apertura de películas

2. Sitio web de producto

3. Póster animado

4. Publicidad y comercio electrónico

Filosofía de diseño de H3
Rompiendo los límites entre tareas: de lo especializado a lo general
Hemos desarrollado dos generaciones anteriores de modelos: Hailuo 01 construyó el sistema desde cero, y Hailuo 02 se centró en mejorar componentes clave como la eficiencia arquitectónica, la calidad de los datos y la escala.
Al diseñar H3, reconocimos las limitaciones de los modelos generativos anteriores en torno a los límites de las tareas: la generación de imágenes normalmente se dividía en modelos expertos separados para T2I, edición, referencia de sujeto, referencia de movimiento y referencia de estilo; la voz, los efectos de sonido y la música en la generación de audio se estudiaban en gran medida como dominios separados; y la generación de video se fragmentaba aún más en texto a video, imagen a video, primer y último fotograma, referencia de sujeto, referencia de movimiento, referencia de voz, edición de video, etc., con límites claros también entre imagen, video y audio.
Estas tareas, capacidades y modalidades aisladas limitaban la libertad creativa en la práctica. Y, del lado del entrenamiento, limitaban la capacidad del modelo para generalizar. Ambos aspectos apuntan a un gran margen de cambio, tanto en el paradigma de aplicación como en el de entrenamiento. Por eso, el primer principio que guió el desarrollo de H3 fue unificar y generalizar entre tareas.
Con esto en mente, aquí hay un breve resumen del paradigma de preentrenamiento de H3:
1. Datos y tareas
Texto a imagen
Texto a video
*Con audio generado conjuntamente, toda la salida de audio es estéreo nativo
Modelado nativo de múltiples tomas*
Texto a audio
Sin separación entre voz, efectos de sonido y música: todo se modela de forma conjunta
2. Referencia y edición generalizadas
Referencia y edición de imagen a imagen
Referencia y edición de imagen a video
Referencia y edición de audio a audio
Referencia y edición de audio-video a audio-video
En nuestro diseño, "referencia y edición generalizadas" significa:
- Construido enteramente con datos reales y naturales, lo que le otorga una gran escalabilidad de datos.
- Relaciones de referencia y edición expresadas mediante lenguaje natural en lugar de limitarse a un conjunto fijo de tareas; el lenguaje (o la estructura de inteligencia, en términos amplios) es el puente hacia la generalización.
3. Arquitectura
Fusionar diversos tipos de datos y tareas lo antes posible: la proporción de mezcla adecuada es clave.
4. Estrategia de entrenamiento
Fusionar diversos tipos de datos y tareas lo antes posible en el entrenamiento: la proporción de mezcla adecuada es clave
Todas estas decisiones apuntan al mismo objetivo: dotar a H3 de amplias capacidades de comprensión y generación de contexto multimodal desde la etapa de preentrenamiento.
Antes hablamos del cambio en el paradigma de entrenamiento, ¿cómo está cambiando también el panorama de aplicaciones de los modelos de video?
Estamos viendo cómo los creadores describen su intención directamente en lenguaje natural, en lugar de solo ingresar un simple prompt visual. A medida que la comprensión multimodal, el seguimiento de instrucciones y la ejecución de tareas complejas siguen mejorando, los modelos de video podrán captar una intención creativa más completa, manejar necesidades de contenido más complejas y pasar gradualmente de "generar un clip" a participar genuinamente en todo el proceso de producción de contenido.
Decisiones técnicas de H3
La filosofía de diseño de H3 es simple, pero construirlo fue todo menos simple. De Hailuo-01 a Hailuo-02 y a H3, la complejidad de ingeniería de cada generación ha crecido aproximadamente 10 veces respecto a la anterior.
Un vistazo breve a algunas de las tecnologías centrales de H3:
1. H3-Contextual Omni Representation
Una de las cosas más importantes que hicimos al desarrollar H3 fue fortalecer su capacidad de generación de descripciones.
La introducción del contexto multimodal amplió aún más lo que una "descripción" debe cubrir: ya no solo describimos el video objetivo, sino también la relación entre el contexto y el video objetivo, e incluso las relaciones entre los elementos del propio contexto.
Necesitamos describir video y audio de forma conjunta, y esa relación audiovisual se vuelve aún más compleja cuando hay múltiples tomas.
Esto es fundamentalmente una forma de Contextual Omni Representation, donde el lenguaje actúa como el puente generalizable e intérprete, unificando las "tareas" en una forma abierta y descriptiva. Esta es la raíz de la amplia capacidad de H3 para seguir instrucciones.
Para lograrlo, construimos modelos dedicados y un pipeline de comprensión de modalidades completas. La mayor parte del material fuente requiere alrededor de 100K tokens de inferencia, destilados a un promedio de aproximadamente 4K tokens.
2. H3-VAE: Un gran impulso a la eficiencia arquitectónica
La serie H ha avanzado continuamente en la tecnología de tokenizers. Con H3, renovamos por completo nuestro tokenizer anterior, logrando mejoras generalizadas en la calidad de reconstrucción y la capacidad de aprendizaje, lo que le da a H3 una ventaja competitiva en eficiencia. Su alta relación de compresión también ofrece una ganancia de 4x en la longitud efectiva de secuencia, lo que reduce sustancialmente los costos de entrenamiento e inferencia, y es la tecnología clave detrás de nuestro soporte nativo de resolución 2K.
3. H3-Omni Transformer: Una arquitectura diseñada para la generalización de tareas
En línea con la filosofía de diseño de H3 de que "la arquitectura debe servir a la tarea", la generalidad y la eficiencia fueron los únicos dos objetivos. Cabe destacar que dejamos de lado la arquitectura de Hailuo-02, a pesar de las significativas ventajas arquitectónicas que nos dio en su momento, porque introduciría una complejidad innecesaria para un modelo construido en torno a la generalización de tareas. Creemos que la generalización de tareas es una tendencia irreversible, y los trucos arquitectónicos deben dar paso a la forma en que se define el modelo.
En H3, la introducción del contexto multimodal triplicó la varianza en la longitud de secuencia, y las cargas de cómputo para comprensión y generación se volvieron notablemente más heterogéneas. Adoptamos una arquitectura de entrenamiento que separa las cargas de comprensión y generación, ajustando la utilización del hardware para cada una, mientras equilibramos de forma conjunta el cómputo heterogéneo por muestra con el balanceo de carga entre muestras. De extremo a extremo, esto elevó el rendimiento del entrenamiento en casi un 30%.
4. H3-In-context Regeneration
Para la salida 2K de H3, en lugar de usar un módulo de superresolución dedicado convencional, hacemos que el modelo base de H3 regenere su propia salida de baja resolución en contexto. Esto trae dos ventajas: primero, el proceso de regeneración reutiliza al máximo la capacidad generativa ya incorporada en el modelo base de H3; segundo, el enfoque en contexto le permite volver a recurrir al contexto multimodal original para producir una salida de alta resolución, recuperando detalles que la superresolución tradicional solo puede "adivinar" y a menudo no puede restaurar, como texto pequeño y detalles finos.
In-Context Regeneration es en sí misma otra expresión de la generalización de tareas.
Pronto compartiremos el informe técnico completo de H3. Esperamos recibir tus comentarios.
Nuestra visión y lo que viene
El lenguaje, las imágenes, el video y el audio son modalidades fundamentales de la experiencia humana. Están profundamente interconectadas y sirven como nuestras principales interfaces con el mundo. Juntas, forman contextos multimodales que pueden comunicar una amplia gama de información de manera eficiente, y la capacidad de expresar y compartir información es en sí misma una forma de productividad.
Para la comprensión y generación multimodal, vemos el lenguaje como un sistema computacional generalizable y escalable. Por eso creemos que la inteligencia multimodal debería estar profundamente arraigada en el lenguaje.
H3 aún tiene margen para crecer, y estas son nuestras prioridades para futuras versiones:
- Una sólida comprensión multimodal es la base de la generación de alta calidad, y hay un margen significativo para mejorar. En la próxima generación de la serie H, planeamos integrar capacidades de nuestros modelos de la serie M.
- El tamaño actual del modelo H3 deja margen de mejora en varias capacidades. El escalado es un camino claro hacia adelante, y creemos que una mayor generalización de tareas nos permitirá desbloquear todo su potencial.
- El detalle visual aún puede mejorar en ciertos escenarios. Seguiremos avanzando hacia resoluciones más altas y una mayor fidelidad visual.
Inteligencia con todos.





