MiniMax H3: Un modelo abierto que rompe las fronteras entre tareas y modalidades

@MiniMax_AI
INGLÉShace 2 días · 31 jul 2026
306K
2.4K
305
117
830

TL;DR

MiniMax H3 es un modelo multimodal unificado capaz de generar video en 2K con audio estéreo integrado. Simplifica los flujos de trabajo creativos al permitir que el lenguaje natural controle referencias y ediciones multimodales complejas.

Hoy lanzamos MiniMax H3, un modelo de generación multimodal de propósito general. H3 comprende contexto unificado en texto, imágenes, video y audio, generando video con sonido estéreo nativo, de hasta 15 segundos en resolución 2K.

Las pruebas iniciales demuestran que H3 está listo para la creación de contenido comercial en una amplia gama de casos de uso, destacándose en el seguimiento de instrucciones, la representación precisa de texto y marcas, y la transferencia de movimiento V2V. Con generación y edición multimodal precisa y controlable, H3 está diseñado para publicidad, branding, comercio electrónico, diseño de productos, UI/UX, juegos y más.

Impulsado por tecnologías como Contextual Omni Representation, H3-VAE, H3-Omni Transformer e In-Context Regeneration, H3 ofrece una relación precio-rendimiento líder en la industria. Ofrecemos resolución 2K por defecto. A 2K, el precio por segundo de H3 es menos de un tercio del de los modelos convencionales, y a 768p, es menos de la mitad del precio de la resolución 720p de los modelos convencionales.

Los modelos de código cerrado han dominado durante mucho tiempo la generación de video, con una iteración más lenta y un ecosistema menos abierto que campos como los grandes modelos de lenguaje. Para apoyar a la comunidad de código abierto, acelerar la compatibilidad con una gama más amplia de hardware de IA y facilitar que los usuarios creen sus propias versiones personalizadas, planeamos abrir los pesos del modelo en los próximos días, sujeto a las leyes y regulaciones aplicables. La compatibilidad de hardware ha sido una consideración clave desde las etapas más tempranas del diseño de H3.

Aspectos destacados del modelo H3

1. Comprensión del contexto multimodal

El trabajo creativo real requiere combinar información compleja entre modalidades, incorporando imágenes, audio, video y más como fuentes de entrada. Por ejemplo, el prompt para la toma que aparece a continuación es: «Toma como referencia el movimiento de cámara de Hitchcock del Video 1, haz que el personaje de la Imagen 2 cante y que las voces coincidan con el Audio 3». Solo tienes que describir en palabras la relación entre el contexto y el video objetivo. H3 se encarga por sí solo de la comprensión compleja e integral de todas las modalidades.

Entrada Multimodal

MiniMax (official) - inline image

Video 1

MiniMax (official) - inline image

Imagen 2

MiniMax (official) - inline image

Audio 3

Video Generado por H3

MiniMax (official) - inline image

2. Rendimiento 2K

MiniMax (official) - inline image

3. Sonido estéreo nativo

MiniMax (official) - inline image

Casos de uso de H3

1. Títulos de apertura de películas

MiniMax (official) - inline image

2. Sitio web de producto

MiniMax (official) - inline image

3. Póster animado

MiniMax (official) - inline image

4. Publicidad y comercio electrónico

MiniMax (official) - inline image

Filosofía de diseño de H3

Rompiendo las barreras entre tareas: de lo especializado a lo general

Hemos desarrollado dos generaciones anteriores de modelos: Hailuo 01 construyó el sistema desde cero, y Hailuo 02 se centró en mejorar componentes clave como la eficiencia arquitectónica, la calidad de los datos y la escala.

Al diseñar H3, reconocimos las limitaciones de los modelos generativos anteriores en torno a los límites de las tareas: la generación de imágenes se dividía típicamente en modelos expertos separados para T2I, edición, referencia de sujeto, referencia de movimiento y referencia de estilo; la voz, los efectos de sonido y la música en la generación de audio se estudiaban en gran medida como dominios separados; y la generación de video se fragmentaba aún más en texto a video, imagen a video, primer y último fotograma, referencia de sujeto, referencia de movimiento, referencia de voz, edición de video y más, con límites claros también entre imagen, video y audio.

Estas tareas, capacidades y modalidades aisladas limitaban la libertad creativa en la práctica. Y, en el lado del entrenamiento, restringían la capacidad del modelo para generalizar. Ambos aspectos apuntan a un amplio margen de cambio, tanto en el paradigma de aplicación como en el de entrenamiento. Así que el primer principio que guió el desarrollo de H3 fue unificar y generalizar entre tareas.

Con esto en mente, aquí tienes un breve resumen del paradigma de preentrenamiento de H3:

1. Datos y tareas

Texto a imagen

Texto a video

*Con audio generado conjuntamente, toda la salida de audio es estéreo nativo

Modelado nativo de múltiples tomas*

Texto a audio

Sin separación entre voz, efectos de sonido y música — todo se modela conjuntamente

2. Referencia y edición generalizadas

Referencia y edición de imagen a imagen

Referencia y edición de imagen a video

Referencia y edición de audio a audio

Referencia y edición de audio-video a audio-video

En nuestro diseño, «referencia y edición generalizadas» significa:

  • Construido íntegramente a partir de datos reales y naturales, lo que le otorga una fuerte escalabilidad de datos.
  • Las relaciones de referencia y edición se expresan mediante lenguaje natural en lugar de limitarse a un conjunto fijo de tareas; el lenguaje (o la estructura de inteligencia, en términos generales) es el puente hacia la generalización.

3. Arquitectura

Fusionar diversos tipos de datos y tareas lo antes posible — la proporción adecuada de mezcla es clave.

4. Estrategia de entrenamiento

Fusionar diversos tipos de datos y tareas lo antes posible en el entrenamiento — la proporción adecuada de mezcla es clave.

Todas estas decisiones apuntan al mismo objetivo: dotar a H3 de amplias capacidades de comprensión del contexto multimodal y generación desde la etapa de preentrenamiento en adelante.

Antes hablamos del cambio en el paradigma de entrenamiento. Entonces, ¿cómo está cambiando también el panorama de aplicaciones de los modelos de video?

Estamos viendo cómo los creadores describen su intención directamente en lenguaje natural, en lugar de limitarse a introducir un prompt visual simple. A medida que la comprensión multimodal, el seguimiento de instrucciones y la ejecución de tareas complejas siguen mejorando, los modelos de video podrán captar una intención creativa más completa, manejar necesidades de contenido más complejas y pasar gradualmente de «generar un clip» a participar genuinamente en todo el proceso de producción de contenido.

Decisiones técnicas de H3

La filosofía de diseño de H3 es simple — pero construirlo fue cualquier cosa menos simple. De Hailuo-01 a Hailuo-02 y a H3, la complejidad de ingeniería de cada generación ha crecido aproximadamente 10 veces respecto a la anterior.

Un breve vistazo a algunas de las tecnologías centrales de H3:

1. H3-Contextual Omni Representation

Una de las cosas más importantes que hicimos en la ingeniería de H3 fue fortalecer su capacidad para generar descripciones.

  • La introducción del contexto multimodal amplió aún más el alcance de lo que debe cubrir la «descripción»: ya no solo describimos el video objetivo, sino también la relación entre el contexto y el video objetivo, e incluso las relaciones entre los elementos del propio contexto.
  • Necesitamos describir conjuntamente el video y el audio, y esa relación audiovisual se vuelve aún más compleja a lo largo de múltiples tomas.
  • Esto es fundamentalmente una forma de Contextual Omni Representation, donde el lenguaje actúa como puente e intérprete generalizable, unificando las «tareas» en una forma abierta y descriptiva. Esta es la raíz de la amplia capacidad de H3 para seguir instrucciones.
  • Para lograrlo, construimos modelos dedicados y un pipeline de comprensión de todas las modalidades. La mayor parte del material fuente requiere alrededor de 100K tokens de inferencia, que se destilan hasta un promedio de aproximadamente 4K tokens.

2. H3-VAE: Un gran impulso a la eficiencia arquitectónica

La serie H ha impulsado continuamente la tecnología de tokenizadores. Con H3, rediseñamos por completo nuestro tokenizador anterior, logrando mejoras generalizadas en la calidad de reconstrucción y la capacidad de aprendizaje, lo que otorga a H3 una ventaja competitiva en eficiencia. Su alta tasa de compresión también ofrece una ganancia de 4x en la longitud efectiva de la secuencia, reduciendo sustancialmente los costos de entrenamiento e inferencia, y es la tecnología clave detrás de nuestro soporte nativo de resolución 2K.

3. H3-Omni Transformer: Una arquitectura diseñada para la generalización de tareas

En línea con la filosofía de diseño de H3 de que «la arquitectura debe servir a la tarea», la generalidad y la eficiencia fueron los únicos dos objetivos. Cabe destacar que dejamos de lado la arquitectura de Hailuo-02, a pesar de las importantes ventajas arquitectónicas que nos dio en su momento, porque introduciría una complejidad innecesaria en un modelo construido en torno a la generalización de tareas. Creemos que la generalización de tareas es una tendencia irreversible, y que los trucos arquitectónicos deberían dar paso a cómo se define el modelo.

En H3, la introducción del contexto multimodal triplicó la varianza en la longitud de las secuencias, y las cargas de trabajo computacionales para la comprensión y la generación se volvieron notablemente más heterogéneas. Adoptamos una arquitectura de entrenamiento que separa las cargas de trabajo de comprensión y generación, optimizando la utilización del hardware para cada una, a la vez que equilibra el cómputo heterogéneo por muestra con el balanceo de carga entre muestras. De extremo a extremo, esto elevó el rendimiento del entrenamiento en casi un 30%.

4. H3-In-context Regeneration

Para la salida 2K de H3, en lugar de utilizar un módulo de superresolución dedicado convencional, hacemos que el modelo base de H3 regenere en contexto su propia salida de baja resolución. Esto aporta dos ventajas: primero, el proceso de regeneración reutiliza al máximo la capacidad generativa ya integrada en el modelo base de H3; segundo, el enfoque contextual le permite recurrir nuevamente al contexto multimodal original para producir una salida de alta resolución, recuperando detalles que la superresolución tradicional solo puede «adivinar» y a menudo no puede restaurar, como texto pequeño y detalles finos.

In-Context Regeneration es en sí misma otra expresión de la generalización de tareas.

Pronto compartiremos el informe técnico completo de H3. Esperamos recibir tus comentarios.

Nuestra visión y lo que viene

El lenguaje, las imágenes, el video y el audio son modalidades fundamentales de la experiencia humana. Están profundamente interconectados y sirven como nuestras principales interfaces con el mundo. Juntos, forman contextos multimodales que pueden comunicar una vasta gama de información de manera eficiente, y la capacidad de expresar y compartir información es en sí misma una forma de productividad.

Para la comprensión y generación multimodal, vemos el lenguaje como un sistema computacional generalizable y escalable. Por eso creemos que la inteligencia multimodal debería estar profundamente arraigada en el lenguaje.

H3 todavía tiene margen para crecer, y estas son nuestras prioridades para las versiones futuras:

  • Una sólida comprensión multimodal es la base de la generación de alta calidad, y hay un margen significativo de mejora. En la próxima generación de la serie H, planeamos integrar capacidades de nuestros modelos de la serie M.
  • El tamaño actual del modelo H3 deja margen de mejora en varias capacidades. El escalado es un camino claro hacia adelante, y creemos que una mayor generalización de tareas nos permitirá desbloquear todo su potencial.
  • El detalle visual aún puede mejorar en ciertos escenarios. Seguiremos avanzando hacia resoluciones más altas y una mayor fidelidad visual.

Inteligencia con todos.

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales