Hoje, estamos lançando o MiniMax H3, um modelo multimodal de geração de uso geral. O H3 compreende contexto unificado entre texto, imagens, vídeo e áudio, gerando vídeo com som estéreo nativo, em até 15 segundos e resolução 2K.
Os primeiros testes mostram que o H3 está pronto para a criação de conteúdo comercial em uma ampla gama de casos de uso, destacando-se no seguimento de instruções, na renderização precisa de texto e marcas e na transferência de movimento V2V. Com geração e edição multimodais precisas e controláveis, o H3 é feito para publicidade, branding, e-commerce, design de produtos, UI/UX, jogos e muito mais.
Alimentado por tecnologias como Contextual Omni Representation, H3-VAE, H3-Omni Transformer e In-Context Regeneration, o H3 oferece um custo-benefício líder no setor. Oferecemos resolução 2K por padrão. Em 2K, o preço por segundo do H3 é menos de um terço do preço dos modelos convencionais e, em 768p, menos da metade do preço dos modelos convencionais em 720p.
Modelos de código fechado dominaram a geração de vídeo por muito tempo, com iteração mais lenta e um ecossistema menos aberto do que áreas como a dos grandes modelos de linguagem. Para apoiar a comunidade open-source, acelerar a compatibilidade com uma gama mais ampla de hardware de IA e facilitar a criação de versões personalizadas pelos usuários, planejamos disponibilizar os pesos do modelo nos próximos dias, sujeito às leis e regulamentações aplicáveis. A compatibilidade de hardware tem sido uma consideração fundamental desde os estágios iniciais do design do H3.
Destaques do Modelo H3
1. Compreensão de contexto multimodal
O trabalho criativo real exige combinar informações complexas entre modalidades, usando imagens, áudio, vídeo e mais como fontes de entrada. Por exemplo, o prompt para o plano abaixo é: "Referencie o movimento de câmera de Hitchcock do Vídeo 1, faça o personagem da Imagem 2 cantar, com os vocais combinando com o Áudio 3." Basta descrever em palavras a relação entre o contexto e o vídeo-alvo. O H3 cuida sozinho da compreensão complexa e de modalidade completa.
Entrada Multimodal

Vídeo 1

Imagem 2

Áudio 3
Vídeo Gerado pelo H3

2. Desempenho em 2K

3. Som Estéreo Nativo

Casos de Uso do H3
1. Aberturas de Filmes

2. Site de Produto

3. Pôster Animado

4. Publicidade e E-commerce

Filosofia de Design do H3
Quebrando as Fronteiras Entre Tarefas: do Especializado ao Generalista
Desenvolvemos duas gerações anteriores de modelos: o Hailuo 01 construiu o sistema do zero, e o Hailuo 02 focou em melhorar componentes principais como eficiência arquitetural, qualidade dos dados e escala.
Ao projetar o H3, reconhecemos as limitações dos modelos generativos anteriores em relação às fronteiras entre tarefas: a geração de imagens era normalmente dividida em modelos especializados separados para T2I, edição, referência de assunto, referência de movimento e referência de estilo; voz, efeitos sonoros e música na geração de áudio eram amplamente estudados como domínios separados; e a geração de vídeo era ainda mais fragmentada em texto-para-vídeo, imagem-para-vídeo, primeiro e último quadro, referência de assunto, referência de movimento, referência de voz, edição de vídeo e muito mais, com fronteiras claras também entre imagem, vídeo e áudio.
Essas tarefas, capacidades e modalidades isoladas limitavam a liberdade criativa na prática. E, no lado do treinamento, limitavam a capacidade do modelo de generalizar. Ambas apontam para um enorme espaço de mudança, tanto no paradigma de aplicação quanto no de treinamento. Portanto, o primeiro princípio que guiou o desenvolvimento do H3 foi unificar e generalizar entre tarefas.
Com base nisso, aqui está uma breve visão geral do paradigma de pré-treinamento do H3:
1. Dados e Tarefas
Texto para imagem
Texto para vídeo
*Com áudio gerado em conjunto, toda a saída de áudio é estéreo nativa
Modelagem nativa multi-shot*
Texto para áudio
Sem separação entre voz, efeitos sonoros e música — tudo modelado em conjunto
2. Referência e edição generalizadas
Referência e edição de imagem para imagem
Referência e edição de imagem para vídeo
Referência e edição de áudio para áudio
Referência e edição de áudio-vídeo para áudio-vídeo
Em nosso design, "referência e edição generalizadas" significa:
- Construído inteiramente com dados reais e naturais, o que garante forte escalabilidade de dados.
- Relacionamentos de referência e edição expressos por linguagem natural, em vez de confinados a um conjunto fixo de tarefas; a linguagem (ou estrutura de inteligência, de modo amplo) é a ponte para a generalização.
3. Arquitetura
Fundir diversos tipos de dados e tarefas o mais cedo possível — a proporção certa de mistura é fundamental.
4. Estratégia de Treinamento
Fundir diversos tipos de dados e tarefas o mais cedo possível no treinamento — a proporção certa de mistura é fundamental
Todas essas escolhas apontam para o mesmo objetivo: dar ao H3 amplas capacidades de compreensão de contexto multimodal e geração desde o estágio de pré-treinamento.
Falamos antes sobre a mudança no paradigma de treinamento. E como o cenário de aplicações dos modelos de vídeo também está mudando?
Estamos vendo criadores de conteúdo descreverem sua intenção diretamente em linguagem natural, em vez de apenas inserir um prompt visual simples. À medida que a compreensão multimodal, o seguimento de instruções e a execução de tarefas complexas continuam melhorando, os modelos de vídeo serão capazes de captar a intenção criativa de forma mais completa, lidar com necessidades de conteúdo mais complexas e, gradualmente, passar de "gerar um clipe" para realmente participar de todo o processo de produção de conteúdo.
Escolhas Técnicas do H3
A filosofia de design do H3 é simples — mas construí-lo foi tudo menos simples. Do Hailuo-01 ao Hailuo-02 e ao H3, a complexidade de engenharia de cada geração cresceu cerca de 10 vezes em relação à anterior.
Uma breve olhada em algumas das tecnologias centrais do H3:
1. H3-Contextual Omni Representation
Uma das coisas mais importantes que fizemos na engenharia do H3 foi fortalecer sua capacidade de geração de legendas.
- Introduzir contexto multimodal ampliou ainda mais o que uma "legenda" precisa cobrir: não estamos mais descrevendo apenas o vídeo-alvo, mas a relação entre o contexto e o vídeo-alvo, e até mesmo as relações entre elementos dentro do próprio contexto.
- Precisamos descrever vídeo e áudio em conjunto, e essa relação audiovisual fica ainda mais complexa em múltiplos planos.
- Isso é, fundamentalmente, uma forma de Contextual Omni Representation, em que a linguagem atua como ponte generalizável e intérprete, unificando "tarefas" em uma forma aberta e descritiva. Essa é a raiz da ampla capacidade do H3 de seguir instruções.
- Para chegar lá, construímos modelos dedicados e um pipeline de compreensão de modalidades completas. A maior parte do material de origem exige cerca de 100 mil tokens de inferência, destilados para uma média de aproximadamente 4 mil tokens.
2. H3-VAE: Um Grande Salto em Eficiência Arquitetural
A série H tem avançado continuamente na tecnologia de tokenizadores. Com o H3, reformulamos completamente nosso tokenizador anterior, alcançando ganhos generalizados em qualidade de reconstrução e capacidade de aprendizado, o que dá ao H3 uma vantagem competitiva em eficiência. Sua alta taxa de compressão também proporciona um ganho de 4x no comprimento efetivo da sequência, reduzindo substancialmente os custos de treinamento e inferência, e é a tecnologia-chave por trás do nosso suporte nativo à resolução 2K.
3. H3-Omni Transformer: Uma Arquitetura Construída para a Generalização de Tarefas
Em linha com a filosofia de design do H3 de que "a arquitetura deve servir à tarefa", generalidade e eficiência eram os únicos dois objetivos. Notavelmente, deixamos de lado a arquitetura do Hailuo-02, apesar das significativas vantagens arquiteturais que ela nos trouxe no passado, porque introduziria complexidade desnecessária para um modelo construído em torno da generalização de tarefas. Acreditamos que a generalização de tarefas é uma tendência irreversível, e os artifícios arquiteturais devem dar lugar à forma como o modelo é definido.
No H3, a introdução de contexto multimodal triplicou a variância no comprimento das sequências, e as cargas de trabalho computacionais para compreensão e geração ficaram visivelmente mais heterogêneas. Adotamos uma arquitetura de treinamento que separa as cargas de trabalho de compreensão e geração, otimizando a utilização de hardware para cada uma e, ao mesmo tempo, equilibrando a computação heterogênea por amostra com o balanceamento de carga entre amostras. De ponta a ponta, isso elevou o throughput de treinamento em quase 30%.
4. H3-In-context Regeneration
Para a saída 2K do H3, em vez de usar um módulo dedicado convencional de super-resolução, fazemos com que o modelo base H3 regenere sua própria saída de baixa resolução em contexto. Isso traz duas vantagens: primeiro, o processo de regeneração reutiliza ao máximo a capacidade generativa já incorporada ao modelo base H3; segundo, a abordagem em contexto permite que ele recorra novamente ao contexto multimodal original para produzir uma saída de alta resolução, recuperando detalhes que a super-resolução tradicional só pode "adivinhar" e muitas vezes não consegue restaurar, como textos pequenos e detalhes finos.
A In-Context Regeneration é, por si só, outra expressão da generalização de tarefas.
Em breve, compartilharemos o relatório técnico completo do H3. Aguardamos seu feedback.
Nossa Visão e o Que Vem a Seguir
Linguagem, imagens, vídeo e áudio são modalidades fundamentais da experiência humana. Elas estão profundamente interligadas e servem como nossas principais interfaces com o mundo. Juntas, formam contextos multimodais que podem comunicar uma vasta gama de informações com eficiência, e a capacidade de expressar e compartilhar informações é, por si só, uma forma de produtividade.
Para a compreensão e a geração multimodais, vemos a linguagem como um sistema computacional generalizável e escalável. É por isso que acreditamos que a inteligência multimodal deve ser profundamente fundamentada na linguagem.
O H3 ainda tem espaço para crescer, e estas são as nossas prioridades para as próximas versões:
- Uma compreensão multimodal forte é a base para a geração de alta qualidade, e há espaço significativo para melhorias. Na próxima geração da série H, planejamos integrar capacidades dos nossos modelos da série M.
- O tamanho atual do modelo H3 deixa espaço para melhorias em diversas capacidades. Escalar é um caminho claro, e acreditamos que uma generalização de tarefas mais forte nos permitirá desbloquear todo o seu potencial.
- O detalhe visual ainda pode ser melhorado em determinados cenários. Continuaremos avançando em direção a resoluções mais altas e maior fidelidade visual.
Inteligência com Todos.





