오늘 우리는 범용 멀티모달 생성 모델인 MiniMax H3를 출시합니다. H3는 텍스트, 이미지, 영상, 오디오를 아우르는 통합 컨텍스트를 이해하며, 네이티브 스테레오 사운드를 갖춘 최대 15초, 2K 해상도의 영상을 생성할 수 있습니다.
초기 테스트 결과, H3는 다양한 사용 사례에서 상업용 콘텐츠 제작에 바로 활용할 수 있는 수준으로, 지시 수행, 정확한 텍스트 및 브랜드 렌더링, V2V 모션 트랜스퍼에서 뛰어난 성능을 보여줍니다. 정밀하고 제어 가능한 멀티모달 생성 및 편집 기능을 갖춘 H3는 광고, 브랜딩, 이커머스, 제품 디자인, UI/UX, 게임 등 다양한 분야에 최적화되어 있습니다.
Contextual Omni Representation, H3-VAE, H3-Omni Transformer, In-Context Regeneration 등의 기술로 구동되는 H3는 업계 최고 수준의 가성비를 제공합니다. 기본적으로 2K 해상도를 지원하며, 2K 기준 초당 가격은 주류 모델의 3분의 1 미만이고, 768p 기준으로는 주류 모델의 720p 가격의 절반 미만입니다.
폐쇄형 모델은 오랫동안 영상 생성 분야를 지배해 왔으며, 대규모 언어 모델 같은 분야에 비해 반복 주기가 느리고 생태계의 개방성도 낮았습니다. 오픈소스 커뮤니티를 지원하고, 더 다양한 AI 하드웨어와의 호환성을 높이며, 사용자가 자신만의 맞춤형 버전을 더 쉽게 구축할 수 있도록 하기 위해, 우리는 관련 법규를 준수하는 범위 내에서 조만간 모델 가중치를 공개할 계획입니다. 하드웨어 호환성은 H3 설계의 초기 단계부터 핵심 고려 사항이었습니다.
H3 모델 주요 특징
1. 멀티모달 컨텍스트 이해
진정한 창작 작업은 이미지, 오디오, 영상 등 다양한 입력 소스를 활용해 여러 모달리티에 걸친 복잡한 정보를 융합해야 합니다. 예를 들어 아래 장면에 대한 프롬프트는 다음과 같습니다: "Video 1의 히치콕 카메라 무빙을 참고하고, Image 2의 캐릭터가 Audio 3의 보컬에 맞춰 노래하게 해줘." 컨텍스트와 대상 영상 사이의 관계를 말로 설명하기만 하면, H3가 복잡한 전 모달리티 이해를 스스로 처리합니다.
멀티모달 입력

Video 1

Image 2

Audio 3
H3 생성 영상

2. 2K 성능

3. 네이티브 스테레오 사운드

H3 활용 사례
1. 영화 오프닝 타이틀

2. 제품 웹사이트

3. 애니메이션 포스터

4. 광고 및 이커머스

H3의 디자인 철학
작업 간 경계 허물기: 전문 모델에서 범용 모델로
우리는 이전에 두 세대의 모델을 개발했습니다: Hailuo 01은 시스템을 처음부터 구축했고, Hailuo 02는 아키텍처 효율성, 데이터 품질, 스케일 같은 핵심 구성 요소 개선에 집중했습니다.
H3를 설계하면서 우리는 기존 생성 모델의 작업 경계에 따른 한계를 인식했습니다: 이미지 생성은 일반적으로 T2I, 편집, 피사체 참조, 모션 참조, 스타일 참조를 위한 별도의 전문 모델로 분리되어 있었고, 오디오 생성에서 음성, 음향 효과, 음악은 대부분 별개의 도메인으로 연구되었으며, 영상 생성은 텍스트-투-비디오, 이미지-투-비디오, 첫 프레임 및 마지막 프레임, 피사체 참조, 모션 참조, 음성 참조, 영상 편집 등으로 더욱 세분화되어 이미지, 영상, 오디오 간에도 명확한 경계가 존재했습니다.
이렇게 분리된 작업, 기능, 모달리티는 실제 창작의 자유를 제약했습니다. 또한 학습 측면에서는 모델의 일반화 능력을 제한했습니다. 이 두 가지 모두 애플리케이션 패러다임과 학습 패러다임 모두에 큰 변화의 여지가 있음을 시사합니다. 그래서 H3 개발을 이끈 첫 번째 원칙은 작업 전반에 걸친 통합과 일반화였습니다.
이를 바탕으로 H3 사전학습 패러다임을 간단히 소개하면 다음과 같습니다:
1. 데이터 및 작업
Text-to-image
Text-to-video
*오디오를 함께 생성하는 경우, 모든 오디오 출력은 네이티브 스테레오입니다
Native multi-shot modeling*
Text-to-audio
음성, 음향 효과, 음악의 구분 없이 모두 함께 모델링됩니다
2. 일반화된 참조 및 편집
Image-to-image 참조 및 편집
Image-to-video 참조 및 편집
Audio-to-audio 참조 및 편집
Audio-video-to-audio-video 참조 및 편집
우리 설계에서 "일반화된 참조 및 편집"이 의미하는 바는 다음과 같습니다:
- 실제 자연 데이터로만 구축되어 강력한 데이터 확장성을 제공합니다.
- 참조 및 편집 관계가 고정된 작업 집합에 국한되지 않고 자연어로 표현됩니다. 언어(또는 넓게 보면 지능 구조)가 일반화로 가는 브리지 역할을 합니다.
3. 아키텍처
다양한 데이터 유형과 작업을 가능한 한 이른 시점에 융합하는 것 — 올바른 혼합 비율이 핵심입니다.
4. 학습 전략
학습 과정에서 다양한 데이터 유형과 작업을 가능한 한 이른 시점에 융합하는 것 — 올바른 혼합 비율이 핵심입니다.
이러한 모든 선택은 같은 목표를 향합니다: H3가 사전학습 단계부터 광범위한 멀티모달 컨텍스트 이해 및 생성 능력을 갖추도록 하는 것입니다.
앞서 우리는 학습 패러다임의 변화에 대해 이야기했습니다. 그렇다면 영상 모델의 애플리케이션 환경도 어떻게 변화하고 있을까요?
크리에이터들이 단순한 시각적 프롬프트만 입력하는 대신, 자연어로 자신의 의도를 직접 설명하는 모습을 볼 수 있습니다. 멀티모달 이해, 지시 수행, 복잡한 작업 실행 능력이 계속 향상됨에 따라 영상 모델은 더 완전한 창작 의도를 파악하고, 더 복잡한 콘텐츠 요구를 처리하며, "클립 하나 생성하기"에서 점차 콘텐츠 제작 프로세스 전체에 실질적으로 참여하는 방향으로 나아갈 수 있을 것입니다.
H3의 기술적 선택
H3의 디자인 철학은 단순합니다 — 하지만 이를 구축하는 과정은 결코 단순하지 않았습니다. Hailuo-01에서 Hailuo-02, 그리고 H3에 이르기까지 각 세대의 엔지니어링 복잡도는 지난 세대 대비 약 10배 증가했습니다.
H3의 핵심 기술 몇 가지를 간단히 살펴보겠습니다:
1. H3-Contextual Omni Representation
H3를 엔지니어링하면서 우리가 가장 중요하게 한 일 중 하나는 캡셔닝 역량을 강화한 것입니다.
- 멀티모달 컨텍스트의 도입으로 "캡션"이 다뤄야 할 범위가 더욱 넓어졌습니다. 더 이상 대상 영상만 설명하는 것이 아니라, 컨텍스트와 대상 영상 간의 관계, 나아가 컨텍스트 내 요소들 간의 관계까지 설명해야 합니다.
- 영상과 오디오를 함께 설명해야 하며, 이러한 시청각 관계는 여러 장면에 걸쳐 더욱 복잡해집니다.
- 이는 근본적으로 Contextual Omni Representation의 한 형태로, 언어가 일반화 가능한 브리지이자 해석자 역할을 하며 "작업"을 개방적이고 서술적인 형태로 통합합니다. 이것이 H3의 광범위한 지시 수행 능력의 근원입니다.
- 이를 위해 우리는 전용 모델과 전 모달리티 이해 파이프라인을 구축했습니다. 대부분의 소스 자료는 약 100K 토큰의 추론이 필요하며, 평균 약 4K 토큰으로 증류됩니다.
2. H3-VAE: 아키텍처 효율성의 대폭 향상
H 시리즈는 토크나이저 기술을 지속적으로 발전시켜 왔습니다. H3에서는 이전 토크나이저를 완전히 재설계하여 재구성 품질과 학습 가능성에서 전반적인 개선을 달성했고, H3가 효율성 측면에서 경쟁 우위를 확보하게 했습니다. 높은 압축률은 또한 유효 시퀀스 길이에서 4배의 이득을 제공하여 학습 및 추론 비용을 크게 절감하며, 네이티브 2K 해상도 지원의 핵심 기술이기도 합니다.
3. H3-Omni Transformer: 작업 일반화를 위해 설계된 아키텍처
"아키텍처는 작업에 봉사해야 한다"는 H3의 디자인 철학에 따라, 일반성과 효율성이라는 두 가지 목표만을 추구했습니다. 특히 우리는 Hailuo-02 아키텍처가 한때 제공했던 상당한 아키텍처적 이점에도 불구하고 이를 과감히 제쳐두었습니다. 작업 일반화를 중심으로 구축된 모델에는 불필요한 복잡성을 도입할 수 있기 때문입니다. 우리는 작업 일반화가 되돌릴 수 없는 추세라고 믿으며, 아키텍처적 기법은 모델이 정의되는 방식에 자리를 내줘야 합니다.
H3에서 멀티모달 컨텍스트의 도입은 시퀀스 길이의 분산을 3배로 늘렸고, 이해와 생성의 컴퓨트 워크로드는 훨씬 더 이질적으로 변했습니다. 우리는 이해와 생성 워크로드를 분리하는 학습 아키텍처를 채택하여 각각에 맞춰 하드웨어 활용을 미세 조정하는 동시에, 샘플별 이질적 컴퓨트와 샘플 간 부하 분산을 함께 균형 있게 조정했습니다. 종단 간(end-to-end)으로 학습 처리량이 약 30% 향상되었습니다.
4. H3-In-context Regeneration
H3의 2K 출력을 위해 기존의 전용 초해상도 모듈 대신, H3 베이스 모델이 자체 저해상도 출력을 in-context 방식으로 재생성하도록 했습니다. 여기에는 두 가지 장점이 있습니다: 첫째, 재생성 과정이 H3 베이스 모델에 이미 내장된 생성 능력을 최대한 재활용합니다. 둘째, in-context 접근 방식은 원래의 멀티모달 컨텍스트를 다시 활용해 고해상도 출력을 생성하므로, 기존 초해상도 기술이 단지 "추측"만 할 수 있고 종종 복원하지 못하는 작은 텍스트나 미세한 디테일 같은 정보를 복구할 수 있습니다.
In-Context Regeneration은 그 자체로 작업 일반화의 또 다른 표현입니다.
곧 전체 H3 기술 보고서를 공유할 예정입니다. 여러분의 피드백을 기다리겠습니다.
우리의 비전과 향후 계획
언어, 이미지, 영상, 오디오는 인간 경험의 근본적인 모달리티입니다. 이들은 깊이 상호 연결되어 있으며 우리와 세상 사이의 핵심 인터페이스 역할을 합니다. 함께 방대한 범위의 정보를 효율적으로 전달할 수 있는 멀티모달 컨텍스트를 형성하며, 정보를 표현하고 공유하는 능력은 그 자체로 생산성의 한 형태입니다.
멀티모달 이해와 생성에 있어 우리는 언어를 일반화 가능하고 확장 가능한 컴퓨테이셔널 시스템으로 봅니다. 그렇기 때문에 멀티모달 지능은 언어에 깊이 기반을 두어야 한다고 믿습니다.
H3는 여전히 성장할 여지가 있으며, 향후 버전을 위한 우리의 우선순위는 다음과 같습니다:
- 강력한 멀티모달 이해는 고품질 생성의 기반이며, 개선의 여지가 상당합니다. H 시리즈의 다음 세대에서는 M-시리즈 모델의 역량을 통합할 계획입니다.
- H3의 현재 모델 규모는 여러 기능에서 개선의 여지를 남겨둡니다. 스케일링은 명확한 발전 경로이며, 더 강력한 작업 일반화를 통해 그 잠재력을 완전히 발휘할 수 있다고 믿습니다.
- 특정 시나리오에서 시각적 디테일은 여전히 개선될 수 있습니다. 우리는 더 높은 해상도와 더 뛰어난 시각적 충실도를 계속 추구할 것입니다.
Intelligence with Everyone.





