Сегодня мы запускаем MiniMax H3 — универсальную мультимодальную модель генерации. H3 понимает единый контекст текста, изображений, видео и аудио и генерирует видео с нативным стереозвуком длительностью до 15 секунд в разрешении 2K.
Ранние тесты показывают, что H3 готова к коммерческому созданию контента в самых разных сценариях: она отлично следует инструкциям, точно воспроизводит текст и брендинг и поддерживает перенос движения V2V. Благодаря точной управляемой мультимодальной генерации и редактированию H3 создана для рекламы, брендинга, электронной коммерции, продуктового дизайна, UI/UX, игр и других задач.
Благодаря таким технологиям, как Contextual Omni Representation, H3-VAE, H3-Omni Transformer и In-Context Regeneration, H3 обеспечивает лидирующее на рынке соотношение цены и производительности. По умолчанию мы предлагаем разрешение 2K. При 2K цена за секунду у H3 составляет менее трети стоимости массовых моделей, а при 768p — менее половины цены за 720p массовых моделей.
Закрытые модели долгое время доминировали в генерации видео: они обновлялись медленнее, а их экосистема была менее открытой, чем в таких областях, как большие языковые модели. Чтобы поддержать сообщество open-source, ускорить совместимость с более широким спектром аппаратного обеспечения для ИИ и упростить пользователям создание собственных кастомизированных версий, мы планируем в ближайшие дни открыть веса модели в соответствии с действующим законодательством. Совместимость с аппаратным обеспечением была ключевым фактором с самых ранних этапов проектирования H3.
Ключевые особенности H3
1. Понимание мультимодального контекста
Реальная творческая работа требует объединения сложной информации из разных модальностей — изображений, аудио, видео и других источников. Например, промпт для кадра ниже звучит так: «Используй движение камеры Хичкока из Видео 1, заставь персонажа с Изображения 2 петь, а вокал должен соответствовать Аудио 3». Достаточно словами описать связь между контекстом и целевым видео. H3 сама справляется со сложным пониманием всех модальностей.
Мультимодальный ввод

Видео 1

Изображение 2

Аудио 3
Видео, сгенерированное H3

2. Видео в 2K

3. Нативный стереозвук

Сценарии использования H3
1. Вступительные титры фильма

2. Страница продукта

3. Анимированный постер

4. Реклама и e-commerce

Философия дизайна H3
Стирая границы между задачами: от специализированного к универсальному
Мы разработали два предыдущих поколения моделей: Hailuo 01 создала систему с нуля, а Hailuo 02 была сосредоточена на улучшении ключевых компонентов — эффективности архитектуры, качества данных и масштабирования.
При проектировании H3 мы осознали ограничения предыдущих генеративных моделей в части границ между задачами: генерация изображений обычно делилась на отдельные экспертные модели для T2I, редактирования, референса объекта, референса движения и референса стиля; голос, звуковые эффекты и музыка в генерации аудио в основном изучались как отдельные области; а генерация видео была дополнительно раздроблена на text-to-video, image-to-video, первый и последний кадр, референс объекта, референс движения, референс голоса, видеомонтаж и многое другое — с чёткими границами между изображением, видео и аудио.
Разрозненные задачи, возможности и модальности ограничивали творческую свободу на практике. А со стороны обучения — ограничивали способность модели к обобщению. Всё это указывает на огромный простор для изменений как в парадигме применения, так и в парадигме обучения. Поэтому первым принципом разработки H3 стало объединение и обобщение задач.
Исходя из этого, вот краткий обзор парадигмы предобучения H3:
1. Данные и задачи
Text-to-image
Text-to-video
*При совместной генерации аудио весь аудиовыход — нативный стерео
Native multi-shot modeling*
Text-to-audio
Никакого разделения на голос, звуковые эффекты и музыку — всё моделируется совместно
2. Обобщённый референс и редактирование
Image-to-image reference and editing
Image-to-video reference and editing
Audio-to-audio reference and editing
Audio-video-to-audio-video reference and editing
В нашем понимании «обобщённый референс и редактирование» означает:
- Полностью построен на реальных естественных данных, что обеспечивает высокую масштабируемость данных.
- Связи между референсом и редактированием выражаются на естественном языке, а не ограничены фиксированным набором задач; язык (или, в широком смысле, структура интеллекта) — это мост к обобщению.
3. Архитектура
Объединяйте разнообразные типы данных и задачи как можно раньше — правильное соотношение смешивания является ключевым.
4. Стратегия обучения
Объединяйте разнообразные типы данных и задачи как можно раньше в процессе обучения — правильное соотношение смешивания является ключевым.
Все эти решения направлены на одну цель: дать H3 широкие возможности понимания мультимодального контекста и генерации начиная с этапа предобучения.
Выше мы говорили о смене парадигмы обучения. Как меняется и сфера применения видеомоделей?
Мы видим, как создатели прямо описывают свой замысел на естественном языке, а не просто вводят простой визуальный промпт. По мере улучшения мультимодального понимания, следования инструкциям и выполнения сложных задач видеомодели смогут улавливать более полный творческий замысел, справляться с более сложными потребностями в контенте и постепенно переходить от «генерации клипа» к реальному участию во всём процессе производства контента.
Технические решения H3
Философия дизайна H3 проста — но разработка модели была далеко не простой. От Hailuo-01 к Hailuo-02 и H3 сложность инженерной реализации каждого следующего поколения выросла примерно в 10 раз по сравнению с предыдущим.
Краткий обзор ключевых технологий H3:
1. H3-Contextual Omni Representation
Одним из важнейших шагов при создании H3 стало усиление её способности к созданию подписей (captioning).
- Введение мультимодального контекста расширило охват «подписи»: теперь мы описываем не только целевое видео, но и связь между контекстом и целевым видео, а также связи между элементами внутри самого контекста.
- Нам нужно совместно описывать видео и аудио, и эта аудиовизуальная связь становится ещё сложнее на нескольких кадрах.
- По сути, это форма Contextual Omni Representation, в которой язык выступает обобщающим мостом и интерпретатором, объединяя «задачи» в открытую описательную форму. Это основа широкой способности H3 следовать инструкциям.
- Чтобы этого добиться, мы создали специализированные модели и конвейер понимания всех модальностей. Для большинства исходных материалов требуется около 100K токенов инференса, которые сжимаются в среднем до примерно 4K токенов.
2. H3-VAE: значительное повышение эффективности архитектуры
Серия H постоянно развивала технологию токенизатора. В H3 мы полностью переработали предыдущий токенизатор, добившись всестороннего улучшения качества реконструкции и обучаемости, что дало H3 конкурентное преимущество в эффективности. Высокая степень сжатия также даёт четырёхкратный выигрыш в эффективной длине последовательности, существенно снижая затраты на обучение и инференс, и является ключевой технологией поддержки нативного разрешения 2K.
3. H3-Omni Transformer: архитектура для обобщения задач
В соответствии с философией H3 о том, что «архитектура должна служить задаче», единственными целями были обобщаемость и эффективность. Примечательно, что мы отказались от архитектуры Hailuo-02, несмотря на значительные архитектурные преимущества, которые она нам когда-то давала, потому что она привнесла бы ненужную сложность в модель, построенную вокруг обобщения задач. Мы считаем, что обобщение задач — необратимый тренд, и архитектурные ухищрения должны уступать место тому, как определяется модель.
В H3 введение мультимодального контекста утроило дисперсию длины последовательностей, а вычислительные нагрузки для понимания и генерации стали значительно более неоднородными. Мы приняли обучающую архитектуру, разделяющую нагрузки понимания и генерации, точнее настраивая использование оборудования для каждой из них, одновременно балансируя неоднородные вычисления на семпл и равномерную загрузку между семплами. В целом это повысило пропускную способность обучения почти на 30%.
4. H3-In-context Regeneration
Для вывода 2K мы вместо обычного выделенного модуля супер-разрешения заставляем базовую модель H3 регенерировать собственный низкоразрешающий вывод внутри контекста. Это даёт два преимущества: во-первых, процесс регенерации максимально использует генеративные возможности, уже заложенные в базовую модель H3; во-вторых, подход in-context позволяет ей снова обращаться к исходному мультимодальному контексту для получения высокоразрешающего вывода, восстанавливая детали, которые традиционное супер-разрешение может лишь «угадывать» и часто не в состоянии восстановить, — например, мелкий текст и тонкие детали.
In-Context Regeneration сама по себе — ещё одно проявление обобщения задач.
Скоро мы опубликуем полный технический отчёт по H3. Будем рады вашей обратной связи.
Наше видение и дальнейшие планы
Язык, изображения, видео и аудио — фундаментальные модальности человеческого опыта. Они глубоко взаимосвязаны и служат нашими основными интерфейсами с миром. Вместе они образуют мультимодальные контексты, способные эффективно передавать огромный объём информации, а способность выражать и делиться информацией сама по себе является формой производительности.
Для мультимодального понимания и генерации мы рассматриваем язык как обобщаемую, масштабируемую вычислительную систему. Именно поэтому мы считаем, что мультимодальный интеллект должен быть глубоко основан на языке.
У H3 ещё есть потенциал для роста, и вот наши приоритеты для будущих версий:
- Сильное мультимодальное понимание — основа высококачественной генерации, и здесь есть значительный простор для улучшений. В следующем поколении серии H мы планируем интегрировать возможности наших моделей серии M.
- Текущий размер модели H3 оставляет пространство для улучшения ряда возможностей. Масштабирование — очевидный путь вперёд, и мы уверены, что более сильное обобщение задач позволит полностью раскрыть её потенциал.
- Визуальная детализация в некоторых сценариях всё ещё может быть улучшена. Мы продолжим стремиться к более высоким разрешениям и большей визуальной точности.
Интеллект для всех.





