MiniMax H3: открытая модель, стирающая границы между задачами и модальностями

@MiniMax_AI
АНГЛИЙСКИЙ21 час назад · 31 июл. 2026 г.
226K
2.1K
282
103
701

Суть

MiniMax H3 — это унифицированная мультимодальная модель, способная генерировать видео в разрешении 2K со встроенным стереоаудио. Она упрощает творческие рабочие процессы, позволяя использовать естественный язык для управления сложными кросс-модальными ссылками и редактированием.

Сегодня мы запускаем MiniMax H3 — универсальную мультимодальную модель генерации. H3 понимает единый контекст текста, изображений, видео и аудио и генерирует видео с нативным стереозвуком длительностью до 15 секунд в разрешении 2K.

Ранние тесты показывают, что H3 готова к коммерческому созданию контента в самых разных сценариях: она отлично следует инструкциям, точно воспроизводит текст и брендинг и поддерживает перенос движения V2V. Благодаря точной управляемой мультимодальной генерации и редактированию H3 создана для рекламы, брендинга, электронной коммерции, продуктового дизайна, UI/UX, игр и других задач.

Благодаря таким технологиям, как Contextual Omni Representation, H3-VAE, H3-Omni Transformer и In-Context Regeneration, H3 обеспечивает лидирующее на рынке соотношение цены и производительности. По умолчанию мы предлагаем разрешение 2K. При 2K цена за секунду у H3 составляет менее трети стоимости массовых моделей, а при 768p — менее половины цены за 720p массовых моделей.

Закрытые модели долгое время доминировали в генерации видео: они обновлялись медленнее, а их экосистема была менее открытой, чем в таких областях, как большие языковые модели. Чтобы поддержать сообщество open-source, ускорить совместимость с более широким спектром аппаратного обеспечения для ИИ и упростить пользователям создание собственных кастомизированных версий, мы планируем в ближайшие дни открыть веса модели в соответствии с действующим законодательством. Совместимость с аппаратным обеспечением была ключевым фактором с самых ранних этапов проектирования H3.

Ключевые особенности H3

1. Понимание мультимодального контекста

Реальная творческая работа требует объединения сложной информации из разных модальностей — изображений, аудио, видео и других источников. Например, промпт для кадра ниже звучит так: «Используй движение камеры Хичкока из Видео 1, заставь персонажа с Изображения 2 петь, а вокал должен соответствовать Аудио 3». Достаточно словами описать связь между контекстом и целевым видео. H3 сама справляется со сложным пониманием всех модальностей.

Мультимодальный ввод

MiniMax (official) - inline image

Видео 1

MiniMax (official) - inline image

Изображение 2

MiniMax (official) - inline image

Аудио 3

Видео, сгенерированное H3

MiniMax (official) - inline image

2. Видео в 2K

MiniMax (official) - inline image

3. Нативный стереозвук

MiniMax (official) - inline image

Сценарии использования H3

1. Вступительные титры фильма

MiniMax (official) - inline image

2. Страница продукта

MiniMax (official) - inline image

3. Анимированный постер

MiniMax (official) - inline image

4. Реклама и e-commerce

MiniMax (official) - inline image

Философия дизайна H3

Стирая границы между задачами: от специализированного к универсальному

Мы разработали два предыдущих поколения моделей: Hailuo 01 создала систему с нуля, а Hailuo 02 была сосредоточена на улучшении ключевых компонентов — эффективности архитектуры, качества данных и масштабирования.

При проектировании H3 мы осознали ограничения предыдущих генеративных моделей в части границ между задачами: генерация изображений обычно делилась на отдельные экспертные модели для T2I, редактирования, референса объекта, референса движения и референса стиля; голос, звуковые эффекты и музыка в генерации аудио в основном изучались как отдельные области; а генерация видео была дополнительно раздроблена на text-to-video, image-to-video, первый и последний кадр, референс объекта, референс движения, референс голоса, видеомонтаж и многое другое — с чёткими границами между изображением, видео и аудио.

Разрозненные задачи, возможности и модальности ограничивали творческую свободу на практике. А со стороны обучения — ограничивали способность модели к обобщению. Всё это указывает на огромный простор для изменений как в парадигме применения, так и в парадигме обучения. Поэтому первым принципом разработки H3 стало объединение и обобщение задач.

Исходя из этого, вот краткий обзор парадигмы предобучения H3:

1. Данные и задачи

Text-to-image

Text-to-video

*При совместной генерации аудио весь аудиовыход — нативный стерео

Native multi-shot modeling*

Text-to-audio

Никакого разделения на голос, звуковые эффекты и музыку — всё моделируется совместно

2. Обобщённый референс и редактирование

Image-to-image reference and editing

Image-to-video reference and editing

Audio-to-audio reference and editing

Audio-video-to-audio-video reference and editing

В нашем понимании «обобщённый референс и редактирование» означает:

  • Полностью построен на реальных естественных данных, что обеспечивает высокую масштабируемость данных.
  • Связи между референсом и редактированием выражаются на естественном языке, а не ограничены фиксированным набором задач; язык (или, в широком смысле, структура интеллекта) — это мост к обобщению.

3. Архитектура

Объединяйте разнообразные типы данных и задачи как можно раньше — правильное соотношение смешивания является ключевым.

4. Стратегия обучения

Объединяйте разнообразные типы данных и задачи как можно раньше в процессе обучения — правильное соотношение смешивания является ключевым.

Все эти решения направлены на одну цель: дать H3 широкие возможности понимания мультимодального контекста и генерации начиная с этапа предобучения.

Выше мы говорили о смене парадигмы обучения. Как меняется и сфера применения видеомоделей?

Мы видим, как создатели прямо описывают свой замысел на естественном языке, а не просто вводят простой визуальный промпт. По мере улучшения мультимодального понимания, следования инструкциям и выполнения сложных задач видеомодели смогут улавливать более полный творческий замысел, справляться с более сложными потребностями в контенте и постепенно переходить от «генерации клипа» к реальному участию во всём процессе производства контента.

Технические решения H3

Философия дизайна H3 проста — но разработка модели была далеко не простой. От Hailuo-01 к Hailuo-02 и H3 сложность инженерной реализации каждого следующего поколения выросла примерно в 10 раз по сравнению с предыдущим.

Краткий обзор ключевых технологий H3:

1. H3-Contextual Omni Representation

Одним из важнейших шагов при создании H3 стало усиление её способности к созданию подписей (captioning).

  • Введение мультимодального контекста расширило охват «подписи»: теперь мы описываем не только целевое видео, но и связь между контекстом и целевым видео, а также связи между элементами внутри самого контекста.
  • Нам нужно совместно описывать видео и аудио, и эта аудиовизуальная связь становится ещё сложнее на нескольких кадрах.
  • По сути, это форма Contextual Omni Representation, в которой язык выступает обобщающим мостом и интерпретатором, объединяя «задачи» в открытую описательную форму. Это основа широкой способности H3 следовать инструкциям.
  • Чтобы этого добиться, мы создали специализированные модели и конвейер понимания всех модальностей. Для большинства исходных материалов требуется около 100K токенов инференса, которые сжимаются в среднем до примерно 4K токенов.

2. H3-VAE: значительное повышение эффективности архитектуры

Серия H постоянно развивала технологию токенизатора. В H3 мы полностью переработали предыдущий токенизатор, добившись всестороннего улучшения качества реконструкции и обучаемости, что дало H3 конкурентное преимущество в эффективности. Высокая степень сжатия также даёт четырёхкратный выигрыш в эффективной длине последовательности, существенно снижая затраты на обучение и инференс, и является ключевой технологией поддержки нативного разрешения 2K.

3. H3-Omni Transformer: архитектура для обобщения задач

В соответствии с философией H3 о том, что «архитектура должна служить задаче», единственными целями были обобщаемость и эффективность. Примечательно, что мы отказались от архитектуры Hailuo-02, несмотря на значительные архитектурные преимущества, которые она нам когда-то давала, потому что она привнесла бы ненужную сложность в модель, построенную вокруг обобщения задач. Мы считаем, что обобщение задач — необратимый тренд, и архитектурные ухищрения должны уступать место тому, как определяется модель.

В H3 введение мультимодального контекста утроило дисперсию длины последовательностей, а вычислительные нагрузки для понимания и генерации стали значительно более неоднородными. Мы приняли обучающую архитектуру, разделяющую нагрузки понимания и генерации, точнее настраивая использование оборудования для каждой из них, одновременно балансируя неоднородные вычисления на семпл и равномерную загрузку между семплами. В целом это повысило пропускную способность обучения почти на 30%.

4. H3-In-context Regeneration

Для вывода 2K мы вместо обычного выделенного модуля супер-разрешения заставляем базовую модель H3 регенерировать собственный низкоразрешающий вывод внутри контекста. Это даёт два преимущества: во-первых, процесс регенерации максимально использует генеративные возможности, уже заложенные в базовую модель H3; во-вторых, подход in-context позволяет ей снова обращаться к исходному мультимодальному контексту для получения высокоразрешающего вывода, восстанавливая детали, которые традиционное супер-разрешение может лишь «угадывать» и часто не в состоянии восстановить, — например, мелкий текст и тонкие детали.

In-Context Regeneration сама по себе — ещё одно проявление обобщения задач.

Скоро мы опубликуем полный технический отчёт по H3. Будем рады вашей обратной связи.

Наше видение и дальнейшие планы

Язык, изображения, видео и аудио — фундаментальные модальности человеческого опыта. Они глубоко взаимосвязаны и служат нашими основными интерфейсами с миром. Вместе они образуют мультимодальные контексты, способные эффективно передавать огромный объём информации, а способность выражать и делиться информацией сама по себе является формой производительности.

Для мультимодального понимания и генерации мы рассматриваем язык как обобщаемую, масштабируемую вычислительную систему. Именно поэтому мы считаем, что мультимодальный интеллект должен быть глубоко основан на языке.

У H3 ещё есть потенциал для роста, и вот наши приоритеты для будущих версий:

  • Сильное мультимодальное понимание — основа высококачественной генерации, и здесь есть значительный простор для улучшений. В следующем поколении серии H мы планируем интегрировать возможности наших моделей серии M.
  • Текущий размер модели H3 оставляет пространство для улучшения ряда возможностей. Масштабирование — очевидный путь вперёд, и мы уверены, что более сильное обобщение задач позволит полностью раскрыть её потенциал.
  • Визуальная детализация в некоторых сценариях всё ещё может быть улучшена. Мы продолжим стремиться к более высоким разрешениям и большей визуальной точности.

Интеллект для всех.

Переделать в YouMind

Превратите одну вирусную статью в полноценный рабочий процесс создания контента

Собирайте источники, расшифровывайте паттерны, создавайте активы, пишите черновики и публикуйте контент из одного рабочего пространства ИИ.

Исследовать YouMind
Для авторов

Превратите ваш Markdown в аккуратную статью для 𝕏

Когда вы публикуете длинные тексты, изображения, таблицы и блоки кода, форматирование в 𝕏 становится мучением. YouMind превращает полный черновик в Markdown в чистую статью, готовую к публикации в 𝕏.

Попробовать Markdown для 𝕏

Другие паттерны для анализа

Недавние виральные статьи

Смотреть другие виральные статьи