今天,我們正式推出 MiniMax H3——一款通用多模態生成模型。H3 能理解橫跨文字、圖片、影片與音訊的統一上下文,並生成帶有原生立體聲的影片,最高支援 15 秒、2K 解析度。
早期測試顯示,H3 已可勝任各類商業內容創作場景,在指令遵循、精準的文字與品牌渲染,以及 V2V 動作遷移方面表現出色。憑藉精準、可控的多模態生成與編輯能力,H3 專為廣告、品牌、電子商務、產品設計、UI/UX、遊戲等場景打造。
H3 搭載 Contextual Omni Representation、H3-VAE、H3-Omni Transformer 與 In-Context Regeneration 等技術,提供業界領先的性價比。我們預設提供 2K 解析度。在 2K 下,H3 的每秒價格不到主流模型的三分之一;在 768p 下,價格也不到主流模型 720p 的一半。
長期以來,閉源模型一直主導著影片生成領域,與大型語言模型等領域相比,其迭代速度較慢,生態系統也不夠開放。為了支持開源社群、加速與更多 AI 硬體的相容性,並讓使用者更容易打造自己的客製化版本,我們計劃在未來幾天內開放模型權重,並在適用法律法規允許的範圍內進行。從 H3 設計的最初階段起,硬體相容性就是我們的核心考量。
H3 模型亮點
1. 多模態上下文理解
真正的創意工作需要跨越不同模態融合複雜資訊,將圖片、音訊、影片等更多內容作為輸入來源。例如,下方鏡頭的提示詞是:「參考影片 1 中的希區考克式運鏡,讓圖片 2 中的角色唱歌,歌聲要與音訊 3 對應。」你只需要用文字描述上下文與目標影片之間的關係,H3 就會自行完成複雜的全模態理解。
多模態輸入

影片 1

圖片 2

音訊 3
H3 生成的影片

2. 2K 畫質表現

3. 原生立體聲

H3 應用場景
1. 電影開場片頭

2. 產品網站

3. 動態海報

4. 廣告與電子商務

H3 的設計哲學
打破任務邊界:從專用走向通用
我們先後開發了兩代模型:Hailuo 01 從零打造了整套系統,Hailuo 02 則專注於改進架構效率、資料品質與規模等核心環節。
在設計 H3 時,我們意識到先前生成模型在任務邊界上的限制:影像生成通常被拆分成多個獨立的專家模型,分別處理 T2I、編輯、主體參考、動作參考與風格參考;音訊生成中的語音、音效與音樂,大多被當作獨立領域來研究;而影片生成更是被進一步細分為文字轉影片、圖片轉影片、首尾幀、主體參考、動作參考、語音參考、影片編輯等,圖片、影片與音訊之間也存在著明確的界線。
這些彼此孤立的任務、能力與模態,在實踐中限制了創作自由,也限制了模型在訓練端的泛化能力。這兩點都指向了巨大的變革空間,無論是應用範式還是訓練範式。因此,H3 開發的首要原則,就是跨任務的統一與泛化。
基於此,以下是 H3 預訓練範式的簡要概覽:
1. 資料與任務
文字轉圖片
文字轉影片
*搭配聯合生成的音訊,所有音訊輸出均為原生立體聲
原生多鏡頭建模*
文字轉音訊
語音、音效與音樂不分離——全部聯合建模
2. 通用化參考與編輯
圖片對圖片的參考與編輯
圖片對影片的參考與編輯
音訊對音訊的參考與編輯
音訊影片對音訊影片的參考與編輯
在我們的設計中,「通用化參考與編輯」意味著:
- 完全基於真實、自然的資料建構,具有強大的資料擴展性。
- 參考與編輯關係透過自然語言表達,而非局限於固定任務集;語言(或廣義上的智能結構)是通往泛化的橋樑。
3. 架構
盡可能早地融合不同資料類型與任務——正確的混合比例是關鍵。
4. 訓練策略
在訓練中盡可能早地融合不同資料類型與任務——正確的混合比例是關鍵。
這些選擇都指向同一個目標:讓 H3 從預訓練階段就具備廣泛的多模態上下文理解與生成能力。
前面我們談到了訓練範式的轉變,那麼影片模型的應用版圖又在發生什麼變化?
我們看到創作者開始直接用自然語言描述創作意圖,而不只是輸入簡單的視覺提示詞。隨著多模態理解、指令遵循與複雜任務執行能力持續提升,影片模型將能掌握更完整的創作意圖、應對更複雜的內容需求,並逐步從「生成一段片段」走向真正參與整個內容製作流程。
H3 的技術選擇
H3 的設計哲學很簡單——但打造它的過程絕不簡單。從 Hailuo-01 到 Hailuo-02 再到 H3,每一代的工程複雜度都比上一代成長約 10 倍。
以下快速瀏覽 H3 的幾項核心技術:
1. H3-Contextual Omni Representation
在打造 H3 的過程中,我們做的最重要的事情之一,就是強化它的描述(captioning)能力。
- 多模態上下文的引入,進一步擴大了「描述」需要涵蓋的範圍——我們不再只是描述目標影片,還要描述上下文與目標影片之間的關係,甚至是上下文內部元素之間的關係。
- 我們需要同時描述影片與音訊,而這種視聽關係在多個鏡頭之間會變得更加複雜。
- 這本質上就是一種 Contextual Omni Representation,讓語言扮演可泛化的橋樑與詮釋者,將「任務」統一為開放、描述性的形式。這正是 H3 強大指令遵循能力的根源。
- 為了達成這個目標,我們建立了專門的模型與全模態理解管線。大多數素材需要約 100K token 的推論量,最終精煉為平均約 4K token。
2. H3-VAE:架構效率的重大提升
H 系列持續在 tokenizer 技術上推進。到了 H3,我們徹底翻新了先前的 tokenizer,在重建品質與可學習性上全面獲得提升,為 H3 帶來效率上的競爭優勢。其高壓縮率也讓有效序列長度提升 4 倍,大幅降低訓練與推論成本,同時也是我們原生支援 2K 解析度的關鍵技術。
3. H3-Omni Transformer:為任務泛化而生的架構
呼應 H3「架構應該服務於任務」的設計哲學,我們只追求兩個目標:通用性與效率。值得一提的是,我們放棄了 Hailuo-02 的架構,儘管它曾為我們帶來顯著的架構優勢,因為對於一個以任務泛化為核心的模型來說,它會引入不必要的複雜度。我們相信任務泛化是不可逆的趨勢,架構上的巧思應該讓位於模型本身的定義方式。
在 H3 中,多模態上下文的引入使序列長度的變異擴大了三倍,理解與生成的運算負載也變得更加異質。我們採用了一種將理解與生成運算分離的訓練架構,分別針對兩者調校硬體利用率,同時在樣本內的異質運算與跨樣本的負載平衡之間取得平衡。端到端來看,這讓訓練吞吐量提升了近 30%。
4. H3-In-context Regeneration
針對 H3 的 2K 輸出,我們沒有採用傳統的專用超解析度模組,而是讓 H3 基礎模型在上下文內重新生成自己的低解析度輸出。這帶來兩個優勢:第一,重新生成的過程能最大限度地重用 H3 基礎模型內建的生成能力;第二,上下文內的方式讓它可以再次利用原始的多模態上下文來產生高解析度輸出,還原傳統超解析度只能「猜測」、往往無法恢復的細節,例如小文字與精細紋理。
In-Context Regeneration 本身就是任務泛化的另一種表現。
我們很快會發布完整的 H3 技術報告。期待大家的回饋。
我們的願景與下一步
語言、圖片、影片與音訊,是人類經驗的基本模態。它們彼此深度連結,是我們與世界互動的主要介面。它們共同構成多模態上下文,能高效傳遞豐富的資訊,而表達與分享資訊的能力,本身就是一種生產力。
對於多模態理解與生成,我們將語言視為一個可泛化、可擴展的計算系統。這也是為什麼我們相信,多模態智能應該深深植根於語言。
H3 仍有成長空間,以下是我們未來版本的重點方向:
- 強大的多模態理解是高品質生成的基礎,而且還有很大的提升空間。在下一代 H 系列中,我們計劃整合 M 系列模型的能力。
- H3 目前的模型規模在多項能力上仍有改善空間。擴大規模是明確的方向,我們相信更強的任務泛化能力將能充分釋放其潛力。
- 在某些場景下,視覺細節仍可進一步提升。我們將持續朝更高解析度與更精緻的視覺保真度邁進。
智能,與每個人同在。





