創作者可以直接利用的優勢
- 多種參考被理解為同一脈絡: H3 會理解文字、角色圖片、動作片段、運鏡範例、聲音之間的關係,而不是把它們當成彼此獨立的工具模式。
- 生成與編輯由同一模型完成: 同一套多模態機制既支援新鏡頭、首尾幀轉場和參考遷移,也支援對現有影片做定向修改。
- 開放權重帶來更多部署選擇: FL2VA 與 Ref2VA 基礎權重可在支援的本機框架中執行,MiniMax 同時提供託管的 Context-IR 與 2K 再生成服務。
MiniMax H3 是一款通用多模態影片模型,可同時理解文字、圖片、影片和音訊參考,生成帶有原生立體聲的短影片。在 Ottermind 中,你可以把創作簡報、來源素材、生成版本和修改決定放在同一套工作流程裡。
MiniMax 於 2026 年 7 月 31 日發布 MiniMax H3。它把文字、圖片、影片和音訊整合為影片生成與編輯的共同脈絡。官方系統支援 4–15 秒、24 FPS 和 32 kHz 立體聲音訊;Hailuo 目前的產品介面提供 5–15 秒片長。H3-Base 生成 768p 影片,託管的 H3-Regenerate-2K 流程則完成 2K 輸出。在 Ottermind Studio 中,每項參考素材和生成版本都能持續連結同一份創作簡報。
當一個鏡頭同時依賴角色圖片、動作參考、運鏡示例、聲音或待修改的原影片時,MiniMax H3 最能發揮價值。更穩妥的做法是給每份參考指定一個明確用途,先生成聚焦的短鏡頭,再在 Ottermind Studio 中對照簡報篩選結果。
組合已確認的產品圖、品牌構圖、動作示例和聲音方向,探索廣告與電商場景,同時不丟失原始創作要求。
從圖片繼承人物外觀,從影片借用動作節奏,再從音訊參考聲音特徵,並明確各輸入之間的關係。
替換人物、物體、場景、光線、臺詞或特效,同時要求模型保留原片中已經合格的部分。
早期討論主要關注 H3 將開放權重、混合媒體參考、原生聲音和構圖能力結合在一起。反覆出現的實戰建議是:每份參考只承擔一個任務,鏡頭保持聚焦,並在定稿前逐項檢查對白、文字、手部、物體關係和連續性。
創作者不再把 H3 只當作文字生成影片工具,而是用它組合角色、動作、運鏡、風格和聲音依據來建立鏡頭。
聚焦的產品場景、動態圖形、片頭和單一動作短片,通常比包含複雜物理或多事件的長場景更可靠。
本機工作流程提供權重存取和社群最佳化空間,但顯示記憶體需求、推論速度、量化方案和環境相容性仍是常見討論。
在 Ottermind Studio 中集中保存鏡頭目標、腳本、產品素材、角色圖片、動作片段、音訊參考和交付規格。
選擇可用的 MiniMax H3 模型,逐項指定參考作用,再定義動作、運鏡、聲音、片長、畫面比例和解析度。
檢查參考還原、動作、對白、文字和連續性,保留最佳版本,只修改薄弱部分,並在 Studio 中保留完整決策記錄。
MiniMax H3 是 MiniMax 於 2026 年 7 月 31 日發布的通用多模態影片生成與編輯模型。它能同時理解文字、圖片、影片和音訊,並生成帶有原生立體聲的短影片。
不是。H3 是 MiniMax 影片模型序列中獨立命名的新模型;Hailuo 2.3 是更早的另一款模型,而 Hailuo AI 也是目前可使用 MiniMax H3 的消費級產品入口。
H3 支援純文字、首幀或尾幀引導、首尾幀生成和全能參考模式。官方文件列出最多 9 張圖片、3 段影片和 3 段音訊,混合輸入最多 12 個檔案;音訊不能作為唯一參考。
MiniMax 系統文件給出的範圍是 4–15 秒、24 FPS;Hailuo 目前的產品頁顯示 5–15 秒,因此可選片長取決於實際使用入口和工作流程。
可以。H3 會同步生成影片和 32 kHz 立體聲音訊,包括對白、音效、環境聲和音樂。發布前仍需檢查聽感以及台詞與腳本是否一致。
可以,但要通過官方完整工作流程。H3-Base 先輸出 768p,託管的 H3-Regenerate-2K 再使用基礎結果和原始脈絡生成 2K 版本;Hailuo 產品中的解析度選項可能採用不同標註。
MiniMax 於 2026 年 8 月 3 日開放了 H3-Base FL2VA 與 Ref2VA 權重,採用 MiniMax H3 Community License。託管的 H3-Context-IR 預處理系統與 H3-Regenerate-2K 模組不在首批開放權重範圍內。
把 Ottermind 作為 H3 生成入口之外的協作工作區:整理提示詞和來源檔案,生成可比較的版本,對照簡報審片,並把修改記錄與選定結果留在一起,為下一個鏡頭繼續創作。
把簡報、參考素材、提示詞、生成版本和修改決定集中到一條連貫的創作工作流程中。