创作者可以直接利用的优势
- 多种参考被理解为同一上下文: H3 会理解文本、角色图、动作片段、运镜示例、声音之间的关系,而不是把它们当成彼此孤立的工具模式。
- 生成与编辑由同一模型完成: 同一套多模态机制既支持新镜头、首尾帧转场和参考迁移,也支持对已有视频做定向修改。
- 开放权重带来更多部署选择: FL2VA 与 Ref2VA 基础权重可在受支持的本地框架中运行,MiniMax 同时提供托管的 Context-IR 与 2K 再生成服务。
MiniMax H3 是一款通用多模态视频模型,可同时理解文本、图片、视频和音频参考,生成带原生立体声的短视频。在 Ottermind 中,你可以把创作简报、源素材、生成版本和修改决定放在同一条工作流里。
MiniMax 于 2026 年 7 月 31 日发布 MiniMax H3。它把文本、图片、视频和音频统一为视频生成与编辑的上下文。官方系统支持 4–15 秒、24 FPS 和 32 kHz 立体声音频;Hailuo 当前产品界面提供 5–15 秒时长。H3-Base 生成 768p 视频,托管的 H3-Regenerate-2K 环节则完成 2K 输出。在 Ottermind Studio 中,每项参考素材和生成版本都能持续关联同一份创作简报。
当一个镜头同时依赖角色图、动作参考、运镜示例、声音或待修改的原视频时,MiniMax H3 最能发挥价值。更稳妥的做法是给每份参考指定一个明确用途,先生成聚焦的短镜头,再在 Ottermind Studio 中对照简报筛选结果。
组合已确认的产品图、品牌构图、动作示例和声音方向,探索广告与电商场景,同时不丢失原始创作要求。
从图片继承人物外观,从视频借用动作节奏,再从音频参考声音特征,并明确各输入之间的关系。
替换人物、物体、场景、光线、台词或特效,同时要求模型保留原片中已经合格的部分。
早期讨论主要关注 H3 将开放权重、混合媒体参考、原生声音和构图能力结合在一起。反复出现的实战建议是:每份参考只承担一个任务,镜头保持聚焦,并在定稿前逐项检查对白、文字、手部、物体关系和连续性。
创作者不再把 H3 只当作文本生成视频工具,而是用它组合角色、动作、运镜、风格和声音证据来搭建镜头。
聚焦的产品场景、动态图形、片头和单一动作短片,通常比包含复杂物理或多事件的长场景更可靠。
本地工作流提供权重访问和社区优化空间,但显存需求、推理速度、量化方案和环境兼容性仍是高频讨论。
在 Ottermind Studio 中集中保存镜头目标、脚本、产品素材、角色图片、动作片段、音频参考和交付规格。
选择可用的 MiniMax H3 模型,逐项指定参考作用,再定义动作、运镜、声音、时长、画幅和分辨率。
检查参考还原、动作、对白、文字和连续性,保留最佳版本,只修改薄弱部分,并在 Studio 中保留完整决策记录。
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的通用多模态视频生成与编辑模型。它能同时理解文本、图片、视频和音频,并生成带原生立体声的短视频。
不是。H3 是 MiniMax 视频模型序列中独立命名的新模型;Hailuo 2.3 是更早的另一款模型,而 Hailuo AI 也是目前可使用 MiniMax H3 的消费级产品入口。
H3 支持纯文本、首帧或尾帧引导、首尾帧生成和全能参考模式。官方文档列出最多 9 张图片、3 段视频和 3 段音频,混合输入最多 12 个文件;音频不能作为唯一参考。
MiniMax 系统文档给出的范围是 4–15 秒、24 FPS;Hailuo 当前产品页显示 5–15 秒,因此可选时长取决于具体使用入口和工作流。
可以。H3 会同步生成视频和 32 kHz 立体声音频,包括对白、音效、环境声和音乐。发布前仍需检查听感以及台词与脚本是否一致。
可以,但要通过官方完整工作流。H3-Base 先输出 768p,托管的 H3-Regenerate-2K 再使用基础结果和原始上下文生成 2K 版本;Hailuo 产品中的分辨率选项可能采用不同标注。
MiniMax 于 2026 年 8 月 3 日开放了 H3-Base FL2VA 与 Ref2VA 权重,采用 MiniMax H3 Community License。托管的 H3-Context-IR 预处理系统与 H3-Regenerate-2K 模块不在首批开放权重范围内。
把 Ottermind 作为 H3 生成入口之外的协作工作区:整理提示词和源文件,生成可比较的版本,对照简报审片,并把修改记录与选定结果留在一起,为下一个镜头继续创作。
把简报、参考素材、提示词、生成版本和修改决定集中到一条连贯的创作工作流中。