
开源全模态视频模型
MiniMax H3
MiniMax 开源全模态视频模型。用文字、图片、参考视频和参考音频,一次性生成原生 2K 并带同步立体声的视频——时长 4 至 15 秒。
- 原生 2K(2560×1440)输出
- 原生同步立体声
- 全模态输入:图片 + 视频 + 音频参考
- 首尾帧,最多 9 张参考图
- 对话式视频编辑
Online generator
MiniMax H3 在线生成器
已绑定 minimax-h3-video 线路。输入、时长、画幅与积分以实时生成器为准。
三种运镜方式
在文字、单图或多模态参考之间切换,控制镜头走向。

一个模型,全模态
图像、视频与音频的统一流程
MiniMax H3 在同一上下文里理解文字、图片、参考视频与参考音频——角色身份、动作节奏与声音氛围在一次生成中保持一致,无需跨工具拼合。
用 MiniMax H3 生成




Model comparison
MiniMax H3 对比 Hailuo 02
相比上一代的升级。
| 能力 | Hailuo 02 | MiniMax H3 |
|---|---|---|
| 分辨率 | 768p / 1080p | 原生 2K(2560×1440) |
| 时长 | 6s / 10s | 4–15 秒 |
| 原生音频 | 无 | 同步立体声 |
| 输入 | 文字 + 图片 | 文字 + 图片 + 视频 + 音频 |
| 视频编辑 | 无 | 对话式 |
| 权重 | 闭源 | 开放权重(分阶段) |
Hailuo 02 数据为 MiniMax 此前 768p/1080p 线路;MiniMax H3 能力依据 MiniMax 官方文档,核验于 2026-07-31。
如何生成
选择输入
填写提示词,加入首图或首尾帧,可选附加参考图、视频或音频。
设置时长与画幅
选择 4–15 秒时长与适配平台的画幅(21:9 至 9:16)。
生成与精修
运行模型,再用对话式编辑修改角色、声音或节奏,直到满意。
MiniMax H3 最适合什么
原生 2K、同步音频与多模态参考最能发挥价值的场景。

品牌与产品广告
原生 2K 桌面与主视觉镜头,带同步音效与旁白,适合 TVC 与新品广告。

角色表演
用参考图跨镜头锁定角色,并精准控制微表情与动作。

动作与追逐戏
多镜头动作场面,以运镜指令控制 24fps 电影节奏。

社媒短视频
9:16 竖版、最长 15 秒、带原生音频——适合 Reels、Shorts、TikTok。

电影预演
在昂贵拍摄前验证镜头衔接、运镜与场景氛围。

风格化内容
由参考与提示词驱动的动漫、插画、水墨与游戏 CG 风格。
为什么选择 MiniMax H3
模型内 2K,非放大
原生渲染完整 2K 像素密度,画面更干净。
一次出声
无需单独配音或拟音——音频与画面同步生成。
全模态上下文
文字、图片、视频与音频参考在一次生成中保持一致。
可指导的编辑
用指令修改角色、场景、声音与节奏。
首尾帧控制
精确定义运动轨迹与最终构图。
开放权重
MiniMax 开放权重路线,按地区分阶段开放。
MiniMax H3常见问题
MiniMax H3 是什么?
MiniMax H3 是 MiniMax 的开源全模态视频模型,可在一个统一流程中,用文字、图片、参考视频和参考音频生成原生 2K 并带有同步立体声的视频。
MiniMax H3 支持哪些输入?
支持文生视频、图生视频(含首尾帧)以及多模态参考——最多 9 张参考图、3 段参考视频和 3 段参考音频组合输入。
MiniMax H3 能生成音频吗?
可以。它能一次性生成与画面同步的原生立体声音频——对白、音效与环境声同步产出。
支持哪些分辨率、时长和画幅?
原生 2K(2560×1440)、4–15 秒成片,支持 21:9、16:9、4:3、1:1、3:4、9:16 画幅。
H3 和 Hailuo 02 有什么区别?
Hailuo 02 输出 768p/1080p 且无原生音频。H3 新增原生 2K、同步立体声、全模态参考输入(图+视频+音频)、单次生成内多镜头,以及对话式视频编辑。
生成后还能编辑视频吗?
可以。MiniMax H3 支持对话式编辑——你可以对已生成的片段下达指令,修改角色、物体、场景、声音或节奏。
MiniMax H3 是开源的吗?
MiniMax 已宣布 MiniMax H3 为开放权重模型。权重按地区分阶段开放,并受当地法规约束,具体状态以 MiniMax 官方渠道为准。
如何在 PixMind 上用 MiniMax H3 生成?
使用上方生成器——已绑定 minimax-h3-video 线路。填写提示词(或加入图片/参考),选择时长与画幅后运行,积分按实时生成器计费。
