🔥Minimax H3 已上线!开通年费会员立享 45% 折扣立即开通
Pixmind

MiniMax H3:开源权重 2K 视频模型的完整指南

文章目录

MiniMax H3:开源权重 2K 视频模型的完整指南

MiniMax H3 是 MiniMax 推出的开源权重通用多模态视频模型。它能在同一遍推理中生成 2560×1440 分辨率的原生 2K 视频并同步产出立体声音频,最多接受 12 路多模态参考(文本、图像、视频和音频),并提供开放权重供自托管使用。MiniMax 将其定价设在同类前沿视频模型的三分之一左右:在主流网关(OpenRouter、Vercel AI Gateway、EvoLink)上,768p 输出每秒 $0.09,原生 2K 输出每秒 $0.13。

本文是一篇支柱级长文,整合了经过核验的规格表、定价、API 接入路径、提示词实战指南和已知限制,帮助创作者判断 H3 在真实工作流中的位置。如需直接使用生成器,请走 PixMind MiniMax H3 路由MiniMax H3 在线生成器

核心要点

  • 它可以生成 5 至 15 秒的片段,输出 24 FPS 的原生 2K(2560×1440)画质,并在同一遍推理中产出与画面同步的原生立体声。
  • 单次生成支持文本输入,外加最多 9 张参考图、3 段参考视频和 3 段参考音频,合计 12 路参考。
  • 根据 OpenRouter、Vercel AI Gateway 和 EvoLink 的费率表,第三方网关上的定价约为 2K 每秒 $0.13、768p 每秒 $0.09,约为同类前沿模型的三分之一。
  • 权重以开源形式提供自托管使用,按地区分阶段开放。
  • Reddit 独立测评者的共识认为,H3 的画质约达到 Seedance 级别 98% 的水准,时序一致性强,画面内文字渲染准确。

PixMind AI 视频中心

MiniMax H3 是什么?

MiniMax H3 是 MiniMax(一家成立于北京的 AI 实验室)推出的基于 Transformer 架构的开源权重通用多模态视频模型。它是该公司前沿视频模型的第三代产品。

该模型的决定性特征是「统一」。H3 不再依赖独立的文生视频、图生视频、音频和编辑模型,而是在同一个上下文窗口中接收文本、图像、参考视频和参考音频,先生成画面,再在同一遍推理中产出同步的立体声。对白、音效与环境音都和画面同步生成,而非后期配音。(MiniMax 官方博客,《MiniMax H3》MiniMax 平台文档

MiniMax H3 实战演示:真实生成案例

在看规格表之前,先看看模型实际能产出什么。下面的视频是一段完整的 MiniMax H3 演示,将一条提示词走完从输入到成片的全流程,这是最快了解 H3 的原生 2K 与多模态参考在实际中能带来什么的方式。

完整教程演示 MiniMax H3 的工作流,从参考素材设置、提示词撰写,到带同步音频的 2K 成片。

MiniMax 将 H3 以开源权重形式发布,支持原生 2K、流水线内立体声音频以及 12 路多模态参考输入,这正是上述教程端到端演示的能力组合。

核心技术规格

H3 的规格表围绕原生画质构建,而非后期放大输出。下表关键数据来自 MiniMax 官方博客与 API 文档,并经 OpenRouter、Vercel AI Gateway 和 EvoLink 发布的模型卡片交叉核对。

规格 参数
原生分辨率 2560×1440(2K)
帧率 24 FPS
片段时长 5 至 15 秒
音频 原生同步立体声,流水线内生成
图像参考 最多 9 张
视频参考 最多 3 段
音频参考 最多 3 段
单次生成参考总数 与文本组合最多 12 路
画面比例 21:9、16:9、4:3、1:1、3:4、9:16
权重 开源权重,按地区分阶段发布
编辑 对生成的片段进行基于指令的对话式修改

原生 2K 输出是它最关键的差异点。许多标榜「2K」或「4K」的视频模型其实是事后放大的,这种做法能锐化边缘,但无法凭空合成模型本来就没有生成的细节。H3 在模型内部以 2560×1440 直接渲染,因此皮肤细纹、发丝、布料和细小文字在成片尺寸下仍能保留,无需额外的放大步骤。(MiniMax 官方博客

开源权重发布与自托管

H3 以开源权重模型的形式发布,这与 Google(Veo)的闭源前沿产品线以及大多数闭源消费级视频工具不同。开放权重意味着:只要机构拥有充足的 GPU 资源,就可以在自己的基础设施上托管模型、对其进行审计和微调,并免除按秒计费的 API 费用。

发布是分阶段进行的。MiniMax 已确认会开放权重,但会按地区逐步推出,并受当地法规和许可条件约束。任何计划自托管的团队都应将 MiniMax 官方渠道视为其所在司法管辖区当前可用性的唯一可信来源,而不要依赖第三方镜像。(MiniMax 官方博客

实操上的结论是:需要保证延迟、满足数据驻留要求,或追求长期成本可预测的团队,可以在权重开放到自己所在地区后规划自托管;而当下就需要产出视频的团队,则应使用托管的 API,或通过 PixMind、OpenRouter、Vercel AI Gateway、EvoLink 这类网关接入。

多模态输入:12 路参考系统的工作原理

H3 的输入系统是写提示词之前最值得搞清楚的部分。单次生成可以组合以下内容:

  • 一条带镜头指示的文本提示词。
  • 最多 9 张参考图(可用于首帧、尾帧、人物身份、产品、服装或风格参考)。
  • 最多 3 段参考视频(用于动作语言、节奏或表演)。
  • 最多 3 段参考音频(用于音色、音乐感觉或声音设计节奏)。

也就是说,在同一个上下文里,共有 12 路参考再加一条文本提示词。(MiniMax 平台文档

每一份参考都应该只承担一项职责。多模态模型最常见的失败模式是输入相互冲突的参考:比如两张身份不同的人物图,或一段与首尾帧冲突的动作参考视频。请把 12 个参考槽位各自当作单一用途的控制项:一张图锁定人物身份,另一张锁定服装,再一张锁定产品几何形状;一段视频参考负责动作节奏;一段音频参考负责整体节拍。

这里也正好适合使用 H3 的对话式编辑能力。片段生成后,你可以通过指令修改人物、物体、场景、声音或节奏,而不必从零重建整个镜头。

原生 2K 输出与同步立体声音频

原生 2K 画面加流水线内立体声音频的组合,是相比上一代 MiniMax 模型考虑 H3 的最大理由。

画面层面,原生 2K 意味着模型直接渲染 2560×1440 像素的真实细节。发丝、皮肤纹理、包装上的小字、屏幕录制类镜头中的细小 UI 元素,在成片尺寸下依然清晰。24 FPS 的帧率更契合电影和高端商业制作,而不是仅适配社媒分发的 30 FPS。

电影级特写静帧,展现 MiniMax H3 在女性面部上的原生 2K 细节,配以温暖黄金时刻光线与胶片颗粒

音频层面,H3 在生成画面的同一遍推理中产出对白、音效和环境音,并将它们与画面帧锁定。这省去了无音频闭源流水线所必需的后期配音和拟音环节。画面中的人物开口说话时,唇形动作与人声同步生成;玻璃杯撞到桌面时,撞击声与画面接触瞬间一并生成。(MiniMax 官方博客

需要注意的是:任何生成出来的音频,尤其是对白,在发布前都需要人工核对措辞、发音、节奏和瑕疵。

跨服务商的 MiniMax H3 定价

H3 最强的竞争优势之一就是价格。在主流第三方网关上,费率表都集中在原生 2K 输出每秒 $0.13、768p 输出每秒 $0.09 附近。下表的金额就是按这些每秒单价直接计算得出。

输出 单价 5 秒片段 10 秒片段 15 秒片段
原生 2K(2560×1440) 约 $0.13/秒 约 $0.65 约 $1.30 约 $1.95
768p 约 $0.09/秒 约 $0.45 约 $0.90 约 $1.35

上述费率公布在 OpenRouter、Vercel AI Gateway 和 EvoLink 上,并与 MiniMax 自家平台上的定价页面保持一致。(OpenRouterVercel AI GatewayEvoLinkMiniMax 平台

MiniMax 将自己的费率定在同类前沿视频模型的三分之一左右。对于高产量的制作工作流(社媒投放、多变量广告创意、可视化预演),这种价差会被迅速放大。一家要渲染 1,000 条 15 秒 2K 片段的工作室,用 H3 的花费大约是 $1,950;如果走单价更高的前沿路由,相同产量下成本会显著更高。

MiniMax API 与接入路径

接入 H3 一共有四种实用方式,分别面向不同类型的用户。

1. PixMind 生成器(零代码)。 适合希望直接用现成 UI、不想写代码的创作者,是接入最快的路径。打开 PixMind MiniMax H3 生成器,上传参考素材,撰写提示词,选择时长和画面比例,即可渲染。MiniMax H3 在线生成器

2. MiniMax 平台 API(直连)。 想使用规范 API 接口的开发者,可以通过 platform.minimax.io 直接调用 MiniMax。这是新功能、参数支持和价格变动的最权威来源,但需要完成 MiniMax 账号注册(必要时进行 KYC 实名认证)以及相应的集成开发。(MiniMax 平台文档

3. 聚合网关(OpenRouter、Vercel AI Gateway、EvoLink)。 这些网关与其他模型族一道,在统一的计费和 SDK 接口下提供 H3。当你希望一次集成覆盖多个视频模型,或现有应用已经使用某个网关的协议时,它们是合适的选择。费率中可能包含少量网关加价。(OpenRouterVercel AI GatewayEvoLink

4. 自托管权重。 一旦你所在地区开放了权重,就可以在自己的 GPU 上运行 H3。这种方式不再按秒付费,但成本会转移到硬件、运维和推理基础设施上。它只适合有持续高产量或对数据驻留有严格要求的团队。

对大多数读者来说,合适的起点是零代码的 PixMind 生成器或某个网关集成。当你需要的参数是网关没有暴露的,再转向直连 MiniMax API;只有当产量大到能摊薄运营开销时,才考虑自托管。

H3 与上一代 MiniMax 及其他视频模型的对比

H3 相比上一代 MiniMax 是一次跨代升级,在价格上也是对其他前沿视频模型的有力替代。下方的对比以 MiniMax 官方对 H3 的能力说明、上一代 MiniMax 的公开资料,以及前文提到的费率表为依据。

MiniMax H3 vs 上一代 MiniMax

上一代 MiniMax 输出 768p 或 1080p 视频,不支持原生音频,输入侧只支持文本加图像。H3 在此基础上加入了原生 2K、同步立体声音频、完整的多模态参考(图像加视频加音频)、生成中的对话式编辑,以及开放权重。对于已经在用官方产品的用户来说,H3 在规格上是严格的超集,一旦在你常用的接入路由上可用,就是理所当然的默认选择。

MiniMax H3 vs Seedance 2.5 与 Veo 3.1

Reddit 独立测评者的共识认为,H3 的画质约达到 Seedance 级别 98% 的水准,时序一致性尤其强,画面内文字渲染几乎完美。剩下的差距主要体现在电影级写实度的最顶端,以及复杂的物理交互场景。

权衡在价格上。H3 的 2K 费率表大约是同类前沿模型的三分之一,这使它成为高产量工作的默认选择,因为那一点点画质差距并不值得多花 3 倍的钱。但对于以「极致写实」为全部目标的旗舰投放级镜头,Seedance 2.5 或 Veo 3.1 可能仍是更好的选择。

MiniMax H3 vs Kling 3.0 Turbo 与 PixVerse V6

Kling 3.0 Turbo 与 PixVerse V6 主打速度和社媒格式的覆盖广度,而非原生 2K 的保真度。对于电影级和投放级制作,H3 是更强的选择;而在短社媒片段的快速迭代上,尤其是在不需要原生音频时,Kling Turbo 和 PixVerse V6 依然有用武之地。

对比所有已接入的视频模型

Reddit 与社区共识

从 Reddit 上 r/LocalLLaMA、r/aivideo 及相关社区的讨论中提炼出的 H3 早期独立测评共识,可以归纳为三点:

  1. 画质接近前沿水准。 测评者将 H3 的画质定位在 Seedance 级别约 98% 的水平,差距主要集中在照片级写实度和复杂物理交互的最顶端。
  2. 时序一致性是真正的强项。 人物、物体和场景在多帧之间的连贯性,明显优于上一代 MiniMax。
  3. 文字渲染基本被解决。 画面内文字一直是视频模型长期翻车的痛点,在 H3 的大部分输出中都能干净渲染。

Reddit 上的测评并不能替代你用自己测试提示词做的基准测试,但可以作为有用的方向性参考。请把「Seedance 画质 98%」这个数字看作社区里的简称,而不是精确测量值。

MiniMax H3 提示词实战手册

H3 更偏爱「导演型」提示词,而非「描述型」。请把每一次生成都当作「一个镜头、一个任务」,并把 12 个参考槽位当作精确的控制项。

先锁定不变量

在写正文之前,先决定哪些元素在整个片段中不能变。把它们在提示词里显式声明:人物身份、产品几何形状、配色、服装、标签位置、构图。用于编码这些不变量的参考,每份都只承担一项职责。

一个主体动作,一次镜头运动

当画面创意由一个主体动作加一次镜头运动承担时,短片段的表达会更清晰。在 5 秒的片段里硬塞三种变换,会逼着模型把每一个都赶完,这正是画面闪烁的头号元凶。

把声音写进镜头

由于 H3 在同一遍推理中生成音频,请在描述产生声音的动作时一并描写声音。明确写出对白(加引号)、环境音的质感,以及刻意留白的位置。不要让音频变成隐含项。

四个提示词模板

  • 电影级产品片: "[产品] 在 [表面] 上的高级主视觉镜头。镜头缓慢 [运动方式]。光线:[氛围]。保持精确的比例、材质和标签位置。音频:细腻的 [音色质感],无音乐,无旁白。以干净的主视觉镜头收尾。"
  • 人物对白场景: "[景别] 中,[人物] 在 [场景]。他说:'[简短台词]'。自然房间底噪、[环境音]、真实唇形同步。镜头:[运动方式]。光线:[氛围]。"
  • 首尾帧过渡: "从给定的首帧自然过渡到给定的尾帧。主体 [动作]。镜头沿 [路径] 以 [节奏] 跟随。全程保持身份、服装和环境一致。"
  • 多模态参考锁定: "用参考图 1 锁定人物身份,参考图 2 锁定服装,参考视频 1 提供动作节奏。参考音频 1 设定音色和节拍。主体在 [场景] 中执行 [动作]。"

MiniMax H3 提示词模板与起步示例库

MiniMax H3 的最佳使用场景

H3 非常适合那些原生 2K 保真度、同步音频或多模态参考控制,比追求最低每秒成本更重要的工作流。

电影级风光静帧,描绘黄昏时分的未来霓虹都市,展现 MiniMax H3 的输出画质与景深

  • 电影级广告与产品主视觉片。 原生 2K 加立体声意味着,单次 H3 生成就能交付近乎成片的镜头,无需额外的音频后期环节。
  • 对白驱动的场景。 同一遍推理中生成唇形、人声和环境音的组合,让 H3 非常适合短篇叙事和人物驱动的作品。
  • 以参考素材驱动的投放系列一致性。 12 路参考预算让你可以把同一个人物、同一件产品、同一套服装和同一种动作语言,贯穿到一组投放镜头里。
  • 高产量多变量创意。 以大约前沿定价三分之一的水平,H3 是为某个创意方向产出大量 A/B 测试变体和平台定制版本的合适工具。
  • 可视化预演(previz)流水线。 开放权重加上低 API 成本,让 H3 可行于需要大量产出预演、又不想被单条预算压垮的工作室。

限制与注意事项

一份可信的指南也要指出 H3 做得不好的地方。

  • 音频仍需人工核对。 生成的对白、人声和音效,在发布前都需要人工核对措辞、发音、节奏和瑕疵。
  • 复杂物理交互可能漂移。 手部、接触、快速旋转、遮挡以及复杂物体之间的交互,对整个视频模型类别而言仍是难点,不止 H3。
  • 身份与品牌细节需要清权。 人脸、Logo、产品几何形状、画面内文字以及授权角色,都需要最终的版权和准确性审核。
  • 权重的可用性按地区分阶段开放。 开放权重在分阶段发布中;在确定自托管方案前,请通过 MiniMax 官方渠道确认当前状态。
  • 能力与定价会变化。 模型卡片和费率表变动很快。在正式产出时,请以你常用路由上的实时生成器为准,核对生效中的参数与价格。

MiniMax H3 常见问题

MiniMax H3 是开源权重吗?

是的。MiniMax 已宣布 H3 为开源权重模型。权重按地区分阶段发布,并受当地法规约束,因此在规划自托管部署之前,请通过 MiniMax 官方渠道确认你所在司法管辖区的当前可用性。(MiniMax 官方博客

MiniMax H3 多少钱?

在主流第三方网关(OpenRouter、Vercel AI Gateway、EvoLink)以及 MiniMax 平台上,H3 的定价约为:原生 2K 输出每秒 $0.13,768p 输出每秒 $0.09。一条 15 秒的 2K 片段大约 $1.95;一条 15 秒的 768p 片段大约 $1.35。MiniMax 将其定位在同类前沿视频模型定价的三分之一左右。(OpenRouterVercel AI GatewayEvoLinkMiniMax 平台

H3 支持哪些分辨率、帧率和时长?

H3 输出原生 2K 视频,分辨率 2560×1440,帧率 24 FPS,片段长度 5 至 15 秒。它支持 21:9、16:9、4:3、1:1、3:4 和 9:16 六种画面比例。(MiniMax 官方博客MiniMax 平台文档

MiniMax H3 能生成音频吗?

可以。H3 在生成画面的同一遍推理中产出原生同步立体声音频(对白、音效和环境音),因此无需单独的配音或拟音环节。不过,对白在发布前仍需核对措辞、节奏和瑕疵。

MiniMax H3 支持哪些输入?

单次生成接受一条文本提示词,外加最多 9 张参考图、3 段参考视频和 3 段参考音频,合计 12 路参考。首尾帧控制通过图像槽位实现。(MiniMax 平台文档

我可以自托管 MiniMax H3 吗?

可以,前提是你所在地区已开放权重。自托管可以免除按秒计费的 API 费用,但需要 GPU 算力、推理基础设施以及运维投入。对大多数团队来说,更合适的起点是托管的 API,或像 PixMind 这样的网关。

H3 与 Seedance 2.5 和 Veo 3.1 相比如何?

Reddit 独立测评者的共识认为,H3 的画质约达到 Seedance 级别 98% 的水准,时序一致性强,画面内文字渲染准确。剩下的差距主要体现在照片级写实度的顶端和复杂物理交互上。H3 的优势在价格:其 2K 费率表大约是同类前沿模型的三分之一,因此是高产量工作的默认选择。

我可以在哪里生成 MiniMax H3 视频?

最快的零代码路径是 PixMind MiniMax H3 生成器。开发者也可以通过 platform.minimax.io 直连 MiniMax 平台 API,或通过 OpenRouter、Vercel AI Gateway、EvoLink 集成。打开 H3 生成器

MiniMax H3 应该怎么写提示词?

把每一次生成都当作「一个镜头、一个主体动作、一次镜头运动」。先锁定不变量(身份、产品、服装、配色、构图),给 12 个参考槽位中的每一个都只分配一项任务,并把声音(对白、环境音、留白)写进提示词,紧跟在产生声音的动作旁边。具体模板参见上方的提示词实战手册。

H3 生成的片段可以商用吗?

它们适用于大多数商业项目,但人脸、品牌 Logo、产品几何形状、画面内文字以及授权角色都需要最终的版权和准确性审核。请确保你对输入模型的真实人物或第三方参考素材拥有相应权利。

结论:H3 在你的技术栈中处于什么位置

当你需要在能扛住高产量的价位上,获得原生 2K 保真度、同步音频或多模态参考控制时,MiniMax H3 是默认选择。它并不是唯一值得用的模型:Seedance 2.5 和 Veo 3.1 仍在电影级写实度的最顶端占优,而像 Kling 3.0 Turbo 这样更快的路由在社媒快速迭代上依然有用。但对于市场上分布最广的中间段,那里质量要求高、预算又是真实的,H3 凭借开放权重、12 路多模态输入、原生 2K、流水线内立体声音频,以及大约前沿三分之一的价格,成为务实的默认选择。

下一步就是用自己的提示词跑一跑。打开 PixMind MiniMax H3 生成器,上传一两张能锁定身份和产品的参考素材,写一个镜头、一次镜头运动,并把输出和你目前使用的模型对比一下。MiniMax H3 生成器 浏览所有已接入的 AI 视频模型


本指南中的规格、定价与能力信息已于 2026-08-01 对照 MiniMax 官方博客MiniMax 平台文档OpenRouterVercel AI GatewayEvoLink 完成核验。模型卡片与费率表变动很快;在正式产出前,请务必以你常用路由上的实时数值为准。

继续浏览中,生成器即将加载...