MiniMax H3 爆款视频:如何用 MiniMax H3 制作让人停滑的 AI 短视频
2026 年爆款短视频的配方是这样的:一秒节奏突变、一个清晰的核心创意,以及一段在观众滑走之前就到位的配乐。作为生成器背后的模型,MiniMax H3 正是为此类格式而生:它能输出原生 2K 画质、同步的立体声音频,并在单次异步任务中接受最多 12 个多模态参考素材。这意味着创作者可以让角色的面部、动作语言和声音在一整周的 15 秒发布中保持一致,全程无需切换生成流程。
本指南把这些能力转化为可直接照做的 Reels、TikTok、Shorts 以及 15 秒故事片段工作流。你将获得:六步爆款循环、七套结构化提示词模板、前 3 秒就生效的钩子公式、竖版格式规范、MiniMax Audio 搭配方案、一拆六的内容复用计划,以及那些在 AI 视频发布前悄悄毁掉它们的常见误区。如需直接使用生成器,请打开 PixMind MiniMax H3 视频工具。MiniMax H3 在线生成器
核心要点
- MiniMax H3(模型 ID
minimax/hailuo-3)输出原生 2K 视频并带同步立体声音频,每次任务最多接受 12 个多模态参考素材,这正是短视频创作者保持角色、动作和声音一致性所需的规格。- 爆款工作流共六步:钩子、脚本、锁定参考素材、生成、MiniMax Audio 配音、加字幕并发布,然后循环。
- 竖版 9:16 是短视频的主流格式;MiniMax H3 还支持 1:1、3:4、4:3、16:9 和 21:9,便于跨平台复用。
- 采用按量计费:2K 画质每秒 0.13 美元,768P 画质每秒 0.09 美元,因此一条 15 秒片段在 2K 下约 1.95 美元,768P 下约 1.35 美元。
- 钩子决定前 3 秒的胜负;具体的钩子公式胜过通用开场,而模型管线内的音频能力正是实现紧凑音画钩子的关键。
为什么 MiniMax H3 天生适合短视频爆款
短视频平台青睐三件事,而老一代视频模型无法在一次生成中同时满足。其一是交付尺寸下的细节表现,因为竖屏手机会放大画面的模糊感。其二是内置音频,因为静音会扼杀完播率。其三是参考素材控制,因为一个爆款角色必须在系列的每一条片段中都看起来是同一个人。
MiniMax H3 同时解决了这三件事。它能渲染原生 2K 视频,在生成画面的同一次任务中生成同步的立体声音频,并接受每次生成最多 12 个多模态参考素材,其中可包含最多 9 张图片、3 段视频和 3 段音频,与文字提示词一起输入。
原生 2K 的差别在 Reels 和 TikTok 上比在长视频 YouTube 上更为关键。竖屏手机是高密度的像素网格,平台压缩会对画质偏软的源素材进行惩罚。在压缩前就已存在的 2K 渲染,比 1080p 拉升给编码器留下了更多可保留的细节,这也是 MiniMax H3 片段在平台二次编码后仍能在最终信息流中保留细节的原因。请保持在 2K,而不是营销文案中流传的未经验证的「4K 60fps」说法;已核实的规格说明止步于原生 2K。
原生音频是第二个力量倍增器。老一代视频模型输出静音画面,迫使创作者额外进行配音和拟音步骤。MiniMax H3 在生成画面的同一次任务中生成对白、环境声和音效,因此一条 15 秒片段从生成器出来时就带着完成的配乐,可以直接发布,无需后期绕路。
第三个杠杆是多模态参考。创作者可以提供角色参考图、服装参考图、用于动作的短视频参考素材,以及用于声音的音频素材,模型会在一次异步任务中把它们组合起来。这种组合能力正是系列作品得以成立的基础:一周 7 条发布里都是同一个角色、同一套服装、同一个声音。那些讲解「如何在约 17 分钟内做出一条爆款故事视频」的社区教程经常获得几十万播放量,TikTok 创作者也经常逐拍拆解自己的 MiniMax H3 示例生成过程,这是一个强烈信号:这种形式有真实需求,而不只是新鲜感。
MiniMax H3 实战:真实爆款视频案例
在工作流之前,先看看这条管线究竟能产出什么。下方视频来自一位创作者真实、端到端的 MiniMax H3 短视频制作过程,他在约 17 分钟内把一条提示词变成爆款片段,并将生成的画面与 MiniMax Audio 搭配。
MiniMax H3 还在 Artificial Analysis 视频编辑榜单上排名第一,并在文生视频和图生视频两项均位列前三,这是独立信号,表明这种形式有真实的上升势能,而非一时新鲜。
MiniMax H3 在 Artificial Analysis 视频编辑榜单排名第一
MiniMax H3 六步爆款工作流
一条爆款短视频绝不是单条提示词的产物,它是一个可重复循环的产物。下面这六步是真正能把一条片段从创意推进到可直接发信息流的成品的关键。
第一步:先锁定钩子
先写钩子,再写其他任何东西。决定你使用的是后面会详细展开的四种经过验证的短视频钩子中的哪一种:冷开场、节奏突变、强势断言,还是视觉反差。钩子决定了片段的第一秒,而第一秒决定了剩下的 14 秒还会不会被看。
一个有效的钩子有三个属性。它是视觉的,而不只是口述的;它抛出一个观众想得到答案的问题;它能用单个镜头表达。如果这个钩子只靠黑屏上的文字来呈现,那它就不是 MiniMax H3 钩子,而是一张幻灯片。
第二步:把 15 秒写成节拍
一条 15 秒片段在留出节奏空间后,大约能容纳四个节拍:钩子(0-3 秒)、铺垫(3-6 秒)、高潮(6-12 秒)和点睛(12-15 秒)。每个节拍写成一行,而不是一段。每个节拍在提示词中会变成一条镜头指令。
不要试图把 60 秒的故事塞进 15 秒。模型和观众都会被赶得喘不过气。如果你要讲的故事超过 15 秒,那就是一个系列,而不是一条片段,复用章节会讲如何切分。
第三步:用参考素材锁定角色和身份
这是大多数创作者会跳过的一步。在写任何文字提示词之前,先决定片段中什么绝不能变:角色面部、服装、产品、配色、环境。然后为每个不变项分配一个参考素材。MiniMax H3 的多模态预算允许你按职责拆分参考素材:一张图片定身份、一张定服装、一张定产品、一段视频定动作、一段音频定声音。
第四步:生成,然后按变量逐个迭代
提交任务,让异步任务跑起来。MiniMax H3 采用异步模式:提交、轮询、再下载。第一版渲染出来后,每次迭代只改一个变量,绝不要一次改五个。如果动作不对,就改动作描述;如果光照不对,就改光照;如果身份漂移了,就修参考素材,而不是改提示词文字。
这里也是选择 768P 做迭代、把 2K 留给最终成片的合适时机。768P 为每秒 0.09 美元,迭代成本比 2K 低约三分之一,而在手机屏幕上画质差距足够小,因此可以在为主版本付费之前先验证构图、动作和钩子。
第五步:搭配 MiniMax Audio 制作配音和对口型
如果片段需要人声,可以同时使用 MiniMax Audio 和 MiniMax H3 来制作旁白和对口型的对话。先生成语音台词,再把这段音频作为参考素材回传,让画面中的口型与台词吻合。这就是把一条静音渲染变成会说话的角色片段的循环,全程无需手动拟音。
用作背景配乐时,请保持音频参考素材通用且短小。模型会基于参考素材进行创作,一段 15 秒的参考素材就足以设定节奏或情绪,又不会盖过对白。
将 MiniMax H3 视频与 MiniMax Audio 搭配使用
第六步:加字幕、定格式,为循环发布
为导出的片段加上字幕,锁定竖版 9:16 宽高比,并按平台推荐的码率导出。字幕比大多数创作者想象的更重要:短视频很大一部分观看发生在观众点开声音之前的静音自动播放时段,而屏幕文字正是支撑钩子走过这一窗口的关键。发布之后,关注前 30 分钟的留存数据,找出观众滑走的位置,然后在下一条片段里把这个节拍往前挪。
这六步就是循环。每条片段跑一遍,每个系列跑两遍。
写出让人停滑的 MiniMax H3 提示词
MiniMax H3 的提示词是一份镜头清单,而不是一段描述。模型奖励去导演它的创作者,惩罚只是叙述它的创作者。一条让人停滑的提示词会把镜头拆成六个具名部分:景别、运镜、光照、动作、主体和环境。每个部分占一行。
六段式提示词骨架
- 景别: 取景和镜头语言(近景、中景、远景、俯拍、过肩镜头)。
- 运镜: 运动方式(锁定、缓慢推近、轨道、手持、环绕)。
- 光照: 情绪和方向(温暖窗光、硬质霓虹、柔光主光、黄金时刻)。
- 动作: 产生视觉创意的主体动作(一个主要动作)。
- 主体: 画面中的人或物,尽可能用一张参考图固定。
- 环境: 用一句话描述的环境,而不是一段话。
按这个顺序写每个部分。顺序很重要,因为当模型不得不在相互冲突的指令之间取舍时,会更看重靠前的内容。每条提示词都要以一行明确的「不得更改」结尾,列出那些不变项,因为正是这一行让身份和服装在系列的多版渲染中保持一致。
七套可直接使用的提示词模板
这些是针对短视频平台上表现最好的几种格式的入门模板。把方括号字段替换为你自己的变量,并保留结尾的不变项行。

1. 冷开场产品揭晓(9:16,15 秒)
「竖版 9:16。[产品]放置在[表面]上的近景,硬质顶光,深沉阴影。运镜:3 秒内缓慢推近,然后锁定保持。动作:液体在产品周围[流淌或飞溅]。主体:[产品描述、几何形状、标签]。环境:极简纹理背景,采用[配色]。音频:轻柔的[纹理]声,无音乐,无人声旁白。以干净的产品主视觉画面结束。不得更改:产品几何形状、标签位置、配色。」
2. 说话人故事片段(9:16,15 秒)
「竖版 9:16。[角色]看向镜头的中近景,柔和窗光主光,中性墙面。运镜:锁定,带有细微的手持呼吸感。动作:角色说一句台词,然后做出一个小反应。主体:[角色描述,以参考图 1 为锚定]。环境:简约室内,浅景深。音频:对白『[短台词]』,自然房间底噪,按照参考音频 1 进行真实对口型。不得更改:角色身份、服装。」
3. 节奏突变变身(9:16,8 秒)
「竖版 9:16。[场景 A]的远景,然后在第 2 秒硬切到[场景 B]。运镜:两个状态都锁定。光照:从[冷色平面光]切换到[暖色戏剧光]。动作:一个物体在剪辑点[变身、消失或复制]。主体:[主体描述]。环境:单一环境,两个状态之间重新布景。音频:场景 A 下低沉持续音,剪辑点尖锐撞击声,场景 B 下环境铺底声。不得更改:主体身份、环境几何形状。」
4. 首尾帧故事(9:16,10 秒)
「竖版 9:16。从提供的首帧自然过渡到提供的尾帧。运镜:沿单条[路径]以[节奏]推进。光照:[一致的情绪]。动作:主体在过渡中完成[一个主要动作]。主体:[以参考图 1 为锚定的角色]。环境:[环境]。音频:环境[纹理]声,无对白。不得更改:身份、服装、配色、构图。」
5. 电影感空镜循环(9:16,6 秒)
「竖版 9:16。[主体]在[环境]中的缓慢跟踪镜头。运镜:恒速轨道,无剪辑。光照:黄金时刻逆光。动作:主体保持在画面中,带有细微的[自然动作]。主体:[主体描述]。环境:[环境、天气、一天中的时间]。音频:环境自然声,无音乐。以与开头一致的帧结束,以实现无缝循环。不得更改:主体、环境、光照。」
6. 视觉反差钩子(9:16,12 秒)
「竖版 9:16。[寻常物体]的近景,然后在第 4 秒揭示[意外的背景]。运镜:锁定在主体上,缓慢推进揭示。光照:[中性渐变为戏剧化]。动作:主体[做寻常动作],揭示[意外事件]。主体:[主体描述]。环境:单一环境,揭示时重新布置。音频:环境[纹理]声在揭示时升华为尖锐提示音。不得更改:主体身份、环境几何形状。」
7. 多模态角色系列镜头(9:16,15 秒)
「竖版 9:16。[角色]在[地点]的中景,对镜头说一句台词。运镜:缓慢环绕。光照:[情绪]。动作:角色说话,然后从画面左侧离开。使用参考图 1 固定角色身份,参考图 2 固定服装,参考视频 1 固定节奏与肢体语言。参考音频 1 设定声音和台词演绎。主体:[角色描述]。环境:[地点]。不得更改:身份、服装、声音。」
前 3 秒:让人停滑的钩子
一条短视频的胜负在前 3 秒就决定了。Reels、TikTok 和 Shorts 上的每条留存曲线都呈现同样的形状:前 1 到 3 秒急剧下滑,然后是一个较缓的尾部。钩子的作用就是压平最初的下滑。MiniMax H3 能在单个镜头里渲染出一个视觉钩子,并配上同步音频,这使第一秒能发挥比黑屏文字开场更大的作用。

四种有效的钩子公式
冷开场从动作进行中切入。没有铺垫,没有背景介绍,没有标题卡。观众直接掉进某个瞬间的中段,必须继续看下去才能搞清楚发生了什么。对 MiniMax H3 来说,这意味着提示词要以动作的高潮开场,且音频提示已经响起。
节奏突变把两种不兼容的画面并排放在一起:宁静的物体处于充满敌意的环境中,或熟悉的物体在做不熟悉的事。只要你保持主体不变,只在硬切时改变环境或动作,模型就能很好地处理这种形式。
强势断言用一行屏幕文字开场,承诺一个回报。当画面已经在同一帧里证实了这个断言时,它的效果最好。不要让断言以文字形式叠在通用空镜上,这会被看作填充内容并被滑走。
视觉反差让画面表现一件事,而音频暗示另一件事。角色平静地说话,身后的环境却在变化,或一个看似静止但其实在运动的物体。MiniMax H3 的管线内音频让这种形式可行,因为这种反差依赖于紧凑的音画同步,而静音模型加后期配音无法实现这种同步。
钩子构建:三条规则
第一,让钩子视觉化。前半秒观众还没开声音,图像必须承担起工作。
第二,抛出一个问题。钩子应该让观众想要下一个节拍给出的答案。没有问题的信息只是描述,而描述无法让人停下手指。
第三,不要在前 3 秒就给出回报。回报是观众继续看下 12 秒的理由。立刻化解张力,观众就没了继续看的理由。
竖版格式与平台规格
短视频平台都汇聚到竖版 9:16,但具体的导出规格依然重要。MiniMax H3 支持 9:16、1:1、3:4、4:3、16:9 和 21:9,覆盖所有短视频和中视频场景。对原生短视频来说,9:16 是默认选项。
| 平台 | 宽高比 | 安全时长 | 推荐长度 | 备注 |
|---|---|---|---|---|
| TikTok | 9:16、1:1、16:9 | 7-15 秒最佳 | 最长 10 分钟 | 默认开声自动播放;建议加字幕 |
| Instagram Reels | 9:16 | 7-15 秒最佳 | 最长 90 秒 | 仅 9:16 可全屏显示;封面会被裁切 |
| YouTube Shorts | 9:16 | 最长 60 秒 | 15-30 秒 | 必须 60 秒及以下才能算作 Short |
| Stories(IG、FB) | 9:16 | 每段 15 秒 | 每段 15 秒 | 更长的片段切分为 15 秒章节 |
| 信息流动态 | 9:16、1:1、4:5 | 5-30 秒 | 15 秒 | 方形和 4:5 在网格视图中保留更多细节 |
在 MiniMax H3 中以 2K 渲染,让平台在此基础上压缩。原生 2K 主版本给下游的每个编码器留出了更多可保留的细节,这在 TikTok 和 Reels 上尤为重要,因为那里激进的二次压缩会把偏软的源素材压成一团糊。对于准备投入付费推流的片段来说,原生 2K 是正确的默认选项,因为细节必须在反复投递和二次编码中撑得住。
对于要在后期剪辑拼接的片段,请让每个镜头保持相同的宽高比和帧率。在同一条短视频里混用 9:16 和 16:9 素材,会迫使你加黑边或做裁切重构,两者都会让最终效果变差,并吃掉字幕所在的竖向安全区。
跨平台 AI 视频导出指南
MiniMax H3 视频与 MiniMax Audio 的搭配
MiniMax H3 在生成画面的同一次任务中生成同步的立体声音频,但对于需要独立旁白、音乐或对口型对话的创作者,MiniMax Audio 可以作为互补的人声与音乐模型与 MiniMax H3 搭配。这种双模型组合覆盖了单次任务无法覆盖的场景。
旁白工作流
先在 MiniMax Audio 中生成旁白台词,再把得到的音频片段作为参考回传到 MiniMax H3 的请求中。这样生成的片段,台词会驱动画面角色的口型和节奏。它适用于说话人故事片段、讲解类格式和以对白为主的系列作品。
脚本要紧凑。一条 15 秒片段在自然对话节奏下大约容纳 30 到 35 个口播词。比这更紧会让演绎显得仓促;更长则迫使你切镜头,破坏模型最擅长的单镜头逻辑。
对口型与人声一致性
做系列作品时,请在多次 MiniMax H3 生成中重复使用同一段音频参考素材。人声一致性是让一个反复出现的角色在不同发布之间显得连贯的关键。对待人声参考素材要像对待身份参考图一样:一个职责,全系列锁定。在不同发布之间切换人声参考素材,对连贯性的破坏几乎比任何其他变量改动都更严重。
配乐与声音设计
用作背景配乐时,请让音频参考素材短小且通用。模型会基于参考素材进行创作,所以 15 秒的参考素材足以设定情绪或节奏,又不会盖过对白。对于音效,请在提示词里把声音和产生它的动作一起描述。MiniMax H3 在同一次任务中生成拟音,因此玻璃杯砸到桌面可以连同撞击声一起渲染,而不是事后配音。
复用:一条 15 秒片段变成一周的发布
一条 MiniMax H3 片段很少只是一条发布。如果在渲染之前就做好规划,同一次生成可以孕育出一周的平台原生内容。
持续有效的复用做法是:在主片段设计阶段就把复用考虑进去。把主版本渲染成 9:16 2K,但让主体保持在画面中心,这样同一条片段就能裁切成 1:1 或 4:5,用于信息流发布而不丢失动作。导出主版本后再切出衍生版:用于 TikTok 和 Reels 的 15 秒完整剪辑,用于 Stories 的 6 秒纯钩子剪辑,以及用于 Shorts 的 30 秒加长剪辑(把主版本与同次渲染的空镜搭配)。
工作流第三步锁定的那个角色和那套服装,让你在本周晚些时候拍摄第二条、第三条片段时,依然感觉属于同一个系列。目标:每周一个主概念、三条衍生版、两条配套片段。如果参考素材已锁定,这相当于大约两次生成产出六条发布。
用于付费推流时,把 15 秒主版本作为主素材,6 秒纯钩子剪辑作为再营销素材。纯钩子剪辑面向已经看过主版本、需要二次触达的观众,起到预告作用。追踪哪条衍生版的单次观看成本最低,并在下一轮投放把预算向那条剪辑倾斜。
AI 视频内容复用指南
毁掉 MiniMax H3 片段的常见误区
大多数表现不佳的 AI 短视频都败在同样一份简短的原因清单上。发布前请过一遍这份清单。
在竖屏信息流里输出横屏。 为了电影感选择 16:9 渲染,再裁切成 9:16,会丢掉大部分画面,并以不可预测的方式重新定位主体。从第一版渲染开始就默认用 9:16。MiniMax H3 原生支持竖屏,所以从竖屏开始没有任何画质损失。
模糊的提示词。 像「做一个酷酷的人在走路的视频」这样的提示词,让模型没有任何可优化的目标。请用六段式骨架,按具名行指定景别、运镜、光照、动作、主体和环境。
忽视钩子。 把九成精力花在画面上、零精力花在第一秒上,就注定这条片段会在第一次上滑时死去。按工作流第一步的要求,先写钩子,再写其他任何东西。
默认美学。 当提示词过于单薄时,MiniMax H3 会呈现一种可辨识的默认观感。请向具体的光照、具体的配色、具体的环境靠拢。模型更奖励导演型创作者,而不是描述型创作者。
让多模态预算过载。 喂入九张身份相互冲突的图片会导致画面闪烁和漂移。请为每个参考素材只分配一个职责,让各个槽位互相独立。
跳过迭代。 直接发布第一版渲染几乎从来不是正确的选择。每次迭代只改一个变量,把 2K 主版本渲染留给最终真正要发布的那一版。
把音频当作事后考虑。 静音或配乐糟糕的片段会在默认开声自动播放的平台上流失留存。要么使用 MiniMax H3 的管线内音频,要么有意地与 MiniMax Audio 搭配。音频不是后期步骤。
MiniMax H3 爆款视频常见问题
单条 MiniMax H3 片段可以多长?
MiniMax H3 生成的片段处于与 Reels、TikTok 和 Shorts 匹配的短视频时长范围内。用于爆款目的时,建议把工作时长规划在 15 秒左右,再为 Stories 和纯钩子剪辑切到 6 到 12 秒。对于更长的叙事,请生成多个镜头并把它们剪辑在一起,而不是把长故事硬塞进一次生成。
MiniMax H3 能输出竖版视频吗?
可以。MiniMax H3 支持 9:16、1:1、3:4、4:3、16:9 和 21:9。在 TikTok、Reels 和 Shorts 上做原生短视频投放时,请从第一版渲染就用 9:16,而不是从更宽的主版本裁切。
MiniMax H3 输出里有声音吗?
有。MiniMax H3 在生成画面的同一次任务中生成同步的立体声音频,包括对白、环境声和音效。对于需要独立旁白、音乐或对口型对话的创作者,MiniMax Audio 可以作为互补的人声与音乐模型与 MiniMax H3 搭配。
如何在多条片段里保持同一个角色?
用一张参考图锁定角色身份,并在系列里的每次生成中都复用同一段参考。为每个参考素材只分配一个职责:一张图定身份、另一张定服装、一段视频定动作、一段音频定声音。完整方法见我们的角色一致性详解。MiniMax H3 角色一致性指南
一条 MiniMax H3 爆款片段要多少钱?
采用按输出秒数计费的按量计价模式。原生 2K 下为每秒 0.13 美元,因此一条 15 秒片段约 1.95 美元。768P 下为每秒 0.09 美元,因此一条 15 秒片段约 1.35 美元。用 768P 迭代、把 2K 留给最终主版本,是标准的成本控制做法。
MiniMax H3 有免费或入门选项吗?
最快的零代码路径是 PixMind MiniMax H3 生成器,它带有入门档位。我们的免费额度指南讲解了如何领取并叠加额度,让你在投入付费预算之前先验证工作流。MiniMax H3 免费额度指南
我可以在社交平台上把 MiniMax H3 片段用于商业用途吗?
MiniMax H3 的输出适用于大多数商业短视频用途,但人脸、品牌标识、产品几何形状、屏幕文字和授权角色在发布前都需要做最终的权利和准确性审核。请确保你对自己喂入模型的真实人物或第三方参考素材拥有相应权利。
结论:先把循环跑起来,再慢慢打磨
把 MiniMax H3 做成爆款片段的创作者,并不是那些写出最长提示词的人。他们是那些把六步循环跑得很紧凑的人:把别的事都先放一边先把钩子定下来、写一份 15 秒节拍脚本、按职责锁定参考素材、做迭代渲染、用 MiniMax Audio 搭配音和声音、再加字幕做竖版导出,瞄准循环本身。这个循环跑一遍就得到一条片段;每周用锁定的参考素材跑,就得到一个系列。
下一步:打开 PixMind MiniMax H3 生成器,从上面的七套提示词模板里挑一套,锁定一个角色参考,今天就渲染出你的第一条 15 秒片段。明天再用同样的参考素材跑一遍。打开 MiniMax H3 视频生成器 浏览所有已接入的 AI 视频模型
本指南中的规格、定价和能力于 2026-08-01 对照 MiniMax 官方平台和 MiniMax H3 模型卡片进行了核实。社区和创作者趋势的引用均为泛指;模型卡片和价目表变化很快,请在正式产出前在你所用通道里确认实时数值。



