MiniMax H3 角色一致性:在 AI 视频中保持同一角色的完整指南
AI 视频最难的问题不是分辨率、运动或音频,而是如何让同一个角色从一个镜头延续到下一个镜头。标准的文生视频流程在每次渲染时都从零开始重建人脸,所以镜头一的主角到了镜头二就成了陌生人。MiniMax H3(API id minimax/hailuo-3)建立在另一套前提之上:你只需要提供定义角色的参考文件,模型就能把这种身份特征跨角度、跨镜头、跨片段地延续下去,无需你用文字反复描述。
本指南面向制作故事、系列和营销活动作品、需要在一段序列中保持同一角色形象完全一致的创作者。内容涵盖一致性为何会失效、MiniMax H3 的参考系统和原生多镜头一致性如何解决这一问题,以及一套可直接套用的方法,帮你打造一个能在整个项目中稳定复现的角色。定价、能力详情和 12 文件参考预算均为 2026-08-01 当天核验的规格。
核心要点
- 角色身份存在于参考文件中,而非文本提示词中。在每一个镜头中提供角色参考图,MiniMax H3 就能在不重复描述的情况下保持面部、发型和穿搭一致。
- 模型单次请求最多接受 12 个多模态参考文件,涵盖图片、视频、音频和文本。这个预算让你可以分别为角色、穿搭、场景和动作分配独立槽位,每个参考只承担一项职责。
- 原生多镜头一致性是 MiniMax H3 的一等能力。同一个主体在一个场景的多个镜头中保持连贯。
- 可靠的工作流是:先设计主角色,再做一张干净的正脸参考图,然后在后续每一个镜头中都喂入这张参考图。
- 社区和行业实践建议把参考的「影响强度」设定在 65% 到 75% 之间,创作者反馈单张主体参考图能达到约 95% 的角色一致性。
为什么角色一致性是 AI 视频中的硬难题
「每个镜头换一个人」的失效模式是结构性的,而非调参问题。一个从文本提示词中逐帧采样的视频模型,根本不记得两秒前生成的人脸,更不用说上一段片段里的人脸。每一帧都是从分布中的一次新抽样,所以特征会漂移。剪辑之间,颧骨变得更锐利;瞳色偏移半个色阶;镜头一里左脸颊的痣,到镜头二就跑到了右脸颊。等你把三个镜头剪到一起,观众读出的就是三个不同的人。
这一点对故事类作品的影响比其他任何形式都大。城市天际线的风景镜头不需要连贯性;香水的产品环绕镜头也不需要。但只要角色承担叙事,观众就会逐帧追踪那张脸。哪怕只是轻微的漂移,也会被读作穿帮;大幅漂移则直接破坏虚构感。社交系列、常驻发言人、品牌角色、多镜头广告和短片都会撞上同一堵墙。
在提示词中重复描述角色并不能解决问题。一段写着「三十多岁女性,黑色短发,绿眼睛,雀斑,牛仔夹克」的文字,会把所有视觉细节都交给模型在每次渲染时自行诠释。同一提示词的两次生成,会产生两位都符合描述但不同的女性。提示词是一份规格说明,不是一把锁。没有视觉锚点,模型就会不停地重新发明。
解决办法是停止用文字指定角色,改为以参考形式提供它。这正是 MiniMax H3 参考系统的核心前提,本指南余下部分讲的就是如何把它用好。
MiniMax H3 完整模型指南
MiniMax H3 如何解决角色一致性
MiniMax H3 通过两个互补机制来攻克一致性问题:一套让你把角色作为输入附加进去的多模态参考系统,以及让主体在一个场景的多个镜头中保持连贯的原生多镜头一致性。两者结合,把角色身份从提示词中抽离,转移到参考层,让模型可以读取它,而不是凭空想象。
参考文件就是身份层
核心思路很简单:与其描述角色,不如直接把它展示出来。MiniMax H3 单次请求最多接受 12 个多模态参考文件,来源涵盖图片、视频、音频和文本。当你提供角色的参考图时,模型就能在跨角度和跨镜头时保持外观一致,无需再次描述。参考文件就是那把锁,提示词只负责指挥动作。
这套机制之所以起效,是因为参考图消除了诠释空间。参考图里只有一张确定的脸,而不是一组符合描述的分布。模型的任务从「发明一个符合这些词语的人」变成了「在这个新镜头中使用这个具体的人」,这是一个简单得多也稳定得多的任务。
12 文件上限内的预算配比有明确文档:最多 9 张图片、3 段视频、3 段音频,配合文本提示词使用。具体如何分配由你决定,而这也正是大部分手艺所在。下一节会讲分配方式。
原生多镜头一致性
MiniMax H3 把多镜头一致性当作一等能力来对待,也就是说,同一个主体在一个场景的多个镜头中保持连贯,而不是只在单个片段内连贯。实际表现就是:在镜头一走进房间、在镜头三坐下的角色,看起来仍然是同一个人,因为参考文件随每个镜头一起传递。
这正是真正的多镜头模型与「凑巧能渲染多个片段」的单镜头模型之间的区别。单镜头模型能把一张脸在五秒内拼凑起来,但无法保证片段二中的脸与片段一匹配。多镜头模型可以做到,因为身份由参考锚定,而不是由上一帧的残差统计锚定。
如何分配 12 文件参考预算
使用多模态参考时最常见的错误,就是喂入相互冲突的输入。两张身份不同的角色图,或一段穿搭与角色参考图相矛盾的动作参考视频,都会导致闪烁和漂移。12 个槽位中的每一个,都应当只承担一项职责。
针对角色驱动序列的一种可靠分配模式:
- 角色身份: 同一角色的两到三张不同角度图片(正面、四分之三侧面、侧面),如果有;若没有,一张干净的正脸图也可以。
- 穿搭与道具: 一到两张锁定外套、配饰或角色手持产品的图片,与身份参考分开,这样换装不会渗到脸部。
- 场景与环境: 一到两张关于地点、光线或风格的图片,让角色在每个镜头中都渲染进同一个一致的世界。
- 动作或表演: 一段短参考视频(可选),展示你想要的节奏、运镜或肢体语言。
- 音频(可选): 一段语音或配乐参考,与画面参考分开。

这样预算里仍留有迭代余地。你不需要在每次请求中都填满 12 个槽位。一张主体参考图就足以应对许多镜头,只有当每个新参考都能带来明确、不冲突的约束时,增加参考才会有帮助。
MiniMax H3 多模态输入深度解析
MiniMax H3 实战:真实角色一致性案例
讲方法之前,先看看主体参考实际能产出什么。下方视频演示了 MiniMax H3 的单图设置,展示一张干净的照片如何把一个角色锁定到新角度、新光线和新镜头中。
MiniMax H3 把主体参考作为一等输入正是为这种工作流设计的,也就是上面教程依赖的能力。
MiniMax H3 主体参考发布公告
主角设计法,逐步拆解
复现角色最可靠的工作流,被社区指南称为「主角设计法」:先设计主角色,生成一张干净的正脸参考图,然后在每个镜头中都喂入这张参考图。它之所以有效,是因为给了 MiniMax H3 一个关于面部的唯一权威信息源,并以固定输入的形式反复使用,而不是每次都重新写提示词。
第一步:设计主角色
渲染任何东西之前,先用文字定义这个角色。记下整个项目中永远不能变的固定属性:年龄段、族裔、发型与发色、瞳色、体型、辨识标记、默认穿搭。这份文档就是角色圣经。它的存在,是为了让你在时隔数周修改镜头时,仍能与过去的自己对角色的样子达成一致。
你也要在这一步决定什么是不可变的、什么是可变的。面部不可变;穿搭可随场景变化;发型可随时间跳转变化。把每一项属性标记为锁定或灵活,并在后续镜头中把锁定属性从提示词文本中剔除。锁定属性属于参考,不属于散文。
第二步:生成一张干净的正脸参考图
用 MiniMax H3(或你顺手的任何图像工具)生成一张干净的主角色正脸肖像。目标是拿到一张打光良好、构图到肩或到腰的图像,面部清晰可见,表情中立,没有遮挡(不要墨镜,不要手挡脸,面部不要有强烈阴影)。
三条规则能让参考图更有力:均匀打光,让模型能读出面部的几何结构;相机置于眼睛高度并正对,避免透视变形需要诠释;背景纯粹或简洁,不让任何元素与角色争夺注意力。参考图首先是一种测量工具,其次才是审美对象。你随时可以在之后渲染更具艺术感的构图,但参考本身应该是对面部最清晰的陈述。
在最终确定前,先生成三到五个参考变体。即便设置相同,面部在不同变体之间也会漂移,所以挑出最贴合角色圣经的那一张。这张被选中的图,就是整个项目每个镜头的规范参考。
第三步:在后续每个镜头中喂入参考
一旦有了规范参考,序列中每个视频镜头都以同样的方式起步:把参考图作为主体参考输入附加,然后写一段提示词,只描述该镜头的新内容(动作、相机、场景、光线)。不要在提示词中重新描述角色。重新描述会让模型重新诠释,而这正是参考想要避免的失效模式。
在多镜头序列中,参考图是常量,提示词是变量。正是这种不对称把角色维系住。脸来自文件,调度来自文字,两层互不争夺。
主体参考:当你只有一张照片
不是每个项目都从设计好的主角色起步。有时候输入只是一张照片:发言人广告里的真人、广告里的产品图、品牌吉祥物的现有插画。MiniMax H3 的主体参考式输入直接处理这种情况。你提供一张主体图,模型就把这个主体渲染到新角度、新光线和新场景中。
使用单图主体参考的创作者反馈,当源图干净时,角色一致性可达 95% 以上。这个数字是社区观察而非基准测试,前提是你遵守几条规则:源图应当是高分辨率、打光均匀、主体清晰;主体应在画面中占据足够大的比例;面部不应被遮挡、模糊,或以极端角度拍摄。
在最终确定前测试三到五个变体
单张参考图产出的是一个输出分布,而不是单一确定的脸。从同一参考生成三到五个测试片段并排审查。如果主体在五段中都保持住,这张参考就够强,可以继续做下去。如果出现漂移,要么是源图偏弱,要么是提示词在要求与参考冲突的内容(重度风格化、极端年龄变化、相互冲突的穿搭)。
先测后定这一步,是单图工作流中最大的杠杆。它能在重做成本很低时及早发现弱参考,而不是等到你已经围绕一张无法锁定的参考搭出一整段序列之后才发现。
用一张照片,还是设计主角色?
单图工作流与主角设计法之间的选择,取决于素材来源。如果你已经有真人照片或现成的角色设计图,主体参考就是正确的起点。如果你是从零开始创造角色,主角设计法能给你更多控制权,因为你可以刻意设计参考,而不是继承一张已有图像的约束。
两种工作流最终走到同一个终点:每个镜头都附上规范参考图,提示词只描述调度。
调节参考影响强度:65% 到 75% 的甜蜜区间
大多数主体参考实现都暴露了一个控制项,决定参考驱动输出的强度。命名因界面而异(「影响强度」「强度」「依从度」),但机制相同:低值让模型围绕参考即兴发挥,高值则强制输出严格匹配参考。社区群体关于 MiniMax H3 式主体参考的小贴士,一致把这项设定落在 65% 到 75% 区间,这也是角色一致性工作的合适起点。
依从度过低:参考被忽略
当影响强度过低时,模型把参考视作建议。输出中的脸与参考相似但不完全匹配,而且相似度会随片段推进而减弱。这种失效模式读作「同一类人」而非「同一个人」。对于需要复现的角色来说,这是错误的失效方向,因为整个意义就在于身份完全一致。
依从度过高:输出看起来僵硬
当影响强度过高时,模型会死板地复制参考,而不是为新镜头重新摆姿。脸被锁定在源图的精确表情和头部角度,动作变僵硬,角色看起来像被贴到场景上,而不是融入场景。一致性很高,但表演是死的。
找到甜蜜区间
65% 到 75% 区间是参考保持身份、提示词掌控表演的范围。对于干净的正脸参考,从 70% 起步。如果脸在片段中漂移,向上调;如果动作看起来僵硬或角色无法转头,向下调。把这项设定当作每镜头的旋钮,而不是全局常量,因为合适的值取决于该镜头要求角色移动和转头的幅度。
两种情况需要离开这个区间。角色远离镜头的快速动作镜头,可能需要略高的值才能在运动中保住身份。希望以不同视觉风格渲染角色的风格化镜头,可能需要略低的值让风格透出来。两种情况下,每次只改一个变量,这样你才能把结果归因到具体原因。
用复现角色搭建多镜头序列
多镜头序列正是角色一致性大显身手的地方。每个镜头都是一次独立的 MiniMax H3 生成,附上规范参考,序列由参考维系,而非靠运气。在渲染之前先把序列规划成镜头清单,是把一段连贯作品和一堆杂乱片段区分开的关键。
建立镜头清单
在任何生成之前,把序列写成一张表,每个镜头占一行。对每个镜头,记下镜头号、景别(全景、中景、特写)、运镜、动作、场景、所附的参考。参考列是负责执行一致性的列:同一个角色参考出现在每一行,镜头专属参考(产品、地点、换装)只在相关行出现。
一段三镜头角色序列的最小镜头清单可能长这样:
- 镜头 1(全景): 角色走进厨房,走到操作台前,晨光。参考:角色正面图、厨房场景。
- 镜头 2(中景): 角色在操作台前,打开一个盒子,作出反应。参考:角色正面图、产品图。
- 镜头 3(特写): 角色的脸,微微一笑。参考:角色正面图,如有四分之三角度参考也一并附上。
每一行都带角色参考,只有辅助参考在变化。正是这种结构让剪辑能够成立。
渲染之前先做分镜
关于多镜头一致角色的「免训练视频分镜」的学术研究为这一方向提供了支撑,而实操版本其实很直白:先把每个镜头作为单张图像来画或来描述,生成这些静帧,把它们作为序列一并批准,再把渲染预算花到视频上。静帧比视频便宜,能让你一眼检查连贯性,并在之后动画化镜头时成为首帧参考。

这里的纪律是:把序列当作序列来审查,而不是当作独立图像。把批准的静帧并排放在一起,问一个问题:这个角色在所有静帧里读起来是同一个人吗?如果是,进入视频阶段;如果不是,先修参考,别在不成立的序列上烧视频预算。
按顺序、在同一会话里渲染镜头
如果可以,把镜头按故事顺序在同一会话里渲染。模型和设定会随时间漂移,相隔数天渲染会引入打破连贯性的方差,哪怕参考保持不变。在同一会话、用同一参考和同一设定渲染,是通向一致序列最可控的路径。
实战案例:角色一致性的真实应用
三个实战案例展示这套方法如何适配不同形式。每个案例都从同一个根基起步:每个镜头附上规范角色参考,提示词只描述调度。
案例一:三镜头产品广告,带一位固定发言人
一家护肤品牌需要一条三镜头社交广告,由一位发言人手持并评价一罐面霜。角色参考是一张发言人干净的正脸肖像。产品参考是单独一张罐子静帧图,只在产品出现的镜头中附上。
- 镜头 1(中景): 发言人走入画面,手中拿着产品。参考:角色正面图、产品静帧。
- 镜头 2(特写): 发言人拧开盖子。参考:角色正面图、产品静帧。
- 镜头 3(中近景): 发言人对着镜头说话。参考:仅角色正面图。
因为角色参考在三个镜头中完全相同,产品参考只在产品可见时出现,剪辑就既保住了发言人身份,又让产品干净地出现与消失。按 MiniMax H3 已核验的费率(2K 每秒 $0.13,768P 每秒 $0.09),三段六秒 2K 镜头大约花费 $2.34,让这种形式非常适合低成本迭代。
案例二:Reels 系列中的固定角色
一位创作者希望在一档每周更新的短 Reels 系列中使用同一位动画主持人。主角设计法直接适用。第一次会话用于设计并把主角色锁定为一张规范的正脸参考。之后每集都从这张参考起步,配合每集一段描述主题、场景和动作的提示词。
参考图每周都不变,这正是整个意义所在。观众能在各集之间认出主持人,因为主持人字面上就是同一张脸,作为同一个文件被喂入。通过辅助参考,穿搭和场景可以按集变化,但身份保持锁定。对一档播几十集的系列来说,这是「一个可辨识的角色」与「一队撞脸替身」之间的差别。
案例三:多镜头故事场景
一段短叙事场景需要一位角色跨五个镜头:走进房间、坐到桌前、对一通电话作出反应、站起、离开。角色参考附到每个镜头。宽镜头中附上场景参考(同一房间、一致角度)。任何视频渲染前都先建立镜头清单,静帧作为序列一并批准后再做动画。
这里最棘手的是反应镜头:角色的表情要变,身份不能变。解决办法是把角色参考保持在标准影响强度,在提示词中描述新表情,让其他所有不变项继续由参考承载。参考保住脸,提示词提供情绪。
常见失效与修复方法
角色一致性工作以可预测的方式失效。大多数失效都能追溯到参考、提示词或两者之间的交互。
参考图质量差
模糊、过暗或极端角度的参考无法锁定身份,因为模型无法清晰读取面部。输出会漂移,因为模型必须把参考隐藏的细节自行脑补出来。解决办法是用均匀打光、相机正对眼睛高度、表情中立来重新生成参考。参考是测量工具,请把它当测量工具对待。
相互冲突的参考
两张不同脸的角色图,或一张穿搭与穿搭参考相冲突的角色参考,会迫使模型仲裁。仲裁表现为闪烁和漂移。解决办法是渲染前审查参考集合,确保每一项属性都由唯一一个参考定义。如果需要换装,换穿搭参考,而不是身份参考。
在提示词中重新描述角色
当参考图已经定义了她,却在提示词里写「黑色短发绿眼睛的女性」,会邀请模型重新诠释。模型会同时读这两路输入并尝试同时满足,可能把脸从参考上拉走。解决办法是一旦附上参考,就从提示词中完全移除身份描述,让参考履行它的职责。
画幅比例或构图错误
用 9:16 拍的参考用于 16:9 的输出,可能让人脸变形或裁掉辨识特征。解决办法是按你打算交付的画幅比例生成参考,或采用头肩构图,能在不同比例的裁切下幸存。
破坏身份的动作
快速旋转、遮挡(一只手从脸前划过)和极端的头部转动,会让模型在片段中途丢失面部,并在面部重新出现时重建一张略微不同的脸。解决办法是规划镜头时让面部在动作中至少部分可见,把极端转头留到面部不是焦点的时刻。如果某个镜头必须靠动作打破身份,在剪辑中绕开断裂处剪,不要试图把脸硬撑过断裂。
MiniMax H3 角色工作提示词模板
多镜头序列的成本
MiniMax H3 的定价让多镜头角色工作可以低成本迭代。已核验费率为:原生 2K 每秒 $0.13,768P 每秒 $0.09。一段六个镜头、每个六秒的 2K 片段大约花费 $4.68;同序列在 768P 大约 $3.24。这便宜到足够渲染多个变体再挑出最佳镜头,而这正是做角色一致性工作的正确方式。
一种有用的预算模式是:在 768P 上迭代,在 2K 上定稿。用 768P 跑测试渲染,检查参考能否锁定、序列能否剪到一起。一旦参考和镜头清单稳定下来,再用原生 2K 渲染最终序列。这样能压低迭代成本,把更高保真、更高成本的渲染留给你真正会发布的输出。
每秒价格随片段长度线性变化,所以每个镜头在故事允许的范围内尽量短。一段角色一致性测试不需要十五秒的片段。五到六秒通常足以判断面部是否稳得住,2K 下每镜头成本不到一美元。
MiniMax H3 角色一致性常见问题
保持角色一致需要多少参考?
一张干净的正脸图就足以锁定许多镜头的身份。三到五张不同角度的图(正面、四分之三、侧面)能给模型更多依据,提升转头时的一致性。把 12 文件预算的其余部分分配给穿搭、场景、动作和音频,前提是每一项都带来不冲突的约束。
可以用真人照片做角色参考吗?
可以。真人照片可以作为主体参考式输入使用。照片应当高分辨率、打光均匀、无遮挡,主体在画面中占据足够大的比例。从同一张照片生成三到五个测试片段,检查主体是否在所有片段中都保持住,再据此搭建序列。发布前请确保你拥有真人肖像的使用权。
主体参考适用于产品或吉祥物这类非人类主体吗?
适用。机制相同。提供一张产品、吉祥物或物体的干净参考图,模型就会把它的外观跨镜头延续。这对必须在一段序列中保持完全相同形象的品牌角色和产品广告尤其有用。同样的规则适用:一张清晰参考,无冲突输入,影响强度从 65% 到 75% 区间起步。
一段多镜头角色序列成本是多少?
按已核验费率(2K 每秒 $0.13,768P 每秒 $0.09),六个六秒镜头的序列在 2K 下约 $4.68,768P 下约 $3.24。在 768P 迭代、在 2K 定稿,能在压低总成本的同时,把高保真渲染留给你打算发布的剪辑。
MiniMax H3 有免费选项吗?
最快的免代码路径是托管的 MiniMax H3 工具,它通过 UI 运行同一套参考系统,无需任何设置。免费额度和入门福利会轮换更新,所以制作时请查阅当前的额度指南了解可用福利。MiniMax H3 免费额度指南
这套方法对跨多个独立视频的复现角色也适用吗,而不只是一段序列?
适用。主角设计法正是为这种情况设计的。一次性锁定规范参考,然后在系列中每段新视频的第一个镜头上都附上它。角色会在相隔数周或数月发布的独立视频中读作同一个人,因为脸每次都作为同一个文件被喂入。
影响强度应该从多少起步?
用一张干净的正脸参考时,从 70% 起步。如果脸在片段中漂移,向上调;如果动作看起来僵硬,向下调。把这项设定当作每镜头的旋钮,而不是全局常量,因为合适的值取决于该镜头要求角色移动和转头的幅度。
结语:让参考承担这份工作
角色一致性这件事,从你停止用文字描述角色、改用参考文件提供它的那一刻起,就不再是赌运气。MiniMax H3 的 12 文件多模态预算和原生多镜头一致性正是为这套工作流而生,主角设计法给你一条可复现的路径:设计主角色,生成一张干净的正脸参考,把这张参考附到每个镜头上。在最终确定前测试三到五个变体,把影响强度设定在 65% 到 75% 区间,让提示词只承载调度。脸,每次都来自文件。
下一步是把这套方法落到一个真实项目上。挑一个角色,建立规范参考,用 768P 跑一段三镜头序列测试剪辑,参考锁定后再用原生 2K 定稿。
PixMind MiniMax H3 视频工具 MiniMax H3 爆款视频指南 MiniMax H3 免费额度指南
本指南中的规格、定价和能力已于 2026-08-01 对照 MiniMax 官方博客、MiniMax 平台文档、OpenRouter、Vercel AI Gateway 和 EvoLink 完成核验。社区工作流细节(主角设计法、65% 到 75% 影响强度区间、单图约 95% 一致性的观察)反映创作者和行业实践,并非正式基准。模型卡和费率卡变化很快,请在制作前始终在你的路由中确认实时数值。



