MiniMax H3 角色一致性:在 AI 影片中保持同一角色的完整指南
AI 影片最難的問題不是解析度、動態或音訊,而是如何讓同一個角色從一個鏡頭延續到下一個鏡頭。標準的文生影片流程在每次渲染時都從零開始重建人臉,所以鏡頭一的主角到了鏡頭二就成了陌生人。MiniMax H3(API id minimax/hailuo-3)建立在另一套前提之上:你只需要提供定義角色的參考檔案,模型就能把這種身分特徵跨角度、跨鏡頭、跨片段地延續下去,無需你用文字反覆描述。
本指南面向製作故事、系列與行銷活動作品、需要在一段序列中保持同一個角色形象完全一致的創作者。內容涵蓋一致性為何會失效、MiniMax H3 的參考系統與原生多鏡頭一致性如何解決這個問題,以及一套可直接套用的方法,幫你打造一個能在整個專案中穩定重現的角色。定價、能力詳情與 12 檔案參考預算均為 2026-08-01 當天核驗的規格。
核心要點
- 角色身分存在於參考檔案中,而非文字提示詞中。在每一個鏡頭中提供角色參考圖,MiniMax H3 就能在不重複描述的情況下保持面部、髮型與穿搭一致。
- 模型單次請求最多接受 12 個多模態參考檔案,涵蓋圖片、影片、音訊與文字。這個預算讓你可以分別為角色、穿搭、場景與動作分配獨立欄位,每個參考只承擔一項職責。
- 原生多鏡頭一致性是 MiniMax H3 的一等能力。同一個主體在一個場景的多個鏡頭中保持連貫。
- 可靠的工作流程是:先設計主角,再做一張乾淨的正臉參考圖,然後在後續每一個鏡頭中都餵入這張參考圖。
- 社群與業界實踐建議把參考的「影響強度」設定在 65% 到 75% 之間,創作者回報單張主體參考圖能達到約 95% 的角色一致性。
為什麼角色一致性是 AI 影片中的硬難題
「每個鏡頭換一個人」的失效模式是結構性的,而非調參問題。一個從文字提示詞中逐影格取樣的影片模型,根本不記得兩秒前生成的人臉,更不用說上一段片段裡的人臉。每一影格都是從分佈中的一次新抽樣,所以特徵會漂移。剪輯之間,顴骨變得更銳利;瞳色偏移半個色階;鏡頭一裡左臉頰的痣,到鏡頭二就跑到了右臉頰。等你把三個鏡頭剪到一起,觀眾讀出的就是三個不同的人。
這一點對故事類作品的影響比其他任何形式都大。城市天際線的風景鏡頭不需要連貫性;香水的產品環繞鏡頭也不需要。但只要角色承擔敘事,觀眾就會逐影格追蹤那張臉。哪怕只是輕微的漂移,也會被讀作穿幫;大幅漂移則直接破壞虛構感。社交系列、常駐代言人、品牌角色、多鏡頭廣告與短片都會撞上同一堵牆。
在提示詞中重複描述角色並不能解決問題。一段寫著「三十多歲女性,黑色短髮,綠眼睛,雀斑,牛仔夾克」的文字,會把所有視覺細節都交給模型在每次渲染時自行詮釋。同一提示詞的兩次生成,會產生兩位都符合描述但不同的女性。提示詞是一份規格說明,不是一把鎖。沒有視覺錨點,模型就會不停地重新發明。
解決辦法是停止用文字指定角色,改為以參考形式提供它。這正是 MiniMax H3 參考系統的核心前提,本指南餘下部分講的就是如何把它用好。
MiniMax H3 完整模型指南
MiniMax H3 如何解決角色一致性
MiniMax H3 透過兩個互補機制來攻克一致性問題:一套讓你把角色作為輸入附加進去的多模態參考系統,以及讓主體在一個場景的多個鏡頭中保持連貫的原生多鏡頭一致性。兩者結合,把角色身分從提示詞中抽離,轉移到參考層,讓模型可以讀取它,而不是憑空想像。
參考檔案就是身分層
核心思路很簡單:與其描述角色,不如直接把它展示出來。MiniMax H3 單次請求最多接受 12 個多模態參考檔案,來源涵蓋圖片、影片、音訊與文字。當你提供角色的參考圖時,模型就能在跨角度與跨鏡頭時保持外觀一致,無需再次描述。參考檔案就是那把鎖,提示詞只負責指揮動作。
這套機制之所以起效,是因為參考圖消除了詮釋空間。參考圖裡只有一張確定的臉,而不是一組符合描述的分佈。模型的任務從「發明一個符合這些詞語的人」變成了「在這個新鏡頭中使用這個具體的人」,這是一個簡單得多也穩定得多的任務。
12 檔案上限內的預算配比有明確文件:最多 9 張圖片、3 段影片、3 段音訊,配合文字提示詞使用。具體如何分配由你決定,而這也正是大部分手藝所在。下一節會講分配方式。
原生多鏡頭一致性
MiniMax H3 把多鏡頭一致性當作一等能力來對待,也就是說,同一個主體在一個場景的多個鏡頭中保持連貫,而不是只在單個片段內連貫。實際表現就是:在鏡頭一走進房間、在鏡頭三坐下的角色,看起來仍然是同一個人,因為參考檔案隨每個鏡頭一起傳遞。
這正是真正的多鏡頭模型與「湊巧能渲染多個片段」的單鏡頭模型之間的區別。單鏡頭模型能把一張臉在五秒內拼湊起來,但無法保證片段二中的臉與片段一匹配。多鏡頭模型可以做到,因為身分由參考錨定,而不是由上一影格的殘差統計錨定。
如何分配 12 檔案參考預算
使用多模態參考時最常見的錯誤,就是餵入相互衝突的輸入。兩張身分不同的角色圖,或一段穿搭與角色參考圖相矛盾的動作參考影片,都會導致閃爍與漂移。12 個欄位中的每一個,都應當只承擔一項職責。
針對角色驅動序列的一種可靠分配模式:
- 角色身分: 同一個角色的兩到三張不同角度圖片(正面、四分之三側面、側面),如果你有;若沒有,一張乾淨的正臉圖也可以。
- 穿搭與道具: 一到兩張鎖定外套、配飾或角色手持產品的圖片,與身分參考分開,這樣換裝不會滲到臉部。
- 場景與環境: 一到兩張關於地點、光線或風格的圖片,讓角色在每個鏡頭中都渲染進同一個一致的世界。
- 動作或表演: 一段短參考影片(可選),展示你想要的節奏、運鏡或肢體語言。
- 音訊(可選): 一段語音或配樂參考,與畫面參考分開。

這樣預算裡仍留有反覆運算的餘地。你不需要在每次請求中都填滿 12 個欄位。一張主體參考圖就足以應對許多鏡頭,只有當每個新參考都能帶來明確、不衝突的約束時,增加參考才會有幫助。
MiniMax H3 多模態輸入深度解析
MiniMax H3 實戰:真實角色一致性案例
講方法之前,先看看主體參考實際能產出什麼。下方影片演示了 MiniMax H3 的單圖設定,展示一張乾淨的照片如何把一個角色鎖定到新角度、新光線與新鏡頭中。
MiniMax H3 把主體參考作為一等輸入,正是為這種工作流程設計的,也就是上面教學依賴的能力。
MiniMax H3 主體參考發佈公告
主角設計法,逐步拆解
重現角色最可靠的工作流程,被社群指南稱為「主角設計法」:先設計主角,生成一張乾淨的正臉參考圖,然後在每個鏡頭中都餵入這張參考圖。它之所以有效,是因為給了 MiniMax H3 一個關於面部的唯一權威資訊源,並以固定輸入的形式反覆使用,而不是每次都重新寫提示詞。
第一步:設計主角
渲染任何東西之前,先用文字定義這個角色。記下整個專案中永遠不能變的固定屬性:年齡段、族裔、髮型與髮色、瞳色、體型、辨識標記、預設穿搭。這份文件就是角色聖經。它的存在,是為了讓你在時隔數週修改鏡頭時,仍能與過去的自己對角色的樣子達成一致。
你也要在這一步決定什麼是不可變的、什麼是可變的。面部不可變;穿搭可隨場景變化;髮型可隨時間跳轉變化。把每一項屬性標記為鎖定或靈活,並在後續鏡頭中把鎖定屬性從提示詞文字中剔除。鎖定屬性屬於參考,不屬於散文。
第二步:生成一張乾淨的正臉參考圖
用 MiniMax H3(或你順手的任何圖像工具)生成一張乾淨的主角正臉肖像。目標是拿到一張打光良好、構圖到肩或到腰的圖像,面部清晰可見,表情中立,沒有遮擋(不要墨鏡,不要手擋臉,面部不要有強烈陰影)。
三條規則能讓參考圖更有力:均勻打光,讓模型能讀出面部的幾何結構;相機置於眼睛高度並正對,避免透視變形需要詮釋;背景純粹或簡潔,不讓任何元素與角色爭奪注意力。參考圖首先是一種測量工具,其次才是審美物件。你隨時可以在之後渲染更具藝術感的構圖,但參考本身應該是對面部最清晰的陳述。
在最終確定前,先生成三到五個參考變體。即便設定相同,面部在不同變體之間也會漂移,所以挑出最貼合角色聖經的那一張。這張被選中的圖,就是整個專案每個鏡頭的規範參考。
第三步:在後續每個鏡頭中餵入參考
一旦有了規範參考,序列中每個影片鏡頭都以同樣的方式起步:把參考圖作為主體參考輸入附加,然後寫一段提示詞,只描述該鏡頭的新內容(動作、相機、場景、光線)。不要在提示詞中重新描述角色。重新描述會讓模型重新詮釋,而這正是參考想要避免的失效模式。
在多鏡頭序列中,參考圖是常數,提示詞是變數。正是這種不對稱把角色維繫住。臉來自檔案,調度來自文字,兩層互不爭奪。
主體參考:當你只有一張照片
不是每個專案都從設計好的主角起步。有時候輸入只是一張照片:代言人廣告裡的真人、廣告裡的產品圖、品牌吉祥物的現有插畫。MiniMax H3 的主體參考式輸入直接處理這種情況。你提供一張主體圖,模型就把這個主體渲染到新角度、新光線與新場景中。
使用單圖主體參考的創作者回報,當來源圖乾淨時,角色一致性可達 95% 以上。這個數字是社群觀察而非基準測試,前提是你遵守幾條規則:來源圖應當是高解析度、打光均勻、主體清晰;主體應在畫面中佔據足夠大的比例;面部不應被遮擋、模糊,或以極端角度拍攝。
在最終確定前測試三到五個變體
單張參考圖產出的是一個輸出分佈,而不是單一確定的臉。從同一張參考生成三到五個測試片段並排審查。如果主體在五段中都保持住,這張參考就夠強,可以繼續做下去。如果出現漂移,要麼是來源圖偏弱,要麼是提示詞在要求與參考衝突的內容(重度風格化、極端年齡變化、相互衝突的穿搭)。
先測後定這一步,是單圖工作流程中最大的槓桿。它能在重做成本很低時及早發現弱參考,而不是等到你已經圍繞一張無法鎖定的參考搭出一整段序列之後才發現。
用一張照片,還是設計主角?
單圖工作流程與主角設計法之間的選擇,取決於素材來源。如果你已經有真人照片或現成的角色設計圖,主體參考就是正確的起點。如果你是從零開始創造角色,主角設計法能給你更多控制權,因為你可以刻意設計參考,而不是繼承一張已有圖像的約束。
兩種工作流程最終走到同一個終點:每個鏡頭都附上規範參考圖,提示詞只描述調度。
調節參考影響強度:65% 到 75% 的甜蜜區間
大多數主體參考實作都公開了一個控制項,決定參考驅動輸出的強度。命名因介面而異(「影響強度」「強度」「依從度」),但機制相同:低值讓模型圍繞參考即興發揮,高值則強制輸出嚴格匹配參考。社群群組關於 MiniMax H3 式主體參考的小提示,一致把這項設定落在 65% 到 75% 區間,這也是角色一致性工作的合適起點。
依從度過低:參考被忽略
當影響強度過低時,模型把參考視作建議。輸出中的臉與參考相似但不完全匹配,而且相似度會隨片段推進而減弱。這種失效模式讀作「同一類人」而非「同一個人」。對於需要重現的角色來說,這是錯誤的失效方向,因為整個意義就在於身分完全一致。
依從度過高:輸出看起來僵硬
當影響強度過高時,模型會死板地複製參考,而不是為新鏡頭重新擺姿。臉被鎖定在來源圖的精確表情與頭部角度,動作變僵硬,角色看起來像被貼到場景上,而不是融入場景。一致性很高,但表演是死的。
找到甜蜜區間
65% 到 75% 區間是參考保持身分、提示詞掌控表演的範圍。對於乾淨的正臉參考,從 70% 起步。如果臉在片段中漂移,向上調;如果動作看起來僵硬或角色無法轉頭,向下調。把這項設定當作每鏡頭的旋鈕,而不是全域常數,因為合適的值取決於該鏡頭要求角色移動與轉頭的幅度。
兩種情況需要離開這個區間。角色遠離相機的快速動作鏡頭,可能需要略高的值才能在運動中保住身分。希望以不同視覺風格渲染角色的風格化鏡頭,可能需要略低的值讓風格透出來。兩種情況下,每次只改一個變數,這樣你才能把結果歸因到具體原因。
用重現角色搭建多鏡頭序列
多鏡頭序列正是角色一致性大顯身手的地方。每個鏡頭都是一次獨立的 MiniMax H3 生成,附上規範參考,序列由參考維繫,而非靠運氣。在渲染之前先把序列規劃成鏡頭清單,是把一段連貫作品與一堆雜亂片段區分開的關鍵。
建立鏡頭清單
在任何生成之前,把序列寫成一張表,每個鏡頭佔一行。對每個鏡頭,記下鏡頭號、景別(全景、中景、特寫)、運鏡、動作、場景、所附的參考。參考列是負責執行一致性的列:同一個角色參考出現在每一行,鏡頭專屬參考(產品、地點、換裝)只在相關行出現。
一段三鏡頭角色序列的最小鏡頭清單可能長這樣:
- 鏡頭 1(全景): 角色走進廚房,走到流理台前,晨光。參考:角色正面圖、廚房場景。
- 鏡頭 2(中景): 角色在流理台前,打開一個盒子,作出反應。參考:角色正面圖、產品圖。
- 鏡頭 3(特寫): 角色的臉,微微一笑。參考:角色正面圖,如有四分之三角度參考也一併附上。
每一行都帶角色參考,只有輔助參考在變化。正是這種結構讓剪輯能夠成立。
渲染之前先做分鏡
關於多鏡頭一致角色的「免訓練影片分鏡」的學術研究為這個方向提供了支撐,而實操版本其實很直白:先把每個鏡頭作為單張圖像來畫或來描述,生成這些靜幀,把它們作為序列一併批准,再把渲染預算花到影片上。靜幀比影片便宜,能讓你一眼檢查連貫性,並在之後動畫化鏡頭時成為首影格參考。

這裡的紀律是:把序列當作序列來審查,而不是當作獨立圖像。把批准的靜幀並排放在一起,問一個問題:這個角色在所有靜幀裡讀起來是同一個人嗎?如果是,進入影片階段;如果不是,先修參考,別在不成立的序列上燒影片預算。
按順序、在同一工作階段裡渲染鏡頭
如果可以,把鏡頭按故事順序在同一工作階段裡渲染。模型與設定會隨時間漂移,相隔數天渲染會引入打破連貫性的變異數,哪怕參考保持不變。在同一工作階段、用同一參考與同一設定渲染,是通向一致序列最可控的路徑。
實戰案例:角色一致性的真實應用
三個實戰案例展示這套方法如何適配不同形式。每個案例都從同一個根基起步:每個鏡頭附上規範角色參考,提示詞只描述調度。
案例一:三鏡頭產品廣告,帶一位固定代言人
一家護膚品牌需要一條三鏡頭社群廣告,由一位代言人手持並評價一罐面霜。角色參考是一張代言人乾淨的正臉肖像。產品參考是單獨一張罐子靜幀圖,只在產品出現的鏡頭中附上。
- 鏡頭 1(中景): 代言人走入畫面,手中拿著產品。參考:角色正面圖、產品靜幀。
- 鏡頭 2(特寫): 代言人擰開蓋子。參考:角色正面圖、產品靜幀。
- 鏡頭 3(中近景): 代言人對著鏡頭說話。參考:僅角色正面圖。
因為角色參考在三個鏡頭中完全相同,產品參考只在產品可見時出現,剪輯就既保住了代言人身分,又讓產品乾淨地出現與消失。按 MiniMax H3 已核驗的費率(2K 每秒 $0.13,768P 每秒 $0.09),三段六秒 2K 鏡頭大約花費 $2.34,讓這種形式非常適合低成本反覆運算。
案例二:Reels 系列中的固定角色
一位創作者希望在一檔每週更新的短 Reels 系列中使用同一位動畫主持人。主角設計法直接適用。第一次工作階段用於設計並把主角鎖定為一張規範的正臉參考。之後每集都從這張參考起步,配合每集一段描述主題、場景與動作的提示詞。
參考圖每週都不變,這正是整個意義所在。觀眾能在各集之間認出主持人,因為主持人字面上就是同一張臉,作為同一個檔案被餵入。透過輔助參考,穿搭與場景可以按集變化,但身分保持鎖定。對一檔播幾十集的系列來說,這是「一個可辨識的角色」與「一隊撞臉替身」之間的差別。
案例三:多鏡頭故事場景
一段短敘事場景需要一位角色跨五個鏡頭:走進房間、坐到桌前、對一通電話作出反應、站起、離開。角色參考附到每個鏡頭。廣鏡頭中附上場景參考(同一個房間、一致角度)。任何影片渲染前都先建立鏡頭清單,靜幀作為序列一併批准後再做動畫。
這裡最棘手的是反應鏡頭:角色的表情要變,身分不能變。解決辦法是把角色參考保持在標準影響強度,在提示詞中描述新表情,讓其他所有不變項繼續由參考承載。參考保住臉,提示詞提供情緒。
常見失效與修復方法
角色一致性工作以可預測的方式失效。大多數失效都能追溯到參考、提示詞或兩者之間的互動。
參考圖品質差
模糊、過暗或極端角度的參考無法鎖定身分,因為模型無法清晰讀取面部。輸出會漂移,因為模型必須把參考隱藏的細節自行腦補出來。解決辦法是用均勻打光、相機正對眼睛高度、表情中立來重新生成參考。參考是測量工具,請把它當測量工具對待。
相互衝突的參考
兩張不同臉的角色圖,或一張穿搭與穿搭參考相衝突的角色參考,會迫使模型仲裁。仲裁表現為閃爍與漂移。解決辦法是渲染前審查參考集合,確保每一項屬性都由唯一一個參考定義。如果需要換裝,換穿搭參考,而不是身分參考。
在提示詞中重新描述角色
當參考圖已經定義了她,卻在提示詞裡寫「黑色短髮綠眼睛的女性」,會邀請模型重新詮釋。模型會同時讀這兩路輸入並嘗試同時滿足,可能把臉從參考上拉走。解決辦法是一旦附上參考,就從提示詞中完全移除身分描述,讓參考履行它的職責。
長寬比或構圖錯誤
用 9:16 拍的參考用於 16:9 的輸出,可能讓人臉變形或裁掉辨識特徵。解決辦法是按你打算交付的長寬比生成參考,或採用頭肩構圖,能在不同比例的裁切下倖存。
破壞身分的動作
快速旋轉、遮擋(一隻手從臉前劃過)與極端的頭部轉動,會讓模型在片段中途丟失面部,並在面部重新出現時重建一張略微不同的臉。解決辦法是規劃鏡頭時讓面部在動作中至少部分可見,把極端轉頭留到面部不是焦點的時刻。如果某個鏡頭必須靠動作打破身分,在剪輯中繞開斷裂處剪,不要試圖把臉硬撐過斷裂。
MiniMax H3 角色工作提示詞範本
多鏡頭序列的成本
MiniMax H3 的定價讓多鏡頭角色工作可以低成本反覆運算。已核驗費率為:原生 2K 每秒 $0.13,768P 每秒 $0.09。一段六個鏡頭、每個六秒的 2K 片段大約花費 $4.68;同序列在 768P 大約 $3.24。這便宜到足夠渲染多個變體再挑出最佳鏡頭,而這正是做角色一致性工作的正確方式。
一種有用的預算模式是:在 768P 上反覆運算,在 2K 上定稿。用 768P 跑測試渲染,檢查參考能否鎖定、序列能否剪到一起。一旦參考與鏡頭清單穩定下來,再用原生 2K 渲染最終序列。這樣能壓低反覆運算成本,把更高保真、更高成本的渲染留給你真正會發佈的輸出。
每秒價格隨片段長度線性變化,所以每個鏡頭在故事允許的範圍內盡量短。一段角色一致性測試不需要十五秒的片段。五到六秒通常足以判斷面部是否穩得住,2K 下每鏡頭成本不到一美元。
MiniMax H3 角色一致性常見問題
保持角色一致需要多少參考?
一張乾淨的正臉圖就足以鎖定許多鏡頭的身分。三到五張不同角度的圖(正面、四分之三、側面)能給模型更多依據,提升轉頭時的一致性。把 12 檔案預算的其餘部分分配給穿搭、場景、動作與音訊,前提是每一項都帶來不衝突的約束。
可以用真人照片做角色參考嗎?
可以。真人照片可以作為主體參考式輸入使用。照片應當高解析度、打光均勻、無遮擋,主體在畫面中佔據足夠大的比例。從同一張照片生成三到五個測試片段,檢查主體是否在所有片段中都保持住,再據此搭建序列。發佈前請確保你擁有真人肖像的使用權。
主體參考適用於產品或吉祥物這類非人類主體嗎?
適用。機制相同。提供一張產品、吉祥物或物體的乾淨參考圖,模型就會把它的外觀跨鏡頭延續。這對必須在一段序列中保持完全相同形象的品牌角色與產品廣告尤其有用。同樣的規則適用:一張清晰參考,無衝突輸入,影響強度從 65% 到 75% 區間起步。
一段多鏡頭角色序列成本是多少?
按已核驗費率(2K 每秒 $0.13,768P 每秒 $0.09),六個六秒鏡頭的序列在 2K 下約 $4.68,768P 下約 $3.24。在 768P 反覆運算、在 2K 定稿,能在壓低總成本的同時,把高保真渲染留給你打算發佈的剪輯。
MiniMax H3 有免費選項嗎?
最快的免程式碼路徑是託管的 MiniMax H3 工具,它透過 UI 運行同一套參考系統,無需任何設定。免費額度與入門福利會輪換更新,所以製作時請查閱當前的額度指南了解可用福利。MiniMax H3 免費額度指南
這套方法對跨多個獨立影片的重現角色也適用嗎,而不只是一段序列?
適用。主角設計法正是為這種情況設計的。一次性鎖定規範參考,然後在系列中每段新影片的第一個鏡頭上都附上它。角色會在相隔數週或數月發佈的獨立影片中讀作同一個人,因為臉每次都作為同一個檔案被餵入。
影響強度應該從多少起步?
用一張乾淨的正臉參考時,從 70% 起步。如果臉在片段中漂移,向上調;如果動作看起來僵硬,向下調。把這項設定當作每鏡頭的旋鈕,而不是全域常數,因為合適的值取決於該鏡頭要求角色移動與轉頭的幅度。
結語:讓參考承擔這份工作
角色一致性這件事,從你停止用文字描述角色、改用參考檔案提供它的那一刻起,就不再是賭運氣。MiniMax H3 的 12 檔案多模態預算與原生多鏡頭一致性正是為這套工作流程而生,主角設計法給你一條可重現的路徑:設計主角,生成一張乾淨的正臉參考,把這張參考附到每個鏡頭上。在最終確定前測試三到五個變體,把影響強度設定在 65% 到 75% 區間,讓提示詞只承載調度。臉,每次都來自檔案。
下一步是把這套方法落在一個真實專案上。挑一個角色,建立規範參考,用 768P 跑一段三鏡頭序列測試剪輯,參考鎖定後再用原生 2K 定稿。
PixMind MiniMax H3 影片工具 MiniMax H3 爆款影片指南 MiniMax H3 免費額度指南
本指南中的規格、定價與能力已於 2026-08-01 對照 MiniMax 官方部落格、MiniMax 平台文件、OpenRouter、Vercel AI Gateway 與 EvoLink 完成核驗。社群工作流程細節(主角設計法、65% 到 75% 影響強度區間、單圖約 95% 一致性的觀察)反映創作者與業界實踐,並非正式基準。模型卡與費率卡變化很快,請在製作前始終在你的路由中確認即時數值。



