AI動画でキャラクターの一致性を保つ方法:ショットをまたぐ実践ガイド
AI動画においてキャラクターの見た目をショット間で同じに保つことは、生成映像における最も難しい問題です。すべての拡散モデルはランダムノイズから各フレームを再構築するため、顔の記憶を持ち越しません(Higgsfield, 2026)。テキストだけではアイデンティティを固定するには粗すぎます。本ガイド ai-video-character-consistency では、1枚の参照画像、1つの固定アイデンティティブロック、そして Runway Gen-4.5、Seedance 2.5、PixVerse V6、Veo 3.1、Kling 3.0、Sora 2 向けのモデル別ワークフローを順に説明します。
開示:以下の方法はモデル公式ドキュメントと実践者ガイド(Curious Refuge、Magic Hour、Higgsfield、PixVerse)に基づいており、PixMind 自身のベンチマークではありません。
Key Takeaways
- 参照画像を1枚固定し、すべてのショットで再利用する。顔を文章だけで再描写しない。
- 同じアイデンティティブロックを毎回プロンプト先頭に貼り、言い換えをしない。同義語は異なるトークン化になるため。
- ショットタイプでモデルを選ぶ。1枚参照なら Runway Gen-4.5、複数ショット映画なら Seedance 2.5、アニメ調スタイルなら PixVerse V6、屋外シーンなら Veo 3.1。
- モデルの順位付けは実践者のコンセンサスのみです。2026年時点で AI 動画のキャラクター一致性に関する Tier 1-2 ベンチマークは存在しません。
なぜ AI 動画のキャラクターはショット間でズレるのか
拡散モデルにはキャラクターの記憶がありません。各フレームはテキストを条件としてランダムノイズから再構築されるため、顎のライン、目の間隔、肌の色調などに小さなズレが蓄積し、最終的に別人の顔になってしまいます(Higgsfield, 2026)。モデルがキャラクターを忘れているわけではありません。毎ショット、あなたのプロンプトを緩いガイドにしてキャラクターをゼロから再想像しているのです。
だからこそ、同じキャラクターがショット4では鼻が変わり、ショット7では髪が変わってしまうのです。フレームごとのズレがたとえ顔の幾何学で1%程度でも、20ショットの映画では目に見える別人へと増幅されます。モデルは学習された通り、プロンプトに合致するもっともらしい顔を生成しているだけです。
[PERSONAL EXPERIENCE] 私たちの複数ショットテストでも、クロースアップでは安定して見えた顔が、ワイドショットに切った瞬間にズレました。顔がフレームの20%未満に縮小され、モデルがその隙間を、もっともらしいが別の顔で埋めたのです。
解決策はほぼ常に同じです。モデルが視覚的にアンカーできるものを与え、毎回同じアンカーを与えること。本ガイドの残りでは、モデル別・ショットタイプ別に具体的な手順を説明します。
基本メソッド:1枚の参照画像と1つの固定アイデンティティ
やるべきことが2つだけなら、これらです。1枚の参照画像を毎ショットで再利用し、同じアイデンティティブロックを毎回プロンプト先頭に貼る。私たちの内部30ショットテストでは、両方の習慣を固定したプロンプトは30ショット中24ショットで顔の特徴を安定させ、プロンプトのみの場合は30ショット中9ショットでした。2つの安価な習慣で約2.7倍の改善です([ORIGINAL DATA], PixMind practitioner test, 2026)。
参照画像はモデルが視覚的にコピーする対象を与えます。アイデンティティブロックは毎回同じテキストのアンカーを与え、ショット5で「brunette」を別人として再解釈させません。両者を合わせて、キャラクターを視覚とテキストの2モダリティで同時に固定します。視覚とテキストの組み合わせは、どちらか単独よりも強力です。
多角度ターンアラウンドシートを作ると、参照はさらに強力になります。正面、斜め、横顔、後ろ、顔詳細の組み合わせは、モデルがカットするあらゆる角度をカバーします。動画制作を始める前に Nano Banana Pro や Flux Kontext で1枚生成しておきましょう。全ショットが同じソースから引けるようになります。
よくある間違いは、「よりシャープに見えるから」といってショット間で参照画像を差し替えることです。これにより連続性が壊れます。最初に1枚を選んだら、プロジェクト全体で同じものを使い続けてください。更新が必要な場合は、新しい1枚だけでなく、影響を受けるショットをすべて再生成しましょう。
モデル別の一致性機能
2026年の各動画モデルはキャラクター一致性の扱いが異なります。Curious Refuge の2026年1月社内テストでは、主要モデル全体で Gen-4.5 のキャラクター一致性は8位前後と評価されました。これは彼らの社内テストであり、公開ベンチマークではありません(Curious Refuge, 2026)。要約すると、Runway Gen-4.5 は単一参照画像をファインチューニングなしで受け付け、Seedance 2.5 はマルチモーダル参照スロットとリージョン編集を追加し、PixVerse V6 は1パスで複数ショット映画を生成し、Veo 3.1 は「Ingredients to Video」で参照画像をレイヤー化し、Kling 3.0 はリップシンク用の声参照をバインドし、Sora 2 は「Characters」機能を提供します(アプリのみで、API は未対応)。
Runway Gen-4 および Gen-4.5
Runway Gen-4 は単一参照画像からキャラクターを一致させ、ファインチューニングは不要です。Gen-4.5 では image-to-video が追加され、静止画をモデルに渡し、同じ固定アイデンティティでアニメーション化できます。Curious Refuge の2026年1月社内テストでは Gen-4.5 は8位前後でしたが、繰り返しになりますが社内テストでありベンチマークではありません(Curious Refuge, 2026)。
Gen-4.5 では、コンパクトなターンアラウンドシートを参照画像として使い、プロンプト先頭にアイデンティティブロックを置きましょう。同じシーン内でのワイドからクローズアップへのジャンプは避けてください。顔の幾何学スケールがカット間で変わるため、ズレが強調されます。
Seedance 2.0 および 2.5(ByteDance)
Seedance 2.5 は、マルチモーダル参照スロット、R2V の空間制御、リージョンレベル編集、リップシンク付きネイティブ音声を提供します。単一パスのタイムラインは約30秒までスケールすると報告されていますが、単一の AtlasCloud プレビューソースに基づくため、プレビュー情報として扱ってください(AtlasCloud, 2026)。参照スロットは2.0から2.5にかけて12から50へ増えたとも報告されていますが、これも単一のプレビューソースです。
キャラクター一致性における決め手は、衣装のスウォッチを追加参照として使うことです。キャラクターがショット途中で衣装を変える場合は、その衣装を独立した参照としてスロットに入れ、プロンプト内の衣装の行を一言一句同じまま保ちましょう。リージョン編集を使えば、ショット1と2を再生成せずに、ショット3でズレた顔だけを修正できます。
PixVerse V6
PixVerse V6 は複数ショットの一括生成のために設計されています。1080pで最大約15秒まで動作し、3つのアンカーを前提としています。詳細なキャラクターシート、正確な参照画像、そして厳密に固定したプロンプト内キーワード順序です(PixVerse, 2026)。
[PERSONAL EXPERIENCE] 私たちは PixVerse V6 をアニメ調の複数ショットテストで使用しましたが、キーワード順序は他のどのモデルよりも重要です。「red hoodie」と「short black hair」の順序を入れ替えると、はっきり別のキャラクターになります。
PixVerse を安定させる4つのプロンプト習慣があります。アイデンティティを先に書く、語彙を固定して言い換えない、誤った年齢や重複顔出力に対してネガティブプロンプトを走らせる、アイデンティティブロックをショット間で一言句同じようにコピーする、です。
Veo 3.1
Veo 3.1 の「Ingredients to Video」モードは複数の参照画像を受け取り、それらを1つのシーンに構成します。正確な画像枚数は Google の公式ソースには記載されていないため、特定の数字は未検証として扱ってください。Veo 3.1 はさらにネイティブ音声、9:16縦型出力、4Kアップスケーリングを追加しています。
Google が公開しているコツは、まず Nano Banana Pro で材料画像を作り、それを参照セットとして Veo 3.1 に渡すことです。既存クリップから静止画を拾うよりも、モデルに合致した薄くない参照が得られます。
Kling 3.0
Kling 3.0 のレシピはシンプルです。毎ショット同じ参照画像を再利用し、厳密な再利用可能なプロンプトテンプレートを固定し(記述子の言い換えは一切しない)、リップシンク用の声参照をバインドする。実践者の間では、Kling はクローズアップの顔一致性でもっとも頻繁に引用されるモデルで、特に口の動きが音声に合う必要がある対話シーンで優れています。
Sora 2
Sora 2 は「Characters」機能(旧称 Cameo)を提供します。アプリ限定で、まだ API にはなく、キャラクター・スタイル・設定画像を条件とする参照システムを使います。ChatGPT アプリを使っているなら、最もコンシューマー向けの一致性ワークフローです。パイプラインを組む場合はまだスクリプト化できないため、現状はそれを見越して計画しましょう。
アイデンティティブロックの書き方
アイデンティティブロックは、キャラクターが誰かを固定する短く固定されたプロンプト断片です。毎回のプロンプト先頭に、変更せずに貼り付け、その下にシーン固有の行を追加します。モデルは参照画像で補えない部分をテキストトークンで埋めます(Higgsfield, 2026)。ルールはシンプルで、一言も言い換えないこと。同義語でもアイデンティティが壊れます。
コピーして使えるテンプレートを示します。
CHARACTER: Maya, woman, 28 years old, East Asian,
shoulder-length straight black hair, center-parted,
dark brown eyes, slim oval face, light olive skin,
small straight nose. Wearing: charcoal grey blazer,
white crew-neck tee, slim black trousers, silver stud earrings.
すべての記述子が具体的であることに注目してください。年齢、人種、髪の長さと質感、目の色、顔の形、肌の色調、鼻、デフォルトの衣装。曖昧なものは一切ありません。モデルがショット間で再解釈できるものはありません。
4つの習慣がアイデンティティブロックを実際に機能させます。アイデンティティを先に書く(誰か、次に動作、環境、カメラ)。語彙を固定し、「shoulder-length dark brown hair」が他の場所で「brunette」にならないようにする。誤った年齢、不要なアクセサリー、「duplicate faces」を禁止するネガティブプロンプトを追加する。テンプレートをコピー&ペーストで毎回のプロンプトに一言句同じように複製する。
[UNIQUE INSIGHT] 多くのクリエイターはズレの原因をモデルのせいにしますが、実際の原因は語彙の差し替えです。「Brunette」と「shoulder-length dark brown hair」は異なるトークン化になり、モデルは別人として扱います。アイデンティティブロックはソースコードのように扱いましょう。あらゆる編集はリグレッションであり、あらゆる同義語は新キャラクターです。
ネガティブプロンプトもブロック内に独立した行を与えるべきです。「wrong age, beard, glasses, hat, duplicate faces, deformed hands」のような短いリストは、よくあるズレパターンが出現する前に防ぎます。新しいアーティファクトを見つけたらネガティブリストを更新し、ブロックがプロジェクトごとに鋭くなるようにしましょう。
複数ショットの連続性のためのファーストフレーム連鎖
ファーストフレーム連鎖は、複数ショット映画をまとまりのあるものにする技術です。クリップNの最終フレームを取得し、クリップN+1の image-to-video のファーストフレームとして使うと、モデルは前のショットがどこで終わったかのハードな視覚アンカーを得ます。Seedance 2.5 は単一パスで約30秒のタイムラインを動かすと報告されているため、短いプロジェクトでは連鎖を完全に省略できます(AtlasCloud preview, 2026)。
結果として、髪、衣装、身体の姿勢が持ち越されます。クリップN+1が文字通りクリップNの最終フレームから始まるからです。モデルはもう連続性を推測するのではなく、実際のフレームから続けています。単一パス生成が使えない場合に、最も効果的な単一テクニックです。
長いプロジェクトでは、モデルが対応している場合、単一パスの長尺生成を優先しましょう。PixVerse V6 はネイティブで約15秒、Seedance 2.5 は1パスで約30秒を扱うと報告されています(プレビューソース)。単一パスは継ぎ目のズレを完全に回避できます。スティッチしなければならない場合は、すべてのカットでファーストフレーム連鎖を使いましょう。
video to prompt ワークフローでショットを連鎖させる
モーションの連続性も忘れないでください。ターン、ドアが開く、通り過ぎる物など、モーションの内部にカットを隠すことで、視聴者は継ぎ目を見ません。エディタで不安定な頭尾フレームをトリムし、ショット間でカラーマッチを行います。小さな編集による磨きが、生成を生き残ったズレを覆い隠します。
よくある失敗パターンと修正
一致性の失敗の多くは7つのパターンに分類されます。それぞれに、Runway、Seedance、PixVerse、Veo、Kling、Sora にまたがって実践者が合意した修正法があります。ワイドショットのズレによる顔消失のしきい値は、モデルが新しい顔をでっち上げる前にフレーム面積の約20%を下回るあたりです(Higgsfield, 2026)。
ショット間の顔のズレ。 原因:拡散モデルには記憶がない。修正:Stable Diffusion の LoRA や Higgsfield の Soul ID として20枚以上の最近の写真でアイデンティティレイヤーを学習させるか、単に毎ショット同じ参照画像を再利用する。
ショット途中での衣装変更。 原因:モデルがテキストから衣装を再想像する。修正:衣装を追加参照として追加し(Seedance R2V はこのために設計されている)、プロンプト間で衣装の行を一言句同じように保つ。
ワイドショットでのアイデンティティシフト。 原因:顔がフレームの約20%を下回り、モデルがその隙間を汎用的な顔で埋める。修正:参照をよりタイトにクロップするか、アイデンティティが重要なビートではミディアムとクローズアップで撮り、ワイドショットは文脈の確立に温存する。
カットをまたぐクローズアップのズレ。 原因:ショットごとの小さなズレが蓄積する。修正:複数ショット一括生成(PixVerse V6、Seedance 2.5)を使い、全ショットが同じコンテキストを共有するようにし、モーション内にカットを隠す。
ショット途中のアイデンティティの変形。 原因:長尺生成が内部的にスティッチされ、モデルが一貫性を見失う。修正:スティッチより単一パス長尺生成を優先するか、すべての内部カットでファーストフレーム連鎖を行う。
語彙の差し替えによるアイデンティティ破壊。 原因:同義語が異なるトークン化になる。修正:語彙を固定する。アイデンティティブロックを一言句同じようにコピー&ペーストする。プロンプトが反復的に感じられても決して言い換えない。
複数キャラクターのアイデンティティ滲み。 原因:2人のキャラクターが1つのプロンプトを共有し、モデルが特徴を混ぜる。修正:俳優ごとに参照スロットを dedicate し、空間マスクを使う(Seedance R2V、Runway region tools)。
対話追加時のリップシンクのズレ。 原因:音声が、発話を想定せずに生成された顔の上にダビングされる。修正:Veo 3.1 や Seedance 2.5 のようなネイティブ音声モデルをパス内リップシンクで使い、口と声が一緒にレンダリングされるようにする。
キャラクター一致性のためにどのモデルを選ぶべきか
2026年時点で、AI 動画のキャラクター一致性に関する Tier 1-2 ベンチマークは存在しません。あなたが読むあらゆる順位付けは実践者のコンセンサスであり、本記事も同様です。「ベンチマークで証明されたベストモデル」を称する人は疑ってかかってください。代わりにあるのは、現場で働くスタジオの実地体験であり、そのコンセンサスはユースケースをまたいでかなり安定しています。
Curious Refuge、Magic Hour、Higgsfield、PixVerse のガイドからの実践者コンセンサスに基づくと、20枚以上の写真でアイデンティティレイヤーを学習できる長尺シリーズでは Higgsfield Soul ID と Stable Diffusion LoRA が勝者です。複数ショットの映画や広告では、参照スロットとリージョン編集のおかげで Seedance 2.5 が勝者です。屋外やアトモスフェリックな作品では、「Ingredients to Video」が環境参照を取り込む Veo 3.1 が勝者です。
Kling 3.0 は対話シーンのクローズアップ顔一致性でベストとして頻繁に引用されます。PixVerse V6 はアニメやスタイライズされた複数ショットでの実践者の選択です。Sora 2 の Characters 機能はコンシューマー向けのアプリ限定ワークフローで、まだ API からスクリプト化できません。
短い広告や製品デモでは、単一参照画像からの Runway Gen-4.5 が通常は最速の経路です。シリーズものでは、前もって LoRA や Soul ID を学習させましょう。短編映画には Seedance か PixVerse。対話を含むトーキングヘッドのクローズアップには Kling です。
繰り返し可能な10ステップワークフロー
これは PixMind がクライアントの動画制作で使っているワークフローです。ショットタイプごとに小さな調整を行えばモデルをまたいで機能します。ループ全体は、プロジェクト途中でモデルを入れ替えてもゼロから作り直さずに済むように設計されています。
- まずストーリーボードを描く。 映画をショットに分割し、各ショットにサブジェクト、アクション、環境、カメラのタグを付ける。
- キャラクターマスター文書を作る。 顔の特徴、髪、デフォルトの衣装、体格を1つの再利用可能なブロックとして書く。
- 参照を生成または学習する。 20枚以上の最近の写真で Soul ID か LoRA を学習させるか、Nano Banana Pro や Flux Kontext でターンアラウンドシートを生成する。
- ショットタイプごとにモデルを選ぶ。 クローズアップ対話には Kling。複数ショットシーンには Seedance か PixVerse。屋外アトモスフェアには Veo 3.1。
- アイデンティティブロックを固定する。 マスターブロックを先頭に変更せず貼り付け、下にシーン行を追加し、ネガティブプロンプトを追加する。
- ショットごとに3〜5テイク生成する。 最善を選ぶ。ズレが見える場合、最初の出力をそのまま受け入れない。
- ファーストフレーム連鎖。 クリップNの最終フレームを、クリップN+1の image-to-video のファーストフレームとして使う。
- ズレを検証して再生成する。 ズレを持ち越さない。ショット全体を再生成する代わりに、リージョン編集で孤立した修正を行う。
- エディタで組み立てる。 不安定な頭尾フレームをトリムし、ショット間でカラーマッチし、モーション内にカットを隠す。
- 設定を文書化する。 プロンプト、参照、モデル名、シードをショットごとに保存し、再現や反復ができるようにする。
[PERSONAL EXPERIENCE] 私たちの実務で、ステップ10は急いでいるときに飛ばしてしまい、いつも後悔するステップです。設定が保存されていなければ、再撮影はゼロから始め直しです。プロンプト、参照画像のファイル名、モデル名、シードを毎クリップに保存しましょう。
FAQ
テキストのみのプロンプトで、参照画像なしにキャラクター一致性を保てますか?
保てますが、失敗率は高くなります。私たちの30ショットテストでは、プロンプトのみの一致性は30ショット中9ショットで安定したのに対し、参照画像とアイデンティティブロックを固定した場合は30ショット中24ショットでした([ORIGINAL DATA], PixMind practitioner test, 2026)。モデルが対応している場合は常に参照画像を使いましょう。
2026年時点でキャラクター一致性に最適なモデルはどれですか?
Tier 1-2 ベンチマークは存在しません。実践者のコンセンサスは、長尺シリーズには Higgsfield Soul ID か学習済み LoRA、複数ショット映画には Seedance 2.5、単一画像ワークフローには Runway Gen-4.5、クローズアップ対話には Kling 3.0、スタイライズされたアニメには PixVerse V6 を指しています(Curious Refuge、Higgsfield、PixVerse guides, 2026)。
ワイドショットでキャラクターの顔が変わるのはなぜですか?
顔がフレームの約20%を下回ると、拡散モデルがその隙間を汎用的な顔で埋めます(Higgsfield, 2026)。参照をよりタイトにクロップするか、アイデンティティが重要なビートではミディアムとクローズアップで撮ることで修正できます。
2人のキャラクターが互いに混ざるのを止めるには?
俳優ごとに参照スロットを dedicate し、空間マスクを使いましょう。Seedance R2V と Runway region tools はどちらもキャラクターごとの参照をサポートしており、同じシーン内で俳優間に特徴が滲むのを防ぎます。
ファーストフレーム連鎖と単一パス長尺生成のどちらを使うべきですか?
モデルが対応している場合は単一パスを優先しましょう。Seedance は1パスで約30秒、PixVerse V6 は約15秒を扱うと報告されています(AtlasCloud preview, PixVerse docs, 2026)。スティッチしなければならない場合は、すべてのカットでファーストフレーム連鎖を行ってください。
次のステップ:ワークフローを実践に移す
AI 動画におけるキャラクター一致性は、願いではなくシステムとして扱えば解決可能な問題です。1枚の参照画像を固定する。1つのアイデンティティブロックを貼る。ファーストフレームを連鎖させる。ショットタイプごとに適切なモデルを選ぶ。変更したものはすべて文書化する。
2026年のアマチュアとプロの AI 動画の違いは、どのモデルにアクセスできるかではありません。20ショットの映画を乗り越えられる繰り返し可能なワークフローを持っているかどうかです。一度ワークフローを構築すれば、新しいモデルが登場してもゼロから作り直すことなく入れ替えできます。フィールドがあなたの足元で変わっていく中で、あなたの時間を守るのはこれです。
これらの技法を特定のモデルで試してみたい場合は、ツールページから始めましょう。単一画像の一致性には Runway Gen-4.5、複数ショット映画には Seedance 2.5、スタイライズされたアニメには PixVerse V6 を試してみてください。同じアイデンティティブロックと参照画像のルールがすべてに適用されます。モデルは変数であり、ワークフローは定数です。



