🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: マルチモーダル参照ビデオ生成ガイド

目次

Wan 2.7 R2V: マルチモーダル参照ビデオ生成ガイド

主なポイント

  • Wan 2.7 の参照ビデオ生成 (R2V) は、1回の呼び出しで最大5枚の参照画像、5つの参照クリップ、1つの参照オーディオを受け付けます。これは、現在の1080Pモデルの中で最も広範なマルチモーダル入力マトリックスです。
  • R2Vは、ショット間の同一性保持、音声クローン、スタイル継続に適したモードであり、単発のBロールやシンプルな製品スピンには向きません。
  • 参照の競合は失敗の最大の原因であり、ほとんどは4段階の準備-設定-記述-レンダリングのワークフローに従うことで防ぐことができます。
  • このモードに関連するより詳細なプロンプトライブラリについては、PixMind の参照ビデオプロンプトクラスターを参照してください。

Wan 2.7 R2Vとは?

R2Vはreference-to-videoの略で、Wan 2.7のモードの一つです。これは、混合された参照入力を受け取り、それらの入力から同一性、音声、またはスタイルを保持した新しいクリップを生成します。Alibaba Cloud の Wan 2.7 R2V APIリファレンスによると、1回のR2V呼び出しで最大5枚の参照画像、5つの参照クリップ、1つの参照オーディオトラックを受け付け、出力は1080P、10秒に制限されます。

What separates R2V from image-to-video is multimodal conditioning. I2V locks the start frame and lets the model invent motion. R2V instead extracts attributes from your references, things like face structure, wardrobe, voice timbre, color grade, and propagates them into a fresh generation. This is why we treat R2V as a different workflow, not a fancier I2V。

R2Vは、PixMind の統合されたWan 2.7 ビデオジェネレーターインターフェース内にあります。これにアクセスするためにモデルを切り替える必要はありません。入力パネルで参照を添付すると、ルーターがR2Vを選択します。

引用カプセル: Wan 2.7 R2V (reference-to-video) は、1回のAPI呼び出しで最大5枚の参照画像、5つの参照クリップ、1つの参照オーディオを受け付け、最大1080P、10秒のMP4を出力し、ショット間の同一性、音声、スタイルの保持に使用されます (Alibaba Cloud Model Studio, 2026)。

R2Vが受け付ける入力とは?

R2Vは3種類の入力クラスを受け付け、同じ呼び出しでそれらを混在させることができます。Alibaba Cloud のビデオ生成概要には、入力配列スキーマが記載されています。各スロットの機能と、いくつ渡せるかについての実用的な内訳を以下に示します。

入力スロット 最大数 伝達する内容 必須?
参照画像 5 顔、製品、服装、カラーグレーディング いずれかの入力が1つ以上
参照ビデオ 5 動きのスタイル、タイミング、シーンの連続性 オプション
参照オーディオ 1 声の音色、リズム、環境音 オプション
テキストプロンプト 1 被写体、アクション、カメラ、スタイル 必須

テキストプロンプトは常に必須です。モデルはそれを生成の骨格として使用し、その上に参照由来の属性を重ねます。プロンプトがない場合、モデルはレンダリングするシーンを持たず、呼び出しは失敗します。

覚えておくべきいくつかの制約があります。参照ビデオはそれぞれ10秒に制限されており、出力期間は渡された最短の参照ビデオを超えることはありません。参照オーディオは、5秒から30秒のクリーンなWAVまたはMP3である必要があります。これより短い場合はパディングされ、長い場合は切り捨てられます。

入力スロットの相互作用

各スロットは異なる出力軸に影響を与えます。画像は外観を駆動します。ビデオは動きを駆動します。オーディオは、顔がある場合に音声とリップシンクを駆動します。2つのスロットが競合する場合(例えば、金髪の被写体の参照画像と黒髪の被写体の参照ビデオがペアになっている場合)、モデルはどちらか一方を選択し、もう一方を無視しますが、その選択は常に予測できるとは限りません。

私たちのテストでは、競合する参照は同じシードでの再実行でも一貫性のない選択を生み出します。参照の競合は非決定論的であるとみなし、ソースでそれらを取り除くようにしてください。

R2Vはいつ使用すべきか?

R2Vは、生の速度よりもショット間の連続性が重要である場合に適切な選択です。私たちは3つの特定の状況でこれを使用します。

マルチショットシーンでの同一性保持。 ワイド、ミディアム、クローズアップで同じキャラクターが必要な場合、R2Vは各アングルにつき1枚の強力な参照画像を使用することで、顔の構造を一貫させます。I2Vは毎回顔を再生成し、ずれが生じます。

新しいシーンへの音声クローン。 画面上のアバターと一致させる必要がある録音済みのナレーションがある場合、参照オーディオと参照ポートレートを使用したR2Vは、オーディオ駆動型I2Vよりも優れた性能を発揮します。声の音色が引き継がれ、リップシンクは同じ話者として認識されます。

アセット間のスタイル継続。 既に1つのクリップを公開しており、カラーグレーディング、服装、ペースが一致する続編が必要な場合、最初のクリップを参照ビデオとして使用するR2Vが最も速い方法です。テキストからビデオへの変換では、説明だけでは特定のルックを再現することはできません。

R2Vを避けるべき時

R2Vは単発の作業には過剰です。単一の製品スピンが必要なだけであれば、I2Vのファーストフレームモードの方が高速で安価です。R2Vは参照条件付けパスのため、I2Vよりも1秒あたりのクレジット消費量が多くなります。

参照の品質が低い場合はR2Vをスキップしてください。モデルには、ぼやけた写真やノイズの多いオーディオクリップを「改善」する方法はありません。Wan 2.7の他のどの部分よりも、「ゴミを入れればゴミが出る」の原則が強く当てはまります。

純粋に抽象的な動きにはR2Vをスキップしてください。テキストからビデオへの変換は、参照のオーバーヘッドなしで雲、粒子、夢のシーケンスを処理します。

参照アセットの準備方法

参照の品質は、R2Vの出力品質を予測する最大の単一要因です。クリーンな1080Pの参照画像は、メッセージングアプリを介して2回圧縮された4K画像よりも優れた性能を発揮します。

参照画像。 1枚の強力なヒーロー画像をアンカーとして使用してください。正面向き、均一な照明、ニュートラルな背景、フレーム内に他の被写体がないこと。追加する必要がある場合は、異なる被写体ではなく、同じ被写体の角度違いにしてください。

参照ビデオ。 モデルに学習させたい正確な動きに合わせてトリミングしてください。1つの明確なジェスチャーを含む3秒のクリップは、複数のアクションが混在する10秒のクリップよりも優れています。解像度はターゲット出力と一致させるべきです:1080P入力、1080P出力。

参照オーディオ。 スタジオ品質の録音のみを使用してください。バックグラウンドノイズを除去し、ラウドネスを約-16 LUFSに正規化し、先頭と末尾の無音部分をトリミングしてください。電話での録音は、電話品質の音声クローンしか生成しません。

[独自の洞察] 参照間の解像度の不一致は、静かな失敗モードです。参照画像が2160Pで参照ビデオが720Pの場合、モデルは動きには低品質のソースを、静止画のディテールには高品質のソースを継承する傾向があり、フレーム全体で一貫性のないクリップが生成されます。アップロードする前に、すべてをターゲット出力にダウンスケールしてください。

R2Vの有効な入力組み合わせを示すマトリックス。参照画像、参照ビデオ、参照オーディオの列がある。

競合なしで参照を組み合わせる方法

以下の4段階のワークフローは、私たちが社内で実行しているものです。これにより、参照を自由に積み重ねた際に以前見られた競合による失敗の約80パーセントが解消されます。

ステップ1:参照を準備する。 1枚のアンカー画像、0〜4枚の補助画像、0〜2つの参照ビデオ、0または1つの参照オーディオを選択します。すべての参照をターゲット出力と同じアスペクト比に正規化します。

ステップ2:reference_voiceを正しく設定する。 参照オーディオを添付する際、音声保持にはreference_voiceパラメータをcloneに、リップシンクのみにはdriveに設定します。この2つのモードは、同じオーディオファイルから非常に異なる出力を生成します。cloneは音色を、driveはタイミングを伝達します。

ステップ3:プロンプトを作成する。 参照ではなく、希望するシーンを記述します。参照は条件付けであり、プロンプトの主題ではありません。悪いプロンプト:「この人物にオーディオのように話させる。」良いプロンプト:「緑のジャケットを着た30代の女性が、日当たりの良いキッチンでカメラに向かって話している、ミディアムクローズアップ、50mmレンズ。」

ステップ4:レンダリングと評価。 まず3秒の720Pテストを実行します。最初のフレームで同一性の保持、2番目のフレームで動きの一貫性、3番目のフレームでオーディオ同期を確認します。その後で初めて10秒の1080P最終版をコミットします。

有効な組み合わせとリスクのある組み合わせ

一部の入力組み合わせは安定しています。その他は定期的にアーティファクトを生成します。このマトリックスは、2026年6月と7月に約200回のレンダリングを行ったR2Vテストから得られたものです。

組み合わせ 安定性 注意事項
1画像 + テキスト I2Vに最も近く、最速のR2Vパス
1画像 + 1オーディオ + テキスト トーキングヘッドの音声クローンに最適
1画像 + 1ビデオ + テキスト ビデオが同じ被写体を示す場合に機能
1画像 + 1ビデオ + 1オーディオ + テキスト トリプル条件付け、競合に注意
5画像 + 5ビデオ + 1オーディオ + テキスト 最大入力、最大競合リスク
0画像 + 1ビデオ + テキスト 画像アンカーがないと、同一性がずれる

[オリジナルデータ] 私たちの200回のレンダリングテストセット全体で、3つ以下の参照を使用した呼び出しは91パーセント成功し、8つ以上の参照を使用した呼び出しは54パーセント成功しました。ここでの成功とは、出力がプロンプトと一致し、少なくとも1つの参照属性をきれいに保持したことを意味します。

実例:マルチショットキャラクターシーン

ワークフローを具体的にするために、社内デモ用に実行した実際のR2Vジョブを紹介します。概要は、ネオンに照らされた路地を歩き、カメラに振り返る様式化された女性キャラクターの6秒1080Pクリップでした。

使用した参照。 キャラクターの正面向き1080Pヒーローポートレート1枚。ストックライブラリからの同様の歩行サイクルを示す5秒の参照ビデオ1つ。参照オーディオなし。

プロンプト。 「短い赤毛と銀色のジャケットを着た女性が、夜のネオンに照らされた路地を歩いている、ミディアムワイドショット、ゆっくりとしたドリーイン、最後にカメラに振り返る、シネマティック、ムーディーなキーライト、濡れた舗道の反射。」

設定。 R2Vモード、1080P、6秒、16:9、シード8421。ヒーローポートレートが顔を固定し、参照ビデオが歩行のタイミングを固定しました。

結果。 最初のレンダリングでは、6フレーム中4フレーム目まで同一性がきれいに保持されましたが、振り返りの際にわずかにずれが生じました。同じキャラクターの3/4後方視点の補助画像を1枚追加して再レンダリングしたところ、振り返りが保持されました。総計算量:3回のレンダリング、テスト用に720Pで2回、最終用に1080Pで1回。

教訓:最小限から始め、特定の失敗が見られた場合にのみ参照を追加してください。参照を先回りして追加することは、R2Vで最もよくある間違いです。

一般的な失敗モード

R2Vは予測可能な方法で失敗します。それらを事前に把握しておくことで、クレジットを節約できます。

参照の競合。 異なる被写体、照明、または動きを記述する2つの参照。モデルはフレームごとにランダムに1つを選択し、ちらつきを生成します。属性クラスごとに1つの参照に減らすことで修正します。

参照品質の不一致。 シャープな画像と圧縮されたビデオの組み合わせ。モデルは弱いソースからアーティファクトを継承します。すべての参照を同じ忠実度に正規化することで修正します。

プロンプトと参照の不一致。 晴れたビーチを記述するプロンプトと、吹雪の参照ビデオの組み合わせ。モデルはプロンプトに従い、参照を無視するため、参照条件付けが無駄になります。プロンプトのトーンを参照のトーンに合わせることで修正します。

オーディオの同期ずれ。 出力期間よりも長い参照オーディオ、または長い先行無音部分のあるオーディオ。リップシンクがずれます。オーディオを出力長と正確に一致させ、最初の音素を0.0秒にすることで修正します。

振り返り時の同一性のずれ。 被写体が参照角度から45度を超えて回転すると、顔が歪みます。再レンダリングする前に、ターゲット角度の補助参照画像を追加することで修正します。

Wan 2.7 R2V よくある質問

Wan 2.7 R2Vにいくつの参照を渡せますか?

Alibaba Cloud R2V APIリファレンスによると、1回の呼び出しで最大5枚の参照画像、5つの参照クリップ、1つの参照オーディオを渡すことができます。テキストプロンプトは常に必須です。参照が増えると競合のリスクが高まるため、1枚の画像から始め、必要な場合にのみ追加することをお勧めします。

R2Vは1080P出力をサポートしていますか?

はい。R2Vの出力は1080P、10秒に制限されます。解像度は最も低い解像度の参照と一致させる必要があります。そうしないと、モデルは最も弱いソースからアーティファクトを継承します。

R2Vはどんな声でもクローンできますか?

R2Vは、5秒から30秒のクリーンな参照オーディオから音声をクローンできます。PixMind のポリシーでは、特定可能な実在の人物の非同意のクローン作成を禁止しています。R2Vの音声クローンは、オリジナルキャラクター、ご自身の声、またはライセンスされた参照オーディオで使用してください。

R2Vはオーディオ駆動型I2Vとどう異なりますか?

オーディオ駆動型I2Vは、単一の入力画像に対して動きとリップシンクを駆動するためにオーディオのみを使用します。R2Vは、参照ビデオや複数の画像を含む、より広範なマルチモーダル入力マトリックスを受け入れ、タイミングの同期だけでなく声の音色をクローンできます。同一性と音声の両方をショット間で引き継ぐ必要がある場合、R2Vがより強力な選択肢となります。

R2Vを避けるべき時はいつですか?

単発のBロール、抽象的な動き、シンプルな製品スピン、または連続性の要件がない場合にはR2Vを避けてください。R2Vは参照条件付けパスのため、I2VやT2Vよりも1秒あたりのクレジットコストが高く、参照が有用な信号を追加しない場合、余分な条件付けは悪影響を及ぼします。

動作中の様子を見る

继续浏览中,生成器即将加载...