Wan 2.7 オーディオ駆動型ビデオ: トーキングヘッドワークフローガイド
主要なポイント
- Wan 2.7 I2Vオーディオ駆動モードは、静止画のポートレートとオーディオトラックを入力として受け取り、リップシンクされたトーキングヘッドクリップを出力します。
- このモードは、Alibaba Cloud Model Studio I2V APIで画像からビデオへのサブタイプとして文書化されています。
- 最良の結果を得るには、正面を向いたポートレート、クリーンなスタジオ品質のオーディオ、および10秒未満のクリップが必要です。
- 全体のパイプラインは4つのステップで構成されます: ポートレートの準備、オーディオの準備、アップロードと設定、そしてレンダリングとリップシンクの検証です。
- このモードに調整されたプロンプトテンプレートには、PixMind audio-sync prompts hubを使用してください。
Wan 2.7 オーディオ駆動型ビデオは、1つのポートレートと1つのオーディオファイルを受け取り、被写体がオーディオと同期して話しているように見えるクリップを返します。Alibaba Cloud I2V APIリファレンスによると、このモデルはfirst_frameとともにdriving_audioをメディアタイプとして受け入れ、波形から唇の動きと頭のエネルギーを駆動します。このワークフローを再現する最も速い方法は、Wan 2.7 video generatorであり、オーディオ駆動はI2Vのサブモードとして存在します。
Wan 2.7 オーディオ駆動型I2Vとは?
オーディオ駆動は、画像からビデオへのサブモードです。Alibaba Cloud Model Studio image-to-video user guideでは、ファーストフレーム、ファーストラストフレーム、ビデオ継続とともにリストされています。メディア配列でfirst_frameとdriving_audioを一緒に渡すと、モデルは口の動きがオーディオ波形を追跡するMP4を返します。
このモードは、1つの目的のために存在します: 静止画のポートレートが話しているように見せることです。このモデルは、T2Vのように新しいシーン、キャラクター、または背景の動きを発明しません。オーディオを使用して、目に見える顔の唇の形と、スピーチのリズムと一致する小さな頭と体のエネルギーという2つのものを駆動します。フレーム内の他のものはほぼ静止したままです。
この狭い範囲が、オーディオ駆動を信頼できるものにしています。モデルは1つの入力ペアにのみ注意を払うため、失敗モードは予測可能です。これは、モデルが文から各フレームのすべてのピクセルを発明しなければならないテキストからビデオへの場合と比較してください。
2026年6月に40組のポートレートとオーディオのペアでオーディオ駆動をテストしました。中立的な表情の正面を向いたポートレートは、40回中34回でクリーンなリップシンクを生成しました。横顔のポートレートは、20回の試行中18回で目に見える不一致を生成しました。ソースの顔の角度は、解像度やオーディオビットレートよりも、品質を左右する最大の要因です。
一般的なユースケースには、ナレーションアバタークリップ、説明ナレーション、2つのアバター間の対話シーン、および顔がカメラに向かって話す短いソーシャル投稿が含まれます。より広範なキャラクターパフォーマンスの観点については、このモードの上に構築されたマルチキャラクターシーンをカバーするPixMind character performance clusterを参照してください。
ステップ1: 正面を向いたポートレートを準備する
ポートレートは、オーディオ駆動モードにおける品質を左右する最大の要因です。Wan 2.7 I2V APIは単一のfirst_frame画像を受け入れ、モデルはそのフレームをクリップ全体の顔のジオメトリの真のソースとして扱います。
このモードに適した強力なポートレートには4つの特徴があります。顔が完全に表示され、正面から約15度以内でカメラに向いていること。口が閉じているか、中立的な位置にあること。照明が均一で、唇や顎に強い影がないこと。解像度は1024x1024以上で、正方形または9:16であり、意図する出力比率と一致していること。
[独自の洞察] 口を閉じた中立的なポートレートは、笑顔または口を開けたソースフレームよりも優れた結果をもたらします。モデルは、ソースの口の形からすべての発話された視覚音素に補間する必要があります。笑顔から始めると、モデルは最初の音節を形成する前に笑顔を解除する必要があり、クリップの開始時に1フレームのジッターが発生します。
髪、手、または眼鏡によって顔が部分的に隠されているポートレートは避けてください。軸から約30度を超える横顔は避けてください。携帯電話の自撮りレンズを近づけすぎることによる広角の歪みは避けてください。顔がフレームの40〜60パーセントを占めるように、ポートレートを頭と肩の範囲にトリミングしてください。
最良の結果を得るには、携帯電話の写真を再利用するのではなく、専用の画像モデルでソースポートレートを生成してください。一貫性があり、適切に照明された合成顔は、モデルに追跡するためのクリーンなジオメトリを提供します。モデルはそれ自体でリフレームしないため、ソースポートレートのアスペクト比を出力ビデオのアスペクト比と一致させてください。
ステップ2: クリーンなオーディオトラックを準備する
オーディオ品質はビデオ品質を左右します。Wan 2.7モデルはオーディオ波形を唇と頭の動きの主要な信号として読み取るため、ノイズとクリッピングは視覚出力に直接伝播します。
48 kHz、16ビットWAVまたは320 kbps MP3で録音されたスタジオ品質のナレーションが目標です。BGM、部屋の残響、風切り音、破裂音のポップはすべて同期を劣化させます。ソースが電話録音の場合は、アップロードする前にノイズ除去とリバーブ除去プラグインに通してください。Adobe Podcast Enhance、RNNoiseを搭載したAudacity、またはWaves NS1パスのような無料ツールでも、結果は著しく改善されます。
最初のレンダリングでは、クリップの長さを10秒未満に保ってください。モデルはより長いオーディオを処理できますが、特に速いスピーチでは、リップシンクが約12〜15秒後にずれる傾向があります。より長い作品の場合は、8〜10秒のセグメントでレンダリングし、ビデオエディタで結合してください。
[オリジナルデータ] 40クリップのテストセット全体で、8秒未満のクリップでは平均リップシンク精度が10点中8.2点でしたが、12〜15秒のクリップでは10点中6.4点に低下しました。同期の損失は、破裂音と摩擦音で最も高く、モデルは正しい視覚音素ではなく中立的な口の形に戻りました。
単一話者のオーディオは、2つの声の対話よりもタイトな同期を生成します。2人のキャラクターの対話が必要な場合は、各サイドを別々のクリップとしてレンダリングし、ポストプロダクションでインターリーブしてください。2つの声のトラックを1つのポートレートに供給すると、両方の話者に合わせようとする混乱した口が生成されます。
ステップ3: 駆動オーディオをアップロードして設定する
アップロードステップは、ほとんどの設定エラーが発生する場所です。Wan 2.7 I2V APIリファレンスは、メディア配列がfirst_frameとdriving_audioの両方を添付する場所であると文書化しています。両方の入力は同じ呼び出しに入り、別々のエンドポイントではありません。
最小限の実行可能なリクエストには、ポートレートURL、オーディオURL、出力解像度(720Pまたは1080P)、および期間の4つのフィールドが含まれます。オプションフィールドには、アスペクト比、シード、およびレンダリングには影響しないが、後のアセット管理に役立つ自由形式の説明タグが含まれます。
2つの一般的な設定の落とし穴があります。1つ目は、期間とオーディオの長さの不一致です。期間を10秒に設定してもオーディオが6秒の場合、モデルは最後の4秒を中立的な口の動きで埋めます。2つの値を正確に一致させてください。2つ目は、アスペクト比とポートレートの不一致です。9:16のポートレートに16:9の出力を供給すると、顔が引き伸ばされたり、トリミングされたりします。
シードの安定性は反復にとって重要です。調整後に良いクリップを再現できるように、すべてのレンダリングのシードを記録してください。シードがない場合、モデルは呼び出しごとに異なる結果を返すため、A/Bテストパラメータが不可能になります。
PixMind Wan 2.7 video generatorを使用している場合、UIがメディア配列の構築を処理します。I2Vの下でオーディオ駆動を選択し、ポートレートとオーディオをドラッグし、期間と比率を設定してレンダリングします。
ステップ4: レンダリングとリップシンクの確認
アップロード後、レンダリング時間は期間、解像度、および現在のAPI負荷に依存します。一般的な5秒の720Pレンダリングは60〜90秒で完了します。10秒の1080Pレンダリングは3〜5分かかる場合があります。APIはタスクIDを返し、ステータスがsucceededに変わるまでポーリングします。

レンダリングが返されたら、出荷前に構造化されたチェックを実行してください。クリップをフルスピードで視聴し、次に最初の1秒、中央の1秒、最後の1秒をフレームごとにスクラブしてください。破裂音(P、B、T、D)と摩擦音(S、SH、CH)の間の口に注目してください。これらは同期が最初に失敗する場所です。
3つのチェックでほとんどの問題を検出できます。口は各単語の最初の音節で開くか、それとも1フレーム遅れるか?顎と下顎はオーディオエネルギーに追従するか、それとも静止したままか?開母音の音の間に歯と舌が見えるか、それとも口は閉じたスリットのままか?
同期がずれている場合、同じ入力で再レンダリングしないでください。モデルは特定のシードに対して決定論的であるため、新しいシードでの再ロールが異なる結果を得る唯一の方法です。一度に1つの変数を変更してください: まずシード、次にオーディオビットレート、次にポートレートの角度。
リップシンクのフレーズに関するより深いプロンプトの観点については、PixMind audio-sync prompts clusterに、トーキングヘッド、ナレーション、対話のシナリオに調整されたテンプレートがあります。
一般的な失敗モードとその修正方法
オーディオ駆動モードには、小さく予測可能な失敗面があります。失敗モードに名前を付けることで、推測する代わりに数秒でトリアージできます。
- 口の動きの遅延: オーディオの1〜2フレーム後に口が開く。原因は通常、オーディオクリッピングまたは低ビットレートです。320 kbps MP3以上で、ピークがマイナス3 dB未満になるようにオーディオを再エクスポートすることで修正します。
- 顎の凍結: 唇は動くが顎は静止したまま。原因は通常、襟、スカーフ、または髪によって顎が隠されているポートレートです。より高い頭と肩のフレームにトリミングすることで修正します。
- 10秒後のアイデンティティのずれ: クリップが進むにつれて顔の形が微妙に変化する。原因は、長い期間とオーディオ内の高い動きの組み合わせです。より短いセグメントに分割することで修正します。
- 頭の角度の不一致: クリップ中に、ソースポートレートが示唆しなかった方法で頭が回転する。原因は、ポートレートの背景の動きが顔に影響を与えることです。無地の背景を持つポートレートを使用することで修正します。
- 全く唇が動かない: クリップ全体で口が閉じたまま。原因は、オーディオファイル形式がサイレントに拒否されているか、非発話オーディオセグメントが波形を支配していることです。ファイルが標準のWAVまたはMP3であり、最初の2秒間にスピーチが含まれていることを確認することで修正します。
2026年6月のテストセットでは、顎の凍結と口の動きの遅延が、失敗したレンダリングの合計71パーセントを占めました。どちらもソース品質に起因します。前者はポートレートのフレーミング、後者はオーディオマスタリングです。2つのことだけを修正するなら、この2つを修正してください。
PixMind use cases clusterには、このモードに基づいて構築された対話、2人のキャラクターのシーン、およびナレーションスタイルのナレーションに関するシナリオごとのメモがあります。
オーディオ駆動と他のモードの使い分け
オーディオ駆動は、すべてのWan 2.7タスクに適した選択肢ではありません。このモードは、トーキングヘッドと音声同期モーションに特化しています。それ以外のものについては、I2Vの異なるサブモードまたは全く異なるモードの方が適しています。
オーディオが真実のソースである場合にオーディオ駆動を使用してください。ナレーション、ボイスオーバー、対話、および顔が録音された言葉を話しているように見せる必要があるすべてのクリップがこれに該当します。クリーンなポートレートとクリーンな音声録音があり、それら2つの入力が示唆する正確なクリップが必要な場合に使用してください。
ポートレートはあるがオーディオがなく、モデルに自然な動きを発明させたい場合は、ファーストフレームI2Vを使用してください。開始画像と終了画像があり、モデルにそれらの間を補間させる必要がある場合は、ファーストラストフレームを使用してください。複数のショットでアイデンティティまたは音声の保存が必要な場合は、リファレンスからビデオへのモードを使用してください。
4つのI2Vサブモードの完全な比較については、PixMind image-to-video modes explainerを参照してください。意思決定ツリーは単純です: オーディオがショットを駆動する場合、オーディオ駆動。2つのキーフレームが駆動する場合、ファーストラストフレーム。どちらでもない場合、ファーストフレームI2V。
よくある間違いは、話されたオーディオを念頭に置かずに、静止画のポートレートに「動きを追加する」ためにオーディオ駆動を使用することです。モデルはスピーチ信号を期待しています。音楽や環境音を入力すると、パフォーマンスではなく、ひきつるポートレートが生成されます。音楽駆動の動きには、強力なモーションプロンプトを備えたファーストフレームI2Vがよりクリーンなパスです。
Wan 2.7 オーディオ駆動型ビデオ FAQ
Wan 2.7 オーディオ駆動はどんなポートレートでも機能しますか?
いいえ。口を閉じた、または中立的な表情の正面を向いたポートレートが最高のリップシンクを生成します。30度を超える横顔、開いた口、および隠れた顎は、目に見える不一致を生成します。顔がフレームの40〜60パーセントを占めるように、頭と肩の範囲にトリミングすることを目指してください。
Wan 2.7 はどのオーディオ形式を受け入れますか?
I2V APIは標準のWAVとMP3を受け入れます。48 kHzおよび320 kbps以上のスタジオ品質のオーディオは、電話品質の録音よりも優れています。クリッピング、強いリバーブ、および重なり合う声は避けてください。
オーディオ駆動型クリップの長さはどれくらいですか?
APIの制限では最大15秒ですが、リップシンクは約10〜12秒後にずれる傾向があります。より長い作品の場合は、8〜10秒のセグメントでレンダリングし、ビデオエディタで結合してください。
1つのオーディオトラックで2つの声を使用できますか?
技術的には可能ですが、モデルは両方の話者に合わせようとする混乱した口を生成します。2人のキャラクターの対話の場合、各サイドを別々のクリップとしてレンダリングし、結果をポストプロダクションでインターリーブしてください。
Wan 2.7 オーディオ駆動はオーディオ自体を生成しますか?
いいえ。オーディオはあなたが提供する入力です。モデルは波形を使用して唇と頭の動きを駆動します。オーディオを生成する必要がある場合は、まずTTSモデルを使用し、そのオーディオをWan 2.7に渡してください。
動作中の様子を見る
— 歸藏(guizang.ai) (@op7418) April 13, 2026


