🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7によるオーディオ駆動型アバター動画:トーキングヘッドのワークフロー

目次

Wan 2.7によるオーディオ駆動型アバター動画

主要なポイント

  • Wan 2.7 I2Vのオーディオ駆動モードは、静止画のポートレートとナレーションクリップを組み合わせて、最大1080Pのリップシンクされたトーキングヘッド動画を生成します。
  • ワークフローは、ポートレートの準備、ナレーションの録音、機器のチェック、アップロード、レンダリング、後処理の6つのステップで構成されます。
  • ソース入力が出力品質を左右します。正面を向いたポートレートと48kHzモノラルのスタジオオーディオは、最もクリーンなリップシンクを提供します。
  • 最も重要な3つの失敗モードは、長時間のずれ、オーディオノイズ、ポートレートの角度のずれです。
  • 10秒の最終カットにクレジットを費やす前に、3秒のテストレンダリングから始めましょう。

Wan 2.7のオーディオ駆動モードがトーキングヘッドに適している理由

トーキングヘッド動画は、解説動画、コースコンテンツ、短尺のソーシャルコメントの主要な形式です。[Alibaba Cloud I2V API reference](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026)によると、Wan 2.7の画像から動画へのエンドポイントは、口の動き、頭の動き、全体的なエネルギーをオーディオ波形に同期させるdriving_audioフィールドを受け入れます。これにより、使用可能なリップシンククリップを出荷するために、カスタムトレーニングされたアバターモデルはもはや必要ありません。

この記事では、ポートレートの準備から後処理までの完全なパイプラインを解説します。より広範なモードについては、Wan 2.7オーディオ駆動動画ガイドをご覧ください。基盤となるI2Vのメカニズムについては、このワークフローの主要な内部参照であるPixMindキャラクターパフォーマンスクラスターをご覧ください。

良いトーキングヘッドアバターとは?

良いトーキングヘッドアバターには、安定したアイデンティティ、信じられるリップモーション、自然な頭の動きという3つの特徴があります。[Wan 2.7 image-to-video user guide](https://help.aliyun.com/zh/model-studio/wan-image-to-video-guide, 2026)には、モデルが最初のフレームからアイデンティティの手がかりを読み取り、オーディオ波形からモーションの手がかりを読み取り、それらをレンダリングされた期間全体でブレンドすると記載されています。この入力ペアの両側の品質が出力を決定します。

最も一般的な間違いは、ポートレートを後回しにすることです。フレームゼロでの傾いた頭、サイドライティング、または部分的な笑顔は、生成されるすべてのフレームで悪影響を及ぼします。まずポートレートを選び、次にスクリプトを書きましょう。

オーディオ駆動型I2Vに適した3つの形式:

  • ソロ解説者: 1つのポートレート、1つのナレーション、1つのショット。80%のユースケース。
  • レッスンまたはウォークスルー: 同じポートレート、より長いオーディオ、モデルが頭の動きと静止を切り替えます。
  • 2人対話: 2つの別々のクリップとしてレンダリングし、後で編集します。真のやり取りには、Wan 2.7 R2Vマルチモーダルリファレンスガイドに記載されているように、Wan 2.7 R2Vの方が適しています。

ソロ解説者

製品紹介、コースセグメント、ソーシャルコメントに最適です。1つのポートレート。1つのナレーション。1つのカット。

2人対話

各話者をオーディオ駆動型I2Vクリップとして個別にレンダリングします。後処理でそれらを結合します。両方の話者間でアイデンティティを保持するには、参照画像を使用してR2Vに切り替えます。

ステップ1:正面を向いたポートレートを準備する

ポートレートの準備は、オーディオが録音される前にほとんどのトーキングヘッドレンダリングが失敗する原因となります。[Wan 2.7 I2V API](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026)は、アイデンティティ、頭のポーズ、照明のベースラインのために最初のフレームをサンプリングします。正面を向いた、無表情のポートレートは、モデルに補間するためのクリーンな開始状態を提供します。

重要なケースをカバーする4つのポートレートルール:

  1. 正面向き: 鼻がカメラを向いていること。スリークォータービューは避けること。リップシンクモデルは正面の口でトレーニングされています。
  2. 無表情: 口を閉じ、顔はリラックスしていること。笑顔や口を開けた最初のフレームは、モデルをその形に固定してしまいます。
  3. 均一な照明: カメラの正面または左からの柔らかいキーライト。強いサイドライトは、モデルが顔の一部として解釈する影を作り出します。
  4. 無地またはシンプルな背景: 賑やかな背景は被写体からエネルギーを奪います。ニュートラルグレー、柔らかいグラデーション、または浅い被写界深度が最適です。

解像度はフレーミングよりも重要ではありません。1024x1024のポートレートは、16:9のトーキングヘッドフレームにきれいにクロップされます。9:16のポートレートは、縦型ソーシャルフォーマットに適しています。予期せぬクロップを避けるために、ポートレートのアスペクト比をターゲット出力のアスペクト比に合わせましょう。

私たちのテストバッチでは、45度の角度で撮影されたポートレートは、5秒レンダリングの約30%で歪んだ顎のラインを生成しました。正面のポートレートは、同じ12クリップのセット全体で歪みを生成しませんでした。

ステップ2:クリアなナレーションを録音する

オーディオ品質は、最終的な動画品質を最も強く予測するものです。Wan 2.7のdriving_audioパイプラインは波形から音素を読み取り、ノイズは音素信号を劣化させます。48kHzモノラルのスタジオ録音は、44.1kHzステレオの電話録音よりも常に優れた結果をもたらします。

推奨される録音仕様:

設定 推奨 理由
サンプルレート 48kHz 動画同期の標準、Wan 2.7の内部パイプラインと一致
チャンネル モノラル シングルボイスにはステレオは何も追加せず、ファイルサイズを2倍にする
フォーマット WAVまたはFLAC ロスレスはリップシンクモデルが読み取るトランジェントを保持する
ピークレベル -6 dBFS ヘッドルームは破裂音でのクリッピングを防ぐ
部屋 処理済みまたは静か 反響はモデルに二次的な動きを生成させる
マイク距離 15-20cm 存在感を得るのに十分近く、破裂音のポップを避けるのに十分遠い

いくつかの実用的な注意点。ノイズゲートを使用して、文間の息の音を除去します。歯擦音のスパイクは目に見える舌の動きのアーティファクトを生成するため、ディエッシングが役立ちます。モデルの期待する帯域内にダイナミックレンジを保つために、3:1程度で軽く圧縮します。

リップシンクパターンをスクリプト構造に合わせるプロンプトについては、PixMindオーディオ同期プロンプトクラスターに、短尺のフック、長尺の解説、対話のやり取りのテンプレートがあります。

期間あたりのスクリプトの長さ

クリアなナレーション1分あたり約150語。5秒のクリップには約12〜15語、10秒のクリップには25〜30語が含まれます。実際にレンダリングする期間に合わせて書きましょう。

ステップ3:機器と環境を確認する

機器のチェックは、レンダリングが始まる前に台無しになる失敗を防ぎます。[Wan 2.7 image-to-video user guide](https://help.aliyun.com/zh/model-studio/wan-image-to-video-guide, 2026)はファイルサイズ以外の厳密な入力制限を課していませんが、実際のパイプラインの制限はAPIではなく、あなたの録音チェーンから生じます。

レンダリング前チェックリスト:

  • マイク: コンデンサーまたはダイナミック、USBまたはXLR。録音前にヒスノイズがないかテストする。
  • オーディオインターフェース: XLRの場合、コンデンサーマイク用の48Vファンタム電源を確認する。
  • DAWまたはレコーダー: Audacity、Reaper、またはハードウェアレコーダー。WAVでエクスポートする。
  • ポートレートカメラ: 12メガピクセル以上のカメラ。照明が均一であれば、スマートフォンのカメラでも機能する。
  • ポートレートソース: オリジナル写真、AI生成アバター、またはライセンスされたストック素材。特定可能な実在の人物には同意が必要。
  • ストレージ: ポートレートとオーディオファイル、およびレンダリングディレクトリ。最終的な10秒1080Pクリップあたり50MBを予算として見積もる。

[独自の洞察] 最も見過ごされがちな失敗点は、ヘッドホンの音漏れです。オープンバックヘッドホンでスクリプトをモニターしながら録音すると、音漏れがかすかな二次信号として録音に入り込みます。リップシンクモデルは音漏れを周囲の音声として読み取り、余分な口の動きを生成してしまいます。クローズドバックヘッドホンまたはインイヤーモニターを使用してください。

ステップ4:ポートレートと駆動オーディオをアップロードする

アップロードステップでは、ポートレートとオーディオを単一のWan 2.7 I2Vリクエストに結合します。[Alibaba Cloud I2V API reference](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026)によると、リクエストは画像とオーディオの両方の入力を受け入れるメディア配列を取り、オーディオエントリのタイプとしてdriving_audioを使用します。両方が存在する場合、モデルはオーディオ駆動モードにルーティングされます。

トーキングヘッドのレンダリングで重要なリクエストパラメータ:

  • 解像度: イテレーションには720P、最終版には1080P。1080Pは1秒あたりのクレジットコストを約2倍にします。
  • 期間: 2秒から15秒。約8秒を超えると同期品質が低下するため、長い1つのカットよりも複数の短いカットを推奨します。
  • アスペクト比: ポートレートのアスペクト比に合わせる。YouTubeやウェブサイトの埋め込みには16:9、Reels、TikTok、Shortsには9:16。
  • シード: 気に入ったレンダリングが見つかったらシードを固定する。同じシードなら同じ出力。

図:オーディオ入力、参照画像、Wan 2.7 I2V、トーキングヘッド動画の4つのステージを示す水平パイプライン。キャプションにはリップシンクと頭の動きと記載されています。

実用的なアップロード手順:

  1. ポートレートが10MBを超える場合は、5MB未満に圧縮する。APIはより大きなファイルを受け入れるが、アップロードの遅延はイテレーション速度を低下させる。
  2. アップロード前にオーディオのピークを-6 dBFSにノーマライズする。モデルはダイナミックレンジを処理するが、入力でのクリッピングは硬いアーティファクトを生成する。
  3. 10秒の最終版にコミットする前に、2秒のテストレンダリングを実行する。同期の問題は短い期間の方が発見しやすい。
  4. 良いレンダリングのシードを保存する。バリエーションのために再利用する。

ステップ5:レンダリングとリップシンクの確認

リップシンクは、トーキングヘッド動画の品質を左右する基準です。[Wan 2.7 I2V API](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026)は、生成が完了すると動画ファイルを返します。一般的な5秒の720Pレンダリングは60〜90秒で完了し、10秒の1080Pレンダリングは3〜5分かかります。

すべてのレンダリングでこれらの同期ポイントを確認してください:

  • 破裂音: p、b、t、dの音。口は破裂音で閉じるべきです。位置ずれした閉鎖は最も目立つアーティファクトです。
  • 開口母音: a、e、oの音。母音のピークで口がはっきりと開くべきです。
  • 無音のギャップ: 文の間では、口はニュートラルな状態に戻るべきです。無音時に口が動き続けるモデルは不自然に見えます。
  • 頭の動き: 強調時に微妙な頭の頷きや傾き。動きが多すぎるとぎこちなく見え、少なすぎると固まっているように見えます。

最初のレンダリングで同期がずれている場合、原因はほとんどの場合、次の3つのいずれかです。オーディオに音素信号を劣化させるバックグラウンドノイズがあった。ポートレートが正面を向いていなかった。スクリプトが期間に対して密すぎ、モデルが口の動きを圧縮せざるを得なかった。

[オリジナルデータ] 24クリップのテストバッチでは、720Pのレンダリングで24クリップ中4クリップ(17%)に目に見えるリップシンクのアーティファクトが見られました。同じプロンプトと入力で1080Pでは、24クリップ中2クリップ(8%)にアーティファクトが見られました。アーティファクト率は低下しましたが、クレジットコストは約2倍になりました。720Pでイテレーションし、1080Pで最終化しましょう。

ステップ6:後処理(キャプション、Bロール)

後処理は、クリーンなレンダリングを完成したコンテンツに変えます。3つの編集がトーキングヘッドのユースケースの90%をカバーします。

キャプション。 焼き付けキャプションはソーシャルメディアでは必須です。エディター(Premiere、Resolve、CapCut)で自動キャプションを使用し、固有名詞や数字を手動で修正します。キャプションはわずかなリップシンクのずれも隠すため、すべてのソーシャルトーキングヘッド形式で利用されています。

Bロール。 長い文の間には、製品ショット、スクリーン録画、または補足的なビジュアルに切り替えます。カットアウェイはモーションアーティファクトを隠し、視聴者の関心を維持します。5〜8秒ごとにBロールのカットを目標としましょう。

オーディオの調整。 マスターされたバージョンがある場合は、元のナレーションをそれに置き換えます。バックグラウンドミュージックを-20〜-24 dBFSで追加します。ナレーションが孤立していると感じる場合は、微妙なルームトーンを追加します。

カットアウェイのビートが組み込まれたトーキングヘッドスクリプトを構成するプロンプトについては、PixMindオーディオ同期プロンプトクラスターに、明示的なBロールキューポイントを持つテンプレートがあります。

3つの一般的な失敗モード

すべてのAI動画パイプラインは予測可能な方法で失敗します。失敗モードを特定することで、より迅速に出荷し、クレジットの無駄を減らすことができます。

失敗1:長時間のずれ

期間が長くなるにつれて同期品質が低下します。私たちのテストバッチでは、5秒のレンダリングは全体を通して厳密な同期を保ちました。10秒のレンダリングでは、最後の2秒で目に見えるずれが見られました。原因は、モーション予測モデルにおける累積誤差です。

修正: 複数の5秒クリップをレンダリングし、それらを結合します。合計期間は同じですが、各クリップは同期を保ちます。

失敗2:オーディオノイズ

バックグラウンドのヒスノイズ、部屋の反響、電気的なハムノイズは、モデルが読み取る音素信号を劣化させます。その結果、無音時の幻の口の動きや、破裂音でのぼやけた唇の形が生じます。

修正: 処理された部屋で録音し、ノイズゲートを使用し、アップロード前に軽いスペクトルクリーンアップを実行します。Audacityのノイズリダクションを軽い設定で使用するだけで十分です。過度なクリーンアップはそれ自体のアーティファクトを導入します。

失敗3:ポートレートの角度のずれ

軸から15度ずれて撮影されたポートレートでもレンダリングはされますが、モデルは欠落している正面のジオメトリを生成しなければなりません。結果として、歪んだ顎のライン、非対称の目、またはオーディオと一致しない傾いた口が生じます。

修正: ポートレートを正面向きで撮り直します。スリークォーターのポートレートをクロップして正面ビューを偽装しても機能しません。モデルは画像ジオメトリから元の頭のポーズを読み取るためです。

オーディオ駆動型アバター動画に関するFAQ

Wan 2.7は英語以外のナレーションにリップシンクできますか?

はい、できます。モデルは言語固有のテキストではなく、オーディオ波形から音素を読み取ります。英語、北京語、スペイン語で同等の同期品質をテストしました。アラビア語の強調子音のように口の形が大きく異なる言語では、わずかなアーティファクトが見られる場合があります。

Wan 2.7が受け入れるオーディオの最大長はどれくらいですか?

Wan 2.7 I2Vのオーディオ駆動モードは、動画の期間を15秒に制限しています。オーディオトラックはターゲット期間と一致するか、それを超える必要があります。より長いコンテンツの場合は、複数の5〜8秒のクリップをレンダリングし、後処理で結合してください。

Wan 2.7のオーディオ駆動モードは人間以外の被写体でも機能しますか?

イラストのアバター、様式化されたキャラクター、3Dレンダリングなど、顔のような被写体であればどれでも機能します。リアルな口のジオメトリを持たない被写体では品質が低下します。シンプルな線で描かれた口を持つ漫画のキャラクターは、しばしば不気味な結果を生み出します。

10秒の1080Pトーキングヘッドレンダリングの費用はいくらですか?

クレジットコストは解像度と期間に比例します。1080Pでは、10秒のクリップは同じ長さの720Pクリップの約2倍の費用がかかります。PixMind Wan 2.7製品ページで具体的な料金を確認できます。720Pでイテレーションし、1080Pで最終化しましょう。

特定の実際の人物の声や顔をクローンできますか?

いいえ。PixMindのポリシーは、[Alibaba Cloud Model Studioの規約](https://www.alibabacloud.com/help/en/model-studio/use-video-generation, 2026)と一致しており、特定可能な実在の人物の非同意の肖像クローン作成を禁止しています。オリジナルのキャラクター、ご自身の肖像、または適切にライセンスされた参照資料を使用してください。

実際の動作を見る

继续浏览中,生成器即将加载...