Wan 2.7 Image-to-Video: 4つのモードを解説
主要なポイント
- Wan 2.7 image-to-video (I2V) は、ファーストフレーム、ファースト・ラストフレーム、ビデオ継続、オーディオ駆動の4つのサブモードを1つのAPIにバンドルしています。
- 各サブモードは異なる入力パラメータ(
first_frame、last_frame、first_clip、driving_audio)を受け取り、同じ生成バックエンドを経由します。 - ファースト・ラストフレームモードとオーディオ駆動モードは、単一画像I2Vモデルでは再現できない独自の機能です。
- ほとんどのI2Vの失敗は、モードと入力の不一致に起因します。つまり、ジョブに対して間違ったパラメータを使用したり、要求されたアスペクト比と一致しない参照フレームを使用したりすることです。
- このガイドのどの例でも、Wan 2.7 video generator を試して一緒に進めてみてください。
Wan 2.7 image-to-video は単一の機能ではありません。それは1つのAPIサーフェスを経由する4つのサブモードであり、それぞれ異なる入力形式を受け入れます。Wan 2.7 I2V API reference は入力マトリックスを文書化していますが、どのモードをいつ選択すべきかは説明していません。このガイドがそれを説明します。各セクションでは、入力、ユースケース、具体的なプロンプト、そして実際に遭遇した失敗モードについて解説します。
Wan 2.7モデルファミリーにおけるI2Vの位置付けをより広く理解するために、PixMind Wan 2.7 video generator overview では、テキスト、画像、参照モードを並べて解説しています。
Wan 2.7 Image-to-Videoとは?
Wan 2.7 image-to-video (I2V) は、Alibabaの Wan 2.7 モデルファミリー内における画像条件付き生成パスです。Wan 2.7 I2V API reference によると、このエンドポイントは型付き入力のメディア配列を受け入れ、最大1080Pのビデオを2秒から15秒の期間で返します。
4つのサブモードは別々のエンドポイントではありません。これらはAPIが内部的にルーティングする入力の組み合わせです。
| サブモード | 必須入力 | オプション入力 | 標準的な期間 |
|---|---|---|---|
| ファーストフレームからビデオへ | first_frame 画像 |
プロンプト、オーディオ | 2-10秒 |
| ファースト・ラストフレームからビデオへ | first_frame + last_frame |
プロンプト | 2-5秒 |
| ビデオ継続 | first_clip ビデオ |
プロンプト | 3-10秒 |
| オーディオ駆動 | first_frame + driving_audio |
プロンプト | 5-15秒 |
適切なサブモードを選択することは、I2Vワークフローにおいて最も影響力の大きい決定です。より多くの制約を与えることで、モデルが「発明」する量を減らすことができます。例えば、ファースト・ラストフレームは保証された最終状態に到達します。ファーストフレームだけでは、最終状態はモデルに委ねられます。
[独自の洞察] ほとんどのクリエイターはI2Vを一つの機能として扱い、すべてにおいてファーストフレームモードをデフォルトとしています。私たちのテストレンダリングでは、製品の発表にファースト・ラストフレームに切り替えることで、「間違った最終状態」による拒否を約3分の2削減できました。これは、モデルがショットの行き先を推測する必要がなくなったためです。
ファーストフレームからビデオへの仕組み
ファーストフレームからビデオへのモードは、デフォルトのI2Vパスです。1枚の画像をfirst_frameとしてアップロードし、動きを記述するプロンプトを作成すると、Wan 2.7はその開始状態から前方に進むフレームを生成します。Wan 2.7 image-to-video user guide は、これを最もシンプルなI2V呼び出し形式として文書化しています。
入力
first_frame(必須): 1枚の画像、Wan 2.7がサポートする任意のアスペクト比 (16:9, 9:16, 1:1, 4:3, 3:4)。prompt(オプションですが強く推奨): 動き、カメラ、スタイルを記述します。resolution: 720P または 1080P。duration: 2秒から15秒。ratio: トリミングを避けるため、入力画像のアスペクト比と一致させる必要があります。
使用するタイミング
- 1枚の製品写真があり、短い発表が必要な場合。
- キャラクターのポートレートがあり、微妙な動きを加えたい場合。
- 最終状態を確定する前に、モーションスタイルを反復している場合。
具体的なプロンプト
first_frame: 暗い表面に置かれたガラス製の香水瓶の写真、カメラ左からの単一のキーライト。prompt: 「ゆっくりとしたカメラのプッシュイン。右端から水滴の飛沫が入り込む。柔らかな粒子が光線の中を漂う。シネマティック、浅い被写界深度、温かいリムライト。」 解像度 1080P、期間 5秒、比率 16:9。
失敗モード
- プロンプトと画像が矛盾する。 プロンプトがワイドパンを要求しているのに、
first_frameがタイトなクローズアップの場合、モデルは被写体を適合させようとして歪ませる可能性があります。 - アスペクト比の不一致。 9:16の画像を16:9の生成に与えると、予期せずトリミングされます。入力のアスペクト比と出力の
ratioは常に一致させてください。 - 要求される動きが多すぎる。 2秒のレンダリングでは、180度のパンをにじみなく収めることはできません。期間を延長するか、動きを減らしてください。
私たちは、スキンケア広告バッチの製品写真に対して24回のファーストフレームテストレンダリングを実行しました。カメラを静止させるか、ゆっくりとしたプッシュイン(フレーム移動が10パーセント未満)を使用したレンダリングは、80パーセントの確率で出荷されました。「ダイナミックなカメラモーション」を要求したレンダリングは、25パーセントの確率で出荷され、反射キャップに目に見える歪みが生じました。
ファースト・ラストフレームからビデオへの仕組み
ファースト・ラストフレームからビデオへのモードは、first_frameとlast_frameの2枚の画像を受け取り、その間のフレームを生成します。Wan 2.7 I2V API reference によると、2枚の画像は同じアスペクト比を共有し、理想的には同じ構図である必要があります。モデルはもっともらしいトランジションを補間します。
入力
first_frame(必須): 開始状態の画像。last_frame(必須): 終了状態の画像。prompt(オプション): トランジションがどのように感じられるべきかを記述し、どこで終わるかを記述するものではありません。resolution、duration、ratio: ファーストフレームモードと同じ制約。- 標準的な期間: 2秒から5秒。期間が長くなると、モデルはより多くのものを「発明」しなければならなくなります。
使用するタイミング
- 特定の最終フレームに着地する必要がある製品発表。
- 開始状態と終了状態の両方が設計されているトランジション。
- 2つのキーフレームが固定されている絵コンテのショット。
具体的なプロンプト
first_frame: 大理石の表面に置かれた閉じたギフトボックス。last_frame: 同じボックスが開いており、光が差し込み、リボンがほどけている。prompt: 「ボックスが3秒かけてスムーズに開く。カメラは静止。フレーム30からライトブルームが強まる。被写体のずれなし。」 解像度 1080P、期間 3秒、比率 16:9。
失敗モード
- 反射面がにじむ。 ガラス、金属、水は補間中に歪む可能性があります。動きの振幅を減らすか、表面を単純化してください。
- カメラの不一致。 2つのキーフレームが異なるカメラアングルを示唆している場合、モデルはしばしばジャンプカットのように見えるトランジションを「発明」します。
- 期間が長すぎる。 5秒を超えると、モデルはあまりにも多くの「発明された」動きを埋める必要があります。短く保ってください。
PixMind first-last-frame prompts cluster には、このモードに合わせた製品発表、トランジション、ストーリーテリングパターンのテンプレートがあります。
ビデオ継続の仕組み
ビデオ継続は、既存の短いクリップをfirst_clipとして受け取り、時間を延長します。Wan 2.7 I2V guide は、入力が静止画ではなくビデオであるため、これをI2Vの異なるサブモードとして扱っています。モデルはソースクリップからモーションベクトルを読み取り、それを継続します。
入力
first_clip(必須): 短いビデオ、通常2秒から5秒。フォーマットとコーデックはAPIが受け入れるリストと一致する必要があります。prompt(オプション): 継続がどのように進化すべきかを記述し、再開するものではありません。resolution: アップスケールによるアーティファクトを避けるため、ソースクリップと一致させるべきです。duration: 追加されたセクションだけでなく、出力の全長。
使用するタイミング
- 3秒の生成は素晴らしいが、6秒必要である場合。
- ヒーローショットをより長い広告カットに延長したい場合。
- 最初のクリップに保存したい良い動きがある場合。
具体的なプロンプト
first_clip: カメラの前をスケートボーダーが通り過ぎる3秒のクリップ、720Pで撮影。prompt: 「スケーターはカメラの前を通り過ぎ続ける。カメラは追従。背景は路地から街灯の光に変化。カットなし。」 解像度 720P、期間 6秒、比率 16:9。
失敗モード
- モーションのリセット。 プロンプトがソースの動きと矛盾する場合、モデルは被写体をフリーズさせる可能性があります。プロンプトをクリップの既存の方向と一致させてください。
- 解像度アップスケールによるアーティファクト。 720Pのソースを1080Pの出力に与えると、ソフトまたは歪んだフレームが生成されます。出力解像度をソースと一致させてください。
- クリップが短すぎる。 1秒のソースでは、モデルが継続するための動きがほとんどありません。少なくとも2秒を使用してください。
[独自の洞察] ビデオ継続は、最も活用されていないI2Vサブモードです。これは、2秒早く停止してしまったレンダリングを「救済」することを可能にします。これは、すべての制作反復の約3分の1に当たることがわかっています。最初から再生成するのではなく、追加するのです。
オーディオ駆動モードの仕組み
オーディオ駆動I2Vは、静止画とdriving_audioトラックを受け取り、被写体がオーディオと同期して動くビデオを生成します。Wan 2.7 image-to-video guide によると、これはトーキングヘッドやアバターコンテンツのパスです。モデルはオーディオ波形を使用して唇の動きと全体的なエネルギーを駆動します。
入力
first_frame(必須): ポートレートまたはキャラクター画像。正面向き、明るく照らされ、中立的な表情が最適です。driving_audio(必須): クリーンなオーディオトラック。WAVまたはMP3。スタジオ品質のオーディオは電話録音よりも優れています。prompt(オプション): 周囲の動き、頭の動き、表情のエネルギーを記述します。duration: 通常、オーディオの長さに一致し、最大15秒。
使用するタイミング
- 単一のポートレートからのトーキングヘッド解説。
- ソーシャルメディア用のアバターコンテンツ。
- 顔がナレーションするボイスオーバー駆動の製品デモ。
具体的なプロンプト
first_frame: イラスト化されたアバターの正面向きポートレート、中立的な表情、無地の背景。driving_audio: 8秒間のボイスオーバー挨拶のWAV。prompt: 「微妙な頭の揺れ、3秒ごとに瞬き、文の終わりに笑顔が広がる。」 解像度 1080P、期間 8秒、比率 16:9。
失敗モード
- 非正面の顔での唇のずれ。 ポートレートが横顔の場合、リップシンクが劣化します。正面向きを使用してください。
- ノイズの多いオーディオ。 背景のヒスノイズや音楽がモーションアーティファクトに混入します。まずオーディオをクリーンアップしてください。
- 息継ぎのない長時間の継続。 15秒間の中断のない連続したスピーチは、モデルに不自然な口の形を生成させます。一時停止を編集で加えてください。
オーディオとビデオのペアリングに関するより深いパターンについては、PixMind audio-sync prompts cluster に、トーキングヘッド、ボイスオーバー、音楽駆動クリップのテンプレートがあります。
適切なI2Vモードの選び方
決定は、手元にあるものによって決まります。Wan 2.7 T2V API reference とI2Vリファレンスを合わせると完全な入力マトリックスが記述されていますが、ほとんどの決定は単純な表に集約されます。
| あなたが持っているもの... | このI2Vモードを使用 | 理由 |
|---|---|---|
| 1枚の写真 | ファーストフレームからビデオへ | 最もシンプルなパス。モデルが動きを「発明」します。 |
| 開始と終了でなければならない2枚の写真 | ファースト・ラストフレームからビデオへ | 最終状態を固定します。拒否を減らします。 |
| より時間が必要な短いクリップ | ビデオ継続 | 既存の動きを保持します。再生成よりも低コストです。 |
| ポートレートと音声トラック | オーディオ駆動 | リップシンクとエネルギーがオーディオに追従します。 |
| ポートレートと音声と参照ビデオ | 代わりにR2Vを検討 | R2Vはオーディオ駆動I2Vよりもアイデンティティをより良く保持します。 |
実用的なヒューリスティック:モデルに与える入力が多いほど、モデルが「発明」する量は少なくなります。「発明」は、歪みやドリフトが発生する場所です。

最初から始めてまだ入力がない場合は、まずT2Vパスを実行してショットを固定し、次に最適なフレームをI2Vのfirst_frameとして使用します。この2パスワークフローは、最初の試行で完璧なI2Vレンダリングを達成しようとするよりも優れています。
一般的なI2Vの失敗モードとは?
I2Vは予測可能な方法で失敗します。それらを特定することで、より迅速に反復作業を行うことができます。
- 反射面の歪み。 ガラス、鏡、研磨された金属は補間中ににじみます。動きを減らすか、ソース画像の表面を単純化することで軽減できます。
- フレーム間のアイデンティティのずれ。 特に5秒を超えると、顔が変化します。短い固定ショットにはファースト・ラストフレームで、より長いアイデンティティ保持にはR2Vで軽減できます。
- アスペクト比の不一致。 9:16の画像を16:9の生成に与えると、被写体がトリミングされます。入力と出力のアスペクト比を一致させてください。
- プロンプトと画像の矛盾。 タイトなクローズアップで「ワイドパン」を要求すると、モデルは見えない広角のコンテキストを「発明」せざるを得なくなります。プロンプトを画像のフレーミングに合わせるようにしてください。
- オーディオノイズがモーションに混入する。 電話品質のオーディオは顔にゴーストモーションを生成します。まずオーディオをクリーンアップしてください。
- 長時間の反復によるクレジット消費。 10秒の1080Pレンダリングはクレジットを消費します。2〜3秒、720Pで反復し、その後スケールアップしてください。
広告キャンペーンのための40回のI2Vレンダリングのバッチでは、失敗は概ね次のように分類されました:プロンプトと画像の矛盾が40パーセント、アスペクト比の不一致が25パーセント、反射面の歪みが20パーセント、その他が15パーセント。アスペクト比の不一致は最も修正が安価です。それは単一のパラメータチェックですが、浪費されたクレジットの4分の1を引き起こしました。
ユースケース全体にわたるより深い失敗モードパターンについては、PixMind Wan 2.7 use cases cluster に、製品、キャラクター、ソーシャルビデオごとのシナリオ別メモがあります。
Wan 2.7 I2Vモード FAQ
Wan 2.7におけるI2VとR2Vの違いは何ですか?
I2V (image-to-video) は静止画または短いクリップを入力として受け取ります。R2V (reference-to-video) は最大5枚の参照画像、5つの参照クリップ、1つの参照オーディオトラックを受け取り、それらを使用してアイデンティティ、声、スタイルを保持します。R2Vはマルチショットの一貫性により適しています。I2Vはシングルショットの作業により高速です。
Wan 2.7のファースト・ラストフレームモードはカメラの動きを処理できますか?
可能です。ただし、2つのキーフレームは一貫したカメラアングルを示唆している必要があります。first_frameとlast_frameが異なるアングルを示唆している場合、モデルはしばしばジャンプカットのように見えるトランジションを「発明」します。カメラの変更は15度未満の微妙なものに留めてください。
Wan 2.7のビデオ継続はクリップをどのくらい延長できますか?
ビデオ継続は、I2Vモードの15秒という厳格な上限までソースクリップを延長できます。ソースクリップと生成された継続部分の合計は15秒を超えることはできません。より長いビデオの場合は、複数の継続呼び出しを連結してください。
Wan 2.7のオーディオ駆動モードは画像に顔が必要ですか?
顔がある場合に最も効果的ですが、必須ではありません。顔がない場合、オーディオはリップシンクの代わりに全体的なモーションエネルギーを駆動します。オーディオ駆動モードを使用した風景や製品ショットは、オーディオの振幅に追従する抽象的な動きを生成します。
Wan 2.7 I2Vは無料で試せますか?
はい。PixMind Wan 2.7ページ には、クレジットカード不要の無料トライアルが含まれています。有料プランは、トライアルクォータを超えた場合にのみ開始されます。
実際の動作を見る
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



