Wan 2.7 Video Generator: The Complete Guide to Text, Image, and Reference Modes
主要なポイント
- Wan 2.7は、テキストからビデオ(T2V)、画像からビデオ(I2V)、参照からビデオ(R2V)を単一のワークフローでカバーする統合モデルです。
- 720Pおよび1080P出力、2〜15秒の期間、16:9、9:16、1:1を含む5つのアスペクト比をサポートしています。
- 最初と最後のフレーム、およびオーディオ駆動モードは、単一画像I2Vモデルでは実現できない開始状態と終了状態の制御を提供します。
- Reference-to-video (R2V)は、1回の呼び出しで最大5つの参照画像、5つの参照クリップ、および1つの参照オーディオトラックを受け入れます。
- このガイドのどの例でも、Wan 2.7 video generatorを試して一緒に進めてみてください。
Wan 2.7 ビデオジェネレーターとは?
Wan 2.7は、AlibabaのWanチームによる最新のビデオ生成モデルであり、Alibaba Cloud Model Studioを通じて公開されています。これは、以前は別々だった4つの機能(テキストからビデオ、画像からビデオ、参照からビデオ、ビデオ編集)を1つのモデルファミリーに統合します。Alibaba Cloud video generation overviewによると、このモデルはマルチモーダル入力を受け入れ、最大1080PのMP4またはMOVを出力します。
2.7の主要な変化は、ワークフローの統合です。テキストからビデオと画像からビデオのためにベンダーを切り替える代わりに、同じモデルを呼び出し、渡す入力に基づいてAPIがルーティングするようにします。これは、すべてのモードを1つの作成インターフェースで処理するPixMind Wan 2.7 product pageと一致しています。
クリエイターにとって、これはモード切り替えでほとんどの制作時間が失われるため重要です。プロンプトを書き、レンダリングし、開始状態が間違っていることに気づき、別のツールで最初から再構築します。Wan 2.7の統合されたインターフェースにより、モデルを切り替えることなく入力を交換できます。
Wan 2.7はいくつのモードをサポートしていますか?
Wan 2.7は4つのモードを公開しています。I2V API referenceには、完全な入力マトリックスが記載されています。以下に実用的な内訳を示します。
| モード | 入力 | 最適な用途 | 最大期間 | 最大解像度 |
|---|---|---|---|---|
| T2V (Text-to-Video) | テキストプロンプト、オプションのオーディオ | ストーリーボード、抽象的な動き、Bロール | 15秒 | 1080P |
| I2V (Image-to-Video) | 最初のフレーム、オプションの最後のフレーム、オプションのオーディオ | 製品の発表、キャラクターのアクション、アニメーション | 15秒 | 1080P |
| R2V (Reference-to-Video) | 最大5つの参照画像 + 5つの参照クリップ + 参照オーディオ | アイデンティティの保持、音声クローン、複数キャラクターのシーン | 10秒 | 1080P |
| Video Edit | ソースビデオ + 指示 | スタイル転送、指示ベースの編集 | 10秒 | 1080P |

テキストからビデオ (T2V)
T2Vはテキストプロンプトを受け取り、ビデオを出力します。Wan 2.7 T2V API referenceには、解像度、期間、比率、オプションのオーディオトラックなどのサポートされているパラメーターがリストされています。T2Vはアイデアからクリップへの最速のパスです。
固定された開始フレームがない場合はT2Vを使用します。抽象的な動き、Bロール、ストーリーボード、様式化されたシーケンスはすべて適しています。開始状態が重要な場合はT2Vを避けてください。フレームゼロで特定の製品を画面に表示する必要がある場合は、I2Vに切り替えてください。
画像からビデオ (I2V)
I2Vは、Wan 2.7のワークフロー統合が発揮される場所です。Wan 2.7 image-to-video user guideには、4つのサブモードが記載されています。
- 最初のフレームからビデオ: 1枚の画像が開始状態となり、モデルが動きを生成します。
- 最初と最後のフレームからビデオ: 2枚の画像が開始状態と終了状態を定義し、モデルが補間します。
- ビデオの継続: 短いクリップが開始状態となり、モデルがそれを延長します。
- オーディオ駆動: 画像とオーディオトラックがリップシンクまたは動きを駆動します。
4つのI2Vパスの詳細については、PixMind first-last-frame prompts clusterを参照してください。
参照からビデオ (R2V)
R2Vは最も強力で、最も文書化されていないモードです。Wan 2.7 R2V API referenceは、最大5つの参照画像、5つの参照クリップ、および1つの参照オーディオトラックを受け入れる呼び出しについて説明しています。モデルはこれらを使用して、出力全体でアイデンティティ、音声、およびスタイルを保持します。
R2Vは、ショット全体でキャラクターを同じように見せる必要がある場合や、新しいシーンに音声をクローンしたい場合に使用します。トレードオフは期間です。R2Vは10秒に制限されており、T2VおよびI2Vの15秒の上限よりも短いです。
ビデオ編集
ビデオ編集は、ソースビデオとテキスト指示を受け取り、編集されたクリップを返します。Wan 2.7 video editing APIは、指示ベースの編集とスタイル転送をサポートしています。このモードは生成ガイドの範囲外ですが、存在することを知っておく価値はあります。
最初と最後のフレームモードはどのように機能しますか?
最初と最後のフレームはI2Vのサブモードです。最初のフレーム用と最後のフレーム用に2枚の画像を提供します。Wan 2.7は中間のフレームを生成します。

これは、単一画像I2Vが終了状態をモデルに任せるため重要です。ショットが特定のフレームに着地する必要がある場合(製品が完全に回転している、箱が完全に開いている、キャラクターが完全に振り向いているなど)、最初と最後のフレームは、その着地を保証する方法です。
実用的なパターンは、2つのキーフレームを撮影または生成し、それらを最初と最後としてアップロードし、期間を設定してレンダリングすることです。Wan 2.7はそれらの間の動きを補間します。PixMind first-last-frame prompts pageには、製品の発表、トランジション、ストーリーテリングパターンのプロンプトテンプレートがあります。
注意すべき一般的な失敗モード:
- 反射面での歪み: ガラス、金属、水は補間中ににじむことがあります。
- キャラクターのアイデンティティのずれ: 顔がフレーム間で変化する可能性があります。
- カメラの不整合: 2つのキーフレームが異なるカメラアングルを示唆している場合、モデルはトランジションを考案する必要があります。
5〜10秒のレンダリングを行う前に、まず短い期間(2〜3秒)でテストしてください。
オーディオ駆動ビデオはどのように機能しますか?
オーディオ駆動モードは、静止画像とオーディオトラックを受け取り、被写体がオーディオと同期して話したり動いたりするように見えるビデオを生成します。これは、トーキングヘッドやアバターコンテンツの基盤です。
モデルはオーディオ波形を使用して、2つのことを駆動します。リップモーション(顔がある場合)と全体的なモーションエネルギーです。Wan 2.7 I2V APIは、driving_audioタイプを使用して、メディア配列の一部としてオーディオを受け入れます。
トーキングヘッドのユースケースでは、これをPixMind character performance clusterと組み合わせてください。オーディオ駆動I2Vとクリーンな参照ポートレートの組み合わせは、カスタムモデルをトレーニングすることなくリップシンクされたアバターを作成するための現在の最良のオープンパスです。
2つの実用的な注意点:
- オーディオ品質がビデオ品質を左右します。クリーンなスタジオ録音は、電話のマイクよりも優れています。
- まず3秒のクリップでテストしてください。同期の問題は早期に発見しやすいです。
どの解像度、期間、アスペクト比を選択すべきですか?
Wan 2.7は720Pおよび1080P出力をサポートしています。トレードオフはコストとシャープネスです。PixMind pricing strategyによると、1080Pは720Pの約2倍のクレジットを1秒あたり消費します。
| 設定 | 選択時期 | トレードオフ |
|---|---|---|
| 720P | ソーシャルファーストコンテンツ、縦型ビデオ、テストイテレーション | 低コスト、大画面では目に見える柔らかさ |
| 1080P | 製品ショーケース、シネマティックプレビズ、広告クリエイティブ | 高コスト、よりシャープなディテール |
| 16:9 | YouTube、ウェブサイト埋め込み | 標準ワイドスクリーン |
| 9:16 | Reels、TikTok、Shorts | モバイル縦型 |
| 1:1 | フィード投稿、正方形埋め込み | クロスプラットフォームニュートラル |
| 4:3 / 3:4 | エディトリアル、ビンテージスタイル | ニッチ |
期間はコストを直線的に左右します。10秒のレンダリングは、同じ解像度での2秒のレンダリングの約5倍のコストがかかります。イテレーションでは短く、最終的には長く作業してください。
新規ユーザー向けの合理的なデフォルト設定:720P、5秒、16:9。ショットが機能することを確認してから、最終的に1080Pに上げてください。
適切なWan 2.7モードをどのように選択しますか?
どのような入力があるかを知っていれば、意思決定ツリーは簡単です。

- アイデアしかない場合: T2Vを使用します。ビジュアルを追加する前にプロンプトを反復してください。
- 製品写真が1枚ある場合: I2Vの最初のフレームモードを使用します。
- 開始と終了でなければならない2つのキーフレームがある場合: I2Vの最初と最後のフレームを使用します。
- 延長する必要がある短いクリップがある場合: I2Vのビデオ継続を使用します。
- ポートレートとナレーションがある場合: I2Vのオーディオ駆動を使用します。
- ショット全体でアイデンティティまたは音声を保持する必要がある場合: R2Vを使用します。
- 編集またはスタイル変更が必要な既存のフッテージがある場合: ビデオ編集を使用します。
不明な場合は、PixMind Wan family hubから開始し、モード名ではなくユースケースで選択してください。ハブは、作成しようとしているものに基づいて適切なインターフェースにルーティングします。
Wan 2.7にどのようにプロンプトを出すべきですか?
プロンプトの構造は、プロンプトの長さよりも重要です。Wan 2.7は、被写体、アクション、設定、カメラ、スタイルの5つのセグメントからなる構造を評価します。
サンプル構造:
被写体:暗い表面に置かれたガラス製の香水瓶。アクション:水滴の噴霧が右に噴出する。設定:スタジオの黒い背景、カメラ左からの単一のキーライト。カメラ:静止したミディアムショット、50mm相当。スタイル:シネマティック、浅い被写界深度、暖かいリムライト。
各セグメントは出力空間を狭めます。欠落しているセグメントはモデルの事前知識にデフォルト設定され、通常は一般的です。
より詳細なプロンプトパターンについては、PixMind multi-shot prompts clusterが、マルチショットシーケンス、オーディオ同期パターン、最初と最後のフレームのストーリーボードを含む12の再利用可能な構造をカバーしています。
避けるべき2つのプロンプトの落とし穴:
- 過負荷なプロンプト: 1つのプロンプトに5つ以上の被写体があるとモデルが混乱します。複数のレンダリングに分割してください。
- ネガティブプロンプトの乱用: Wan 2.7は画像モデルのようにネガティブプロンプトを重視しません。短く保ってください。
Wan 2.7は他のモデルと比較してどうですか?
Wan 2.7は混雑した分野に位置しています。Sora 2, VEO 3, Kling 2.0, Seedanceはすべて重複するユースケースをターゲットにしています。差別化は、各モデルがどのモードを公開しているか、そしてそのコストにあります。
| 機能 | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Text-to-Video | はい | はい | はい | はい |
| Image-to-Video | はい | 限定的 | はい | はい |
| First-Last-Frame | はい | いいえ | 限定的 | 限定的 |
| Reference-Video (R2V) | はい | いいえ | いいえ | 限定的 |
| Audio-Driven I2V | はい | はい | はい | 限定的 |
| 最大期間 | 15秒 | 20秒 | 8秒 | 10秒 |
| 最大解像度 | 1080P | 1080P | 1080P | 1080P |
この表は、2026年7月時点でのベンダー公開仕様を反映しています。独立した直接比較テストは、Wan 2.7 versus Sora 2 prompt testおよびVEO and Kling showdownに掲載されています。
Wan 2.7の際立った利点は、最初と最後のフレームとR2Vの組み合わせです。表中の他のモデルで、両方をフル機能で公開しているものはありません。ワークフローで正確な開始と終了の制御とアイデンティティの保持が必要な場合、Wan 2.7は現在唯一の単一モデルパスです。
一般的な失敗モードは何ですか?
すべてのAIビデオモデルには失敗があります。失敗モードを特定することで、より迅速に出荷できます。
- 反射面での歪み: ガラス、鏡、研磨された金属。プロンプトで動きの振幅を減らすことで軽減します。
- ショット間のアイデンティティのずれ: 顔が生成間で変化します。R2V参照入力で軽減します。
- フレーム内の幻覚テキスト: 看板、ラベル、ロゴが意味不明なものとしてレンダリングされます。入力画像からテキストを削除することで軽減します。
- アスペクト比の不一致: 9:16の画像を16:9の生成に供給すると、予期せずトリミングされます。入力アスペクトを出力アスペクトに合わせます。
- 長いイテレーションでのクレジット消費: 10秒のテストレンダリングはクレジットを急速に消費します。2〜3秒でイテレーションしてください。
PixMind use cases clusterには、製品マーケティング、キャラクターパフォーマンス、シネマティックプレビズ、ソーシャルフックごとのシナリオ別失敗モードに関するメモがあります。
Wan 2.7 Video Generator FAQ
Wan 2.7は無料で試せますか?
はい。PixMind Wan 2.7 pageには、クレジットカード不要の無料トライアルが含まれています。有料プランは、トライアルクォータを超えた場合にのみ適用されます。
Wan 2.7は4Kをサポートしていますか?
いいえ。Wan 2.7ビデオは最大1080Pです。Wan 2.7画像モデルはProティアを通じて4K静止画をサポートしていますが、ビデオ出力は1080Pに制限されています。
Wan 2.7は特定の人物の顔をクローンできますか?
Wan 2.7は参照入力からアイデンティティを保持できますが、PixMindのポリシーは、実際の識別可能な人物の非同意の肖像クローンを禁止しています。R2Vは、オリジナルキャラクター、ストック参照、またはご自身の肖像で使用してください。
Wan 2.7の1回のレンダリングにはどのくらい時間がかかりますか?
生成時間は、期間、解像度、および負荷によって異なります。一般的な5秒の720Pレンダリングは60〜90秒で完了します。10秒の1080Pレンダリングは3〜5分かかる場合があります。APIはステータスをポーリングするためのタスクIDを返します。
Wan 2.7はオーディオを生成しますか?
はい、ただしオーディオ入力を受け入れるモードのみです。T2Vはオーディオトラックを受け取り、それに合わせてモーションを同期できます。I2Vオーディオ駆動モードは、オーディオを使用してリップとモーションの同期を駆動します。純粋なオーディオ生成(音楽、効果音)は、別のAlibabaモデルです。
Wan 2.7の出力を商用利用できますか?
はい。生成された出力は、Alibaba Cloud Model Studioの規約に基づき、商用利用が可能です。出荷前にAlibaba Cloud Model Studio overviewで現在の規約を確認してください。
動作中の様子を見る
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



