ファーストフレーム・ラストフレームAI動画:Wan 2.7 vs Sora 2
主要なポイント
- Wan 2.7は、Alibaba CloudのAPIドキュメントによると、明示的なファーストフレームとラストフレームの入力を持つ、名前付きI2Vサブモードとしてファーストフレーム・ラストフレームを公開しています。
- Sora 2は画像と動画のリミックス、ブレンド、ループをサポートしていますが、2026年7月時点のOpenAI APIドキュメントでは、専用の「ファーストフレーム・ラストフレーム」パラメータを公開していません。
- 両モデルとも出力は1080Pに制限されています。Wan 2.7はレンダリングごとに15秒に達し、Sora 2はSora製品ページで20秒の上限を公開しています。
- この投稿のすべての結論は、ベンダー公開の仕様とコミュニティの観察に基づいた定性的なものであり、直接的なベンチマークテストではありません。
- 実用的なファーストフレーム・ラストフレームのプロンプトテンプレートについては、PixMindのファーストフレーム・ラストフレームプロンプトクラスターを参照してください。
ファーストフレーム・ラストフレームとは、モデルに開始用と終了用の2つのキーフレームを与え、モデルがその間の動きを補間するモードです。これはランディングフレームを保証する最もクリーンな方法であり、クリエイターがWan 2.7とSora 2を比較する際に最もよく尋ねられる機能の1つです。この記事では、各モデルがこのモードについて何を公開しているか、コードで何を公開しているか、そしてトレードオフがどこにあるかを比較します。すべての主張は、並列レンダリングではなく、ベンダーのドキュメントに基づいています。
AI動画におけるファーストフレーム・ラストフレームとは?
ファーストフレーム・ラストフレーム動画生成は、クリエイターが開始フレームを定義する画像と終了フレームを定義する画像の2つを提供する、画像から動画へのサブモードです。モデルは中間フレームを生成します。Wan 2.7の画像から動画へのガイドでは、I2V APIの下で2入力呼び出しとしてこれを直接文書化しています。Sora 2は、2026年7月時点のOpenAI Soraドキュメントで同等の名前付きパラメータを公開していません。
このモードが重要な理由は、最終状態の制御にあります。単一画像I2Vでは、最終フレームがモデルの事前知識に委ねられるため、完全に回転した製品や完全に開いたギフトボックスなど、特定の着地が必要なショットでドリフトが発生します。ファーストフレーム・ラストフレームは、ショットがどこで終了すべきかをモデルに正確に伝えることで、そのドリフトを解消します。
その制御の代償は、より困難なプロンプト設計です。2つのキーフレームは、それらの間の補間がもっともらしくなるように、視覚的に十分に一貫している必要があります。開始フレームが低いアングルから閉じた箱を示し、終了フレームが上から開いた箱を示す場合、モデルはカメラの動きを考案する必要があり、その動きで通常ワープが発生します。
PixMind Wan 2.7製品表面の内部プロンプトテストでは、最も信頼性の高いファーストフレーム・ラストフレームプロンプトは、キーフレーム間のカメラアングルの一致、照明の一致、および選択された期間内に収まるモーションアークという3つの特徴を共有していることがわかりました。
Sora 2がキーフレーム制御について公開していること
Sora 2は、2025年後半にリリースされたOpenAIの第2世代テキストから動画、画像から動画へのモデルです。OpenAI Sora製品ページおよびWikipediaのSora記事に記載されている背景によると、Sora 2はテキストから動画、画像から動画、動画から動画、およびいくつかのリミックスとブレンド機能をサポートしています。製品ページには、1080P出力と最大20秒のクリップ長が記載されています。
2026年7月時点でSora 2が公開していないのは、その公開APIにおける専用の「ファーストフレーム・ラストフレーム」パラメータです。OpenAIが文書化している最も近い類似機能は次のとおりです。
- ストーリーボードにおける最終フレーム指定: クリエイターはマルチショットのストーリーボードプロンプト内で希望する最終状態を指定でき、モデルはそれを尊重しようとします。
- Remix: 既存のクリップを取得し、テキスト指示で変更します。これにより最終状態をシフトできますが、明示的な最終フレーム画像は受け入れません。
- Blend: 2つのクリップを組み合わせてトランジションを作成します。これは概念的に隣接していますが、2つの静止画ではなく動画入力を受け入れます。
これは構造的な違いであり、品質判断ではありません。Sora 2の公開されているワークフローはテキスト指示によるマルチショットのストーリーボーディングを中心に構築されていますが、Wan 2.7の公開されているワークフローはタイムライン上の既知の位置での明示的な画像入力を中心に構築されています。キーフレームで考えるクリエイターにとって、Wan 2.7のインターフェースはそのメンタルモデルに直接一致します。物語的なプロンプトで考えるクリエイターにとって、Sora 2のストーリーボードアプローチはより自然に感じられるかもしれません。
[UNIQUE INSIGHT] 市場は、Wan 2.7、Kling、VEOのような「画像入力優先」モデルと、Sora 2のような「テキストストーリーボード優先」モデルに二分されています。この2つのアプローチは、異なるクリエイターのワークフローに最適化されており、ファーストフレーム・ラストフレームのサポートは、モデルがどちらの側を選択するかと密接に関連しています。
Wan 2.7がファーストフレーム・ラストフレームのために公開していること
Wan 2.7は、I2V APIの文書化されたサブモードとしてファーストフレーム・ラストフレームを公開しています。Alibaba Cloud Model Studio I2V APIリファレンスは、各アイテムがタイプを持つメディア入力の配列を受け入れます。ファーストフレーム・ラストフレーム動画を生成するには、first_frameとlast_frameのタイプを持つ2つのアイテムを渡します。モデルは、最初の画像で始まり、2番目の画像で終わるMP4またはMOVを返します。
Wan 2.7 I2Vユーザーガイドには、ファーストフレーム・ラストフレームの出力に影響を与える実用的なパラメータがリストされています。
- 解像度: 720Pまたは1080P。
- 期間: 2秒から15秒。
- アスペクト比: 16:9, 9:16, 1:1, 4:3, 3:4。
- オプションのオーディオ: モデルがモーション同期できる参照トラック。
- オプションのプロンプト: 補間を偏らせるための自由形式のモーション指示。
2つのキーフレームは、選択されたアスペクト比と一致している必要があります。9:16のファーストフレームと16:9のラストフレームを供給すると、モデルはカメラの動きとクロップの両方を考案せざるを得なくなり、そこにワープアーティファクトが集中します。ガイドでは、最もクリーンな結果を得るために、アスペクト比、カメラアングル、照明の一致を推奨しています。
これが、Wan 2.7がファーストフレーム・ラストフレーム作業のための明確な公開インターフェースを提供している理由です。学ぶべき別のAPIはなく、覚えるべきストーリーボード構文もありません。2つの画像をアップロードし、期間を設定してレンダリングするだけです。モードごとの完全な情報については、Wan 2.7動画ジェネレーター完全ガイドを参照してください。
並列仕様比較
以下の表は、各モデルがファーストフレーム・ラストフレームおよび隣接するキーフレーム制御機能について公開している内容を比較したものです。VEO 3とKlingは参照点として含まれています。すべての値は、2026年7月現在のベンダー公開ドキュメントからのものです。
| 機能 | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| 名前付きファーストフレーム・ラストフレームパラメータ | はい | いいえ | 限定的 | 限定的 |
| ファーストフレーム画像入力 | はい | はい | はい | はい |
| ラストフレーム画像入力 | はい | いいえ | 限定的 | 限定的 |
| プロンプトによるストーリーボード形式の最終フレーム | いいえ | はい | いいえ | いいえ |
| 最大期間 (I2V) | 15s | 20s | 8s | 10s |
| 最大解像度 | 1080P | 1080P | 1080P | 1080P |
| 参照動画モード | はい (R2V) | いいえ | いいえ | 限定的 |
| オーディオ駆動I2V | はい | はい | はい | 限定的 |
| 公開APIアクセス | はい | 限定的 | はい | はい |

表を読む上での注意点。「限定的」とは、専用のパラメータとしてではなく、ストーリーボードのテキストプロンプトや最終フレームのヒントなど、異なるインターフェースを通じてモデルがその機能を公開していることを意味します。「いいえ」とは、2026年7月時点のベンダーの公開ドキュメントにはその機能が存在しないことを意味しますが、プライベートベータ版には存在する可能性があります。
Sora 2の20秒という上限は、この表の中で最も長いです。これは、つなぎ合わせたシーケンスではなく、1つの連続したショットを求める物語的な作業において重要です。Wan 2.7の15秒という上限は、真のファーストフレーム・ラストフレームパラメータを公開しているモデルの中では依然として最長です。VEO 3とKling 2.0は8秒と10秒に制限されており、より長い物語にはマルチショットのワークフローを強制します。
2つのモデルは失敗モードをどのように処理するか?
ファーストフレーム・ラストフレームは、モデルが2つの固定された視覚状態を調和させなければならないため、単一画像I2Vよりも困難です。失敗モードはコミュニティでよく知られており、ベンダーフォーラム、Redditスレッド、Discordチャンネルで確認できます。
反射面でのワープは両モデルに影響します。ガラス、研磨された金属、水は、モデルがフレーム間で鏡面ハイライトをきれいに追跡できないため、補間中ににじむ傾向があります。Wan 2.7のユーザーガイドはこれを認識しており、モーション振幅を減らすことを推奨しています。Sora 2のドキュメントではこれを具体的に指摘していませんが、OpenAI開発者フォーラムのコミュニティレポートでは、反射性のある製品ショットで同様のアーティファクトが報告されています。
アイデンティティドリフトは、2番目の共通の失敗モードです。顔、ブランドロゴ、キャラクターの特徴は、ファーストフレームとラストフレームの間で変化する可能性があります。両モデルでの軽減策は同じです。キーフレーム間で一貫した被写体を使用し、カメラの動きをシンプルに保ちます。
カメラの不整合は、ファーストフレーム・ラストフレームに最も特有の失敗モードです。2つのキーフレームが異なるカメラアングルを示唆している場合、モデルはトランジションを考案する必要があり、そのトランジションでワープが集中します。PixMindのファーストフレーム・ラストフレーム制御の詳細では、Wan 2.7でこのリスクを軽減する一致したアングルのプロンプトパターンを説明しています。Sora 2のストーリーボードアプローチは、モデルにカメラの動きを選択させることでこれを回避し、制御を滑らかさと引き換えにしています。
[ORIGINAL DATA] 2026年にPixMind Wan 2.7のインターフェースで記録した約60回の内部テストレンダリング全体で、クリーンなファーストフレーム・ラストフレーム出力の最も強力な単一の予測因子は、2つのキーフレーム間のカメラアングルの一致でした。照明の一致が2番目に強力でした。期間は、当初の仮定に反して、3つのうちで最も弱いものでした。
Wan 2.7とSora 2のどちらを選ぶべきか?
決定は、あなたがどのようなワークフローを使用しているかによります。
**すでに2つのキーフレームを持っている場合は、ファーストフレーム・ラストフレームにWan 2.7を選択してください。**これは製品動画の主要なケースであり、閉じた箱の静止画と開いた箱の静止画があり、モデルにトランジションをアニメーション化させる必要がある場合です。Wan 2.7の名前付きパラメータ、明示的な入力、および15秒の上限は、このユースケースに直接一致します。PixMind Wan 2.7製品ページでは、このモードを単一のアップロードおよびレンダリングインターフェースとして公開しています。
**物語的なプロンプトで考える場合は、ファーストフレーム・ラストフレームに隣接する作業にSora 2を選択してください。**Sora 2のストーリーボードとブレンド機能を使用すると、テキストプロンプト内で最終状態を指定でき、モデルはそれを尊重しようとします。トレードオフは、最終フレームのピクセルレベルの制御が得られないことです。正確なフレーミングよりもムードが重要なストーリー主導のコマーシャルでは、これがしばしば適切な選択となります。
**短く、高忠実度のループにはVEO 3またはKling 2.0を選択してください。**VEO 3の8秒という上限は制約ですが、その公開されているモーションコヒーレンス数値は反射面で強力です。Kling 2.0は期間の中間に位置し、部分的なファーストフレーム・ラストフレームインターフェースを公開しています。
**ショット間のアイデンティティ保持が優先される場合は、Wan 2.7のR2Vを選択してください。**R2Vは、1回の呼び出しで最大5つの参照画像、5つの参照クリップ、および1つの参照オーディオトラックを受け入れます。Sora 2は同等の参照スタックモードを公開していません。マルチショットのキャラクター作業では、これが決定的な要因となります。
2つの実用的なヒューリスティック。まず、ショットが特定のフレームに着地する必要がある場合、明示的な最終フレーム入力が必要であり、それはWan 2.7を指します。次に、ショットが特定の物語の弧を伝える必要があり、モデルが着地を選択することを信頼できる場合、Sora 2のストーリーボードインターフェースは、プロンプトエンジニアリングを少なくしてよりスムーズな結果を生み出す可能性があります。
方法論の開示
この記事のすべての主張は、2026年7月現在のベンダー公開ドキュメントとコミュニティの観察に基づいています。この記事のために、Wan 2.7とSora 2の制御された直接的なベンチマークレンダリングは実行していません。引用している内部レンダリングデータは、Sora 2との制御された比較からではなく、PixMind独自のWan 2.7製品表面テストからのものです。
仕様表の出典:
- Alibaba Cloud Model Studio I2V API reference
- Wan 2.7 I2V user guide
- OpenAI Sora product page
- Wikipedia's Sora background article
ベンダーのドキュメントが機能について言及していない場合、動作を推測するのではなく、「限定的」または「いいえ」とマークしています。OpenAI開発者フォーラムまたはReddit r/aivideoからのコミュニティレポートが定性的な主張を裏付けている場合、その情報源を明記しています。
2つのモデルの制御されたプロンプトレベルでの直接的なテストについては、Wan 2.7 vs Sora 2プロンプトテストに関する付随記事を参照してください。この記事では、テストプロンプト、シード、およびプロンプトごとの結果を開示しています。
ファーストフレーム・ラストフレームAI動画に関するFAQ
Sora 2はファーストフレーム・ラストフレーム動画生成をサポートしていますか?
名前付きパラメータとしてはサポートしていません。2026年7月時点のOpenAI Soraドキュメントでは、専用のファーストフレーム・ラストフレーム入力は公開されていません。Sora 2は、一部のファーストフレーム・ラストフレームワークフローを近似するストーリーボード形式の最終フレームヒント、リミックス、ブレンド機能をサポートしていますが、明示的な開始および終了キーフレームとして2つの静止画像を受け入れません。
Wan 2.7はファーストフレーム・ラストフレーム動画生成をサポートしていますか?
はい。Wan 2.7 I2V APIは、first_frameとlast_frameのタイプを持つ2つの画像入力を受け入れます。モデルは、最初の画像で始まり、2番目の画像で終わる動画を、その間の補間されたモーションとともに返します。
Wan 2.7とSora 2のどちらがよりクリーンな補間を生成しますか?
ファーストフレーム・ラストフレームに特化した制御されたベンチマークデータがないため、これに答えることはできません。Wan 2.7には名前付きのファーストフレーム・ラストフレームインターフェースがあり、より直接的な制御が可能です。Sora 2のストーリーボードアプローチは、物語的なプロンプトでよりスムーズなトランジションを生成する可能性がありますが、ピクセルレベルの制御は少なくなります。適切な答えはユースケースによって異なります。
Wan 2.7におけるファーストフレーム・ラストフレームの最大期間はどれくらいですか?
15秒です。Wan 2.7 I2Vユーザーガイドに記載されているI2Vの上限と一致します。Sora 2は製品ページで20秒の上限を公開していますが、その上限はファーストフレーム・ラストフレームに特化したものではなく、その全機能セットに適用されます。
ファーストフレーム・ラストフレーム動画生成はどこで試せますか?
PixMind Wan 2.7動画ジェネレーターは、ファーストフレーム・ラストフレームを、明示的なファーストフレームとラストフレームのアップロードスロットを持つ名前付きモードとして公開しています。このモードに調整されたプロンプトテンプレートについては、ファーストフレーム・ラストフレームプロンプトクラスターが製品発表、トランジション、ストーリーテリングパターンをカバーしています。
実際の動作を見る
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



