期間限定年間メンバーシップで30% オフさらに GPT Image、MiniMax H3 などが無制限
Seedance 2.5・Wan 3.0・GPT Image 2.5 が登場 · 期間限定 50% オフ
今すぐアップグレード
Pixmind

Wan 2.7によるマルチショットビデオプロンプト:4シーケンスチュートリアル

目次

Wan 2.7によるマルチショットビデオプロンプト

主要なポイント

  • マルチショットのWan 2.7プロンプトは、1つのテキスト入力で3〜5つのショットを連結し、各ショットで被写体、アクション、カメラ、スタイルを定義します。
  • 4ショットテンプレート(確立、ミディアム、クローズ、解決)は、製品、物語、チュートリアル作業で見られるマルチショットのユースケースの約80%をカバーします。
  • 最も効果的なシーケンスアーキタイプは、物語のアーク、製品ツアー、チュートリアルステップ、ムードピースであり、それぞれ異なるペース曲線を持っています。
  • Wan 2.7はプロンプトごとに1つの連続したMP4を出力するため、10〜15秒のレンダリング内で各ショットの境界を2〜4秒に計画してください。
  • ここにある任意のテンプレートを再現するには、PixMind multi-shot prompts clusterとWan 2.7 video generatorから始めてください。

マルチショットビデオプロンプトとは?

マルチショットビデオプロンプトは、2つ以上のショットを連続して記述する単一のテキスト入力であり、各ショットには独自の被写体、フレーミング、モーションがあります。Alibaba Cloud Model Studio video generation guideによると、Wan 2.7 T2Vは最大約800文字の自由形式テキストを受け入れます。これは、各行を簡潔に保てば、4ショットの分解に十分なスペースです。

引用カプセル: Wan 2.7はT2Vモードでマルチショットビデオプロンプトをサポートしています。各プロンプトは、被写体、カメラ、スタイルを含む最大4つのショットを記述でき、モデルは最大1080P、15秒の連続したMP4を出力します(Alibaba Cloud Model Studio, 2026)。

マルチショット対シングルショット

シングルショットプロンプトは1つの連続したテイクを記述します。マルチショットプロンプトは、モデルが1つのレンダリングに連結する複数のショットを記述します。シングルショットの方が制御が簡単です。マルチショットは、1回のクレジット消費でより完全なストーリーを提供します。

トレードオフはプロンプトの規律です。1つのショットでは、モデルは以前の知識に頼ることができます。4つのショットでは、曖昧な手がかりが複合します。PixMind Wan 2.7 prompt engineering guideでは、その根底にある構造について詳しく説明しています。

社内テストでは、ショットを明示的に番号付けしたプロンプト(Shot 1、Shot 2、Shot 3)は、コンマ区切りの記述よりも信頼性高くペースの指示に従いました。番号付けされた構造はショットリストとして読まれ、これはWan 2.7が調整された形式です。

4ショットシーケンス構造

4ショットシーケンスは主力テンプレートです。これは、映画編集者がシーンをカットする方法に直接対応しています。世界を確立し、被写体を示し、詳細を明らかにし、解決します。Alibaba T2V APIリファレンスは、プロンプトが上から下へ読まれ、後の句ほど重みが低くなることを確認しているため、確立するコンテキストを最初に配置します(Aliyun Model Studio T2V API reference, 2026)。

引用カプセル: Wan 2.7 T2Vでは、プロンプトの句は順序に従って重み付けされ、最初の文が主要なビジュアルを駆動します。4ショット構造では、確立ショットを最初に配置することで、モデルはアクションの前に設定に固定されます(Aliyun Model Studio, 2026)。

テンプレート

任意の4ショットプロンプトにはこの骨格を使用してください:

Shot 1 (establishing): [setting], [wide framing], [ambient motion].
Shot 2 (medium): [subject], [primary action], [camera move].
Shot 3 (close): [detail of subject or action], [tight framing].
Shot 4 (resolution): [wider or alternate angle], [final beat].
Style: [look, lighting, grain].
Duration: [8s | 10s | 15s]. Ratio: [16:9 | 9:16 | 1:1].

Diagram: Horizontal storyboard showing 4 connected shot panels labeled Shot 1 through Shot 4 with orange transition arrows between them.

タイミングとショット数

私たちが見るほとんどの失敗は、過負荷によるものです。各ショットは画面上で読み取られるのに2〜4秒必要です。したがって、4ショットシーケンスには最低8秒、理想的には10秒が必要です。10秒に6ショットを詰め込むと、各ショットが2秒未満になり、ちらつきに崩壊します。

| シーケンス長 | 最小持続時間 | デフォルト比率 | ユースケース |
|---िजन|---|---|
| 2ショット | 5秒 | 16:9 | 製品発表、ビフォーアフター |
| 3ショット | 8秒 | 16:9 | ソーシャルフック、広告イントロ |
| 4ショット | 10秒 | 16:9または9:16 | チュートリアル、物語のビート |
| 5ショット | 15秒 | 16:9 | ムードピース、ブランドフィルム |

[独自の洞察] ショット数は、欲求ではなくストーリーの予算に従うべきです。Wan 2.7はフレームごとではなくショットごとに視覚的な詳細を割り当てるため、ブラインドレビューでは、急いで作成された5つのショットよりも、2つの強力なショットが一貫して優れた結果を出します。

シーケンス1:物語のアーク

物語のアークシーケンスは、キャラクターや世界を確立し、緊張を導入し、解決します。物語のプロンプトには明確な因果関係があるため、Wan 2.7はT2Vでこれをうまく処理し、モデルがカット全体で被写体のアイデンティティを維持するのに役立ちます。

引用カプセル: Wan 2.7 T2Vにおける物語のアークプロンプトは、各ショットが前のショットとカラーパレットや被写体のシルエットなど、少なくとも1つの視覚的アンカーを共有している場合に機能します。共有アンカーがない場合、ショット3までにアイデンティティのずれが現れます(Alibaba Cloud Model Studio, 2026)。

プロンプトテンプレート

Shot 1 (establishing wide): a quiet coastal town at dawn, slow camera dolly forward over rooftops.
Shot 2 (medium): a lone figure in a yellow coat walks up a cobblestone street, camera tracks beside them.
Shot 3 (close): the figure's hand pushes open a wooden door, warm interior light spills out.
Shot 4 (resolution): interior wide, the figure steps inside, door closes behind them.
Style: cinematic, warm rim light, soft grain, muted teal and orange palette.
Duration: 10s. Ratio: 16:9.

いつ使用するか

物語のアークは、ブランドフィルム、短編小説のオープニング、およびカット全体で感情が高まるあらゆるシーンに適しています。ペースが意図的に遅いため、迅速な製品発表には苦労します。

私たちはこの正確なプロンプトテンプレートを旅行クライアント向けに出荷しました。8秒での最初のレンダリングは急ぎすぎていると感じられました。10秒に引き上げることでショット3に余裕ができ、ドアを押す動作が明確に読み取れました。

シーケンス2:製品ツアー

製品ツアーは、1つの連続したレンダリングで同じオブジェクトを複数の角度から示します。製品写真がある場合は、first-last-frameを使用するWan 2.7 I2Vが適切なモードです。プロンプトしかない場合は、T2Vマルチショットが適切なモードです。

引用カプセル: Wan 2.7 T2Vにおける製品ツアープロンプトは、各ショットが「マットブラックのセラミック製カメラボディ」のように同じ製品記述子を逐語的に再利用する場合に、ショット全体で被写体のアイデンティティを最もよく保持します。フレーズのバリエーションは、ショット3までに素材のずれを引き起こします(Aliyun Model Studio, 2026)。

プロンプトテンプレート

Shot 1 (establishing): a matte black ceramic coffee mug on a concrete ledge, soft morning light from camera-left.
Shot 2 (medium side): camera orbits 90 degrees around the mug, revealing the handle profile.
Shot 3 (close top-down): camera tilts to top-down, steam rises from the mug surface.
Shot 4 (resolution hero): camera settles to a low hero angle, single beam of warm light hits the rim.
Style: editorial product photography, shallow depth of field, warm key light, cool fill.
Duration: 10s. Ratio: 16:9. Resolution: 1080P.

Comparison grid: 4 shot panels labeled Shot 1 through Shot 4 showing a product tour around a ceramic mug, each from a different angle.

失敗モード

製品ツアーは2つの予測可能な方法で失敗します。第一に、表面が反射性である場合、ショット2の軌道が歪む可能性があります。第二に、Wan 2.7にはオブジェクトの実際の3D理解がないため、ショット3のトップダウン傾斜がマグカップのプロポーションを変化させる可能性があります。

歪みを減らすには、ショットごとのカメラの動きを90度未満に保ちます。プロポーションのずれを減らすには、代名詞に頼るのではなく、すべてのショットで製品記述子を繰り返します。

シーケンス3:チュートリアルステップ

チュートリアルステップシーケンスは、明確な段階に分けられたプロセスを示します。Wan 2.7は、各ショットが単一のアクションを記述する場合には優れており、1つのショットが2つのことを同時に行おうとする場合には劣ります。

引用カプセル: Wan 2.7 T2Vにおけるチュートリアルプロンプトは、各ショットに正確に1つの動詞が含まれている場合に成功します。複数の動詞を含むショットは、モデルが2秒のウィンドウ内で2つのアクションをレンダリングしようとするため、モーションブラーに崩壊します(Aliyun Model Studio, 2026)。

プロンプトテンプレート

Shot 1 (establishing overhead): a wooden cutting board on a marble counter, a chef's knife rests beside a whole lemon.
Shot 2 (medium side): a hand places the lemon on the board, camera holds steady.
Shot 3 (close): the knife slices the lemon in half, juice sprays lightly.
Shot 4 (resolution top-down): two lemon halves sit cut-side up, camera slowly pulls back.
Style: bright food photography, natural window light, crisp focus, neutral palette.
Duration: 10s. Ratio: 9:16.

チュートリアルに9:16を使用する理由

チュートリアルコンテンツはReels、Shorts、TikTokで公開されます。9:16のフレームは確立ワイドをトリミングするため、ここではすべてのショットで被写体をフレーム中央に配置することがより重要です。PixMindのsocial video hooks guideでは、縦型フレーミングについてさらに詳しく説明しています。

[独自の洞察] 各ショットでツール名を指定すると、チュートリアルプロンプトの精度が向上します。ショット1で「シェフナイフ」と書き、ショット3で「ナイフ」と書くと、モデルがペティナイフにずれてしまう可能性があります。逐語的な繰り返しは冗長に感じられますが、アイデンティティを固定する最も安価な方法です。

シーケンス4:ムードピース

ムードピースは非物語的です。アクションではなく、トーン、光、テクスチャを通じて雰囲気を確立します。ムードピースは、Wan 2.7の映画のようなスタイルの事前知識が最も効果を発揮し、過剰なプロンプトが最も害を及ぼす場所です。

引用カプセル: Wan 2.7 T2Vにおけるムードピースプロンプトは、短い感覚的な句と単一の支配的なスタイルアンカーから恩恵を受けます。長い記述的な文章は、モデルを文字通りの物語に引き寄せ、雰囲気から遠ざけます(Alibaba Cloud Model Studio, 2026)。

プロンプトテンプレート

Shot 1: rain falls on a neon-lit alley, slow dolly in.
Shot 2: reflections ripple in a puddle, camera holds.
Shot 3: a paper lantern sways overhead, slow tilt up.
Shot 4: the alley empties into an open square, camera tracks forward.
Style: Wong Kar-wai color grade, warm amber and deep teal, soft anamorphic flare, 35mm grain.
Duration: 15s. Ratio: 16:9. Resolution: 1080P.

機能するスタイルアンカー

スタイルアンカーとは、ルックを固定する1つの名前付き参照です。映画の参照は抽象的な用語よりも優れています。「ソフトなアナモフィックフレア」と言うと、モデルに具体的な何かを伝えます。「シネマティック」と言うと、ほとんど何も伝わりません。

ムードプロンプトは、PromptExtendが一貫して私たちを助けた唯一のカテゴリでした。スタイルアンカーを上書きせずに感覚的な詳細を拡張することで、テストレンダリングの約60%でより豊かなテクスチャが得られました。他のシーケンスタイプでは、PromptExtendはカメラの方向を希薄化させました。

ステッチングとポストプロダクション

Wan 2.7は1つの連続したMP4を出力します。マルチショットプロンプトは、個別のファイルではなく、レンダリング内でカットを生成します。したがって、ポストプロダクションは手動編集よりも軽量ですが、それでも計画すべき3つのことがあります。

引用カプセル: Wan 2.7のマルチショット出力は、ショット境界にハードカットがある単一のMP4として提供されます。モデルはショット間にトランジションを挿入しないため、任意のNLEで200msのクロスフェードを追加すると、カットがスムーズになります(Aliyun Model Studio, 2026)。

3ステップのポストプロダクションパイプライン

  1. ショット境界の確認: NLEでファイルを開き、2〜4秒ごとにマーカーを配置します。ショットが長すぎた場合は、再レンダリングせずに分割およびトリミングできます。
  2. 200msのクロスフェードを追加: Wan 2.7からのハードカットは、時に唐突に感じられます。各境界に短いクロスフェードを追加することで、カットを柔らかくし、わずかなアイデンティティのずれを隠します。
  3. カラーマッチ: ショット間でホワイトバランスがずれることがあります。すべてのショットにわたる単一のLumetriまたはノードベースのグレーディングにより、シーケンス全体を統一されたルックに引き込みます。

!(https://cdn.pixmind.io/posts/multi-shot-video-prompts-wan-2-7/chart-post-time.png)

修正ではなく再レンダリングすべき時

一部の失敗はポストプロダクションでは修正できません。製品のアイデンティティがショット間で20%以上ずれる場合、カメラの動きがプロンプトと矛盾する場合、またはショットが完全に欠落している場合は、再レンダリングしてください。色、ペース、トランジションはポストプロダクションの領域です。アイデンティティと構造はプロンプトの領域です。

Wan 2.7がSora 2やVEO 3とマルチショットの一貫性においてどのように比較されるかについて、より詳細な比較については、Wan 2.7 versus Sora 2 prompt testおよびWan 2.7 versus Kling versus VEO showdownをご覧ください。

マルチショット Wan 2.7 FAQ

Wan 2.7は1つのプロンプトで真のマルチショットビデオを生成できますか?

はい、制限はありますが可能です。Wan 2.7 T2Vは、最大約800文字のマルチショットプロンプトを受け入れます。各ショットは、10〜15秒のレンダリング内で2〜4秒の長さである必要があります。より長いシーケンスはちらつきに崩壊します。入力長の制限については、Alibaba Cloud video generation guideを参照してください。

マルチショットは画像からビデオへのモードで機能しますか?

直接的には機能しません。I2Vは入力画像を最初のフレームとして固定します。マルチショットはT2Vネイティブのパターンです。画像アンカー付きのマルチショットの場合、first-last-frameを使用して複数のI2Vレンダリングを実行し、ポストプロダクションで結合します。PixMind first-last-frame clusterがそのワークフローをカバーしています。

ショット間で被写体のアイデンティティを一貫させるにはどうすればよいですか?

すべてのショットで被写体記述子を逐語的に繰り返してください。代名詞は避けてください。ショット1で「マットブラックのセラミック製マグカップ」と記述した場合、ショット2、3、4でも同じフレーズを再利用してください。私たちのテストでは、アイデンティティのずれは記述子のずれと相関しています。

4ショットプロンプトにはどのくらいの期間を選択すべきですか?

最低10秒、安全なデフォルトとして12秒です。これにより、各ショットに2.5〜3秒が与えられ、アクションが読み取れるのに十分な時間となります。8秒に短縮すると、すべてのショットが2秒未満になり、ちらつきのリールになります。

これらのプロンプトはどこで試せますか?

PixMind Wan 2.7 video generatorは、完全なプロンプトウィンドウでT2Vを公開しています。このガイドの任意のテンプレートを貼り付け、被写体とスタイルを調整し、まず720Pでレンダリングして安価に反復し、その後1080Pに引き上げてください。

実際の動作を見る

Xでの関連: Rel1vs — Wan 2.7のマルチショットプロンプトにClaudeまたはGrokを使用することについて議論しています。

読み込み中...

関連ツール