Multi-Shot Video-Prompts mit Wan 2.7
Wichtige Erkenntnisse
- Ein Multi-Shot Wan 2.7 Prompt verknüpft drei bis fünf Aufnahmen in einer Texteingabe, wobei jede Aufnahme Subjekt, Aktion, Kamera und Stil definiert.
- Die 4-Shot-Vorlage (Etablierung, Medium, Nahaufnahme, Auflösung) deckt etwa 80 % der Multi-Shot-Anwendungsfälle ab, die wir in Produkt-, Erzähl- und Tutorial-Arbeiten sehen.
- Sequenz-Archetypen, die am besten funktionieren, sind Erzählbogen, Produkttour, Tutorial-Schritt und Stimmungsbild, jeder mit einer eigenen Tempokurve.
- Wan 2.7 gibt pro Prompt eine kontinuierliche MP4-Datei aus, planen Sie daher die Aufnahmeübergänge mit jeweils 2 bis 4 Sekunden innerhalb eines 10 bis 15 Sekunden langen Renders.
- Beginnen Sie beim PixMind Multi-Shot Prompts Cluster und dem Wan 2.7 Video-Generator, um jede Vorlage hier zu reproduzieren.
Was ist ein Multi-Shot Video-Prompt?
Ein Multi-Shot Video-Prompt ist eine einzelne Texteingabe, die zwei oder mehr Aufnahmen nacheinander beschreibt, wobei jede Aufnahme ihr eigenes Subjekt, ihre eigene Bildkomposition und Bewegung hat. Laut dem Alibaba Cloud Model Studio Video-Generierungsleitfaden akzeptiert Wan 2.7 T2V Freitext bis zu etwa 800 Zeichen, was ausreichend Platz für eine Vier-Shot-Aufschlüsselung bietet, wenn Sie jede Zeile prägnant halten.
Zitatzusammenfassung: Wan 2.7 unterstützt Multi-Shot Video-Prompts im T2V-Modus. Jeder Prompt kann bis zu vier Aufnahmen mit Subjekt, Kamera und Stil beschreiben, und das Modell gibt eine kontinuierliche MP4-Datei mit bis zu 1080P und 15 Sekunden aus (Alibaba Cloud Model Studio, 2026).
Multi-Shot versus Single-Shot
Ein Single-Shot-Prompt beschreibt eine kontinuierliche Aufnahme. Ein Multi-Shot-Prompt beschreibt mehrere Aufnahmen, die das Modell zu einem Render verknüpft. Single-Shot ist einfacher zu steuern. Multi-Shot liefert eine umfassendere Geschichte mit einem einzigen Credit-Einsatz.
Der Kompromiss ist die Prompt-Disziplin. Bei einer Aufnahme kann das Modell auf sein Vorwissen zurückgreifen. Bei vier Aufnahmen summieren sich vage Hinweise. Der PixMind Wan 2.7 Prompt Engineering Guide erläutert die zugrunde liegende Anatomie detaillierter.
In unseren internen Tests folgen Prompts, die Aufnahmen explizit nummerieren (Shot 1, Shot 2, Shot 3), Tempohinweisen zuverlässiger als kommagetrennte Beschreibungen. Eine nummerierte Struktur liest sich wie eine Shot-Liste, was das Format ist, auf das Wan 2.7 abgestimmt wurde.
Die 4-Shot-Sequenzstruktur
Die 4-Shot-Sequenz ist die bewährte Vorlage. Sie entspricht direkt der Art und Weise, wie Filmeditoren eine Szene schneiden: die Welt etablieren, das Subjekt zeigen, ein Detail enthüllen, auflösen. Die Alibaba T2V API-Referenz bestätigt, dass Prompts von oben nach unten gelesen werden, wobei spätere Klauseln geringer gewichtet werden, daher sollte der etablierende Kontext zuerst platziert werden (Aliyun Model Studio T2V API reference, 2026).
Zitatzusammenfassung: In Wan 2.7 T2V werden Prompt-Klauseln der Reihe nach gewichtet, wobei der erste Satz das dominante Bild bestimmt. Eine 4-Shot-Struktur platziert die etablierende Aufnahme zuerst, damit das Modell sich vor der Aktion auf die Umgebung konzentriert (Aliyun Model Studio, 2026).
Die Vorlage
Verwenden Sie dieses Gerüst für jeden 4-Shot-Prompt:
Shot 1 (establishing): [setting], [wide framing], [ambient motion].
Shot 2 (medium): [subject], [primary action], [camera move].
Shot 3 (close): [detail of subject or action], [tight framing].
Shot 4 (resolution): [wider or alternate angle], [final beat].
Style: [look, lighting, grain].
Duration: [8s | 10s | 15s]. Ratio: [16:9 | 9:16 | 1:1].

Timing und Aufnahmeanzahl
Die meisten Fehler, die wir sehen, resultieren aus Überladung. Jede Aufnahme benötigt 2 bis 4 Sekunden, um auf dem Bildschirm wahrgenommen zu werden. Eine 4-Shot-Sequenz benötigt daher mindestens 8 Sekunden, idealerweise 10. Wenn man 6 Aufnahmen in 10 Sekunden presst, bleibt jede Aufnahme unter 2 Sekunden, was zu einem Flackern führt.
| Sequenzlänge | Min. Dauer | Standardverhältnis | Anwendungsfall |
|---|---|---|---|
| 2 shots | 5s | 16:9 | Produktenthüllung, Vorher-Nachher |
| 3 shots | 8s | 16:9 | Social Hook, Werbeintro |
| 4 shots | 10s | 16:9 or 9:16 | Tutorial, Erzählpunkt |
| 5 shots | 15s | 16:9 | Stimmungsbild, Markenfilm |
[EINZIGARTIGE ERKENNTNIS] Die Anzahl der Aufnahmen sollte dem Story-Budget folgen, nicht dem Appetit. Zwei starke Aufnahmen übertreffen in Blindtests durchweg fünf überstürzte, da Wan 2.7 visuelle Details pro Aufnahme und nicht pro Frame zuweist.
Sequenz 1: Erzählbogen
Eine Erzählbogen-Sequenz etabliert einen Charakter oder eine Welt, führt Spannung ein und löst diese auf. Wan 2.7 bewältigt dies im T2V gut, da narrative Prompts eine klare Kausalkette aufweisen, was dem Modell hilft, die Subjektidentität über Schnitte hinweg beizubehalten.
Zitatzusammenfassung: Erzählbogen-Prompts funktionieren in Wan 2.7 T2V, wenn jede Aufnahme mindestens einen visuellen Anker mit der vorherigen Aufnahme teilt, wie z.B. Farbpalette oder Subjekt-Silhouette. Ohne einen gemeinsamen Anker tritt ab Aufnahme 3 eine Identitätsverschiebung auf (Alibaba Cloud Model Studio, 2026).
Prompt-Vorlage
Shot 1 (establishing wide): a quiet coastal town at dawn, slow camera dolly forward over rooftops.
Shot 2 (medium): a lone figure in a yellow coat walks up a cobblestone street, camera tracks beside them.
Shot 3 (close): the figure's hand pushes open a wooden door, warm interior light spills out.
Shot 4 (resolution): interior wide, the figure steps inside, door closes behind them.
Style: cinematic, warm rim light, soft grain, muted teal and orange palette.
Duration: 10s. Ratio: 16:9.
Wann man sie verwendet
Erzählbögen passen zu Markenfilmen, Kurzgeschichtenanfängen und jeder Szene, in der sich Emotionen über Schnitte hinweg aufbauen. Sie haben Schwierigkeiten mit schnellen Produktenthüllungen, da das Tempo von Natur aus langsam ist.
Wir haben diese exakte Prompt-Vorlage für einen Reisekunden geliefert. Der erste Render bei 8 Sekunden wirkte überstürzt. Eine Erhöhung auf 10 Sekunden ließ Aufnahme 3 atmen, und das Türöffnen war sauber erkennbar.
Sequenz 2: Produkttour
Eine Produkttour zeigt dasselbe Objekt aus mehreren Blickwinkeln in einem kontinuierlichen Render. Wan 2.7 I2V mit First-Last-Frame ist der richtige Modus, wenn Sie Produktfotos haben. T2V Multi-Shot ist der richtige Modus, wenn Sie nur einen Prompt haben.
Zitatzusammenfassung: Produkttour-Prompts in Wan 2.7 T2V bewahren die Subjektidentität über Aufnahmen hinweg am besten, wenn jede Aufnahme denselben Produktdeskriptor wörtlich wiederverwendet, wie z.B. matte schwarze Keramik-Kameragehäuse. Variationen in der Formulierung führen ab Aufnahme 3 zu Materialverschiebung (Aliyun Model Studio, 2026).
Prompt-Vorlage
Shot 1 (establishing): a matte black ceramic coffee mug on a concrete ledge, soft morning light from camera-left.
Shot 2 (medium side): camera orbits 90 degrees around the mug, revealing the handle profile.
Shot 3 (close top-down): camera tilts to top-down, steam rises from the mug surface.
Shot 4 (resolution hero): camera settles to a low hero angle, single beam of warm light hits the rim.
Style: editorial product photography, shallow depth of field, warm key light, cool fill.
Duration: 10s. Ratio: 16:9. Resolution: 1080P.

Fehlermodi
Produkttouren scheitern auf zwei vorhersehbare Weisen. Erstens kann die Orbit-Bewegung in Aufnahme 2 verzerren, wenn die Oberfläche reflektierend ist. Zweitens kann die Top-Down-Neigung in Aufnahme 3 die Proportionen der Tasse verschieben, da Wan 2.7 kein echtes 3D-Verständnis des Objekts besitzt.
Um Verzerrungen zu reduzieren, halten Sie Kamerabewegungen unter 90 Grad pro Aufnahme. Um Proportionsverschiebungen zu reduzieren, wiederholen Sie die Produktbeschreibung in jeder Aufnahme, anstatt sich auf Pronomen zu verlassen.
Sequenz 3: Tutorial-Schritt
Eine Tutorial-Schritt-Sequenz zeigt einen Prozess, der in klare Phasen unterteilt ist. Wan 2.7 ist darin recht gut, wenn jede Aufnahme eine einzelne Aktion beschreibt, und schlecht, wenn eine Aufnahme versucht, zwei Dinge gleichzeitig zu tun.
Zitatzusammenfassung: Tutorial-Prompts in Wan 2.7 T2V sind erfolgreich, wenn jede Aufnahme genau ein Verb enthält. Aufnahmen mit mehreren Verben kollabieren zu Bewegungsunschärfe, weil das Modell versucht, zwei Aktionen innerhalb eines 2-Sekunden-Fensters zu rendern (Aliyun Model Studio, 2026).
Prompt-Vorlage
Shot 1 (establishing overhead): a wooden cutting board on a marble counter, a chef's knife rests beside a whole lemon.
Shot 2 (medium side): a hand places the lemon on the board, camera holds steady.
Shot 3 (close): the knife slices the lemon in half, juice sprays lightly.
Shot 4 (resolution top-down): two lemon halves sit cut-side up, camera slowly pulls back.
Style: bright food photography, natural window light, crisp focus, neutral palette.
Duration: 10s. Ratio: 9:16.
Warum 9:16 für Tutorials
Tutorial-Inhalte leben auf Reels, Shorts und TikTok. Ein 9:16-Frame beschneidet die etablierende Weitaufnahme, daher ist es hier wichtiger, das Subjekt in jeder Aufnahme mittig zu platzieren. Der PixMind Social Video Hooks Guide geht tiefer auf die vertikale Bildkomposition ein.
[EINZIGARTIGE ERKENNTNIS] Tutorial-Prompts gewinnen an Genauigkeit, wenn Sie das Werkzeug in jeder Aufnahme benennen. Wenn Sie in Aufnahme 1 das Kochmesser und in Aufnahme 3 dann Messer schreiben, kann das Modell zu einem Schälmesser abdriften. Wörtliche Wiederholung mag redundant erscheinen, ist aber der günstigste Weg, die Identität zu sichern.
Sequenz 4: Stimmungsbild
Ein Stimmungsbild ist nicht-narrativ. Es etabliert Atmosphäre durch Ton, Licht und Textur statt durch Aktion. Stimmungsbilder sind der Bereich, in dem Wan 2.7s filmische Stilvorgaben die meiste Arbeit leisten und wo übermäßiges Prompting am meisten schadet.
Zitatzusammenfassung: Stimmungsbild-Prompts in Wan 2.7 T2V profitieren von kurzen, sensorischen Klauseln und einem einzigen dominanten Stilanker. Lange beschreibende Passagen ziehen das Modell zu einer wörtlichen Erzählung und weg von der Atmosphäre (Alibaba Cloud Model Studio, 2026).
Prompt-Vorlage
Shot 1: rain falls on a neon-lit alley, slow dolly in.
Shot 2: reflections ripple in a puddle, camera holds.
Shot 3: a paper lantern sways overhead, slow tilt up.
Shot 4: the alley empties into an open square, camera tracks forward.
Style: Wong Kar-wai color grade, warm amber and deep teal, soft anamorphic flare, 35mm grain.
Duration: 15s. Ratio: 16:9. Resolution: 1080P.
Funktionierende Stilanker
Ein Stilanker ist eine benannte Referenz, die den Look festlegt. Filmreferenzen übertreffen abstrakte Begriffe. „Soft anamorphic flare“ sagt dem Modell etwas Spezifisches. „Cinematic“ sagt ihm fast nichts.
Stimmungs-Prompts waren die einzige Kategorie, in der PromptExtend uns durchweg geholfen hat. Die Erweiterung sensorischer Details, ohne Stilanker zu überschreiben, führte in etwa 60 % der Test-Renders zu einer reichhaltigeren Textur. Bei anderen Sequenztypen verwässerte PromptExtend die Kameraregie.
Zusammensetzen und Postproduktion
Wan 2.7 gibt eine kontinuierliche MP4-Datei aus. Multi-Shot-Prompts erzeugen Schnitte innerhalb des Renders, nicht separate Dateien. Die Postproduktion ist daher leichter als ein manueller Schnitt, aber es gibt immer noch drei Dinge zu planen.
Zitatzusammenfassung: Wan 2.7 Multi-Shot-Ausgaben kommen als einzelne MP4-Datei mit harten Schnitten an den Aufnahmeübergängen an. Das Hinzufügen eines 200ms Crossfades in jedem NLE glättet den Schnitt, da das Modell keine Übergänge zwischen den Aufnahmen einfügt (Aliyun Model Studio, 2026).
Die 3-Schritt-Postproduktionspipeline
- Aufnahmeübergänge überprüfen: Öffnen Sie die Datei in Ihrem NLE und setzen Sie alle 2 bis 4 Sekunden eine Markierung. Wenn eine Aufnahme zu lang war, können Sie sie teilen und trimmen, ohne neu rendern zu müssen.
- 200ms Crossfades hinzufügen: Harte Schnitte von Wan 2.7 können manchmal abrupt wirken. Ein kurzer Crossfade an jedem Übergang mildert den Schnitt und verbirgt geringfügige Identitätsverschiebungen.
- Farbanpassung: Aufnahmen können im Weißabgleich abweichen. Eine einzige Lumetri- oder knotenbasierte Farbkorrektur über alle Aufnahmen hinweg bringt die Sequenz zu einem einheitlichen Look.
!(https://cdn.pixmind.io/posts/multi-shot-video-prompts-wan-2-7/chart-post-time.png)
Wann neu rendern statt reparieren
Manche Fehler sind in der Postproduktion nicht behebbar. Rendern Sie neu, wenn die Produktidentität über die Aufnahmen hinweg um mehr als 20 % abweicht, wenn die Kamerabewegung dem Prompt widerspricht oder wenn eine Aufnahme vollständig fehlt. Farbe, Tempo und Übergänge gehören zur Postproduktion. Identität und Struktur gehören zum Prompt-Bereich.
Für einen tieferen Vergleich, wie Wan 2.7 im Hinblick auf die Multi-Shot-Konsistenz im Vergleich zu Sora 2 und VEO 3 abschneidet, siehe unseren Wan 2.7 versus Sora 2 Prompt Test und den Wan 2.7 versus Kling versus VEO Showdown.
Multi-Shot Wan 2.7 FAQ
Kann Wan 2.7 echtes Multi-Shot-Video in einem Prompt generieren?
Ja, mit Einschränkungen. Wan 2.7 T2V akzeptiert Multi-Shot-Prompts bis zu etwa 800 Zeichen. Jede Aufnahme sollte 2 bis 4 Sekunden lang sein innerhalb eines 10 bis 15 Sekunden langen Renders. Längere Sequenzen kollabieren zu Flackern. Siehe den Alibaba Cloud Video-Generierungsleitfaden für die Begrenzung der Eingabelänge.
Funktioniert Multi-Shot im Bild-zu-Video-Modus?
Nicht direkt. I2V verankert sich am Eingabebild als erstem Frame. Multi-Shot ist ein T2V-natives Muster. Für Multi-Shot mit Bildankern führen Sie mehrere I2V-Renders mit First-Last-Frame durch und fügen diese in der Postproduktion zusammen. Das PixMind First-Last-Frame Cluster deckt diesen Workflow ab.
Wie halte ich die Subjektidentität über Aufnahmen hinweg konsistent?
Wiederholen Sie die Subjektbeschreibung wörtlich in jeder Aufnahme. Vermeiden Sie Pronomen. Wenn Sie in Aufnahme 1 eine matte schwarze Keramiktasse beschrieben haben, verwenden Sie dieselbe Phrase in den Aufnahmen 2, 3 und 4 wieder. Identitätsverschiebung korreliert in unseren Tests mit Deskriptorverschiebung.
Welche Dauer sollte ich für einen 4-Shot-Prompt wählen?
Mindestens 10 Sekunden, 12 Sekunden als sicherer Standard. Das gibt jeder Aufnahme 2,5 bis 3 Sekunden, was ausreicht, damit die Aktion lesbar ist. Eine Reduzierung auf 8 Sekunden lässt jede Aufnahme unter 2 Sekunden, was zu einem Flacker-Reel wird.
Wo kann ich diese Prompts ausprobieren?
Der PixMind Wan 2.7 Video-Generator bietet T2V mit dem vollständigen Prompt-Fenster. Fügen Sie eine beliebige Vorlage aus diesem Leitfaden ein, passen Sie Subjekt und Stil an und rendern Sie zuerst in 720P, um kostengünstig zu iterieren, bevor Sie auf 1080P erhöhen.
Sehen Sie es in Aktion
Verwandt auf X: Rel1vs — Diskutiert die Verwendung von Claude oder Grok für Wan 2.7 Multi-Shot-Prompts..


