Wan 2.7 Video Generator: Der komplette Leitfaden für Text-, Bild- und Referenzmodi
Wichtige Erkenntnisse
- Wan 2.7 ist ein einheitliches Modell, das Text-zu-Video (T2V), Bild-zu-Video (I2V) und Referenz-zu-Video (R2V) in einem einzigen Workflow abdeckt.
- Es unterstützt 720P- und 1080P-Ausgabe, eine Dauer von 2 bis 15 Sekunden und fünf Seitenverhältnisse, darunter 16:9, 9:16 und 1:1.
- Die Modi "First-last-frame" und "Audio-driven" bieten Ihnen eine Start- und Endzustandssteuerung, die Einzelbild-I2V-Modelle nicht erreichen können.
- Referenz-zu-Video (R2V) akzeptiert bis zu fünf Referenzbilder, fünf Referenzclips und eine Referenz-Audiospur in einem Aufruf.
- Probieren Sie den Wan 2.7 Video Generator aus, um die Beispiele in diesem Leitfaden nachzuvollziehen.
Was ist der Wan 2.7 Video Generator?
Wan 2.7 ist das neueste Videogenerierungsmodell von Alibabas Wan-Team, das über Alibaba Cloud Model Studio zugänglich gemacht wird. Es vereint vier zuvor getrennte Funktionen in einer Modellfamilie: Text-zu-Video, Bild-zu-Video, Referenz-zu-Video und Videobearbeitung. Laut der Alibaba Cloud Video-Generierungsübersicht akzeptiert das Modell multimodale Eingaben und gibt MP4 oder MOV mit bis zu 1080P aus.
Die entscheidende Neuerung in 2.7 ist die Workflow-Vereinheitlichung. Anstatt zwischen Anbietern für Text-zu-Video und Bild-zu-Video zu wechseln, rufen Sie dasselbe Modell auf und lassen die API basierend auf den von Ihnen übergebenen Eingaben routen. Dies entspricht der PixMind Wan 2.7 Produktseite, auf der eine einzige Erstellungsoberfläche jeden Modus handhabt.
Für Kreative ist dies wichtig, da beim Moduswechsel die meiste Produktionszeit verloren geht. Sie schreiben einen Prompt, rendern, stellen fest, dass der Startzustand falsch ist, und bauen dann in einem anderen Tool von Grund auf neu auf. Die einheitliche Oberfläche von Wan 2.7 ermöglicht es Ihnen, Eingaben zu tauschen, ohne Modelle zu tauschen.
Wie viele Modi unterstützt Wan 2.7?
Wan 2.7 bietet vier Modi. Die I2V API-Referenz dokumentiert die vollständige Eingabematrix. Hier ist die praktische Aufschlüsselung.
| Modus | Eingabe | Am besten geeignet für | Max. Dauer | Max. Auflösung |
|---|---|---|---|---|
| T2V (Text-zu-Video) | Text-Prompt, optionales Audio | Storyboarding, abstrakte Bewegung, B-Roll | 15s | 1080P |
| I2V (Bild-zu-Video) | Erster Frame, optional letzter Frame, optionales Audio | Produktvorstellungen, Charakteraktionen, Animation | 15s | 1080P |
| R2V (Referenz-zu-Video) | Bis zu 5 Referenzbilder + 5 Referenzclips + Referenz-Audio | Identitätserhaltung, Stimmklonung, Szenen mit mehreren Charakteren | 10s | 1080P |
| Videobearbeitung | Quellvideo + Anweisung | Stilübertragung, anweisungsbasierte Bearbeitungen | 10s | 1080P |

Text-zu-Video (T2V)
T2V nimmt einen Text-Prompt entgegen und gibt ein Video aus. Die Wan 2.7 T2V API-Referenz listet unterstützte Parameter auf, darunter Auflösung, Dauer, Seitenverhältnis und eine optionale Audiospur. T2V ist der schnellste Weg von der Idee zum Clip.
Verwenden Sie T2V, wenn Sie keinen festen Start-Frame haben. Abstrakte Bewegungen, B-Roll, Storyboards und stilisierte Sequenzen passen alle. Vermeiden Sie T2V, wenn der Startzustand wichtig ist: Wenn Sie ein bestimmtes Produkt bei Frame Null auf dem Bildschirm benötigen, wechseln Sie zu I2V.
Bild-zu-Video (I2V)
I2V ist der Bereich, in dem sich die Workflow-Vereinheitlichung von Wan 2.7 zeigt. Der Wan 2.7 Bild-zu-Video Benutzerleitfaden dokumentiert vier Untermodi:
- First-frame-to-video: Ein Bild wird zum Startzustand, das Modell erfindet die Bewegung.
- First-and-last-frame-to-video: Zwei Bilder definieren Start- und Endzustand, das Modell interpoliert.
- Video continuation: Ein kurzer Clip wird zum Startzustand, das Modell erweitert ihn.
- Audio-driven: Ein Bild plus eine Audiospur steuert Lippensynchronisation oder Bewegung.
Für eine detailliertere Erläuterung der vier I2V-Pfade siehe den PixMind First-Last-Frame Prompts Cluster.
Referenz-zu-Video (R2V)
R2V ist der leistungsstärkste und am wenigsten dokumentierte Modus. Die Wan 2.7 R2V API-Referenz beschreibt einen Aufruf, der bis zu fünf Referenzbilder, fünf Referenzclips und eine Referenz-Audiospur akzeptiert. Das Modell verwendet diese, um Identität, Stimme und Stil über die gesamte Ausgabe hinweg zu bewahren.
R2V ist das, was Sie verwenden sollten, wenn ein Charakter in verschiedenen Aufnahmen gleich aussehen soll oder wenn Sie eine Stimme in eine neue Szene klonen möchten. Der Kompromiss ist die Dauer: R2V ist auf 10 Sekunden begrenzt, kürzer als die 15-Sekunden-Obergrenze von T2V und I2V.
Videobearbeitung
Die Videobearbeitung nimmt ein Quellvideo plus eine Textanweisung entgegen und gibt einen bearbeiteten Clip zurück. Die Wan 2.7 Videobearbeitungs-API unterstützt anweisungsbasierte Bearbeitungen und Stilübertragung. Dieser Modus liegt außerhalb des Rahmens eines Generierungsleitfadens, ist aber wissenswert.
Wie funktioniert der First-Last-Frame-Modus?
First-last-frame ist ein Untermodus von I2V. Sie stellen zwei Bilder bereit: eines für den ersten Frame, eines für den letzten. Wan 2.7 generiert die dazwischenliegenden Frames.

Dies ist wichtig, da Einzelbild-I2V den Endzustand dem Modell überlässt. Wenn Ihre Aufnahme auf einem bestimmten Frame landen muss (ein vollständig gedrehtes Produkt, eine vollständig geöffnete Box, ein vollständig gedrehter Charakter), ist First-last-frame der Weg, um diese Landung zu garantieren.
Das praktische Muster ist: Zwei Keyframes aufnehmen oder generieren, diese als ersten und letzten hochladen, Dauer einstellen, rendern. Wan 2.7 interpoliert die Bewegung dazwischen. Die PixMind First-Last-Frame Prompts Seite enthält Prompt-Vorlagen für Produktvorstellungen, Übergänge und Storytelling-Muster.
Häufige Fehlerquellen, auf die man achten sollte:
- Verzerrung auf reflektierenden Oberflächen: Glas, Metall und Wasser können während der Interpolation verschmieren.
- Identitätsdrift bei Charakteren: Gesichter können sich zwischen den Frames verschieben.
- Kamera-Inkonsistenz: Wenn die beiden Keyframes unterschiedliche Kamerawinkel implizieren, muss das Modell einen Übergang erfinden.
Testen Sie zuerst mit kurzen Dauern (2-3 Sekunden), bevor Sie sich auf 5-10 Sekunden Renderings festlegen.
Wie funktioniert Audio-gesteuertes Video?
Der Audio-gesteuerte Modus nimmt ein Standbild plus eine Audiospur entgegen und erzeugt ein Video, in dem das Motiv synchron zum Audio zu sprechen oder sich zu bewegen scheint. Dies ist die Grundlage für Talking-Head- und Avatar-Inhalte.
Das Modell verwendet die Audiowellenform, um zwei Dinge zu steuern: Lippenbewegung (wenn ein Gesicht vorhanden ist) und die gesamte Bewegungsenergie. Die Wan 2.7 I2V API akzeptiert das Audio als Teil des Medien-Arrays unter Verwendung des Typs driving_audio.
Für Talking-Head-Anwendungsfälle kombinieren Sie dies mit dem PixMind Character Performance Cluster. Die Kombination aus Audio-gesteuertem I2V plus einem sauberen Referenzporträt ist der derzeit beste offene Weg zu einem lippensynchronen Avatar, ohne ein benutzerdefiniertes Modell zu trainieren.
Zwei praktische Hinweise:
- Audioqualität beeinflusst Videoqualität. Eine saubere Studioaufnahme übertrifft ein Telefonmikrofon.
- Testen Sie zuerst mit einem 3-Sekunden-Clip. Synchronisationsprobleme sind leichter frühzeitig zu erkennen.
Welche Auflösung, Dauer und welches Seitenverhältnis sollten Sie wählen?
Wan 2.7 unterstützt 720P- und 1080P-Ausgabe. Der Kompromiss liegt zwischen Kosten und Schärfe. Laut der PixMind Preisstrategie verbraucht 1080P pro Sekunde etwa doppelt so viele Credits wie 720P.
| Einstellung | Wann wählen | Kompromiss |
|---|
| 720P | Social-First-Inhalte, vertikale Videos, Test-Iterationen | Geringere Kosten, sichtbare Unschärfe auf großen Bildschirmen |
| 1080P | Produktpräsentationen, filmische Vorvisualisierung, Werbemittel | Höhere Kosten, schärfere Details |
| 16:9 | YouTube, Website-Einbettungen | Standard-Breitbild |
| 9:16 | Reels, TikTok, Shorts | Mobil vertikal |
| 1:1 | Feed-Posts, quadratische Einbettungen | Plattformübergreifend neutral |
| 4:3 / 3:4 | Redaktionell, Vintage-Stil | Nische |
Die Dauer treibt die Kosten linear an. Ein 10-Sekunden-Rendering kostet etwa das Fünffache eines 2-Sekunden-Renderings bei gleicher Auflösung. Für Iterationen kurz arbeiten. Für das Finale lang gehen.
Ein vernünftiger Standard für neue Benutzer: 720P, 5 Sekunden, 16:9. Bestätigen Sie, dass die Aufnahme funktioniert, und wechseln Sie dann für das Finale zu 1080P.
Wie wählen Sie den richtigen Wan 2.7 Modus aus?
Der Entscheidungsbaum ist unkompliziert, sobald Sie wissen, welche Eingaben Sie haben.

- Sie haben nur eine Idee: Verwenden Sie T2V. Iterieren Sie den Prompt, bevor Sie Visuals hinzufügen.
- Sie haben ein Produktfoto: Verwenden Sie den I2V First-Frame-Modus.
- Sie haben zwei Keyframes, die Start und Ende sein müssen: Verwenden Sie I2V First-Last-Frame.
- Sie haben einen kurzen Clip, der erweitert werden muss: Verwenden Sie I2V Video Continuation.
- Sie haben ein Porträt plus einen Voiceover: Verwenden Sie I2V Audio-Driven.
- Sie benötigen Identitäts- oder Stimmerhaltung über mehrere Aufnahmen hinweg: Verwenden Sie R2V.
- Sie haben vorhandenes Filmmaterial, das eine Bearbeitung oder Stiländerung benötigt: Verwenden Sie Videobearbeitung.
Wenn Sie unsicher sind, beginnen Sie im PixMind Wan Familien-Hub und wählen Sie nach Anwendungsfall statt nach Modusnamen. Der Hub leitet Sie zur richtigen Oberfläche, basierend darauf, was Sie erstellen möchten.
Wie sollten Sie Wan 2.7 prompten?
Die Prompt-Struktur ist wichtiger als die Prompt-Länge. Wan 2.7 belohnt eine Fünf-Segment-Anatomie: Subjekt, Aktion, Einstellung, Kamera, Stil.
Eine Beispielstruktur:
Subjekt: eine Glasparfümflasche auf einer dunklen Oberfläche. Aktion: ein Sprühnebel von Tröpfchen bricht nach rechts aus. Einstellung: Studio schwarzer Hintergrund, einzelnes Hauptlicht von Kamerablickrichtung links. Kamera: statische mittlere Einstellung, 50mm Äquivalent. Stil: filmisch, geringe Schärfentiefe, warmes Gegenlicht.
Jedes Segment verengt den Ausgaberaum. Fehlende Segmente greifen auf das Vorwissen des Modells zurück, das normalerweise generisch ist.
Für tiefere Prompt-Muster deckt der PixMind Multi-Shot Prompts Cluster 12 wiederverwendbare Strukturen ab, darunter Multi-Shot-Sequenzen, Audio-Sync-Muster und First-Last-Frame-Storyboards.
Zwei Prompt-Fallen, die es zu vermeiden gilt:
- Überladene Prompts: Mehr als fünf Subjekte in einem Prompt verwirren das Modell. Teilen Sie sie in mehrere Renderings auf.
- Übermäßiger Gebrauch von Negativ-Prompts: Wan 2.7 gewichtet Negativ-Prompts nicht so wie Bildmodelle. Halten Sie sie kurz.
Wie vergleicht sich Wan 2.7 mit anderen Modellen?
Wan 2.7 befindet sich in einem überfüllten Feld. Sora 2, VEO 3, Kling 2.0 und Seedance zielen alle auf überlappende Anwendungsfälle ab. Die Differenzierung liegt darin, welche Modi jedes Modell anbietet und zu welchen Kosten.
| Fähigkeit | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|
| Text-zu-Video | Ja | Ja | Ja | Ja |
| Bild-zu-Video | Ja | Begrenzt | Ja | Ja |
| First-Last-Frame | Ja | Nein | Begrenzt | Begrenzt |
| Referenz-Video (R2V) | Ja | Nein | Nein | Begrenzt |
| Audio-gesteuertes I2V | Ja | Ja | Ja | Begrenzt |
| Max. Dauer | 15s | 20s | 8s | 10s |
| Max. Auflösung | 1080P | 1080P | 1080P | 1080P |
Diese Tabelle spiegelt die vom Anbieter veröffentlichten Spezifikationen vom Juli 2026 wider. Unabhängige Direktvergleiche finden Sie in unserem Wan 2.7 versus Sora 2 Prompt Test und dem VEO und Kling Showdown.
Der besondere Vorteil von Wan 2.7 ist die Kombination aus First-Last-Frame und R2V. Kein anderes Modell in der Tabelle bietet beides in vollem Umfang. Wenn Ihr Workflow eine präzise Start- und Endsteuerung sowie Identitätserhaltung erfordert, ist Wan 2.7 derzeit der einzige Ein-Modell-Pfad.
Was sind die häufigsten Fehlerquellen?
Jedes KI-Videomodell versagt. Die Benennung der Fehlerquellen hilft Ihnen, schneller zu liefern.
- Verzerrung auf reflektierenden Oberflächen: Glas, Spiegel, poliertes Metall. Mildern Sie dies, indem Sie die Bewegungsamplitude im Prompt reduzieren.
- Identitätsdrift über Aufnahmen hinweg: Gesichter verschieben sich zwischen den Generierungen. Mildern Sie dies mit R2V-Referenzeingaben.
- Halluzinierter Text in Frames: Schilder, Etiketten, Logos werden als Kauderwelsch gerendert. Mildern Sie dies, indem Sie Text aus den Eingabebildern entfernen.
- Seitenverhältnis-Fehler: Das Einspeisen eines 9:16-Bildes in eine 16:9-Generierung führt zu unerwartetem Zuschneiden. Passen Sie das Eingabe-Seitenverhältnis an das Ausgabe-Seitenverhältnis an.
- Credit-Verbrauch bei langen Iterationen: 10-Sekunden-Test-Renderings verbrauchen schnell Credits. Iterieren Sie bei 2-3 Sekunden.
Der PixMind Anwendungsfälle Cluster enthält szenariospezifische Hinweise zu Fehlerquellen für Produktmarketing, Charakterdarstellung, filmische Vorvisualisierung und soziale Hooks.
Wan 2.7 Video Generator FAQ
Ist Wan 2.7 kostenlos testbar?
Ja. Die PixMind Wan 2.7 Seite beinhaltet eine kostenlose Testversion ohne Kreditkarte. Kostenpflichtige Pläne treten erst in Kraft, wenn Sie das Testkontingent überschreiten.
Unterstützt Wan 2.7 4K?
Nein. Wan 2.7 Video erreicht maximal 1080P. Das Wan 2.7 Bildmodell unterstützt 4K-Standbilder über den Pro-Tier, aber die Videoausgabe ist auf 1080P begrenzt.
Kann Wan 2.7 das Gesicht einer bestimmten Person klonen?
Wan 2.7 kann die Identität aus Referenzeingaben bewahren, aber die PixMind-Richtlinie verbietet das nicht-einvernehmliche Klonen von Abbildern realer, identifizierbarer Personen. Verwenden Sie R2V mit Originalcharakteren, Stock-Referenzen oder Ihrem eigenen Abbild.
Wie lange dauert ein Wan 2.7 Rendering?
Die Generierungszeit hängt von Dauer, Auflösung und Auslastung ab. Typische 5-Sekunden-720P-Renderings sind in 60-90 Sekunden fertig. 10-Sekunden-1080P-Renderings können 3-5 Minuten dauern. Die API gibt eine Aufgaben-ID zurück, die Sie für den Status abfragen können.
Generiert Wan 2.7 Audio?
Ja, aber nur in Modi, die Audioeingaben akzeptieren. T2V kann eine Audiospur aufnehmen und dazu bewegungssynchronisieren. Der I2V Audio-gesteuerte Modus verwendet Audio, um Lippen- und Bewegungssynchronisation zu steuern. Reine Audiogenerierung (Musik, Soundeffekte) ist ein separates Alibaba-Modell.
Kann ich Wan 2.7 Ausgaben kommerziell nutzen?
Ja. Die von Ihnen generierten Ausgaben können Sie kommerziell gemäß den Bedingungen von Alibaba Cloud Model Studio nutzen. Überprüfen Sie die aktuellen Bedingungen auf der Alibaba Cloud Model Studio Übersicht, bevor Sie sie veröffentlichen.
Sehen Sie es in Aktion
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



