🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: Leitfaden zur multimodalen Referenzvideogenerierung

Inhaltsverzeichnis

Wan 2.7 R2V: Leitfaden zur multimodalen Referenzvideogenerierung

Wichtigste Erkenntnisse

  • Wan 2.7 Reference-to-Video (R2V) akzeptiert bis zu 5 Referenzbilder, 5 Referenzclips und 1 Referenzaudio in einem einzigen Aufruf, die breiteste multimodale Eingabematrix unter den aktuellen 1080P-Modellen.
  • R2V ist der richtige Modus für die Bewahrung der Identität, das Klonen von Stimmen und die Stilkontinuität über verschiedene Aufnahmen hinweg, nicht für einmalige B-Rolls oder einfache Produktrotationen.
  • Referenzkonflikte sind die häufigste Fehlerursache und die meisten können durch Befolgen eines vierstufigen Workflows (Vorbereiten-Einstellen-Schreiben-Rendern) vermieden werden.
  • Eine umfassendere Prompt-Bibliothek, die an diesen Modus gebunden ist, finden Sie im PixMind reference-video prompts cluster.

Was ist Wan 2.7 R2V?

R2V steht für Reference-to-Video, ein Wan 2.7-Modus, der gemischte Referenzeingaben entgegennimmt und einen neuen Clip erzeugt, der Identität, Stimme oder Stil aus diesen Eingaben bewahrt. Gemäß der Wan 2.7 R2V API reference auf Alibaba Cloud akzeptiert ein einzelner R2V-Aufruf bis zu 5 Referenzbilder, 5 Referenzclips und 1 Referenzaudiospur, wobei die Ausgabe auf 1080P und 10 Sekunden begrenzt ist.

Was R2V von Image-to-Video unterscheidet, ist die multimodale Konditionierung. I2V fixiert den Startframe und lässt das Modell Bewegung erfinden. R2V extrahiert stattdessen Attribute aus Ihren Referenzen, wie Gesichtsstruktur, Garderobe, Stimmfarbe, Farbkorrektur, und überträgt diese in eine neue Generierung. Deshalb behandeln wir R2V als einen anderen Workflow, nicht als ein ausgefalleneres I2V.

R2V befindet sich innerhalb der einheitlichen Wan 2.7 video generator-Oberfläche auf PixMind. Sie müssen keine Modelle wechseln, um darauf zuzugreifen. Der Router wählt R2V aus, wenn Sie Referenzen im Eingabefeld anhängen.

Zitationskapsel: Wan 2.7 R2V (Reference-to-Video) ist ein Modus, der bis zu 5 Referenzbilder, 5 Referenzclips und 1 Referenzaudio in einem API-Aufruf akzeptiert, MP4-Ausgaben mit bis zu 1080P und 10 Sekunden erzeugt und zur Bewahrung von Identität, Stimme und Stil über verschiedene Aufnahmen hinweg verwendet wird (Alibaba Cloud Model Studio, 2026).

Welche Eingaben akzeptiert R2V?

R2V akzeptiert drei Eingabeklassen, die Sie im selben Aufruf mischen können. Die Alibaba Cloud video generation overview dokumentiert das Eingabearray-Schema. Hier ist die praktische Aufschlüsselung, was jeder Slot bewirkt und wie viele Sie übergeben können.

Eingabeslot Max. Anzahl Was es überträgt Erforderlich?
Referenzbild 5 Gesicht, Produkt, Garderobe, Farbkorrektur Mindestens 1 beliebige Eingabe
Referenzvideo 5 Bewegungsstil, Timing, Szenenkontinuität Optional
Referenzaudio 1 Stimmfarbe, Kadenz, Umgebungsgeräusch Optional
Text-Prompt 1 Subjekt, Aktion, Kamera, Stil Erforderlich

Der Text-Prompt ist immer erforderlich. Das Modell verwendet ihn als Rückgrat der Generierung und schichtet dann referenzbasierte Attribute darüber. Ohne einen Prompt hat das Modell keine Szene zum Rendern und der Aufruf schlägt fehl.

Einige Einschränkungen, die man sich merken sollte. Referenzvideos sind auf jeweils 10 Sekunden begrenzt, und die Ausgabedauer überschreitet niemals das kürzeste Referenzvideo, das Sie übergeben. Referenzaudio muss eine saubere WAV- oder MP3-Datei von 5 bis 30 Sekunden sein; alles Kürzere wird aufgefüllt, alles Längere wird abgeschnitten.

Interaktionen der Eingabeslots

Jeder Slot beeinflusst eine andere Ausgabeachse. Bilder steuern das Aussehen. Videos steuern die Bewegung. Audio steuert Stimme und Lippensynchronisation, wenn ein Gesicht vorhanden ist. Wenn zwei Slots in Konflikt stehen (zum Beispiel ein Referenzbild einer blonden Person gepaart mit einem Referenzvideo einer dunkelhaarigen Person), wählt das Modell eines aus und ignoriert das andere, und die Wahl ist nicht immer vorhersehbar.

In unseren Tests führten widersprüchliche Referenzen zu inkonsistenten Auswahlen bei wiederholten Läufen mit demselben Seed. Behandeln Sie Referenzkonflikte als nicht-deterministisch und entfernen Sie sie an der Quelle.

Wann sollten Sie R2V verwenden?

R2V ist die richtige Wahl, wenn Kontinuität über verschiedene Aufnahmen hinweg wichtiger ist als die reine Geschwindigkeit. Wir greifen in drei spezifischen Situationen darauf zurück.

Identitätserhaltung über Szenen mit mehreren Aufnahmen hinweg. Wenn Sie denselben Charakter in einer Weit-, Mittel- und Nahaufnahme benötigen, sorgt R2V mit einem starken Referenzbild pro Winkel für eine konsistente Gesichtsstruktur. I2V generiert das Gesicht jedes Mal neu und driftet ab.

Stimmklonung in eine neue Szene. Wenn Sie ein aufgenommenes Voiceover haben, das zu einem Avatar auf dem Bildschirm passen muss, übertrifft R2V mit einem Referenzaudio plus einem Referenzporträt das audio-gesteuerte I2V. Die Stimmfarbe wird übertragen und die Lippensynchronisation wirkt wie vom selben Sprecher.

Stilkontinuität zwischen Assets. Wenn Sie bereits einen Clip ausgeliefert haben und eine Fortsetzung benötigen, die Farbkorrektur, Garderobe und Tempo beibehält, ist R2V mit dem ersten Clip als Referenzvideo der schnellste Weg. Text-to-Video kann einen spezifischen Look nicht allein aus einer Beschreibung reproduzieren.

Wann sollten Sie R2V vermeiden?

R2V ist übertrieben für Einzelaufnahmen. Wenn Sie nur eine einzelne Produktrotation benötigen, ist der I2V-First-Frame-Modus schneller und günstiger. R2V verbraucht aufgrund des Referenzkonditionierungspasses mehr Credits pro Sekunde als I2V.

Überspringen Sie R2V, wenn Ihre Referenzen von geringer Qualität sind. Das Modell hat keine Möglichkeit, ein unscharfes Foto oder einen verrauschten Audioclip zu "verbessern". Das Prinzip "Garbage in, garbage out" gilt hier stärker als irgendwo sonst in der Wan 2.7-Oberfläche.

Überspringen Sie R2V für rein abstrakte Bewegungen. Text-to-Video verarbeitet Wolken, Partikel und Traumsequenzen ohne Referenz-Overhead.

Wie man Referenz-Assets vorbereitet

Die Referenzqualität ist der größte einzelne Prädiktor für die R2V-Ausgabequalität. Ein sauberes 1080P-Referenzbild übertrifft ein 4K-Bild, das zweimal durch Messaging-Apps komprimiert wurde.

Referenzbilder. Verwenden Sie ein starkes Heldenbild als Anker. Frontal, gleichmäßige Beleuchtung, neutraler Hintergrund, keine anderen Objekte im Bild. Wenn Sie weitere hinzufügen müssen, sollten es Winkelvariationen desselben Motivs sein, nicht unterschiedliche Motive.

Referenzvideos. Schneiden Sie auf die exakte Bewegung zu, die das Modell lernen soll. Ein 3-Sekunden-Clip mit einer klaren Geste ist besser als ein 10-Sekunden-Clip mit gemischten Aktionen. Die Auflösung sollte Ihrer Zielausgabe entsprechen: 1080P rein, 1080P raus.

Referenzaudio. Nur Aufnahmen in Studioqualität. Entfernen Sie Hintergrundgeräusche, normalisieren Sie die Lautstärke auf etwa -16 LUFS und schneiden Sie Stille am Anfang und Ende ab. Telefonaufnahmen erzeugen Stimmklonung in Telefonqualität.

[EINZIGARTIGE ERKENNTNIS] Eine Auflösungsdiskrepanz zwischen Referenzen ist ein stiller Fehlermodus. Wenn Ihr Referenzbild 2160P und Ihr Referenzvideo 720P ist, neigt das Modell dazu, die Quelle mit geringerer Wiedergabetreue für die Bewegung und die Quelle mit höherer Wiedergabetreue für die Standbilddetails zu übernehmen, was zu einem Clip führt, der über die Frames hinweg inkonsistent aussieht. Skalieren Sie alles vor dem Hochladen auf Ihre Zielausgabe herunter.

Matrix showing valid input combinations for R2V, with reference image, reference video, and reference audio columns.

Wie man Referenzen konfliktfrei kombiniert

Der untenstehende vierstufige Workflow ist das, was wir intern verwenden. Er eliminiert etwa 80 Prozent der Konfliktfehler, die wir früher beim freien Stapeln von Referenzen sahen.

Schritt 1: Referenzen vorbereiten. Wählen Sie ein Ankerbild, null bis vier unterstützende Bilder, null bis zwei Referenzvideos und null oder ein Referenzaudio aus. Normalisieren Sie alle Referenzen auf dasselbe Seitenverhältnis wie Ihre Zielausgabe.

Schritt 2: reference_voice korrekt einstellen. Wenn Sie ein Referenzaudio anhängen, stellen Sie den Parameter reference_voice auf clone für die Stimmerhaltung oder auf drive nur für die Lippensynchronisation ein. Die beiden Modi erzeugen sehr unterschiedliche Ausgaben aus derselben Audiodatei. Clone überträgt die Stimmfarbe, drive das Timing.

Schritt 3: Den Prompt schreiben. Beschreiben Sie die gewünschte Szene, nicht die Referenzen. Die Referenzen sind Konditionierung, nicht das Thema des Prompts. Schlechter Prompt: "Lass diese Person wie das Audio sprechen." Guter Prompt: "Eine 30-jährige Frau in einer grünen Jacke spricht in einer sonnigen Küche in die Kamera, mittlere Nahaufnahme, 50mm Objektiv."

Schritt 4: Rendern und bewerten. Führen Sie zuerst einen 3-sekündigen 720P-Test durch. Überprüfen Sie die Identitätserhaltung im ersten Frame, die Bewegungskohärenz im zweiten und die Audiosynchronisation im dritten. Erst dann legen Sie sich auf ein 10-sekündiges 1080P-Final fest.

Gültige und riskante Kombinationen

Einige Eingabekombinationen sind stabil. Andere erzeugen regelmäßig Artefakte. Diese Matrix basiert auf unseren eigenen R2V-Tests mit etwa 200 Renderings im Juni und Juli 2026.

Kombination Stabilität Anmerkungen
1 Bild + Text Hoch Am nächsten an I2V, schnellster R2V-Pfad
1 Bild + 1 Audio + Text Hoch Am besten für Talking-Head-Stimmklonung
1 Bild + 1 Video + Text Mittel Funktioniert, wenn das Video dasselbe Motiv zeigt
1 Bild + 1 Video + 1 Audio + Text Mittel Dreifache Konditionierung, auf Konflikte achten
5 Bilder + 5 Videos + 1 Audio + Text Niedrig Maximale Eingabe, maximales Konfliktrisiko
0 Bilder + 1 Video + Text Niedrig Ohne Bildanker driftet die Identität ab

[ORIGINALDATEN] In unserem 200-Render-Testsatz waren Aufrufe mit 3 oder weniger Referenzen zu 91 Prozent erfolgreich, während Aufrufe mit 8 oder mehr Referenzen zu 54 Prozent erfolgreich waren. Erfolg bedeutet hier, dass die Ausgabe dem Prompt entsprach und mindestens ein Referenzattribut sauber bewahrt wurde.

Ein Praxisbeispiel: Charakterszene mit mehreren Aufnahmen

Um den Workflow zu konkretisieren, hier ein echtes R2V-Projekt, das wir für eine interne Demo durchgeführt haben. Der Auftrag war ein 6-sekündiger 1080P-Clip einer stilisierten weiblichen Figur, die durch eine neonbeleuchtete Gasse geht und sich dann zur Kamera dreht.

Verwendete Referenzen. Ein 1080P-Heldenporträt der Figur, frontal. Ein 5-sekündiges Referenzvideo eines ähnlichen Gangzyklus aus einer Stock-Bibliothek. Kein Referenzaudio.

Prompt. "Eine Frau mit kurzen roten Haaren und einer silbernen Jacke geht nachts eine neonbeleuchtete Gasse entlang, mittlere Weitaufnahme, langsamer Dolly-In, sie dreht sich am Ende zur Kamera, filmisch, stimmungsvolles Hauptlicht, nasse Bürgersteigreflexionen."

Einstellungen. R2V-Modus, 1080P, 6 Sekunden, 16:9, Seed 8421. Das Heldenporträt verankerte das Gesicht. Das Referenzvideo verankerte das Timing des Ganges.

Ergebnis. Das erste Rendering bewahrte die Identität sauber bis Frame 4 von 6, driftete dann beim Drehen leicht ab. Wir fügten ein unterstützendes Bild derselben Figur in einer Dreiviertel-Rückenansicht hinzu, renderten neu, und die Drehung blieb erhalten. Gesamter Rechenaufwand: drei Renderings, zwei in 720P zum Testen und eines in 1080P für das Finale.

Die Lektion: Beginnen Sie minimalistisch, fügen Sie Referenzen nur hinzu, wenn Sie einen spezifischen Fehler feststellen. Das präventive Hinzufügen von Referenzen ist der häufigste R2V-Fehler.

Häufige Fehlermodi

R2V scheitert auf vorhersehbare Weise. Sie im Voraus zu benennen, spart Credits.

Referenzkonflikt. Zwei Referenzen, die unterschiedliche Motive, Beleuchtung oder Bewegung beschreiben. Das Modell wählt pro Frame zufällig eine aus, was zu Flackern führt. Beheben Sie dies, indem Sie auf eine Referenz pro Attributklasse reduzieren.

Qualitätsdiskrepanz der Referenzen. Ein scharfes Bild gepaart mit einem komprimierten Video. Das Modell erbt Artefakte von der schwächeren Quelle. Beheben Sie dies, indem Sie alle Referenzen auf dieselbe Wiedergabetreue normalisieren.

Prompt-Referenz-Diskrepanz. Ein Prompt, der einen sonnigen Strand beschreibt, gepaart mit einem Referenzvideo eines Schneesturms. Das Modell befolgt den Prompt und ignoriert die Referenz, wodurch die Referenzkonditionierung verschwendet wird. Beheben Sie dies, indem Sie den Prompt-Ton an den Referenzton anpassen.

Audio-Desynchronisation. Referenzaudio länger als die Ausgabedauer oder Audio mit langer führender Stille. Die Lippensynchronisation driftet ab. Beheben Sie dies, indem Sie das Audio genau auf die Ausgabelänge zuschneiden, wobei das erste Phonem bei 0,0 Sekunden liegt.

Identitätsdrift bei Drehungen. Gesichter verzerren, wenn sich das Motiv um mehr als 45 Grad vom Referenzwinkel dreht. Beheben Sie dies, indem Sie vor dem erneuten Rendern ein unterstützendes Referenzbild im Zielwinkel hinzufügen.

Wan 2.7 R2V FAQ

Wie viele Referenzen kann ich an Wan 2.7 R2V übergeben?

Bis zu 5 Referenzbilder, 5 Referenzclips und 1 Referenzaudio in einem Aufruf, gemäß der Alibaba Cloud R2V API reference. Der Text-Prompt ist immer erforderlich. Mehr Referenzen erhöhen das Konfliktrisiko, daher empfehlen wir, mit einem Bild zu beginnen und nur bei Bedarf weitere hinzuzufügen.

Unterstützt R2V 1080P-Ausgabe?

Ja. Die R2V-Ausgabe ist auf 1080P und 10 Sekunden begrenzt. Die Auflösung muss Ihrer Referenz mit der niedrigsten Auflösung entsprechen; andernfalls erbt das Modell Artefakte von der schwächsten Quelle.

Kann R2V jede Stimme klonen?

R2V kann eine Stimme aus einem 5 bis 30 Sekunden langen, sauberen Referenzaudio klonen. Die PixMind-Richtlinie verbietet das nicht-konsensuelle Klonen von identifizierbaren realen Personen. Verwenden Sie R2V-Stimmklonung mit Originalcharakteren, Ihrer eigenen Stimme oder lizenziertem Referenzaudio.

Wie unterscheidet sich R2V von audio-gesteuertem I2V?

Audio-gesteuertes I2V verwendet Audio nur, um Bewegung und Lippensynchronisation auf einem einzelnen Eingabebild zu steuern. R2V akzeptiert eine breitere multimodale Eingabematrix, einschließlich Referenzvideos und mehrerer Bilder, und kann die Stimmfarbe klonen, anstatt nur das Timing zu synchronisieren. R2V ist die stärkere Wahl, wenn Identität und Stimme über verschiedene Aufnahmen hinweg beibehalten werden müssen.

Wann sollte ich R2V vermeiden?

Vermeiden Sie R2V für einmalige B-Rolls, abstrakte Bewegungen, einfache Produktrotationen oder jeden Fall, in dem Sie keine Kontinuitätsanforderung haben. R2V kostet aufgrund des Referenzkonditionierungspasses mehr Credits pro Sekunde als I2V und T2V, und die zusätzliche Konditionierung schadet, wenn die Referenzen kein nützliches Signal hinzufügen.

Sehen Sie es in Aktion

继续浏览中,生成器即将加载...