🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: Multimodale Referentie Videogeneratie Gids

Inhoudsopgave

Wan 2.7 R2V: Multimodale Referentie Videogeneratie Gids

Belangrijkste Punten

  • Wan 2.7 reference-to-video (R2V) accepteert tot 5 referentieafbeeldingen, 5 referentieclips en 1 referentieaudio in één oproep, de breedste multimodale invoermatrix onder de huidige 1080P-modellen.
  • R2V is de juiste modus voor identiteitsbehoud, stemklonen en stijlcontinuïteit over verschillende shots, niet voor eenmalige B-roll of eenvoudige productrotaties.
  • Referentieconflicten zijn de belangrijkste oorzaak van mislukkingen, en de meeste kunnen worden voorkomen door een vierstaps workflow van voorbereiden-instellen-schrijven-renderen te volgen.
  • Voor een uitgebreidere promptbibliotheek die aan deze modus is gekoppeld, zie het PixMind referentie-video prompts cluster.

Wat is Wan 2.7 R2V?

R2V staat voor reference-to-video, een Wan 2.7-modus die gemengde referentie-inputs gebruikt en een nieuwe clip produceert die identiteit, stem of stijl van die inputs behoudt. Volgens de Wan 2.7 R2V API-referentie op Alibaba Cloud accepteert één R2V-oproep tot 5 referentieafbeeldingen, 5 referentieclips en 1 referentieaudiotrack, met een outputlimiet van 1080P en 10 seconden.

Wat R2V onderscheidt van image-to-video is multimodale conditionering. I2V vergrendelt het startframe en laat het model beweging uitvinden. R2V extraheert in plaats daarvan attributen uit uw referenties, zoals gezichtsstructuur, kleding, stemtimbre, kleurgradatie, en verspreidt deze in een nieuwe generatie. Daarom behandelen we R2V als een aparte workflow, niet als een luxere I2V.

R2V bevindt zich binnen het uniforme Wan 2.7 video generator oppervlak op PixMind. U hoeft niet van model te wisselen om het te bereiken. De router kiest R2V wanneer u referenties toevoegt in het invoerpaneel.

Citatiecapsule: Wan 2.7 R2V (reference-to-video) is een modus die tot 5 referentieafbeeldingen, 5 referentieclips en 1 referentieaudio accepteert in één API-aanroep, MP4 uitvoert met maximaal 1080P en 10 seconden, en wordt gebruikt voor identiteits-, stem- en stijlbehoud over verschillende shots (Alibaba Cloud Model Studio, 2026).

Welke Inputs Accepteert R2V?

R2V accepteert drie inputklassen, en u kunt deze in dezelfde oproep combineren. Het Alibaba Cloud video generatie overzicht documenteert het invoerarray-schema. Hier is de praktische uitsplitsing van wat elke slot doet en hoeveel u kunt doorgeven.

Input Slot Max Aantal Wat het Draagt Vereist?
Referentieafbeelding 5 Gezicht, product, kleding, kleurgradatie Minimaal 1 van elke input
Referentievideo 5 Bewegingsstijl, timing, scènecontinuïteit Optioneel
Referentieaudio 1 Stemtimbre, cadans, omgevingsgeluid Optioneel
Tekstprompt 1 Onderwerp, actie, camera, stijl Vereist

De tekstprompt is altijd vereist. Het model gebruikt deze als de ruggengraat van de generatie en legt vervolgens referentie-afgeleide attributen erbovenop. Zonder een prompt heeft het model geen scène om te renderen en mislukt de oproep.

Enkele beperkingen die het onthouden waard zijn. Referentievideo's zijn beperkt tot 10 seconden elk, en de uitvoerduur overschrijdt nooit de kortste referentievideo die u doorgeeft. Referentieaudio moet een schone WAV of MP3 zijn van 5 tot 30 seconden; alles korter wordt opgevuld, alles langer wordt afgekapt.

Interacties met invoerslots

Elk slot beïnvloedt een andere uitvoeras. Afbeeldingen bepalen het uiterlijk. Video's bepalen de beweging. Audio bepaalt de stem en lipsynchronisatie wanneer een gezicht aanwezig is. Wanneer twee slots conflicteren (bijvoorbeeld een referentieafbeelding van een blond onderwerp gekoppeld aan een referentievideo van een donkerharig onderwerp), kiest het model er één en negeert het de andere, en de keuze is niet altijd voorspelbaar.

In onze tests leiden conflicterende referenties tot inconsistente keuzes bij herhaalde runs met dezelfde seed. Behandel referentieconflicten als niet-deterministisch en verwijder ze bij de bron.

Wanneer Moet U R2V Gebruiken?

R2V is de juiste keuze wanneer continuïteit over shots belangrijker is dan pure snelheid. We gebruiken het in drie specifieke situaties.

Identiteitsbehoud over scènes met meerdere shots. Als u hetzelfde personage nodig heeft in een wide, medium, en close-up, behoudt R2V met één sterke referentieafbeelding per hoek de gezichtsstructuur consistent. I2V regenereert het gezicht elke keer en wijkt af.

Stemklonen in een nieuwe scène. Wanneer u een opgenomen voice-over heeft die moet overeenkomen met een avatar op het scherm, presteert R2V met een referentieaudio plus een referentieportret beter dan audio-gestuurde I2V. Het stemtimbre wordt overgedragen en de lipsynchronisatie leest als dezelfde spreker.

Stijlcontinuïteit tussen assets. Als u al één clip heeft uitgebracht en een vervolg nodig heeft dat overeenkomt met kleurgradatie, kleding en tempo, is R2V met de eerste clip als referentievideo de snelste weg. Tekst-naar-video kan een specifieke look niet reproduceren op basis van alleen een beschrijving.

Wanneer moet u R2V vermijden?

R2V is overbodig voor werk met één shot. Als u alleen een enkele productrotatie nodig heeft, is de I2V first-frame modus sneller en goedkoper. R2V verbruikt meer credits per seconde dan I2V vanwege de referentieconditioneringspas.

Sla R2V over wanneer uw referenties van lage kwaliteit zijn. Het model kan een wazige foto of een ruisende audioclip niet "verbeteren". "Garbage in, garbage out" geldt hier sterker dan waar dan ook in het Wan 2.7-oppervlak.

Sla R2V over voor puur abstracte beweging. Tekst-naar-video verwerkt wolken, deeltjes en droomsequenties zonder referentie-overhead.

Hoe Referentie-Assets Voor Te Bereiden

Referentiekwaliteit is de grootste voorspeller van de R2V-uitvoerkwaliteit. Een schone 1080P referentieafbeelding presteert beter dan een 4K-afbeelding die tweemaal is gecomprimeerd via berichtenapps.

Referentieafbeeldingen. Gebruik één sterke hero-afbeelding als uw anker. Frontaal, gelijkmatige belichting, neutrale achtergrond, geen andere onderwerpen in beeld. Als u meer moet toevoegen, maak er dan hoekvariaties van hetzelfde onderwerp van, geen verschillende onderwerpen.

Referentievideo's. Trim tot de exacte beweging die u het model wilt laten leren. Een clip van 3 seconden met één duidelijk gebaar is beter dan een clip van 10 seconden met gemengde acties. De resolutie moet overeenkomen met uw doeluitvoer: 1080P in, 1080P uit.

Referentieaudio. Alleen opnames van studiokwaliteit. Verwijder achtergrondruis, normaliseer het volume tot ongeveer -16 LUFS en trim stiltes aan het begin en einde. Telefoonopnames produceren stemklonen van telefoonkwaliteit.

[UNIEK INZICHT] Resolutie-mismatch tussen referenties is een stille faalmodus. Als uw referentieafbeelding 2160P is en uw referentievideo 720P, heeft het model de neiging om de lagere-fidelity bron voor beweging en de hogere-fidelity bron voor stilstaande details te erven, wat een clip produceert die inconsistent lijkt over frames. Schaal alles terug naar uw doeluitvoer voordat u uploadt.

Matrix die geldige invoercombinaties voor R2V toont, met kolommen voor referentieafbeelding, referentievideo en referentieaudio.

Hoe Referenties Te Combineren Zonder Conflicten

De onderstaande vierstaps workflow is wat we intern uitvoeren. Het elimineert ongeveer 80 procent van de conflictfouten die we voorheen zagen bij het vrij stapelen van referenties.

Stap 1: referenties voorbereiden. Kies één ankerbeeld, nul tot vier ondersteunende beelden, nul tot twee referentievideo's en nul of één referentieaudio. Normaliseer alle referenties naar dezelfde beeldverhouding als uw doeluitvoer.

Stap 2: stel reference_voice correct in. Wanneer u een referentieaudio toevoegt, stelt u de parameter reference_voice in op clone voor stembehoud of drive voor alleen lipsynchronisatie. De twee modi produceren zeer verschillende outputs van hetzelfde audiobestand. Clone draagt timbre over, drive draagt timing over.

Stap 3: schrijf de prompt. Beschrijf de scène die u wilt, niet de referenties. De referenties zijn conditionering, niet het onderwerp van de prompt. Slechte prompt: "laat deze persoon praten zoals de audio." Goede prompt: "een 30-jarige vrouw in een groene jas spreekt voor de camera in een zonovergoten keuken, medium close-up, 50mm lens."

Stap 4: renderen en evalueren. Voer eerst een 3-seconden 720P-test uit. Controleer identiteitsbehoud in het eerste frame, bewegingscoherentie in het tweede en audiosynchronisatie in het derde. Pas dan legt u zich vast op een 10-seconden 1080P-eindresultaat.

Geldige en risicovolle combinaties

Sommige invoercombinaties zijn stabiel. Andere produceren regelmatig artefacten. Deze matrix is afkomstig van onze eigen R2V-tests over ongeveer 200 renders in juni en juli 2026.

Combinatie Stabiliteit Opmerkingen
1 afbeelding + tekst Hoog Het dichtst bij I2V, snelste R2V-pad
1 afbeelding + 1 audio + tekst Hoog Beste voor voice cloning van pratende hoofden
1 afbeelding + 1 video + tekst Gemiddeld Werkt wanneer video hetzelfde onderwerp toont
1 afbeelding + 1 video + 1 audio + tekst Gemiddeld Drievoudige conditionering, let op conflicten
5 afbeeldingen + 5 video's + 1 audio + tekst Laag Maximale invoer, maximaal risico op conflicten
0 afbeeldingen + 1 video + tekst Laag Zonder een afbeeldingsanker drijft de identiteit af

[ORIGINELE GEGEVENS] In onze testset van 200 renders slaagden oproepen met 3 of minder referenties in 91 procent van de gevallen, terwijl oproepen met 8 of meer referenties slaagden in 54 procent van de gevallen. Succes betekent hier dat de uitvoer overeenkwam met de prompt en ten minste één referentieattribuut netjes behield.

Een Uitgewerkt Voorbeeld: Scène met Meerdere Shots van een Personage

Om de workflow concreet te maken, volgt hier een echte R2V-taak die we hebben uitgevoerd voor een interne demo. De opdracht was een 6-seconden 1080P-clip van een gestileerd vrouwelijk personage dat door een neonverlichte steeg loopt en zich vervolgens naar de camera draait.

Gebruikte referenties. Eén 1080P hero-portret van het personage, frontaal. Eén 5-seconden referentievideo van een vergelijkbare loopcyclus uit een stockbibliotheek. Geen referentieaudio.

Prompt. "Een vrouw met kort rood haar en een zilveren jas loopt 's nachts door een neonverlichte steeg, medium-wide shot, langzame dolly-in, ze draait zich aan het einde naar de camera, cinematisch, sfeervol hoofdlicht, reflecties op natte bestrating."

Instellingen. R2V-modus, 1080P, 6 seconden, 16:9, seed 8421. Het hero-portret verankerde het gezicht. De referentievideo verankerde de looptiming.

Resultaat. De eerste render behield de identiteit netjes tot frame 4 van 6, waarna deze licht afweek bij de draai. We voegden één ondersteunende afbeelding toe van hetzelfde personage in een driekwart achteraanzicht, renderden opnieuw, en de draai bleef behouden. Totaal aantal berekeningen: drie renders, twee op 720P voor testen en één op 1080P voor het eindresultaat.

De les: begin minimaal, voeg alleen referenties toe wanneer u een specifieke fout ziet. Referenties preventief toevoegen is de meest voorkomende R2V-fout.

Veelvoorkomende Faalmodi

R2V faalt op voorspelbare manieren. Ze vooraf benoemen bespaart credits.

Referentieconflict. Twee referenties die verschillende onderwerpen, belichting of beweging beschrijven. Het model kiest willekeurig één per frame, wat flikkering veroorzaakt. Los dit op door te reduceren tot één referentie per attribuutklasse.

Mismatched referentiekwaliteit. Een scherpe afbeelding gekoppeld aan een gecomprimeerde video. Het model erft artefacten van de zwakkere bron. Los dit op door alle referenties te normaliseren naar dezelfde getrouwheid.

Prompt-referentie mismatch. Een prompt die een zonnig strand beschrijft, gekoppeld aan een referentievideo van een sneeuwstorm. Het model gehoorzaamt de prompt en negeert de referentie, waardoor de referentieconditionering wordt verspild. Los dit op door de prompttoon af te stemmen op de referentietoon.

Audio desynchronisatie. Referentieaudio langer dan de uitvoerduur, of audio met lange inleidende stilte. Lipsynchronisatie wijkt af. Los dit op door de audio precies op de uitvoerlengte te trimmen, met de eerste foneem op 0,0 seconden.

Identiteitsdrift bij bochten. Gezichten vervormen wanneer het onderwerp meer dan 45 graden roteert ten opzichte van de referentiehoek. Los dit op door een ondersteunende referentieafbeelding toe te voegen onder de doelhoek voordat u opnieuw rendert.

Wan 2.7 R2V Veelgestelde Vragen

Hoeveel referenties kan ik doorgeven aan Wan 2.7 R2V?

Tot 5 referentieafbeeldingen, 5 referentieclips en 1 referentieaudio in één oproep, volgens de Alibaba Cloud R2V API-referentie. De tekstprompt is altijd vereist. Meer referenties verhogen het risico op conflicten, dus we raden aan om te beginnen met één afbeelding en alleen toe te voegen wanneer nodig.

Ondersteunt R2V 1080P-uitvoer?

Ja. R2V-uitvoer is beperkt tot 1080P en 10 seconden. De resolutie moet overeenkomen met uw laagst-resolutie referentie; anders erft het model artefacten van de zwakste bron.

Kan R2V elke stem klonen?

R2V kan een stem klonen van een schone referentieaudio van 5 tot 30 seconden. Het beleid van PixMind verbiedt het niet-consensueel klonen van identificeerbare echte personen. Gebruik R2V-stemklonen met originele personages, uw eigen stem of gelicentieerde referentieaudio.

Hoe verschilt R2V van audio-gestuurde I2V?

Audio-gestuurde I2V gebruikt audio alleen om beweging en lipsynchronisatie aan te sturen op één enkele invoerafbeelding. R2V accepteert een bredere multimodale invoermatrix, inclusief referentievideo's en meerdere afbeeldingen, en kan stemtimbre klonen in plaats van alleen de synchronisatietiming. R2V is de sterkere keuze wanneer zowel identiteit als stem over shots heen moeten worden overgedragen.

Wanneer moet ik R2V vermijden?

Vermijd R2V voor one-shot B-roll, abstracte beweging, eenvoudige productrotaties, of elke situatie waarin u geen continuïteitsvereiste heeft. R2V kost meer credits per seconde dan I2V en T2V vanwege de referentieconditioneringspas, en de extra conditionering is schadelijk als de referenties geen nuttig signaal toevoegen.

Bekijk het in Actie

继续浏览中,生成器即将加载...