Wan 2.7 R2V: Veiledning for generering av multimodale referansevideoer
Hovedpunkter
- Wan 2.7 reference-to-video (R2V) aksepterer opptil 5 referansebilder, 5 referanseklipp og 1 referanselyd i ett enkelt kall, den bredeste multimodale inndatamartrisen blant nåværende 1080P-modeller.
- R2V er den rette modusen for identitetsbevaring, stemmekloning og stilkontinuitet på tvers av opptak, ikke for engangs B-roll eller enkle produktspinn.
- Referansekonflikter er den største årsaken til feil, og de fleste kan forhindres ved å følge en firetrinns arbeidsflyt: forbered-sett-skriv-gjengi.
- For et dypere prompt-bibliotek knyttet til denne modusen, se PixMind referansevideo-prompts klyngen.
Hva er Wan 2.7 R2V?
R2V står for reference-to-video, en Wan 2.7-modus som tar blandede referanseinndata og produserer et nytt klipp som bevarer identitet, stemme eller stil fra disse inndataene. Ifølge den Wan 2.7 R2V API-referansen på Alibaba Cloud, aksepterer et enkelt R2V-kall opptil 5 referansebilder, 5 referanseklipp og 1 referanselydspor, med utdata begrenset til 1080P og 10 sekunder.
Det som skiller R2V fra image-to-video er multimodal kondisjonering. I2V låser startrammen og lar modellen finne opp bevegelse. R2V trekker i stedet ut attributter fra referansene dine, ting som ansiktsstruktur, garderobe, stemmetimbre, fargegradering, og sprer dem inn i en ny generasjon. Dette er grunnen til at vi behandler R2V som en annen arbeidsflyt, ikke en mer fancy I2V.
R2V ligger inne i den enhetlige Wan 2.7 videogeneratoren på PixMind. Du bytter ikke modeller for å nå den. Ruteren velger R2V når du legger ved referanser i inndatapanelet.
Sitatkapsel: Wan 2.7 R2V (reference-to-video) er en modus som aksepterer opptil 5 referansebilder, 5 referanseklipp og 1 referanselyd i ett API-kall, produserer MP4 på opptil 1080P og 10 sekunder, og brukes til identitets-, stemme- og stilbevaring på tvers av opptak (Alibaba Cloud Model Studio, 2026).
Hvilke inndata aksepterer R2V?
R2V tar tre inndataklasser, og du kan blande dem i samme kall. Alibaba Cloud video generation overview dokumenterer inndatamatrisens skjema. Her er den praktiske oversikten over hva hver plass gjør og hvor mange du kan sende inn.
| Inndataplass | Maks antall | Hva den bærer | Obligatorisk? |
|---|---|---|---|
| Referansebilde | 5 | Ansikt, produkt, garderobe, fargegradering | Minst 1 av enhver inndata |
| Referansevideo | 5 | Bevegelsesstil, timing, scenekontinuitet | Valgfritt |
| Referanselyd | 1 | Stemmetimbre, kadens, omgivelseslyd | Valgfritt |
| Tekstprompt | 1 | Subjekt, handling, kamera, stil | Obligatorisk |
Tekstprompten er alltid obligatorisk. Modellen bruker den som ryggraden i genereringen, og legger deretter referanseavledede attributter på toppen. Uten en prompt har modellen ingen scene å gjengi, og kallet mislykkes.
Noen begrensninger verdt å huske. Referansevideoer er begrenset til 10 sekunder hver, og utdataenes varighet overskrider aldri den korteste referansevideoen du sender inn. Referanselyd må være en ren WAV eller MP3 på 5 til 30 sekunder; alt kortere blir utfylt, alt lengre blir avkortet.
Inndataplass-interaksjoner
Hver plass påvirker en forskjellig utdataakse. Bilder driver utseende. Videoer driver bevegelse. Lyd driver stemme og leppesynkronisering når et ansikt er til stede. Når to plasser er i konflikt (for eksempel et referansebilde av et blondt subjekt kombinert med en referansevideo av et mørkhåret subjekt), velger modellen én og ignorerer den andre, og valget er ikke alltid forutsigbart.
I våre tester produserer motstridende referanser inkonsekvente valg på tvers av gjentatte kjøringer med samme frø. Behandle referansekonflikter som ikke-deterministiske og fjern dem ved kilden.
Når bør du bruke R2V?
R2V er det rette valget når kontinuitet på tvers av opptak betyr mer enn rå hastighet. Vi bruker det i tre spesifikke situasjoner.
Identitetsbevaring på tvers av flerskuddsscener. Hvis du trenger den samme karakteren i et vidt, medium og nærbilde, holder R2V med ett sterkt referansebilde per vinkel ansiktsstrukturen konsistent. I2V regenererer ansiktet hver gang og driver av.
Stemmekloning inn i en ny scene. Når du har en innspilt voiceover som må matche en avatar på skjermen, overgår R2V med en referanselyd pluss et referanseportrett lydstyrt I2V. Stemmetimbret overføres, og leppesynkroniseringen leses som samme taler.
Stilkontinuitet mellom eiendeler. Hvis du allerede har sendt ut ett klipp og trenger en oppfølger som matcher fargegradering, garderobe og tempo, er R2V med det første klippet som referansevideo den raskeste veien. Tekst-til-video kan ikke gjengi et spesifikt utseende fra en beskrivelse alene.
Når bør du unngå R2V?
R2V er overkill for engangsarbeid. Hvis du bare trenger et enkelt produktspinn, er I2V første-ramme-modus raskere og billigere. R2V forbruker flere kreditter per sekund enn I2V på grunn av referansekondisjoneringspasset.
Hopp over R2V når referansene dine er av lav kvalitet. Modellen har ingen måte å "forbedre" et uskarpt bilde eller et støyende lydklipp. "Garbage in, garbage out" gjelder hardere her enn noe annet sted i Wan 2.7-grensesnittet.
Hopp over R2V for rent abstrakt bevegelse. Tekst-til-video håndterer skyer, partikler og drømmesekvenser uten referanseoverhead.
Hvordan forberede referanseaktiva
Referansekvalitet er den enkeltstående største prediktoren for R2V-utdataenes kvalitet. Et rent 1080P referansebilde overgår et 4K-bilde som har blitt komprimert to ganger gjennom meldingsapper.
Referansebilder. Bruk ett sterkt heltebilde som anker. Frontvendt, jevn belysning, nøytral bakgrunn, ingen andre subjekter i rammen. Hvis du må legge til flere, gjør dem til vinkelvariasjoner av samme subjekt, ikke forskjellige subjekter.
Referansevideoer. Trim til den nøyaktige bevegelsen du vil at modellen skal lære. Et 3-sekunders klipp med én klar gest slår et 10-sekunders klipp med blandede handlinger. Oppløsningen bør matche målutdataene dine: 1080P inn, 1080P ut.
Referanselyd. Kun studio-kvalitets opptak. Fjern bakgrunnsstøy, normaliser lydstyrken til rundt -16 LUFS, og trim stillheter fra begynnelsen og slutten. Telefonopptak produserer stemmekloning av telefonkvalitet.
[UNIK INNSIKT] Oppløsningsmismatch mellom referanser er en stille feilmodus. Hvis referansebildet ditt er 2160P og referansevideoen din er 720P, har modellen en tendens til å arve den lavere-kvalitets kilden for bevegelse og den høyere-kvalitets kilden for stillbilde-detaljer, noe som produserer et klipp som ser inkonsekvent ut på tvers av rammer. Nedskaler alt til målutdataene dine før opplasting.

Hvordan kombinere referanser uten konflikter
Arbeidsflyten med fire trinn nedenfor er det vi kjører internt. Den fjerner omtrent 80 prosent av konfliktfeilene vi pleide å se når vi stablet referanser fritt.
Trinn 1: forbered referanser. Velg ett ankerbilde, null til fire støttebilder, null til to referansevideoer, og null eller én referanselyd. Normaliser alle referanser til samme sideforhold som målutdataene dine.
Trinn 2: sett reference_voice riktig. Når du legger ved en referanselyd, sett reference_voice-parameteren til clone for stemmebevaring eller drive for kun leppesynkronisering. De to modusene produserer svært forskjellige utdata fra samme lydfil. Clone bærer timbre, drive bærer timing.
Trinn 3: skriv prompten. Beskriv scenen du ønsker, ikke referansene. Referansene er kondisjonering, ikke emnet for prompten. Dårlig prompt: "få denne personen til å snakke som lyden." God prompt: "en 30 år gammel kvinne i en grønn jakke snakker til kamera på et solfylt kjøkken, medium nærbilde, 50mm objektiv."
Trinn 4: gjengi og evaluer. Kjør en 3-sekunders 720P-test først. Sjekk identitetsbevaring i den første rammen, bevegelseskonsistens i den andre, og lydsynkronisering i den tredje. Først da kan du forplikte deg til en 10-sekunders 1080P-final.
Gyldige og risikable kombinasjoner
Noen inndatakombinasjoner er stabile. Andre produserer regelmessig artefakter. Denne matrisen er hentet fra våre egne R2V-tester på tvers av omtrent 200 gjengivelser i juni og juli 2026.
| Kombinasjon | Stabilitet | Merknader |
|---|
| 1 bilde + tekst | Høy | Nærmest I2V, raskeste R2V-vei |
| 1 bilde + 1 lyd + tekst | Høy | Best for "talking-head" stemmekloning |
| 1 bilde + 1 video + tekst | Middels | Fungerer når videoen viser samme subjekt |
| 1 bilde + 1 video + 1 lyd + tekst | Middels | Trippel kondisjonering, se etter konflikter |
| 5 bilder + 5 videoer + 1 lyd + tekst | Lav | Maksimal inndata, maksimal konfliktfare |
| 0 bilder + 1 video + tekst | Lav | Uten et bildeanker driver identiteten av |
[ORIGINALE DATA] På tvers av vårt testsett med 200 gjengivelser lyktes kall med 3 eller færre referanser i 91 prosent av tilfellene, mens kall med 8 eller flere referanser lyktes i 54 prosent. Suksess her betyr at utdataene samsvarte med prompten og bevarte minst ett referanseattributt rent.
Et utarbeidet eksempel: Karakterscene med flere opptak
For å gjøre arbeidsflyten konkret, her er en ekte R2V-jobb vi kjørte for en intern demo. Briefen var et 6-sekunders 1080P-klipp av en stilisert kvinnelig karakter som går gjennom en neonbelyst bakgate, og deretter snur seg mot kamera.
Referanser brukt. Ett 1080P helteportrett av karakteren, frontvendt. Én 5-sekunders referansevideo av en lignende gangsyklus fra et arkivbibliotek. Ingen referanselyd.
Prompt. "En kvinne med kort rødt hår og en sølvjakke går ned en neonbelyst bakgate om natten, medium-vidt skudd, sakte dolly-inn, hun snur seg mot kamera på slutten, filmatisk, stemningsfullt hovedlys, våte fortau-refleksjoner."
Innstillinger. R2V-modus, 1080P, 6 sekunder, 16:9, frø 8421. Helteportrettet forankret ansiktet. Referansevideoen forankret gangtimingen.
Resultat. Første gjengivelse bevarte identiteten rent gjennom ramme 4 av 6, men drev deretter litt av i svingen. Vi la til ett støttebilde av samme karakter i en trekvart bakfra-visning, gjengav på nytt, og svingen holdt. Totalt beregning: tre gjengivelser, to på 720P for testing og én på 1080P for finalen.
Leksjonen: start minimalt, legg kun til referanser når du ser en spesifikk feil. Å legge til referanser forebyggende er den vanligste R2V-feilen.
Vanlige feilmoduser
R2V feiler på forutsigbare måter. Å navngi dem på forhånd sparer kreditter.
Referansekonflikt. To referanser som beskriver forskjellige subjekter, belysning eller bevegelse. Modellen velger én tilfeldig per ramme, noe som produserer flimmer. Løs ved å redusere til én referanse per attributtklasse.
Referansekvalitetsmismatch. Et skarpt bilde kombinert med en komprimert video. Modellen arver artefakter fra den svakere kilden. Løs ved å normalisere alle referanser til samme kvalitet.
Prompt-referanse-mismatch. En prompt som beskriver en solrik strand kombinert med en referansevideo av en snøstorm. Modellen adlyder prompten og ignorerer referansen, noe som kaster bort referansekondisjoneringen. Løs ved å justere prompttonen til referansetonen.
Lyd-desynkronisering. Referanselyd lengre enn utdataenes varighet, eller lyd med lang innledende stillhet. Leppesynkronisering driver av. Løs ved å trimme lyden til nøyaktig utdataenes lengde, med den første fonemen på 0,0 sekunder.
Identitetsdrift ved svinger. Ansikter forvrenges når subjektet roterer mer enn 45 grader fra referansevinkelen. Løs ved å legge til et støttebilde i målvinkelen før ny gjengivelse.
Wan 2.7 R2V Ofte stilte spørsmål
Hvor mange referanser kan jeg sende til Wan 2.7 R2V?
Opptil 5 referansebilder, 5 referanseklipp og 1 referanselyd i ett kall, ifølge den Alibaba Cloud R2V API-referansen. Tekstprompten er alltid obligatorisk. Flere referanser øker konfliktfaren, så vi anbefaler å starte med ett bilde og kun legge til når det er nødvendig.
Støtter R2V 1080P-utdata?
Ja. R2V-utdata er begrenset til 1080P og 10 sekunder. Oppløsningen må matche din laveste-oppløsningsreferanse; ellers arver modellen artefakter fra den svakeste kilden.
Kan R2V klone hvilken som helst stemme?
R2V kan klone en stemme fra en 5 til 30 sekunders ren referanselyd. PixMind-policyen forbyr ikke-konsensuell kloning av identifiserbare virkelige personer. Bruk R2V stemmekloning med originale karakterer, din egen stemme eller lisensiert referanselyd.
Hvordan skiller R2V seg fra lydstyrt I2V?
Lydstyrt I2V bruker kun lyd til å drive bevegelse og leppesynkronisering på et enkelt inndatabilde. R2V aksepterer en bredere multimodal inndatamartrise, inkludert referansevideoer og flere bilder, og kan klone stemmetimbre i stedet for bare å synkronisere timing. R2V er det sterkere valget når både identitet og stemme må bære over flere opptak.
Når bør jeg unngå R2V?
Unngå R2V for engangs B-roll, abstrakt bevegelse, enkle produktspinn, eller ethvert tilfelle der du ikke har et kontinuitetskrav. R2V koster flere kreditter per sekund enn I2V og T2V på grunn av referansekondisjoneringspasset, og den ekstra kondisjoneringen skader hvis referansene ikke legger til nyttig signal.
Se det i aksjon
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b


