🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: Guide til multimodal referencevideogenerering

Indholdsfortegnelse

Wan 2.7 R2V: Guide til multimodal referencevideogenerering

Hovedpunkter

  • Wan 2.7 reference-to-video (R2V) accepterer op til 5 referencebilleder, 5 referenceklip og 1 referencelyd i et enkelt kald, den bredeste multimodale inputmatrix blandt nuværende 1080P-modeller.
  • R2V er den rette tilstand til identitetsbevarelse, stemmekloning og stilkontinuitet på tværs af optagelser, ikke til engangs B-roll eller simple produktrotationer.
  • Referencekonflikter er den største årsag til fejl, og de fleste kan forhindres ved at følge en firetrins arbejdsgang: forbered-indstil-skriv-render.
  • For et dybere promptbibliotek knyttet til denne tilstand, se PixMind reference-video prompts klyngen.

Hvad er Wan 2.7 R2V?

R2V står for reference-to-video, en Wan 2.7-tilstand, der tager blandede referenceinput og producerer et nyt klip, der bevarer identitet, stemme eller stil fra disse input. Ifølge Wan 2.7 R2V API-referencen på Alibaba Cloud accepterer et enkelt R2V-kald op til 5 referencebilleder, 5 referenceklip og 1 referencelydspor, med output begrænset til 1080P og 10 sekunder.

Hvad der adskiller R2V fra image-to-video er multimodal konditionering. I2V låser startrammen og lader modellen opfinde bevægelse. R2V udtrækker i stedet attributter fra dine referencer, såsom ansigtsstruktur, garderobe, stemmeklang, farvegradering, og propagerer dem ind i en ny generation. Derfor behandler vi R2V som en anderledes arbejdsgang, ikke en mere avanceret I2V.

R2V sidder inde i den samlede Wan 2.7 videogenerator overflade på PixMind. Du skifter ikke modeller for at nå den. Routeren vælger R2V, når du vedhæfter referencer i inputpanelet.

Citationskapsel: Wan 2.7 R2V (reference-to-video) er en tilstand, der accepterer op til 5 referencebilleder, 5 referenceklip og 1 referencelyd i ét API-kald, producerer MP4 i op til 1080P og 10 sekunder, og bruges til identitets-, stemme- og stilbevarelse på tværs af optagelser (Alibaba Cloud Model Studio, 2026).

Hvilke input accepterer R2V?

R2V tager tre inputklasser, og du kan blande dem i samme kald. Alibaba Cloud video generation overview dokumenterer inputarray-skemaet. Her er den praktiske oversigt over, hvad hver slot gør, og hvor mange du kan sende.

| Input-slot | Maks. antal | Hvad det indeholder | Påkrævet? |
|---|
| Referencebillede | 5 | Ansigt, produkt, garderobe, farvegradering | Mindst 1 af ethvert input |
| Referencevideo | 5 | Bevægelsesstil, timing, scenekontinuitet | Valgfrit |
| Referencelyd | 1 | Stemmeklang, kadence, omgivende lyd | Valgfrit |
| Tekstprompt | 1 | Emne, handling, kamera, stil | Påkrævet |

Tekstprompten er altid påkrævet. Modellen bruger den som rygraden i generationen og lægger derefter referencederiverede attributter ovenpå. Uden en prompt har modellen ingen scene at rendere, og kaldet mislykkes.

Et par begrænsninger, der er værd at huske. Referencevideoer er begrænset til 10 sekunder hver, og outputvarigheden overstiger aldrig den korteste referencevideo, du sender. Referencelyd skal være en ren WAV eller MP3 på 5 til 30 sekunder; alt kortere bliver udfyldt, alt længere bliver afkortet.

Input-slot-interaktioner

Hver slot påvirker en forskellig outputakse. Billeder driver udseende. Videoer driver bevægelse. Lyd driver stemme og læbesynkronisering, når et ansigt er til stede. Når to slots er i konflikt (f.eks. et referencebillede af en blond person parret med en referencevideo af en mørkhåret person), vælger modellen den ene og ignorerer den anden, og valget er ikke altid forudsigeligt.

I vores tests producerer modstridende referencer inkonsekvente valg på tværs af gentagne kørsler med samme seed. Behandl referencekonflikter som ikke-deterministiske og fjern dem ved kilden.

Hvornår skal du bruge R2V?

R2V er det rette valg, når kontinuitet på tværs af optagelser betyder mere end rå hastighed. Vi bruger det i tre specifikke situationer.

Identitetsbevarelse på tværs af scener med flere optagelser. Hvis du har brug for den samme karakter i en vid, medium og nærbillede, bevarer R2V med ét stærkt referencebillede pr. vinkel ansigtsstrukturen konsistent. I2V genskaber ansigtet hver gang og driver.

Stemmekloning ind i en ny scene. Når du har en indspillet voiceover, der skal matche en avatar på skærmen, overgår R2V med en referencelyd plus et referenceportræt lyddrevet I2V. Stemmeklangen overføres, og læbesynkroniseringen fremstår som den samme taler.

Stilkontinuitet mellem aktiver. Hvis du allerede har leveret et klip og har brug for en efterfølger, der matcher farvegradering, garderobe og tempo, er R2V med det første klip som referencevideo den hurtigste vej. Tekst-til-video kan ikke gengive et specifikt udseende ud fra en beskrivelse alene.

Hvornår skal du undgå R2V?

R2V er overkill til engangsopgaver. Hvis du kun har brug for en enkelt produktrotation, er I2V's first-frame-tilstand hurtigere og billigere. R2V forbruger flere credits pr. sekund end I2V på grund af referencekonditioneringspasset.

Spring R2V over, når dine referencer er af lav kvalitet. Modellen har ingen måde at "forbedre" et sløret foto eller et støjende lydklip. "Garbage in, garbage out" gælder her mere end noget andet sted i Wan 2.7-overfladen.

Spring R2V over for rent abstrakt bevægelse. Tekst-til-video håndterer skyer, partikler og drømmesekvenser uden reference-overhead.

Sådan forbereder du referenceaktiver

Referencekvalitet er den største enkeltstående forudsigelse af R2V-outputkvalitet. Et rent 1080P referencebillede overgår et 4K-billede, der er blevet komprimeret to gange via messaging-apps.

Referencebilleder. Brug ét stærkt heltebillede som dit anker. Frontvendt, jævn belysning, neutral baggrund, ingen andre motiver i billedet. Hvis du skal tilføje flere, skal de være vinkelvariationer af det samme motiv, ikke forskellige motiver.

Referencevideoer. Klip til den præcise bevægelse, du ønsker, at modellen skal lære. Et 3-sekunders klip med én klar gestus slår et 10-sekunders klip med blandede handlinger. Opløsningen skal matche dit måloutput: 1080P ind, 1080P ud.

Referencelyd. Kun optagelser i studiekvalitet. Fjern baggrundsstøj, normaliser lydstyrken til omkring -16 LUFS, og klip stilhed fra begyndelsen og slutningen. Telefonoptagelser producerer stemmekloning i telefonkvalitet.

[UNIK INDSIGT] Opløsningsuoverensstemmelse mellem referencer er en tavs fejlfunktion. Hvis dit referencebillede er 2160P, og din referencevideo er 720P, har modellen en tendens til at arve den lavere-fidelity kilde til bevægelse og den højere-fidelity kilde til stillestående detaljer, hvilket producerer et klip, der ser inkonsekvent ud på tværs af rammer. Nedskaler alt til dit måloutput før upload.

Matrix, der viser gyldige inputkombinationer for R2V, med kolonner for referencebillede, referencevideo og referencelyd.

Sådan kombineres referencer uden konflikter

Den firetrins arbejdsgang nedenfor er, hvad vi kører internt. Den fjerner omkring 80 procent af de konfliktfejl, vi plejede at se, når vi frit stablede referencer.

Trin 1: forbered referencer. Vælg ét ankerbillede, nul til fire støttebilleder, nul til to referencevideoer og nul eller én referencelyd. Normaliser alle referencer til samme billedformat som dit måloutput.

Trin 2: indstil reference_voice korrekt. Når du vedhæfter en referencelyd, skal du indstille reference_voice-parameteren til clone for stemmebevarelse eller drive for kun læbesynkronisering. De to tilstande producerer meget forskellige outputs fra den samme lydfil. Clone overfører klang, drive overfører timing.

Trin 3: skriv prompten. Beskriv den scene, du ønsker, ikke referencerne. Referencerne er konditionering, ikke emnet for prompten. Dårlig prompt: "få denne person til at tale som lyden." God prompt: "en 30-årig kvinde i en grøn jakke taler til kameraet i et solbeskinnet køkken, medium nærbillede, 50mm objektiv."

Trin 4: render og evaluer. Kør først en 3-sekunders 720P test. Tjek identitetsbevarelse i den første ramme, bevægelseskoherens i den anden og lydsynkronisering i den tredje. Først derefter forpligt dig til en 10-sekunders 1080P finale.

Gyldige og risikable kombinationer

Nogle inputkombinationer er stabile. Andre producerer regelmæssigt artefakter. Denne matrix er baseret på vores egen R2V-test på tværs af cirka 200 renders i juni og juli 2026.

| Kombination | Stabilitet | Noter |
|---|
| 1 billede + tekst | Høj | Tættest på I2V, hurtigste R2V-vej |
| 1 billede + 1 lyd + tekst | Høj | Bedst til talking-head stemmekloning |
| 1 billede + 1 video + tekst | Medium | Virker når video viser samme motiv |
| 1 billede + 1 video + 1 lyd + tekst | Medium | Tredobbelt konditionering, pas på konflikter |
| 5 billeder + 5 videoer + 1 lyd + tekst | Lav | Maksimalt input, maksimal konfliktfare |
| 0 billeder + 1 video + tekst | Lav | Uden et billedanker driver identiteten |

[ORIGINALE DATA] På tværs af vores 200-render testsæt lykkedes kald med 3 eller færre referencer i 91 procent af tilfældene, mens kald med 8 eller flere referencer lykkedes i 54 procent af tilfældene. Succes her betyder, at outputtet matchede prompten og bevarede mindst én referenceattribut rent.

Et gennemarbejdet eksempel: Karakterscene med flere optagelser

For at gøre arbejdsgangen konkret er her et rigtigt R2V-job, vi kørte til en intern demo. Briefen var et 6-sekunders 1080P-klip af en stiliseret kvindelig karakter, der går gennem en neonoplyst gyde og derefter vender sig mod kameraet.

Anvendte referencer. Et 1080P helteportræt af karakteren, frontvendt. En 5-sekunders referencevideo af en lignende gangcyklus fra et stockbibliotek. Ingen referencelyd.

Prompt. "En kvinde med kort rødt hår og en sølvjakke går ned ad en neonoplyst gyde om natten, medium-vidvinkeloptagelse, langsom dolly-in, hun vender sig mod kameraet til sidst, filmisk, stemningsfuldt hovedlys, våde fortovsrefleksioner."

Indstillinger. R2V-tilstand, 1080P, 6 sekunder, 16:9, seed 8421. Helteportrættet forankrede ansigtet. Referencevideoen forankrede gangtimingen.

Resultat. Første render bevarede identiteten rent gennem ramme 4 af 6, drev derefter lidt på drejningen. Vi tilføjede et støttebillede af den samme karakter i en trekvart bagfra-visning, re-rendered, og drejningen holdt. Samlet beregning: tre renders, to i 720P til test og en i 1080P til final.

Lektionen: start minimalt, tilføj kun referencer, når du ser en specifik fejl. At tilføje referencer forebyggende er den mest almindelige R2V-fejl.

Almindelige fejltyper

R2V fejler på forudsigelige måder. At navngive dem på forhånd sparer credits.

Referencekonflikt. To referencer, der beskriver forskellige motiver, belysning eller bevægelse. Modellen vælger tilfældigt én pr. ramme, hvilket producerer flimmer. Løs ved at reducere til én reference pr. attributklasse.

Referencekvalitetsuoverensstemmelse. Et skarpt billede parret med en komprimeret video. Modellen arver artefakter fra den svagere kilde. Løs ved at normalisere alle referencer til samme fidelity.

Prompt-reference-uoverensstemmelse. En prompt, der beskriver en solrig strand, parret med en referencevideo af en snestorm. Modellen adlyder prompten og ignorerer referencen, hvilket spilder referencekonditioneringen. Løs ved at afstemme promptens tone med referencens tone.

Lyddesynkronisering. Referencelyd længere end outputvarigheden, eller lyd med lang indledende stilhed. Læbesynkronisering driver. Løs ved at trimme lyden til præcis outputlængden, med den første fonem ved 0,0 sekunder.

Identitetsdrift ved drejninger. Ansigter forvrænges, når motivet roterer mere end 45 grader fra referencevinklen. Løs ved at tilføje et støttende referencebillede i den ønskede vinkel før re-rendering.

Wan 2.7 R2V Ofte Stillede Spørgsmål

Hvor mange referencer kan jeg sende til Wan 2.7 R2V?

Op til 5 referencebilleder, 5 referenceklip og 1 referencelyd i ét kald, ifølge Alibaba Cloud R2V API-referencen. Tekstprompten er altid påkrævet. Flere referencer øger risikoen for konflikter, så vi anbefaler at starte med ét billede og kun tilføje, når det er nødvendigt.

Understøtter R2V 1080P output?

Ja. R2V output er begrænset til 1080P og 10 sekunder. Opløsningen skal matche din laveste-opløsningsreference; ellers arver modellen artefakter fra den svageste kilde.

Kan R2V klone enhver stemme?

R2V kan klone en stemme fra en 5 til 30 sekunders ren referencelyd. PixMind's politik forbyder ikke-samtykkende kloning af identificerbare virkelige personer. Brug R2V stemmekloning med originale karakterer, din egen stemme eller licenseret referencelyd.

Hvordan adskiller R2V sig fra lyddrevet I2V?

Lyddrevet I2V bruger kun lyd til at drive bevægelse og læbesynkronisering på et enkelt inputbillede. R2V accepterer en bredere multimodal inputmatrix, herunder referencevideoer og flere billeder, og kan klone stemmeklang snarere end blot at synkronisere timing. R2V er det stærkere valg, når både identitet og stemme skal overføres på tværs af optagelser.

Hvornår skal jeg undgå R2V?

Undgå R2V til engangs B-roll, abstrakt bevægelse, simple produktrotationer eller enhver situation, hvor du ikke har et kontinuitetskrav. R2V koster flere credits pr. sekund end I2V og T2V på grund af referencekonditioneringspasset, og den ekstra konditionering skader, hvis referencerne ikke tilføjer et nyttigt signal.

Se det i aktion

继续浏览中,生成器即将加载...