Wan 2.7 Videogenerator: Den komplette guiden til tekst-, bilde- og referansemoduser
Viktige punkter
- Wan 2.7 er én samlet modell som dekker tekst-til-video (T2V), bilde-til-video (I2V) og referanse-til-video (R2V) i én enkelt arbeidsflyt.
- Den støtter 720P og 1080P utdata, 2 til 15 sekunders varighet, og fem sideforhold inkludert 16:9, 9:16 og 1:1.
- Første-siste-ramme og lydstyrte moduser gir deg starttilstand- og sluttilstandskontroll som enkeltbilde I2V-modeller ikke kan matche.
- Referanse-til-video (R2V) aksepterer opptil fem referansebilder, fem referanseklipp og ett referanselydspor i ett kall.
- Prøv Wan 2.7 videogeneratoren for å følge med på eksemplene i denne guiden.
Hva er Wan 2.7 Videogeneratoren?
Wan 2.7 er den nyeste videogenereringsmodellen fra Alibabas Wan-team, eksponert gjennom Alibaba Cloud Model Studio. Den forener fire tidligere separate funksjoner i én modellfamilie: tekst-til-video, bilde-til-video, referanse-til-video og videoredigering. Ifølge Alibaba Cloud video generation overview aksepterer modellen multimodal input og utdata MP4 eller MOV i opptil 1080P.
Nøkkelendringen i 2.7 er arbeidsflytforening. I stedet for å bytte mellom leverandører for tekst-til-video og bilde-til-video, kaller du den samme modellen og lar API-et rute basert på input du sender. Dette samsvarer med PixMind Wan 2.7 produktsiden, hvor én opprettelsesflate håndterer hver modus.
For skapere er dette viktig fordi modusbytte er der mesteparten av produksjonstiden går tapt. Du skriver en prompt, render, innser at starttilstanden er feil, og bygger deretter opp fra bunnen av i et annet verktøy. Wan 2.7s samlede overflate lar deg bytte input uten å bytte modeller.
Hvor mange moduser støtter Wan 2.7?
Wan 2.7 eksponerer fire moduser. I2V API-referansen dokumenterer den fullstendige inputmatrisen. Her er den praktiske oversikten.
| Modus | Input | Best for | Maks varighet | Maks oppløsning |
|---|---|---|---|---|
| T2V (Tekst-til-video) | Tekstprompt, valgfri lyd | Storyboarding, abstrakt bevegelse, B-roll | 15s | 1080P |
| I2V (Bilde-til-video) | Første ramme, valgfri siste ramme, valgfri lyd | Produktavsløringer, karakterhandling, animasjon | 15s | 1080P |
| R2V (Referanse-til-video) | Opptil 5 referansebilder + 5 referanseklipp + referanselyd | Identitetsbevaring, stemmekloning, scener med flere karakterer | 10s | 1080P |
| Videoredigering | Kildevideo + instruksjon | Stiloverføring, instruksjonsbaserte redigeringer | 10s | 1080P |

Tekst-til-video (T2V)
T2V tar en tekstprompt og produserer en video. Wan 2.7 T2V API-referansen lister opp støttede parametere inkludert oppløsning, varighet, forhold og et valgfritt lydspor. T2V er den raskeste veien fra idé til klipp.
Bruk T2V når du ikke har en fast startramme. Abstrakt bevegelse, B-roll, storyboards og stiliserte sekvenser passer alle. Unngå T2V når starttilstanden er viktig: hvis du trenger et spesifikt produkt på skjermen ved ramme null, bytt til I2V.
Bilde-til-video (I2V)
I2V er der Wan 2.7s arbeidsflytforening viser seg. Wan 2.7 bilde-til-video brukerveiledningen dokumenterer fire undermoduser:
- Første-ramme-til-video: ett bilde blir starttilstanden, modellen finner opp bevegelsen.
- Første-og-siste-ramme-til-video: to bilder definerer start- og sluttilstander, modellen interpolerer.
- Videofortsettelse: et kort klipp blir starttilstanden, modellen utvider det.
- Lydstyrt: et bilde pluss et lydspor driver leppesynkronisering eller bevegelse.
For en dypere gjennomgang av de fire I2V-banene, se PixMind første-siste-ramme prompts klyngen.
Referanse-til-video (R2V)
R2V er den kraftigste og mest underdokumenterte modusen. Wan 2.7 R2V API-referansen beskriver et kall som aksepterer opptil fem referansebilder, fem referanseklipp og ett referanselydspor. Modellen bruker disse til å bevare identitet, stemme og stil på tvers av utdataene.
R2V er det du skal bruke når du trenger at en karakter ser lik ut på tvers av opptak, eller når du vil klone en stemme inn i en ny scene. Kompromisset er varighet: R2V har en grense på 10 sekunder, kortere enn 15-sekunders taket for T2V og I2V.
Videoredigering
Videoredigering tar en kildevideo pluss en tekstinstruksjon og returnerer et redigert klipp. Wan 2.7 videoredigerings-API-en støtter instruksjonsbaserte redigeringer og stiloverføring. Denne modusen er utenfor omfanget av en genereringsguide, men verdt å vite at den eksisterer.
Hvordan fungerer Første-Siste-Ramme-modusen?
Første-siste-ramme er en undermodus av I2V. Du oppgir to bilder: ett for den første rammen, ett for den siste. Wan 2.7 genererer rammene imellom.

Dette er viktig fordi enkeltbilde I2V overlater sluttilstanden til modellen. Hvis opptaket ditt må lande på en spesifikk ramme (et produkt fullt rotert, en boks helt åpen, en karakter helt snudd), er første-siste-ramme hvordan du garanterer den landingen.
Det praktiske mønsteret er: ta opp eller generer to nøkkelrammer, last dem opp som første og siste, sett varighet, render. Wan 2.7 interpolerer bevegelsen mellom dem. PixMind første-siste-ramme promptsiden har promptmaler for produktavsløringer, overganger og fortellermønstre.
Vanlige feilmoduser å se etter:
- Forvrengning på reflekterende overflater: glass, metall og vann kan smøre seg under interpolering.
- Identitetsdrift på karakterer: ansikter kan forskyve seg mellom rammer.
- Kamerainkonsekvens: hvis de to nøkkelrammene antyder forskjellige kameravinkler, må modellen finne opp en overgang.
Test med korte varigheter først (2-3 sekunder) før du forplikter deg til 5-10 sekunders rendringer.
Hvordan fungerer lydstyrt video?
Lydstyrt modus tar et stillbilde pluss et lydspor og produserer en video der motivet ser ut til å snakke eller bevege seg i synk med lyden. Dette er grunnlaget for "talking-head" og avatarinnhold.
Modellen bruker lydbølgeformen til å drive to ting: leppebevegelse (hvis et ansikt er til stede) og generell bevegelsesenergi. Wan 2.7 I2V API-en aksepterer lyden som en del av mediearrayet, ved å bruke driving_audio-typen.
For "talking-head" brukstilfeller, par dette med PixMind karakterytelsesklyngen. Kombinasjonen av lydstyrt I2V pluss et rent referanseportrett er den nåværende beste åpne veien til en leppesynkronisert avatar uten å trene en tilpasset modell.
To praktiske merknader:
- Lydkvalitet driver videokvalitet. Et rent studioopptak overgår en telefonmikrofon.
- Test med et 3-sekunders klipp først. Synkroniseringsproblemer er lettere å oppdage tidlig.
Hvilken oppløsning, varighet og sideforhold bør du velge?
Wan 2.7 støtter 720P og 1080P utdata. Kompromisset er kostnad versus skarphet. Ifølge PixMind prisstrategien forbruker 1080P omtrent dobbelt så mange kreditter som 720P per sekund.
| Innstilling | Når du skal velge | Kompromiss |
|---|---|---|
| 720P | Sosialt-først-innhold, vertikal video, testing av iterasjoner | Lavere kostnad, synlig mykhet på store skjermer |
| 1080P | Produktfremvisninger, filmatisk previs, annonsemateriell | Høyere kostnad, skarpere detaljer |
| 16:9 | YouTube, nettstedinnbygginger | Standard bredskjerm |
| 9:16 | Reels, TikTok, Shorts | Mobil vertikal |
| 1:1 | Feed-innlegg, kvadratiske innbygginger | Plattformnøytral |
| 4:3 / 3:4 | Redaksjonell, vintage stil | Niche |
Varighet driver kostnad lineært. En 10-sekunders rendring koster omtrent 5 ganger en 2-sekunders rendring med samme oppløsning. For iterasjon, jobb kort. For final, gå langt.
En rimelig standard for nye brukere: 720P, 5 sekunder, 16:9. Bekreft at opptaket fungerer, og øk deretter til 1080P for det endelige resultatet.
Hvordan velger du riktig Wan 2.7-modus?
Beslutningstreet er enkelt når du vet hvilke input du har.

- Du har bare en idé: bruk T2V. Iterer på prompten før du legger til visuelle elementer.
- Du har ett produktbilde: bruk I2V første-ramme-modus.
- Du har to nøkkelrammer som må være start og slutt: bruk I2V første-siste-ramme.
- Du har et kort klipp som må utvides: bruk I2V videofortsettelse.
- Du har et portrett pluss en voiceover: bruk I2V lydstyrt.
- Du trenger identitets- eller stemmebevaring på tvers av opptak: bruk R2V.
- Du har eksisterende opptak som trenger en redigering eller stilendring: bruk videoredigering.
Hvis du er usikker, start på PixMind Wan familiehub og velg etter brukstilfelle i stedet for etter modusnavn. Huben ruter deg til riktig overflate basert på hva du prøver å lage.
Hvordan skal du prompte Wan 2.7?
Promptstruktur er viktigere enn promptlengde. Wan 2.7 belønner en fem-segmenters anatomi: subjekt, handling, setting, kamera, stil.
En eksempelstruktur:
Subjekt: en parfymeflaske av glass på en mørk overflate. Handling: en spray av dråper bryter ut til høyre. Setting: studio svart bakteppe, enkelt hovedlys fra kamera-venstre. Kamera: statisk medium skudd, 50mm ekvivalent. Stil: filmatisk, grunn dybdeskarphet, varmt kantlys.
Hvert segment innsnevrer utdataområdet. Manglende segmenter faller tilbake på modellens tidligere, som vanligvis er generisk.
For dypere promptmønstre dekker PixMind multi-shot prompts klyngen 12 gjenbrukbare strukturer, inkludert multi-shot sekvenser, lydsynkroniseringsmønstre og første-siste-ramme storyboards.
To prompt-fallgruver å unngå:
- Overbelastede prompts: mer enn fem subjekter i én prompt forvirrer modellen. Del opp i flere rendringer.
- Overbruk av negative prompts: Wan 2.7 vekter ikke negative prompts slik bildemodeller gjør. Hold dem korte.
Hvordan sammenligner Wan 2.7 seg med andre modeller?
Wan 2.7 befinner seg i et overfylt felt. Sora 2, VEO 3, Kling 2.0 og Seedance retter seg alle mot overlappende brukstilfeller. Differensieringen ligger i hvilke moduser hver modell eksponerer og til hvilken pris.
| Funksjon | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Tekst-til-video | Ja | Ja | Ja | Ja |
| Bilde-til-video | Ja | Begrenset | Ja | Ja |
| Første-Siste-Ramme | Ja | Nei | Begrenset | Begrenset |
| Referanse-video (R2V) | Ja | Nei | Nei | Begrenset |
| Lydstyrt I2V | Ja | Ja | Ja | Begrenset |
| Maks varighet | 15s | 20s | 8s | 10s |
| Maks oppløsning | 1080P | 1080P | 1080P | 1080P |
Denne tabellen reflekterer leverandørpubliserte spesifikasjoner per juli 2026. Uavhengig direkte testing finnes i vår Wan 2.7 versus Sora 2 prompt test og VEO og Kling oppgjøret.
Wan 2.7s særegne fordel er første-siste-ramme kombinert med R2V. Ingen annen modell i tabellen eksponerer begge med full kapasitet. Hvis arbeidsflyten din krever presis start- og sluttkontroll pluss identitetsbevaring, er Wan 2.7 for øyeblikket den eneste enkeltmodellveien.
Hva er de vanlige feilmodusene?
Hver AI-videomodell feiler. Å navngi feilmodusene hjelper deg med å levere raskere.
- Forvrengning på reflekterende overflater: glass, speil, polert metall. Reduser ved å redusere bevegelsesamplituden i prompten.
- Identitetsdrift på tvers av opptak: ansikter forskyver seg mellom generasjoner. Reduser med R2V referanseinput.
- Hallusinert tekst i rammer: skilt, etiketter, logoer gjengis som uforståelig. Reduser ved å fjerne tekst fra inputbilder.
- Sideforholdsmismatch: å mate et 9:16 bilde inn i en 16:9 generering beskjærer uventet. Match input sideforhold til output sideforhold.
- Kredittforbruk på lange iterasjoner: 10-sekunders testrendringer spiser kreditter raskt. Iterer på 2-3 sekunder.
PixMind brukstilfelleklyngen har feilmodusnotater per scenario for produktmarkedsføring, karakterytelse, filmatisk previs og sosiale kroker.
Wan 2.7 Videogenerator FAQ
Er Wan 2.7 gratis å prøve?
Ja. PixMind Wan 2.7-siden inkluderer en gratis prøveperiode uten kredittkortkrav. Betalte planer trer i kraft først når du overskrider prøvekvoten.
Støtter Wan 2.7 4K?
Nei. Wan 2.7 video topper ut på 1080P. Wan 2.7 bildemodellen støtter 4K stillbilder gjennom Pro-nivået, men videoutdata er begrenset til 1080P.
Kan Wan 2.7 klone ansiktet til en spesifikk person?
Wan 2.7 kan bevare identitet fra referanseinput, men PixMind-policyen forbyr ikke-konsensuell kloning av likhet av ekte, identifiserbare personer. Bruk R2V med originale karakterer, arkivreferanser eller din egen likhet.
Hvor lang tid tar én Wan 2.7-rendring?
Genereringstid avhenger av varighet, oppløsning og belastning. Typiske 5-sekunders 720P-rendringer fullføres på 60-90 sekunder. 10-sekunders 1080P-rendringer kan ta 3-5 minutter. API-et returnerer en oppgave-ID du spør etter status.
Genererer Wan 2.7 lyd?
Ja, men bare i moduser som aksepterer lydinput. T2V kan ta et lydspor og bevegelsessynkronisere til det. I2V lydstyrt modus bruker lyd til å drive leppe- og bevegelsessynkronisering. Ren lydgenerering (musikk, lydeffekter) er en separat Alibaba-modell.
Kan jeg bruke Wan 2.7-utdata kommersielt?
Ja. Utdata du genererer er dine å bruke kommersielt under Alibaba Cloud Model Studio-vilkårene. Gå gjennom de gjeldende vilkårene på Alibaba Cloud Model Studio oversikten før du leverer.
Se det i aksjon
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



