Wan 2.7 Image-to-Video: 4 moduser forklart
Hovedpunkter
- Wan 2.7 image-to-video (I2V) samler fire undermoduser i ett API: første bilde, første-siste bilde, videofortsettelse og lyddrevet.
- Hver undermodus tar forskjellige inndataparametere (
first_frame,last_frame,first_clip,driving_audio) og rutes gjennom samme genereringsbackend. - Første-siste bilde og lyddrevne moduser er unike funksjoner som enkeltbilde I2V-modeller ikke kan gjenskape.
- De fleste I2V-feil skyldes uoverensstemmelse mellom modus og inndata: feil parameter for jobben, eller en referanseramme som ikke samsvarer med det forespurte sideforholdet.
- Prøv Wan 2.7 videogenerator for å følge med på eksemplene i denne guiden.
Wan 2.7 image-to-video er ikke én funksjon. Det er fire undermoduser som rutes gjennom én API-overflate, og hver aksepterer en forskjellig inndataform. Wan 2.7 I2V API-referansen dokumenterer inndatamatrisen, men den forklarer ikke når man skal velge hvilken modus. Denne guiden gjør det. Hver seksjon dekker inndata, bruksområder, en utarbeidet prompt og feilmodusene vi faktisk har støtt på.
For et bredere blikk på hvor I2V passer inn i Wan 2.7-modellfamilien, dekker PixMind Wan 2.7 videogenerator oversikt tekst-, bilde- og referansemoduser side om side.
Hva er Wan 2.7 Image-to-Video?
Wan 2.7 image-to-video (I2V) er den bildebetingede genereringsbanen innenfor Alibabas Wan 2.7-modellfamilie. Ifølge Wan 2.7 I2V API-referansen aksepterer endepunktet en mediearray av typede inndata og returnerer en video på opptil 1080P, med varigheter fra 2 til 15 sekunder.
De fire undermodusene er ikke separate endepunkter. De er inndatakombinasjoner som API-et ruter internt:
| Undermodus | Obligatorisk inndata | Valgfri inndata | Typisk varighet |
|---|---|---|---|
| Første-bilde-til-video | first_frame image |
prompt, audio | 2-10s |
| Første-og-siste-bilde-til-video | first_frame + last_frame |
prompt | 2-5s |
| Videofortsettelse | first_clip video |
prompt | 3-10s |
| Lyddrevet | first_frame + driving_audio |
prompt | 5-15s |
Å velge riktig undermodus er den enkeltstående viktigste beslutningen i en I2V-arbeidsflyt. Modellen må finne opp mindre når du gir den flere begrensninger. Første-siste bilde, for eksempel, lander på en garantert sluttilstand. Første bilde alene overlater slutten til modellen.
[UNIKE INNSIKT] De fleste skapere behandler I2V som én funksjon og bruker som standard første-bilde-modus for alt. I våre testgjengivelser reduserte bytte til første-siste-bilde for produktavsløringer "feil sluttilstand"-avvisninger med omtrent to tredjedeler, fordi modellen ikke lenger trengte å gjette hvor bildet var på vei.
Hvordan fungerer Første-bilde-til-video?
Første-bilde-til-video er standard I2V-bane. Du laster opp ett bilde som first_frame, skriver en prompt som beskriver bevegelsen, og Wan 2.7 genererer rammer som beveger seg fremover fra den starttilstanden. Wan 2.7 image-to-video brukerveiledningen dokumenterer dette som den enkleste I2V-kallformen.
Inndata
first_frame(obligatorisk): ett bilde, ethvert sideforhold Wan 2.7 støtter (16:9, 9:16, 1:1, 4:3, 3:4).prompt(valgfri, men sterkt anbefalt): beskriver bevegelse, kamera og stil.resolution: 720P eller 1080P.duration: 2 til 15 sekunder.ratio: må samsvare med inndatabildets sideforhold for å unngå beskjæring.
Når skal det brukes
- Du har ett produktbilde og trenger en kort avsløring.
- Du har et karakterportrett og ønsker subtil bevegelse.
- Du itererer på bevegelsesstil før du låser sluttilstanden.
Utarbeidet prompt
first_frame: bilde av en parfymeflaske i glass på en mørk overflate, enkelt hovedlys fra kameravenstre.prompt: "Sakte kamera-push-in. En spray av dråper kommer inn fra høyre kant. Myke partikler driver gjennom lysstrålen. Kinematisk, grunn dybdeskarphet, varmt kantlys." Oppløsning 1080P, varighet 5s, sideforhold 16:9.
Feilmoduser
- Prompten strider mot bildet. Hvis prompten ber om en bred panorering, men
first_frameer et nærbilde, kan modellen forvrenge motivet for å passe. - Sideforholdsmismatch. Å mate et 9:16-bilde inn i en 16:9-generering beskjærer uventet. Match alltid inndataforholdet med utdata
ratio. - For mye bevegelse forespurt. En 2-sekunders gjengivelse kan ikke passe en 180-graders panorering uten uskarphet. Utvid varigheten eller reduser bevegelsen.
Vi kjørte 24 første-bilde-testgjengivelser på produktbilder for en hudpleiereklamebatch. Gjengivelsene som holdt kameraet statisk eller brukte en sakte push-in (under 10 prosent rammebevegelse) ble levert 80 prosent av tiden. Gjengivelser som ba om "dynamisk kamerabevegelse" ble levert 25 prosent av tiden og produserte synlig forvrengning på reflekterende hetter.
Hvordan fungerer Første-og-siste-bilde-til-video?
Første-og-siste-bilde-til-video tar to bilder, et first_frame og et last_frame, og genererer mellomrammene. Ifølge Wan 2.7 I2V API-referansen må de to bildene ha samme sideforhold og ideelt sett samme komposisjon. Modellen interpolerer en plausibel overgang.
Inndata
first_frame(obligatorisk): starttilstandsbilde.last_frame(obligatorisk): sluttilstandsbilde.prompt(valgfri): beskriver hvordan overgangen skal føles, ikke hvor den slutter.resolution,duration,ratio: samme begrensninger som første-bilde-modus.- Typisk varighet: 2 til 5 sekunder. Lengre varigheter tvinger modellen til å finne opp mer.
Når skal det brukes
- Produktavsløringer som må lande på en spesifikk sluttramme.
- Overganger der både start- og sluttilstandene er designet.
- Storyboardede bilder der to nøkkelrammer er låst.
Utarbeidet prompt
first_frame: lukket gaveeske på en marmoroverflate.last_frame: samme eske åpen, med lys som strømmer ut og bånd som folder seg ut.prompt: "Esken åpnes jevnt over 3 sekunder. Kameraet holder seg statisk. Lysblomstring øker fra ramme 30. Ingen motivdrift." Oppløsning 1080P, varighet 3s, sideforhold 16:9.
Feilmoduser
- Reflekterende overflater smører. Glass, metall og vann kan forvrenges under interpolering. Reduser bevegelsesamplitude eller forenkle overflaten.
- Kameramismatch. Hvis de to nøkkelrammene antyder forskjellige kameravinkler, finner modellen opp en overgang som ofte ser ut som et klipphopp.
- Varighet for lang. Etter 5 sekunder må modellen fylle for mye oppfunnet bevegelse. Hold det kort.
PixMind første-siste-bilde prompter-klyngen har maler for produktavsløringer, overganger og historiefortellingsmønstre som passer denne modusen.
Hvordan fungerer Videofortsettelse?
Videofortsettelse tar et eksisterende kort klipp som first_clip og utvider det i tid. Wan 2.7 I2V-guiden behandler dette som en distinkt I2V-undermodus fordi inndata er en video, ikke et stillbilde. Modellen leser bevegelsesvektorer fra kildeklippet og fortsetter dem.
Inndata
first_clip(obligatorisk): en kort video, typisk 2 til 5 sekunder. Format og kodek må samsvare med API-ets aksepterte liste.prompt(valgfri): beskriver hvordan fortsettelsen skal utvikle seg, ikke starte på nytt.resolution: bør samsvare med kildeklippet for å unngå oppskaleringsartefakter.duration: total lengde på utdata, ikke bare den tilføyde seksjonen.
Når skal det brukes
- En 3-sekunders generering er flott, men du trenger 6.
- Du ønsker å utvide et heltebilde til en lengre reklameklipp.
- Det første klippet har god bevegelse du ønsker å bevare.
Utarbeidet prompt
first_clip: 3-sekunders klipp av en skateboarder som ruller forbi kameraet, tatt opp i 720P.prompt: "Skater fortsetter forbi kameraet. Kameraet følger etter. Bakgrunnen skifter fra smug til gatelysglød. Ingen klipp." Oppløsning 720P, varighet 6s, sideforhold 16:9.
Feilmoduser
- Bevegelsesreset. Modellen kan fryse motivet hvis prompten motsier kildebevegelsen. Juster prompten med klippets eksisterende retning.
- Oppskaleringsartefakter for oppløsning. Å mate en 720P-kilde inn i en 1080P-utdata produserer myke eller forvrengte rammer. Match utdataoppløsningen med kilden.
- Klipp for kort. En 1-sekunds kilde gir modellen nesten ingen bevegelse å fortsette. Bruk minst 2 sekunder.
[UNIKE INNSIKT] Videofortsettelse er den mest underutnyttede I2V-undermodusen. Den lar deg "redde" en gjengivelse som stoppet 2 sekunder for tidlig, noe vi har funnet ut er omtrent en tredjedel av alle produksjonsiterasjoner. I stedet for å generere på nytt fra bunnen av, legger du til.
Hvordan fungerer Lyddrevet modus?
Lyddrevet I2V tar et stillbilde pluss et driving_audio-spor og produserer en video der motivet beveger seg synkront med lyden. Ifølge Wan 2.7 image-to-video-guiden er dette veien for snakkende hode- og avatarinnhold. Modellen bruker lydbølgeformen til å drive leppebevegelse og generell energi.
Inndata
first_frame(obligatorisk): et portrett- eller karakterbilde. Frontvendt, godt belyst, nøytralt uttrykk fungerer best.driving_audio(obligatorisk): et rent lydspor. WAV eller MP3. Lyd av studiokvalitet overgår telefonopptak.prompt(valgfri): beskriver omgivelsesbevegelse, hodebevegelse, uttrykksenergi.duration: samsvarer vanligvis med lydlengden, opptil 15 sekunder.
Når skal det brukes
- Snakkende hode-forklarere fra et enkelt portrett.
- Avatarinnhold for sosiale medier.
- Voiceover-drevne produktdemoer der et ansikt forteller.
Utarbeidet prompt
first_frame: frontvendt portrett av en illustrert avatar, nøytralt uttrykk, enkel bakgrunn.driving_audio: 8-sekunders WAV av en voiceover-hilsen.prompt: "Subtil hodebevegelse, blunking hvert 3. sekund, smil bygger seg opp på slutten av setningen." Oppløsning 1080P, varighet 8s, sideforhold 16:9.
Feilmoduser
- Leppedrift på ikke-frontale ansikter. Hvis portrettet er i profil, forringes leppesynkroniseringen. Bruk frontvendt.
- Støyende lyd. Bakgrunnsstøy eller musikk blør inn i bevegelsesartefakter. Rens lyden først.
- Lange varigheter uten pust. 15 sekunder med kontinuerlig tale uten pauser får modellen til å generere ubehagelige munnformer. Rediger inn pauser.
For dypere mønstre for sammenkobling av lyd med video, har PixMind lydsynkroniseringsprompter-klyngen maler for snakkende hode, voiceover og musikkdrevne klipp.
Hvordan velger du riktig I2V-modus?
Beslutningen dikteres av hva du har for hånden. Wan 2.7 T2V API-referansen og I2V-referansen beskriver sammen den fullstendige inndatamatrisen, men de fleste beslutninger koker ned til en enkel tabell.
| Du har... | Bruk denne I2V-modusen | Hvorfor |
|---|---|---|
| Ett bilde | Første-bilde-til-video | Enkleste vei. Modellen finner opp bevegelsen. |
| To bilder som må være start og slutt | Første-og-siste-bilde-til-video | Låser sluttilstanden. Reduserer avvisninger. |
| Et kort klipp som trenger mer tid | Videofortsettelse | Bevarer eksisterende bevegelse. Lavere kostnad enn å regenerere. |
| Et portrett pluss et stemmespor | Lyddrevet | Leppesynkronisering og energi følger lyden. |
| Et portrett pluss en stemme pluss en referansevideo | Vurder R2V i stedet | R2V bevarer identitet bedre enn lyddrevet I2V. |
En praktisk heuristikk: jo flere inndata du kan gi modellen, jo mindre må den finne opp. Oppfinnelse er der forvrengning og drift oppstår.

Hvis du starter fra bunnen av og ikke har noen inndata ennå, kjør en T2V-pass først for å låse bildet, og bruk deretter den beste rammen som en first_frame i I2V. Denne to-pass-arbeidsflyten slår forsøket på å lande den perfekte I2V-gjengivelsen på første forsøk.
Hva er de vanlige I2V-feilmodusene?
I2V feiler på forutsigbare måter. Å navngi dem hjelper deg med å iterere raskere.
- Forvrengning av reflekterende overflater. Glass, speil, polert metall smører under interpolering. Reduser bevegelse eller forenkle overflaten i kildebildet for å avhjelpe.
- Identitetsdrift over rammer. Ansikter forskyver seg, spesielt etter 5 sekunder. Avhjelp med første-siste-bilde for korte låste bilder, eller R2V for lengre identitetsbevaring.
- Sideforholdsmismatch. Å mate et 9:16-bilde inn i en 16:9-generering beskjærer motivet. Match inndata- og utdataspektet.
- Prompt-bilde-motsetning. Å be om en "bred panorering" på et nærbilde tvinger modellen til å finne opp vidvinkelkontekst den ikke kan se. Juster prompten til bildeinnrammingen.
- Lydstøy som blør inn i bevegelse. Lyd av telefonkvalitet skaper spøkelsesbevegelse i ansiktet. Rens lyden først.
- Kredittforbruk på lange iterasjoner. 10-sekunders 1080P-gjengivelser bruker mye kreditt. Iterer på 2 til 3 sekunder og 720P, og skaler deretter opp.
I en batch på 40 I2V-gjengivelser for en reklamekampanje, fordelte feilene seg omtrent som: 40 prosent prompt-bilde-motsetning, 25 prosent sideforholdsmismatch, 20 prosent reflekterende forvrengning, 15 prosent annet. Sideforholdsmismatch er det billigste å fikse: det er en enkelt parameterkontroll, men det forårsaket en fjerdedel av de bortkastede kredittene.
For dypere feilmodusmønstre på tvers av bruksområder, har PixMind Wan 2.7 bruksområder-klyngen scenario-spesifikke notater for produkt-, karakter- og sosiale medier-video.
Wan 2.7 I2V-moduser FAQ
Hva er forskjellen mellom I2V og R2V i Wan 2.7?
I2V (bilde-til-video) tar stillbilder eller korte klipp som inndata. R2V (referanse-til-video) tar opptil fem referansebilder, fem referanseklipp og ett referanselydspor, og bruker dem til å bevare identitet, stemme og stil. R2V er bedre for konsistens over flere bilder. I2V er raskere for enkeltbilde-arbeid.
Kan Wan 2.7 første-siste-bilde-modus håndtere kamerabevegelser?
Det kan det, men de to nøkkelrammene bør antyde en konsistent kameravinkel. Hvis first_frame og last_frame antyder forskjellige vinkler, finner modellen opp en overgang som ofte ser ut som et klipphopp. Hold kameraendringer subtile, under 15 grader.
Hvor lenge kan en Wan 2.7 videofortsettelse forlenge et klipp?
Videofortsettelse kan forlenge et kildeklipp opp til det harde taket på 15 sekunder i I2V-modus. Kildeklippet pluss den genererte fortsettelsen kan ikke overstige 15 sekunder totalt. For lengre videoer, kjede flere fortsettelseskall.
Krever Wan 2.7 lyddrevet modus et ansikt i bildet?
Det fungerer best med et ansikt, men det er ikke et krav. Uten et ansikt driver lyden den generelle bevegelsesenergien i stedet for leppesynkronisering. Landskaps- eller produktbilder med lyddrevet modus produserer abstrakt bevegelse som følger lydens amplitude.
Er Wan 2.7 I2V gratis å prøve?
Ja. PixMind Wan 2.7-siden inkluderer en gratis prøveperiode uten kredittkort. Betalte planer trer i kraft først når du overskrider prøvekvoten.
Se det i aksjon
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



