Wan 2.7 Image-to-Video: 4 tilstande forklaret
Vigtigste pointer
- Wan 2.7 image-to-video (I2V) samler fire undertilstande i én API: første-billede, første-sidste-billede, videofortsættelse og lyddrevet.
- Hver undertilstand tager forskellige inputparametre (
first_frame,last_frame,first_clip,driving_audio) og rutes gennem den samme genererings-backend. - Første-sidste-billede og lyddrevne tilstande er unikke funktioner, som enkeltbillede I2V-modeller ikke kan replikere.
- De fleste I2V-fejl skyldes uoverensstemmelse mellem tilstand og input: forkert parameter til opgaven, eller en reference-ramme, der ikke matcher det ønskede billedformat.
- Prøv den Wan 2.7 video generator for at følge med i ethvert eksempel i denne guide.
Wan 2.7 image-to-video er ikke én funktion. Det er fire undertilstande, der rutes gennem én API-flade, hver især accepterende en forskellig inputform. Den Wan 2.7 I2V API reference dokumenterer inputmatricen, men den forklarer ikke, hvornår man skal vælge hvilken tilstand. Denne guide gør. Hvert afsnit dækker inputs, brugsscenarier, en udarbejdet prompt og de fejltilstande, vi faktisk har oplevet.
For et bredere overblik over, hvor I2V passer ind i Wan 2.7 modelfamilien, dækker PixMind Wan 2.7 video generator oversigt tekst-, billede- og referencetilstande side om side.
Hvad er Wan 2.7 Image-to-Video?
Wan 2.7 image-to-video (I2V) er den billedbetingede genereringssti inden for Alibaba's Wan 2.7 modelfamilie. Ifølge den Wan 2.7 I2V API reference accepterer endepunktet en mediearray af typede inputs og returnerer en video i op til 1080P, med varigheder fra 2 til 15 sekunder.
De fire undertilstande er ikke separate endepunkter. De er inputkombinationer, som API'en ruter internt:
| Undertilstand | Påkrævet input | Valgfrit input | Typisk varighed |
|---|
| Første-billede-til-video | first_frame billede | prompt, lyd | 2-10s |
| Første-og-sidste-billede-til-video | first_frame + last_frame | prompt | 2-5s |
| Videofortsættelse | first_clip video | prompt | 3-10s |
| Lyddrevet | first_frame + driving_audio | prompt | 5-15s |
At vælge den rigtige undertilstand er den enkeltstående mest indflydelsesrige beslutning i en I2V-arbejdsgang. Modellen skal opfinde mindre, når du giver den flere begrænsninger. Første-sidste-billede lander for eksempel på en garanteret sluttilstand. Første-billede alene overlader slutningen til modellen.
[UNIK INDSIGT] De fleste skabere behandler I2V som én funktion og bruger som standard første-billede-tilstand til alt. I vores testgengivelser reducerede skiftet til første-sidste-billede for produktpræsentationer "forkert sluttilstand"-afvisninger med omkring to tredjedele, fordi modellen ikke længere skulle gætte, hvor optagelsen var på vej hen.
Hvordan fungerer Første-billede-til-video?
Første-billede-til-video er standard I2V-stien. Du uploader ét billede som first_frame, skriver en prompt, der beskriver bevægelsen, og Wan 2.7 genererer billeder, der bevæger sig fremad fra den starttilstand. Den Wan 2.7 image-to-video user guide dokumenterer dette som den enkleste I2V-kaldsform.
Inputs
first_frame(påkrævet): ét billede, ethvert billedformat Wan 2.7 understøtter (16:9, 9:16, 1:1, 4:3, 3:4).prompt(valgfrit, men stærkt anbefalet): beskriver bevægelse, kamera og stil.resolution: 720P eller 1080P.duration: 2 til 15 sekunder.ratio: skal matche inputbilledets billedformat for at undgå beskæring.
Hvornår skal det bruges
- Du har ét produktfoto og har brug for en kort præsentation.
- Du har et karakterportræt og ønsker subtil bevægelse.
- Du itererer på bevægelsesstil, før du låser sluttilstanden.
Udarbejdet prompt
first_frame: foto af en glasparfumeflaske på en mørk overflade, enkelt hovedlys fra kamera-venstre.prompt: "Langsom kameraindskubning. En spray af dråber kommer ind fra højre kant. Bløde partikler driver gennem lysstrålen. Filmisk, lav dybdeskarphed, varmt kantlys." Opløsning 1080P, varighed 5s, billedformat 16:9.
Fejltilstande
- Prompt kæmper mod billedet. Hvis prompten beder om en bred panorering, men
first_frameer et tæt nærbillede, kan modellen forvrænge motivet for at passe. - Billedformatuoverensstemmelse. At føre et 9:16-billede ind i en 16:9-generering beskærer uventet. Match altid inputbilledformatet med output
ratio. - For meget bevægelse anmodet om. En 2-sekunders gengivelse kan ikke rumme en 180-graders panorering uden udtværing. Forlæng varigheden eller reducer bevægelsen.
Vi kørte 24 første-billede testgengivelser på produktfotos til en batch hudplejereklamer. Gengivelserne, der holdt kameraet statisk eller brugte en langsom indskubning (under 10 procent billedvandring), blev leveret 80 procent af tiden. Gengivelser, der bad om "dynamisk kamerabevægelse", blev leveret 25 procent af tiden og producerede synlig forvrængning på reflekterende hætter.
Hvordan fungerer Første-og-Sidste-Billede-til-Video?
Første-og-sidste-billede-til-video tager to billeder, et first_frame og et last_frame, og genererer de mellemliggende billeder. Ifølge den Wan 2.7 I2V API reference skal de to billeder have samme billedformat og ideelt set samme komposition. Modellen interpolerer en plausibel overgang.
Inputs
first_frame(påkrævet): starttilstandsbillede.last_frame(påkrævet): sluttilstandsbillede.prompt(valgfrit): beskriver, hvordan overgangen skal føles, ikke hvor den ender.resolution,duration,ratio: samme begrænsninger som første-billede-tilstand.- Typisk varighed: 2 til 5 sekunder. Længere varigheder tvinger modellen til at opfinde mere.
Hvornår skal det bruges
- Produktpræsentationer, der skal lande på en specifik slutramme.
- Overgange, hvor både start- og sluttilstandene er designet.
- Storyboardede optagelser, hvor to nøglebilleder er låst.
Udarbejdet prompt
first_frame: lukket gaveæske på en marmoroverflade.last_frame: samme æske åben, med lys strømmende ud og bånd, der folder sig ud.prompt: "Æske åbner jævnt over 3 sekunder. Kamera holder statisk. Lysglimt stiger fra billede 30. Ingen motivdrift." Opløsning 1080P, varighed 3s, billedformat 16:9.
Fejltilstande
- Reflekterende overflader udtværes. Glas, spejle, poleret metal udtværes under interpolation. Afhjælp ved at reducere bevægelse eller forenkle overfladen.
- Kamerauoverensstemmelse. Hvis de to nøglebilleder antyder forskellige kameravinkler, opfinder modellen en overgang, der ofte ligner et springklip.
- Varighed for lang. Efter 5 sekunder skal modellen udfylde for meget opfundet bevægelse. Hold det kort.
Den PixMind first-last-frame prompts cluster har skabeloner til produktpræsentationer, overgange og fortællingsmønstre, der matcher denne tilstand.
Hvordan fungerer Videofortsættelse?
Videofortsættelse tager et eksisterende kort klip som first_clip og forlænger det i tid. Den Wan 2.7 I2V guide behandler dette som en særskilt I2V-undertilstand, fordi inputtet er en video, ikke et stillbillede. Modellen læser bevægelsesvektorer fra kildeklippet og fortsætter dem.
Inputs
first_clip(påkrævet): en kort video, typisk 2 til 5 sekunder. Format og codec skal matche API'ens accepterede liste.prompt(valgfrit): beskriver, hvordan fortsættelsen skal udvikle sig, ikke genstarte.resolution: skal matche kildeklippet for at undgå opskaleringsartefakter.duration: samlet længde af outputtet, ikke kun den tilføjede sektion.
Hvornår skal det bruges
- En 3-sekunders generering er fantastisk, men du har brug for 6.
- Du ønsker at forlænge en hero-optagelse til et længere reklameklip.
- Det første klip har god bevægelse, du ønsker at bevare.
Udarbejdet prompt
first_clip: 3-sekunders klip af en skateboarder, der ruller forbi kameraet, optaget i 720P.prompt: "Skater fortsætter forbi kameraet. Kamera følger. Baggrund skifter fra gyde til gadelysglød. Ingen klip." Opløsning 720P, varighed 6s, billedformat 16:9.
Fejltilstande
- Bevægelsesnulstilling. Modellen kan fryse motivet, hvis prompten modsiger kildebevægelsen. Juster prompten med klippets eksisterende retning.
- Opskaleringsartefakter i opløsning. At føre en 720P-kilde ind i et 1080P-output producerer bløde eller forvrængede billeder. Match outputopløsning til kilde.
- Klip for kort. En 1-sekunds kilde giver modellen næsten ingen bevægelse at fortsætte. Brug mindst 2 sekunder.
[UNIK INDSIGT] Videofortsættelse er den mest underudnyttede I2V-undertilstand. Den lader dig "redde" en gengivelse, der stoppede 2 sekunder for tidligt, hvilket vi har fundet er omkring en tredjedel af alle produktionsiterationer. I stedet for at regenerere fra bunden, tilføjer du.
Hvordan fungerer Lyddrevet tilstand?
Lyddrevet I2V tager et stillbillede plus et driving_audio spor og producerer en video, hvor motivet bevæger sig synkront med lyden. Ifølge den Wan 2.7 image-to-video guide er dette stien for talking-head og avatarindhold. Modellen bruger lydbølgeformen til at drive læbebevægelse og overordnet energi.
Inputs
first_frame(påkrævet): et portræt- eller karakterbillede. Frontalt, godt belyst, neutralt udtryk fungerer bedst.driving_audio(påkrævet): et rent lydspor. WAV eller MP3. Lyd i studiekvalitet overgår telefonoptagelser.prompt(valgfrit): beskriver omgivende bevægelse, hovedbevægelse, udtryksenergi.duration: matcher normalt lydlængden, op til 15 sekunder.
Hvornår skal det bruges
- Talking-head forklaringer fra et enkelt portræt.
- Avatarindhold til sociale medier.
- Voiceover-drevne produktdemoer, hvor et ansigt fortæller.
Udarbejdet prompt
first_frame: frontalt portræt af en illustreret avatar, neutralt udtryk, ensfarvet baggrund.driving_audio: 8-sekunders WAV af en voiceover-hilsen.prompt: "Subtil hovedsvaj, blinker hvert 3. sekund, smil opbygges ved slutningen af sætningen." Opløsning 1080P, varighed 8s, billedformat 16:9.
Fejltilstande
- Læbedrift på ikke-frontale ansigter. Hvis portrættet er i profil, forringes læbesynkroniseringen. Brug frontalt.
- Støjende lyd. Baggrundsstøj eller musik siver ind i bevægelsesartefakter. Rens lyden først.
- Lange varigheder uden åndedræt. 15 sekunders kontinuerlig tale uden pauser får modellen til at generere akavede mundformer. Rediger pauser ind.
For dybere mønstre for parring af lyd med video, har den PixMind audio-sync prompts cluster skabeloner til talking-head, voiceover og musikdrevne klip.
Hvordan vælger du den rigtige I2V-tilstand?
Beslutningen dikteres af, hvad du har ved hånden. Den Wan 2.7 T2V API reference og I2V-referencen beskriver tilsammen den fulde inputmatrix, men de fleste beslutninger kan koges ned til en simpel tabel.
| Du har... | Brug denne I2V-tilstand | Hvorfor |
|---|
| Ét foto | Første-billede-til-video | Simpleste vej. Modellen opfinder bevægelsen. |
| To fotos, der skal være start og slut | Første-og-sidste-billede-til-video | Låser sluttilstanden. Reducerer afvisninger. |
| Et kort klip, der har brug for mere tid | Videofortsættelse | Bevarer eksisterende bevægelse. Lavere omkostninger end at regenerere. |
| Et portræt plus et stemmespor | Lyddrevet | Læbesynkronisering og energi følger lyden. |
| Et portræt plus en stemme plus en referencevideo | Overvej R2V i stedet | R2V bevarer identiteten bedre end lyddrevet I2V. |
En praktisk heuristik: jo flere inputs du kan give modellen, jo mindre skal den opfinde. Opfindelse er der, hvor forvrængning og drift opstår.

Hvis du starter fra bunden og endnu ikke har inputs, skal du først køre et T2V-pas for at låse optagelsen, og derefter bruge det bedste billede som et first_frame i I2V. Denne to-pas-arbejdsgang er bedre end at forsøge at lande den perfekte I2V-gengivelse i første forsøg.
Hvad er de almindelige I2V-fejltilstande?
I2V fejler på forudsigelige måder. At navngive dem hjælper dig med at iterere hurtigere.
- Forvrængning af reflekterende overflader. Glas, spejle, poleret metal udtværes under interpolation. Afhjælp ved at reducere bevægelse eller forenkle overfladen i kildebilledet.
- Identitetsdrift på tværs af billeder. Ansigter skifter, især efter 5 sekunder. Afhjælp med første-sidste-billede for korte låste optagelser, eller R2V for længere identitetsbevarelse.
- Billedformatuoverensstemmelse. At føre et 9:16-billede ind i en 16:9-generering beskærer motivet. Match input- og outputbilledformat.
- Prompt-billede-modsigelse. At bede om "bred panorering" på et tæt nærbillede tvinger modellen til at opfinde vidvinkelkontekst, den ikke kan se. Juster prompten til billedets indramning.
- Lydstøj, der siver ind i bevægelse. Lyd i telefonkvalitet skaber spøgelsesbevægelse på ansigtet. Rens lyden først.
- Kreditforbrug ved lange iterationer. 10-sekunders 1080P-gengivelser forbruger credits. Iterer ved 2 til 3 sekunder og 720P, og skaler derefter op.
I en batch på 40 I2V-gengivelser til en reklamekampagne fordelte fejlene sig groft som: 40 procent prompt-billede-modsigelse, 25 procent billedformatuoverensstemmelse, 20 procent reflekterende forvrængning, 15 procent andet. Billedformatuoverensstemmelse er den billigste at rette: det er en enkelt parameterkontrol, men den forårsagede en fjerdedel af de spildte credits.
For dybere fejltilstandsmønstre på tværs af brugsscenarier, har den PixMind Wan 2.7 use cases cluster scenariespecifikke noter for produkt-, karakter- og sociale videoer.
Wan 2.7 I2V-tilstande FAQ
Hvad er forskellen mellem I2V og R2V i Wan 2.7?
I2V (image-to-video) tager stillbilleder eller korte klip som input. R2V (reference-to-video) tager op til fem referencebilleder, fem referenceklip og ét reference-lydspor og bruger dem til at bevare identitet, stemme og stil. R2V er bedre til konsistens over flere optagelser. I2V er hurtigere til enkeltoptagelsesarbejde.
Kan Wan 2.7 første-sidste-billede-tilstand håndtere kamerabevægelser?
Det kan den, men de to nøglebilleder bør antyde en konsistent kameravinkel. Hvis first_frame og last_frame antyder forskellige vinkler, opfinder modellen en overgang, der ofte ligner et springklip. Hold kameraændringer subtile, under 15 grader.
Hvor længe kan en Wan 2.7 videofortsættelse forlænge et klip?
Videofortsættelse kan forlænge et kildeklip op til det hårde loft på 15 sekunder i I2V-tilstand. Kildeklippet plus den genererede fortsættelse kan ikke overstige 15 sekunder i alt. For længere videoer, kæd flere fortsættelseskald sammen.
Kræver Wan 2.7 lyddrevet tilstand et ansigt i billedet?
Det fungerer bedst med et ansigt, men det er ikke påkrævet. Uden et ansigt driver lyden den overordnede bevægelsesenergi i stedet for læbesynkronisering. Landskabs- eller produktoptagelser med lyddrevet tilstand producerer abstrakt bevægelse, der følger lydens amplitude.
Er Wan 2.7 I2V gratis at prøve?
Ja. Den PixMind Wan 2.7 page inkluderer en gratis prøveperiode uden krav om kreditkort. Betalte planer træder først i kraft, når du overskrider prøvekvoten.
Se det i aktion
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



