Wan 2.7 Første-Siste-Ramme Kontroll: En 5-Trinns Hvordan-Guide
Hovedpunkter
- Første-siste-ramme-modus i Wan 2.7 I2V lar deg feste både start- og sluttilstandene for et klipp, der modellen interpolerer bevegelsen mellom dem.
- Fem trinn driver en ren gjengivelse: forbered nøkkelbilder, last opp begge bildene, angi varighet, skriv overgangsprompten, og evaluer deretter på fem akser.
- Vanlige feilmoduser er forvrengning av reflekterende overflater, identitetsdrift på karakterer og kamerahopp når de to nøkkelbildene er uenige om vinkel.
- Start kort på 2 til 5 sekunder; varighet skalerer kredittkostnaden lineært, og lange gjengivelser forsterker artefakter.
- PixMind første-siste-ramme prompt-klyngen har maler som samsvarer med de tre eksempel-mønstrene i denne guiden.
Hva er Første-Siste-Ramme-Modus?
Første-siste-ramme er en undermodus av Wan 2.7 bilde-til-video (I2V). Du leverer to bilder: ett for den første rammen, ett for den siste. Wan 2.7 genererer mellomliggende rammer som forbinder dem. Ifølge Alibaba Cloud I2V API-referansen aksepterer modellen et ordnet par bildeinnganger og produserer en MP4 i opptil 1080P.
Dette er viktig fordi enkeltbilde I2V overlater sluttilstanden til modellen. Hvis opptaket ditt må lande på en spesifikk ramme, et produkt fullt rotert eller en boks fullt åpnet, er første-siste-ramme måten du garanterer den landingen på. For moduskontekst, se PixMind Wan 2.7 videogeneratoren, der én opprettelsesflate håndterer hver I2V-undermodus.
Kjernearbeidsflyten er fem trinn: forbered to nøkkelbilder, last dem opp i rekkefølge, angi varighet, skriv overgangsprompten, og gjengi og evaluer deretter. Hvert trinn har en enkelt beslutning som avgjør om gjengivelsen lykkes.
Trinn 1: Forbered Nøkkelbildene Dine
Nøkkelbildekvalitet er den største enkeltfaktoren for en ren første-siste-ramme-gjengivelse. Wan 2.7 bilde-til-video brukerveiledningen anbefaler å matche komposisjon, belysning og kameravinkel på tvers av begge rammene. Vi har funnet ut at uoverensstemmende nøkkelbilder tvinger modellen til å finne opp en overgang, noe som er der forvrengning og identitetsdrift oppstår.
Tre konsistensregler dekker de fleste tilfeller. Match komposisjon ved å ramme inn begge motivene i samme skjermposisjon. Match belysning ved å holde samme hovedlysretning og fargetemperatur. Match kamera ved å holde brennvidde, vinkel og avstand konstant. Bryt en av reglene, og modellen må interpolere over en diskontinuitet.
Sitatkapsel: Nøkkelbildekonsistens er den dominerende faktoren i Wan 2.7 første-siste-ramme-kvalitet. Alibaba Cloud bilde-til-video brukerveiledningen anbefaler å matche komposisjon, belysning og kameravinkel på tvers av begge inngangsrammene for å unngå modell-oppfunne overganger som forårsaker forvrengning og identitetsdrift.
Komposisjons-sjekkliste
- Motivet opptar samme skjermkvadrant i begge rammene.
- Bakgrunnselementer forblir i faste posisjoner.
- Sideforholdet for begge rammene samsvarer med mål-utdataforholdet.
- Negativ plass er bevart slik at bevegelsen har et sted å gå.
Belysnings-sjekkliste
- Hovedlysretningen er identisk i begge rammene.
- Fargetemperaturen samsvarer innenfor 200K.
- Skyggelengde og vinkel er konsistente med en enkelt lyskilde.
- Spekulære høydepunkter faller på de samme overflateområdene.
Kamera-sjekkliste
- Brennvidden er identisk (bruk EXIF-data eller metadata).
- Opptaksvinkelen samsvarer innenfor 5 grader.
- Kamerahøyden er konsistent.
- Linseforvrengningskarakteristikker samsvarer (fast optikk versus zoom).
Vi har brukt kreditter på å teste par der den første rammen ble tatt med 35mm og den siste med 50mm. Modellen produserte et ubehagelig "knepp" midt i klippet. Lås brennvidden før du genererer.
Trinn 2: Last Opp Første Ramme og Siste Ramme
Wan 2.7 forventer de to rammene i en definert rekkefølge. Det første bildet du sender inn blir starttilstanden, det andre blir sluttilstanden. Ifølge Alibaba Cloud Model Studio-oversikten aksepterer I2V-kallet bilde-URL-er eller base64-kodede nyttelaster, og modellen behandler inndata-arrayet som en ordnet sekvens.
Rekkefølge betyr mer enn folk forventer. Hvis du laster opp bildet av den åpne boksen først og bildet av den lukkede boksen sist, får du en lukkende animasjon. Reverser rekkefølgen, og du får en åpningsanimasjon. Modellen utleder ikke intensjon fra prompten alene; rammerekkefølgen er sannhetskilden for retning.
Opplastingsformat og størrelse
Begge rammene bør ha samme sideforhold som mål-utdata. Å mate en 9:16 første ramme og en 1:1 siste ramme tvinger en beskjæring, og beskjæringer introduserer artefakter i kantene. Endre størrelsen på begge rammene til utdataoppløsningen før opplasting.
En praktisk størrelsesoppskrift: mål 1920x1080 for 16:9 utdata i 1080P, 1080x1920 for 9:16, og 1080x1080 for 1:1. Hold filstørrelsen under 10MB per ramme for å unngå tidsavbruddsfeil på trege tilkoblinger.
Navngivning og ordensdisiplin
Gi filene dine navn på en måte som gjør sekvensen åpenbar. keyframe-01-closed.png og keyframe-02-open.png fjerner gjetting ved opplasting. Dette høres trivielt ut, men opplastinger i omvendt rekkefølge er den nest vanligste feilen vi ser.
Trinn 3: Angi Varighet (og Hvorfor Du Bør Starte Kort)
Varighet kontrollerer hvor mange interpolerte rammer modellen må produsere mellom dine to nøkkelbilder. Lengre varigheter betyr mer interpolasjon, noe som betyr flere sjanser for at modellen driver. Wan 2.7 I2V API-referansen støtter varigheter fra 2 til 15 sekunder for I2V.
Vi anbefaler å starte på 2 til 5 sekunder for ethvert nytt nøkkelbilde-par. Korte gjengivelser avdekker feilmoduser billig. Hvis modellen kan interpolere rent over 3 sekunder, kan du trygt utvide til 8 eller 10 sekunder på neste pass.
Sitatkapsel: Wan 2.7 I2V støtter varigheter fra 2 til 15 sekunder, men kredittkostnaden skalerer lineært med varigheten. Testing på 2 til 5 sekunder avdekker forvrengning, drift og kamerahopp-feilmoduser til en brøkdel av kostnaden for en 10-sekunders gjengivelse.
Varighet versus bevegelsesamplitude
Korte varigheter fungerer for små bevegelser. En 3-sekunders gjengivelse passer til et lokk som løftes av en boks. En 5-sekunders gjengivelse passer til en karakter som snur seg fra bak til front. Skyv forbi 8 sekunder, og modellen må finne opp mellomliggende bevegelse som ingen av nøkkelbildene antyder, noe som er der hallusinert bevegelse kommer inn.
Kredittkostnadsmatematikk
Varighet skalerer kostnaden lineært. En 10-sekunders 1080P gjengivelse koster omtrent fem ganger det en 2-sekunders 1080P gjengivelse koster. Hvis du tester på 10 sekunder og feiler, betaler du full pris for en gjengivelse du ikke kan bruke. Test kort, og forplikt deg deretter.
Trinn 4: Skriv Overgangsprompten
Prompten i første-siste-ramme-modus beskriver bevegelsen mellom de to rammene. Den beskriver ikke motivet på nytt; nøkkelbildene gjør allerede det. PixMind første-siste-ramme prompt-klyngen katalogiserer prompt-mønstre for de tre gjennomarbeidede eksemplene nedenfor.
En overgangsprompt har fire deler: handlingen, hastigheten, kamerabevegelsen og stilen. Hold hver del til en kort setningsdel. Lange prompter fortynner modellens oppmerksomhet og produserer mykere bevegelse.
Sitatkapsel: Overgangsprompter i Wan 2.7 første-siste-ramme-modus bør beskrive bevegelse, ikke motiv. Effektive prompter dekker fire deler: handling, hastighet, kamerabevegelse og stil. Hver del som en kort setningsdel overgår avsnittslange prompter som beskriver på nytt hva nøkkelbildene allerede viser.
Prompt-anatomi
- Handling: hva som beveger seg. "Lokket løfter seg," "figuren snur seg," "himmelen mørkner."
- Hastighet: hvor fort. "Sakte," "gradvis," "over tre sekunder."
- Kamera: hva kameraet gjør. "Statisk," "subtil push-in," "låst."
- Stil: visuell behandling. "Filmatisk," "dokumentarisk," "mykt fokus."
Anti-mønster: over-prompting
Motstå fristelsen til å beskrive motivet på nytt. Hvis det første nøkkelbildet er en lukket gaveeske, trenger ikke prompten din å si "en lukket gaveeske på et trebord." Modellen vet allerede. Å beskrive på nytt presser modellen til å gjengi boksen på nytt, noe som motarbeider interpolasjon.
[UNIK INNSIKT] Overgangspromptens jobb er å begrense bevegelse, ikke å erklære motiv. Behandle den som koreografinotater for en danser som allerede kjenner kostymet.
Trinn 5: Gjengi og Evaluer på Fem Akser
Hver første-siste-ramme-gjengivelse trenger en eksplisitt evalueringspass. Vi evaluerer på fem akser, hver scoret bestått eller ikke bestått. En gjengivelse som feiler på en akse går tilbake til trinn 1 eller trinn 4, ikke til endelig levering.

De fem aksene dekker identitet, kamera, belysning, bevegelse og nøyaktighet for målrammen. De tre første kommer fra nøkkelbildekvalitet. De to siste kommer fra prompt- og varighetsvalg.
Sitatkapsel: Wan 2.7 første-siste-ramme-gjengivelser bør evalueres på fem binære akser: identitetskonsistens, kamerakontinuitet, lyskontinuitet, bevegelsesplausibilitet og målrammeoppnåelse. En gjengivelse som feiler på en akse bør omarbeides på nøkkelbilde- eller prompt-stadiet i stedet for å rulles på nytt blindt.
Akse 1: Identitetskonsistens
Ser motivet ut som det samme motivet på tvers av alle rammene? For karakterer, sjekk ansiktsgeometri. For produkter, sjekk silhuett og merkevare. Drift her skyldes vanligvis nøkkelbilder som er uenige om vinkel.
Akse 2: Kamerakontinuitet
Forblir kameraet der det skal? Hvis du spesifiserte statisk, sjekk for utilsiktede push-ins. Hvis du spesifiserte en push-in, sjekk at bevegelsen er jevn og ikke hakker.
Akse 3: Lyskontinuitet
Forblir lysretningen konstant? Se etter skyggebytter midt i klippet, noe som indikerer at modellen byttet lyskilder mellom rammene.
Akse 4: Bevegelsesplausibilitet
Ser bevegelsen fysisk troverdig ut? Lokk passerer ikke gjennom bokser. Lemmer bøyer seg ikke bakover. Hår fryser ikke i luften. Usannsynlig bevegelse betyr vanligvis at prompten ba om for mye på for kort varighet.
Akse 5: Målrammeoppnåelse
Samsvarer den siste rammen av den genererte videoen med ditt opplastede siste-ramme-bilde? Dette er testen som gir modusen sitt navn. Hvis modellen lander et sted nær, men ikke nøyaktig, stram inn prompten din eller forkort varigheten.
Tre Gjennomarbeidede Eksempler (Produktoppdagelse, Karaktervending, Dag til Natt)
De tre mønstrene nedenfor dekker omtrent 80 prosent av første-siste-ramme-brukstilfellene vi ser på PixMind. Hver inkluderer nøkkelbildeforberedelse, prompt, varighet og feilmodusen som biter oftest.
Eksempel 1: Produktoppdagelse (gaveeske lukket til åpen)
Nøkkelbilder: to produktbilder, identisk kamera og belysning. Første ramme: lokket lukket. Andre ramme: lokket helt åpent med interiøret synlig.
Prompt: "Lokket løfter seg sakte oppover og vipper tilbake, og avslører interiøret. Statisk kamera, myk filmatisk belysning, tre sekunders varighet."
Varighet: 3 sekunder i 1080P, 16:9.
Feilmodus: forvrengning av reflekterende overflater. Hvis boksen har en blank finish, smører modellen høydepunktet når lokket beveger seg. Reduser ved å redusere glans i nøkkelbildene eller legge til "matt overflate" i prompten.
Eksempel 2: Karaktervending (bakfra til forfra)
Nøkkelbilder: to karaktergjengivelser, identisk belysning og brennvidde. Første ramme: karakter sett bakfra. Andre ramme: karakter vendt mot kameraet.
Prompt: "Figuren roterer sakte for å vende mot kameraet, snur med klokken over fire sekunder. Statisk medium bilde, filmatisk dybdeskarphet."
Varighet: 4 til 5 sekunder i 1080P.
Feilmodus: identitetsdrift. Ansiktet kan forskyve seg midt i vendingen. Reduser ved å gjøre begge nøkkelbildene så frontale som mulig innenfor vendingen, eller ved å bruke referanse-til-video (R2V)-modus for sterkere identitetsbevaring.
Eksempel 3: Dag til natt (tidspassasje)
Nøkkelbilder: to landskapsbilder, identisk komposisjon. Første ramme: dagslys. Andre ramme: natt med kunstig lys på.
Prompt: "Himmelen mørkner gradvis fra dag til natt over fem sekunder, kunstig lys tennes, fargetemperaturen kjøles. Statisk kamera, låst stativ."
Varighet: 5 sekunder i 1080P.
Feilmodus: kamerahopp. Hvis de to landskapsbildene ble tatt fra selv litt forskjellige posisjoner, finner modellen opp en kamerabevegelse for å bygge bro mellom dem. Reduser ved å ta begge nøkkelbildene fra et låst stativ, eller ved å bruke et enkelt bilde med eksponeringsbracketing.
Vanlige Feilmoduser (og Hvordan Fikse Dem)
Å navngi feilmoduser er hvordan du leverer raskere. De tre nedenfor står for de fleste avviste gjengivelsene vi ser.
Forvrengning av reflekterende overflater
Glass, polert metall og vann smøres ut under interpolasjon fordi modellen ikke kan spore refleksjoner konsekvent. Reduser bevegelsesamplitude, bytt til matte overflater i nøkkelbilder, eller forkort varigheten slik at modellen har færre rammer å finne opp.
Identitetsdrift
Ansikter og silhuetter forskyver seg mellom rammene. Dette er mest vanlig når de to nøkkelbildene er uenige om vinkel eller uttrykk. Ta nøkkelbildene på nytt med matchede vinkler, eller bytt til R2V-modus med et referansebilde for å forankre identitet.
Kamerahopp
Modellen finner opp en kamerabevegelse for å bygge bro mellom to nøkkelbilder som antyder forskjellige vinkler. Løsningen er oppstrøms: lås brennvidde, vinkel og høyde på tvers av begge nøkkelbildene. Hvis du ikke kan ta på nytt, aksepter kamerabevegelsen og skriv den inn i prompten.
Vi har funnet ut at kamerahopp er feilmodusen som oftest feildiagnostiseres som en "modellfeil." Modellen gjør nøyaktig det nøkkelbildene forteller den å gjøre. Fiks inndataene.
Wan 2.7 Første-Siste-Ramme FAQ
Hva er forskjellen mellom første-ramme og første-siste-ramme i Wan 2.7?
Første-ramme-modus aksepterer ett bilde som starttilstand og lar modellen finne opp sluttilstanden. Første-siste-ramme-modus aksepterer to bilder og tvinger modellen til å lande på det andre bildet. Første-siste-ramme gir deg sluttilstandskontroll som første-ramme ikke kan.
Hvor lang bør min første Wan 2.7 første-siste-ramme-gjengivelse være?
Start på 2 til 5 sekunder. Korte varigheter avdekker feilmoduser billig. Ifølge Alibaba Cloud I2V API-referansen støttes varigheter fra 2 til 15 sekunder, men lange varigheter øker interpolasjonsavstanden og risikoen for artefakter.
Kan Wan 2.7 første-siste-ramme håndtere reflekterende overflater som glass og metall?
Ja, men med forsiktighet. Reflekterende overflater er den vanligste feilmodusen for forvrengning. Reduser ved å redusere glans i nøkkelbildene, holde bevegelsesamplitude liten, og skrive "matt overflate" inn i prompten. Speil og polert krom forblir de vanskeligste tilfellene.
Hvordan forhindrer jeg identitetsdrift på tvers av de to nøkkelbildene?
Match kameravinkelen, brennvidden og belysningen på tvers av begge nøkkelbildene innenfor stramme toleranser. Hvis drift vedvarer, bytt til referanse-til-video (R2V)-modus og send et referansebilde for å forankre identitet. R2V er dokumentert i PixMind Wan 2.7 videogeneratorguiden.
Støtter Wan 2.7 første-siste-ramme 1080P?
Ja. Wan 2.7 I2V støtter 720P og 1080P utdata. Første-siste-ramme arver begge. 1080P forbruker omtrent dobbelt så mange kreditter per sekund som 720P, så iterer på 720P og avslutt på 1080P.
Se Det i Aksjon
11 minutes of work turned into 8.7M views in 5 days
— Woody (@woody_research) May 28, 2026
no camera, no real person, no photoshoots, just a 24 year old kid and an ai girl he generated on his laptop.
I've been watching how the page is built. the whole pipeline is three tools running in sequence.
> chatgpt writes… https://t.co/iNPeLY9r3K pic.twitter.com/4jB5QObIvw



