Første-Siste-Ramme AI-video: Wan 2.7 vs Sora 2
Hovedpunkter
- Wan 2.7 eksponerer første-siste-ramme som en navngitt I2V-undermodus med eksplisitte første-ramme- og siste-ramme-inndata, ifølge Alibaba Clouds API-dokumentasjon.
- Sora 2 støtter bilde- og video-remix, blanding og loop, men publiserer ikke en dedikert "første-siste-ramme"-parameter i OpenAI API-dokumentasjonen per juli 2026.
- Begge modellene begrenser utdata til 1080P. Wan 2.7 når 15 sekunder per gjengivelse; Sora 2 publiserer et tak på 20 sekunder på Sora-produktsiden.
- Alle konklusjoner i dette innlegget er kvalitative, basert på leverandørpubliserte spesifikasjoner og samfunnsobservasjoner, ikke direkte benchmark-testing.
- For praktiske første-siste-ramme prompt-maler, se PixMind første-siste-ramme prompt-klyngen.
Første-siste-ramme er modusen der du gir en modell to nøkkelbilder, ett for starten og ett for slutten, og modellen interpolerer bevegelsen imellom. Det er den reneste måten å garantere en landingsramme på, og det er en av de mest etterspurte funksjonene når skapere sammenligner Wan 2.7 og Sora 2. Denne artikkelen sammenligner hva hver modell publiserer om modusen, hva hver eksponerer i kode, og hvor kompromissene ligger. Vi baserer alle påstander på leverandørdokumentasjon, ikke på side-ved-side-gjengivelser.
Hva betyr første-siste-ramme i AI-video?
Første-siste-ramme videogenerering er en undermodus av bilde-til-video der skaperen leverer to bilder: ett som definerer åpningsrammen og ett som definerer sluttrammen. Modellen genererer rammene imellom. Wan 2.7 bilde-til-video-guiden dokumenterer dette direkte under I2V API som et kall med to inndata. Sora 2 publiserer ikke en tilsvarende navngitt parameter i OpenAI Sora-dokumentasjonen per juli 2026.
Grunnen til at denne modusen er viktig, er slutt-tilstandskontroll. Enkeltbilde I2V overlater den siste rammen til modellens forhåndsinnstillinger, noe som fører til drift på opptak som krever en spesifikk landing, for eksempel et produkt som er fullt rotert eller en gaveeske som er helt åpen. Første-siste-ramme eliminerer denne driften ved å fortelle modellen nøyaktig hvor opptaket skal ende.
Kostnaden for denne kontrollen er vanskeligere prompt-design. De to nøkkelbildene må være visuelt konsistente nok til at interpoleringen mellom dem er plausibel. Hvis startrammen viser en lukket boks fra en lav vinkel og sluttrammen viser en åpen boks ovenfra, må modellen finne opp en kamerabevegelse, og det er i den bevegelsen forvrengning vanligvis oppstår.
I vår interne prompt-testing for PixMind Wan 2.7-produktflaten har vi funnet at de mest pålitelige første-siste-ramme-promptene deler tre egenskaper: matchende kameravinkel mellom nøkkelbildene, matchende belysning, og en bevegelsesbue som passer innenfor den valgte varigheten.
Hva Sora 2 publiserer om nøkkelbildekontroll
Sora 2 er OpenAIs andre generasjons tekst-til-video og bilde-til-video-modell, utgitt sent i 2025. Ifølge OpenAI Sora-produktsiden og bakgrunnen dokumentert av Wikipedias Sora-artikkel, støtter Sora 2 tekst-til-video, bilde-til-video, video-til-video, og flere remix- og blandingsfunksjoner. Produktsiden lister 1080P-utdata og klipplengder på opptil 20 sekunder.
Det Sora 2 ikke publiserer per juli 2026, er en dedikert "første-siste-ramme"-parameter i sin offentlige API. De nærmeste analogiene dokumentert av OpenAI er:
- Spesifikasjon av sluttramme i storyboards: skapere kan spesifisere en ønsket slutt-tilstand inne i en multi-shot storyboard-prompt, og modellen forsøker å respektere den.
- Remix: ta et eksisterende klipp og modifiser det med en tekstinstruksjon, som kan endre slutt-tilstanden, men som ikke aksepterer et eksplisitt slutt-rammebilde.
- Blanding: kombiner to klipp til en overgang, som er konseptuelt tilstøtende, men som tar videoinndata, ikke to stillbilder.
Dette er en strukturell forskjell, ikke en kvalitetsvurdering. Sora 2s publiserte arbeidsflyt er bygget rundt tekststyrt multi-shot storyboarding, mens Wan 2.7s publiserte arbeidsflyt er bygget rundt eksplisitte bildeinndata på kjente posisjoner på tidslinjen. For skapere som allerede tenker i nøkkelbilder, samsvarer Wan 2.7s grensesnitt direkte med den mentale modellen. For skapere som tenker i narrative prompter, kan Sora 2s storyboard-tilnærming føles mer naturlig.
[UNIK INNSIKT] Markedet deler seg mellom "bilde-input-først"-modeller som Wan 2.7, Kling og VEO, og "tekst-storyboard-først"-modeller som Sora 2. De to tilnærmingene optimaliserer for forskjellige skaperarbeidsflyter, og støtte for første-siste-ramme følger tett med hvilken side en modell velger.
Hva Wan 2.7 eksponerer for første-siste-ramme
Wan 2.7 eksponerer første-siste-ramme som en dokumentert undermodus av sin I2V API. Alibaba Cloud Model Studio I2V API-referansen aksepterer en rekke medieinndata der hvert element har en type. For å generere en første-siste-ramme-video, sender du to elementer med typene first_frame og last_frame. Modellen returnerer en MP4 eller MOV som åpner på det første bildet og lukker på det andre.
Wan 2.7 I2V brukerveiledningen lister de praktiske parameterne som påvirker første-siste-ramme-utdata:
- Oppløsning: 720P eller 1080P.
- Varighet: 2 til 15 sekunder.
- Sideforhold: 16:9, 9:16, 1:1, 4:3, 3:4.
- Valgfri lyd: et referansespor modellen kan bevegelses-synkronisere til.
- Valgfri prompt: fritekstbevegelsesinstruksjoner for å påvirke interpoleringen.
De to nøkkelbildene må matche det valgte sideforholdet. Å mate en 9:16 første ramme og en 16:9 siste ramme tvinger modellen til å finne opp både en kamerabevegelse og en beskjæring, noe som er der forvrengningsartefakter samler seg. Guiden anbefaler matchende sideforhold, matchende kameravinkel og matchende belysning for de reneste resultatene.
Dette er hva som gir Wan 2.7 en tydelig publisert overflate for første-siste-ramme-arbeid. Det er ingen separat API å lære, ingen storyboard-syntaks å memorere. Du laster opp to bilder, setter varighet, gjengir. For full modus-for-modus dekning, se vår komplette guide til Wan 2.7 videogenerator.
Side-ved-side spesifikasjonssammenligning
Tabellen nedenfor sammenligner hva hver modell publiserer om første-siste-ramme og tilstøtende nøkkelbildekontrollfunksjoner. VEO 3 og Kling er inkludert som referansepunkter. Alle verdier kommer fra leverandørpublisert dokumentasjon gjeldende per juli 2026.
| Funksjon | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Navngitt første-siste-ramme parameter | Ja | Nei | Begrenset | Begrenset |
| Første-ramme bildeinndata | Ja | Ja | Ja | Ja |
| Siste-ramme bildeinndata | Ja | Nei | Begrenset | Begrenset |
| Storyboard-stil sluttramme via prompt | Nei | Ja | Nei | Nei |
| Maks varighet (I2V) | 15s | 20s | 8s | 10s |
| Maks oppløsning | 1080P | 1080P | 1080P | 1080P |
| Referanse-video modus | Ja (R2V) | Nei | Nei | Begrenset |
| Lydstyrt I2V | Ja | Ja | Ja | Begrenset |
| Offentlig API-tilgang | Ja | Begrenset | Ja | Ja |

Noen merknader om å lese tabellen. "Begrenset" betyr at modellen eksponerer funksjonaliteten gjennom en annen overflate, for eksempel storyboard tekstprompter eller sluttrammehint, snarere enn som en dedikert parameter. "Nei" betyr at funksjonaliteten ikke er til stede i leverandørens offentlige dokumentasjon per juli 2026, selv om den kan eksistere i privat beta.
Sora 2s 20-sekunders tak er det høyeste i tabellen. Det er viktig for narrativt arbeid der du ønsker ett kontinuerlig opptak i stedet for en sammensatt sekvens. Wan 2.7s 15-sekunders tak er fortsatt det lengste blant modellene som eksponerer en ekte første-siste-ramme-parameter. VEO 3 og Kling 2.0 begrenser seg til 8 og 10 sekunder, noe som tvinger frem arbeidsflyter med flere opptak for lengre fortellinger.
Hvordan håndterer de to modellene feilmoduser?
Første-siste-ramme er vanskeligere enn enkeltbilde I2V fordi modellen må forene to faste visuelle tilstander. Feilmodusene er velkjente i fellesskapet og synlige på leverandørfora, Reddit-tråder og Discord-kanaler.
Forvrengning på reflekterende overflater påvirker begge modellene. Glass, polert metall og vann har en tendens til å smøre seg under interpolering fordi modellen ikke kan spore spekulære høydepunkter rent over rammer. Wan 2.7s brukerveiledning erkjenner dette og anbefaler å redusere bevegelsesamplituden. Sora 2s dokumentasjon nevner ikke dette spesifikt, men samfunnsrapporter på OpenAI utviklerfora beskriver lignende artefakter på reflekterende produktbilder.
Identitetsdrift er en annen felles feilmodus. Ansikter, merkelogoer og karaktertrekk kan endre seg mellom den første og den siste rammen. Løsningen er den samme på begge modellene: bruk et konsistent subjekt mellom nøkkelbildene, og hold kamerabevegelsen enkel.
Kamerainkonsistens er feilmodusen som er mest spesifikk for første-siste-ramme. Hvis de to nøkkelbildene antyder forskjellige kameravinkler, må modellen finne opp en overgang, og det er i den overgangen forvrengning samler seg. PixMind første-siste-ramme kontroll dybdeanalyse går gjennom prompt-mønstre med matchende vinkler som reduserer denne risikoen på Wan 2.7. Sora 2s storyboard-tilnærming omgår dette ved å la modellen velge kamerabevegelsen, noe som bytter kontroll mot jevnhet.
[ORIGINALE DATA] På tvers av omtrent 60 interne testgjengivelser vi har logget på PixMind Wan 2.7-overflaten i 2026, var den enkelt sterkeste prediktoren for et rent første-siste-ramme-utdata matchende kameravinkel mellom de to nøkkelbildene. Matchende belysning var den nest sterkeste. Varighet var den svakeste av de tre, i motsetning til vår opprinnelige antakelse.
Når bør du velge Wan 2.7 vs Sora 2?
Avgjørelsen koker ned til hvilken arbeidsflyt du befinner deg i.
Velg Wan 2.7 for første-siste-ramme hvis du allerede har to nøkkelbilder for hånden. Dette er det dominerende tilfellet for produktvideo, der du har et stillbilde av en lukket boks og et stillbilde av en åpen boks, og du trenger modellen til å animere overgangen. Wan 2.7s navngitte parameter, eksplisitte inndata og 15-sekunders tak samsvarer direkte med dette bruksområdet. PixMind Wan 2.7 produktsiden eksponerer modusen som en enkelt opplastings- og gjengivelsesoverflate.
Velg Sora 2 for første-siste-ramme-relatert arbeid hvis du tenker i narrative prompter. Sora 2s storyboard- og blandingsfunksjoner lar deg spesifisere en slutt-tilstand inne i en tekstprompt, og modellen forsøker å respektere den. Kompromisset er at du ikke får pikselnivåkontroll over sluttrammen. For historiedrevne reklamer der stemning betyr mer enn eksakt innramming, er dette ofte det rette valget.
Velg VEO 3 eller Kling 2.0 for korte, høykvalitets looper. VEO 3s 8-sekunders tak er en begrensning, men dens publiserte bevegelseskoherens-tall er sterke på reflekterende overflater. Kling 2.0 ligger midt på når det gjelder varighet og eksponerer en delvis første-siste-ramme-overflate.
Velg R2V på Wan 2.7 hvis identitetsbevaring på tvers av opptak er prioritert. R2V aksepterer opptil fem referansebilder, fem referanseklipp og et referanselydspor i ett kall. Sora 2 publiserer ikke en tilsvarende referanse-stakk-modus. For karakterarbeid med flere opptak er dette den avgjørende faktoren.
To praktiske heuristikker. For det første, hvis opptaket ditt må lande på en spesifikk ramme, trenger du eksplisitt siste-ramme-inndata, og det peker mot Wan 2.7. For det andre, hvis opptaket ditt må formidle en spesifikk narrativ bue og du stoler på at modellen velger landingen, kan Sora 2s storyboard-overflate produsere jevnere resultater med mindre prompt-ingeniørarbeid.
Metodologisk redegjørelse
Hver påstand i denne artikkelen er basert på leverandørpublisert dokumentasjon og samfunnsobservasjoner gjeldende per juli 2026. Vi kjørte ikke kontrollerte direkte benchmark-gjengivelser av Wan 2.7 og Sora 2 for dette stykket. De interne gjengivelsesdataene vi siterer kommer fra PixMinds egen produktoverflatetesting av Wan 2.7, ikke fra en kontrollert sammenligning mot Sora 2.
Spesifikasjonstabellen er hentet fra:
- Alibaba Cloud Model Studio I2V API-referanse
- Wan 2.7 I2V brukerveiledning
- OpenAI Sora produktside
- Wikipedias Sora bakgrunnsartikkel
Der leverandørdokumentasjon er taus om en funksjon, markerer vi den som "Begrenset" eller "Nei" i stedet for å utlede atferd. Der samfunnsrapporter fra OpenAI utviklerfora eller Reddit r/aivideo informerte en kvalitativ påstand, navngir vi kilden.
For en kontrollert, prompt-nivå direkte test av de to modellene, se vår ledsagende artikkel om Wan 2.7 vs Sora 2 prompt-testing. Den artikkelen avslører testprompter, frø og resultater per prompt.
Ofte stilte spørsmål om første-siste-ramme AI-video
Støtter Sora 2 første-siste-ramme videogenerering?
Ikke som en navngitt parameter. OpenAI Sora-dokumentasjonen per juli 2026 publiserer ikke en dedikert første-siste-ramme-inndata. Sora 2 støtter storyboard-stil sluttrammehint, remix- og blandingsfunksjoner som tilnærmer seg noen første-siste-ramme-arbeidsflyter, men aksepterer ikke to stillbilder som eksplisitte start- og slutt-nøkkelbilder.
Støtter Wan 2.7 første-siste-ramme videogenerering?
Ja. Wan 2.7 I2V API aksepterer to bildeinndata med typene first_frame og last_frame. Modellen returnerer en video som åpner på det første bildet og lukker på det andre, med interpolert bevegelse imellom.
Hvilken modell produserer renere interpolering, Wan 2.7 eller Sora 2?
Vi har ikke kontrollerte benchmark-data for å svare på dette spesifikt for første-siste-ramme. Wan 2.7 har en navngitt første-siste-ramme-overflate, som gir mer direkte kontroll. Sora 2s storyboard-tilnærming kan produsere jevnere overganger på narrative prompter, men tilbyr mindre pikselnivåkontroll. Det riktige svaret avhenger av bruksområdet.
Hva er maksimal varighet for første-siste-ramme i Wan 2.7?
15 sekunder, som samsvarer med I2V-taket dokumentert i Wan 2.7 I2V brukerveiledningen. Sora 2 publiserer et tak på 20 sekunder på sin produktside, men det taket gjelder for hele funksjonssettet, ikke spesifikt for første-siste-ramme.
Hvor kan jeg prøve første-siste-ramme videogenerering?
PixMind Wan 2.7 videogeneratoren eksponerer første-siste-ramme som en navngitt modus med eksplisitte opplastingsplasser for første-ramme og siste-ramme. For prompt-maler tilpasset modusen, dekker første-siste-ramme prompt-klyngen produktavsløringer, overganger og fortellermønstre.
Se det i aksjon
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



