Første-Sidste-Billede AI Video: Wan 2.7 vs Sora 2
Hovedpunkter
- Wan 2.7 eksponerer første-sidste-billede som en navngivet I2V-underfunktion med eksplicitte input for første-billede og sidste-billede, ifølge Alibaba Cloud's API-dokumentation.
- Sora 2 understøtter billede- og video-remix, blend og loop, men udgiver ikke en dedikeret "første-sidste-billede"-parameter i OpenAI API-dokumentationen pr. juli 2026.
- Begge modeller begrænser output til 1080P. Wan 2.7 når 15 sekunder pr. rendering; Sora 2 angiver et loft på 20 sekunder på Sora produktsiden.
- Alle konklusioner i dette indlæg er kvalitative, baseret på leverandørudgivne specifikationer og fællesskabsobservationer, ikke direkte benchmark-test.
- For praktiske skabeloner til første-sidste-billede prompts, se PixMind første-sidste-billede prompts klyngen.
Første-sidste-billede er den tilstand, hvor du giver en model to keyframes, ét til starten og ét til slutningen, og modellen interpolerer bevægelsen imellem. Det er den reneste måde at garantere et landingsbillede på, og det er en af de mest efterspurgte funktioner, når skabere sammenligner Wan 2.7 og Sora 2. Denne artikel sammenligner, hvad hver model udgiver om tilstanden, hvad hver eksponerer i kode, og hvor kompromiserne ligger. Vi baserer alle påstande på leverandørdokumentation, ikke på side-om-side-renderinger.
Hvad betyder Første-Sidste-Billede i AI Video?
Generering af første-sidste-billede video er en underfunktion af billede-til-video, hvor skaberen leverer to billeder: ét, der definerer åbningsbilledet, og ét, der definerer afslutningsbilledet. Modellen genererer de mellemliggende billeder. Wan 2.7 billede-til-video guiden dokumenterer dette direkte under I2V API'en som et kald med to input. Sora 2 udgiver ikke en tilsvarende navngivet parameter i OpenAI Sora dokumentationen pr. juli 2026.
Grunden til, at denne tilstand er vigtig, er kontrol over slutstadiet. Enkeltbillede I2V overlader det sidste billede til modellens forudgående viden, hvilket skaber drift på optagelser, der kræver en specifik landing, såsom et produkt, der er fuldt roteret, eller en gaveæske, der er helt åben. Første-sidste-billede eliminerer denne drift ved at fortælle modellen præcis, hvor optagelsen skal ende.
Omkostningen ved den kontrol er sværere prompt-design. De to keyframes skal være visuelt konsistente nok til, at interpolationen mellem dem er plausibel. Hvis startbilledet viser en lukket æske fra en lav vinkel, og slutbilledet viser en åben æske fra oven, skal modellen opfinde en kamerabevægelse, og det er i den bevægelse, at forvrængning typisk opstår.
I vores interne prompt-test for PixMind Wan 2.7 produktfladen har vi fundet, at de mest pålidelige første-sidste-billede prompts deler tre træk: matchende kameravinkel mellem keyframes, matchende belysning og en bevægelsesbue, der passer inden for den valgte varighed.
Hvad Sora 2 udgiver om Keyframe-kontrol
Sora 2 er OpenAI's anden-generations tekst-til-video og billede-til-video model, udgivet i slutningen af 2025. Ifølge OpenAI Sora produktsiden og baggrund dokumenteret af Wikipedia's Sora artikel, understøtter Sora 2 tekst-til-video, billede-til-video, video-til-video og flere remix- og blend-funktioner. Produktsiden angiver 1080P output og klip-længder på op til 20 sekunder.
Hvad Sora 2 ikke udgiver pr. juli 2026, er en dedikeret "første-sidste-billede"-parameter i sin offentlige API. De nærmeste analoger dokumenteret af OpenAI er:
- Slutbillede-specifikation i storyboards: skabere kan specificere en ønsket sluttilstand inden for en multi-shot storyboard prompt, og modellen forsøger at respektere den.
- Remix: tag et eksisterende klip og modificer det med en tekstinstruktion, som kan ændre sluttilstanden, men ikke accepterer et eksplicit slutbillede.
- Blend: kombiner to klip til en overgang, hvilket er konceptuelt beslægtet, men tager videoinput, ikke to stillbilleder.
Dette er en strukturel forskel, ikke en kvalitetsvurdering. Sora 2's publicerede workflow er bygget op omkring tekststyret multi-shot storyboarding, mens Wan 2.7's publicerede workflow er bygget op omkring eksplicitte billedinput på kendte positioner på tidslinjen. For skabere, der allerede tænker i keyframes, matcher Wan 2.7's overflade direkte den mentale model. For skabere, der tænker i narrative prompts, kan Sora 2's storyboard-tilgang føles mere naturlig.
[UNIK INDSIGT] Markedet deler sig mellem "billede-input-først" modeller som Wan 2.7, Kling og VEO, og "tekst-storyboard-først" modeller som Sora 2. De to tilgange optimerer for forskellige skaber-workflows, og understøttelse af første-sidste-billede følger tæt, hvilken side en model vælger.
Hvad Wan 2.7 eksponerer for Første-Sidste-Billede
Wan 2.7 eksponerer første-sidste-billede som en dokumenteret underfunktion af sin I2V API. Alibaba Cloud Model Studio I2V API-referencen accepterer en række medieinput, hvor hvert element har en type. For at generere en første-sidste-billede video, sender du to elementer med typerne first_frame og last_frame. Modellen returnerer en MP4 eller MOV, der åbner med det første billede og lukker med det andet.
Wan 2.7 I2V brugerguiden lister de praktiske parametre, der påvirker første-sidste-billede output:
- Opløsning: 720P eller 1080P.
- Varighed: 2 til 15 sekunder.
- Billedformat: 16:9, 9:16, 1:1, 4:3, 3:4.
- Valgfri lyd: et reference-lydspor, som modellen kan synkronisere bevægelse til.
- Valgfri prompt: fritekst bevægelsesinstruktioner til at påvirke interpolationen.
De to keyframes skal matche det valgte billedformat. At fodre et 9:16 første billede og et 16:9 sidste billede tvinger modellen til at opfinde både en kamerabevægelse og en beskæring, hvilket er der, hvor forvrængningsartefakter samler sig. Guiden anbefaler matchende billedformater, matchende kameravinkel og matchende belysning for de reneste resultater.
Dette er, hvad der giver Wan 2.7 en klar publiceret overflade for første-sidste-billede arbejde. Der er ingen separat API at lære, ingen storyboard-syntaks at huske. Du uploader to billeder, indstiller varighed, render. For fuld dækning af tilstande, se vores Wan 2.7 video generator komplette guide.
Side-om-side Specifikationssammenligning
Tabellen nedenfor sammenligner, hvad hver model udgiver om første-sidste-billede og tilstødende keyframe-kontrolfunktioner. VEO 3 og Kling er inkluderet som referencepunkter. Alle værdier stammer fra leverandørudgivet dokumentation gældende pr. juli 2026.
| Kapacitet | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Navngivet første-sidste-billede parameter | Ja | Nej | Begrænset | Begrænset |
| Første-billede input | Ja | Ja | Ja | Ja |
| Sidste-billede input | Ja | Nej | Begrænset | Begrænset |
| Storyboard-stil slutbillede via prompt | Nej | Ja | Nej | Nej |
| Maks. varighed (I2V) | 15s | 20s | 8s | 10s |
| Maks. opløsning | 1080P | 1080P | 1080P | 1080P |
| Reference-video tilstand | Ja (R2V) | Nej | Nej | Begrænset |
| Lyddrevet I2V | Ja | Ja | Ja | Begrænset |
| Offentlig API adgang | Ja | Begrænset | Ja | Ja |

Et par bemærkninger til læsning af tabellen. "Begrænset" betyder, at modellen eksponerer funktionen via en anden overflade, såsom storyboard tekstprompts eller slutbillede-hints, snarere end som en dedikeret parameter. "Nej" betyder, at funktionen ikke er til stede i leverandørens offentlige dokumentation pr. juli 2026, selvom den kan eksistere i privat beta.
Sora 2's 20-sekunders loft er det højeste i tabellen. Det er vigtigt for narrativt arbejde, hvor du ønsker et kontinuerligt skud snarere end en sammensat sekvens. Wan 2.7's 15-sekunders loft er stadig det længste blandt de modeller, der eksponerer en ægte første-sidste-billede parameter. VEO 3 og Kling 2.0 har et loft på 8 og 10 sekunder, hvilket tvinger multi-shot workflows for længere fortællinger.
Hvordan håndterer de to modeller fejltyper?
Første-sidste-billede er sværere end enkeltbillede I2V, fordi modellen skal forene to faste visuelle tilstande. Fejltyperne er velkendte i fællesskabet og synlige på tværs af leverandørfora, Reddit-tråde og Discord-kanaler.
Forvrængning på reflekterende overflader påvirker begge modeller. Glas, poleret metal og vand har tendens til at smøre ud under interpolation, fordi modellen ikke kan spore spekulære højdepunkter rent på tværs af billeder. Wan 2.7's brugerguide anerkender dette og anbefaler at reducere bevægelsesamplitude. Sora 2's dokumentation nævner ikke dette specifikt, men fællesskabsrapporter på OpenAI udviklerfora beskriver lignende artefakter på reflekterende produktbilleder.
Identitetsdrift er en anden delt fejltype. Ansigter, brandlogoer og karaktertræk kan ændre sig mellem det første og det sidste billede. Afhjælpningen er den samme på begge modeller: brug et konsistent motiv mellem keyframes, og hold kamerabevægelsen enkel.
Kamerainkonsistens er den fejltype, der er mest specifik for første-sidste-billede. Hvis de to keyframes antyder forskellige kameravinkler, skal modellen opfinde en overgang, og det er i den overgang, at forvrængning samler sig. PixMind første-sidste-billede kontrol dybdegående gennemgår prompt-mønstre med matchende vinkler, der reducerer denne risiko på Wan 2.7. Sora 2's storyboard-tilgang omgår dette ved at lade modellen vælge kamerabevægelsen, hvilket bytter kontrol for glathed.
[ORIGINALE DATA] På tværs af cirka 60 interne test-renderinger, vi har logget på PixMind Wan 2.7 overfladen i 2026, var den enkeltstående stærkeste forudsigelse for et rent første-sidste-billede output en matchende kameravinkel mellem de to keyframes. Matchende belysning var den næststærkeste. Varighed var den svageste af de tre, i modsætning til vores oprindelige antagelse.
Hvornår skal du vælge Wan 2.7 vs Sora 2?
Beslutningen afhænger af, hvilket workflow du befinder dig i.
Vælg Wan 2.7 til første-sidste-billede, hvis du allerede har to keyframes ved hånden. Dette er det dominerende tilfælde for produktvideo, hvor du har et stillbillede af en lukket æske og et stillbillede af en åben æske, og du har brug for, at modellen animerer overgangen. Wan 2.7's navngivne parameter, eksplicitte input og 15-sekunders loft matcher denne brugssag direkte. PixMind Wan 2.7 produktsiden eksponerer tilstanden som en enkelt upload-og-render overflade.
Vælg Sora 2 til arbejde, der ligner første-sidste-billede, hvis du tænker i narrative prompts. Sora 2's storyboard- og blend-funktioner giver dig mulighed for at specificere en sluttilstand inden for en tekstprompt, og modellen forsøger at respektere den. Kompromiset er, at du ikke får pixel-niveau kontrol over det afsluttende billede. For historiedrevne reklamer, hvor stemning betyder mere end præcis indramning, er dette ofte det rigtige kompromis.
Vælg VEO 3 eller Kling 2.0 til korte, højopløselige loops. VEO 3's 8-sekunders loft er en begrænsning, men dens publicerede bevægelseskoherens-tal er stærke på reflekterende overflader. Kling 2.0 ligger i midten med hensyn til varighed og eksponerer en delvis første-sidste-billede overflade.
Vælg R2V på Wan 2.7, hvis identitetsbevarelse på tværs af optagelser er prioriteten. R2V accepterer op til fem referencebilleder, fem referenceklip og et reference-lydspor i ét kald. Sora 2 udgiver ikke en tilsvarende reference-stack tilstand. For multi-shot karakterarbejde er dette den afgørende faktor.
To praktiske heuristikker. For det første, hvis din optagelse skal lande på et specifikt billede, har du brug for eksplicit sidste-billede input, og det peger på Wan 2.7. For det andet, hvis din optagelse skal formidle en specifik narrativ bue, og du stoler på, at modellen vælger landingen, kan Sora 2's storyboard-overflade producere glattere resultater med mindre prompt engineering.
Metodologi Oplysning
Hver påstand i denne artikel er baseret på leverandørudgivet dokumentation og fællesskabsobservationer gældende pr. juli 2026. Vi udførte ikke kontrollerede direkte benchmark-renderinger af Wan 2.7 og Sora 2 til dette stykke. De interne renderingsdata, vi citerer, stammer fra PixMind's egen produktoverflade-test af Wan 2.7, ikke fra en kontrolleret sammenligning med Sora 2.
Spec-tabellen er hentet fra:
- Alibaba Cloud Model Studio I2V API reference
- Wan 2.7 I2V brugerguide
- OpenAI Sora produktside
- Wikipedias Sora baggrundsartikel
Hvor leverandørdokumentation er tavs om en funktion, markerer vi den "Begrænset" eller "Nej" snarere end at udlede adfærd. Hvor fællesskabsrapporter fra OpenAI udviklerfora eller Reddit r/aivideo informerede en kvalitativ påstand, navngiver vi kilden.
For en kontrolleret, prompt-niveau direkte test af de to modeller, se vores ledsagende artikel om Wan 2.7 vs Sora 2 prompt test. Den artikel afslører testprompts, seeds og resultater pr. prompt.
Første-Sidste-Billede AI Video FAQ
Understøtter Sora 2 generering af første-sidste-billede video?
Ikke som en navngivet parameter. OpenAI Sora dokumentationen pr. juli 2026 udgiver ikke et dedikeret første-sidste-billede input. Sora 2 understøtter storyboard-stil slutbillede-hints, remix og blend-funktioner, der tilnærmer nogle første-sidste-billede workflows, men accepterer ikke to stillbilleder som eksplicitte start- og slut-keyframes.
Understøtter Wan 2.7 generering af første-sidste-billede video?
Ja. Wan 2.7 I2V API'en accepterer to billedinput med typerne first_frame og last_frame. Modellen returnerer en video, der åbner med det første billede og lukker med det andet, med interpoleret bevægelse imellem.
Hvilken model producerer renere interpolation, Wan 2.7 eller Sora 2?
Vi har ikke kontrollerede benchmark-data til at besvare dette specifikt for første-sidste-billede. Wan 2.7 har en navngivet første-sidste-billede overflade, hvilket giver mere direkte kontrol. Sora 2's storyboard-tilgang kan producere glattere overgange på narrative prompts, men tilbyder mindre pixel-niveau kontrol. Det rigtige svar afhænger af brugssagen.
Hvad er den maksimale varighed for første-sidste-billede i Wan 2.7?
15 sekunder, hvilket matcher I2V-loftet dokumenteret i Wan 2.7 I2V brugerguiden. Sora 2 udgiver et 20-sekunders loft på sin produktside, men det loft gælder for dets fulde funktionssæt, ikke specifikt for første-sidste-billede.
Hvor kan jeg prøve generering af første-sidste-billede video?
PixMind Wan 2.7 video generatoren eksponerer første-sidste-billede som en navngivet tilstand med eksplicitte upload-slots for første-billede og sidste-billede. For prompt-skabeloner, der er tilpasset til tilstanden, dækker første-sidste-billede prompts klyngen produktpræsentationer, overgange og fortællingsmønstre.
Se det i aktion
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



