Wan 2.7 Image-to-Video: 4 Modi Uitgelegd
Belangrijkste Punten
- Wan 2.7 image-to-video (I2V) bundelt vier submodi in één API: first-frame, first-last-frame, videovoortzetting en audio-gestuurd.
- Elke submodus accepteert verschillende invoerparameters (
first_frame,last_frame,first_clip,driving_audio) en wordt via dezelfde generatie-backend gerouteerd. - First-last-frame en audio-gestuurde modi zijn unieke mogelijkheden die single-image I2V-modellen niet kunnen repliceren.
- De meeste I2V-fouten komen voort uit een mismatch tussen modus en invoer: verkeerde parameter voor de taak, of een referentieframe dat niet overeenkomt met de gevraagde beeldverhouding.
- Probeer de Wan 2.7 video generator om elk voorbeeld in deze gids te volgen.
Wan 2.7 image-to-video is geen enkele functie. Het zijn vier submodi die via één API-oppervlak worden gerouteerd, elk met een andere invoervorm. De Wan 2.7 I2V API reference documenteert de invoermatrix, maar legt niet uit wanneer welke modus te kiezen. Deze gids doet dat wel. Elke sectie behandelt invoer, gebruiksscenario's, een uitgewerkte prompt en de faalmodi die we daadwerkelijk zijn tegengekomen.
Voor een bredere kijk op de plaats van I2V binnen de Wan 2.7 modelfamilie, behandelt de PixMind Wan 2.7 video generator overview tekst-, beeld- en referentiemodi naast elkaar.
Wat is Wan 2.7 Image-to-Video?
Wan 2.7 image-to-video (I2V) is het beeld-geconditioneerde generatiepad binnen Alibaba's Wan 2.7 modelfamilie. Volgens de Wan 2.7 I2V API reference accepteert het eindpunt een media-array van getypte invoer en retourneert het een video tot 1080P, met een duur van 2 tot 15 seconden.
De vier submodi zijn geen afzonderlijke eindpunten. Het zijn invoercombinaties die de API intern routeert:
| Submodus | Vereiste invoer | Optionele invoer | Typische duur |
|---|---|---|---|
| First-frame-naar-video | first_frame image |
prompt, audio | 2-10s |
| First-en-last-frame-naar-video | first_frame + last_frame |
prompt | 2-5s |
| Videovoortzetting | first_clip video |
prompt | 3-10s |
| Audio-gestuurd | first_frame + driving_audio |
prompt | 5-15s |
Het kiezen van de juiste submodus is de beslissing met de grootste impact in een I2V-workflow. Het model hoeft minder te verzinnen wanneer je het meer beperkingen geeft. First-last-frame, bijvoorbeeld, resulteert in een gegarandeerde eindtoestand. First-frame alleen laat het einde aan het model over.
[UNIEK INZICHT] De meeste makers behandelen I2V als één functie en gebruiken standaard de first-frame modus voor alles. In onze testrenders verminderde het overschakelen naar first-last-frame voor productonthullingen de afwijzingen van "verkeerde eindtoestand" met ongeveer tweederde, omdat het model niet langer hoefde te raden waar de opname naartoe ging.
Hoe werkt First-Frame-naar-Video?
First-frame-naar-video is het standaard I2V-pad. Je uploadt één afbeelding als de first_frame, schrijft een prompt die de beweging beschrijft, en Wan 2.7 genereert frames die vooruit bewegen vanaf die starttoestand. De Wan 2.7 image-to-video user guide documenteert dit als de eenvoudigste I2V-aanroepvorm.
Invoer
first_frame(vereist): één afbeelding, elke beeldverhouding die Wan 2.7 ondersteunt (16:9, 9:16, 1:1, 4:3, 3:4).prompt(optioneel maar sterk aanbevolen): beschrijft beweging, camera en stijl.resolution: 720P of 1080P.duration: 2 tot 15 seconden.ratio: moet overeenkomen met de beeldverhouding van de invoerafbeelding om bijsnijden te voorkomen.
Wanneer te gebruiken
- Je hebt één productfoto en hebt een korte onthulling nodig.
- Je hebt een karakterportret en wilt subtiele beweging.
- Je itereert op bewegingsstijl voordat je de eindtoestand vastlegt.
Uitgewerkte prompt
first_frame: foto van een glazen parfumflesje op een donker oppervlak, één hoofdlicht van cameralinks.prompt: "Langzame camera-push-in. Een spray van druppels komt binnen vanaf de rechterrand. Zachte deeltjes zweven door de lichtstraal. Cinematisch, geringe scherptediepte, warm randlicht." Resolutie 1080P, duur 5s, verhouding 16:9.
Faalmodi
- Prompt botst met de afbeelding. Als de prompt vraagt om een brede pan, maar de
first_frameeen strakke close-up is, kan het model het onderwerp vervormen om te passen. - Beeldverhouding mismatch. Het invoeren van een 9:16 afbeelding in een 16:9 generatie snijdt onverwacht bij. Stem de invoerbeeldverhouding altijd af op de uitvoer
ratio. - Te veel beweging gevraagd. Een render van 2 seconden kan geen 180-graden pan bevatten zonder te vervagen. Verleng de duur of verminder de beweging.
We hebben 24 first-frame testrenders uitgevoerd op productfoto's voor een batch huidverzorgingsadvertenties. De renders die de camera statisch hielden of een langzame push-in gebruikten (minder dan 10 procent framebeweging) werden 80 procent van de tijd geleverd. Renders die vroegen om "dynamische camerabeweging" werden 25 procent van de tijd geleverd en produceerden zichtbare vervorming op reflecterende doppen.
Hoe werkt First-en-Last-Frame-naar-Video?
First-en-last-frame-naar-video neemt twee afbeeldingen, een first_frame en een last_frame, en genereert de tussenliggende frames. Volgens de Wan 2.7 I2V API reference moeten de twee afbeeldingen dezelfde beeldverhouding en idealiter dezelfde compositie delen. Het model interpoleert een plausibele overgang.
Invoer
first_frame(vereist): starttoestand afbeelding.last_frame(vereist): eindtoestand afbeelding.prompt(optioneel): beschrijft hoe de overgang moet aanvoelen, niet waar deze eindigt.resolution,duration,ratio: dezelfde beperkingen als de first-frame modus.- Typische duur: 2 tot 5 seconden. Langere duren dwingen het model om meer te verzinnen.
Wanneer te gebruiken
- Productonthullingen die op een specifiek eindframe moeten landen.
- Overgangen waarbij zowel de start- als de eindtoestand zijn ontworpen.
- Storyboard-opnamen waarbij twee keyframes zijn vastgelegd.
Uitgewerkte prompt
first_frame: gesloten geschenkdoos op een marmeren oppervlak.last_frame: dezelfde doos open, met licht dat eruit stroomt en lint dat zich ontvouwt.prompt: "Doos opent soepel gedurende 3 seconden. Camera blijft statisch. Lichtgloed neemt toe vanaf frame 30. Geen onderwerpdrift." Resolutie 1080P, duur 3s, verhouding 16:9.
Faalmodi
- Reflecterende oppervlakken vervagen. Glas, metaal en water kunnen vervormen tijdens interpolatie. Verminder de bewegingsamplitude of vereenvoudig het oppervlak.
- Camera mismatch. Als de twee keyframes verschillende camerahoeken impliceren, verzint het model een overgang die vaak op een jump cut lijkt.
- Duur te lang. Na 5 seconden moet het model te veel verzonnen beweging invullen. Houd het kort.
De PixMind first-last-frame prompts cluster bevat sjablonen voor productonthullingen, overgangen en storytellingpatronen die bij deze modus passen.
Hoe werkt Videovoortzetting?
Videovoortzetting neemt een bestaande korte clip als de first_clip en verlengt deze in de tijd. De Wan 2.7 I2V guide behandelt dit als een aparte I2V-submodus omdat de invoer een video is, geen stilstaand beeld. Het model leest bewegingsvectoren uit de bronclip en zet deze voort.
Invoer
first_clip(vereist): een korte video, typisch 2 tot 5 seconden. Formaat en codec moeten overeenkomen met de geaccepteerde lijst van de API.prompt(optioneel): beschrijft hoe de voortzetting moet evolueren, niet opnieuw beginnen.resolution: moet overeenkomen met de bronclip om opschaal-artefacten te voorkomen.duration: totale lengte van de uitvoer, niet alleen het toegevoegde gedeelte.
Wanneer te gebruiken
- Een generatie van 3 seconden is geweldig, maar je hebt 6 nodig.
- Je wilt een hero shot uitbreiden naar een langere advertentiecut.
- De eerste clip heeft goede beweging die je wilt behouden.
Uitgewerkte prompt
first_clip: 3-seconden clip van een skateboarder die langs de camera rolt, vastgelegd op 720P.prompt: "Skater gaat verder langs de camera. Camera volgt. Achtergrond verschuift van steeg naar gloed van straatverlichting. Geen cuts." Resolutie 720P, duur 6s, verhouding 16:9.
Faalmodi
- Bewegingsreset. Het model kan het onderwerp bevriezen als de prompt de bronbeweging tegenspreekt. Stem de prompt af op de bestaande richting van de clip.
- Resolutie-opschaal-artefacten. Het invoeren van een 720P bron in een 1080P uitvoer produceert zachte of vervormde frames. Stem de uitvoerresolutie af op de bron.
- Clip te kort. Een bron van 1 seconde geeft het model bijna geen beweging om voort te zetten. Gebruik minstens 2 seconden.
[UNIEK INZICHT] Videovoortzetting is de meest onderbenutte I2V-submodus. Hiermee kun je een render "redden" die 2 seconden te vroeg stopte, wat we hebben ontdekt bij ongeveer een derde van alle productie-iteraties. In plaats van helemaal opnieuw te genereren, voeg je toe.
Hoe werkt de Audio-gestuurde modus?
Audio-gestuurde I2V neemt een stilstaand beeld plus een driving_audio track en produceert een video waarin het onderwerp synchroon beweegt met de audio. Volgens de Wan 2.7 image-to-video guide is dit het pad voor talking-head en avatar content. Het model gebruikt de audiogolfvorm om lipbeweging en algehele energie aan te sturen.
Invoer
first_frame(vereist): een portret- of karakterafbeelding. Frontaal, goed belicht, neutrale uitdrukking werkt het beste.driving_audio(vereist): een schone audiotrack. WAV of MP3. Audiokwaliteit van studiokwaliteit presteert beter dan telefoonopnames.prompt(optioneel): beschrijft omgevingsbeweging, hoofdbeweging, expressie-energie.duration: komt meestal overeen met de audiolengte, tot 15 seconden.
Wanneer te gebruiken
- Talking-head uitlegvideo's vanuit een enkel portret.
- Avatar content voor social media.
- Voiceover-gestuurde productdemo's waarbij een gezicht vertelt.
Uitgewerkte prompt
first_frame: frontaal portret van een geïllustreerde avatar, neutrale uitdrukking, effen achtergrond.driving_audio: 8-seconden WAV van een voiceover-begroeting.prompt: "Subtiele hoofdbeweging, knipperen elke 3 seconden, glimlach bouwt op aan het einde van de zin." Resolutie 1080P, duur 8s, verhouding 16:9.
Faalmodi
- Lipdrift bij niet-frontale gezichten. Als het portret in profiel is, verslechtert de lipsynchronisatie. Gebruik frontaal.
- Ruisende audio. Achtergrondruis of muziek leidt tot bewegingsartefacten. Reinig de audio eerst.
- Lange duren zonder adem. 15 seconden ononderbroken spraak zonder pauzes zorgt ervoor dat het model ongemakkelijke mondvormen genereert. Voeg pauzes toe.
Voor diepere patronen over het koppelen van audio met video, bevat de PixMind audio-sync prompts cluster sjablonen voor talking-head, voiceover en muziekgestuurde clips.
Hoe kies je de juiste I2V-modus?
De beslissing wordt bepaald door wat je voorhanden hebt. De Wan 2.7 T2V API reference en de I2V-referentie beschrijven samen de volledige invoermatrix, maar de meeste beslissingen komen neer op een eenvoudige tabel.
| Je hebt... | Gebruik deze I2V-modus | Waarom |
|---|---|---|
| Eén foto | First-frame-naar-video | Eenvoudigste pad. Model verzint de beweging. |
| Twee foto's die start en einde moeten zijn | First-en-last-frame-naar-video | Vergrendelt de eindtoestand. Vermindert afwijzingen. |
| Een korte clip die meer tijd nodig heeft | Videovoortzetting | Behoudt bestaande beweging. Lagere kosten dan opnieuw genereren. |
| Een portret plus een audiotrack | Audio-gestuurd | Lipsynchronisatie en energie volgen de audio. |
| Een portret plus een stem plus een referentievideo | Overweeg R2V in plaats daarvan | R2V behoudt de identiteit beter dan audio-gestuurde I2V. |
Een praktische heuristiek: hoe meer invoer je het model kunt geven, hoe minder het hoeft te verzinnen. Verzinsels zijn waar vervorming en drift verschijnen.

Als je helemaal opnieuw begint en nog geen invoer hebt, voer dan eerst een T2V-pass uit om de opname vast te leggen, en gebruik vervolgens het beste frame als een first_frame in I2V. Deze tweestaps workflow is beter dan proberen de perfecte I2V-render in één keer te krijgen.
Wat zijn de veelvoorkomende I2V-faalmodi?
I2V faalt op voorspelbare manieren. Ze benoemen helpt je sneller te itereren.
- Vervorming van reflecterende oppervlakken. Glas, spiegels, gepolijst metaal vervagen tijdens interpolatie. Beperk dit door beweging te verminderen of het oppervlak in de bronafbeelding te vereenvoudigen.
- Identiteitsdrift over frames. Gezichten verschuiven, vooral na 5 seconden. Beperk dit met first-last-frame voor korte, vergrendelde opnamen, of R2V voor langere identiteitsbehoud.
- Beeldverhouding mismatch. Het invoeren van een 9:16 afbeelding in een 16:9 generatie snijdt het onderwerp bij. Stem de invoer- en uitvoerbeeldverhouding af.
- Prompt-afbeelding tegenstrijdigheid. Vragen om een "brede pan" bij een strakke close-up dwingt het model om groothoekcontext te verzinnen die het niet kan zien. Stem de prompt af op de beeldkadering.
- Audiogeluidslekkage in beweging. Audio van telefoonkwaliteit creëert spookbeweging op het gezicht. Reinig de audio eerst.
- Creditverbruik bij lange iteraties. Renders van 10 seconden op 1080P verbruiken veel credits. Itereer op 2 tot 3 seconden en 720P, en schaal vervolgens op.
In een batch van 40 I2V-renders voor een advertentiecampagne waren de storingen grofweg als volgt verdeeld: 40 procent prompt-afbeelding tegenstrijdigheid, 25 procent beeldverhouding mismatch, 20 procent reflecterende vervorming, 15 procent overig. Beeldverhouding mismatch is het goedkoopst te verhelpen: het is een enkele parametercontrole, en toch veroorzaakte het een kwart van de verspilde credits.
Voor diepere faalmoduspatronen over verschillende gebruiksscenario's, bevat de PixMind Wan 2.7 use cases cluster per-scenario notities voor product-, karakter- en sociale video.
Wan 2.7 I2V Modi FAQ
Wat is het verschil tussen I2V en R2V in Wan 2.7?
I2V (image-to-video) gebruikt stilstaande beelden of korte clips als invoer. R2V (reference-to-video) gebruikt tot vijf referentieafbeeldingen, vijf referentieclips en één referentie-audiotrack, en gebruikt deze om identiteit, stem en stijl te behouden. R2V is beter voor consistentie over meerdere opnamen. I2V is sneller voor werk met één opname.
Kan de Wan 2.7 first-last-frame modus camerabewegingen aan?
Dat kan, maar de twee keyframes moeten een consistente camerahoek impliceren. Als first_frame en last_frame verschillende hoeken impliceren, verzint het model een overgang die vaak op een jump cut lijkt. Houd camerawijzigingen subtiel, onder de 15 graden.
Hoe lang kan een Wan 2.7 videovoortzetting een clip verlengen?
Videovoortzetting kan een bronclip verlengen tot het harde plafond van 15 seconden in de I2V-modus. De bronclip plus de gegenereerde voortzetting mogen in totaal niet langer zijn dan 15 seconden. Voor langere video's, koppel meerdere voortzettingsaanroepen aan elkaar.
Vereist de Wan 2.7 audio-gestuurde modus een gezicht in de afbeelding?
Het werkt het beste met een gezicht, maar het is niet vereist. Zonder gezicht stuurt de audio de algehele bewegingsenergie aan in plaats van lipsynchronisatie. Landschaps- of productopnamen met de audio-gestuurde modus produceren abstracte beweging die de amplitude van de audio volgt.
Is Wan 2.7 I2V gratis te proberen?
Ja. De PixMind Wan 2.7 pagina bevat een gratis proefversie zonder creditcard. Betaalde abonnementen worden pas actief als je het proefquotum overschrijdt.
Bekijk het in actie
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



