Wan 2.7 Video Generator: De complete gids voor tekst-, afbeelding- en referentiemodi
Belangrijkste punten
- Wan 2.7 is één uniform model dat tekst-naar-video (T2V), afbeelding-naar-video (I2V) en referentie-naar-video (R2V) in één workflow omvat.
- Het ondersteunt 720P en 1080P uitvoer, een duur van 2 tot 15 seconden, en vijf beeldverhoudingen, waaronder 16:9, 9:16 en 1:1.
- Eerste-laatste-frame en audiogestuurde modi bieden start- en eindstatuscontrole die modellen voor I2V met één afbeelding niet kunnen evenaren.
- Referentie-naar-video (R2V) accepteert tot vijf referentieafbeeldingen, vijf referentieclips en een referentie-audiotrack in één oproep.
- Probeer de Wan 2.7 video generator om mee te doen met elk voorbeeld in deze gids.
Wat is de Wan 2.7 Video Generator?
Wan 2.7 is het nieuwste videogeneratiemodel van Alibaba's Wan-team, beschikbaar via Alibaba Cloud Model Studio. Het verenigt vier voorheen afzonderlijke mogelijkheden in één modelfamilie: tekst-naar-video, afbeelding-naar-video, referentie-naar-video en videobewerking. Volgens het Alibaba Cloud overzicht van videogeneratie accepteert het model multimodale invoer en voert het MP4 of MOV uit met maximaal 1080P.
De belangrijkste verschuiving in 2.7 is de workflow-eenwording. In plaats van te wisselen tussen leveranciers voor tekst-naar-video en afbeelding-naar-video, roep je hetzelfde model aan en laat je de API routeren op basis van de invoer die je doorgeeft. Dit komt overeen met de PixMind Wan 2.7 productpagina, waar één creatie-interface elke modus afhandelt.
Voor makers is dit belangrijk, omdat de meeste productietijd verloren gaat bij het wisselen van modus. Je schrijft een prompt, rendert, realiseert je dat de startstatus verkeerd is en bouwt vervolgens helemaal opnieuw op in een ander hulpmiddel. Het uniforme oppervlak van Wan 2.7 stelt je in staat om invoer te wisselen zonder van model te wisselen.
Hoeveel modi ondersteunt Wan 2.7?
Wan 2.7 biedt vier modi. De I2V API-referentie documenteert de volledige invoermatrix. Hier is de praktische uitsplitsing.
| Modus | Invoer | Beste voor | Max. duur | Max. resolutie |
|---|---|---|---|---|
| T2V (Tekst-naar-video) | Tekstprompt, optionele audio | Storyboarding, abstracte beweging, B-roll | 15s | 1080P |
| I2V (Afbeelding-naar-video) | Eerste frame, optioneel laatste frame, optionele audio | Productonthullingen, karakteractie, animatie | 15s | 1080P |
| R2V (Referentie-naar-video) | Tot 5 referentieafbeeldingen + 5 referentieclips + referentieaudio | Identiteitsbehoud, stemklonen, scènes met meerdere personages | 10s | 1080P |
| Videobewerking | Bronvideo + instructie | Stijltransfer, instructiegebaseerde bewerkingen | 10s | 1080P |

Tekst-naar-video (T2V)
T2V neemt een tekstprompt en voert een video uit. De Wan 2.7 T2V API-referentie vermeldt ondersteunde parameters, waaronder resolutie, duur, verhouding en een optionele audiotrack. T2V is de snelste weg van idee naar clip.
Gebruik T2V wanneer je geen vast startframe hebt. Abstracte beweging, B-roll, storyboards en gestileerde sequenties passen allemaal. Vermijd T2V wanneer de startstatus belangrijk is: als je een specifiek product op het scherm nodig hebt bij frame nul, schakel dan over naar I2V.
Afbeelding-naar-video (I2V)
I2V is waar de workflow-eenwording van Wan 2.7 tot uiting komt. De Wan 2.7 afbeelding-naar-video gebruikershandleiding documenteert vier submodi:
- Eerste-frame-naar-video: één afbeelding wordt de startstatus, het model bedenkt de beweging.
- Eerste-en-laatste-frame-naar-video: twee afbeeldingen definiëren start- en eindstatussen, het model interpoleert.
- Videocontinuïteit: een korte clip wordt de startstatus, het model verlengt deze.
- Audiogestuurd: een afbeelding plus een audiotrack stuurt lipsynchronisatie of beweging aan.
Voor een diepere uitleg van de vier I2V-paden, zie het PixMind eerste-laatste-frame prompts cluster.
Referentie-naar-video (R2V)
R2V is de krachtigste en meest ondergedocumenteerde modus. De Wan 2.7 R2V API-referentie beschrijft een oproep die tot vijf referentieafbeeldingen, vijf referentieclips en één referentie-audiotrack accepteert. Het model gebruikt deze om identiteit, stem en stijl te behouden over de uitvoer.
R2V is wat je moet gebruiken wanneer je wilt dat een personage er hetzelfde uitziet in verschillende shots, of wanneer je een stem wilt klonen in een nieuwe scène. De afweging is de duur: R2V is beperkt tot 10 seconden, korter dan het maximum van 15 seconden van T2V en I2V.
Videobewerking
Videobewerking neemt een bronvideo plus een tekstinstructie en retourneert een bewerkte clip. De Wan 2.7 videobewerkings-API ondersteunt instructiegebaseerde bewerkingen en stijltransfer. Deze modus valt buiten het bereik van een generatiegids, maar het is de moeite waard om te weten dat deze bestaat.
Hoe werkt de Eerste-Laatste-Frame modus?
Eerste-laatste-frame is een submodus van I2V. Je levert twee afbeeldingen: één voor het eerste frame, één voor het laatste. Wan 2.7 genereert de tussenliggende frames.

Dit is belangrijk omdat I2V met één afbeelding de eindstatus aan het model overlaat. Als je shot op een specifiek frame moet landen (een product volledig gedraaid, een doos volledig open, een personage volledig omgedraaid), is eerste-laatste-frame de manier om die landing te garanderen.
Het praktische patroon is: maak of genereer twee keyframes, upload ze als eerste en laatste, stel de duur in, render. Wan 2.7 interpoleert de beweging ertussen. De PixMind eerste-laatste-frame prompts pagina heeft prompt-sjablonen voor productonthullingen, overgangen en storytelling-patronen.
Veelvoorkomende faalmodi om op te letten:
- Vervorming op reflecterende oppervlakken: glas, metaal en water kunnen vervagen tijdens interpolatie.
- Identiteitsverschuiving bij personages: gezichten kunnen verschuiven tussen frames.
- Cameraconsistentie: als de twee keyframes verschillende camerahoeken impliceren, moet het model een overgang bedenken.
Test eerst met korte duren (2-3 seconden) voordat je je vastlegt op renders van 5-10 seconden.
Hoe werkt audiogestuurde video?
De audiogestuurde modus neemt een stilstaand beeld plus een audiotrack en produceert een video waarin het onderwerp lijkt te spreken of te bewegen in synchronisatie met de audio. Dit is de basis van talking-head en avatar content.
Het model gebruikt de audiogolfvorm om twee dingen aan te sturen: lipbeweging (indien een gezicht aanwezig is) en algehele bewegingsenergie. De Wan 2.7 I2V API accepteert de audio als onderdeel van de media-array, met behulp van het type driving_audio.
Voor talking-head use cases, combineer dit met het PixMind karakterprestatie cluster. De combinatie van audiogestuurde I2V plus een schoon referentieportret is de huidige beste open weg naar een lipsynchroniserende avatar zonder een aangepast model te trainen.
Twee praktische opmerkingen:
- Audiokwaliteit stuurt videokwaliteit aan. Een schone studio-opname presteert beter dan een telefoonmicrofoon.
- Test eerst met een clip van 3 seconden. Synchronisatieproblemen zijn gemakkelijker vroegtijdig op te sporen.
Welke resolutie, duur en beeldverhouding moet je kiezen?
Wan 2.7 ondersteunt 720P en 1080P uitvoer. De afweging is kosten versus scherpte. Volgens de PixMind prijsstrategie verbruikt 1080P ongeveer twee keer zoveel credits als 720P per seconde.
| Instelling | Wanneer te kiezen | Afweging |
|---|---|---|
| 720P | Social-first content, verticale video, testiteraties | Lagere kosten, zichtbare zachtheid op grote schermen |
| 1080P | Productpresentaties, cinematische previsualisatie, advertentiecreatie | Hogere kosten, scherper detail |
| 16:9 | YouTube, website-integraties | Standaard breedbeeld |
| 9:16 | Reels, TikTok, Shorts | Mobiel verticaal |
| 1:1 | Feedberichten, vierkante integraties | Cross-platform neutraal |
| 4:3 / 3:4 | Redactioneel, vintage stijl | Niche |
Duur stuurt de kosten lineair aan. Een render van 10 seconden kost ongeveer 5x een render van 2 seconden met dezelfde resolutie. Voor iteratie, werk kort. Voor het eindresultaat, ga lang.
Een redelijke standaard voor nieuwe gebruikers: 720P, 5 seconden, 16:9. Bevestig dat het shot werkt, en verhoog dan naar 1080P voor het eindresultaat.
Hoe kies je de juiste Wan 2.7 modus?
De beslissingsboom is eenvoudig zodra je weet welke invoer je hebt.

- Je hebt alleen een idee: gebruik T2V. Herhaal de prompt voordat je visuals toevoegt.
- Je hebt één productfoto: gebruik I2V eerste-frame modus.
- Je hebt twee keyframes die het begin en einde moeten zijn: gebruik I2V eerste-laatste-frame.
- Je hebt een korte clip die verlengd moet worden: gebruik I2V videocontinuïteit.
- Je hebt een portret plus een voice-over: gebruik I2V audiogestuurd.
- Je hebt identiteits- of stembehoud nodig over shots heen: gebruik R2V.
- Je hebt bestaand beeldmateriaal dat een bewerking of stijlverandering nodig heeft: gebruik videobewerking.
Als je het niet zeker weet, begin dan bij de PixMind Wan familiehub en kies op basis van de use case in plaats van de modusnaam. De hub leidt je naar de juiste interface op basis van wat je probeert te maken.
Hoe moet je Wan 2.7 prompten?
De promptstructuur is belangrijker dan de promptlengte. Wan 2.7 beloont een anatomie van vijf segmenten: onderwerp, actie, setting, camera, stijl.
Een voorbeeldstructuur:
Subject: a glass perfume bottle on a dark surface. Action: a spray of droplets erupts to the right. Setting: studio black backdrop, single key light from camera-left. Camera: static medium shot, 50mm equivalent. Style: cinematic, shallow depth of field, warm rim light.
Elk segment verkleint de uitvoerruimte. Ontbrekende segmenten vallen terug op de voorkennis van het model, wat meestal generiek is.
Voor diepere promptpatronen omvat het PixMind multi-shot prompts cluster 12 herbruikbare structuren, waaronder multi-shot sequenties, audio-sync patronen en eerste-laatste-frame storyboards.
Twee prompt valkuilen om te vermijden:
- Overladen prompts: meer dan vijf onderwerpen in één prompt verwarren het model. Splits op in meerdere renders.
- Overmatig gebruik van negatieve prompts: Wan 2.7 weegt negatieve prompts niet zoals afbeeldingsmodellen dat doen. Houd ze kort.
Hoe verhoudt Wan 2.7 zich tot andere modellen?
Wan 2.7 bevindt zich in een drukbezet veld. Sora 2, VEO 3, Kling 2.0 en Seedance richten zich allemaal op overlappende use cases. De differentiatie zit in welke modi elk model blootstelt en tegen welke kosten.
| Mogelijkheid | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Tekst-naar-video | Ja | Ja | Ja | Ja |
| Afbeelding-naar-video | Ja | Beperkt | Ja | Ja |
| Eerste-Laatste-Frame | Ja | Nee | Beperkt | Beperkt |
| Referentievideo (R2V) | Ja | Nee | Nee | Beperkt |
| Audiogestuurde I2V | Ja | Ja | Ja | Beperkt |
| Max. duur | 15s | 20s | 8s | 10s |
| Max. resolutie | 1080P | 1080P | 1080P | 1080P |
Deze tabel geeft de door de leverancier gepubliceerde specificaties weer per juli 2026. Onafhankelijke onderlinge tests zijn te vinden in onze Wan 2.7 versus Sora 2 prompt test en de VEO en Kling showdown.
Het onderscheidende voordeel van Wan 2.7 is eerste-laatste-frame gecombineerd met R2V. Geen enkel ander model in de tabel biedt beide met volledige functionaliteit. Als je workflow nauwkeurige start- en eindcontrole plus identiteitsbehoud vereist, is Wan 2.7 momenteel het enige pad met één model.
Wat zijn de veelvoorkomende faalmodi?
Elk AI-videomodel faalt. Het benoemen van de faalmodi helpt je sneller te leveren.
- Vervorming op reflecterende oppervlakken: glas, spiegels, gepolijst metaal. Beperk dit door de bewegingsamplitude in de prompt te verminderen.
- Identiteitsverschuiving over shots heen: gezichten verschuiven tussen generaties. Beperk dit met R2V referentie-invoer.
- Gehallucineerde tekst in frames: borden, labels, logo's worden als onzin weergegeven. Beperk dit door tekst uit invoerafbeeldingen te verwijderen.
- Mismatched beeldverhouding: het invoeren van een 9:16 afbeelding in een 16:9 generatie snijdt onverwacht bij. Stem de invoerbeeldverhouding af op de uitvoerbeeldverhouding.
- Creditverbruik bij lange iteraties: testrenders van 10 seconden verbruiken snel credits. Itereer op 2-3 seconden.
Het PixMind use cases cluster bevat per-scenario faalmodusnotities voor productmarketing, karakterprestaties, cinematische previsualisatie en sociale hooks.
Wan 2.7 Video Generator Veelgestelde Vragen
Is Wan 2.7 gratis te proberen?
Ja. De PixMind Wan 2.7 pagina bevat een gratis proefversie zonder creditcard. Betaalde abonnementen worden pas actief als je het proefquotum overschrijdt.
Ondersteunt Wan 2.7 4K?
Nee. Wan 2.7 video reikt tot maximaal 1080P. Het Wan 2.7 afbeeldingsmodel ondersteunt 4K stilstaande beelden via de Pro-tier, maar de video-uitvoer is beperkt tot 1080P.
Kan Wan 2.7 het gezicht van een specifiek persoon klonen?
Wan 2.7 kan identiteit behouden uit referentie-invoer, maar het beleid van PixMind verbiedt het klonen van niet-consensuele gelijkenissen van echte, identificeerbare personen. Gebruik R2V met originele personages, stockreferenties of je eigen gelijkenis.
Hoe lang duurt één Wan 2.7 render?
De generatietijd hangt af van de duur, resolutie en belasting. Typische renders van 5 seconden in 720P zijn klaar in 60-90 seconden. Renders van 10 seconden in 1080P kunnen 3-5 minuten duren. De API retourneert een taak-ID die je kunt peilen voor de status.
Genereert Wan 2.7 audio?
Ja, maar alleen in modi die audio-invoer accepteren. T2V kan een audiotrack nemen en deze bewegingssynchroniseren. I2V audiogestuurde modus gebruikt audio om lip- en bewegingssynchronisatie aan te sturen. Pure audiogeneratie (muziek, geluidseffecten) is een apart Alibaba-model.
Kan ik Wan 2.7 uitvoer commercieel gebruiken?
Ja. Uitvoer die je genereert, mag je commercieel gebruiken onder de voorwaarden van Alibaba Cloud Model Studio. Bekijk de huidige voorwaarden op het Alibaba Cloud Model Studio overzicht voordat je levert.
Bekijk het in actie
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



