🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 Video Generator: Komplet guide til tekst, billede og referencevideo

Indholdsfortegnelse

Wan 2.7 Video Generator: Den Komplette Guide til Tekst-, Billede- og Referencetilstande

Vigtigste Pointer

  • Wan 2.7 er én samlet model, der dækker tekst-til-video (T2V), billede-til-video (I2V) og reference-til-video (R2V) i en enkelt arbejdsgang.
  • Den understøtter 720P og 1080P output, 2 til 15 sekunders varighed og fem billedformater, herunder 16:9, 9:16 og 1:1.
  • Første-sidste-frame og lyddrevne tilstande giver dig kontrol over start- og sluttilstand, som enkeltbillede I2V-modeller ikke kan matche.
  • Reference-til-video (R2V) accepterer op til fem referencebilleder, fem referenceklip og et reference-lydspor i ét kald.
  • Prøv Wan 2.7 video generatoren for at følge med i ethvert eksempel i denne guide.

Hvad er Wan 2.7 Video Generatoren?

Wan 2.7 er den seneste videogenereringsmodel fra Alibabas Wan-team, eksponeret gennem Alibaba Cloud Model Studio. Den forener fire tidligere separate funktioner i én modelfamilie: tekst-til-video, billede-til-video, reference-til-video og videoredigering. Ifølge Alibaba Cloud video generation overview accepterer modellen multimodal input og outputter MP4 eller MOV i op til 1080P.

Nøgleskiftet i 2.7 er arbejdsgangsforening. I stedet for at skifte mellem leverandører for tekst-til-video og billede-til-video, kalder du den samme model og lader API'en rute baseret på de inputs, du sender. Dette matcher PixMind Wan 2.7 produktsiden, hvor én oprettelsesflade håndterer alle tilstande.

For skabere er dette vigtigt, fordi tilstandsskift er der, hvor det meste af produktionstiden går tabt. Du skriver en prompt, renderer, indser at starttilstanden er forkert, og genopbygger derefter fra bunden i et andet værktøj. Wan 2.7's samlede overflade lader dig udskifte inputs uden at udskifte modeller.

Hvor mange tilstande understøtter Wan 2.7?

Wan 2.7 eksponerer fire tilstande. I2V API-referencen dokumenterer den fulde inputmatrix. Her er den praktiske oversigt.

Tilstand Input Bedst til Maks. varighed Maks. opløsning
T2V (Tekst-til-Video) Tekstprompt, valgfri lyd Storyboarding, abstrakt bevægelse, B-roll 15s 1080P
I2V (Billede-til-Video) Første frame, valgfri sidste frame, valgfri lyd Produktlanceringer, karakterhandling, animation 15s 1080P
R2V (Reference-til-Video) Op til 5 referencebilleder + 5 referenceklip + reference-lyd Identitetsbevaring, stemmekloning, scener med flere karakterer 10s 1080P
Videoredigering Kildevideo + instruktion Stiloverførsel, instruktionsbaserede redigeringer 10s 1080P

Diagram: Fire-kvadrant gitter, der viser Tekst-til-Video, Billede-til-Video, Første-Sidste-Frame og Reference-Video tilstande forbundet til et centralt knudepunkt.

Tekst-til-Video (T2V)

T2V tager en tekstprompt og outputter en video. Wan 2.7 T2V API-referencen lister understøttede parametre, herunder opløsning, varighed, billedformat og et valgfrit lydspor. T2V er den hurtigste vej fra idé til klip.

Brug T2V, når du ikke har en fast startframe. Abstrakt bevægelse, B-roll, storyboards og stiliserede sekvenser passer alle. Undgå T2V, når starttilstanden er vigtig: hvis du har brug for et specifikt produkt på skærmen ved frame nul, skift til I2V.

Billede-til-Video (I2V)

I2V er der, hvor Wan 2.7's arbejdsgangsforening viser sig. Wan 2.7 billede-til-video brugerguiden dokumenterer fire undertilstande:

  1. Første-frame-til-video: ét billede bliver starttilstanden, modellen opfinder bevægelsen.
  2. Første-og-sidste-frame-til-video: to billeder definerer start- og sluttilstande, modellen interpolerer.
  3. Videofortsættelse: et kort klip bliver starttilstanden, modellen udvider det.
  4. Lyddrevet: et billede plus et lydspor driver læbesynkronisering eller bevægelse.

For en dybere gennemgang af de fire I2V-stier, se PixMind første-sidste-frame prompts klyngen.

Reference-til-Video (R2V)

R2V er den mest kraftfulde og mest underdokumenterede tilstand. Wan 2.7 R2V API-referencen beskriver et kald, der accepterer op til fem referencebilleder, fem referenceklip og et reference-lydspor. Modellen bruger disse til at bevare identitet, stemme og stil på tværs af outputtet.

R2V er det, du skal bruge, når du har brug for, at en karakter ser ens ud på tværs af optagelser, eller når du vil klone en stemme ind i en ny scene. Kompromiset er varighed: R2V topper ved 10 sekunder, kortere end T2V og I2V's loft på 15 sekunder.

Videoredigering

Videoredigering tager en kildevideo plus en tekstinstruktion og returnerer et redigeret klip. Wan 2.7 videoredigerings-API'en understøtter instruktionsbaserede redigeringer og stiloverførsel. Denne tilstand er uden for omfanget af en genereringsguide, men det er værd at vide, at den eksisterer.

Hvordan fungerer Første-Sidste-Frame tilstanden?

Første-sidste-frame er en undertilstand af I2V. Du leverer to billeder: et til den første frame, et til den sidste. Wan 2.7 genererer de mellemliggende frames.

Diagram: Tidslinje, der viser to keyframes med tre interpolerede frames imellem, med Wan 2.7 logo-konceptet, der markerer de mellemliggende frames.

Dette er vigtigt, fordi enkeltbillede I2V overlader sluttilstanden til modellen. Hvis dit skud skal lande på en specifik frame (et produkt fuldt roteret, en kasse helt åben, en karakter fuldt vendt), er første-sidste-frame den måde, du garanterer denne landing på.

Det praktiske mønster er: optag eller generer to keyframes, upload dem som første og sidste, indstil varighed, render. Wan 2.7 interpolerer bevægelsen mellem dem. PixMind første-sidste-frame prompts siden har prompt-skabeloner til produktlanceringer, overgange og storytelling-mønstre.

Almindelige fejltilstande at være opmærksom på:

  • Forvrængning på reflekterende overflader: glas, metal og vand kan udtværes under interpolation.
  • Identitetsdrift på karakterer: ansigter kan skifte mellem frames.
  • Kamerainkonsistens: hvis de to keyframes antyder forskellige kameravinkler, skal modellen opfinde en overgang.

Test med korte varigheder først (2-3 sekunder), før du forpligter dig til 5-10 sekunders renders.

Hvordan fungerer lyddrevet video?

Lyddrevet tilstand tager et stillbillede plus et lydspor og producerer en video, hvor motivet ser ud til at tale eller bevæge sig synkront med lyden. Dette er grundlaget for talking-head og avatar-indhold.

Modellen bruger lydbølgeformen til at drive to ting: læbebevægelse (hvis et ansigt er til stede) og den overordnede bevægelsesenergi. Wan 2.7 I2V API'en accepterer lyden som en del af mediearrayet ved hjælp af driving_audio typen.

For talking-head brugsscenarier, par dette med PixMind karakterpræstationsklyngen. Kombinationen af lyddrevet I2V plus et rent referenceportræt er den nuværende bedste åbne vej til en læbesynkroniseret avatar uden at træne en brugerdefineret model.

To praktiske bemærkninger:

  • Lydkvalitet driver videokvalitet. En ren studieoptagelse overgår en telefonmikrofon.
  • Test først med et 3-sekunders klip. Synkroniseringsproblemer er lettere at opdage tidligt.

Hvilken opløsning, varighed og billedformat skal du vælge?

Wan 2.7 understøtter 720P og 1080P output. Kompromiset er omkostninger versus skarphed. Ifølge PixMind prisstrategien forbruger 1080P cirka dobbelt så mange credits som 720P per sekund.

Indstilling Hvornår skal man vælge Kompromis
720P Social-først indhold, vertikal video, testiterationer Lavere omkostninger, synlig blødhed på store skærme
1080P Produktpræsentationer, filmisk previs, reklamekreativ Højere omkostninger, skarpere detaljer
16:9 YouTube, website-indlejringer Standard widescreen
9:16 Reels, TikTok, Shorts Mobil vertikal
1:1 Feed-opslag, firkantede indlejringer Platformsuafhængig neutral
4:3 / 3:4 Redaktionel, vintage stil Niche

Varighed driver omkostninger lineært. En 10-sekunders render koster cirka 5 gange en 2-sekunders render ved samme opløsning. Til iteration, arbejd kort. Til final, gå langt.

En rimelig standard for nye brugere: 720P, 5 sekunder, 16:9. Bekræft, at optagelsen fungerer, og opgrader derefter til 1080P til den endelige version.

Hvordan vælger du den rigtige Wan 2.7 tilstand?

Beslutningstræet er ligetil, når du ved, hvilke inputs du har.

Arbejdsgangsdiagram, der viser 5 trin: Input, Tilstandsdetektion, Modelrouting, Generering, Output.

  • Du har kun en idé: brug T2V. Gentag prompten, før du tilføjer visuelle elementer.
  • Du har ét produktfoto: brug I2V første-frame tilstand.
  • Du har to keyframes, der skal være start og slut: brug I2V første-sidste-frame.
  • Du har et kort klip, der skal udvides: brug I2V videofortsættelse.
  • Du har et portræt plus en voiceover: brug I2V lyddrevet.
  • Du har brug for identitets- eller stemmebevaring på tværs af optagelser: brug R2V.
  • Du har eksisterende optagelser, der skal redigeres eller have en stilændring: brug videoredigering.

Hvis du er usikker, start ved PixMind Wan familiehubben og vælg efter brugsscenarie snarere end efter tilstandsnavn. Hubben dirigerer dig til den rigtige overflade baseret på, hvad du forsøger at lave.

Hvordan skal du prompte Wan 2.7?

Prompt-struktur betyder mere end prompt-længde. Wan 2.7 belønner en fem-segment anatomi: motiv, handling, omgivelser, kamera, stil.

En eksempelstruktur:

Motiv: en glasparfumeflaske på en mørk overflade. Handling: en spray af dråber bryder ud til højre. Omgivelser: sort studiebaggrund, enkelt hovedlys fra kamera-venstre. Kamera: statisk medium skud, 50mm ækvivalent. Stil: filmisk, lav dybdeskarphed, varmt kantlys.

Hvert segment indsnævrer outputrummet. Manglende segmenter falder tilbage på modellens forudgående, som normalt er generisk.

For dybere promptmønstre dækker PixMind multi-shot prompts klyngen 12 genanvendelige strukturer, herunder multi-shot sekvenser, lydsynkroniseringsmønstre og første-sidste-frame storyboards.

To prompt-faldgruber at undgå:

  • Overbelastede prompts: mere end fem motiver i én prompt forvirrer modellen. Opdel i flere renders.
  • Overforbrug af negative prompts: Wan 2.7 vægter ikke negative prompts på samme måde som billedmodeller gør. Hold dem korte.

Hvordan sammenligner Wan 2.7 sig med andre modeller?

Wan 2.7 befinder sig i et overfyldt felt. Sora 2, VEO 3, Kling 2.0 og Seedance retter sig alle mod overlappende brugsscenarier. Differentieringen ligger i, hvilke tilstande hver model eksponerer, og til hvilken pris.

Funktion Wan 2.7 Sora 2 VEO 3 Kling 2.0
Tekst-til-Video Ja Ja Ja Ja
Billede-til-Video Ja Begrænset Ja Ja
Første-Sidste-Frame Ja Nej Begrænset Begrænset
Reference-Video (R2V) Ja Nej Nej Begrænset
Lyddrevet I2V Ja Ja Ja Begrænset
Maks. varighed 15s 20s 8s 10s
Maks. opløsning 1080P 1080P 1080P 1080P

Denne tabel afspejler leverandørudgivne specifikationer pr. juli 2026. Uafhængig head-to-head test findes i vores Wan 2.7 versus Sora 2 prompt test og VEO og Kling opgøret.

Wan 2.7's særprægede fordel er første-sidste-frame kombineret med R2V. Ingen anden model i tabellen eksponerer begge med fuld kapacitet. Hvis din arbejdsgang kræver præcis start- og slutkontrol plus identitetsbevaring, er Wan 2.7 i øjeblikket den eneste enkeltmodelsti.

Hvad er de almindelige fejltilstande?

Hver AI-videomodel fejler. At navngive fejltilstandene hjælper dig med at levere hurtigere.

  • Forvrængning på reflekterende overflader: glas, spejle, poleret metal. Afhjælp ved at reducere bevægelsesamplitude i prompten.
  • Identitetsdrift på tværs af optagelser: ansigter skifter mellem generationer. Afhjælp med R2V referenceinputs.
  • Hallucineret tekst i frames: skilte, etiketter, logoer gengives som volapyk. Afhjælp ved at fjerne tekst fra inputbilleder.
  • Billedformatuoverensstemmelse: at føre et 9:16 billede ind i en 16:9 generering beskærer uventet. Match inputbilledformat til outputbilledformat.
  • Kreditforbrug ved lange iterationer: 10-sekunders testrenders forbruger credits hurtigt. Iterer ved 2-3 sekunder.

PixMind brugsscenarier klyngen har fejltilstandsnoter pr. scenarie for produktmarkedsføring, karakterpræstation, filmisk previs og sociale hooks.

Wan 2.7 Video Generator Ofte Stillede Spørgsmål

Er Wan 2.7 gratis at prøve?

Ja. PixMind Wan 2.7 siden inkluderer en gratis prøveperiode uden kreditkort. Betalte planer træder først i kraft, når du overskrider prøvekvoten.

Understøtter Wan 2.7 4K?

Nej. Wan 2.7 video topper ved 1080P. Wan 2.7 billedmodellen understøtter 4K stillbilleder via Pro-niveauet, men videooutput er begrænset til 1080P.

Kan Wan 2.7 klone en specifik persons ansigt?

Wan 2.7 kan bevare identitet fra referenceinputs, men PixMind's politik forbyder ikke-konsensuel kloning af virkelige, identificerbare personers lighed. Brug R2V med originale karakterer, stock-referencer eller din egen lighed.

Hvor lang tid tager en Wan 2.7 render?

Genereringstid afhænger af varighed, opløsning og belastning. Typiske 5-sekunders 720P renders afsluttes på 60-90 sekunder. 10-sekunders 1080P renders kan tage 3-5 minutter. API'en returnerer et opgave-ID, du kan afstemme for status.

Genererer Wan 2.7 lyd?

Ja, men kun i tilstande, der accepterer lydinput. T2V kan tage et lydspor og bevægelsessynkronisere til det. I2V lyddrevet tilstand bruger lyd til at drive læbe- og bevægelsessynkronisering. Ren lydgenerering (musik, lydeffekter) er en separat Alibaba-model.

Kan jeg bruge Wan 2.7 outputs kommercielt?

Ja. Outputs, du genererer, er dine til kommerciel brug under Alibaba Cloud Model Studio vilkårene. Gennemgå de nuværende vilkår på Alibaba Cloud Model Studio oversigten, før du sender.

Se det i aktion

继续浏览中,生成器即将加载...