🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Generatore video Wan 2.7: Guida completa a testo, immagine e video di riferimento

Indice

Generatore video Wan 2.7: La guida completa alle modalità testo, immagine e riferimento

Punti chiave

  • Wan 2.7 è un modello unificato che copre text-to-video (T2V), image-to-video (I2V) e reference-to-video (R2V) in un unico flusso di lavoro.
  • Supporta output 720P e 1080P, una durata da 2 a 15 secondi e cinque rapporti d'aspetto inclusi 16:9, 9:16 e 1:1.
  • Le modalità "first-last-frame" e "audio-driven" offrono un controllo dello stato iniziale e finale che i modelli I2V a immagine singola non possono eguagliare.
  • Reference-to-video (R2V) accetta fino a cinque immagini di riferimento, cinque clip di riferimento e una traccia audio di riferimento in una singola chiamata.
  • Prova il generatore video Wan 2.7 per seguire qualsiasi esempio in questa guida.

Cos'è il generatore video Wan 2.7?

Wan 2.7 è l'ultimo modello di generazione video del team Wan di Alibaba, esposto tramite Alibaba Cloud Model Studio. Unifica quattro capacità precedentemente separate in un'unica famiglia di modelli: text-to-video, image-to-video, reference-to-video e editing video. Secondo la panoramica sulla generazione video di Alibaba Cloud, il modello accetta input multimodali e produce MP4 o MOV fino a 1080P.

Il cambiamento chiave nella versione 2.7 è l'unificazione del flusso di lavoro. Invece di passare da un fornitore all'altro per text-to-video e image-to-video, si chiama lo stesso modello e si lascia che l'API instradi in base agli input che si passano. Questo corrisponde alla pagina del prodotto PixMind Wan 2.7, dove un'unica interfaccia di creazione gestisce ogni modalità.

Per i creatori, questo è importante perché il cambio di modalità è dove si perde la maggior parte del tempo di produzione. Si scrive un prompt, si renderizza, ci si rende conto che lo stato iniziale è sbagliato, e poi si ricostruisce da zero in uno strumento diverso. L'interfaccia unificata di Wan 2.7 consente di scambiare gli input senza cambiare modello.

Quante modalità supporta Wan 2.7?

Wan 2.7 espone quattro modalità. La documentazione API I2V documenta la matrice di input completa. Ecco la ripartizione pratica.

Modalità Input Ideale per Durata massima Risoluzione massima
T2V (Text-to-Video) Prompt testuale, audio opzionale Storyboarding, movimento astratto, B-roll 15s 1080P
I2V (Image-to-Video) Primo fotogramma, ultimo fotogramma opzionale, audio opzionale Rivelazioni di prodotti, azione di personaggi, animazione 15s 1080P
R2V (Reference-to-Video) Fino a 5 immagini di riferimento + 5 clip di riferimento + audio di riferimento Conservazione dell'identità, clonazione vocale, scene multi-personaggio 10s 1080P
Modifica video Video sorgente + istruzione Trasferimento di stile, modifiche basate su istruzioni 10s 1080P

Diagramma: Griglia a quattro quadranti che mostra le modalità Text-to-Video, Image-to-Video, First-Last-Frame e Reference-Video collegate a un hub centrale.

Text-to-Video (T2V)

T2V prende un prompt testuale e produce un video. La documentazione API T2V di Wan 2.7 elenca i parametri supportati, inclusi risoluzione, durata, rapporto e una traccia audio opzionale. T2V è il percorso più veloce dall'idea alla clip.

Usa T2V quando non hai un fotogramma iniziale fisso. Movimenti astratti, B-roll, storyboard e sequenze stilizzate si adattano tutti. Evita T2V quando lo stato iniziale è importante: se hai bisogno di un prodotto specifico sullo schermo al fotogramma zero, passa a I2V.

Image-to-Video (I2V)

I2V è dove si manifesta l'unificazione del flusso di lavoro di Wan 2.7. La guida utente image-to-video di Wan 2.7 documenta quattro sotto-modalità:

  1. First-frame-to-video: un'immagine diventa lo stato iniziale, il modello inventa il movimento.
  2. First-and-last-frame-to-video: due immagini definiscono gli stati iniziale e finale, il modello interpola.
  3. Continuazione video: una breve clip diventa lo stato iniziale, il modello la estende.
  4. Audio-driven: un'immagine più una traccia audio guida la sincronizzazione labiale o il movimento.

Per una panoramica più approfondita dei quattro percorsi I2V, consulta il cluster di prompt "first-last-frame" di PixMind.

Reference-to-Video (R2V)

R2V è la modalità più potente e meno documentata. La documentazione API R2V di Wan 2.7 descrive una chiamata che accetta fino a cinque immagini di riferimento, cinque clip di riferimento e una traccia audio di riferimento. Il modello le usa per preservare identità, voce e stile nell'output.

R2V è ciò che si usa quando un personaggio deve apparire lo stesso in diverse inquadrature, o quando si vuole clonare una voce in una nuova scena. Il compromesso è la durata: R2V si ferma a 10 secondi, più breve del limite di 15 secondi di T2V e I2V.

Editing video

L'editing video prende un video sorgente più un'istruzione testuale e restituisce una clip modificata. L'API di editing video di Wan 2.7 supporta modifiche basate su istruzioni e trasferimento di stile. Questa modalità è al di fuori dell'ambito di una guida alla generazione, ma è utile sapere che esiste.

Come funziona la modalità First-Last-Frame?

First-last-frame è una sotto-modalità di I2V. Si forniscono due immagini: una per il primo fotogramma, una per l'ultimo. Wan 2.7 genera i fotogrammi intermedi.

Diagramma: Timeline che mostra due fotogrammi chiave con tre fotogrammi interpolati tra di essi, con il concetto del logo Wan 2.7 che contrassegna i fotogrammi intermedi.

Questo è importante perché l'I2V a immagine singola lascia lo stato finale al modello. Se la tua ripresa deve atterrare su un fotogramma specifico (un prodotto completamente ruotato, una scatola completamente aperta, un personaggio completamente girato), il "first-last-frame" è il modo per garantire quell'atterraggio.

Il modello pratico è: scatta o genera due fotogrammi chiave, caricali come primo e ultimo, imposta la durata, renderizza. Wan 2.7 interpola il movimento tra di essi. La pagina dei prompt "first-last-frame" di PixMind contiene modelli di prompt per rivelazioni di prodotti, transizioni e schemi narrativi.

Modalità di fallimento comuni da tenere d'occhio:

  • Deformazione su superfici riflettenti: vetro, metallo e acqua possono sbavare durante l'interpolazione.
  • Deriva dell'identità sui personaggi: i volti possono cambiare tra i fotogrammi.
  • Incoerenza della telecamera: se i due fotogrammi chiave implicano angolazioni diverse della telecamera, il modello deve inventare una transizione.

Testa prima con durate brevi (2-3 secondi) prima di impegnarti in render da 5-10 secondi.

Come funziona il video Audio-Driven?

La modalità audio-driven prende un'immagine fissa più una traccia audio e produce un video in cui il soggetto sembra parlare o muoversi in sincronia con l'audio. Questa è la base dei contenuti con "talking-head" e avatar.

Il modello utilizza la forma d'onda audio per guidare due cose: il movimento delle labbra (se è presente un volto) e l'energia complessiva del movimento. L'API I2V di Wan 2.7 accetta l'audio come parte dell'array multimediale, utilizzando il tipo driving_audio.

Per i casi d'uso di "talking-head", abbina questo al cluster di performance dei personaggi di PixMind. La combinazione di I2V audio-driven più un ritratto di riferimento pulito è il miglior percorso aperto attuale per un avatar con sincronizzazione labiale senza addestrare un modello personalizzato.

Due note pratiche:

  • La qualità dell'audio determina la qualità del video. Una registrazione in studio pulita supera un microfono del telefono.
  • Testa prima con una clip di 3 secondi. I problemi di sincronizzazione sono più facili da individuare in anticipo.

Quale risoluzione, durata e rapporto d'aspetto dovresti scegliere?

Wan 2.7 supporta output 720P e 1080P. Il compromesso è costo contro nitidezza. Secondo la strategia di prezzo di PixMind, 1080P consuma circa il doppio dei crediti di 720P al secondo.

Impostazione Quando scegliere Compromesso
720P Contenuti "social-first", video verticale, iterazioni di test Costo inferiore, morbidezza visibile su schermi grandi
1080P Presentazioni di prodotti, previs cinematici, creatività pubblicitaria Costo più elevato, dettagli più nitidi
16:9 YouTube, incorporamenti di siti web Widescreen standard
9:16 Reels, TikTok, Shorts Verticale mobile
1:1 Post di feed, incorporamenti quadrati Neutrale tra piattaforme
4:3 / 3:4 Editoriale, stile vintage Di nicchia

La durata incide linearmente sul costo. Un render di 10 secondi costa circa 5 volte un render di 2 secondi alla stessa risoluzione. Per l'iterazione, lavora su durate brevi. Per il finale, vai su durate lunghe.

Un'impostazione predefinita ragionevole per i nuovi utenti: 720P, 5 secondi, 16:9. Conferma che l'inquadratura funzioni, quindi passa a 1080P per il finale.

Come scegliere la modalità Wan 2.7 giusta?

L'albero decisionale è semplice una volta che sai quali input hai.

Diagramma del flusso di lavoro che mostra 5 fasi: Input, Rilevamento modalità, Routing modello, Generazione, Output.

  • Hai solo un'idea: usa T2V. Iterare sul prompt prima di aggiungere elementi visivi.
  • Hai una foto di un prodotto: usa la modalità I2V "first-frame".
  • Hai due fotogrammi chiave che devono essere l'inizio e la fine: usa I2V "first-last-frame".
  • Hai una breve clip che deve essere estesa: usa I2V "video continuation".
  • Hai un ritratto più una voce fuori campo: usa I2V "audio-driven".
  • Hai bisogno di preservare l'identità o la voce tra le inquadrature: usa R2V.
  • Hai filmati esistenti che necessitano di una modifica o di un cambio di stile: usa l'editing video.

Se non sei sicuro, inizia dall'hub della famiglia PixMind Wan e scegli in base al caso d'uso piuttosto che al nome della modalità. L'hub ti indirizza alla superficie giusta in base a ciò che stai cercando di creare.

Come dovresti fare il prompt a Wan 2.7?

La struttura del prompt è più importante della sua lunghezza. Wan 2.7 premia un'anatomia a cinque segmenti: soggetto, azione, ambientazione, telecamera, stile.

Una struttura di esempio:

Soggetto: una bottiglia di profumo di vetro su una superficie scura. Azione: uno spruzzo di goccioline erutta a destra. Ambientazione: sfondo nero da studio, singola luce chiave da sinistra della telecamera. Telecamera: inquadratura media statica, equivalente a 50mm. Stile: cinematografico, profondità di campo ridotta, luce di contorno calda.

Ogni segmento restringe lo spazio di output. I segmenti mancanti utilizzano il valore predefinito del modello, che di solito è generico.

Per modelli di prompt più approfonditi, il cluster di prompt multi-shot di PixMind copre 12 strutture riutilizzabili, incluse sequenze multi-shot, modelli di sincronizzazione audio e storyboard "first-last-frame".

Due insidie dei prompt da evitare:

  • Prompt sovraccarichi: più di cinque soggetti in un unico prompt confondono il modello. Dividi in più render.
  • Uso eccessivo di prompt negativi: Wan 2.7 non pondera i prompt negativi come fanno i modelli di immagine. Mantienili brevi.

Come si confronta Wan 2.7 con altri modelli?

Wan 2.7 si trova in un campo affollato. Sora 2, VEO 3, Kling 2.0 e Seedance mirano tutti a casi d'uso sovrapposti. La differenziazione sta nelle modalità che ogni modello espone e a quale costo.

Capacità Wan 2.7 Sora 2 VEO 3 Kling 2.0
Text-to-Video
Image-to-Video Limitato
First-Last-Frame No Limitato Limitato
Reference-Video (R2V) No No Limitato
Audio-Driven I2V Limitato
Durata massima 15s 20s 8s 10s
Risoluzione massima 1080P 1080P 1080P 1080P

Questa tabella riflette le specifiche pubblicate dai fornitori a luglio 2026. I test comparativi indipendenti si trovano nel nostro test dei prompt Wan 2.7 contro Sora 2 e nello scontro VEO e Kling.

Il vantaggio distintivo di Wan 2.7 è il "first-last-frame" combinato con R2V. Nessun altro modello nella tabella espone entrambi con piena capacità. Se il tuo flusso di lavoro richiede un controllo preciso di inizio e fine più la preservazione dell'identità, Wan 2.7 è attualmente l'unico percorso a modello singolo.

Quali sono le modalità di fallimento comuni?

Ogni modello video AI fallisce. Nominare le modalità di fallimento ti aiuta a spedire più velocemente.

  • Deformazione su superfici riflettenti: vetro, specchi, metallo lucidato. Mitiga riducendo l'ampiezza del movimento nel prompt.
  • Deriva dell'identità tra le inquadrature: i volti cambiano tra le generazioni. Mitiga con input di riferimento R2V.
  • Testo allucinato nei fotogrammi: cartelli, etichette, loghi vengono renderizzati come scarabocchi. Mitiga rimuovendo il testo dalle immagini di input.
  • Disallineamento del rapporto d'aspetto: l'inserimento di un'immagine 9:16 in una generazione 16:9 ritaglia in modo inaspettato. Fai corrispondere l'aspetto dell'input a quello dell'output.
  • Consumo di crediti su iterazioni lunghe: i render di test di 10 secondi consumano rapidamente i crediti. Iterare a 2-3 secondi.

Il cluster di casi d'uso di PixMind contiene note sulle modalità di fallimento per scenario per il marketing di prodotto, le performance dei personaggi, la previs cinematica e gli "social hooks".

FAQ sul generatore video Wan 2.7

Wan 2.7 è gratuito da provare?

Sì. La pagina PixMind Wan 2.7 include una prova gratuita senza carta di credito richiesta. I piani a pagamento si attivano solo quando si supera la quota di prova.

Wan 2.7 supporta il 4K?

No. Il video Wan 2.7 raggiunge un massimo di 1080P. Il modello di immagine Wan 2.7 supporta immagini fisse 4K tramite il livello Pro, ma l'output video è limitato a 1080P.

Wan 2.7 può clonare il volto di una persona specifica?

Wan 2.7 può preservare l'identità dagli input di riferimento, ma la politica di PixMind proibisce la clonazione non consensuale di somiglianze di persone reali e identificabili. Usa R2V con personaggi originali, riferimenti stock o la tua somiglianza.

Quanto tempo impiega un render di Wan 2.7?

Il tempo di generazione dipende dalla durata, dalla risoluzione e dal carico. I render tipici di 5 secondi a 720P terminano in 60-90 secondi. I render di 10 secondi a 1080P possono richiedere 3-5 minuti. L'API restituisce un ID attività che si interroga per lo stato.

Wan 2.7 genera audio?

Sì, ma solo nelle modalità che accettano input audio. T2V può prendere una traccia audio e sincronizzare il movimento con essa. La modalità I2V audio-driven utilizza l'audio per guidare la sincronizzazione labiale e del movimento. La generazione audio pura (musica, effetti sonori) è un modello Alibaba separato.

Posso usare gli output di Wan 2.7 commercialmente?

Sì. Gli output che generi sono tuoi da usare commercialmente secondo i termini di Alibaba Cloud Model Studio. Rivedi i termini attuali sulla panoramica di Alibaba Cloud Model Studio prima della spedizione.

Guardalo in azione

继续浏览中,生成器即将加载...