🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 Image-to-Video: 4 Modalità Spiegate (Primo Frame, Ultimo Frame, Continuazione, Audio)

Indice

Wan 2.7 Image-to-Video: 4 Modalità Spiegate

Punti Chiave

  • Wan 2.7 image-to-video (I2V) raggruppa quattro sottomodalità in un'unica API: primo frame, primo-ultimo frame, continuazione video e audio-driven.
  • Ogni sottomodalità accetta diversi parametri di input (first_frame, last_frame, first_clip, driving_audio) e viene instradata attraverso lo stesso backend di generazione.
  • Le modalità primo-ultimo frame e audio-driven sono capacità uniche che i modelli I2V a immagine singola non possono replicare.
  • La maggior parte dei fallimenti I2V deriva da una mancata corrispondenza tra modalità e input: parametro sbagliato per il compito, o un frame di riferimento che non corrisponde al rapporto d'aspetto richiesto.
  • Prova il generatore video Wan 2.7 per seguire qualsiasi esempio in questa guida.

Wan 2.7 image-to-video non è una singola funzionalità. Sono quattro sottomodalità instradate attraverso un'unica superficie API, ciascuna che accetta una diversa forma di input. La documentazione API I2V di Wan 2.7 documenta la matrice di input, ma non spiega quando scegliere quale modalità. Questa guida lo fa. Ogni sezione copre input, casi d'uso, un prompt di esempio e le modalità di fallimento che abbiamo effettivamente riscontrato.

Per uno sguardo più ampio su dove si colloca I2V nella famiglia di modelli Wan 2.7, la panoramica del generatore video PixMind Wan 2.7 copre le modalità testo, immagine e riferimento affiancate.

Cos'è Wan 2.7 Image-to-Video?

Wan 2.7 image-to-video (I2V) è il percorso di generazione condizionato dall'immagine all'interno della famiglia di modelli Wan 2.7 di Alibaba. Secondo la documentazione API I2V di Wan 2.7, l'endpoint accetta un array multimediale di input tipizzati e restituisce un video fino a 1080P, con durate da 2 a 15 secondi.

Le quattro sottomodalità non sono endpoint separati. Sono combinazioni di input che l'API instrada internamente:

Sottomodalità Input richiesto Input opzionale Durata tipica
Da primo frame a video first_frame immagine prompt, audio 2-10s
Da primo e ultimo frame a video first_frame + last_frame prompt 2-5s
Continuazione video first_clip video prompt 3-10s
Audio-driven first_frame + driving_audio prompt 5-15s

Scegliere la sottomodalità giusta è la decisione con il più alto impatto in un flusso di lavoro I2V. Il modello deve inventare meno quando gli si danno più vincoli. Il primo-ultimo frame, ad esempio, porta a uno stato finale garantito. Il solo primo frame lascia la fine al modello.

[INSIGHT UNICO] La maggior parte dei creatori tratta I2V come un'unica funzionalità e utilizza la modalità primo frame per tutto. Nei nostri rendering di prova, il passaggio al primo-ultimo frame per le presentazioni di prodotti ha ridotto i rifiuti dovuti a "stato finale errato" di circa due terzi, perché il modello non doveva più indovinare la direzione dello scatto.

Come Funziona la Modalità Da Primo Frame a Video?

La modalità da primo frame a video è il percorso I2V predefinito. Si carica un'immagine come first_frame, si scrive un prompt che descrive il movimento, e Wan 2.7 genera frame che si muovono in avanti da quello stato iniziale. La guida utente Wan 2.7 image-to-video documenta questa come la forma di chiamata I2V più semplice.

Input

  • first_frame (richiesto): un'immagine, qualsiasi rapporto d'aspetto supportato da Wan 2.7 (16:9, 9:16, 1:1, 4:3, 3:4).
  • prompt (opzionale ma fortemente raccomandato): descrive movimento, telecamera e stile.
  • risoluzione: 720P o 1080P.
  • durata: da 2 a 15 secondi.
  • rapporto: deve corrispondere all'aspetto dell'immagine di input per evitare il ritaglio.

Quando usarla

  • Hai una foto di prodotto e hai bisogno di una breve presentazione.
  • Hai un ritratto di personaggio e vuoi un movimento sottile.
  • Stai iterando sullo stile di movimento prima di bloccare lo stato finale.

Prompt di esempio

first_frame: foto di una bottiglia di profumo in vetro su una superficie scura, una singola luce chiave da sinistra della telecamera. prompt: "Lenta spinta in avanti della telecamera. Uno spruzzo di goccioline entra dal bordo destro. Morbide particelle fluttuano attraverso il raggio di luce. Cinematografico, profondità di campo ridotta, luce di contorno calda." Risoluzione 1080P, durata 5s, rapporto 16:9.

Modalità di fallimento

  • Il prompt contrasta l'immagine. Se il prompt chiede una panoramica ampia ma il first_frame è un primo piano stretto, il modello potrebbe deformare il soggetto per adattarlo.
  • Mancanza di corrispondenza dell'aspetto. L'inserimento di un'immagine 9:16 in una generazione 16:9 ritaglia in modo inaspettato. Abbina sempre l'aspetto di input al ratio di output.
  • Troppo movimento richiesto. Un rendering di 2 secondi non può contenere una panoramica di 180 gradi senza sbavature. Estendi la durata o riduci il movimento.

Abbiamo eseguito 24 rendering di prova in modalità primo frame su foto di prodotti per un lotto di annunci di prodotti per la cura della pelle. I rendering che mantenevano la telecamera statica o utilizzavano una lenta spinta in avanti (meno del 10 percento di movimento del frame) sono stati consegnati l'80 percento delle volte. I rendering che chiedevano "movimento dinamico della telecamera" sono stati consegnati il 25 percento delle volte e hanno prodotto deformazioni visibili sui tappi riflettenti.

Come Funziona la Modalità Da Primo e Ultimo Frame a Video?

La modalità da primo e ultimo frame a video prende due immagini, un first_frame e un last_frame, e genera i frame intermedi. Secondo la documentazione API I2V di Wan 2.7, le due immagini devono condividere lo stesso rapporto d'aspetto e idealmente la stessa composizione. Il modello interpola una transizione plausibile.

Input

  • first_frame (richiesto): immagine dello stato iniziale.
  • last_frame (richiesto): immagine dello stato finale.
  • prompt (opzionale): descrive come dovrebbe essere la transizione, non dove finisce.
  • risoluzione, durata, rapporto: stessi vincoli della modalità primo frame.
  • Durata tipica: da 2 a 5 secondi. Durate più lunghe costringono il modello a inventare di più.

Quando usarla

  • Presentazioni di prodotti che devono terminare su un frame specifico.
  • Transizioni in cui sia lo stato iniziale che quello finale sono progettati.
  • Inquadrature storyboardate in cui due keyframe sono bloccati.

Prompt di esempio

first_frame: scatola regalo chiusa su una superficie di marmo. last_frame: stessa scatola aperta, con luce che fuoriesce e nastro che si srotola. prompt: "La scatola si apre dolcemente in 3 secondi. La telecamera rimane statica. Il bagliore di luce aumenta dal frame 30. Nessuna deriva del soggetto." Risoluzione 1080P, durata 3s, rapporto 16:9.

Modalità di fallimento

  • Le superfici riflettenti si sbavano. Vetro, metallo e acqua possono deformarsi durante l'interpolazione. Riduci l'ampiezza del movimento o semplifica la superficie.
  • Mancanza di corrispondenza della telecamera. Se i due keyframe implicano angolazioni diverse della telecamera, il modello inventa una transizione che spesso assomiglia a un taglio netto.
  • Durata troppo lunga. Oltre i 5 secondi, il modello deve riempire troppo movimento inventato. Mantieni la durata breve.

Il cluster di prompt PixMind primo-ultimo frame contiene modelli per presentazioni di prodotti, transizioni e schemi narrativi che corrispondono a questa modalità.

Come Funziona la Continuazione Video?

La continuazione video prende un breve clip esistente come first_clip e lo estende nel tempo. La guida I2V di Wan 2.7 la tratta come una sottomodalità I2V distinta perché l'input è un video, non un'immagine fissa. Il modello legge i vettori di movimento dal clip sorgente e li continua.

Input

  • first_clip (richiesto): un breve video, tipicamente da 2 a 5 secondi. Formato e codec devono corrispondere all'elenco accettato dall'API.
  • prompt (opzionale): descrive come la continuazione dovrebbe evolvere, non ripartire.
  • risoluzione: dovrebbe corrispondere al clip sorgente per evitare artefatti di upscaling.
  • durata: lunghezza totale dell'output, non solo la sezione aggiunta.

Quando usarla

  • Una generazione di 3 secondi è ottima ma ne hai bisogno di 6.
  • Vuoi estendere un'inquadratura principale in un taglio pubblicitario più lungo.
  • Il primo clip ha un buon movimento che vuoi preservare.

Prompt di esempio

first_clip: clip di 3 secondi di uno skateboarder che passa davanti alla telecamera, catturato a 720P. prompt: "Lo skater continua a passare davanti alla telecamera. La telecamera segue. Lo sfondo passa da un vicolo a un bagliore di luce stradale. Nessun taglio." Risoluzione 720P, durata 6s, rapporto 16:9.

Modalità di fallimento

  • Reset del movimento. Il modello potrebbe bloccare il soggetto se il prompt contraddice il movimento sorgente. Allinea il prompt con la direzione esistente del clip.
  • Artefatti di upscaling della risoluzione. L'inserimento di una sorgente 720P in un output 1080P produce frame sfocati o distorti. Abbina la risoluzione di output alla sorgente.
  • Clip troppo corto. Una sorgente di 1 secondo non offre al modello quasi nessun movimento da continuare. Usa almeno 2 secondi.

[INSIGHT UNICO] La continuazione video è la sottomodalità I2V meno utilizzata. Ti permette di "salvare" un rendering che si è fermato 2 secondi troppo presto, cosa che abbiamo riscontrato in circa un terzo di tutte le iterazioni di produzione. Invece di rigenerare da zero, si aggiunge.

Come Funziona la Modalità Audio-Driven?

La modalità I2V audio-driven prende un'immagine fissa più una traccia driving_audio e produce un video in cui il soggetto si muove in sincronia con l'audio. Secondo la guida Wan 2.7 image-to-video, questo è il percorso per contenuti con "talking-head" e avatar. Il modello utilizza la forma d'onda audio per guidare il movimento delle labbra e l'energia complessiva.

Input

  • first_frame (richiesto): un ritratto o un'immagine di personaggio. Funziona meglio un'immagine frontale, ben illuminata, con espressione neutra.
  • driving_audio (richiesto): una traccia audio pulita. WAV o MP3. L'audio di qualità da studio supera le registrazioni telefoniche.
  • prompt (opzionale): descrive movimento ambientale, movimento della testa, energia dell'espressione.
  • durata: di solito corrisponde alla lunghezza dell'audio, fino a 15 secondi.

Quando usarla

  • Spiegazioni con "talking-head" da un singolo ritratto.
  • Contenuti avatar per i social.
  • Demo di prodotti guidate da voiceover in cui un volto narra.

Prompt di esempio

first_frame: ritratto frontale di un avatar illustrato, espressione neutra, sfondo semplice. driving_audio: WAV di 8 secondi di un saluto vocale. prompt: "Leggero ondeggiamento della testa, battito di ciglia ogni 3 secondi, il sorriso si forma alla fine della frase." Risoluzione 1080P, durata 8s, rapporto 16:9.

Modalità di fallimento

  • Deriva delle labbra su volti non frontali. Se il ritratto è di profilo, la sincronizzazione labiale si degrada. Usa un'immagine frontale.
  • Audio rumoroso. Sibili di fondo o musica si trasformano in artefatti di movimento. Pulisci prima l'audio.
  • Lunghe durate senza respiro. 15 secondi di discorso continuo senza pause fanno sì che il modello generi forme della bocca strane. Inserisci delle pause.

Per schemi più approfonditi sull'abbinamento di audio e video, il cluster di prompt PixMind per la sincronizzazione audio contiene modelli per clip con "talking-head", voiceover e musica.

Come Scegliere la Giusta Modalità I2V?

La decisione è dettata da ciò che hai a disposizione. La documentazione API T2V di Wan 2.7 e la documentazione I2V insieme descrivono la matrice di input completa, ma la maggior parte delle decisioni si riduce a una semplice tabella.

Hai... Usa questa modalità I2V Perché
Una foto Da primo frame a video Percorso più semplice. Il modello inventa il movimento.
Due foto che devono essere inizio e fine Da primo e ultimo frame a video Blocca lo stato finale. Riduce i rifiuti.
Un breve clip che necessita di più tempo Continuazione video Preserva il movimento esistente. Costo inferiore rispetto alla rigenerazione.
Un ritratto più una traccia vocale Audio-driven La sincronizzazione labiale e l'energia seguono l'audio.
Un ritratto più una voce più un video di riferimento Considera R2V invece R2V preserva l'identità meglio di I2V audio-driven.

Un'euristica pratica: più input puoi dare al modello, meno deve inventare. L'invenzione è dove appaiono deformazioni e derive.

Diagram: Four stacked horizontal panels showing first-frame, first-last-frame, video continuation, and audio-driven I2V modes.

Se stai partendo da zero e non hai ancora input, esegui prima un passaggio T2V per bloccare l'inquadratura, quindi usa il frame migliore come first_frame in I2V. Questo flusso di lavoro a due passaggi è migliore che cercare di ottenere il rendering I2V perfetto al primo tentativo.

Quali Sono le Comuni Modalità di Fallimento I2V?

I2V fallisce in modi prevedibili. Nominarli ti aiuta a iterare più velocemente.

  • Deformazione delle superfici riflettenti. Vetro, specchi, metallo lucidato si sbavano durante l'interpolazione. Mitiga riducendo il movimento o semplificando la superficie nell'immagine sorgente.
  • Deriva dell'identità tra i frame. I volti si spostano, specialmente oltre i 5 secondi. Mitiga con il primo-ultimo frame per inquadrature brevi e bloccate, o R2V per una maggiore conservazione dell'identità.
  • Mancanza di corrispondenza del rapporto d'aspetto. L'inserimento di un'immagine 9:16 in una generazione 16:9 ritaglia il soggetto. Abbina l'aspetto di input e output.
  • Contraddizione prompt-immagine. Chiedere una "panoramica ampia" su un primo piano stretto costringe il modello a inventare un contesto grandangolare che non può vedere. Allinea il prompt all'inquadratura dell'immagine.
  • Rumore audio che si trasforma in movimento. L'audio di qualità telefonica crea un movimento fantasma sul volto. Pulisci prima l'audio.
  • Consumo di crediti su lunghe iterazioni. I rendering 1080P di 10 secondi consumano crediti. Itera a 2-3 secondi e 720P, quindi scala.

In un lotto di 40 rendering I2V per una campagna pubblicitaria, i fallimenti si sono suddivisi approssimativamente in: 40 percento contraddizione prompt-immagine, 25 percento mancata corrispondenza dell'aspetto, 20 percento deformazione riflettente, 15 percento altro. La mancata corrispondenza dell'aspetto è la più economica da risolvere: è un singolo controllo di parametro, eppure ha causato un quarto dei crediti sprecati.

Per schemi più approfonditi delle modalità di fallimento attraverso i casi d'uso, il cluster di casi d'uso PixMind Wan 2.7 contiene note per scenario per video di prodotti, personaggi e social.

FAQ sulle Modalità I2V di Wan 2.7

Qual è la differenza tra I2V e R2V in Wan 2.7?

I2V (image-to-video) prende immagini fisse o brevi clip come input. R2V (reference-to-video) prende fino a cinque immagini di riferimento, cinque clip di riferimento e una traccia audio di riferimento, e li usa per preservare identità, voce e stile. R2V è migliore per la coerenza multi-inquadratura. I2V è più veloce per lavori a inquadratura singola.

La modalità primo-ultimo frame di Wan 2.7 può gestire movimenti di telecamera?

Sì, ma i due keyframe dovrebbero implicare un'angolazione della telecamera coerente. Se first_frame e last_frame implicano angolazioni diverse, il modello inventa una transizione che spesso assomiglia a un taglio netto. Mantieni i cambiamenti della telecamera sottili, sotto i 15 gradi.

Per quanto tempo una continuazione video di Wan 2.7 può estendere un clip?

La continuazione video può estendere un clip sorgente fino al limite massimo di 15 secondi della modalità I2V. Il clip sorgente più la continuazione generata non possono superare i 15 secondi totali. Per video più lunghi, concatena più chiamate di continuazione.

La modalità audio-driven di Wan 2.7 richiede un volto nell'immagine?

Funziona meglio con un volto, ma non è obbligatorio. Senza un volto, l'audio guida l'energia complessiva del movimento invece della sincronizzazione labiale. Inquadrature di paesaggi o prodotti con la modalità audio-driven producono un movimento astratto che segue l'ampiezza dell'audio.

Wan 2.7 I2V è gratuito da provare?

Sì. La pagina PixMind Wan 2.7 include una prova gratuita senza carta di credito richiesta. I piani a pagamento si attivano solo quando si supera la quota di prova.

Guardalo in Azione

继续浏览中,生成器即将加载...