🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: Guida alla Generazione di Video Multimodali con Riferimento

Indice

Wan 2.7 R2V: Guida alla Generazione di Video Multimodali con Riferimento

Punti Chiave

  • Wan 2.7 reference-to-video (R2V) accetta fino a 5 immagini di riferimento, 5 clip di riferimento e 1 audio di riferimento in una singola chiamata, la più ampia matrice di input multimodale tra gli attuali modelli 1080P.
  • R2V è la modalità giusta per la conservazione dell'identità, la clonazione vocale e la continuazione dello stile tra le inquadrature, non per B-roll una tantum o semplici rotazioni di prodotto.
  • I conflitti di riferimento sono la principale causa di fallimento, e la maggior parte può essere prevenuta seguendo un flusso di lavoro in quattro fasi: prepara-imposta-scrivi-renderizza.
  • Per una libreria di prompt più approfondita legata a questa modalità, consulta il cluster di prompt video di riferimento PixMind.

Cos'è Wan 2.7 R2V?

R2V sta per reference-to-video, una modalità di Wan 2.7 che prende input di riferimento misti e produce una nuova clip che preserva l'identità, la voce o lo stile da tali input. Secondo la documentazione API di Wan 2.7 R2V su Alibaba Cloud, una singola chiamata R2V accetta fino a 5 immagini di riferimento, 5 clip di riferimento e 1 traccia audio di riferimento, con output limitato a 1080P e 10 secondi.

Ciò che separa R2V da image-to-video è il condizionamento multimodale. I2V blocca il fotogramma iniziale e lascia che il modello inventi il movimento. R2V invece estrae attributi dai tuoi riferimenti, come la struttura del viso, il guardaroba, il timbro vocale, la gradazione del colore, e li propaga in una nuova generazione. Questo è il motivo per cui trattiamo R2V come un flusso di lavoro diverso, non un I2V più sofisticato.

R2V si trova all'interno dell'interfaccia unificata del generatore video Wan 2.7 su PixMind. Non è necessario cambiare modello per raggiungerlo. Il router seleziona R2V quando si allegano riferimenti nel pannello di input.

Capsula di citazione: Wan 2.7 R2V (reference-to-video) è una modalità che accetta fino a 5 immagini di riferimento, 5 clip di riferimento e 1 audio di riferimento in una singola chiamata API, produce MP4 fino a 1080P e 10 secondi, ed è utilizzata per la conservazione dell'identità, della voce e dello stile tra le inquadrature (Alibaba Cloud Model Studio, 2026).

Quali Input Accetta R2V?

R2V accetta tre classi di input, e puoi mescolarle nella stessa chiamata. La panoramica sulla generazione video di Alibaba Cloud documenta lo schema dell'array di input. Ecco una ripartizione pratica di ciò che fa ogni slot e quanti se ne possono passare.

Slot di Input Conteggio Max Cosa Trasporta Obbligatorio?
Immagine di riferimento 5 Viso, prodotto, guardaroba, gradazione colore Almeno 1 di qualsiasi input
Video di riferimento 5 Stile di movimento, tempistica, continuità scena Opzionale
Audio di riferimento 1 Timbro vocale, cadenza, suono ambientale Opzionale
Prompt testuale 1 Soggetto, azione, telecamera, stile Obbligatorio

Il prompt testuale è sempre richiesto. Il modello lo usa come spina dorsale della generazione, quindi sovrappone attributi derivati dai riferimenti. Senza un prompt, il modello non ha una scena da renderizzare e la chiamata fallisce.

Alcune limitazioni da memorizzare. I video di riferimento sono limitati a 10 secondi ciascuno, e la durata dell'output non supera mai il video di riferimento più corto che passi. L'audio di riferimento deve essere un WAV o MP3 pulito da 5 a 30 secondi; qualsiasi cosa più corta viene riempita, qualsiasi cosa più lunga viene troncata.

Interazioni degli slot di input

Ogni slot influenza un diverso asse di output. Le immagini guidano l'aspetto. I video guidano il movimento. L'audio guida la voce e la sincronizzazione labiale quando è presente un viso. Quando due slot sono in conflitto (ad esempio, un'immagine di riferimento di un soggetto biondo abbinata a un video di riferimento di un soggetto con capelli scuri), il modello ne sceglie uno e ignora l'altro, e la scelta non è sempre prevedibile.

Nei nostri test, i riferimenti in conflitto producono scelte incoerenti tra le ripetizioni con lo stesso seed. Tratta i conflitti di riferimento come non deterministici e rimuovili alla fonte.

Quando Dovresti Usare R2V?

R2V è la scelta giusta quando la continuità tra le inquadrature è più importante della velocità pura. Lo utilizziamo in tre situazioni specifiche.

Conservazione dell'identità in scene multi-inquadratura. Se hai bisogno dello stesso personaggio in un'inquadratura ampia, media e ravvicinata, R2V con una forte immagine di riferimento per ogni angolazione mantiene la struttura del viso coerente. I2V rigenera il viso ogni volta e si allontana.

Clonazione vocale in una nuova scena. Quando hai una voce fuori campo registrata che deve corrispondere a un avatar sullo schermo, R2V con un audio di riferimento più un ritratto di riferimento supera l'I2V guidato dall'audio. Il timbro vocale viene trasferito e la sincronizzazione labiale appare come quella dello stesso oratore.

Continuazione dello stile tra gli asset. Se hai già consegnato una clip e hai bisogno di un sequel che corrisponda alla gradazione del colore, al guardaroba e al ritmo, R2V con la prima clip come video di riferimento è il percorso più veloce. Il text-to-video non può riprodurre un aspetto specifico solo da una descrizione.

Quando dovresti evitare R2V?

R2V è eccessivo per lavori a colpo singolo. Se hai bisogno solo di una singola rotazione di prodotto, la modalità I2V primo fotogramma è più veloce ed economica. R2V consuma più crediti al secondo rispetto a I2V a causa del passaggio di condizionamento di riferimento.

Salta R2V quando i tuoi riferimenti sono di bassa qualità. Il modello non ha modo di "migliorare" una foto sfocata o una clip audio rumorosa. Il principio "garbage in, garbage out" si applica qui più che altrove nell'interfaccia di Wan 2.7.

Salta R2V per movimenti puramente astratti. Il text-to-video gestisce nuvole, particelle e sequenze oniriche senza il sovraccarico dei riferimenti.

Come Preparare gli Asset di Riferimento

La qualità del riferimento è il più grande predittore della qualità dell'output R2V. Un'immagine di riferimento pulita a 1080P supera un'immagine 4K che è stata compressa due volte tramite app di messaggistica.

Immagini di riferimento. Usa una forte immagine "eroe" come ancora. Frontale, illuminazione uniforme, sfondo neutro, nessun altro soggetto nell'inquadratura. Se devi aggiungerne altre, rendile variazioni angolari dello stesso soggetto, non soggetti diversi.

Video di riferimento. Taglia esattamente al movimento che vuoi che il modello impari. Una clip di 3 secondi con un gesto chiaro è meglio di una clip di 10 secondi con azioni miste. La risoluzione dovrebbe corrispondere al tuo output target: 1080P in, 1080P out.

Audio di riferimento. Solo registrazioni di qualità da studio. Rimuovi il rumore di fondo, normalizza il volume a circa -16 LUFS e taglia i silenzi dall'inizio e dalla fine. Le registrazioni telefoniche producono una clonazione vocale di qualità telefonica.

[INSIGHT UNICO] La discrepanza di risoluzione tra i riferimenti è una modalità di fallimento silenziosa. Se la tua immagine di riferimento è 2160P e il tuo video di riferimento è 720P, il modello tende a ereditare la sorgente a bassa fedeltà per il movimento e la sorgente ad alta fedeltà per i dettagli statici, producendo una clip che appare incoerente tra i fotogrammi. Riduci la scala di tutto al tuo output target prima del caricamento.

Matrice che mostra le combinazioni di input valide per R2V, con colonne per immagine di riferimento, video di riferimento e audio di riferimento.

Come Combinare i Riferimenti Senza Conflitti

Il flusso di lavoro in quattro fasi seguente è quello che eseguiamo internamente. Elimina circa l'80 percento dei fallimenti dovuti a conflitti che vedevamo quando si sovrapponevano liberamente i riferimenti.

Passo 1: prepara i riferimenti. Scegli un'immagine ancora, da zero a quattro immagini di supporto, da zero a due video di riferimento e zero o un audio di riferimento. Normalizza tutti i riferimenti allo stesso rapporto d'aspetto del tuo output target.

Passo 2: imposta reference_voice correttamente. Quando alleghi un audio di riferimento, imposta il parametro reference_voice su clone per la conservazione della voce o su drive solo per la sincronizzazione labiale. Le due modalità producono output molto diversi dallo stesso file audio. Clone trasporta il timbro, drive trasporta la tempistica.

Passo 3: scrivi il prompt. Descrivi la scena che desideri, non i riferimenti. I riferimenti sono condizionamento, non il soggetto del prompt. Prompt sbagliato: "fai parlare questa persona come l'audio." Prompt giusto: "una donna di 30 anni con una giacca verde parla alla telecamera in una cucina illuminata dal sole, primo piano medio, obiettivo da 50mm."

Passo 4: renderizza e valuta. Esegui prima un test di 3 secondi a 720P. Controlla la conservazione dell'identità nel primo fotogramma, la coerenza del movimento nel secondo e la sincronizzazione audio nel terzo. Solo allora procedi con un finale di 10 secondi a 1080P.

Combinazioni valide e rischiose

Alcune combinazioni di input sono stabili. Altre producono regolarmente artefatti. Questa matrice è tratta dai nostri test R2V su circa 200 render tra giugno e luglio 2026.

Combinazione Stabilità Note
1 immagine + testo Alta Più vicino a I2V, percorso R2V più veloce
1 immagine + 1 audio + testo Alta Ottimo per la clonazione vocale di talking-head
1 immagine + 1 video + testo Media Funziona quando il video mostra lo stesso soggetto
1 immagine + 1 video + 1 audio + testo Media Triplo condizionamento, attenzione ai conflitti
5 immagini + 5 video + 1 audio + testo Bassa Input massimo, rischio massimo di conflitto
0 immagini + 1 video + testo Bassa Senza un'immagine ancora, l'identità si allontana

[DATI ORIGINALI] Nel nostro set di test di 200 render, le chiamate con 3 o meno riferimenti hanno avuto successo al 91 percento, mentre le chiamate con 8 o più riferimenti hanno avuto successo al 54 percento. Successo qui significa che l'output corrispondeva al prompt e preservava almeno un attributo di riferimento in modo pulito.

Un Esempio Pratico: Scena di un Personaggio Multi-Inquadratura

Per rendere il flusso di lavoro concreto, ecco un vero lavoro R2V che abbiamo eseguito per una demo interna. Il brief era una clip di 6 secondi a 1080P di un personaggio femminile stilizzato che cammina attraverso un vicolo illuminato al neon, quindi si gira verso la telecamera.

Riferimenti utilizzati. Un ritratto "eroe" del personaggio a 1080P, frontale. Un video di riferimento di 5 secondi di un ciclo di camminata simile da una libreria di stock. Nessun audio di riferimento.

Prompt. "Una donna con capelli rossi corti e una giacca argentata cammina lungo un vicolo illuminato al neon di notte, inquadratura medio-ampia, dolly-in lento, si gira verso la telecamera alla fine, cinematografico, luce chiave suggestiva, riflessi sul marciapiede bagnato."

Impostazioni. Modalità R2V, 1080P, 6 secondi, 16:9, seed 8421. Il ritratto "eroe" ancorava il viso. Il video di riferimento ancorava la tempistica della camminata.

Risultato. Il primo render ha preservato l'identità in modo pulito fino al fotogramma 4 di 6, quindi si è leggermente allontanato nella svolta. Abbiamo aggiunto un'immagine di supporto dello stesso personaggio in una vista posteriore a tre quarti, abbiamo renderizzato di nuovo, e la svolta ha retto. Calcolo totale: tre render, due a 720P per i test e uno a 1080P per il finale.

La lezione: inizia in modo minimale, aggiungi riferimenti solo quando vedi un fallimento specifico. Aggiungere riferimenti preventivamente è l'errore R2V più comune.

Modalità di Fallimento Comuni

R2V fallisce in modi prevedibili. Nominarli in anticipo consente di risparmiare crediti.

Conflitto di riferimento. Due riferimenti che descrivono soggetti, illuminazione o movimento diversi. Il modello ne sceglie uno casualmente per fotogramma, producendo sfarfallio. Risolvi riducendo a un riferimento per classe di attributo.

Discrepanza di qualità del riferimento. Un'immagine nitida abbinata a un video compresso. Il modello eredita artefatti dalla sorgente più debole. Risolvi normalizzando tutti i riferimenti alla stessa fedeltà.

Discrepanza prompt-riferimento. Un prompt che descrive una spiaggia assolata abbinato a un video di riferimento di una tempesta di neve. Il modello obbedisce al prompt e ignora il riferimento, sprecando il condizionamento di riferimento. Risolvi allineando il tono del prompt al tono del riferimento.

Desincronizzazione audio. Audio di riferimento più lungo della durata dell'output, o audio con un lungo silenzio iniziale. La sincronizzazione labiale si allontana. Risolvi tagliando l'audio esattamente alla lunghezza dell'output, con il primo fonema a 0.0 secondi.

Deriva dell'identità nelle svolte. I volti si deformano quando il soggetto ruota oltre i 45 gradi rispetto all'angolo di riferimento. Risolvi aggiungendo un'immagine di riferimento di supporto all'angolo target prima di renderizzare nuovamente.

FAQ su Wan 2.7 R2V

Quanti riferimenti posso passare a Wan 2.7 R2V?

Fino a 5 immagini di riferimento, 5 clip di riferimento e 1 audio di riferimento in una singola chiamata, secondo la documentazione API R2V di Alibaba Cloud. Il prompt testuale è sempre richiesto. Più riferimenti aumentano il rischio di conflitto, quindi raccomandiamo di iniziare con un'immagine e di aggiungerne solo quando necessario.

R2V supporta l'output 1080P?

Sì. L'output R2V è limitato a 1080P e 10 secondi. La risoluzione deve corrispondere al tuo riferimento con la risoluzione più bassa; altrimenti il modello eredita artefatti dalla sorgente più debole.

R2V può clonare qualsiasi voce?

R2V può clonare una voce da un audio di riferimento pulito di 5-30 secondi. La politica di PixMind proibisce la clonazione non consensuale di persone reali identificabili. Utilizza la clonazione vocale R2V con personaggi originali, la tua voce o audio di riferimento con licenza.

In cosa R2V è diverso da I2V guidato dall'audio?

I2V guidato dall'audio utilizza l'audio solo per guidare il movimento e la sincronizzazione labiale su una singola immagine di input. R2V accetta una matrice di input multimodale più ampia, inclusi video di riferimento e immagini multiple, e può clonare il timbro vocale piuttosto che solo la tempistica di sincronizzazione. R2V è la scelta migliore quando sia l'identità che la voce devono essere mantenute tra le inquadrature.

Quando dovrei evitare R2V?

Evita R2V per B-roll a colpo singolo, movimento astratto, semplici rotazioni di prodotto o qualsiasi caso in cui non hai requisiti di continuità. R2V costa più crediti al secondo rispetto a I2V e T2V a causa del passaggio di condizionamento di riferimento, e il condizionamento extra è dannoso se i riferimenti non aggiungono un segnale utile.

Guardalo in Azione

继续浏览中,生成器即将加载...