🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Prompt Video Multi-Shot con Wan 2.7: Un Tutorial in 4 Sequenze

Indice

Prompt Video Multi-Shot con Wan 2.7

Punti Chiave

  • Un prompt multi-shot di Wan 2.7 concatena da tre a cinque inquadrature in un unico input di testo, dove ogni inquadratura definisce soggetto, azione, telecamera e stile.
  • Il modello a 4 inquadrature (stabilire, medio, primo piano, risoluzione) copre circa l'80% dei casi d'uso multi-shot che riscontriamo nel lavoro su prodotti, narrazioni e tutorial.
  • Gli archetipi di sequenza che funzionano meglio sono l'arco narrativo, il tour del prodotto, il passaggio tutorial e il pezzo d'atmosfera, ognuno con una curva di ritmo distinta.
  • Wan 2.7 produce un MP4 continuo per prompt, quindi pianifica i confini delle inquadrature a 2-4 secondi ciascuna all'interno di un rendering di 10-15 secondi.
  • Inizia dal cluster di prompt multi-shot di PixMind e dal generatore video Wan 2.7 per riprodurre qualsiasi modello qui.

Cos'è un Prompt Video Multi-Shot?

Un prompt video multi-shot è un singolo input di testo che descrive due o più inquadrature in sequenza, dove ogni inquadratura ha il proprio soggetto, inquadratura e movimento. Secondo la guida alla generazione video di Alibaba Cloud Model Studio, Wan 2.7 T2V accetta testo in formato libero fino a circa 800 caratteri, che è spazio sufficiente per una scomposizione a quattro inquadrature se si mantiene ogni riga concisa.

Capsula di citazione: Wan 2.7 supporta prompt video multi-shot in modalità T2V. Ogni prompt può descrivere fino a quattro inquadrature con soggetto, telecamera e stile, e il modello produce un MP4 continuo fino a 1080P e 15 secondi (Alibaba Cloud Model Studio, 2026).

Multi-shot contro single-shot

Un prompt single-shot descrive una ripresa continua. Un prompt multi-shot descrive diverse inquadrature che il modello concatena in un unico rendering. Il single-shot è più facile da controllare. Il multi-shot offre una storia più completa con una singola spesa di credito.

Il compromesso è la disciplina del prompt. Con una sola inquadratura, il modello può basarsi sulle sue conoscenze precedenti. Con quattro inquadrature, gli indizi vaghi si accumulano. La guida all'ingegneria dei prompt di PixMind Wan 2.7 illustra l'anatomia sottostante in modo più dettagliato.

Nei nostri test interni, i prompt che numerano esplicitamente le inquadrature (Shot 1, Shot 2, Shot 3) seguono gli indizi di ritmo in modo più affidabile rispetto alle descrizioni separate da virgole. La struttura numerata viene letta come una shot list, che è il formato su cui Wan 2.7 è stato addestrato.

La Struttura della Sequenza a 4 Inquadrature

La sequenza a 4 inquadrature è il modello di riferimento. Si mappa direttamente a come i montatori cinematografici tagliano una scena: stabilire il mondo, mostrare il soggetto, rivelare un dettaglio, risolvere. Il riferimento API T2V di Alibaba conferma che i prompt vengono letti dall'alto verso il basso con le clausole successive ponderate meno, quindi inserisci il contesto di stabilizzazione per primo (Riferimento API T2V di Aliyun Model Studio, 2026).

Capsula di citazione: In Wan 2.7 T2V, le clausole del prompt sono ponderate in ordine, con la prima frase che guida l'elemento visivo dominante. Una struttura a 4 inquadrature posiziona l'inquadratura di stabilizzazione per prima in modo che il modello si basi sull'ambientazione prima dell'azione (Aliyun Model Studio, 2026).

Il modello

Usa questo scheletro per qualsiasi prompt a 4 inquadrature:

Shot 1 (establishing): [setting], [wide framing], [ambient motion].
Shot 2 (medium): [subject], [primary action], [camera move].
Shot 3 (close): [detail of subject or action], [tight framing].
Shot 4 (resolution): [wider or alternate angle], [final beat].
Style: [look, lighting, grain].
Duration: [8s | 10s | 15s]. Ratio: [16:9 | 9:16 | 1:1].

Diagram: Horizontal storyboard showing 4 connected shot panels labeled Shot 1 through Shot 4 with orange transition arrows between them.

Tempistiche e numero di inquadrature

La maggior parte dei fallimenti che vediamo derivano dal sovraccarico. Ogni inquadratura ha bisogno di 2-4 secondi per essere leggibile sullo schermo. Una sequenza a 4 inquadrature richiede quindi almeno 8 secondi, idealmente 10. Inserire 6 inquadrature in 10 secondi lascia ogni inquadratura sotto i 2 secondi, il che si traduce in un tremolio.

Lunghezza sequenza Durata minima Rapporto predefinito Caso d'uso
2 inquadrature 5s 16:9 Rivelazione prodotto, prima-dopo
3 inquadrature 8s 16:9 Gancio social, intro pubblicitaria
4 inquadrature 10s 16:9 o 9:16 Tutorial, battuta narrativa
5 inquadrature 15s 16:9 Pezzo d'atmosfera, filmato di marca

[INSIGHT UNICO] Il numero di inquadrature dovrebbe seguire il budget della storia, non l'appetito. Due inquadrature forti superano costantemente cinque affrettate in una revisione cieca, perché Wan 2.7 alloca i dettagli visivi per inquadratura piuttosto che per fotogramma.

Sequenza 1: Arco Narrativo

Una sequenza ad arco narrativo stabilisce un personaggio o un mondo, introduce tensione e risolve. Wan 2.7 gestisce bene questo aspetto in T2V perché i prompt narrativi hanno una chiara catena causale, che aiuta il modello a mantenere l'identità del soggetto attraverso i tagli.

Capsula di citazione: I prompt ad arco narrativo funzionano in Wan 2.7 T2V quando ogni inquadratura condivide almeno un ancoraggio visivo con l'inquadratura precedente, come la palette di colori o la silhouette del soggetto. Senza un ancoraggio condiviso, la deriva dell'identità appare entro l'inquadratura 3 (Alibaba Cloud Model Studio, 2026).

Modello di prompt

Shot 1 (establishing wide): a quiet coastal town at dawn, slow camera dolly forward over rooftops.
Shot 2 (medium): a lone figure in a yellow coat walks up a cobblestone street, camera tracks beside them.
Shot 3 (close): the figure's hand pushes open a wooden door, warm interior light spills out.
Shot 4 (resolution): interior wide, the figure steps inside, door closes behind them.
Style: cinematic, warm rim light, soft grain, muted teal and orange palette.
Duration: 10s. Ratio: 16:9.

Quando usarlo

Gli archi narrativi si adattano a filmati di marca, inizi di racconti brevi e qualsiasi scena in cui l'emozione si costruisce attraverso i tagli. Hanno difficoltà con le rapide rivelazioni di prodotti perché il ritmo è lento per design.

Abbiamo consegnato questo esatto modello di prompt per un cliente del settore viaggi. Il primo rendering a 8 secondi sembrava affrettato. Portandolo a 10 secondi, l'inquadratura 3 ha avuto respiro e l'apertura della porta è stata letta chiaramente.

Sequenza 2: Tour del Prodotto

Un tour del prodotto mostra lo stesso oggetto da più angolazioni in un unico rendering continuo. Wan 2.7 I2V con first-last-frame è la modalità giusta quando si hanno foto del prodotto. Il multi-shot T2V è la modalità giusta quando si ha solo un prompt.

Capsula di citazione: I prompt di tour del prodotto in Wan 2.7 T2V mantengono al meglio l'identità del soggetto tra le inquadrature quando ogni inquadratura riutilizza lo stesso descrittore di prodotto verbatim, come "corpo macchina fotografica in ceramica nera opaca". Variazioni nella formulazione causano una deriva del materiale entro l'inquadratura 3 (Aliyun Model Studio, 2026).

Modello di prompt

Shot 1 (establishing): a matte black ceramic coffee mug on a concrete ledge, soft morning light from camera-left.
Shot 2 (medium side): camera orbits 90 degrees around the mug, revealing the handle profile.
Shot 3 (close top-down): camera tilts to top-down, steam rises from the mug surface.
Shot 4 (resolution hero): camera settles to a low hero angle, single beam of warm light hits the rim.
Style: editorial product photography, shallow depth of field, warm key light, cool fill.
Duration: 10s. Ratio: 16:9. Resolution: 1080P.

Comparison grid: 4 shot panels labeled Shot 1 through Shot 4 showing a product tour around a ceramic mug, each from a different angle.

Modalità di fallimento

I tour del prodotto falliscono in due modi prevedibili. Primo, l'orbita nell'inquadratura 2 potrebbe deformarsi se la superficie è riflettente. Secondo, l'inclinazione dall'alto verso il basso nell'inquadratura 3 potrebbe alterare le proporzioni della tazza perché Wan 2.7 non ha una vera comprensione 3D dell'oggetto.

Per ridurre la deformazione, mantieni i movimenti della telecamera sotto i 90 gradi per inquadratura. Per ridurre l'alterazione delle proporzioni, ripeti il descrittore del prodotto in ogni inquadratura invece di affidarti ai pronomi.

Sequenza 3: Passaggio Tutorial

Una sequenza di passaggi tutorial mostra un processo suddiviso in fasi chiare. Wan 2.7 è discreto in questo quando ogni inquadratura descrive una singola azione, e scarso quando un'inquadratura cerca di fare due cose contemporaneamente.

Capsula di citazione: I prompt tutorial in Wan 2.7 T2V hanno successo quando ogni inquadratura contiene esattamente un verbo. Le inquadrature multi-verbo collassano in sfocature di movimento perché il modello cerca di renderizzare due azioni all'interno di una finestra di 2 secondi (Aliyun Model Studio, 2026).

Modello di prompt

Shot 1 (establishing overhead): a wooden cutting board on a marble counter, a chef's knife rests beside a whole lemon.
Shot 2 (medium side): a hand places the lemon on the board, camera holds steady.
Shot 3 (close): the knife slices the lemon in half, juice sprays lightly.
Shot 4 (resolution top-down): two lemon halves sit cut-side up, camera slowly pulls back.
Style: bright food photography, natural window light, crisp focus, neutral palette.
Duration: 10s. Ratio: 9:16.

Perché 9:16 per i tutorial

I contenuti tutorial vivono su Reels, Shorts e TikTok. Un frame 9:16 ritaglia l'inquadratura ampia di stabilizzazione, quindi è più importante qui posizionare il soggetto al centro del frame in ogni inquadratura. La guida ai ganci video social di PixMind approfondisce l'inquadratura verticale.

[INSIGHT UNICO] I prompt tutorial guadagnano precisione quando si nomina lo strumento in ogni inquadratura. Scrivere "coltello da chef" nell'inquadratura 1 e poi "coltello" nell'inquadratura 3 permette al modello di passare a un coltello da spelucchino. La ripetizione verbatim sembra ridondante, ma è il modo più economico per bloccare l'identità.

Sequenza 4: Pezzo d'Atmosfera

Un pezzo d'atmosfera è non narrativo. Stabilisce l'atmosfera attraverso tono, luce e texture piuttosto che l'azione. I pezzi d'atmosfera sono dove i precedenti di stile cinematografico di Wan 2.7 fanno il massimo del lavoro, e dove l'eccesso di prompt fa più danni.

Capsula di citazione: I prompt di pezzi d'atmosfera in Wan 2.7 T2V beneficiano di clausole brevi e sensoriali e di un singolo ancoraggio di stile dominante. Lunghi passaggi descrittivi spingono il modello verso una narrazione letterale e lontano dall'atmosfera (Alibaba Cloud Model Studio, 2026).

Modello di prompt

Shot 1: rain falls on a neon-lit alley, slow dolly in.
Shot 2: reflections ripple in a puddle, camera holds.
Shot 3: a paper lantern sways overhead, slow tilt up.
Shot 4: the alley empties into an open square, camera tracks forward.
Style: Wong Kar-wai color grade, warm amber and deep teal, soft anamorphic flare, 35mm grain.
Duration: 15s. Ratio: 16:9. Resolution: 1080P.

Ancoraggi di stile che funzionano

Un ancoraggio di stile è un riferimento nominativo che blocca l'aspetto. I riferimenti cinematografici superano i termini astratti. Dire "soft anamorphic flare" dice al modello qualcosa di specifico. Dire "cinematico" non gli dice quasi nulla.

I prompt d'atmosfera sono stati l'unica categoria in cui PromptExtend ci ha costantemente aiutato. Estendere i dettagli sensoriali senza sovrascrivere gli ancoraggi di stile ha dato una texture più ricca in circa il 60% dei rendering di prova. Per altri tipi di sequenza, PromptExtend ha diluito la direzione della telecamera.

Montaggio e Post-Produzione

Wan 2.7 produce un MP4 continuo. I prompt multi-shot producono tagli all'interno del rendering, non file separati. La post-produzione è quindi più leggera di un montaggio manuale, ma ci sono ancora tre cose da pianificare.

Capsula di citazione: Gli output multi-shot di Wan 2.7 arrivano come un singolo MP4 con tagli netti ai confini delle inquadrature. L'aggiunta di una dissolvenza incrociata di 200ms in qualsiasi NLE ammorbidisce il taglio, poiché il modello non inserisce transizioni tra le inquadrature (Aliyun Model Studio, 2026).

La pipeline di post-produzione in 3 fasi

  1. Ispeziona i confini delle inquadrature: apri il file nel tuo NLE e posiziona un marcatore ogni 2-4 secondi. Se un'inquadratura è durata troppo, puoi dividerla e tagliarla senza doverla renderizzare di nuovo.
  2. Aggiungi dissolvenze incrociate di 200ms: i tagli netti di Wan 2.7 a volte sembrano bruschi. Una breve dissolvenza incrociata a ogni confine ammorbidisce il taglio e nasconde piccole derive di identità.
  3. Correzione colore: le inquadrature potrebbero presentare derive nel bilanciamento del bianco. Una singola correzione Lumetri o basata su nodi su tutte le inquadrature uniforma la sequenza in un unico aspetto.

!(https://cdn.pixmind.io/posts/multi-shot-video-prompts-wan-2-7/chart-post-time.png)

Quando renderizzare di nuovo invece di correggere

Alcuni fallimenti non sono risolvibili in post-produzione. Renderizza di nuovo se l'identità del prodotto deriva di oltre il 20% tra le inquadrature, se il movimento della telecamera contraddice il prompt, o se un'inquadratura è completamente mancante. Colore, ritmo e transizioni sono territorio della post-produzione. Identità e struttura sono territorio del prompt.

Per un confronto più approfondito su come Wan 2.7 si confronta con Sora 2 e VEO 3 in termini di coerenza multi-shot, consulta il nostro test dei prompt Wan 2.7 contro Sora 2 e lo scontro Wan 2.7 contro Kling contro VEO.

FAQ su Wan 2.7 Multi-Shot

Wan 2.7 può generare video multi-shot reali in un unico prompt?

Sì, con limiti. Wan 2.7 T2V accetta prompt multi-shot fino a circa 800 caratteri. Ogni inquadratura dovrebbe durare da 2 a 4 secondi all'interno di un rendering di 10-15 secondi. Sequenze più lunghe collassano in un tremolio. Consulta la guida alla generazione video di Alibaba Cloud per il limite di lunghezza dell'input.

Il multi-shot funziona in modalità da immagine a video?

Non direttamente. I2V si basa sull'immagine di input come primo fotogramma. Il multi-shot è un pattern nativo di T2V. Per il multi-shot con ancoraggi immagine, esegui più rendering I2V con first-last-frame e unisci in post-produzione. Il cluster first-last-frame di PixMind copre quel flusso di lavoro.

Come mantengo l'identità del soggetto coerente tra le inquadrature?

Ripeti il descrittore del soggetto verbatim in ogni inquadratura. Evita i pronomi. Se hai descritto una tazza di ceramica nera opaca nell'inquadratura 1, riutilizza la stessa frase nelle inquadrature 2, 3 e 4. La deriva dell'identità è correlata alla deriva del descrittore nei nostri test.

Quale durata dovrei scegliere per un prompt a 4 inquadrature?

10 secondi al minimo, 12 secondi come impostazione predefinita sicura. Questo dà a ogni inquadratura da 2,5 a 3 secondi, che è sufficiente per leggere l'azione. Spingere a 8 secondi lascia ogni inquadratura sotto i 2 secondi, il che diventa un filmato tremolante.

Dove posso provare questi prompt?

Il generatore video PixMind Wan 2.7 espone T2V con la finestra completa del prompt. Incolla qualsiasi modello da questa guida, regola soggetto e stile, e renderizza prima a 720P per iterare a basso costo prima di passare a 1080P.

Guardalo in Azione

Correlato su X: Rel1vs — Discute l'uso di Claude o Grok per i prompt multi-shot di Wan 2.7.

继续浏览中,生成器即将加载...

Strumenti correlati