Wan 2.7 Prompt Engineering: 12 Modelli Riutilizzabili
Punti Chiave
- I prompt di Wan 2.7 funzionano meglio con un'anatomia a cinque segmenti: soggetto, azione, ambientazione, telecamera e stile.
- Dodici modelli riutilizzabili coprono l'80 percento dei casi d'uso T2V, I2V e first-last-frame che vediamo in produzione.
- Ogni modello include un template, un esempio pratico e la specifica modalità di errore che abbiamo misurato su render reali.
- La maggior parte dei fallimenti è riconducibile a prompt sovraccarichi, intento della telecamera mancante o modalità errata per l'input. I modelli seguenti risolvono i primi due.
- Per ricette multi-shot più approfondite, consulta la pagina dei prompt multi-shot di PixMind Wan 2.7.
Struttura di ricompensa di Wan 2.7. Un prompt senza intento della telecamera predefinisce uno scatto grandangolare statico. Un prompt senza indicazione di stile predefinisce un fotorealismo neutro. I modelli seguenti sono stati estratti da circa 600 render attraverso le modalità T2V, I2V e first-last-frame durante giugno e luglio 2026. Li abbiamo nominati in modo che il team potesse smettere di riscrivere i prompt da zero.
Qual è l'Anatomia di un Prompt Wan 2.7?
Ogni prompt Wan 2.7 affidabile che abbiamo rilasciato ha cinque segmenti: soggetto, azione, ambientazione, telecamera, stile. La guida alla generazione video di Alibaba Cloud Model Studio conferma che il modello li tratta come campi semantici discreti, non come prosa a forma libera. Il modello è: nominare prima il soggetto, poi l'azione, poi l'ambientazione, poi la telecamera, poi lo stile.

I segmenti mancanti sono la causa principale di output generici. Quando il prompt omette l'intento della telecamera, Wan 2.7 ne sceglie uno predefinito. Quando il prompt omette lo stile, si ottiene un fotorealismo neutro, il che va bene ma raramente è l'obiettivo.
Abbiamo testato 80 prompt rimuovendo un segmento alla volta. L'omissione dello stile ha prodotto il calo di qualità maggiore, seguita da vicino dall'omissione della telecamera. La rimozione del soggetto ha interrotto il render completamente circa un terzo delle volte.
Soggetto
Il soggetto è il nome a cui è puntata la telecamera. Usa un singolo soggetto primario quando possibile. Due soggetti funzionano se la loro relazione è spaziale ("un bicchiere accanto a una bottiglia"). Tre o più soggetti sovraccaricano il modello e producono artefatti di fusione.
Azione
L'azione è ciò che il soggetto fa per tutta la durata del clip. Wan 2.7 legge i verbi letteralmente. "Spruzzare" produce movimento. "Sedersi" produce un soggetto statico. Abbina la durata dell'azione alla durata del clip: un render di 2 secondi non può contenere un'azione di 10 secondi.
Ambientazione
L'ambientazione è l'ambiente e l'illuminazione. Sii specifico. "Sfondo da studio con una singola luce chiave calda da sinistra della telecamera" è meglio di "illuminazione da studio". La direzione della luce è importante perché definisce l'aspetto dei riflessi, dove di solito appare la distorsione.
Telecamera
Il segmento della telecamera nomina l'obiettivo, l'inquadratura e il movimento. Wan 2.7 supporta statico, push, pull, orbit, dolly, pan, tilt e a mano libera. Specifica la lunghezza focale in millimetri quando il campo visivo è importante. Un'inquadratura media da 50mm appare diversa da un'ampia da 24mm.
Stile
Il segmento dello stile è quello con il peso maggiore. Cinematografico, editoriale, documentaristico, anime, d'archivio, iperrealistico. Scegli uno. L'impilamento degli stili ("documentario cinematografico d'archivio") produce rumore visivo.
Modello 1: L'Anatomia a 5 Segmenti
Quando usarlo
Usa l'Anatomia a 5 Segmenti per ogni prompt predefinito. È il modello base che ogni altro modello in questa guida estende. Se impari un solo modello, impara questo.
Template
[Subject]. [Action]. [Setting]. [Camera: framing, focal length, motion]. [Style: one descriptor, optional modifiers].
Esempio pratico
Una bottiglia di profumo di vetro su una superficie nera lucida. Uno spruzzo di goccioline sottili erutta a destra. Sfondo nero da studio, singola luce chiave calda da sinistra della telecamera. Inquadratura media statica, equivalente a 50mm. Cinematografico, profondità di campo ridotta, luce di contorno calda.
Errore comune
Sovraccaricare un singolo segmento con intenti multipli. Ad esempio, "look cinematografico editoriale documentaristico" nello slot dello stile produce una media piatta di tutti e tre. Scegli uno.
Modello 2: La Rivelazione Inversa
Quando usarlo
Usa la Rivelazione Inversa quando vuoi nascondere il soggetto all'inizio del clip e rivelarlo alla fine. Funziona per le rivelazioni di prodotti, l'apertura di regali e qualsiasi "gancio" che dipenda dalla curiosità. Il cluster di prompt first-last-frame di PixMind copre questo modello in profondità con ricette di keyframe.
Template
[Extreme close-up of one detail of the subject]. [The camera pulls back slowly to reveal the full subject]. [Setting]. [Camera: slow pull-back, 35mm to 50mm]. [Style].
Esempio pratico
Primo piano estremo dei denti di una cerniera metallica su un tessuto scuro. La telecamera si allontana lentamente per rivelare una giacca di pelle strutturata appoggiata su un pavimento di cemento. Loft industriale con luce da finestra laterale, particelle di polvere visibili. Lento allontanamento, equivalente a 35mm a 50mm. Moda editoriale, contrasto morbido.
Errore comune
Allontanarsi troppo velocemente. Wan 2.7 legge "lentamente" ma ignora le parole qualitative di velocità quando la durata è breve. A 2 secondi, la rivelazione non ha tempo di manifestarsi. Usa un minimo di 5 secondi per la Rivelazione Inversa.
Modello 3: La Spinta in Avanti della Telecamera
Quando usarlo
La Spinta in Avanti della Telecamera serve per l'enfasi. Quando il soggetto è già inquadrato e vuoi approfondire l'attenzione dello spettatore, spingi in avanti. È l'equivalente cinematografico di uno zoom, ma prodotto muovendo fisicamente la telecamera in avanti.
Template
[Subject, already framed]. [Subtle action: a glance, a shift, a flicker]. [Setting]. [Camera: steady push-in from medium to close-up, 50mm]. [Style: cinematic, shallow depth of field].
Esempio pratico
Una teiera di ceramica su un tavolo di legno, vapore che sale dal beccuccio. La telecamera si sposta da un'inquadratura media a un primo piano in 4 secondi. Cucina mattutina, luce soffusa dalla finestra da destra della telecamera. Spinta costante in avanti, equivalente a 50mm. Cinematografico, toni caldi.
Errore comune
Combinare la spinta in avanti con il movimento del soggetto. Se anche il soggetto si muove, il movimento della telecamera viene interpretato come tremolio a mano libera. O la telecamera si muove o il soggetto si muove, non entrambi.
Modello 4: L'Orbita
Quando usarlo
L'Orbita mostra un soggetto 3D da più angolazioni in un'unica ripresa continua. Usala per prodotti, sculture e architettura dove la comprensione dimensionale è importante. Secondo la riferimento API I2V di Alibaba Cloud, il modello interpreta "orbita" come un percorso della telecamera a 360 gradi attorno a un soggetto bloccato.
Template
[Subject centered in frame]. [Subject is still or has minimal motion]. [Setting: simple backdrop, no competing detail]. [Camera: 360-degree orbit around the subject at eye level]. [Style].
Esempio pratico
Un vaso di ceramica minimalista centrato su un piedistallo di pietra. Il vaso è immobile, con un singolo stelo essiccato all'interno. Spazio galleria vuoto, luce diurna soffusa da un lucernario. Orbita a 360 gradi all'altezza degli occhi, equivalente a 35mm. Film di prodotto editoriale, contrasto morbido.
Errore comune
Orbitare contro uno sfondo complesso. Il modello deve inventare cosa c'è dietro il soggetto mentre la telecamera si muove. Mantieni lo sfondo pulito o aspettati artefatti.
Modello 5: Il Pull-Focus sul Dettaglio del Prodotto
Quando usarlo
Usa il Pull-Focus quando devi dirigere l'attenzione dall'intero prodotto a una caratteristica specifica. È il modello standard per i clip di marketing di prodotto in cui un dettaglio (un logo, una texture, una chiusura) necessita del tocco finale.
Template
[Wide frame showing the full product]. [A specific detail is in the background, slightly soft]. [Setting]. [Camera: rack focus from wide to the detail over 3 seconds, then hold]. [Style].
Esempio pratico
Un portafoglio di pelle aperto su una superficie di ardesia. Il marchio del produttore in rilievo si trova sulla patta interna, leggermente fuori fuoco. Superficie di ardesia, luce laterale radente, ombra profonda. Rack focus dal portafoglio al marchio del produttore in 3 secondi, mantieni per 2 secondi. Prodotto editoriale, toni caldi.
Errore comune
Dimenticare di specificare quale dettaglio ottiene la messa a fuoco. Il modello ne sceglie uno. Se il prompt non nomina l'obiettivo della messa a fuoco, si ottiene un dettaglio arbitrario a fuoco, spesso quello sbagliato.
Modello 6: La Sequenza Multi-Shot
Quando usarlo
La Sequenza Multi-Shot unisce due o più inquadrature in un'unica generazione. È il modello giusto per narrazioni brevi, rivelazioni di prodotti con contesto o "ganci" social che necessitano di un'inquadratura di apertura e di una risoluzione. La pagina dei prompt multi-shot di PixMind Wan 2.7 è il compagno approfondito di questo modello.
Template
Shot 1 (establishing): [wide framing, setting]. Shot 2 (closer): [subject, action]. Shot 3 (detail): [close-up, key detail]. [Setting runs through]. [Camera: explicit per shot]. [Style].
Esempio pratico
Inquadratura 1: ampia inquadratura di apertura di una strada laterale di Tokyo bagnata dalla pioggia di notte, riflessi al neon sull'asfalto bagnato. Inquadratura 2: inquadratura media di un ombrello che si inclina verso l'alto per rivelare una figura retroilluminata. Inquadratura 3: primo piano di goccioline di pioggia che scivolano dal bordo dell'ombrello. Vicolo di Tokyo, insegne al neon, superfici bagnate. Telecamera: grandangolo bloccato, lenta inclinazione verso l'alto, macro statica. Cinematografico, palette di colori freddi.
Errore comune
Tre inquadrature in un clip di 2 secondi. Ogni inquadratura necessita di almeno 1,5 secondi per essere percepita. Tre inquadrature significano un minimo di 5 secondi. Qualsiasi cosa più breve produce uno stroboscopio.
Modello 7: La Compressione Time-Lapse
Quando usarlo
Usa la Compressione Time-Lapse quando vuoi mostrare un lungo processo in un breve clip. Tramonti, crescita delle piante, sequenze di costruzione e decadimento si adattano tutti. Wan 2.7 legge "time-lapse" come movimento accelerato, non come salto di fotogrammi letterale.
Template
[Subject positioned for a long-duration change]. [Slow transformation: light shifting, shadows moving, material settling]. [Setting]. [Camera: locked-off static shot, 24mm to 35mm]. [Style: time-lapse, soft motion blur on transitions].
Esempio pratico
Una ciotola di frutta su un tavolo di legno vicino a una finestra. Per tutta la durata, la luce passa da una fresca mattina a un caldo pomeriggio, le ombre ruotano, la mela si ammorbidisce lentamente. Stanza naturale, singola finestra. Inquadratura statica fissa, equivalente a 35mm. Time-lapse, gradazione calda.
Errore comune
Chiedere una trasformazione che superi la fisica del modello. Un fiore che si apre in 3 secondi funziona. Un edificio in costruzione in 5 secondi no.
Modello 8: Il Modello Ritmo Sincronizzato all'Audio
Quando usarlo
Il Modello Ritmo Sincronizzato all'Audio abbina la modalità I2V guidata dall'audio a un prompt strutturato attorno al ritmo dell'audio. Usalo per clip di "talking-head", rivelazioni di prodotti sincronizzate con la musica e qualsiasi caso in cui l'audio definisca l'energia del movimento. Il cluster di prompt audio-sync di PixMind copre questo in profondità.
Template
[Subject portrait or product]. [Motion cue mapped to audio: "subtle sway on the beat", "lip-sync", "pulse on the downbeat"]. [Setting: simple, neutral]. [Camera: static or minimal drift]. [Style]. Pair with [audio file: type, duration, BPM if musical].
Esempio pratico
Ritratto di avatar stilizzato, rivolto verso la telecamera. Sincronizzazione labiale con la voce fuori campo allegata, leggero ondeggiamento della testa ai confini delle frasi, battito di ciglia tra le frasi. Sfondo scuro neutro, luce chiave morbida. Primo piano medio statico, equivalente a 50mm. Ritratto cinematografico, bordo caldo. Abbinato a una voce fuori campo di 6 secondi a 120 BPM.
Errore comune
Dimenticare di allegare l'audio. Senza audio, il modello inventa un movimento inattivo generico e l'affermazione di sincronizzazione labiale viene ignorata. Conferma sempre che l'input audio sia allegato prima del rendering.
Modello 9: Lo Storyboard Primo-Ultimo Fotogramma
Quando usarlo
Lo Storyboard Primo-Ultimo Fotogramma è il modello per qualsiasi clip in cui lo stato iniziale e lo stato finale devono essere specifici. Wan 2.7 interpola i fotogrammi intermedi. Usalo per aperture di regali, aperture di porte, trasformazioni e rivelazioni di prodotti in cui il fotogramma finale è un'immagine conosciuta.
Template
First frame: [exact description of the start image]. Last frame: [exact description of the end image]. [Connecting action that transforms start to end]. [Setting consistent across both frames]. [Camera: explicit and consistent]. [Style].
Esempio pratico
Primo fotogramma: una scatola regalo opaca chiusa su una superficie di marmo, vista dall'alto. Ultimo fotogramma: la stessa scatola completamente aperta, luce che fuoriesce dall'interno, coperchio appoggiato di lato. Il coperchio si solleva lentamente e la luce si riversa. Superficie di marmo, singola luce dall'alto. Dall'alto fissa, equivalente a 35mm. Cinematografico, luce volumetrica calda.
Errore comune
Angoli della telecamera non corrispondenti tra i due keyframe. Se il primo fotogramma è dall'alto e l'ultimo fotogramma è all'altezza degli occhi, il modello inventa un movimento della telecamera che di solito appare sbagliato. Fai corrispondere gli angoli della telecamera su entrambi i keyframe.
Modello 10: Il Remake Bloccato su Riferimento
Quando usarlo
Il Remake Bloccato su Riferimento utilizza la modalità R2V per preservare identità, stile o movimento da un clip di riferimento. Usalo quando l'output deve assomigliare al personaggio, alla voce o allo stile visivo dell'input attraverso più inquadrature. Secondo la guida Alibaba Cloud Wan I2V, R2V accetta fino a cinque immagini di riferimento e cinque clip di riferimento in una singola chiamata.
Template
Reference inputs: [N reference images, M reference clips, optional audio]. [Subject description matching the reference identity]. [Action within the reference character's range]. [Setting]. [Camera]. [Style consistent with reference].
Esempio pratico
Input di riferimento: tre immagini di riferimento di un personaggio anime stilizzato, un clip di riferimento di un ciclo di camminata, nessun audio di riferimento. Lo stesso personaggio anime stilizzato cammina attraverso un vicolo illuminato al neon, si guarda indietro una volta. Vicolo illuminato al neon di notte, riflessi sul terreno bagnato. Inquadratura media in movimento, equivalente a 50mm. Anime, gradazione di colore vibrante.
Errore comune
Mescolare identità di riferimento. Se le immagini di riferimento mostrano due personaggi diversi, il modello li media. Blocca su un'unica identità per render.
Modello 11: La Rivelazione dello Spazio Negativo
Quando usarlo
La Rivelazione dello Spazio Negativo utilizza l'area vuota del fotogramma come palcoscenico per l'arrivo del soggetto. Usala per "ganci" in cui l'occhio dello spettatore è attratto dal vuoto e poi ricompensato. Funziona bene per i formati social verticali in cui il primo fotogramma deve essere visivamente tranquillo.
Template
[Frame opens on mostly empty space, single subtle texture]. [The subject enters from a frame edge, slow]. [Setting: minimal, single light source]. [Camera: static or slow drift]. [Style].
Esempio pratico
Il fotogramma si apre su una parete di cemento quasi vuota con un singolo raggio di luce calda. Una figura entra lentamente dal bordo destro, cammina nella luce, si ferma. Interno in cemento, singolo raggio di luce calda, ombra profonda. Inquadratura media statica, equivalente a 50mm. Cinematografico, alto contrasto.
Errore comune
Riempire lo spazio negativo troppo presto. Se il soggetto entra nel primo secondo, il "gancio" muore. Mantieni il fotogramma vuoto per almeno 1,5 secondi prima che il soggetto arrivi.
Modello 12: Il Modello Sottile a Micro-Movimento
Quando usarlo
Il modello a Micro-Movimento è per i casi in cui il clip dovrebbe sembrare quasi un'immagine fissa con un minuscolo segnale di movimento. È la scelta giusta per scatti di prodotti editoriali, ritratti in stile archivio e qualsiasi contesto in cui un movimento evidente appare scadente.
Template
[Subject framed as a still image]. [One single subtle motion: a blink, a breath, a steam wisp, a fabric shift]. [Setting]. [Camera: locked-off static]. [Style: editorial, minimal motion].
Esempio pratico
Una tazza di ceramica di caffè nero su una superficie di lino, vista dall'alto. Un singolo ricciolo di vapore sale dalla superficie del caffè. Superficie di lino, luce soffusa dalla finestra da destra della telecamera. Dall'alto fissa, equivalente a 50mm. Natura morta editoriale, luce naturale calda.
Errore comune
Aggiungere un secondo movimento. Il modello funziona perché si muove esattamente una cosa. Un secondo movimento (vapore più uno spostamento d'ombra) rompe l'incantesimo e il clip viene letto come un video ordinario.
Come Si Combinano i Modelli?
La maggior parte dei clip di produzione combina due modelli. Una Rivelazione Inversa più un Pull-Focus è una comune rivelazione di prodotto. Una Sequenza Multi-Shot più una finitura a Micro-Movimento è un comune "gancio" social. La regola generale: combina un modello strutturale (anatomia, multi-shot, primo-ultimo fotogramma) con un modello di movimento (orbita, spinta, pull-focus).
[INSIGHT UNICO] I modelli che si combinano bene condividono un intento della telecamera. I modelli con intenti della telecamera contrastanti, come Orbita più Spinta, si scontrano e producono tremolio. Scegli modelli i cui segmenti della telecamera concordano.
Quando si combinano, scrivi il prompt nell'ordine in cui lo vedrà lo spettatore. Il modello legge i prompt da sinistra a destra e pondera i segmenti precedenti più pesantemente. Le prime 20 parole del prompt guidano la maggior parte del risultato visivo.
Per un contesto di confronto tra i modelli, consulta la nostra guida completa al generatore video Wan 2.7 e il compagno di prompt multi-shot Wan 2.7.
FAQ sull'Ingegneria dei Prompt Wan 2.7
Quanto dovrebbe essere lungo un prompt Wan 2.7?
Un prompt Wan 2.7 funzionante è di 40-80 parole e copre tutti e cinque i segmenti anatomici. Prompt più lunghi diluiscono l'intento della telecamera. Prompt più brevi lasciano troppo al modello precedente. I 12 modelli sopra rientrano tutti in questo intervallo. Secondo la panoramica sulla generazione video di Alibaba Cloud Model Studio, il modello tronca i prompt oltre circa 500 token.
Wan 2.7 supporta i prompt negativi?
Wan 2.7 accetta prompt negativi ma li pondera leggermente rispetto ai modelli di immagine. Mantieni i prompt negativi brevi, al massimo tre o cinque termini. Lunghe liste negative hanno un effetto minimo e consumano il budget del prompt. Usa negativi specifici come "testo, filigrana, logo" piuttosto che astratti come "brutto".
Dovrei usare PromptExtend su Wan 2.7?
Dipende. PromptExtend aiuta quando il tuo prompt base è inferiore a 30 parole. Diluisce istruzioni specifiche della telecamera quando il tuo prompt base copre già l'anatomia a cinque segmenti. Testa entrambi i modi su un render. La nostra recensione di PromptExtend in Wan 2.7 contiene i dati comparativi.
Qual è il modello migliore per gli annunci di prodotti?
Lo Storyboard Primo-Ultimo Fotogramma più la Spinta in Avanti della Telecamera è la combinazione più forte che abbiamo misurato per gli annunci di prodotti. Inizia con un'ampia inquadratura del prodotto, termina con un primo piano di un dettaglio. Il cluster di casi d'uso di PixMind per il marketing di prodotto contiene studi di caso completi.
Come posso prevenire la distorsione su superfici riflettenti?
Riduci l'ampiezza del movimento nel prompt. Sostituisci "rotazione veloce" con "lenta deriva". Aggiungi una direzione esplicita della luce nel segmento dell'ambientazione perché i riflessi seguono la luce. Testa prima a 720P perché la distorsione è più visibile a 1080P.
Guardalo in Azione
Correlato su X: Rel1vs — Discute l'uso di Claude o Grok per descrivere riferimenti per i prompt di Wan 2.7..


