Come fare il reverse engineering dei prompt video: un workflow shot-by-shot
Un video di riferimento raramente corrisponde a un unico prompt. Si tratta di una sequenza di inquadrature (shot), ognuna con il proprio soggetto, azione, movimento di camera, illuminazione, suono e transizione. Questa guida mostra come trasformare quella sequenza in prompt video AI strutturati e riutilizzabili, senza appiattire l'intera clip in un vago riassunto.
Imparerai un workflow pratico per il reverse engineering dei prompt video, uno schema di output temporizzato, l'analisi dettagliata di sei scene e una checklist per convertire il risultato in Veo, Runway, Seedance o un altro modello di destinazione.
Vuoi ricevere automaticamente una prima bozza? Carica una clip su PixMind Video to Prompt, poi usa questa guida per esaminare e perfezionare l'elenco delle inquadrature.
Parte 1: Concetti chiave e cheat sheet dei parametri
Cos'è il reverse engineering dei prompt video?
Fare il reverse engineering di un prompt video significa analizzare una clip inquadratura per inquadratura e convertire le scelte visive e sonore in un linguaggio di produzione strutturato. Invece di indovinare il prompt originale del creatore, documenti ciò che è effettivamente presente: soggetto, azione, ambiente, inquadratura, movimento di camera, illuminazione, colore, suono e transizioni.
Il risultato non è una copia forense della fonte, bensì una specifica creativa modificabile che puoi riutilizzare con un soggetto, un prodotto, una location o un modello video di destinazione diversi.
La struttura del prompt a cinque livelli
Ogni prompt video efficace è costruito su cinque livelli sovrapposti:
| Livello | Cosa cattura | Esempi di descrittori |
|---|---|---|
| Soggetto | Chi o cosa si trova nell'inquadratura | "una donna con un vestito di lino bianco" |
| Azione / Movimento | Cosa si muove e come | "cammina lentamente nell'erba alta" |
| Ambiente | Luogo, ora del giorno, meteo | "prato all'ora d'oro, vento leggero" |
| Camera | Tipo di inquadratura, movimento, caratteristiche dell'obiettivo | "campo largo in movimento (tracking shot), leggero riflesso della lente" |
| Stile / Atmosfera | Direzione estetica, color grading, tono | "cinematografico, toni caldi, grana della pellicola" |
Cheat sheet dei parametri fondamentali
| Parametro | Valore predefinito iniziale | Opzioni avanzate |
|---|---|---|
| Tipo di inquadratura | Mezzo primo piano (Medium shot) | Primissimo piano / ripresa aerea |
| Velocità del movimento | Velocità normale | Slow motion / time-lapse |
| Illuminazione | Luce diurna naturale | Ora d'oro / retroilluminazione al neon |
| Color grading | Neutro | Teal-orange / desaturato |
| Movimento di camera | Statico | Dolly / camera a mano mossa |
| Indicazione di durata | 5–8 secondi | 15–30 secondi |
| Indicazione audio | Nessuna | Suono d'ambiente / dialogo |
| Rapporto d'aspetto | 16:9 | 9:16 (verticale) / 1:1 |
Principio fondamentale: Inizia con i dettagli che cambiano concretamente l'inquadratura, poi aggiungi un controllo alla volta. Un prompt breve e coerente al suo interno è molto più utile di un prompt lungo che contiene istruzioni contrastanti su camera, luci o azioni.
Uno schema di output per prompt video shot-by-shot
Per le clip multi-inquadratura, crea un record per ogni inquadratura invece di un unico paragrafo per l'intero video:
| Campo | Cosa registrare | Esempio |
|---|---|---|
| Timecode | Inizio e fine dell'inquadratura | 00:04–00:07 |
| Soggetto | Persona, oggetto o prodotto visibile | Runner con una giacca a vento rossa |
| Azione | Movimento del soggetto e dell'ambiente | Il runner si gira; la pioggia cade da sinistra a destra |
| Camera | Tipo di inquadratura, angolazione e movimento | Mezzo primo piano dal basso, tracking a mano |
| Luci e colori | Fonte, direzione, contrasto, palette | Luce chiave fredda da cielo coperto, ombre blu attenuate |
| Audio | Dialogo, ambiente, effetti, musica | Passi, pioggia, pulsazione di bassi profondi |
| Transizione | Come inizia l'inquadratura successiva | Taglio con whip-pan (panoramica a schiaffo) sul movimento |
Questo schema risponde direttamente alle esigenze di estrazione scena per scena, come le ricerche per "AI prompt da clip a singola scena". Inoltre, rende facile individuare gli errori: se uno strumento etichetta un'inquadratura fissa come un movimento di dolly, puoi correggere quel singolo campo senza dover riscrivere l'intero prompt.
Parte 2: Analisi della scena — Paesaggio naturale cinematografico
Obiettivo
Trovi la clip di un documentario di viaggio: una catena montuosa coperta di nebbia all'alba, un lento movimento aereo all'indietro (pull-back), nessuna persona. Vuoi ricreare quell'atmosfera.
✅ Esempio visivo di riferimento
(Esempio illustrativo — non è un output reale del modello PixMind.)
Template di prompt consigliato
Ripresa aerea con drone che si allontana lentamente da una cresta montuosa coperta di nebbia all'alba.
Luce azzurra pallida e arancione tenue filtra attraverso le nuvole basse. Pini visibili in basso.
Senza persone. Color grading cinematografico, riflesso anamorfico (lens flare), qualità 4K.
Atmosfera: serena, vasta, leggermente malinconica.
Durata: ~8 secondi.
Passo dopo passo
- Disattiva l'audio e guarda la clip tre volte. Concentrati solo su ciò che fa la fotocamera — per ora ignora il contenuto del soggetto.
- Identifica la direzione dominante del movimento. In questo caso: verso l'alto + all'indietro (pull-back).
- Definisci la fonte di luce e la sua qualità. Alba = angolazione bassa, diffusa, sfumatura da calda a fredda.
- Sintetizza lo stile in 2-3 aggettivi. "Cinematografico, sereno, vasto."
- Incolla le tue note nello strumento Video-to-Prompt di PixMind per estrarre automaticamente una bozza, quindi perfezionala manualmente.
⚠️ Errore comune
Non scrivere l'intera descrizione della scena come un'unica frase continua. Modelli come Veo 3 funzionano decisamente meglio quando soggetto, movimento e stile sono separati da interruzioni di riga o virgole — nascondere tutto in un unico paragrafo peggiora la qualità dell'output.
Parte 3: Analisi della scena — Pubblicità di prodotto
Obiettivo
Un annuncio pubblicitario di bellezza di 10 secondi: un prodotto su una superficie di marmo, lento zoom in avanti (push-in), illuminazione morbida da studio, sfondo pastello. Desideri estrarre un template riutilizzabile per video di prodotto.
✅ Esempio visivo di riferimento
(Esempio illustrativo — non è un output reale del modello PixMind.)
Template di prompt consigliato
Primo piano con lento zoom in avanti su una boccetta di [nome del prodotto] posizionata su una superficie di marmo bianco.
Illuminazione morbida e diffusa da studio dall'alto a sinistra. Sfondo rosa pastello, fuori fuoco.
Sottili goccioline d'acqua sul prodotto. Senza mani, senza persone.
Estetica elegante, minimale, di lusso. Movimento fluido della fotocamera, senza vibrazioni.
Clip di 5 secondi, 16:9.
Passo dopo passo
- Metti in pausa su tre fotogrammi chiave dell'annuncio di riferimento: l'inizio, la metà e la fine.
- Osserva cosa cambia tra i fotogrammi. In questo caso, cambia solo la distanza della fotocamera (push-in) — lo sfondo e l'illuminazione rimangono costanti.
- Identifica gli elementi specifici del brand e sostituiscili. Sostituisci il nome del prodotto e la palette di colori con i tuoi.
- Fai un test con il generatore video AI Seedance 2 di PixMind — la sua gestione delle scene pubblicitarie di prodotti è ottimizzata specificamente per questo tipo di estetica controllata da studio.
⚠️ Errore comune
Evita descrittori di lusso generici come "high-end" o "premium". Descrivi invece le prove visive del lusso: marmo, ombre morbide, composizione minimale, movimento lento. I modelli rispondono a segnali visivi concreti, non a etichette di qualità astratte.
Parte 4: Analisi della scena — Scena di strada urbana con persone
Obiettivo
Un video in stile street photography: un incrocio trafficato di notte, camera a mano, luci al neon che si riflettono sull'asfalto bagnato, pedoni che si muovono rapidamente nell'inquadratura.
✅ Esempio visivo di riferimento
(Esempio illustrativo — non è un output reale del modello PixMind.)
Template di prompt consigliato
Mezzo primo piano a mano di un incrocio cittadino trafficato di notte, asfalto bagnato che riflette
insegne al neon rosse, blu e gialle. Folla di persone che cammina rapidamente in molteplici
direzioni. Leggero motion blur sui pedoni. Profondità di campo ridotta.
Urbano, crudo, ad alto contrasto. Estetica stile Tokyo o New York.
Camera: leggera oscillazione, nessuna stabilizzazione. 6–8 secondi.
Passo dopo passo
- Elenca ogni fonte di luce nella scena. Insegne al neon, fari delle auto, vetrine dei negozi — ognuna di esse è un descrittore.
- Descrivi la densità della folla. "Diradata", "moderata" o "densa" fornisce al modello un segnale sulla popolazione.
- Cattura la personalità della fotocamera. Camera a mano significa imperfezione intenzionale — scrivi esplicitamente "nessuna stabilizzazione" o "leggera oscillazione della fotocamera".
- Usa lo strumento Text-to-Prompt di PixMind per generare una bozza di base dalle note della scena, quindi aggiungi manualmente i descrittori della fotocamera.
⚠️ Errore comune
Citare un luogo reale specifico (ad esempio, "Incrocio di Shibuya") aiuta a stabilire un riferimento estetico, ma non può sostituire la descrizione visiva. I modelli potrebbero ignorare il nome del luogo e generare una strada generica. Descrivi sempre ciò che vedi, non solo dove si trova.
Parte 5: Analisi della scena — Ritratto in primo piano emotivo
Obiettivo
Un primo piano in stile documentario: il volto di una persona anziana, luce naturale della finestra, lento zoom in avanti (push-in), nessun dialogo, atmosfera contemplativa.
✅ Esempio visivo di riferimento
(Esempio illustrativo — non è un output reale del modello PixMind.)
Template di prompt consigliato
Primo piano con lento zoom in avanti (push-in) sul volto di una persona anziana, circa 65 anni, espressione neutra,
riflessiva e calma. Luce naturale morbida da una finestra sul lato sinistro.
Leggera texture della pelle visibile. Sfondo: interno caldo sfocato.
Stile documentario, color grading desaturato, nessun sottofondo musicale.
Camera: dolly-in molto lento, ultra-stabile. 8 secondi.
Passo dopo passo
- Identifica l'ancora emotiva. Quale singola parola cattura l'atmosfera? In questo caso è "contemplativa". Scrivila esplicitamente.
- Descrivi la direzione e la qualità della luce. "Luce della finestra da sinistra" offre al modello molti più elementi su cui lavorare rispetto a "luce naturale".
- Nota ciò che è deliberatamente assente. Nessun sorriso, nessuna azione, nessun dialogo — i descrittori negativi sono efficaci tanto quanto quelli positivi.
- Fai un test su Veo — in base alle specifiche annunciate, Veo 3/3.1 gestisce particolarmente bene i primi piani umani realistici con una forte fedeltà dell'illuminazione.
⚠️ Errore comune
Non specificare mai il volto o le sembianze di una persona reale in un prompt. Descrivi invece le caratteristiche demografiche ed emotive. In questo modo il prompt rimarrà entro le linee guida d'uso del modello e produrrà risultati più coerenti tra le varie generazioni.
Parte 6: Analisi della scena — Riprese d'azione / sportive
Obiettivo
Un video di surf: prospettiva aerea, atleta che cavalca un'onda enorme, slow motion, spruzzi d'acqua che brillano alla luce del sole, alta energia.
✅ Esempio visivo di riferimento
(Esempio illustrativo — non è un output reale del modello PixMind.)
Template di prompt consigliato
Ripresa aerea dall'alto di un surfista che cavalca una grande onda che si infrange, in slow motion.
Spruzzi d'acqua bianca che esplodono verso l'alto, retroilluminati dal sole splendente di mezzogiorno — effetto scintillio.
Oceano: blu-verde profondo. Surfista: piccolo rispetto all'onda.
Alta energia, composizione dinamica. Camera: angolazione da drone in volo stazionario, leggera inclinazione.
Slow motion al 50% della velocità. 6 secondi, 16:9.
Passo dopo passo
- Stabilisci le relazioni di scala. "Il surfista appare piccolo rispetto all'onda" fornisce al modello un punto di ancoraggio compositivo.
- Descrivi come la luce interagisce con la scena. Gli spruzzi retroilluminati creano un effetto scintillio/alone — indicalo esplicitamente.
- Specifica lo slow motion con un numero. "Velocità al 50%" o "riproduzione a 120fps" è più chiaro rispetto a scrivere semplicemente "slow motion".
- Consulta la pagina dei prompt di Seedance 2 per strutture di prompt specifiche per il movimento, ottimizzate per scene ad alta azione.
⚠️ Errore comune
Le scene ad alta azione sono quelle in cui i modelli producono il maggior numero di artefatti — arti distorti, fisica dell'acqua errata. L'aggiunta di vincoli come "movimento dell'acqua fisicamente realistico" o "nessuna distorsione" riduce sensibilmente la probabilità di questi problemi.
Parte 7: Analisi della scena — Brand Story / Cortometraggio narrativo
Obiettivo
Un brand film di 15 secondi: le mani di un artigiano che modellano l'argilla su un tornio da vasaio, illuminazione calda del laboratorio, dettagli in primo piano, tagli lenti tra le inquadrature.
✅ Esempio visivo di riferimento
(Esempio illustrativo — non è un output reale del modello PixMind.)
Template di prompt consigliato
Primo piano di mani segnate dal tempo che modellano l'argilla bagnata su un tornio da vasaio, movimento lento e deliberato.
Luce calda al tungsteno del laboratorio, particelle di polvere visibili nell'aria.
Sfondo: scaffali di legno sfocati con pezzi di ceramica.
Tattile, artigianale, color grading caldo. Camera: lento push-in macro sulle mani.
Suono d'ambiente: tornio che gira dolcemente, senza musica. 10–12 secondi.
Passo dopo passo
- Inizia con descrittori di texture. "Mani segnate dal tempo", "argilla bagnata", "scaffali di legno" — il linguaggio tattile attiva una resa visiva più ricca.
- Aggiungi dettagli sulle particelle ambientali. "Particelle di polvere visibili nell'aria" aggiunge notevole profondità e realismo senza aumentare la complessità compositiva.
- Includi un'indicazione audio se il modello la supporta. Sia Veo 3 che Seedance 2.5 supportano la generazione nativa dell'audio — "suono d'ambiente: tornio che gira dolcemente" è un elemento di prompt valido ed efficace.
- Fai riferimento ai casi d'uso per annunci di prodotto di Seedance 2 per strutture di prompt di narrativa di brand convalidate rispetto a output commerciali.
⚠️ Errore comune
I prompt narrativi multi-inquadratura (Inquadratura A → Inquadratura B → Inquadratura C) tendono a confondere i modelli a clip singola. Se hai bisogno di tagli tra le inquadrature, genera ogni clip separatamente e assemblale in post-produzione — non cercare di descrivere una sequenza di montaggio all'interno di un singolo prompt.
Parte 8: Framework universale per i prompt e checklist pre-invio
Framework universale per i prompt video
Una struttura che funziona per ogni tipo di scena:
[Tipo di inquadratura] + [Soggetto] + [Azione/Movimento],
[Ambiente] + [Illuminazione],
[Movimento di camera] + [Caratteristiche della fotocamera],
[Stile/Color grading] + [Atmosfera],
[Durata] + [Rapporto d'aspetto].
Opzionale: [Indicazione audio].
Esempio compilato:
Campo largo in movimento (tracking shot) di una donna con un cappotto rosso che cammina in una foresta innevata,
luce del tardo pomeriggio che filtra tra gli alberi spogli, ombre blu morbide sulla neve.
Camera: tracciamento laterale lento, fluido e stabile.
Cinematografico, toni freddi desaturati, silenzioso e malinconico.
8 secondi, 16:9. Senza dialoghi.
Riferimento per la lunghezza del prompt
| Lunghezza del prompt | Ideale per | Rischio |
|---|---|---|
| Meno di 30 parole | Test rapidi, esplorazione dello stile | Troppo vago, output incoerente |
| 40–80 parole | La maggior parte dei casi d'uso in produzione | Punto di equilibrio ideale |
| 80–120 parole | Scene complesse con molti elementi | Possibili conflitti tra elementi |
| Più di 120 parole | Raramente appropriato | Alto rischio di contraddizioni |
Checklist pre-invio
Scorri questo elenco prima di inviare qualsiasi prompt video:
- [ ] Nessuna istruzione di movimento in conflitto — ad esempio, "camera a mano" e "perfettamente stabile" non possono coesistere nello stesso prompt.
- [ ] La fonte di luce è specificata — "luce naturale" è più debole di "luce laterale dell'ora d'oro da destra".
- [ ] Il movimento di camera è specificato — statico, dolly, panoramica (pan), inclinazione (tilt), camera a mano, aereo: scegline uno e indicalo chiaramente.
- [ ] Le relazioni di scala del soggetto sono definite — particolarmente importante in paesaggi, scene d'azione e inquadrature di folla.
- [ ] Gli aggettivi di stile sono visivi, non astratti — "toni caldi, grana della pellicola" è molto meglio di "capolavoro cinematografico".
- [ ] La durata è inclusa — i modelli utilizzano la durata per calibrare il ritmo del movimento e le transizioni.
- [ ] Nessuna somiglianza con persone reali viene citata — descrivi le caratteristiche fisiche ed emotive, non un'identità specifica.
- [ ] Indicazione audio aggiunta per i modelli che la supportano — non lasciare vuoto il campo audio nei prompt per Veo 3 o Seedance 2.5.
Riferimento rapido: Strumenti PixMind consigliati per fase
| Fase | Attività | Strumento consigliato |
|---|---|---|
| 1 | Carica il filmato, ottieni una bozza di prompt | Video-to-Prompt |
| 2 | Perfeziona le note della scena in un prompt rifinito | Text-to-Prompt |
| 3 | Genera il video dal tuo prompt finale | Veo o Seedance 2 |
| 4 | Approfondisci la strategia dei prompt | Guida YouTube Video-to-Prompt |
Parte 9: Tiriamo le somme
Il text-to-prompt è fondamentalmente un'abilità di traduzione — convertire le informazioni visive nel vocabolario specifico che i modelli di intelligenza artificiale sono addestrati a comprendere. Più descrivi con precisione ciò che vedi (piuttosto che ciò che provi), più il modello sarà in grado di riprodurlo in modo coerente.
Inizia con il framework a cinque livelli, usa il template universale come struttura di base ed esegui la checklist prima di ogni invio. Con il tempo, costruirai una libreria personale di template di prompt testati che potrai adattare a qualsiasi nuovo progetto.
Il modo più rapido per accelerare questo processo: usa lo strumento Video-to-Prompt di PixMind per estrarre automaticamente una bozza dal filmato di riferimento, quindi applica le tecniche di questa guida per perfezionarla manualmente. La combinazione di estrazione automatica e perfezionamento umano supera costantemente ciascuno dei due approcci presi singolarmente.



