Ingénierie des Prompts Wan 2.7 : 12 Modèles Réutilisables
Points Clés
- Les prompts Wan 2.7 fonctionnent mieux avec une anatomie en cinq segments : sujet, action, décor, caméra et style.
- Douze modèles réutilisables couvrent 80 % des cas d'utilisation T2V, I2V et de première-dernière-image que nous rencontrons en production.
- Chaque modèle comprend un template, un exemple concret et le mode d'échec spécifique que nous avons mesuré sur des rendus réels.
- La plupart des échecs proviennent de prompts surchargés, d'une intention de caméra manquante ou d'un mode incorrect pour l'entrée. Les modèles ci-dessous corrigent les deux premiers.
- Pour des recettes multi-plans plus approfondies, consultez la page des prompts multi-plans Wan 2.7 de PixMind.
Structure de récompense de Wan 2.7. Un prompt sans intention de caméra par défaut est un plan large statique. Un prompt sans indication de style par défaut est un photoréalisme neutre. Les modèles ci-dessous ont été extraits d'environ 600 rendus à travers les modes T2V, I2V et première-dernière-image en juin et juillet 2026. Nous les avons nommés ainsi pour que l'équipe puisse cesser de réécrire les prompts à partir de zéro.
Quelle est l'anatomie d'un Prompt Wan 2.7 ?
Chaque prompt Wan 2.7 fiable que nous avons livré comporte cinq segments : sujet, action, décor, caméra, style. Le guide de génération vidéo d'Alibaba Cloud Model Studio confirme que le modèle les traite comme des champs sémantiques discrets, et non comme de la prose libre. Le modèle est le suivant : nommez d'abord le sujet, puis l'action, puis le décor, puis la caméra, puis le style.

Les segments manquants sont la principale cause de résultats génériques. Lorsque le prompt omet l'intention de la caméra, Wan 2.7 choisit une valeur par défaut. Lorsque le prompt omet le style, vous obtenez un photoréalisme neutre, ce qui est bien mais rarement l'objectif.
Nous avons testé 80 prompts en supprimant chaque segment tour à tour. L'omission du style a produit la plus grande baisse de qualité, suivie de près par l'omission de la caméra. La suppression du sujet a carrément cassé le rendu environ un tiers du temps.
Sujet
Le sujet est le nom vers lequel la caméra est pointée. Utilisez un seul sujet principal lorsque cela est possible. Deux sujets fonctionnent si leur relation est spatiale ("un verre à côté d'une bouteille"). Trois sujets ou plus surchargent le modèle et produisent des artefacts de fusion.
Action
L'action est ce que le sujet fait pendant la durée du clip. Wan 2.7 lit les verbes littéralement. "Pulvériser" produit du mouvement. "S'asseoir" produit un sujet statique. Adaptez la durée de l'action à la durée du clip : un rendu de 2 secondes ne peut pas contenir une action de 10 secondes.
Décor
Le décor est l'environnement et l'éclairage. Soyez précis. "Fond de studio avec une seule lumière clé venant de la gauche de la caméra" est mieux que "éclairage de studio". La direction de la lumière est importante car elle détermine l'aspect des reflets, où les déformations apparaissent généralement.
Caméra
Le segment caméra nomme l'objectif, le cadrage et le mouvement. Wan 2.7 prend en charge les mouvements statique, push, pull, orbit, dolly, pan, tilt et handheld. Spécifiez la focale en millimètres lorsque le champ de vision est important. Un plan moyen de 50 mm est différent d'un plan large de 24 mm.
Style
Le segment de style est le plus fortement pondéré. Cinématique, éditorial, documentaire, anime, archivistique, hyperréaliste. Choisissez-en un. L'empilement de styles ("cinematic documentary archival") produit du bruit visuel.
Modèle 1 : L'anatomie à 5 segments
Quand l'utiliser
Utilisez l'anatomie à 5 segments pour chaque prompt par défaut. C'est le modèle de base que tous les autres modèles de ce guide étendent. Si vous n'apprenez qu'un seul modèle, apprenez celui-ci.
Modèle
[Subject]. [Action]. [Setting]. [Camera: framing, focal length, motion]. [Style: one descriptor, optional modifiers].
Exemple concret
Un flacon de parfum en verre sur une surface noire polie. Une pulvérisation de fines gouttelettes éclate vers la droite. Fond de studio noir, une seule lumière clé chaude venant de la gauche de la caméra. Plan moyen statique, équivalent 50mm. Cinématique, faible profondeur de champ, lumière de contour chaude.
Échec courant
Surcharger un seul segment avec plusieurs intentions. Par exemple, "cinematic editorial documentary look" dans l'emplacement de style produit une moyenne plate des trois. Choisissez-en un.
Modèle 2 : La révélation inversée
Quand l'utiliser
Utilisez la révélation inversée lorsque vous souhaitez cacher le sujet au début du clip et le révéler à la fin. Cela fonctionne pour les révélations de produits, les ouvertures de cadeaux et tout accroche qui dépend de la curiosité. Le cluster de prompts première-dernière-image de PixMind couvre ce modèle en profondeur avec des recettes de keyframes.
Modèle
[Extreme close-up of one detail of the subject]. [The camera pulls back slowly to reveal the full subject]. [Setting]. [Camera: slow pull-back, 35mm to 50mm]. [Style].
Exemple concret
Gros plan extrême sur les dents d'une fermeture éclair métallique sur un tissu sombre. La caméra recule lentement pour révéler une veste en cuir structurée posée sur un sol en béton. Loft industriel avec lumière de fenêtre latérale, particules de poussière visibles. Recul lent, équivalent 35mm à 50mm. Mode éditoriale, contraste doux.
Échec courant
Reculer trop vite. Wan 2.7 lit "lentement" mais ignore les mots de vitesse qualitative lorsque la durée est courte. À 2 secondes, la révélation n'a pas le temps de se produire. Utilisez 5 secondes minimum pour la révélation inversée.
Modèle 3 : Le Poussée avant de la caméra
Quand l'utiliser
La poussée avant de la caméra est destinée à l'emphase. Lorsque le sujet est déjà cadré et que vous souhaitez approfondir l'attention du spectateur, avancez. C'est l'équivalent cinématographique d'un zoom, mais produit par le déplacement physique de la caméra vers l'avant.
Modèle
[Subject, already framed]. [Subtle action: a glance, a shift, a flicker]. [Setting]. [Camera: steady push-in from medium to close-up, 50mm]. [Style: cinematic, shallow depth of field].
Exemple concret
Une théière en céramique sur une table en bois, de la vapeur s'échappant du bec. La caméra effectue un travelling avant d'un plan moyen à un gros plan sur 4 secondes. Cuisine matinale, lumière douce de la fenêtre venant de la droite de la caméra. Travelling avant stable, équivalent 50mm. Cinématique, tons chauds.
Échec courant
Combiner le travelling avant avec le mouvement du sujet. Si le sujet bouge également, le mouvement de la caméra est interprété comme un tremblement à main levée. Soit la caméra bouge, soit le sujet bouge, pas les deux.
Modèle 4 : L'orbite
Quand l'utiliser
L'orbite présente un sujet 3D sous plusieurs angles en un seul plan continu. Utilisez-le pour les produits, les sculptures et l'architecture où la compréhension dimensionnelle est importante. Selon la référence API I2V d'Alibaba Cloud, le modèle interprète "orbite" comme un chemin de caméra à 360 degrés autour d'un sujet fixe.
Modèle
[Subject centered in frame]. [Subject is still or has minimal motion]. [Setting: simple backdrop, no competing detail]. [Camera: 360-degree orbit around the subject at eye level]. [Style].
Exemple concret
Un vase en céramique minimaliste centré sur un socle en pierre. Le vase est immobile, avec une seule tige séchée à l'intérieur. Espace de galerie vide, lumière du jour douce provenant d'une lucarne. Orbite à 360 degrés au niveau des yeux, équivalent 35mm. Film de produit éditorial, contraste doux.
Échec courant
Orbiter contre un arrière-plan complexe. Le modèle doit inventer ce qui se trouve derrière le sujet lorsque la caméra bouge. Gardez l'arrière-plan propre ou attendez-vous à des artefacts.
Modèle 5 : Le "Pull-Focus" sur le détail du produit
Quand l'utiliser
Utilisez le "Pull-Focus" lorsque vous devez diriger l'attention de l'ensemble du produit vers une caractéristique spécifique. C'est le modèle standard pour les clips de marketing produit où un détail (un logo, une texture, un fermoir) nécessite le coup de projecteur final.
Modèle
[Wide frame showing the full product]. [A specific detail is in the background, slightly soft]. [Setting]. [Camera: rack focus from wide to the detail over 3 seconds, then hold]. [Style].
Exemple concret
Un portefeuille en cuir ouvert posé sur une surface d'ardoise. La marque du fabricant en relief se trouve sur le rabat intérieur, légèrement floue. Surface d'ardoise, lumière latérale rasante, ombre profonde. Mise au point en rack du portefeuille vers la marque du fabricant sur 3 secondes, maintien pendant 2 secondes. Produit éditorial, tons chauds.
Échec courant
Oublier de spécifier quel détail est mis au point. Le modèle en choisit un. Si le prompt ne nomme pas la cible de la mise au point, vous obtenez un détail arbitraire mis au point, souvent le mauvais.
Modèle 6 : La séquence multi-plans
Quand l'utiliser
La séquence multi-plans assemble deux plans ou plus en une seule génération. C'est le bon modèle pour les récits courts, les révélations de produits avec contexte, ou les accroches sociales qui nécessitent un plan d'établissement et une récompense. La page des prompts multi-plans Wan 2.7 de PixMind est le compagnon approfondi de ce modèle.
Modèle
Shot 1 (establishing): [wide framing, setting]. Shot 2 (closer): [subject, action]. Shot 3 (detail): [close-up, key detail]. [Setting runs through]. [Camera: explicit per shot]. [Style].
Exemple concret
Plan 1 : plan d'établissement large d'une ruelle de Tokyo détrempée par la pluie la nuit, reflets néon sur l'asphalte mouillé. Plan 2 : plan moyen d'un parapluie s'inclinant pour révéler une silhouette à contre-jour. Plan 3 : gros plan de gouttes de pluie glissant du bord du parapluie. Ruelle de Tokyo, enseignes néon, surfaces mouillées. Caméra : large fixe, lent tilt-up, macro statique. Cinématique, palette de couleurs froides.
Échec courant
Trois plans dans un clip de 2 secondes. Chaque plan a besoin d'au moins 1,5 seconde pour être enregistré. Trois plans signifient 5 secondes minimum. Tout ce qui est plus court produit un effet stroboscopique.
Modèle 7 : La compression en Time-Lapse
Quand l'utiliser
Utilisez la compression en Time-Lapse lorsque vous souhaitez montrer un long processus dans un court clip. Les couchers de soleil, la croissance des plantes, les séquences de construction et de décomposition s'y prêtent tous. Wan 2.7 interprète "time-lapse" comme un mouvement accéléré, et non comme un saut d'images littéral.
Modèle
[Subject positioned for a long-duration change]. [Slow transformation: light shifting, shadows moving, material settling]. [Setting]. [Camera: locked-off static shot, 24mm to 35mm]. [Style: time-lapse, soft motion blur on transitions].
Exemple concret
Un bol de fruits sur une table en bois près d'une fenêtre. Pendant la durée, la lumière passe d'un matin frais à un après-midi chaud, les ombres tournent, la pomme ramollit lentement. Pièce naturelle, une seule fenêtre. Plan statique fixe, équivalent 35mm. Time-lapse, étalonnage chaud.
Échec courant
Demander une transformation qui dépasse la physique du modèle. Une fleur s'ouvrant en 3 secondes fonctionne. Un bâtiment en construction en 5 secondes ne fonctionne pas.
Modèle 8 : Le modèle de rythme synchronisé à l'audio
Quand l'utiliser
Le modèle de rythme synchronisé à l'audio associe le mode audio-driven I2V à un prompt structuré autour du rythme de l'audio. Utilisez-le pour les clips de "talking-head", les révélations de produits synchronisées à la musique, et tout cas où l'audio définit l'énergie du mouvement. Le cluster de prompts audio-sync de PixMind couvre ce sujet en profondeur.
Modèle
[Subject portrait or product]. [Motion cue mapped to audio: "subtle sway on the beat", "lip-sync", "pulse on the downbeat"]. [Setting: simple, neutral]. [Camera: static or minimal drift]. [Style]. Pair with [audio file: type, duration, BPM if musical].
Exemple concret
Portrait d'avatar stylisé, face à la caméra. Synchronisation labiale avec la voix off jointe, léger balancement de la tête aux limites des phrases, clignement des yeux entre les phrases. Fond sombre neutre, lumière clé douce. Plan moyen rapproché statique, équivalent 50mm. Portrait cinématique, contour chaud. Associé à une voix off de 6 secondes à 120 BPM.
Échec courant
Oublier de joindre l'audio. Sans audio, le modèle invente un mouvement inactif générique et la revendication de synchronisation labiale est ignorée. Toujours confirmer que l'entrée audio est jointe avant le rendu.
Modèle 9 : Le storyboard Première-Dernière-Image
Quand l'utiliser
Le storyboard Première-Dernière-Image est le modèle pour tout clip où l'état de début et l'état de fin doivent être spécifiques. Wan 2.7 interpole les images intermédiaires. Utilisez-le pour les ouvertures de cadeaux, les ouvertures de portes, les transformations et les révélations de produits où l'image finale est une image connue.
Modèle
First frame: [exact description of the start image]. Last frame: [exact description of the end image]. [Connecting action that transforms start to end]. [Setting consistent across both frames]. [Camera: explicit and consistent]. [Style].
Exemple concret
Première image : une boîte cadeau mate fermée sur une surface en marbre, vue de dessus. Dernière image : la même boîte entièrement ouverte, la lumière s'échappant de l'intérieur, le couvercle posé sur le côté. Le couvercle se soulève lentement et la lumière se répand. Surface en marbre, une seule lumière zénithale. Vue de dessus fixe, équivalent 35mm. Cinématique, lumière volumétrique chaude.
Échec courant
Mismatched camera angles between the two keyframes. If the first frame is top-down and the last frame is eye-level, the model invents a camera move that usually looks wrong. Match camera angles across both keyframes.
Modèle 10 : Le remake verrouillé par référence
Quand l'utiliser
Le remake verrouillé par référence utilise le mode R2V pour préserver l'identité, le style ou le mouvement d'un clip de référence. Utilisez-le lorsque la sortie doit ressembler au personnage d'entrée, à la voix ou au style visuel sur plusieurs plans. Selon le guide I2V Wan d'Alibaba Cloud, R2V accepte jusqu'à cinq images de référence et cinq clips de référence en un seul appel.
Modèle
Reference inputs: [N reference images, M reference clips, optional audio]. [Subject description matching the reference identity]. [Action within the reference character's range]. [Setting]. [Camera]. [Style consistent with reference].
Exemple concret
Entrées de référence : trois images de référence d'un personnage d'anime stylisé, un clip de référence d'un cycle de marche, pas d'audio de référence. Le même personnage d'anime stylisé marche dans une ruelle éclairée au néon, jette un coup d'œil en arrière une fois. Ruelle éclairée au néon la nuit, reflets du sol mouillé. Plan moyen en travelling, équivalent 50mm. Anime, étalonnage des couleurs vibrant.
Échec courant
Mélanger les identités de référence. Si les images de référence montrent deux personnages différents, le modèle en fait une moyenne. Verrouillez une seule identité par rendu.
Modèle 11 : La révélation par l'espace négatif
Quand l'utiliser
La révélation par l'espace négatif utilise la zone vide du cadre comme scène pour l'arrivée du sujet. Utilisez-la pour les accroches où l'œil du spectateur est attiré par le vide puis récompensé. Cela fonctionne bien pour les formats sociaux verticaux où la première image doit être visuellement calme.
Modèle
[Frame opens on mostly empty space, single subtle texture]. [The subject enters from a frame edge, slow]. [Setting: minimal, single light source]. [Camera: static or slow drift]. [Style].
Exemple concret
Le cadre s'ouvre sur un mur de béton presque vide avec un seul rayon de lumière chaude. Une silhouette entre lentement par le bord droit, marche dans la lumière, s'arrête. Intérieur en béton, un seul rayon de lumière chaude, ombre profonde. Plan moyen statique, équivalent 50mm. Cinématique, contraste élevé.
Échec courant
Remplir l'espace négatif trop tôt. Si le sujet entre dans la première seconde, l'accroche est perdue. Maintenez le cadre vide pendant au moins 1,5 seconde avant l'arrivée du sujet.
Modèle 12 : Le modèle subtil de micro-mouvement
Quand l'utiliser
Le modèle de micro-mouvement est destiné aux cas où le clip doit ressembler presque à une image fixe avec un seul petit indice de mouvement. C'est le bon choix pour les photos de produits éditoriales, les portraits de style archivistique et tout contexte où un mouvement ostensible est perçu comme bon marché.
Modèle
[Subject framed as a still image]. [One single subtle motion: a blink, a breath, a steam wisp, a fabric shift]. [Setting]. [Camera: locked-off static]. [Style: editorial, minimal motion].
Exemple concret
Une tasse en céramique de café noir sur une surface en lin, vue de dessus. Une seule volute de vapeur s'élève de la surface du café. Surface en lin, lumière douce de la fenêtre venant de la droite de la caméra. Vue de dessus fixe, équivalent 50mm. Nature morte éditoriale, lumière naturelle chaude.
Échec courant
Ajouter un deuxième mouvement. Le modèle fonctionne parce qu'une seule chose bouge. Un deuxième mouvement (vapeur plus un déplacement d'ombre) rompt l'illusion et le clip est perçu comme une vidéo ordinaire.
Comment combiner les modèles ?
La plupart des clips de production combinent deux modèles. Une révélation inversée (Reverse Reveal) plus un "Pull-Focus" est une révélation de produit courante. Une séquence multi-plans (Multi-Shot Sequence) plus une finition micro-mouvement (Micro-Motion) est un accroche social courant. La règle générale : combinez un modèle structurel (anatomie, multi-plans, première-dernière-image) avec un modèle de mouvement (orbite, poussée, "pull-focus").
[INSIGHT UNIQUE] Les modèles qui se combinent bien partagent une intention de caméra. Les modèles avec des intentions de caméra conflictuelles, comme Orbite plus Poussée, s'affrontent et produisent des saccades. Choisissez des modèles dont les segments de caméra sont en accord.
Lors de la combinaison, écrivez le prompt dans l'ordre où le spectateur le verra. Le modèle lit les prompts de gauche à droite et pondère plus fortement les segments antérieurs. Les 20 premiers mots du prompt déterminent la majorité du résultat visuel.
Pour un contexte de comparaison entre les modèles, consultez notre guide complet du générateur vidéo Wan 2.7 et le compagnon des prompts multi-plans Wan 2.7.
FAQ sur l'ingénierie des prompts Wan 2.7
Quelle doit être la longueur d'un prompt Wan 2.7 ?
Un prompt Wan 2.7 fonctionnel contient de 40 à 80 mots couvrant les cinq segments de l'anatomie. Les prompts plus longs diluent l'intention de la caméra. Les prompts plus courts laissent trop de choses à la connaissance préalable du modèle. Les 12 modèles ci-dessus se situent tous dans cette fourchette. Selon l'aperçu de la génération vidéo d'Alibaba Cloud Model Studio, le modèle tronque les prompts au-delà d'environ 500 tokens.
Wan 2.7 prend-il en charge les prompts négatifs ?
Wan 2.7 accepte les prompts négatifs mais les pondère légèrement par rapport aux modèles d'images. Gardez les prompts négatifs courts, trois à cinq termes au maximum. Les longues listes négatives ont un effet minimal et épuisent le budget de prompts. Utilisez des négatifs spécifiques comme "texte, filigrane, logo" plutôt que des abstraits comme "laid".
Dois-je utiliser PromptExtend sur Wan 2.7 ?
Cela dépend. PromptExtend est utile lorsque votre prompt de base contient moins de 30 mots. Il dilue les instructions spécifiques de la caméra lorsque votre prompt de base couvre déjà l'anatomie à cinq segments. Testez les deux méthodes sur un rendu. Notre revue de PromptExtend dans Wan 2.7 contient les données comparatives.
Quel modèle est le meilleur pour les publicités de produits ?
Le storyboard Première-Dernière-Image (First-Last-Frame Storyboard) combiné à la poussée avant de la caméra (Camera-Forward Push) est la combinaison la plus efficace que nous ayons mesurée pour les publicités de produits. Commencez par un plan large du produit, terminez par un gros plan sur un détail. Le cluster de cas d'utilisation de PixMind pour le marketing produit contient des études de cas complètes.
Comment éviter les déformations sur les surfaces réfléchissantes ?
Réduisez l'amplitude du mouvement dans le prompt. Remplacez "rotation rapide" par "dérive lente". Ajoutez une direction de lumière explicite dans le segment de décor car les reflets suivent la lumière. Testez d'abord en 720P car les déformations sont plus visibles en 1080P.
Voyez-le en action
Lié sur X: Rel1vs — Discute de l'utilisation de Claude ou Grok pour décrire des références pour les prompts Wan 2.7.


