Générateur vidéo Wan 2.7 : Le guide complet des modes Texte, Image et Référence
Points clés à retenir
- Wan 2.7 est un modèle unifié couvrant le texte-vers-vidéo (T2V), l'image-vers-vidéo (I2V) et la référence-vers-vidéo (R2V) dans un seul flux de travail.
- Il prend en charge la sortie 720P et 1080P, une durée de 2 à 15 secondes et cinq rapports d'aspect, dont 16:9, 9:16 et 1:1.
- Les modes image de début-fin et piloté par l'audio vous offrent un contrôle de l'état de début et de fin que les modèles I2V à image unique ne peuvent égaler.
- La référence-vers-vidéo (R2V) accepte jusqu'à cinq images de référence, cinq clips de référence et une piste audio de référence en un seul appel.
- Essayez le générateur vidéo Wan 2.7 pour suivre n'importe quel exemple de ce guide.
Qu'est-ce que le générateur vidéo Wan 2.7 ?
Wan 2.7 est le dernier modèle de génération vidéo de l'équipe Wan d'Alibaba, exposé via Alibaba Cloud Model Studio. Il unifie quatre capacités auparavant distinctes en une seule famille de modèles : texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo et édition vidéo. Selon l'aperçu de la génération vidéo d'Alibaba Cloud, le modèle accepte une entrée multimodale et produit des MP4 ou MOV jusqu'à 1080P.
Le changement clé dans la version 2.7 est l'unification du flux de travail. Au lieu de changer de fournisseur pour le texte-vers-vidéo et l'image-vers-vidéo, vous appelez le même modèle et laissez l'API acheminer en fonction des entrées que vous transmettez. Cela correspond à la page produit PixMind Wan 2.7, où une seule interface de création gère tous les modes.
Pour les créateurs, cela est important car le changement de mode est l'endroit où la majeure partie du temps de production est perdue. Vous écrivez une invite, effectuez un rendu, réalisez que l'état initial est incorrect, puis reconstruisez à partir de zéro dans un outil différent. L'interface unifiée de Wan 2.7 vous permet d'échanger les entrées sans changer de modèle.
Combien de modes Wan 2.7 prend-il en charge ?
Wan 2.7 expose quatre modes. La référence de l'API I2V documente la matrice d'entrée complète. Voici la répartition pratique.
| Mode |
Entrée |
Idéal pour |
Durée max |
Résolution max |
| T2V (Texte-vers-vidéo) |
Invite textuelle, audio optionnel |
Storyboard, mouvement abstrait, B-roll |
15s |
1080P |
| I2V (Image-vers-vidéo) |
Première image, dernière image optionnelle, audio optionnel |
Révélations de produits, action de personnages, animation |
15s |
1080P |
| R2V (Référence-vers-vidéo) |
Jusqu'à 5 images de référence + 5 clips de référence + audio de référence |
Préservation de l'identité, clonage vocal, scènes multi-personnages |
10s |
1080P |
| Édition vidéo |
Vidéo source + instruction |
Transfert de style, éditions basées sur des instructions |
10s |
1080P |

Texte-vers-vidéo (T2V)
T2V prend une invite textuelle et produit une vidéo. La référence de l'API T2V de Wan 2.7 liste les paramètres pris en charge, y compris la résolution, la durée, le rapport et une piste audio optionnelle. T2V est le chemin le plus rapide de l'idée au clip.
Utilisez T2V lorsque vous n'avez pas d'image de début fixe. Le mouvement abstrait, le B-roll, les storyboards et les séquences stylisées conviennent tous. Évitez T2V lorsque l'état initial est important : si vous avez besoin d'un produit spécifique à l'écran à l'image zéro, passez à I2V.
Image-vers-vidéo (I2V)
I2V est l'endroit où l'unification du flux de travail de Wan 2.7 se manifeste. Le guide utilisateur image-vers-vidéo de Wan 2.7 documente quatre sous-modes :
- Image de début-vers-vidéo : une image devient l'état initial, le modèle invente le mouvement.
- Image de début et de fin-vers-vidéo : deux images définissent les états de début et de fin, le modèle interpole.
- Continuation vidéo : un court clip devient l'état initial, le modèle l'étend.
- Piloté par l'audio : une image plus une piste audio pilote la synchronisation labiale ou le mouvement.
Pour une présentation plus approfondie des quatre chemins I2V, consultez le cluster d'invites image de début-fin de PixMind.
Référence-vers-vidéo (R2V)
R2V est le mode le plus puissant et le moins documenté. La référence de l'API R2V de Wan 2.7 décrit un appel qui accepte jusqu'à cinq images de référence, cinq clips de référence et une piste audio de référence. Le modèle les utilise pour préserver l'identité, la voix et le style tout au long de la sortie.
R2V est ce qu'il faut utiliser lorsque vous avez besoin qu'un personnage ait la même apparence sur plusieurs plans, ou lorsque vous souhaitez cloner une voix dans une nouvelle scène. Le compromis est la durée : R2V est plafonné à 10 secondes, plus court que le plafond de 15 secondes de T2V et I2V.
Édition vidéo
L'édition vidéo prend une vidéo source plus une instruction textuelle et renvoie un clip édité. L'API d'édition vidéo de Wan 2.7 prend en charge les éditions basées sur des instructions et le transfert de style. Ce mode dépasse le cadre d'un guide de génération, mais il est utile de savoir qu'il existe.
Comment fonctionne le mode Image de début-fin ?
Le mode image de début-fin est un sous-mode d'I2V. Vous fournissez deux images : une pour la première image, une pour la dernière. Wan 2.7 génère les images intermédiaires.

C'est important car l'I2V à image unique laisse l'état final au modèle. Si votre plan doit se terminer sur une image spécifique (un produit entièrement tourné, une boîte entièrement ouverte, un personnage entièrement tourné), le mode image de début-fin est la façon de garantir cet atterrissage.
Le modèle pratique est le suivant : filmez ou générez deux images clés, téléchargez-les comme première et dernière, définissez la durée, puis effectuez le rendu. Wan 2.7 interpole le mouvement entre elles. La page d'invites image de début-fin de PixMind contient des modèles d'invites pour les révélations de produits, les transitions et les modèles de narration.
Modes de défaillance courants à surveiller :
- Déformation sur les surfaces réfléchissantes : le verre, les miroirs, le métal poli. Atténuez en réduisant l'amplitude du mouvement dans l'invite.
- Dérive d'identité sur les personnages : les visages peuvent changer entre les images. Atténuez avec les entrées de référence R2V.
- Incohérence de la caméra : si les deux images clés impliquent des angles de caméra différents, le modèle doit inventer une transition.
Testez d'abord avec des durées courtes (2-3 secondes) avant de vous engager sur des rendus de 5-10 secondes.
Comment fonctionne la vidéo pilotée par l'audio ?
Le mode piloté par l'audio prend une image fixe plus une piste audio et produit une vidéo où le sujet semble parler ou bouger en synchronisation avec l'audio. C'est la base du contenu de type "tête parlante" et avatar.
Le modèle utilise la forme d'onde audio pour piloter deux choses : le mouvement des lèvres (si un visage est présent) et l'énergie globale du mouvement. L'API I2V de Wan 2.7 accepte l'audio comme faisant partie du tableau de médias, en utilisant le type driving_audio.
Pour les cas d'utilisation de "tête parlante", associez cela au cluster de performance de personnages PixMind. La combinaison d'I2V piloté par l'audio et d'un portrait de référence propre est la meilleure voie ouverte actuelle pour un avatar synchronisé labialement sans entraîner un modèle personnalisé.
Deux notes pratiques :
- La qualité audio détermine la qualité vidéo. Un enregistrement studio propre surpasse un micro de téléphone.
- Testez d'abord avec un clip de 3 secondes. Les problèmes de synchronisation sont plus faciles à détecter tôt.
Quelle résolution, durée et rapport d'aspect choisir ?
Wan 2.7 prend en charge la sortie 720P et 1080P. Le compromis est le coût par rapport à la netteté. Selon la stratégie de tarification de PixMind, le 1080P consomme environ deux fois plus de crédits que le 720P par seconde.
| Paramètre |
Quand choisir |
Compromis |
| 720P |
Contenu axé sur les réseaux sociaux, vidéo verticale, itérations de test |
Coût inférieur, douceur visible sur les grands écrans |
| 1080P |
Présentations de produits, prévisualisation cinématographique, créations publicitaires |
Coût plus élevé, détails plus nets |
| 16:9 |
YouTube, intégrations de sites web |
Écran large standard |
| 9:16 |
Reels, TikTok, Shorts |
Vertical mobile |
| 1:1 |
Publications de flux, intégrations carrées |
Neutre multiplateforme |
| 4:3 / 3:4 |
Éditorial, style vintage |
Niche |
La durée augmente le coût de manière linéaire. Un rendu de 10 secondes coûte environ 5 fois plus cher qu'un rendu de 2 secondes à la même résolution. Pour l'itération, travaillez court. Pour le final, allez long.
Un réglage par défaut raisonnable pour les nouveaux utilisateurs : 720P, 5 secondes, 16:9. Confirmez que le plan fonctionne, puis passez à 1080P pour le final.
Comment choisir le bon mode Wan 2.7 ?
L'arbre de décision est simple une fois que vous savez quelles entrées vous avez.

- Vous n'avez qu'une idée : utilisez T2V. Itérez sur l'invite avant d'ajouter des visuels.
- Vous avez une photo de produit : utilisez le mode I2V première image.
- Vous avez deux images clés qui doivent être le début et la fin : utilisez le mode I2V image de début-fin.
- Vous avez un court clip qui doit être étendu : utilisez la continuation vidéo I2V.
- Vous avez un portrait plus une voix off : utilisez le mode I2V piloté par l'audio.
- Vous avez besoin de préserver l'identité ou la voix sur plusieurs plans : utilisez R2V.
- Vous avez des séquences existantes qui nécessitent une édition ou un changement de style : utilisez l'édition vidéo.
Si vous n'êtes pas sûr, commencez par le hub de la famille Wan de PixMind et choisissez par cas d'utilisation plutôt que par nom de mode. Le hub vous dirige vers la bonne interface en fonction de ce que vous essayez de créer.
Comment inviter Wan 2.7 ?
La structure de l'invite est plus importante que sa longueur. Wan 2.7 récompense une anatomie en cinq segments : sujet, action, décor, caméra, style.
Un exemple de structure :
Sujet : un flacon de parfum en verre sur une surface sombre. Action : une pulvérisation de gouttelettes éclate vers la droite. Décor : fond noir de studio, une seule lumière clé venant de la gauche de la caméra. Caméra : plan moyen statique, équivalent 50mm. Style : cinématographique, faible profondeur de champ, lumière de contour chaude.
Chaque segment réduit l'espace de sortie. Les segments manquants utilisent les valeurs par défaut du modèle, qui sont généralement génériques.
Pour des modèles d'invites plus approfondis, le cluster d'invites multi-plans de PixMind couvre 12 structures réutilisables, y compris les séquences multi-plans, les modèles de synchronisation audio et les storyboards image de début-fin.
Deux pièges d'invite à éviter :
- Invites surchargées : plus de cinq sujets dans une seule invite confondent le modèle. Divisez en plusieurs rendus.
- Surutilisation des invites négatives : Wan 2.7 ne pondère pas les invites négatives comme le font les modèles d'image. Gardez-les courtes.
Comment Wan 2.7 se compare-t-il aux autres modèles ?
Wan 2.7 se situe dans un domaine encombré. Sora 2, VEO 3, Kling 2.0 et Seedance ciblent tous des cas d'utilisation qui se chevauchent. La différenciation réside dans les modes que chaque modèle expose et à quel coût.
| Capacité |
Wan 2.7 |
Sora 2 |
VEO 3 |
Kling 2.0 |
| Texte-vers-vidéo |
Oui |
Oui |
Oui |
Oui |
| Image-vers-vidéo |
Oui |
Limité |
Oui |
Oui |
| Image de début-fin |
Oui |
Non |
Limité |
Limité |
| Vidéo de référence (R2V) |
Oui |
Non |
Non |
Limité |
| I2V piloté par l'audio |
Oui |
Oui |
Oui |
Limité |
| Durée max |
15s |
20s |
8s |
10s |
| Résolution max |
1080P |
1080P |
1080P |
1080P |
Ce tableau reflète les spécifications publiées par les fournisseurs en juillet 2026. Les tests comparatifs indépendants se trouvent dans notre test d'invite Wan 2.7 contre Sora 2 et le face-à-face VEO et Kling.
L'avantage distinctif de Wan 2.7 est le mode image de début-fin combiné à R2V. Aucun autre modèle du tableau n'expose les deux à pleine capacité. Si votre flux de travail nécessite un contrôle précis du début et de la fin ainsi que la préservation de l'identité, Wan 2.7 est actuellement la seule voie à modèle unique.
Quels sont les modes de défaillance courants ?
Chaque modèle vidéo IA échoue. Nommer les modes de défaillance vous aide à livrer plus rapidement.
- Déformation sur les surfaces réfléchissantes : verre, miroirs, métal poli. Atténuez en réduisant l'amplitude du mouvement dans l'invite.
- Dérive d'identité entre les plans : les visages changent entre les générations. Atténuez avec les entrées de référence R2V.
- Texte halluciné dans les images : les panneaux, étiquettes, logos apparaissent comme du charabia. Atténuez en supprimant le texte des images d'entrée.
- Inadéquation du rapport d'aspect : l'alimentation d'une image 9:16 dans une génération 16:9 recadre de manière inattendue. Faites correspondre l'aspect d'entrée à l'aspect de sortie.
- Consommation de crédits sur les longues itérations : les rendus de test de 10 secondes consomment rapidement des crédits. Itérez à 2-3 secondes.
Le cluster de cas d'utilisation PixMind contient des notes sur les modes de défaillance par scénario pour le marketing produit, la performance des personnages, la prévisualisation cinématographique et les accroches sociales.
FAQ sur le générateur vidéo Wan 2.7
Wan 2.7 est-il gratuit à essayer ?
Oui. La page PixMind Wan 2.7 comprend un essai gratuit sans carte de crédit requise. Les plans payants ne s'activent que lorsque vous dépassez le quota d'essai.
Wan 2.7 prend-il en charge la 4K ?
Non. La vidéo Wan 2.7 est plafonnée à 1080P. Le modèle d'image Wan 2.7 prend en charge les images fixes 4K via le niveau Pro, mais la sortie vidéo est plafonnée à 1080P.
Wan 2.7 peut-il cloner le visage d'une personne spécifique ?
Wan 2.7 peut préserver l'identité à partir des entrées de référence, mais la politique de PixMind interdit le clonage non consensuel de l'apparence de personnes réelles et identifiables. Utilisez R2V avec des personnages originaux, des références de stock ou votre propre apparence.
Combien de temps prend un rendu Wan 2.7 ?
Le temps de génération dépend de la durée, de la résolution et de la charge. Les rendus typiques de 5 secondes en 720P se terminent en 60-90 secondes. Les rendus de 10 secondes en 1080P peuvent prendre 3-5 minutes. L'API renvoie un ID de tâche que vous interrogez pour le statut.
Wan 2.7 génère-t-il de l'audio ?
Oui, mais uniquement dans les modes qui acceptent une entrée audio. T2V peut prendre une piste audio et la synchroniser avec le mouvement. Le mode I2V piloté par l'audio utilise l'audio pour piloter la synchronisation labiale et du mouvement. La génération audio pure (musique, effets sonores) est un modèle Alibaba distinct.
Puis-je utiliser les sorties de Wan 2.7 à des fins commerciales ?
Oui. Les sorties que vous générez vous appartiennent pour une utilisation commerciale selon les conditions d'Alibaba Cloud Model Studio. Consultez les conditions actuelles sur l'aperçu d'Alibaba Cloud Model Studio avant de les diffuser.
Voyez-le en action