Wan 2.7 R2V : Guide de génération de vidéo de référence multimodale
Points clés à retenir
- Wan 2.7 référence-vers-vidéo (R2V) accepte jusqu'à 5 images de référence, 5 clips de référence et 1 audio de référence en un seul appel, la matrice d'entrée multimodale la plus large parmi les modèles 1080P actuels.
- R2V est le mode approprié pour la préservation de l'identité, le clonage vocal et la continuation de style entre les plans, et non pour des plans de coupe uniques ou de simples rotations de produits.
- Les conflits de référence sont la principale cause d'échec, et la plupart peuvent être évités en suivant un flux de travail en quatre étapes : préparer-définir-écrire-rendre.
- Pour une bibliothèque d'invites plus approfondie liée à ce mode, consultez le cluster d'invites vidéo de référence PixMind.
Qu'est-ce que Wan 2.7 R2V ?
R2V signifie référence-vers-vidéo, un mode de Wan 2.7 qui prend des entrées de référence mixtes et produit un nouveau clip qui préserve l'identité, la voix ou le style de ces entrées. Selon la référence API Wan 2.7 R2V sur Alibaba Cloud, un seul appel R2V accepte jusqu'à 5 images de référence, 5 clips de référence et 1 piste audio de référence, avec une sortie plafonnée à 1080P et 10 secondes.
Ce qui sépare R2V de l'image-vers-vidéo est le conditionnement multimodal. I2V verrouille le cadre de départ et laisse le modèle inventer le mouvement. R2V extrait plutôt les attributs de vos références, tels que la structure du visage, la garde-robe, le timbre de la voix, l'étalonnage des couleurs, et les propage dans une nouvelle génération. C'est pourquoi nous traitons R2V comme un flux de travail différent, et non comme un I2V plus sophistiqué.
R2V se trouve dans l'interface unifiée du générateur vidéo Wan 2.7 sur PixMind. Vous n'avez pas besoin de changer de modèle pour y accéder. Le routeur sélectionne R2V lorsque vous attachez des références dans le panneau d'entrée.
Capsule de citation : Wan 2.7 R2V (référence-vers-vidéo) est un mode qui accepte jusqu'à 5 images de référence, 5 clips de référence et 1 audio de référence en un seul appel API, produit des MP4 jusqu'à 1080P et 10 secondes, et est utilisé pour la préservation de l'identité, de la voix et du style entre les plans (Alibaba Cloud Model Studio, 2026).
Quels types d'entrées R2V accepte-t-il ?
R2V prend trois classes d'entrées, et vous pouvez les mélanger dans le même appel. L'aperçu de la génération vidéo d'Alibaba Cloud documente le schéma du tableau d'entrée. Voici la répartition pratique de ce que fait chaque emplacement et combien vous pouvez en passer.
| Emplacement d'entrée | Nombre max. | Ce qu'il contient | Requis ? |
|---|---|---|---|
| Image de référence | 5 | Visage, produit, garde-robe, étalonnage des couleurs | Au moins 1 de n'importe quelle entrée |
| Vidéo de référence | 5 | Style de mouvement, timing, continuité de scène | Facultatif |
| Audio de référence | 1 | Timbre vocal, cadence, son ambiant | Facultatif |
| Invite textuelle | 1 | Sujet, action, caméra, style | Requis |
L'invite textuelle est toujours requise. Le modèle l'utilise comme colonne vertébrale de la génération, puis superpose les attributs dérivés des références. Sans invite, le modèle n'a aucune scène à rendre et l'appel échoue.
Quelques contraintes à mémoriser. Les vidéos de référence sont plafonnées à 10 secondes chacune, et la durée de sortie ne dépasse jamais la vidéo de référence la plus courte que vous passez. L'audio de référence doit être un fichier WAV ou MP3 propre de 5 à 30 secondes ; tout ce qui est plus court est complété, tout ce qui est plus long est tronqué.
Interactions des emplacements d'entrée
Chaque emplacement influence un axe de sortie différent. Les images déterminent l'apparence. Les vidéos déterminent le mouvement. L'audio détermine la voix et la synchronisation labiale lorsqu'un visage est présent. Lorsque deux emplacements sont en conflit (par exemple, une image de référence d'un sujet blond associée à une vidéo de référence d'un sujet aux cheveux foncés), le modèle en choisit un et ignore l'autre, et le choix n'est pas toujours prévisible.
Lors de nos tests, des références conflictuelles ont produit des sélections incohérentes lors de réexécutions avec la même graine. Traitez les conflits de référence comme non déterministes et supprimez-les à la source.
Quand utiliser R2V ?
R2V est le bon choix lorsque la continuité entre les plans est plus importante que la vitesse brute. Nous l'utilisons dans trois situations spécifiques.
Préservation de l'identité dans des scènes multi-plans. Si vous avez besoin du même personnage en plan large, moyen et gros plan, R2V avec une image de référence forte par angle maintient la structure du visage cohérente. I2V régénère le visage à chaque fois et dérive.
Clonage vocal dans une nouvelle scène. Lorsque vous avez une voix off enregistrée qui doit correspondre à un avatar à l'écran, R2V avec un audio de référence plus un portrait de référence surpasse I2V piloté par l'audio. Le timbre de la voix est conservé et la synchronisation labiale donne l'impression qu'il s'agit du même locuteur.
Continuation de style entre les éléments. Si vous avez déjà livré un clip et que vous avez besoin d'une suite qui corresponde à l'étalonnage des couleurs, à la garde-robe et au rythme, R2V avec le premier clip comme vidéo de référence est le chemin le plus rapide. Le texte-vers-vidéo ne peut pas reproduire un look spécifique à partir d'une simple description.
Quand devriez-vous éviter R2V ?
R2V est excessif pour un travail en un seul plan. Si vous n'avez besoin que d'une seule rotation de produit, le mode premier-cadre d'I2V est plus rapide et moins cher. R2V consomme plus de crédits par seconde qu'I2V en raison du passage de conditionnement de référence.
Évitez R2V lorsque vos références sont de mauvaise qualité. Le modèle n'a aucun moyen d'"améliorer" une photo floue ou un clip audio bruyant. Le principe "garbage in, garbage out" s'applique ici plus fortement que partout ailleurs dans l'interface de Wan 2.7.
Évitez R2V pour les mouvements purement abstraits. Le texte-vers-vidéo gère les nuages, les particules et les séquences de rêve sans la surcharge des références.
Comment préparer les ressources de référence
La qualité des références est le plus grand prédicteur de la qualité de sortie de R2V. Une image de référence 1080P nette surpasse une image 4K qui a été compressée deux fois via des applications de messagerie.
Images de référence. Utilisez une image "héro" forte comme ancre. De face, éclairage uniforme, arrière-plan neutre, pas d'autres sujets dans le cadre. Si vous devez en ajouter, faites-en des variations d'angle du même sujet, pas des sujets différents.
Vidéos de référence. Coupez au mouvement exact que vous voulez que le modèle apprenne. Un clip de 3 secondes avec un geste clair est plus efficace qu'un clip de 10 secondes avec des actions mélangées. La résolution doit correspondre à votre sortie cible : 1080P en entrée, 1080P en sortie.
Audio de référence. Enregistrements de qualité studio uniquement. Supprimez le bruit de fond, normalisez le volume à environ -16 LUFS et coupez les silences au début et à la fin. Les enregistrements téléphoniques produisent un clonage vocal de qualité téléphonique.
[APERÇU UNIQUE] L'inadéquation de résolution entre les références est un mode d'échec silencieux. Si votre image de référence est en 2160P et votre vidéo de référence en 720P, le modèle a tendance à hériter de la source de fidélité inférieure pour le mouvement et de la source de fidélité supérieure pour les détails fixes, produisant un clip qui semble incohérent d'un cadre à l'autre. Réduisez la taille de tout à votre sortie cible avant de télécharger.

Comment combiner les références sans conflits
Le flux de travail en quatre étapes ci-dessous est ce que nous utilisons en interne. Il élimine environ 80 % des échecs de conflit que nous observions auparavant en empilant librement les références.
Étape 1 : préparer les références. Choisissez une image d'ancrage, de zéro à quatre images de soutien, de zéro à deux vidéos de référence, et zéro ou un audio de référence. Normalisez toutes les références au même rapport d'aspect que votre sortie cible.
Étape 2 : définir correctement reference_voice. Lorsque vous attachez un audio de référence, définissez le paramètre reference_voice sur clone pour la préservation de la voix ou sur drive pour la synchronisation labiale uniquement. Les deux modes produisent des sorties très différentes à partir du même fichier audio. clone transmet le timbre, drive transmet le timing.
Étape 3 : écrire l'invite. Décrivez la scène que vous voulez, pas les références. Les références sont un conditionnement, pas le sujet de l'invite. Mauvaise invite : "faites parler cette personne comme l'audio." Bonne invite : "une femme de 30 ans en veste verte parle à la caméra dans une cuisine ensoleillée, plan moyen rapproché, objectif 50mm."
Étape 4 : rendre et évaluer. Exécutez d'abord un test de 3 secondes en 720P. Vérifiez la préservation de l'identité dans le premier cadre, la cohérence du mouvement dans le second, et la synchronisation audio dans le troisième. Ce n'est qu'alors que vous vous engagez sur un rendu final de 10 secondes en 1080P.
Combinaisons valides et risquées
Certaines combinaisons d'entrées sont stables. D'autres produisent régulièrement des artefacts. Cette matrice est tirée de nos propres tests R2V sur environ 200 rendus en juin et juillet 2026.
| Combinaison | Stabilité | Notes |
|---|---|---|
| 1 image + texte | Élevée | Le plus proche d'I2V, le chemin R2V le plus rapide |
| 1 image + 1 audio + texte | Élevée | Idéal pour le clonage vocal de "talking-head" |
| 1 image + 1 vidéo + texte | Moyenne | Fonctionne lorsque la vidéo montre le même sujet |
| 1 image + 1 vidéo + 1 audio + texte | Moyenne | Triple conditionnement, attention aux conflits |
| 5 images + 5 vidéos + 1 audio + texte | Faible | Entrée maximale, risque de conflit maximal |
| 0 images + 1 vidéo + texte | Faible | Sans ancre d'image, l'identité dérive |
[DONNÉES ORIGINALES] Sur notre ensemble de tests de 200 rendus, les appels avec 3 références ou moins ont réussi à 91 %, tandis que les appels avec 8 références ou plus ont réussi à 54 %. Le succès ici signifie que la sortie correspondait à l'invite et a préservé au moins un attribut de référence de manière propre.
Un exemple concret : Scène de personnage multi-plans
Pour rendre le flux de travail concret, voici un véritable travail R2V que nous avons réalisé pour une démo interne. Le brief était un clip 1080P de 6 secondes d'un personnage féminin stylisé marchant dans une ruelle éclairée au néon, puis se tournant vers la caméra.
Références utilisées. Un portrait "héro" 1080P du personnage, de face. Une vidéo de référence de 5 secondes d'un cycle de marche similaire provenant d'une bibliothèque de stock. Pas d'audio de référence.
Invite. "A woman with short red hair and a silver jacket walks down a neon-lit alley at night, medium-wide shot, slow dolly-in, she turns to camera at the end, cinematic, moody key light, wet pavement reflections."
Paramètres. Mode R2V, 1080P, 6 secondes, 16:9, graine 8421. Le portrait "héro" a ancré le visage. La vidéo de référence a ancré le timing de la marche.
Résultat. Le premier rendu a préservé l'identité proprement jusqu'à la 4ème image sur 6, puis a légèrement dérivé au moment du virage. Nous avons ajouté une image de soutien du même personnage en vue de trois quarts arrière, avons refait le rendu, et le virage a été maintenu. Calcul total : trois rendus, deux en 720P pour les tests et un en 1080P pour le final.
La leçon : commencez de manière minimale, n'ajoutez des références que lorsque vous constatez un échec spécifique. Ajouter des références de manière préventive est l'erreur R2V la plus courante.
Modes d'échec courants
R2V échoue de manière prévisible. Les nommer à l'avance permet d'économiser des crédits.
Conflit de référence. Deux références décrivant des sujets, des éclairages ou des mouvements différents. Le modèle en choisit une au hasard par image, produisant un scintillement. Corrigez en réduisant à une référence par classe d'attributs.
Inadéquation de qualité des références. Une image nette associée à une vidéo compressée. Le modèle hérite des artefacts de la source la plus faible. Corrigez en normalisant toutes les références à la même fidélité.
Inadéquation invite-référence. Une invite décrivant une plage ensoleillée associée à une vidéo de référence d'une tempête de neige. Le modèle obéit à l'invite et ignore la référence, gaspillant le conditionnement de référence. Corrigez en alignant le ton de l'invite sur le ton de la référence.
Désynchronisation audio. Audio de référence plus long que la durée de sortie, ou audio avec un long silence initial. La synchronisation labiale dérive. Corrigez en coupant l'audio exactement à la durée de sortie, avec le premier phonème à 0,0 seconde.
Dérive d'identité lors des virages. Les visages se déforment lorsque le sujet tourne au-delà de 45 degrés par rapport à l'angle de référence. Corrigez en ajoutant une image de référence de soutien à l'angle cible avant de refaire le rendu.
FAQ Wan 2.7 R2V
Combien de références puis-je passer à Wan 2.7 R2V ?
Jusqu'à 5 images de référence, 5 clips de référence et 1 audio de référence en un seul appel, selon la référence API R2V d'Alibaba Cloud. L'invite textuelle est toujours requise. Plus de références augmentent le risque de conflit, nous recommandons donc de commencer avec une image et d'ajouter seulement si nécessaire.
R2V prend-il en charge la sortie 1080P ?
Oui. La sortie R2V est plafonnée à 1080P et 10 secondes. La résolution doit correspondre à votre référence de plus basse résolution ; sinon, le modèle hérite des artefacts de la source la plus faible.
R2V peut-il cloner n'importe quelle voix ?
R2V peut cloner une voix à partir d'un audio de référence propre de 5 à 30 secondes. La politique de PixMind interdit le clonage non consensuel de personnes réelles identifiables. Utilisez le clonage vocal R2V avec des personnages originaux, votre propre voix ou un audio de référence sous licence.
En quoi R2V est-il différent d'I2V piloté par l'audio ?
I2V piloté par l'audio utilise l'audio uniquement pour piloter le mouvement et la synchronisation labiale sur une seule image d'entrée. R2V accepte une matrice d'entrée multimodale plus large, y compris des vidéos de référence et plusieurs images, et peut cloner le timbre vocal plutôt que de simplement synchroniser le timing. R2V est le meilleur choix lorsque l'identité et la voix doivent être conservées sur plusieurs plans.
Quand devrais-je éviter R2V ?
Évitez R2V pour les plans de coupe uniques, les mouvements abstraits, les simples rotations de produits, ou tout cas où vous n'avez pas d'exigence de continuité. R2V coûte plus de crédits par seconde qu'I2V et T2V en raison du passage de conditionnement de référence, et le conditionnement supplémentaire nuit si les références n'ajoutent pas de signal utile.
Voyez-le en action
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



