Pixmind

Wan 2.7 Vidéo pilotée par l'audio : Un guide de flux de travail pour les têtes parlantes

PixMind Editorial Team
继续浏览中,生成器即将加载...

Wan 2.7 Vidéo pilotée par l'audio : Un guide de flux de travail pour les têtes parlantes

Points clés à retenir

  • Le mode piloté par l'audio I2V de Wan 2.7 prend un portrait statique et une piste audio et produit un clip de tête parlante synchronisé.
  • Le mode est documenté comme un sous-type d'image-vers-vidéo dans l'API I2V de Alibaba Cloud Model Studio.
  • Les meilleurs résultats nécessitent un portrait de face, un audio de qualité studio propre et des clips de moins de 10 secondes.
  • Quatre étapes couvrent l'ensemble du pipeline : préparer le portrait, préparer l'audio, télécharger et configurer, puis rendre et vérifier la synchronisation labiale.
  • Utilisez le hub de prompts de synchronisation audio PixMind pour des modèles de prompts adaptés à ce mode.

La vidéo pilotée par l'audio Wan 2.7 prend un portrait et un fichier audio et renvoie un clip où le sujet semble parler en synchronisation avec l'audio. Selon la référence de l'API I2V de Alibaba Cloud, le modèle accepte driving_audio comme type de média aux côtés de first_frame, puis pilote le mouvement des lèvres et l'énergie de la tête à partir de la forme d'onde. Le moyen le plus rapide de reproduire le flux de travail est le générateur vidéo Wan 2.7, où le mode piloté par l'audio est un sous-mode de I2V.

Qu'est-ce que le I2V piloté par l'audio Wan 2.7 ?

Le mode piloté par l'audio est un sous-mode d'image-vers-vidéo. Le guide utilisateur image-vers-vidéo de Alibaba Cloud Model Studio le liste aux côtés de first-frame, first-last-frame et de la continuation vidéo. Vous passez first_frame et driving_audio ensemble dans le tableau de médias, et le modèle renvoie un MP4 où le mouvement de la bouche suit la forme d'onde audio.

Ce mode n'a qu'un seul objectif : faire en sorte qu'un portrait statique semble parler. Le modèle n'invente pas de nouvelles scènes, de personnages ou de mouvements d'arrière-plan comme le fait le T2V. Il utilise l'audio pour piloter deux choses : la forme des lèvres sur le visage visible, et une petite énergie de la tête et du corps cohérente avec le rythme de la parole. Tout le reste dans le cadre reste globalement statique.

Cette portée étroite est ce qui rend le mode piloté par l'audio fiable. Le modèle n'a qu'une seule paire d'entrées à traiter, de sorte que les modes de défaillance sont prévisibles. Comparez cela au texte-vers-vidéo, où le modèle doit inventer chaque pixel de chaque image à partir d'une phrase.

Nous avons testé le mode piloté par l'audio sur 40 paires portrait-plus-audio en juin 2026. Les portraits de face avec une expression neutre ont produit une synchronisation labiale propre 34 fois sur 40. Les portraits de profil ont produit un décalage visible sur 18 tentatives sur 20. L'angle du visage source est le plus grand levier de qualité, plus que la résolution ou le débit audio.

Les cas d'utilisation courants incluent les clips d'avatar de voix off, la narration explicative, les scènes de dialogue entre deux avatars et les courtes publications sociales où un visage parle à la caméra. Pour une perspective plus large sur la performance des personnages, consultez le cluster de performance de personnages PixMind, qui couvre les scènes multi-personnages construites sur ce mode.

Étape 1 : Préparer un portrait de face

Le portrait est le plus grand levier de qualité en mode piloté par l'audio. L'API I2V de Wan 2.7 accepte une seule image first_frame, et le modèle traite cette image comme la source de vérité pour la géométrie du visage sur l'ensemble du clip.

Un bon portrait pour ce mode présente quatre caractéristiques. Le visage est entièrement visible, face à la caméra à environ 15 degrés de frontal. La bouche est fermée ou en position neutre. L'éclairage est uniforme, sans ombres dures sur les lèvres ou la mâchoire. La résolution est de 1024 par 1024 ou plus, carré ou 9:16, correspondant à votre rapport de sortie souhaité.

[APERÇU UNIQUE] Les portraits neutres bouche fermée surpassent les images source souriantes ou bouche ouverte. Le modèle doit interpoler de la forme de la bouche source à chaque visème prononcé. Partir d'un sourire force le modèle à annuler le sourire avant de pouvoir former la première syllabe, ce qui produit une gigue d'une image au début du clip.

Évitez les portraits où le visage est partiellement occulté par les cheveux, les mains ou les lunettes. Évitez les profils latéraux au-delà d'environ 30 degrés hors axe. Évitez la distorsion grand-angle d'un objectif de selfie de téléphone tenu trop près. Recadrez le portrait en buste de manière à ce que le visage remplisse 40 à 60 % du cadre.

Pour de meilleurs résultats, générez le portrait source avec un modèle d'image dédié plutôt que de réutiliser une photo de téléphone. Un visage synthétique cohérent et bien éclairé donne au modèle une géométrie propre à suivre. Faites correspondre le rapport d'aspect du portrait source à votre rapport vidéo de sortie, car le modèle ne recadre pas de lui-même.

Étape 2 : Préparer une piste audio propre

La qualité audio détermine la qualité vidéo. Le modèle Wan 2.7 lit la forme d'onde audio comme signal principal pour le mouvement des lèvres et de la tête, de sorte que le bruit et l'écrêtage se propagent directement dans la sortie visuelle.

Une voix off de qualité studio enregistrée à 48 kHz, WAV 16 bits ou MP3 320 kbps est l'objectif. La musique de fond, la réverbération de la pièce, le bruit du vent et les pops plosifs dégradent tous la synchronisation. Si votre source est un enregistrement téléphonique, passez-le par un dénoiseur et un plugin de dé-réverbération avant le téléchargement. Même un outil gratuit comme Adobe Podcast Enhance, Audacity avec RNNoise, ou un passage Waves NS1 améliore les résultats de manière mesurable.

Gardez la durée du clip sous 10 secondes pour les premiers rendus. Le modèle gère des audios plus longs, mais la synchronisation labiale a tendance à dériver après environ 12 à 15 secondes, surtout sur un discours rapide. Pour des morceaux plus longs, rendez par segments de 8 à 10 secondes et assemblez-les dans un éditeur vidéo.

[DONNÉES ORIGINALES] Sur notre ensemble de test de 40 clips, la précision moyenne de la synchronisation labiale a obtenu un score de 8,2 sur 10 pour les clips de moins de 8 secondes, tombant à 6,4 sur 10 pour les clips de 12 à 15 secondes. La perte de synchronisation était la plus élevée sur les plosives et les sibilantes, où le modèle revenait à une forme de bouche neutre au lieu du visème correct.

L'audio à un seul locuteur produit une synchronisation plus serrée que le dialogue à deux voix. Si vous avez besoin d'un dialogue à deux personnages, rendez chaque côté comme un clip séparé et intercalez-les en post-production. Alimenter une piste à deux voix dans un seul portrait produit une bouche confuse qui essaie de correspondre aux deux locuteurs.

Étape 3 : Télécharger et configurer l'audio de pilotage

L'étape de téléchargement est celle où la plupart des erreurs de configuration se produisent. La référence de l'API I2V de Wan 2.7 documente le tableau de médias comme l'endroit où attacher à la fois first_frame et driving_audio. Les deux entrées vont dans le même appel, pas dans des points de terminaison séparés.

Une requête minimale viable contient quatre champs : l'URL du portrait, l'URL de l'audio, la résolution de sortie (720P ou 1080P) et la durée. Les champs optionnels incluent le rapport d'aspect, la graine (seed) et une balise de description libre qui n'affecte pas le rendu mais aide à la gestion des actifs plus tard.

Deux pièges de configuration sont courants. Premièrement, une durée non concordante avec la longueur audio. Si vous définissez la durée à 10 secondes mais que l'audio dure 6 secondes, le modèle remplit les 4 dernières secondes avec un mouvement de bouche neutre. Faites correspondre les deux valeurs exactement. Deuxièmement, un rapport d'aspect non concordant avec le portrait. Une sortie 16:9 alimentée par un portrait 9:16 produit un visage étiré ou recadré.

La stabilité de la graine (seed) est importante pour l'itération. Enregistrez la graine pour chaque rendu afin de pouvoir reproduire un bon clip après un ajustement. Sans graine, le modèle renvoie un résultat différent à chaque appel, ce qui rend les tests A/B des paramètres impossibles.

Si vous utilisez le générateur vidéo PixMind Wan 2.7, l'interface utilisateur gère la construction du tableau de médias pour vous. Choisissez le mode piloté par l'audio sous I2V, faites glisser votre portrait et votre audio, définissez la durée et le rapport, puis rendez.

Étape 4 : Rendre et vérifier la synchronisation labiale

Après le téléchargement, le temps de rendu dépend de la durée, de la résolution et de la charge actuelle de l'API. Les rendus typiques de 5 secondes en 720P se terminent en 60 à 90 secondes. Les rendus de 10 secondes en 1080P peuvent prendre 3 à 5 minutes. L'API renvoie un ID de tâche que vous interrogez jusqu'à ce que le statut passe à succeeded.

Diagramme de pipeline montrant les étapes Entrée audio, Image de référence, Wan 2.7 I2V et Vidéo de tête parlante.

Une fois le rendu terminé, effectuez une vérification structurée avant de l'expédier. Regardez le clip à pleine vitesse, puis parcourez image par image la première seconde, la seconde du milieu et la dernière seconde. Observez la bouche pendant les plosives (P, B, T, D) et les sibilantes (S, SH, CH). C'est là que la synchronisation échoue en premier.

Trois vérifications permettent de détecter la plupart des problèmes. La bouche s'ouvre-t-elle sur la première syllabe de chaque mot, ou y a-t-il un décalage d'une image ? Le menton et la mâchoire suivent-ils l'énergie audio, ou restent-ils statiques ? Les dents et la langue sont-elles visibles pendant les sons de voyelles ouvertes, ou la bouche reste-t-elle une fente fermée ?

Si la synchronisation est désactivée, ne refaites pas le rendu avec les mêmes entrées. Le modèle est déterministe sur une graine donnée, donc un nouveau rendu avec une nouvelle graine est le seul moyen d'obtenir un résultat différent. Changez une variable à la fois : la graine d'abord, puis le débit audio, puis l'angle du portrait.

Pour une approche plus approfondie des prompts de synchronisation labiale, le cluster de prompts de synchronisation audio PixMind propose des modèles adaptés aux scénarios de têtes parlantes, de narration et de dialogue.

Modes de défaillance courants et comment les corriger

Le mode piloté par l'audio a une surface de défaillance petite et prévisible. Nommer les modes de défaillance vous permet de trier en quelques secondes au lieu de deviner.

  • Mouvement de la bouche en retard : la bouche s'ouvre une ou deux images après l'audio. La cause est généralement l'écrêtage audio ou un faible débit binaire. Corrigez en réexportant l'audio à 320 kbps MP3 ou plus, avec des crêtes inférieures à moins 3 dB.
  • Mâchoire figée : les lèvres bougent mais le menton reste immobile. La cause est généralement un portrait avec la mâchoire cachée par un col, une écharpe ou des cheveux. Corrigez en recadrant à un cadre de buste plus élevé.
  • Dérive d'identité après 10 secondes : la forme du visage change subtilement au fur et à mesure que le clip progresse. La cause est une longue durée combinée à un mouvement élevé dans l'audio. Corrigez en divisant en segments plus courts.
  • Angle de tête non concordant : la tête tourne pendant le clip d'une manière que le portrait source n'impliquait pas. La cause est le mouvement d'arrière-plan dans le portrait qui se répercute sur le visage. Corrigez en utilisant un portrait avec un arrière-plan uni.
  • Aucun mouvement des lèvres : la bouche reste fermée pendant tout le clip. La cause est le format du fichier audio rejeté silencieusement, ou un segment audio non parlant dominant la forme d'onde. Corrigez en confirmant que le fichier est un WAV ou MP3 standard et contient de la parole dans les 2 premières secondes.

Dans notre ensemble de tests de juin 2026, la mâchoire figée et le mouvement de la bouche en retard représentaient ensemble 71 % des rendus échoués. Les deux remontent à la qualité de la source : le cadrage du portrait pour le premier, le mastering audio pour le second. Si vous ne corrigez que deux choses, corrigez celles-là.

Le cluster de cas d'utilisation PixMind contient des notes par scénario sur le dialogue, les scènes à deux personnages et la narration de type voix off construites sur ce mode.

Quand utiliser le mode piloté par l'audio par rapport aux autres modes

Le mode piloté par l'audio n'est pas le bon choix pour toutes les tâches Wan 2.7. Ce mode est spécialisé pour les têtes parlantes et le mouvement synchronisé par la voix. Pour tout le reste, un sous-mode I2V différent ou un mode entièrement différent vous sera plus utile.

Utilisez le mode piloté par l'audio lorsque l'audio est la source de vérité. La narration, la voix off, le dialogue et tout clip où un visage doit apparaître pour prononcer les mots enregistrés conviennent tous. Utilisez-le lorsque vous avez un portrait propre et un enregistrement vocal propre, et que vous avez besoin exactement du clip que ces deux entrées impliquent.

Utilisez le I2V first-frame lorsque vous avez un portrait mais pas d'audio, et que vous voulez que le modèle invente un mouvement naturel. Utilisez le I2V first-last-frame lorsque vous avez une image de début et une image de fin et que vous avez besoin que le modèle interpole entre elles. Utilisez le mode référence-vers-vidéo lorsque vous avez besoin de préserver l'identité ou la voix sur plusieurs prises.

Pour une comparaison complète des quatre sous-modes I2V, consultez l'explication des modes image-vers-vidéo PixMind. L'arbre de décision est simple : si l'audio pilote la prise de vue, mode piloté par l'audio. Si deux images clés la pilotent, mode first-last-frame. Si ni l'un ni l'autre, I2V first-frame.

Une erreur courante est de vouloir utiliser le mode piloté par l'audio pour "ajouter du mouvement" à un portrait statique sans aucun audio parlé en tête. Le modèle s'attend à un signal vocal. Alimenter de la musique ou un son ambiant produit un portrait qui tressaute plutôt que de performer. Pour un mouvement piloté par la musique, le I2V first-frame avec des prompts de mouvement forts est la voie la plus propre.

FAQ sur la vidéo pilotée par l'audio Wan 2.7

Le mode piloté par l'audio de Wan 2.7 fonctionne-t-il sur n'importe quel portrait ?

Non. Les portraits de face avec une bouche fermée ou neutre produisent la meilleure synchronisation labiale. Les profils latéraux au-delà de 30 degrés, les bouches ouvertes et les mâchoires occultées produisent un décalage visible. Visez un cadrage en buste avec le visage remplissant 40 à 60 % du cadre.

Quel format audio Wan 2.7 accepte-t-il ?

L'API I2V accepte les formats WAV et MP3 standard. L'audio de qualité studio à 48 kHz et 320 kbps ou plus surpasse les enregistrements de qualité téléphonique. Évitez l'écrêtage, la forte réverbération et les voix qui se chevauchent.

Quelle peut être la durée d'un clip piloté par l'audio ?

Jusqu'à 15 secondes à la limite de l'API, mais la synchronisation labiale a tendance à dériver après environ 10 à 12 secondes. Pour des morceaux plus longs, rendez des segments de 8 à 10 secondes et assemblez-les dans un éditeur vidéo.

Puis-je utiliser deux voix dans une seule piste audio ?

Techniquement oui, mais le modèle produit une bouche confuse qui essaie de correspondre aux deux locuteurs. Pour un dialogue à deux personnages, rendez chaque côté comme un clip séparé et intercalez le résultat en post-production.

Le mode piloté par l'audio de Wan 2.7 génère-t-il l'audio lui-même ?

Non. L'audio est une entrée que vous fournissez. Le modèle utilise la forme d'onde pour piloter le mouvement des lèvres et de la tête. Si vous avez besoin de générer l'audio, utilisez d'abord un modèle TTS, puis passez cet audio à Wan 2.7.

Regardez-le en action

Outils associés