使用 Wan 2.7 制作音频驱动的虚拟形象视频:一个口播视频工作流程
Wan 2.7 I2V 音频驱动模式将一张静态肖像和一段清晰的画外音转换为口型同步的口播视频。这是一个包含肖像准备、音频准备以及三种需要避免的失败模式的六步工作流程。
阅读更多
Wan 2.7 音频驱动视频接收一张肖像和一个音频文件,并返回一个视频片段,其中主体看起来与音频同步说话。根据 Alibaba Cloud I2V API reference,该模型接受 driving_audio 作为媒体类型与 first_frame 一同输入,然后从波形驱动嘴唇运动和头部能量。重现此工作流程最快的方法是使用 Wan 2.7 video generator,其中音频驱动是 I2V 的一个子模式。
音频驱动是图像到视频的一个子模式。Alibaba Cloud Model Studio image-to-video user guide 将其与 first-frame、first-last-frame 和视频续接模式并列。您在媒体数组中同时传入 first_frame 和 driving_audio,模型将返回一个 MP4 视频,其中嘴部运动跟踪音频波形。
该模式只有一个目的:让静态肖像看起来像在说话。模型不会像 T2V 那样创造新的场景、角色或背景运动。它使用音频来驱动两件事:可见脸部的嘴唇形状,以及与语音节奏一致的微小头部和身体能量。画面中的其他一切都大致保持静态。
这种狭窄的范围使得音频驱动模式可靠。模型只有一个输入对需要处理,因此故障模式是可预测的。将其与文本到视频进行比较,后者模型必须从一个句子中发明每一帧的每一个像素。
我们在 2026 年 6 月测试了 40 对肖像加音频的音频驱动模式。正面、表情中性的肖像在 40 次中有 34 次产生了清晰的口型同步。侧面肖像在 20 次尝试中有 18 次产生了明显的口型不匹配。源脸部的角度是影响质量的最大单一因素,比分辨率或音频比特率更重要。
常见用例包括画外音头像片段、解说旁白、两个头像之间的对话场景,以及面部对着镜头说话的短社交帖子。对于更广泛的角色表演角度,请参阅 PixMind character performance cluster,其中涵盖了在此模式基础上构建的多角色场景。
肖像在音频驱动模式中是影响质量的最大单一因素。Wan 2.7 I2V API 接受单个 first_frame 图像,模型将该帧视为整个视频片段中面部几何形状的真实来源。
适用于此模式的优质肖像具有四个特征。面部完全可见,面向镜头,与正面角度大致在 15 度以内。嘴巴闭合或处于中性位置。光线均匀,嘴唇或下巴上没有刺眼的阴影。分辨率为 1024x1024 或更大,方形或 9:16,与您预期的输出比例匹配。
[独特见解] 闭嘴中性肖像的表现优于微笑或张嘴的源帧。模型必须从源嘴形插值到每个发音口型。从微笑开始会迫使模型在形成第一个音节之前消除微笑,这会在视频片段开始时产生一帧抖动。
避免面部被头发、手或眼镜部分遮挡的肖像。避免偏离轴线约 30 度以上的侧面肖像。避免手机自拍镜头距离过近造成的广角畸变。将肖像裁剪为头部和肩部,使面部占据画面的 40% 到 60%。
为获得最佳效果,请使用专用图像模型生成源肖像,而不是重复使用手机照片。一致、光线充足的合成面部为模型提供了清晰的几何形状以进行跟踪。将源肖像的宽高比与您的输出视频宽高比匹配,因为模型不会自行重新构图。
音频质量决定视频质量。Wan 2.7 模型将音频波形作为嘴唇和头部运动的主要信号,因此噪音和削波会直接传播到视觉输出中。
目标是 48 kHz、16 位 WAV 或 320 kbps MP3 录制的录音棚级画外音。背景音乐、房间混响、风噪和爆破音都会降低同步效果。如果您的源是手机录音,请在上传前通过降噪器和去混响插件处理。即使是 Adobe Podcast Enhance、带有 RNNoise 的 Audacity 或 Waves NS1 等免费工具也能显著改善效果。
对于首次渲染,请将视频片段长度保持在 10 秒以下。模型可以处理更长的音频,但口型同步在约 12 到 15 秒后往往会漂移,尤其是在语速较快的情况下。对于较长的片段,请以 8 到 10 秒的片段进行渲染,并在视频编辑器中拼接。
[原始数据] 在我们的 40 个视频片段测试集中,8 秒以下视频片段的平均口型同步准确度得分为 8.2 分(满分 10 分),而在 12 到 15 秒的视频片段中下降到 6.4 分。同步丢失在爆破音和摩擦音上最高,模型会恢复到中性嘴形而不是正确的口型。
单人语音比两人对话产生更紧密的同步。如果您需要两人对话,请将每一方渲染为单独的视频片段,并在后期制作中交错。将双语音轨输入到一张肖像中会产生一个混乱的嘴巴,试图匹配两位说话者。
上传步骤是大多数配置错误发生的地方。Wan 2.7 I2V API reference 将媒体数组记录为附加 first_frame 和 driving_audio 的位置。两个输入都进入同一个调用,而不是单独的端点。
一个最小可行请求包含四个字段:肖像 URL、音频 URL、输出分辨率(720P 或 1080P)和持续时间。可选字段包括宽高比、种子以及一个不影响渲染但有助于后期资产管理的自由格式描述标签。
两种常见的配置陷阱。首先,持续时间与音频长度不匹配。如果您将持续时间设置为 10 秒但音频只有 6 秒,模型将用中性嘴部运动填充最后 4 秒。精确匹配这两个值。其次,宽高比与肖像不匹配。16:9 的输出输入 9:16 的肖像会产生拉伸或裁剪的面部。
种子稳定性对于迭代很重要。记录每次渲染的种子,以便在调整后可以重现一个好的视频片段。如果没有种子,模型在每次调用时都会返回不同的结果,这使得 A/B 测试参数变得不可能。
如果您正在使用 PixMind Wan 2.7 video generator,UI 会为您处理媒体数组的构建。在 I2V 下选择音频驱动,拖入您的肖像和音频,设置持续时间和比例,然后渲染。
上传后,渲染时间取决于持续时间、分辨率和当前的 API 负载。典型的 5 秒 720P 渲染在 60 到 90 秒内完成。10 秒 1080P 渲染可能需要 3 到 5 分钟。API 返回一个任务 ID,您需要轮询直到状态变为 succeeded。

渲染完成后,在发布前进行结构化检查。以全速观看视频片段,然后逐帧检查第一秒、中间一秒和最后一秒。观察爆破音(P、B、T、D)和摩擦音(S、SH、CH)时的嘴部。这些是同步最先失败的地方。
三项检查可以发现大多数问题。嘴巴是在每个单词的第一个音节时张开,还是滞后一帧?下巴和下颌是否跟随音频能量移动,还是保持静止?在开元音发音时,牙齿和舌头是否可见,还是嘴巴保持闭合的缝隙?
如果同步不准确,请勿使用相同的输入重新渲染。模型在给定种子下是确定性的,因此使用新种子重新渲染是获得不同结果的唯一途径。一次只改变一个变量:首先是种子,然后是音频比特率,然后是肖像角度。
对于口型同步措辞的更深入提示角度,PixMind audio-sync prompts cluster 提供了针对口播视频、旁白和对话场景调整的模板。
音频驱动模式的故障面很小且可预测。命名故障模式可以让您在几秒钟内进行分类,而不是猜测。
在我们 2026 年 6 月的测试集中,下巴僵硬和嘴部运动滞后合计占失败渲染的 71%。两者都可追溯到源质量问题:前者是肖像构图,后者是音频母带处理。如果您只修复两件事,就修复这两件事。
PixMind use cases cluster 提供了基于此模式构建的对话、双角色场景和画外音式旁白的每场景说明。
音频驱动模式并非适用于所有 Wan 2.7 任务。该模式专门用于口播视频和语音同步运动。对于其他任何情况,I2V 的不同子模式或完全不同的模式会更适合您。
当音频是真实来源时,请使用音频驱动模式。旁白、画外音、对话以及任何面部必须看起来说出录制单词的视频片段都适用。当您拥有清晰的肖像和清晰的语音录音,并且需要完全符合这两个输入所暗示的视频片段时,请使用它。
当您有肖像但没有音频,并且希望模型创造自然运动时,请使用 first-frame I2V。当您有起始图像和结束图像,并且需要模型在它们之间进行插值时,请使用 first-last-frame。当您需要在多个镜头中保留身份或声音时,请使用 reference-to-video。
有关四种 I2V 子模式的完整并排比较,请参阅 PixMind image-to-video modes explainer。决策树很简单:如果音频驱动镜头,则使用音频驱动模式。如果两个关键帧驱动,则使用 first-last-frame。如果两者都不是,则使用 first-frame I2V。
一个常见的错误是在没有语音音频的情况下,使用音频驱动模式为静态肖像“添加运动”。模型期望的是语音信号。输入音乐或环境声音会产生一个抽搐而非表演的肖像。对于音乐驱动的运动,带有强运动提示的 first-frame I2V 是更清晰的路径。
不。闭嘴或中性表情的正面肖像能产生最佳的口型同步。偏离 30 度以上的侧面肖像、张开的嘴巴和被遮挡的下巴会产生明显的口型不匹配。目标是裁剪为头部和肩部,使面部占据画面的 40% 到 60%。
I2V API 接受标准 WAV 和 MP3 格式。48 kHz 和 320 kbps 或更高比特率的录音棚级音频优于手机录音。避免削波、重混响和声音重叠。
API 限制最长 15 秒,但口型同步在约 10 到 12 秒后往往会漂移。对于较长的片段,请渲染 8 到 10 秒的片段,并在视频编辑器中拼接。
技术上可以,但模型会产生一个混乱的嘴巴,试图匹配两位说话者。对于双角色对话,请将每一方渲染为单独的视频片段,并在后期制作中交错结果。
不。音频是您提供的输入。模型使用波形来驱动嘴唇和头部运动。如果您需要生成音频,请首先使用 TTS 模型,然后将该音频传递给 Wan 2.7。
— 歸藏(guizang.ai) (@op7418) April 13, 2026
Wan 2.7 I2V 音频驱动模式将一张静态肖像和一段清晰的画外音转换为口型同步的口播视频。这是一个包含肖像准备、音频准备以及三种需要避免的失败模式的六步工作流程。
阅读更多

Wan 2.7 和 Sora 2 都能从关键帧生成视频,但它们提供了不同的控制方式。本文根据截至 2026 年 7 月供应商发布的规格,对两者进行了并排比较。
阅读更多

Wan 2.7 在单个提示中支持多镜头序列。这是包含四种序列原型(叙事弧线、产品导览、教程步骤和情绪片段)的四镜头提示结构。
阅读更多