Wan 2.7 R2V:多模态参考视频生成指南
核心要点
- Wan 2.7 的参考到视频(R2V)功能在单次调用中最多可接受 5 张参考图像、5 个参考视频片段和 1 段参考音频,是当前 1080P 模型中支持最广泛的多模态输入矩阵。
- R2V 适用于跨镜头的人物身份保留、声音克隆和风格延续,而不适用于一次性 B 卷或简单的产品旋转。
- 参考冲突是导致失败的首要原因,通过遵循四步工作流程(准备-设置-编写-渲染)可以预防大多数冲突。
- 有关此模式更深入的提示库,请参阅 PixMind 参考视频提示集群。
什么是 Wan 2.7 R2V?
R2V 代表参考到视频,是 Wan 2.7 的一种模式,它接受混合参考输入并生成一个新视频片段,该片段保留了这些输入中的身份、声音或风格。根据 Alibaba Cloud 上的 Wan 2.7 R2V API 参考,单次 R2V 调用最多可接受 5 张参考图像、5 个参考视频片段和 1 段参考音轨,输出上限为 1080P 和 10 秒。
R2V 与图像到视频(I2V)的区别在于多模态条件。I2V 锁定起始帧并让模型发明运动。R2V 则从您的参考中提取属性,例如面部结构、服装、音色、色彩分级,并将它们传播到新的生成中。这就是为什么我们将 R2V 视为一种不同的工作流程,而不是更高级的 I2V。
R2V 位于 PixMind 上统一的 Wan 2.7 视频生成器 界面内。您无需切换模型即可使用它。当您在输入面板中附加参考时,路由器会选择 R2V。
引用摘要:Wan 2.7 R2V(参考到视频)是一种模式,它在一次 API 调用中最多可接受 5 张参考图像、5 个参考视频片段和 1 段参考音频,输出 MP4 格式,最高可达 1080P 和 10 秒,用于跨镜头的人物身份、声音和风格保留(Alibaba Cloud Model Studio,2026)。
R2V 接受哪些输入?
R2V 接受三类输入,您可以在同一次调用中混合使用它们。Alibaba Cloud 视频生成概述 文档记录了输入数组的架构。以下是每个插槽的功能以及您可以传递的数量的实际细分。
| 输入槽位 | 最大数量 | 承载内容 | 必需? |
|---|---|---|---|
| 参考图像 | 5 | 面部、产品、服装、色彩分级 | 至少 1 个任意输入 |
| 参考视频 | 5 | 运动风格、时间、场景连续性 | 可选 |
| 参考音频 | 1 | 音色、节奏、环境音 | 可选 |
| 文本提示 | 1 | 主题、动作、摄像机、风格 | 必需 |
文本提示始终是必需的。模型将其用作生成的主干,然后在其上叠加参考派生的属性。如果没有提示,模型就没有场景可渲染,调用将失败。
一些值得记住的限制。参考视频每个上限为 10 秒,输出时长绝不会超过您传入的最短参考视频。参考音频必须是 5 到 30 秒的干净 WAV 或 MP3 文件,任何更短的都会被填充,任何更长的都会被截断。
输入槽位交互
每个槽位都会影响不同的输出轴。图像驱动外观。视频驱动运动。当存在面部时,音频驱动声音和唇形同步。当两个槽位冲突时(例如,金发主题的参考图像与黑发主题的参考视频配对),模型会选择其中一个并忽略另一个,并且选择并不总是可预测的。
在我们的测试中,冲突的参考在相同种子的重复运行中会产生不一致的选择。将参考冲突视为不确定性因素,并从源头消除它们。
何时使用 R2V?
当镜头间的连续性比原始速度更重要时,R2V 是正确的选择。我们在三种特定情况下使用它。
多镜头场景中的身份保留。 如果您需要在广角、中景和特写镜头中保持同一角色,R2V 为每个角度提供一张强参考图像,可以保持面部结构的一致性。I2V 每次都会重新生成面部并产生漂移。
将声音克隆到新场景。 当您有一个录制的画外音必须与屏幕上的虚拟形象匹配时,R2V 结合参考音频和参考肖像的表现优于音频驱动的 I2V。音色会延续,唇形同步看起来像是同一个人在说话。
资产间的风格延续。 如果您已经发布了一个视频片段,并且需要一个在色彩分级、服装和节奏上都匹配的续集,那么将第一个片段作为参考视频的 R2V 是最快的途径。文本到视频无法仅凭描述重现特定的外观。
何时应避免使用 R2V?
R2V 对于一次性工作来说是杀鸡用牛刀。如果您只需要一个产品旋转,I2V 的首帧模式更快更便宜。R2V 每秒消耗的积分比 I2V 多,因为它需要进行参考条件处理。
当您的参考质量较低时,请跳过 R2V。模型无法“改善”模糊的照片或嘈杂的音频片段。在这里,“垃圾进,垃圾出”的原则比 Wan 2.7 界面的任何其他地方都更严格。
对于纯粹的抽象运动,请跳过 R2V。文本到视频可以在没有参考开销的情况下处理云、粒子和梦境序列。
如何准备参考资产
参考质量是 R2V 输出质量的最大单一预测因素。一张清晰的 1080P 参考图像优于一张通过消息应用两次压缩的 4K 图像。
参考图像。 使用一张强有力的主图像作为您的锚点。正面、均匀光照、中性背景,画面中没有其他主体。如果您必须添加更多图像,请确保它们是同一主体的角度变化,而不是不同的主体。
参考视频。 裁剪到您希望模型学习的精确动作。一个包含一个清晰手势的 3 秒片段优于一个包含混合动作的 10 秒片段。分辨率应与您的目标输出匹配:1080P 输入,1080P 输出。
参考音频。 仅限录音棚级录音。去除背景噪音,将响度标准化到 -16 LUFS 左右,并修剪开头和结尾的静音。手机录音会产生手机质量的声音克隆。
[独家见解] 参考之间分辨率不匹配是一种隐性失败模式。如果您的参考图像是 2160P,而参考视频是 720P,模型倾向于继承较低保真度的源用于运动,而较高保真度的源用于静态细节,从而生成一个在帧之间看起来不一致的视频片段。在上传之前,将所有内容降采样到您的目标输出分辨率。

如何无冲突地组合参考
以下是我们内部运行的四步工作流程。它消除了我们在自由堆叠参考时通常会遇到的约 80% 的冲突失败。
步骤 1:准备参考。 选择一张锚点图像,零到四张辅助图像,零到两个参考视频,以及零或一段参考音频。将所有参考标准化为与您的目标输出相同的宽高比。
步骤 2:正确设置 reference_voice。 当您附加参考音频时,将 reference_voice 参数设置为 clone 用于声音保留,或设置为 drive 仅用于唇形同步。这两种模式从相同的音频文件生成非常不同的输出。Clone 承载音色,drive 承载时间。
步骤 3:编写提示。 描述您想要的场景,而不是参考。参考是条件,而不是提示的主题。糟糕的提示:“让这个人像音频一样说话。” 好的提示:“一名 30 岁的女子穿着绿色夹克,在阳光明媚的厨房里对着镜头说话,中景特写,50mm 镜头。”
步骤 4:渲染和评估。 首先运行一个 3 秒的 720P 测试。检查第一帧的身份保留,第二帧的运动连贯性,以及第三帧的音频同步。然后才提交 10 秒的 1080P 最终版本。
有效和有风险的组合
有些输入组合是稳定的。其他组合则经常产生伪影。此矩阵来自我们自己在 2026 年 6 月和 7 月进行的约 200 次渲染的 R2V 测试。
| 组合 | 稳定性 | 备注 |
|---|---|---|
| 1 张图像 + 文本 | 高 | 最接近 I2V,最快的 R2V 路径 |
| 1 张图像 + 1 段音频 + 文本 | 高 | 最适合说话头像的声音克隆 |
| 1 张图像 + 1 段视频 + 文本 | 中 | 当视频显示同一主体时有效 |
| 1 张图像 + 1 段视频 + 1 段音频 + 文本 | 中 | 三重条件,注意冲突 |
| 5 张图像 + 5 段视频 + 1 段音频 + 文本 | 低 | 最大输入,最大冲突风险 |
| 0 张图像 + 1 段视频 + 文本 | 低 | 没有图像锚点,身份会漂移 |
[原始数据] 在我们 200 次渲染的测试集中,使用 3 个或更少参考的调用成功率为 91%,而使用 8 个或更多参考的调用成功率为 54%。这里的成功意味着输出与提示匹配并干净地保留了至少一个参考属性。
一个实际案例:多镜头角色场景
为了使工作流程具体化,这里是我们为内部演示运行的一个真实 R2V 任务。简报要求制作一个 6 秒的 1080P 视频片段,内容是一个风格化的女性角色穿过霓虹灯巷道,然后转向镜头。
使用的参考。 一张 1080P 的角色正面主肖像。一段来自素材库的 5 秒类似行走循环参考视频。没有参考音频。
提示。 “一个留着红色短发、穿着银色夹克的女人在夜晚穿过霓虹灯巷道,中景广角镜头,缓慢推轨,她在结尾处转向镜头,电影感,情绪化的主光,湿润路面反射。”
设置。 R2V 模式,1080P,6 秒,16:9,种子 8421。主肖像锚定了面部。参考视频锚定了行走时间。
结果。 第一次渲染在 6 帧中的前 4 帧干净地保留了身份,然后在转弯时略有漂移。我们添加了一张同一角色的四分之三背视图辅助图像,重新渲染后,转弯保持稳定。总计算量:三次渲染,两次 720P 用于测试,一次 1080P 用于最终版本。
经验:从最少开始,只有当您看到特定失败时才添加参考。预先添加参考是 R2V 最常见的错误。
常见失败模式
R2V 以可预测的方式失败。提前指出它们可以节省积分。
参考冲突。 两个参考描述不同的主体、光照或运动。模型每帧随机选择一个,产生闪烁。通过将每个属性类别减少到一个参考来解决。
参考质量不匹配。 清晰的图像与压缩的视频配对。模型会继承较弱来源的伪影。通过将所有参考标准化为相同的保真度来解决。
提示与参考不匹配。 描述阳光海滩的提示与暴风雪的参考视频配对。模型会遵循提示并忽略参考,从而浪费参考条件。通过将提示的语气与参考的语气对齐来解决。
音频不同步。 参考音频长于输出时长,或音频有长时间的前导静音。唇形同步会漂移。通过将音频精确修剪到输出长度,并将第一个音素置于 0.0 秒处来解决。
转弯时身份漂移。 当主体旋转超过参考角度 45 度时,面部会变形。通过在重新渲染之前添加一个目标角度的辅助参考图像来解决。
Wan 2.7 R2V 常见问题
我可以向 Wan 2.7 R2V 传递多少个参考?
根据 Alibaba Cloud R2V API 参考,在一次调用中最多可传递 5 张参考图像、5 个参考视频片段和 1 段参考音频。文本提示始终是必需的。更多的参考会增加冲突风险,因此我们建议从一张图像开始,并仅在需要时添加。
R2V 支持 1080P 输出吗?
是的。R2V 输出上限为 1080P 和 10 秒。分辨率必须与您最低分辨率的参考匹配;否则模型会继承最弱来源的伪影。
R2V 可以克隆任何声音吗?
R2V 可以从 5 到 30 秒的干净参考音频中克隆声音。PixMind 政策禁止未经同意克隆可识别的真实人物。请将 R2V 声音克隆用于原创角色、您自己的声音或获得许可的参考音频。
R2V 与音频驱动的 I2V 有何不同?
音频驱动的 I2V 仅使用音频来驱动单个输入图像上的运动和唇形同步。R2V 接受更广泛的多模态输入矩阵,包括参考视频和多张图像,并且可以克隆音色而不仅仅是同步时间。当身份和声音都需要跨镜头延续时,R2V 是更强的选择。
我应该何时避免使用 R2V?
对于一次性 B 卷、抽象运动、简单的产品旋转或任何没有连续性要求的情况,请避免使用 R2V。R2V 每秒消耗的积分比 I2V 和 T2V 多,因为它需要进行参考条件处理,如果参考没有增加有用的信号,额外的条件处理反而会带来负面影响。
观看实际操作
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b


