Pixmind

Wan 2.7 图像到视频:4种模式解析(首帧、尾帧、续写、音频驱动)

PixMind Editorial Team
继续浏览中,生成器即将加载...

Wan 2.7 图像到视频:4种模式解析

主要收获

  • Wan 2.7 image-to-video (I2V) 将四种子模式捆绑到一个API中:首帧、首尾帧、视频续写和音频驱动。
  • 每种子模式都接受不同的输入参数(first_framelast_framefirst_clipdriving_audio),并通过相同的生成后端进行路由。
  • 首尾帧和音频驱动模式是单图像I2V模型无法复制的独特功能。
  • 大多数I2V失败源于模式与输入不匹配:为任务选择了错误的参数,或参考帧与请求的宽高比不匹配。
  • 尝试使用 Wan 2.7 视频生成器 来跟随本指南中的任何示例。

Wan 2.7 image-to-video 并非一个单一功能。它是通过一个API表面路由的四种子模式,每种模式接受不同的输入形状。Wan 2.7 I2V API 参考 文档记录了输入矩阵,但并未解释何时选择哪种模式。本指南将对此进行说明。每个部分都涵盖了输入、用例、一个实际操作的提示以及我们实际遇到的失败模式。

要更全面地了解I2V在Wan 2.7模型家族中的位置,PixMind Wan 2.7 视频生成器概述 并排介绍了文本、图像和参考模式。

什么是 Wan 2.7 图像到视频?

Wan 2.7 image-to-video (I2V) 是 Alibaba 的 Wan 2.7 模型家族中基于图像的生成路径。根据 Wan 2.7 I2V API 参考,该端点接受一个包含类型化输入的媒体数组,并返回高达 1080P 的视频,时长从 2 到 15 秒。

这四种子模式并非独立的端点。它们是API内部路由的输入组合:

子模式 必需输入 可选输入 典型时长
首帧到视频 first_frame 图像 提示词, 音频 2-10秒
首尾帧到视频 first_frame + last_frame 提示词 2-5秒
视频续写 first_clip 视频 提示词 3-10秒
音频驱动 first_frame + driving_audio 提示词 5-15秒

选择正确的子模式是I2V工作流程中杠杆率最高的单一决策。当你提供更多约束时,模型需要“发明”的内容就越少。例如,首尾帧模式能确保达到一个预设的最终状态。而单独的首帧模式则将最终状态留给模型决定。

[独家见解] 大多数创作者将I2V视为一个功能,并默认对所有内容使用首帧模式。在我们的测试渲染中,将产品展示切换到首尾帧模式,将“错误最终状态”的拒绝率降低了大约三分之二,因为模型不再需要猜测镜头将走向何方。

首帧到视频如何工作?

首帧到视频是I2V的默认路径。您上传一张图像作为 first_frame,编写一个描述运动的提示词,然后 Wan 2.7 会生成从该起始状态向前运动的帧。Wan 2.7 图像到视频用户指南 将其记录为最简单的I2V调用形式。

输入

  • first_frame (必需): 一张图像,支持 Wan 2.7 支持的任何宽高比(16:9, 9:16, 1:1, 4:3, 3:4)。
  • prompt (可选但强烈推荐): 描述运动、摄像机和风格。
  • resolution: 720P 或 1080P。
  • duration: 2 到 15 秒。
  • ratio: 必须与输入图像的宽高比匹配,以避免裁剪。

何时使用

  • 您有一张产品照片,需要一个简短的展示。
  • 您有一个人物肖像,想要微妙的运动。
  • 您正在迭代运动风格,然后才确定最终状态。

实际操作提示词

first_frame: 一张玻璃香水瓶放在深色表面上的照片,主光源来自摄像机左侧。prompt: "摄像机缓慢推入。一团水滴从右边缘进入。柔和的粒子在光束中漂浮。电影感,浅景深,暖色边缘光。" 分辨率 1080P,时长 5秒,宽高比 16:9。

失败模式

  • 提示词与图像冲突。 如果提示词要求宽幅摇摄,但 first_frame 是一个特写镜头,模型可能会扭曲主体以适应。
  • 宽高比不匹配。 将 9:16 的图像输入到 16:9 的生成中会导致意外裁剪。始终将输入宽高比与输出 ratio 匹配。
  • 请求的运动过多。 2秒的渲染无法在不模糊的情况下容纳 180 度摇摄。延长时长或减少运动。

我们对一批护肤品广告的产品照片进行了 24 次首帧测试渲染。摄像机保持静止或使用缓慢推入(帧移动小于 10%)的渲染有 80% 的时间成功交付。要求“动态摄像机运动”的渲染有 25% 的时间成功交付,并在反光瓶盖上产生了明显的扭曲。

首尾帧到视频如何工作?

首尾帧到视频接受两张图像,一个 first_frame 和一个 last_frame,并生成中间帧。根据 Wan 2.7 I2V API 参考,这两张图像必须共享相同的宽高比,理想情况下也应具有相同的构图。模型会插值出一个合理的过渡。

输入

  • first_frame (必需): 起始状态图像。
  • last_frame (必需): 结束状态图像。
  • prompt (可选): 描述过渡的感觉,而不是其终点。
  • resolutiondurationratio: 与首帧模式相同的约束。
  • 典型时长: 2 到 5 秒。更长的时长会迫使模型“发明”更多内容。

何时使用

  • 必须以特定结束帧结束的产品展示。
  • 起始和结束状态都经过设计的过渡。
  • 两个关键帧已锁定的分镜镜头。

实际操作提示词

first_frame: 大理石表面上的一个封闭礼品盒。last_frame: 同一个盒子打开,光线从中流出,丝带展开。prompt: "盒子在3秒内平稳打开。摄像机保持静止。光晕从第30帧开始增强。主体无漂移。" 分辨率 1080P,时长 3秒,宽高比 16:9。

失败模式

  • 反光表面模糊。 玻璃、金属和水在插值过程中可能会变形。减少运动幅度或简化表面。
  • 摄像机不匹配。 如果两个关键帧暗示不同的摄像机角度,模型会“发明”一个过渡,这通常看起来像跳切。
  • 时长过长。 超过 5 秒,模型需要填充过多的“发明”运动。保持短时长。

PixMind 首尾帧提示词集 包含与此模式匹配的产品展示、过渡和叙事模式的模板。

视频续写如何工作?

视频续写将一个现有的短片段作为 first_clip,并将其在时间上延长。Wan 2.7 I2V 指南 将其视为一种独特的I2V子模式,因为输入是视频,而不是静止图像。模型从源片段中读取运动矢量并继续它们。

输入

  • first_clip (必需): 一个短视频,通常为 2 到 5 秒。格式和编解码器必须与API接受的列表匹配。
  • prompt (可选): 描述续写应如何演变,而不是重新开始。
  • resolution: 应与源片段匹配,以避免放大伪影。
  • duration: 输出的总长度,而不仅仅是附加部分。

何时使用

  • 一个 3 秒的生成效果很好,但您需要 6 秒。
  • 您想将一个精彩镜头延长为更长的广告剪辑。
  • 第一个片段具有您想要保留的良好运动。

实际操作提示词

first_clip: 一个滑板手滑过摄像机的 3 秒片段,以 720P 拍摄。prompt: "滑板手继续滑过摄像机。摄像机跟随。背景从小巷变为路灯光芒。无剪切。" 分辨率 720P,时长 6秒,宽高比 16:9。

失败模式

  • 运动重置。 如果提示词与源运动冲突,模型可能会冻结主体。使提示词与片段的现有方向保持一致。
  • 分辨率放大伪影。 将 720P 源输入到 1080P 输出会产生模糊或扭曲的帧。使输出分辨率与源匹配。
  • 片段过短。 1 秒的源几乎没有给模型提供可继续的运动。使用至少 2 秒的片段。

[独家见解] 视频续写是I2V子模式中最未被充分利用的。它允许您“挽救”一个提前 2 秒停止的渲染,我们发现这大约占所有生产迭代的三分之一。您无需从头开始重新生成,只需进行追加。

音频驱动模式如何工作?

音频驱动I2V接受一张静止图像和一个 driving_audio 音轨,并生成一个主体与音频同步移动的视频。根据 Wan 2.7 图像到视频指南,这是用于“说话人头像”和“虚拟形象”内容的路径。模型使用音频波形来驱动唇部运动和整体能量。

输入

  • first_frame (必需): 一张肖像或人物图像。正面、光线充足、中性表情效果最佳。
  • driving_audio (必需): 一个干净的音轨。WAV 或 MP3 格式。录音棚质量的音频优于手机录音。
  • prompt (可选): 描述环境运动、头部运动、表情能量。
  • duration: 通常与音频长度匹配,最长 15 秒。

何时使用

  • 从单一肖像生成“说话人头像”解说视频。
  • 用于社交媒体的虚拟形象内容。
  • 带有旁白的、由面部讲述的产品演示。

实际操作提示词

first_frame: 一个插画风格虚拟形象的正面肖像,中性表情,纯色背景。driving_audio: 8 秒的旁白问候 WAV 音频。prompt: "头部轻微摇摆,每 3 秒眨眼一次,句子末尾逐渐露出笑容。" 分辨率 1080P,时长 8秒,宽高比 16:9。

失败模式

  • 非正面人脸的唇部漂移。 如果肖像是侧面,唇部同步会变差。请使用正面人脸。
  • 嘈杂音频。 背景嘶嘶声或音乐会渗入运动伪影。请先清理音频。
  • 长时间无呼吸。 15 秒的连续语音没有停顿会使模型生成不自然的嘴形。请编辑加入停顿。

要了解音频与视频配对的更深层模式,PixMind 音频同步提示词集 包含“说话人头像”、旁白和音乐驱动片段的模板。

如何选择正确的 I2V 模式?

这个决定取决于您手头有什么。Wan 2.7 T2V API 参考 和 I2V 参考共同描述了完整的输入矩阵,但大多数决策都可以归结为一个简单的表格。

您拥有... 使用此 I2V 模式 原因
一张照片 首帧到视频 最简单的路径。模型“发明”运动。
两张必须是开始和结束的照片 首尾帧到视频 锁定结束状态。减少拒绝。
一个需要更多时间的短片段 视频续写 保留现有运动。成本低于重新生成。
一张肖像加一个音轨 音频驱动 唇部同步和能量跟随音频。
一张肖像加一个语音加一个参考视频 考虑使用 R2V R2V 比音频驱动 I2V 更好地保留身份。

一个实用的启发式方法是:您能给模型提供的输入越多,它需要“发明”的内容就越少。而“发明”正是扭曲和漂移出现的地方。

图表:四个堆叠的水平面板,显示了首帧、首尾帧、视频续写和音频驱动的 I2V 模式。

如果您是从头开始,还没有任何输入,请先运行 T2V 传递以锁定镜头,然后将最佳帧用作 I2V 中的 first_frame。这种两阶段工作流程优于尝试在第一次尝试时就获得完美的 I2V 渲染。

常见的 I2V 失败模式有哪些?

I2V 以可预测的方式失败。命名它们有助于您更快地迭代。

  • 反光表面扭曲。 玻璃、镜子、抛光金属在插值过程中会模糊。通过减少运动或简化源图像中的表面来缓解。
  • 帧间身份漂移。 人脸会发生变化,尤其是在超过 5 秒后。对于短时锁定镜头,使用首尾帧模式缓解;对于更长的身份保留,使用 R2V。
  • 宽高比不匹配。 将 9:16 的图像输入到 16:9 的生成中会裁剪主体。匹配输入和输出宽高比。
  • 提示词与图像冲突。 在特写镜头上要求“宽幅摇摄”会迫使模型“发明”它看不到的广角上下文。使提示词与图像构图对齐。
  • 音频噪声渗入运动。 手机质量的音频会在人脸上产生鬼影运动。请先清理音频。
  • 长时间迭代的积分消耗。 10 秒 1080P 的渲染会消耗积分。先以 2 到 3 秒和 720P 进行迭代,然后放大。

在一批为广告活动进行的 40 次 I2V 渲染中,失败大致分为:40% 提示词与图像冲突,25% 宽高比不匹配,20% 反光扭曲,15% 其他。宽高比不匹配是最便宜的修复方式:它只是一个参数检查,却造成了四分之一的积分浪费。

要了解跨用例的更深层失败模式,PixMind Wan 2.7 用例集 包含产品、人物和社交视频的每个场景说明。

Wan 2.7 I2V 模式常见问题

Wan 2.7 中的 I2V 和 R2V 有什么区别?

I2V(图像到视频)接受静止图像或短片段作为输入。R2V(参考到视频)接受最多五张参考图像、五个参考片段和一个参考音轨,并使用它们来保留身份、声音和风格。R2V 更适用于多镜头一致性,I2V 更适用于单镜头工作。

Wan 2.7 首尾帧模式可以处理摄像机移动吗?

可以,但两个关键帧应暗示一致的摄像机角度。如果 first_framelast_frame 暗示不同的角度,模型会“发明”一个过渡,这通常看起来像跳切。保持摄像机变化微妙,小于 15 度。

Wan 2.7 视频续写可以将片段延长多长时间?

视频续写可以将源片段延长到 I2V 模式的 15 秒硬性上限。源片段加上生成的续写总时长不能超过 15 秒。对于更长的视频,请链接多个续写调用。

Wan 2.7 音频驱动模式要求图像中有人脸吗?

它在有人脸的情况下效果最佳,但并非必需。没有人脸时,音频会驱动整体运动能量而不是唇部同步。带有音频驱动模式的风景或产品镜头会产生跟随音频幅度的抽象运动。

Wan 2.7 I2V 可以免费试用吗?

是的。PixMind Wan 2.7 页面 包含免费试用,无需信用卡。付费计划仅在您超出试用配额时才生效。

观看实际效果