🔥Minimax H3 已上线!开通年费会员立享 45% 折扣立即开通
Pixmind

Wan 2.7 视频生成器:文本、图像和参考视频的完整指南

文章目录

Wan 2.7 视频生成器:文本、图像和参考模式的完整指南

核心要点

  • Wan 2.7 是一个统一模型,在一个工作流程中涵盖了文本到视频 (T2V)、图像到视频 (I2V) 和参考到视频 (R2V) 功能。
  • 它支持 720P 和 1080P 输出,时长 2 到 15 秒,以及包括 16:9、9:16 和 1:1 在内的五种宽高比。
  • 首尾帧和音频驱动模式为您提供了单图像 I2V 模型无法比拟的起始状态和结束状态控制。
  • 参考到视频 (R2V) 在一次调用中最多可接受五张参考图像、五个参考片段和一个参考音轨。
  • 尝试使用 Wan 2.7 视频生成器 来跟随本指南中的任何示例。

什么是 Wan 2.7 视频生成器?

Wan 2.7 是 Alibaba Wan 团队最新的视频生成模型,通过 Alibaba Cloud Model Studio 开放。它将以前的四种独立功能统一到一个模型家族中:文本到视频、图像到视频、参考到视频和视频编辑。根据 Alibaba Cloud 视频生成概述,该模型接受多模态输入,并输出高达 1080P 的 MP4 或 MOV 格式视频。

2.7 版本的关键转变是工作流程的统一。您无需在不同的供应商之间切换以进行文本到视频和图像到视频的生成,而是调用同一个模型,并让 API 根据您传入的输入进行路由。这与 PixMind Wan 2.7 产品页面 相符,该页面提供了一个创建界面来处理所有模式。

对于创作者来说,这很重要,因为模式切换是浪费大部分制作时间的地方。您编写一个提示,渲染,发现起始状态不正确,然后在一个不同的工具中从头开始重建。Wan 2.7 的统一界面允许您在不更换模型的情况下交换输入。

Wan 2.7 支持多少种模式?

Wan 2.7 提供了四种模式。I2V API 参考 文档记录了完整的输入矩阵。以下是实际细分。

模式 输入 最佳用途 最大时长 最大分辨率
T2V (文本到视频) 文本提示,可选音频 故事板、抽象运动、B-roll 15秒 1080P
I2V (图像到视频) 首帧,可选尾帧,可选音频 产品展示、角色动作、动画 15秒 1080P
R2V (参考到视频) 最多 5 张参考图像 + 5 个参考片段 + 参考音频 身份保留、声音克隆、多角色场景 10秒 1080P
视频编辑 源视频 + 指令 风格迁移、基于指令的编辑 10秒 1080P

Diagram: Four-quadrant grid showing Text-to-Video, Image-to-Video, First-Last-Frame, and Reference-Video modes connected to a central hub.

文本到视频 (T2V)

T2V 接受文本提示并输出视频。Wan 2.7 T2V API 参考 列出了支持的参数,包括分辨率、时长、宽高比和可选音轨。T2V 是从想法到片段最快的路径。

当您没有固定的起始帧时,请使用 T2V。抽象运动、B-roll、故事板和风格化序列都适用。当起始状态很重要时,请避免使用 T2V:如果您需要在第零帧显示特定产品,请切换到 I2V。

图像到视频 (I2V)

I2V 是 Wan 2.7 工作流程统一性的体现。Wan 2.7 图像到视频用户指南 记录了四种子模式:

  1. 首帧到视频:一张图像成为起始状态,模型生成运动。
  2. 首尾帧到视频:两张图像定义起始和结束状态,模型进行插值。
  3. 视频续接:一个短片段成为起始状态,模型对其进行扩展。
  4. 音频驱动:一张图像加上一个音轨驱动口型同步或运动。

要深入了解这四种 I2V 路径,请参阅 PixMind 首尾帧提示集群

参考到视频 (R2V)

R2V 是功能最强大但文档最少的模式。Wan 2.7 R2V API 参考 描述了一个调用,它最多可接受五张参考图像、五个参考片段和一个参考音轨。模型使用这些来在输出中保留身份、声音和风格。

当您需要一个角色在不同镜头中看起来一致,或者想要将声音克隆到新场景中时,R2V 是您的选择。权衡之处在于时长:R2V 的上限为 10 秒,比 T2V 和 I2V 的 15 秒上限要短。

视频编辑

视频编辑接受源视频加上文本指令,并返回一个编辑后的片段。Wan 2.7 视频编辑 API 支持基于指令的编辑和风格迁移。此模式超出了生成指南的范围,但值得了解其存在。

首尾帧模式如何工作?

首尾帧是 I2V 的一个子模式。您提供两张图像:一张用于第一帧,一张用于最后一帧。Wan 2.7 生成中间帧。

Diagram: Timeline showing two keyframes with three interpolated frames between them, with the Wan 2.7 logo concept marking the in-between frames.

这很重要,因为单图像 I2V 将结束状态留给了模型。如果您的镜头需要停在特定帧(产品完全旋转、盒子完全打开、角色完全转身),首尾帧是您保证这种停顿的方式。

实际模式是:拍摄或生成两个关键帧,将它们作为首帧和尾帧上传,设置时长,然后渲染。Wan 2.7 会在它们之间插值运动。PixMind 首尾帧提示页面 提供了产品展示、过渡和故事讲述模式的提示模板。

需要注意的常见故障模式:

  • 反射表面扭曲:玻璃、金属和水在插值过程中可能会模糊。
  • 角色身份漂移:面部可能在帧之间发生变化。
  • 相机不一致:如果两个关键帧暗示了不同的相机角度,模型必须创造一个过渡。

在提交 5-10 秒的渲染之前,请先使用短时长(2-3 秒)进行测试。

音频驱动视频如何工作?

音频驱动模式接受一张静态图像加上一个音轨,并生成一个视频,其中主体似乎与音频同步说话或移动。这是“talking-head”和虚拟形象内容的基础。

模型使用音频波形来驱动两件事:唇部运动(如果存在面部)和整体运动能量。Wan 2.7 I2V API 接受音频作为媒体数组的一部分,使用 driving_audio 类型。

对于“talking-head”用例,请将其与 PixMind 角色表演集群 结合使用。音频驱动的 I2V 加上清晰的参考肖像的组合是目前无需训练自定义模型即可实现口型同步虚拟形象的最佳开放路径。

两个实用注意事项:

  • 音频质量决定视频质量。干净的录音室录音效果优于手机麦克风。
  • 首先用 3 秒的片段进行测试。同步问题更容易及早发现。

您应该选择什么分辨率、时长和宽高比?

Wan 2.7 支持 720P 和 1080P 输出。权衡在于成本与清晰度。根据 PixMind 定价策略,1080P 每秒消耗的积分大约是 720P 的两倍。

设置 何时选择 权衡
720P 社交优先内容、竖屏视频、测试迭代 成本较低,在大屏幕上可见柔和度
1080P 产品展示、电影预演、广告创意 成本较高,细节更清晰
16:9 YouTube、网站嵌入 标准宽屏
9:16 Reels、TikTok、Shorts 移动竖屏
1:1 信息流帖子、方形嵌入 跨平台中立
4:3 / 3:4 编辑、复古风格 小众

时长与成本呈线性关系。10 秒的渲染成本大约是相同分辨率下 2 秒渲染的 5 倍。对于迭代,请选择短时长。对于最终版本,请选择长时长。

新用户的合理默认设置:720P,5 秒,16:9。确认镜头效果良好后,再将最终版本升级到 1080P。

如何选择正确的 Wan 2.7 模式?

一旦您知道自己有哪些输入,决策树就很简单。

Workflow diagram showing 5 stages: Input, Mode Detection, Model Routing, Generation, Output.

  • 您只有一个想法:使用 T2V。在添加视觉效果之前,先迭代提示。
  • 您有一张产品照片:使用 I2V 首帧模式。
  • 您有两个必须是起始和结束的关键帧:使用 I2V 首尾帧。
  • 您有一个需要扩展的短片段:使用 I2V 视频续接。
  • 您有一张肖像加上画外音:使用 I2V 音频驱动。
  • 您需要在不同镜头中保留身份或声音:使用 R2V。
  • 您有需要编辑或风格更改的现有素材:使用视频编辑。

如果您不确定,请从 PixMind Wan 系列中心 开始,并根据用例而非模式名称进行选择。该中心会根据您要制作的内容将您引导至正确的界面。

您应该如何提示 Wan 2.7?

提示结构比提示长度更重要。Wan 2.7 奖励五段式结构:主体、动作、设置、相机、风格。

一个示例结构:

主体:一个放在深色表面上的玻璃香水瓶。动作:一串水滴向右喷出。设置:工作室黑色背景,来自相机左侧的单一主光。相机:静态中景,50mm 等效焦距。风格:电影感,浅景深,暖色边缘光。

每个片段都缩小了输出空间。缺失的片段将默认为模型的先验知识,这通常是通用的。

对于更深入的提示模式,PixMind 多镜头提示集群 涵盖了 12 种可重用结构,包括多镜头序列、音频同步模式和首尾帧故事板。

要避免的两个提示陷阱:

  • 过载提示:一个提示中超过五个主题会使模型混淆。将其拆分为多个渲染。
  • 负面提示过度使用:Wan 2.7 不像图像模型那样重视负面提示。保持它们简短。

Wan 2.7 与其他模型相比如何?

Wan 2.7 处于一个竞争激烈的领域。Sora 2, VEO 3, Kling 2.0 和 Seedance 都针对重叠的用例。区别在于每个模型公开的模式以及成本。

功能 Wan 2.7 Sora 2 VEO 3 Kling 2.0
文本到视频
图像到视频 有限
首尾帧 有限 有限
参考视频 (R2V) 有限
音频驱动 I2V 有限
最大时长 15秒 20秒 8秒 10秒
最大分辨率 1080P 1080P 1080P 1080P

此表反映了截至 2026 年 7 月供应商发布的规格。独立的正面测试可在我们的 Wan 2.7 与 Sora 2 提示测试VEO 与 Kling 对决 中找到。

Wan 2.7 的独特优势是首尾帧与 R2V 的结合。表中没有其他模型能够完全实现这两项功能。如果您的工作流程需要精确的起始和结束控制以及身份保留,Wan 2.7 是目前唯一的单一模型路径。

常见的故障模式有哪些?

每个 AI 视频模型都会失败。指出故障模式有助于您更快地交付。

  • 反射表面扭曲:玻璃、镜子、抛光金属。通过减少提示中的运动幅度来缓解。
  • 镜头间身份漂移:面部在生成之间发生变化。通过 R2V 参考输入来缓解。
  • 帧中幻觉文本:标志、标签、徽标呈现为乱码。通过从输入图像中删除文本来缓解。
  • 宽高比不匹配:将 9:16 图像输入到 16:9 生成中会导致意外裁剪。将输入宽高比与输出宽高比匹配。
  • 长时间迭代的积分消耗:10 秒的测试渲染会快速消耗积分。以 2-3 秒进行迭代。

PixMind 用例集群 针对产品营销、角色表演、电影预演和社交钩子提供了按场景划分的故障模式说明。

Wan 2.7 视频生成器常见问题

Wan 2.7 可以免费试用吗?

是的。PixMind Wan 2.7 页面 包含免费试用,无需信用卡。付费计划仅在您超出试用配额时才生效。

Wan 2.7 支持 4K 吗?

不。Wan 2.7 视频最高支持 1080P。Wan 2.7 图像模型通过 Pro 等级支持 4K 静态图像,但视频输出上限为 1080P。

Wan 2.7 可以克隆特定人物的面部吗?

Wan 2.7 可以从参考输入中保留身份,但 PixMind 政策禁止未经同意克隆真实、可识别人物的肖像。请将 R2V 用于原创角色、库存参考或您自己的肖像。

Wan 2.7 渲染一次需要多长时间?

生成时间取决于时长、分辨率和负载。典型的 5 秒 720P 渲染在 60-90 秒内完成。10 秒 1080P 渲染可能需要 3-5 分钟。API 返回一个任务 ID,您可以轮询其状态。

Wan 2.7 会生成音频吗?

是的,但仅限于接受音频输入的模式。T2V 可以接受音轨并与之进行运动同步。I2V 音频驱动模式使用音频来驱动唇部和运动同步。纯音频生成(音乐、音效)是另一个 Alibaba 模型。

我可以将 Wan 2.7 的输出用于商业用途吗?

是的。您生成的输出根据 Alibaba Cloud Model Studio 的条款可用于商业用途。在发布之前,请查阅 Alibaba Cloud Model Studio 概述 上的当前条款。

观看实际操作

继续浏览中,生成器即将加载...