
首帧-尾帧AI视频:Wan 2.7 与 Sora 2 对比(规格、模式与权衡)
Wan 2.7 和 Sora 2 都能从关键帧生成视频,但它们提供了不同的控制方式。本文根据截至 2026 年 7 月供应商发布的规格,对两者进行了并排比较。
阅读更多
首尾帧是 Wan 2.7 图像到视频 (I2V) 的一个子模式。您提供两张图像:一张作为第一帧,一张作为最后一帧。Wan 2.7 会生成连接它们的中间帧。根据 Alibaba Cloud I2V API 参考,该模型接受一对有序的图像输入,并输出最高1080P的MP4视频。
这很重要,因为单图像I2V会将最终状态留给模型。如果您的镜头必须停留在特定帧上,例如产品完全旋转或盒子完全打开,那么首尾帧模式是您保证实现这一目标的途径。有关模式背景信息,请参阅 PixMind Wan 2.7 视频生成器,其中一个创建界面处理所有I2V子模式。
核心工作流程分为五步:准备两个关键帧、按顺序上传它们、设置时长、编写过渡提示,然后渲染并评估。每一步都有一个决定,决定着渲染是否成功。
关键帧质量是干净的首尾帧渲染最重要的预测因素。Wan 2.7 图像到视频用户指南 建议在两个帧之间匹配构图、光照和摄像机角度。我们发现,不匹配的关键帧会迫使模型发明过渡,从而导致变形和身份漂移。
三条一致性规则涵盖了大多数情况。通过将两个主体置于相同的屏幕位置来匹配构图。通过保持相同的主光源方向和色温来匹配光照。通过保持焦距、角度和距离不变来匹配摄像机。打破任何一条规则,模型都必须在不连续性之间进行插值。
引用摘要:关键帧一致性是 Wan 2.7 首尾帧质量的主导因素。Alibaba Cloud 图像到视频用户指南建议在两个输入帧之间匹配构图、光照和摄像机角度,以避免模型发明的过渡导致变形和身份漂移。
我们曾因测试第一帧以35mm拍摄而最后一帧以50mm拍摄的组合而浪费了信用点。模型在视频中间产生了刺耳的“咔嚓”声。在生成之前锁定焦距。
Wan 2.7 期望这两个帧以定义的顺序排列。您传递的第一张图像成为起始状态,第二张成为结束状态。根据 Alibaba Cloud Model Studio 概述,I2V 调用接受图像URL或base64编码的负载,模型将输入数组视为有序序列。
顺序比人们预期的更重要。如果您先上传打开的盒子图像,然后上传关闭的盒子图像,您将得到一个关闭动画。反转顺序,您将得到一个打开动画。模型不会仅仅从提示中推断意图;帧序列是方向的真实来源。
两个帧应与目标输出共享相同的宽高比。如果第一帧是9:16而最后一帧是1:1,将强制进行裁剪,裁剪会在边缘引入伪影。在上传之前,将两个帧都调整为输出分辨率。
一个实用的尺寸建议:对于1080P的16:9输出,目标尺寸为1920x1080;对于9:16,目标尺寸为1080x1920;对于1:1,目标尺寸为1080x1080。每个帧的文件大小应保持在10MB以下,以避免在慢速连接上出现超时失败。
以一种能明确显示序列的方式命名您的文件。例如,keyframe-01-closed.png 和 keyframe-02-open.png 可以消除上传时的猜测。这听起来微不足道,但上传顺序颠倒是我们看到的第二常见的失败。
时长控制模型必须在两个关键帧之间生成的插值帧数。更长的时长意味着更多的插值,也意味着模型更容易出现漂移。Wan 2.7 I2V API 参考 支持I2V的时长范围为2到15秒。
我们建议任何新的关键帧对都从2到5秒开始。短时长渲染可以廉价地暴露出故障模式。如果模型可以在3秒内干净地插值,那么您可以在下一次尝试中自信地延长到8或10秒。
引用摘要:Wan 2.7 I2V 支持2到15秒的时长,但信用点成本与时长线性相关。在2到5秒进行测试,可以以10秒渲染成本的一小部分暴露出变形、漂移和镜头跳跃等故障模式。
短时长适用于小幅度运动。3秒的渲染适合盒子盖子抬起。5秒的渲染适合角色从背面转向正面。如果超过8秒,模型必须发明两个关键帧都没有暗示的中间运动,这时就会出现幻觉运动。
时长与成本线性相关。一个10秒的1080P渲染成本大约是2秒1080P渲染成本的五倍。如果您在10秒时测试失败,您将为无法使用的渲染支付全价。先进行短时长测试,然后再提交。
首尾帧模式中的提示描述的是两个帧之间的运动。它不重新描述主体;关键帧已经完成了这一点。PixMind 首尾帧提示集群 整理了下面三个实操案例的提示模式。
过渡提示有四个部分:动作、速度、摄像机行为和风格。每个部分都应保持一个简短的从句。过长的提示会分散模型的注意力,并产生更柔和的运动。
引用摘要:Wan 2.7 首尾帧模式中的过渡提示应描述运动,而非主体。有效的提示涵盖四个部分:动作、速度、摄像机行为和风格。每个部分作为一个简短的从句,其效果优于重新描述关键帧内容的段落式提示。
抵制重新描述主体的冲动。如果第一个关键帧是一个关闭的礼品盒,您的提示不需要说“木桌上的一个关闭的礼品盒”。模型已经知道。重新描述会促使模型重新渲染盒子,这会干扰插值。
[独特见解] 过渡提示的作用是限制运动,而不是声明主体。将其视为给已了解服装的舞者提供的编舞笔记。
每个首尾帧渲染都需要明确的评估环节。我们从五个维度进行评估,每个维度都评定为通过或失败。任何维度失败的渲染都将返回步骤1或步骤4,而不是最终交付。

这五个维度涵盖了身份、摄像机、光照、运动和目标帧准确性。前三个来自关键帧质量。后两个来自提示和时长选择。
引用摘要:Wan 2.7 首尾帧渲染应从五个二元维度进行评估:身份一致性、摄像机连续性、光照连续性、运动合理性以及目标帧达成度。任何维度失败的渲染都应在关键帧或提示阶段进行修改,而不是盲目地重新生成。
主体在所有帧中看起来是否相同?对于角色,检查面部几何结构。对于产品,检查轮廓和品牌。这里的漂移通常源于关键帧在角度上的不一致。
摄像机是否保持在应有的位置?如果您指定了静态,请检查是否有意外的推近。如果您指定了推近,请检查移动是否平滑且没有卡顿。
光照方向是否保持不变?注意视频中间的阴影翻转,这表明模型在帧之间切换了光源。
运动看起来是否符合物理规律?盖子不会穿过盒子。肢体不会向后弯曲。头发不会在半空中凝固。不合理的运动通常意味着提示在过短的时长内要求过多。
生成视频的最后一帧是否与您上传的最后一帧图像匹配?这是该模式得名的测试。如果模型接近但不完全精确,请收紧您的提示或缩短时长。
以下三种模式涵盖了我们在 PixMind 上看到的大多数首尾帧用例。每个案例都包括关键帧准备、提示、时长以及最常出现的故障模式。
关键帧:两张产品照片,相同的摄像机和光照。第一帧:盖子关闭。第二帧:盖子完全打开,内部可见。
提示:“盖子缓慢向上抬起并向后倾斜,露出内部。静态摄像机,柔和的电影感光照,三秒时长。”
时长:3秒,1080P,16:9。
故障模式:反射表面变形。如果盒子有光泽表面,模型会在盖子移动时涂抹高光。通过减少关键帧的光泽或在提示中添加“哑光表面”来缓解。
关键帧:两张角色渲染图,相同的光照和焦距。第一帧:从背面看角色。第二帧:角色面向摄像机。
提示:“人物缓慢旋转面向摄像机,在四秒内顺时针转动。静态中景,电影景深。”
时长:4到5秒,1080P。
故障模式:身份漂移。面部可能在转身过程中发生变化。通过使两个关键帧在转身过程中尽可能正面,或使用参考到视频(R2V)模式以更强地保留身份来缓解。
关键帧:两张风景照片,构图相同。第一帧:白天。第二帧:夜晚,人工灯光亮起。
提示:“天空在五秒内从白天逐渐变暗到夜晚,人工灯光逐渐亮起,色温变冷。静态摄像机,固定三脚架。”
时长:5秒,1080P。
故障模式:镜头跳跃。如果两张风景照片的拍摄位置即使略有不同,模型也会发明一个摄像机移动来连接它们。通过使用固定三脚架拍摄两个关键帧,或使用单次曝光包围拍摄来缓解。
命名故障模式是您更快交付的方式。以下三种故障模式占我们看到的大多数被拒绝渲染。
玻璃、抛光金属和水在插值过程中会涂抹,因为模型无法一致地跟踪反射。减少运动幅度,在关键帧中切换到哑光表面,或缩短时长,以便模型需要发明的帧数更少。
面部和轮廓在帧之间发生变化。当两个关键帧在角度或表情上不一致时,这种情况最常见。以匹配的角度重新拍摄关键帧,或切换到R2V模式并使用参考图像来锚定身份。
模型会发明一个摄像机移动来连接暗示不同角度的两个关键帧。修复方法在于上游:锁定两个关键帧的焦距、角度和高度。如果您无法重新拍摄,请接受摄像机移动并将其写入提示中。
我们发现镜头跳跃是最常被误诊为“模型错误”的故障模式。模型正在完全按照关键帧的指示进行操作。修复输入。
首帧模式接受一张图像作为起始状态,并让模型发明结束状态。首尾帧模式接受两张图像,并强制模型停留在第二张图像上。首尾帧为您提供了首帧模式无法提供的结束状态控制。
从2到5秒开始。短时长可以廉价地暴露出故障模式。根据 Alibaba Cloud I2V API 参考,支持2到15秒的时长,但长时间会增加插值距离和伪影风险。
可以,但需谨慎。反射表面是最常见的变形故障模式。通过减少关键帧的光泽、保持较小的运动幅度以及在提示中写入“哑光表面”来缓解。镜子和抛光铬仍然是最难处理的情况。
在严格的公差范围内匹配两个关键帧的摄像机角度、焦距和光照。如果漂移持续存在,请切换到参考到视频(R2V)模式,并传递参考图像以锚定身份。R2V 在 PixMind Wan 2.7 视频生成器指南 中有详细说明。
是的。Wan 2.7 I2V 支持720P和1080P输出。首尾帧模式继承了这两者。1080P每秒消耗的信用点大约是720P的两倍,因此请在720P下迭代,并在1080P下完成。
11 minutes of work turned into 8.7M views in 5 days
— Woody (@woody_research) May 28, 2026
no camera, no real person, no photoshoots, just a 24 year old kid and an ai girl he generated on his laptop.
I've been watching how the page is built. the whole pipeline is three tools running in sequence.
> chatgpt writes… https://t.co/iNPeLY9r3K pic.twitter.com/4jB5QObIvw

Wan 2.7 和 Sora 2 都能从关键帧生成视频,但它们提供了不同的控制方式。本文根据截至 2026 年 7 月供应商发布的规格,对两者进行了并排比较。
阅读更多

Wan 2.7 首帧 尾帧模式是社交视频钩子的理想选择:首帧吸睛,尾帧引导行动。本文介绍了五种钩子模式,包括关键帧准备、提示词和失败模式。
阅读更多

一个综合案例研究,展示了一个护肤品牌如何使用 Wan 2.7 首尾帧功能制作了一个 5 秒 9:16 的 Instagram 产品揭示广告,其中包含提示词、成本以及三次迭代中吸取的经验教训。
阅读更多