Pixmind

Wan 2.7 提示工程:12 个可复用模式及示例

PixMind Editorial Team
继续浏览中,生成器即将加载...

Wan 2.7 提示工程:12 个可复用模式

主要收获

  • Wan 2.7 提示的最佳工作方式是采用五段式结构:主体、动作、场景、镜头和风格。
  • 12 种可复用模式涵盖了我们在生产中遇到的 80% 的 T2V、I2V 和首尾帧用例。
  • 每个模式都包含一个模板、一个示例以及我们在实际渲染中测得的特定失败模式。
  • 大多数失败可归因于提示过载、缺少镜头意图或输入模式错误。以下模式解决了前两个问题。
  • 有关更深入的多镜头配方,请参阅 PixMind 多镜头 Wan 2.7 提示页面

Wan 2.7 奖励结构。没有镜头意图的提示默认为静态广角镜头。没有风格提示的提示默认为中性写实主义。以下模式是从 2026 年 6 月和 7 月期间,跨 T2V、I2V 和首尾帧模式的大约 600 个渲染中提取的。我们对其进行了命名,以便团队可以停止从头开始重写提示。

Wan 2.7 提示的结构是什么?

我们发布的每一个可靠的 Wan 2.7 提示都包含五个部分:主体、动作、场景、镜头和风格。Alibaba Cloud Model Studio 视频生成指南 证实模型将这些视为离散的语义字段,而非自由形式的散文。模式是:首先命名主体,然后是动作,然后是场景,然后是镜头,然后是风格。

图表:Wan 2.7 提示分解为五个颜色编码的片段:主体、动作、场景、镜头、风格。

缺失的片段是导致通用输出的首要原因。当提示省略镜头意图时,Wan 2.7 会选择一个默认值。当提示省略风格时,你会得到中性写实主义,这虽然可以接受,但很少是目标。

我们测试了 80 个提示,依次移除每个片段。风格的省略导致了最大的质量下降,紧随其后的是镜头的省略。主体的移除大约有三分之一的时间会直接导致渲染中断。

主体

主体是镜头指向的名词。尽可能使用单个主要主体。如果两个主体之间存在空间关系(“一个杯子旁边有一个瓶子”),则可以使用。三个或更多主体会使模型过载并产生混合伪影。

动作

动作是主体在剪辑持续时间内所做的事情。Wan 2.7 会字面理解动词。“喷洒”会产生运动。“坐”会产生一个静态主体。将动作长度与剪辑持续时间匹配:一个 2 秒的渲染不能包含一个 10 秒的动作。

场景

场景是环境和照明。要具体。“工作室背景,相机左侧有一个主光”优于“工作室照明”。光线方向很重要,因为它决定了反射的外观,而反射通常是扭曲出现的地方。

镜头

镜头部分命名了镜头、构图和运动。Wan 2.7 支持静态、推、拉、环绕、轨道、摇、俯仰和手持。当视场很重要时,以毫米为单位指定焦距。50 毫米中景与 24 毫米广角看起来不同。

风格

风格部分权重最大。电影式、编辑式、纪录片式、动漫式、档案式、超现实。选择一个。堆叠风格(“电影式纪录片档案式”)会产生视觉噪点。

模式 1:五段式结构

何时使用

将五段式结构用于每个默认提示。它是本指南中所有其他模式的基础模式。如果你只学习一种模式,就学习这种。

模板

[Subject]. [Action]. [Setting]. [Camera: framing, focal length, motion]. [Style: one descriptor, optional modifiers].

示例

一个玻璃香水瓶放在抛光的黑色表面上。一束细小的水滴向右喷出。工作室黑色背景,相机左侧有一个暖色主光。静态中景,50 毫米等效焦距。电影感,浅景深,暖色边缘光。

常见失败

用多个意图使任何单个片段过载。例如,在风格槽中写入“电影式编辑式纪录片式外观”会产生三者的平庸平均值。选择一个。

模式 2:反向揭示

何时使用

当你希望在剪辑开始时隐藏主体并在结束时揭示它时,请使用反向揭示。它适用于产品揭示、礼物开启以及任何依赖好奇心的钩子。 PixMind 首尾帧提示集群 深入介绍了此模式,并提供了关键帧配方。

模板

[Extreme close-up of one detail of the subject]. [The camera pulls back slowly to reveal the full subject]. [Setting]. [Camera: slow pull-back, 35mm to 50mm]. [Style].

示例

深色织物上金属拉链齿的特写。镜头缓慢拉远,展现出放在混凝土地板上的结构化皮夹克。工业阁楼,侧窗光线,可见灰尘颗粒。缓慢拉远,35 毫米至 50 毫米等效焦距。编辑时尚风格,柔和对比度。

常见失败

拉远太快。Wan 2.7 会读取“缓慢”,但在持续时间短时会忽略定性速度词。在 2 秒内,揭示没有时间呈现。反向揭示至少使用 5 秒。

模式 3:镜头前推

何时使用

镜头前推用于强调。当主体已经构图并且你希望加深观众的注意力时,向前推。它相当于电影中的变焦,但通过物理移动相机来实现。

模板

[Subject, already framed]. [Subtle action: a glance, a shift, a flicker]. [Setting]. [Camera: steady push-in from medium to close-up, 50mm]. [Style: cinematic, shallow depth of field].

示例

木桌上的陶瓷茶壶,壶嘴冒着蒸汽。镜头在 4 秒内从中景推至特写。早晨厨房,相机右侧柔和的窗户光线。稳定推入,50 毫米等效焦距。电影感,暖色调。

常见失败

将推入与主体运动结合。如果主体也移动,镜头运动会被解读为手持抖动。要么镜头移动,要么主体移动,不能两者都移动。

模式 4:环绕

何时使用

环绕模式在一个连续镜头中从多个角度展示 3D 主体。适用于产品、雕塑和建筑等需要理解维度的情况。根据 Alibaba Cloud I2V API 参考,模型将“环绕”解释为围绕锁定主体的 360 度相机路径。

模板

[Subject centered in frame]. [Subject is still or has minimal motion]. [Setting: simple backdrop, no competing detail]. [Camera: 360-degree orbit around the subject at eye level]. [Style].

示例

一个极简主义陶瓷花瓶置于石基座中央。花瓶静止,内有一根干枯的茎。空旷的画廊空间,天窗透入柔和的日光。360 度眼平环绕,35 毫米等效焦距。编辑产品影片,柔和对比度。

常见失败

在复杂背景下环绕。当相机移动时,模型必须创造主体背后的内容。保持背景干净,否则可能会出现伪影。

模式 5:产品细节拉焦

何时使用

当你需要将注意力从整个产品转移到某个特定功能时,请使用拉焦。这是产品营销剪辑的标准模式,其中一个细节(标志、纹理、搭扣)需要最终的强调。

模板

[Wide frame showing the full product]. [A specific detail is in the background, slightly soft]. [Setting]. [Camera: rack focus from wide to the detail over 3 seconds, then hold]. [Style].

示例

一个皮革钱包打开放在石板表面上。压印的制造商标志位于内翻盖上,略微失焦。石板表面,侧向掠光,深影。在 3 秒内从钱包到制造商标志进行焦点切换,然后保持 2 秒。编辑产品,暖色调。

常见失败

忘记指定哪个细节获得焦点。模型会选择一个。如果提示没有命名焦点目标,你将得到一个任意的焦点细节,通常是错误的。

模式 6:多镜头序列

何时使用

多镜头序列将两个或更多镜头拼接成一个生成。它是短篇叙事、带上下文的产品揭示或需要建立镜头和高潮的社交钩子的正确模式。PixMind 多镜头 Wan 2.7 提示页面 是此模式的深度伴侣。

模板

Shot 1 (establishing): [wide framing, setting]. Shot 2 (closer): [subject, action]. Shot 3 (detail): [close-up, key detail]. [Setting runs through]. [Camera: explicit per shot]. [Style].

示例

镜头 1:雨夜东京小巷的广角全景,霓虹灯倒映在湿沥青上。镜头 2:中景,雨伞向上倾斜,露出一个背光人物。镜头 3:雨滴从伞边滑落的特写。东京小巷,霓虹灯牌,湿润的表面。镜头:锁定广角,缓慢向上倾斜,微距静态。电影感,冷色调。

常见失败

2 秒剪辑中的三个镜头。每个镜头至少需要 1.5 秒才能被感知。三个镜头意味着至少 5 秒。任何更短的都会产生频闪。

模式 7:延时压缩

何时使用

当你希望在短剪辑中展示一个漫长过程时,请使用延时压缩。日落、植物生长、建造序列和衰变都适用。Wan 2.7 将“延时”解读为加速运动,而不是字面上的跳帧。

模板

[Subject positioned for a long-duration change]. [Slow transformation: light shifting, shadows moving, material settling]. [Setting]. [Camera: locked-off static shot, 24mm to 35mm]. [Style: time-lapse, soft motion blur on transitions].

示例

窗边木桌上的一碗水果。在持续时间内,光线从凉爽的早晨变为温暖的下午,阴影旋转,苹果慢慢变软。自然房间,单窗。锁定静态镜头,35 毫米等效焦距。延时摄影,暖色调。

常见失败

要求超出模型物理限制的转换。一朵花在 3 秒内开放是可行的。一座建筑在 5 秒内建成则不行。

模式 8:音频同步节拍模式

何时使用

音频同步节拍模式将 I2V 音频驱动模式与围绕音频节奏构建的提示配对。它适用于讲话头像剪辑、音乐同步产品揭示以及任何音频定义运动能量的情况。PixMind 音频同步提示集群 深入介绍了此模式。

模板

[Subject portrait or product]. [Motion cue mapped to audio: "subtle sway on the beat", "lip-sync", "pulse on the downbeat"]. [Setting: simple, neutral]. [Camera: static or minimal drift]. [Style]. Pair with [audio file: type, duration, BPM if musical].

示例

风格化头像肖像,面向镜头。与附带的画外音进行唇形同步,在短语边界处头部轻微摇摆,句子之间眨眼。中性深色背景,柔和主光。静态中近景,50 毫米等效焦距。电影感肖像,暖色边缘。配以 6 秒 120 BPM 的画外音。

常见失败

忘记附加音频。没有音频,模型会创造通用的空闲运动,并且唇形同步的声明会被忽略。在渲染之前务必确认已附加音频输入。

模式 9:首尾帧故事板

何时使用

首尾帧故事板适用于任何开始状态和结束状态必须明确的剪辑。Wan 2.7 会插值中间帧。将其用于礼物开启、门开启、变形以及最终帧为已知图像的产品揭示。

模板

First frame: [exact description of the start image]. Last frame: [exact description of the end image]. [Connecting action that transforms start to end]. [Setting consistent across both frames]. [Camera: explicit and consistent]. [Style].

示例

第一帧:一个封闭的哑光礼品盒放在大理石表面上,俯视。最后一帧:同一个盒子完全打开,光线从内部流出,盖子放在一侧。盖子缓慢抬起,光线溢出。大理石表面,单个顶灯。锁定俯视,35 毫米等效焦距。电影感,温暖的体积光。

常见失败

两个关键帧之间的镜头角度不匹配。如果第一帧是俯视,而最后一帧是眼平,模型会创造一个通常看起来错误的镜头移动。确保两个关键帧的镜头角度匹配。

模式 10:参考锁定重制

何时使用

参考锁定重制使用 R2V 模式来保留参考剪辑中的身份、风格或运动。当输出必须在多个镜头中看起来与输入角色、声音或视觉风格一致时使用它。根据 Alibaba Cloud Wan I2V 指南,R2V 在一次调用中最多接受五个参考图像和五个参考剪辑。

模板

Reference inputs: [N reference images, M reference clips, optional audio]. [Subject description matching the reference identity]. [Action within the reference character's range]. [Setting]. [Camera]. [Style consistent with reference].

示例

参考输入:三个风格化动漫角色的参考图像,一个行走循环的参考剪辑,无参考音频。同一个风格化动漫角色穿过霓虹灯照亮的巷道,回头看了一眼。夜晚霓虹灯照亮的巷道,湿地面反射。跟踪中景,50 毫米等效焦距。动漫风格,鲜艳色彩分级。

常见失败

混合参考身份。如果参考图像显示两个不同的角色,模型会将其平均。每次渲染锁定一个身份。

模式 11:负空间揭示

何时使用

负空间揭示利用空白帧区域作为主体出现的舞台。将其用于吸引观众目光进入空白然后获得回报的钩子。它非常适用于垂直社交格式,其中第一帧必须在视觉上保持安静。

模板

[Frame opens on mostly empty space, single subtle texture]. [The subject enters from a frame edge, slow]. [Setting: minimal, single light source]. [Camera: static or slow drift]. [Style].

示例

画面以一个几乎空旷的混凝土墙开始,只有一束暖光。一个人物从右边缘缓慢进入,走进光线,停顿。混凝土内部,单个暖光束,深影。静态中景,50 毫米等效焦距。电影感,高对比度。

常见失败

过早填充负空间。如果主体在第一秒进入,钩子就会失效。在主体到达之前,保持空帧至少 1.5 秒。

模式 12:微动微妙模式

何时使用

微动模式适用于剪辑感觉几乎像带有微小运动提示的静止图像的情况。它是编辑产品照片、档案风格肖像以及任何明显运动显得廉价的场景的正确选择。

模板

[Subject framed as a still image]. [One single subtle motion: a blink, a breath, a steam wisp, a fabric shift]. [Setting]. [Camera: locked-off static]. [Style: editorial, minimal motion].

示例

亚麻表面上的一个陶瓷黑咖啡杯,俯视。一缕蒸汽从咖啡表面向上飘散。亚麻表面,相机右侧柔和的窗户光线。锁定俯视,50 毫米等效焦距。编辑静物,温暖自然光。

常见失败

添加第二个运动。该模式之所以有效,是因为只有一个物体在移动。第二个运动(蒸汽加上阴影移动)会打破这种魔力,剪辑看起来就像普通的视频。

如何组合模式?

大多数生产剪辑结合了两种模式。反向揭示加上拉焦是一种常见的产品揭示。多镜头序列加上微动结尾是一种常见的社交钩子。经验法则:将结构模式(结构、多镜头、首尾帧)与运动模式(环绕、推、拉焦)结合。

[独特见解] 良好组合的模式共享一个镜头意图。具有冲突镜头意图的模式,例如环绕加上推,会相互冲突并产生抖动。选择镜头片段一致的模式。

组合时,按照观众将看到的顺序编写提示。模型从左到右读取提示,并更重视较早的片段。提示的前 20 个词决定了大部分视觉结果。

有关跨模型的比较上下文,请参阅我们的 完整的 Wan 2.7 视频生成器指南多镜头 Wan 2.7 提示伴侣

Wan 2.7 提示工程常见问题

Wan 2.7 提示应该多长?

一个有效的 Wan 2.7 提示应包含 40 到 80 个词,涵盖所有五个结构片段。过长的提示会稀释镜头意图。过短的提示则给模型留下了太多预设。上述 12 种模式都处于这个范围。根据 Alibaba Cloud Model Studio 视频生成概述,模型会截断超过大约 500 个 token 的提示。

Wan 2.7 支持负面提示吗?

Wan 2.7 接受负面提示,但与图像模型相比,其权重较轻。负面提示应保持简短,最多三到五个词。过长的负面列表效果甚微,并会消耗提示预算。使用具体的负面词,如“文本、水印、标志”,而不是抽象的词,如“丑陋”。

我应该在 Wan 2.7 上使用 PromptExtend 吗?

视情况而定。当你的基础提示少于 30 个词时,PromptExtend 会有所帮助。当你的基础提示已经涵盖了五段式结构时,它会稀释具体的镜头指令。在一次渲染中测试两种方式。我们的 Wan 2.7 中 PromptExtend 评测 提供了并排数据。

哪种模式最适合产品广告?

首尾帧故事板加上镜头前推是我们为产品广告测得的最强组合。从广角产品画面开始,以细节特写结束。PixMind 产品营销用例集群 提供了完整的案例研究。

如何防止反射表面出现扭曲?

减少提示中的运动幅度。将“快速旋转”替换为“缓慢漂移”。在场景片段中添加明确的光线方向,因为反射会跟随光线。首先在 720P 下测试,因为扭曲在 1080P 下更明显。

观看实际效果

X 上的相关内容Rel1vs — 讨论如何使用 Claude 或 Grok 来描述 Wan 2.7 提示的参考。

相关工具