Wan 2.7 提示工程:12 個可重複使用的模式
主要重點
- Wan 2.7 提示的最佳運作方式是採用五個部分組成:主體、動作、場景、攝影機和風格。
- 十二個可重複使用的模式涵蓋了我們在生產中看到的 80% 的 T2V、I2V 和首尾幀使用案例。
- 每個模式都包含一個範本、一個實際範例,以及我們在實際渲染中測量到的特定失敗模式。
- 大多數失敗可歸因於提示過載、缺少攝影機意圖或輸入模式錯誤。以下模式解決了前兩個問題。
- 如需更深入的多鏡頭配方,請參閱 PixMind 多鏡頭 Wan 2.7 提示頁面。
Wan 2.7 獎勵結構。沒有攝影機意圖的提示預設為靜態廣角鏡頭。沒有風格提示的提示預設為中性寫實主義。以下模式是從 2026 年 6 月和 7 月期間,在 T2V、I2V 和首尾幀模式下約 600 個渲染中提取的。我們將它們命名,以便團隊可以停止從頭開始重寫提示。
Wan 2.7 提示的結構是什麼?
我們發布的每個可靠的 Wan 2.7 提示都包含五個部分:主體、動作、場景、攝影機、風格。Alibaba Cloud Model Studio 影片生成指南 證實模型將這些視為離散的語義場,而非自由形式的散文。模式是:先命名主體,然後是動作,然後是場景,然後是攝影機,然後是風格。

缺少部分是產生通用輸出的主要原因。當提示省略攝影機意圖時,Wan 2.7 會選擇預設值。當提示省略風格時,您會得到中性寫實主義,這雖然可以接受,但很少是目標。
我們測試了 80 個提示,每次依序移除一個部分。風格的省略導致最大的品質下降,緊隨其後的是攝影機的省略。主體的移除大約有三分之一的時間會直接導致渲染失敗。
主體
主體是攝影機指向的名詞。盡可能使用單一主要主體。如果兩個主體之間存在空間關係(「一個杯子在一個瓶子旁邊」),則可以。三個或更多主體會使模型過載並產生混合偽影。
動作
動作是主體在影片片段持續時間內所做的事情。Wan 2.7 會按字面意思讀取動詞。「噴灑」會產生動作。「坐」會產生靜態主體。將動作長度與影片片段持續時間匹配:一個 2 秒的渲染無法包含一個 10 秒的動作。
場景
場景是環境和照明。要具體。「帶有攝影機左側單一主光的攝影棚背景」優於「攝影棚照明」。光線方向很重要,因為它決定了反射的外觀,而扭曲通常出現在反射處。
攝影機
攝影機部分命名了鏡頭、構圖和運動。Wan 2.7 支援靜態、推、拉、環繞、推軌、搖攝、傾斜和手持。當視野很重要時,請以毫米為單位指定焦距。50 毫米中景與 24 毫米廣角看起來不同。
風格
風格部分權重最重。電影感、編輯式、紀錄片、動畫、檔案、超寫實。選擇一個。堆疊風格(「電影紀錄片檔案」)會產生視覺雜訊。
模式 1:五部分結構
何時使用
將五部分結構用於每個預設提示。它是本指南中所有其他模式的基礎模式。如果您只學習一個模式,請學習這一個。
範本
[Subject]. [Action]. [Setting]. [Camera: framing, focal length, motion]. [Style: one descriptor, optional modifiers].
實際範例
一個玻璃香水瓶放在拋光的黑色表面上。一團細小的水珠向右噴發。攝影棚黑色背景,攝影機左側單一暖色主光。靜態中景,50 毫米等效。電影感,淺景深,暖色邊緣光。
常見失敗
任何單一區段過載多個意圖。例如,風格欄位中的「電影編輯紀錄片風格」會產生三者的平均值。選擇一個。
模式 2:反向揭示
何時使用
當您想在影片片段開頭隱藏主體並在結尾揭示它時,請使用反向揭示。它適用於產品揭示、禮物開啟以及任何依賴好奇心的鉤子。 PixMind 首尾幀提示群組 深入涵蓋了此模式,並提供了關鍵幀配方。
範本
[Extreme close-up of one detail of the subject]. [The camera pulls back slowly to reveal the full subject]. [Setting]. [Camera: slow pull-back, 35mm to 50mm]. [Style].
實際範例
深色布料上金屬拉鍊齒的特寫。攝影機緩慢拉遠,揭示一件放在水泥地板上的結構化皮夾克。工業閣樓,側面窗戶光線,可見灰塵顆粒。緩慢拉遠,35 毫米至 50 毫米等效。編輯時尚,柔和對比。
常見失敗
拉遠太快。Wan 2.7 會讀取「緩慢」,但在持續時間短時會忽略定性速度詞。在 2 秒內,揭示沒有時間呈現。反向揭示至少使用 5 秒。
模式 3:攝影機前推
何時使用
攝影機前推用於強調。當主體已經構圖並且您想加深觀眾的注意力時,請推入。這相當於電影中的變焦,但它是透過實際移動攝影機向前來實現的。
範本
[Subject, already framed]. [Subtle action: a glance, a shift, a flicker]. [Setting]. [Camera: steady push-in from medium to close-up, 50mm]. [Style: cinematic, shallow depth of field].
實際範例
一個陶瓷茶壺放在木桌上,蒸汽從壺嘴升起。攝影機在 4 秒內從中景推入到特寫。早晨廚房,攝影機右側柔和窗戶光線。穩定推入,50 毫米等效。電影感,暖色調。
常見失敗
將推入與主體運動結合。如果主體也移動,攝影機運動會被讀取為手持晃動。要麼攝影機移動,要麼主體移動,不能兩者兼有。
模式 4:環繞
何時使用
環繞模式在一個連續鏡頭中從多個角度展示 3D 主體。將其用於產品、雕塑和建築,其中尺寸理解很重要。根據 Alibaba Cloud I2V API 參考,模型將「環繞」解釋為圍繞鎖定主體的 360 度攝影機路徑。
範本
[Subject centered in frame]. [Subject is still or has minimal motion]. [Setting: simple backdrop, no competing detail]. [Camera: 360-degree orbit around the subject at eye level]. [Style].
實際範例
一個簡約陶瓷花瓶置於石質基座中央。花瓶靜止不動,內部有一根乾燥的莖。空曠的畫廊空間,天窗透入柔和日光。360 度環繞,與視線齊平,35 毫米等效。編輯產品影片,柔和對比。
常見失敗
在複雜背景下環繞。當攝影機移動時,模型必須創造主體後面的內容。保持背景乾淨,否則會出現偽影。
模式 5:產品細節拉焦
何時使用
當您需要將注意力從整個產品轉移到一個特定功能時,請使用拉焦。這是產品行銷影片的標準模式,其中一個細節(標誌、紋理、扣環)需要最終的強調。
範本
[Wide frame showing the full product]. [A specific detail is in the background, slightly soft]. [Setting]. [Camera: rack focus from wide to the detail over 3 seconds, then hold]. [Style].
實際範例
一個皮革錢包打開放在石板表面上。壓印的製造商標誌位於內部翻蓋上,略微失焦。石板表面,側向掠射光,深陰影。在 3 秒內從錢包拉焦到製造商標誌,然後保持 2 秒。編輯產品,暖色調。
常見失敗
忘記指定哪個細節獲得焦點。模型會選擇一個。如果提示沒有命名焦點目標,您會得到一個任意的細節在焦點中,通常是錯誤的那個。
模式 6:多鏡頭序列
何時使用
多鏡頭序列將兩個或更多鏡頭縫合為一個生成。它是短篇敘事、帶有上下文的產品揭示,或需要建立鏡頭和結果的社交鉤子的正確模式。PixMind 多鏡頭 Wan 2.7 提示頁面 是此模式的深度伴侶。
範本
Shot 1 (establishing): [wide framing, setting]. Shot 2 (closer): [subject, action]. Shot 3 (detail): [close-up, key detail]. [Setting runs through]. [Camera: explicit per shot]. [Style].
實際範例
鏡頭 1:雨夜東京小巷的廣角建立鏡頭,霓虹燈倒影在濕瀝青上。鏡頭 2:中景,雨傘向上傾斜,揭示一個背光人物。鏡頭 3:特寫,雨滴從傘邊滑落。東京小巷,霓虹燈招牌,濕潤表面。攝影機:鎖定廣角,緩慢向上傾斜,微距靜態。電影感,冷色調。
常見失敗
2 秒影片中包含三個鏡頭。每個鏡頭至少需要 1.5 秒才能呈現。三個鏡頭意味著至少 5 秒。任何更短的都會產生頻閃效果。
模式 7:縮時壓縮
何時使用
當您想在短片中展示一個漫長過程時,請使用縮時壓縮。日落、植物生長、建造序列和衰變都適用。Wan 2.7 將「縮時」讀作加速運動,而不是字面上的跳幀。
範本
[Subject positioned for a long-duration change]. [Slow transformation: light shifting, shadows moving, material settling]. [Setting]. [Camera: locked-off static shot, 24mm to 35mm]. [Style: time-lapse, soft motion blur on transitions].
實際範例
一碗水果放在窗邊的木桌上。在整個過程中,光線從涼爽的早晨轉變為溫暖的下午,陰影旋轉,蘋果慢慢變軟。自然房間,單一窗戶。鎖定靜態鏡頭,35 毫米等效。縮時,暖色調。
常見失敗
要求超出模型物理限制的轉換。花朵在 3 秒內開放可行。建築物在 5 秒內建成則不行。
模式 8:音訊同步節拍模式
何時使用
音訊同步節拍模式將 I2V 音訊驅動模式與圍繞音訊節奏構建的提示配對。將其用於說話頭像影片、音樂同步產品揭示,以及任何音訊定義運動能量的情況。PixMind 音訊同步提示群組 深入涵蓋了此內容。
範本
[Subject portrait or product]. [Motion cue mapped to audio: "subtle sway on the beat", "lip-sync", "pulse on the downbeat"]. [Setting: simple, neutral]. [Camera: static or minimal drift]. [Style]. Pair with [audio file: type, duration, BPM if musical].
實際範例
風格化頭像肖像,面向攝影機。與附帶的旁白進行唇形同步,在短語邊界處輕微頭部擺動,句子之間眨眼。中性深色背景,柔和主光。靜態中近景,50 毫米等效。電影感肖像,暖色邊緣。搭配 6 秒 120 BPM 的旁白。
常見失敗
忘記附加音訊。如果沒有音訊,模型會發明通用的閒置運動,並且唇形同步聲明會被忽略。在渲染之前務必確認音訊輸入已附加。
模式 9:首尾幀分鏡
何時使用
首尾幀分鏡是任何影片片段的模式,其中開始狀態和結束狀態必須是特定的。Wan 2.7 會內插中間幀。將此用於禮物開啟、門開啟、變形和產品揭示,其中最終幀是已知圖像。
範本
First frame: [exact description of the start image]. Last frame: [exact description of the end image]. [Connecting action that transforms start to end]. [Setting consistent across both frames]. [Camera: explicit and consistent]. [Style].
實際範例
第一幀:一個封閉的啞光禮盒放在大理石表面上,俯視圖。最後一幀:同一個盒子完全打開,光線從內部流出,蓋子放在一側。蓋子緩慢升起,光線溢出。大理石表面,單一頂燈。鎖定俯視,35 毫米等效。電影感,溫暖體積光。
常見失敗
兩個關鍵幀之間的攝影機角度不匹配。如果第一幀是俯視,最後一幀是視線水平,模型會發明一個通常看起來錯誤的攝影機移動。匹配兩個關鍵幀的攝影機角度。
模式 10:參考鎖定重製
何時使用
參考鎖定重製使用 R2V 模式來保留參考影片片段的身份、風格或動作。當輸出必須在多個鏡頭中看起來像輸入角色、聲音或視覺風格時,請使用它。根據 Alibaba Cloud Wan I2V 指南,R2V 在一次呼叫中最多接受五個參考圖像和五個參考影片片段。
範本
Reference inputs: [N reference images, M reference clips, optional audio]. [Subject description matching the reference identity]. [Action within the reference character's range]. [Setting]. [Camera]. [Style consistent with reference].
實際範例
參考輸入:三個風格化動漫角色的參考圖像,一個走路循環的參考影片片段,無參考音訊。同一個風格化動漫角色走過霓虹燈照亮的巷子,回頭看了一眼。夜晚霓虹燈照亮的巷子,濕潤地面反射。追蹤中景,50 毫米等效。動漫,鮮豔色彩分級。
常見失敗
混合參考身份。如果參考圖像顯示兩個不同的角色,模型會將它們平均。每次渲染鎖定一個身份。
模式 11:負空間揭示
何時使用
負空間揭示使用空白畫面區域作為主體出現的舞台。將其用於鉤子,其中觀眾的眼睛被吸引到空白處,然後得到獎勵。它非常適用於垂直社交格式,其中第一幀必須視覺上安靜。
範本
[Frame opens on mostly empty space, single subtle texture]. [The subject enters from a frame edge, slow]. [Setting: minimal, single light source]. [Camera: static or slow drift]. [Style].
實際範例
畫面開啟於一個大部分空白的混凝土牆,帶有一束暖光。一個人物從右邊緣緩慢進入,走入光線中,停頓。混凝土內部,單一暖光束,深陰影。靜態中景,50 毫米等效。電影感,高對比。
常見失敗
過早填滿負空間。如果主體在第一秒進入,鉤子就會失效。在主體到達之前,保持空白畫面至少 1.5 秒。
模式 12:微動細微模式
何時使用
微動模式適用於影片片段應感覺幾乎像靜止圖像,但帶有一個微小運動提示的情況。它是編輯產品照片、檔案風格肖像以及任何明顯運動顯得廉價的場景的正確選擇。
範本
[Subject framed as a still image]. [One single subtle motion: a blink, a breath, a steam wisp, a fabric shift]. [Setting]. [Camera: locked-off static]. [Style: editorial, minimal motion].
實際範例
一個陶瓷馬克杯的黑咖啡放在亞麻表面上,俯視圖。一縷蒸汽從咖啡表面向上飄散。亞麻表面,攝影機右側柔和窗戶光線。鎖定俯視,50 毫米等效。編輯靜物,溫暖自然光。
常見失敗
添加第二個動作。此模式之所以有效,是因為只有一件事物在移動。第二個動作(蒸汽加上陰影移動)會打破這種魔力,影片片段會被視為普通影片。
如何組合模式?
大多數製作影片片段結合了兩種模式。反向揭示加上拉焦是一種常見的產品揭示。多鏡頭序列加上微動結尾是一種常見的社交鉤子。經驗法則:將結構模式(結構、多鏡頭、首尾幀)與運動模式(環繞、推、拉焦)結合。
[獨特見解] 良好組合的模式共享一個攝影機意圖。具有衝突攝影機意圖的模式,例如環繞加上推,會相互衝突並產生抖動。選擇攝影機部分一致的模式。
組合時,請按照觀眾將看到的順序編寫提示。模型從左到右讀取提示,並更重視較早的部分。提示的前 20 個字詞決定了大部分的視覺結果。
如需跨模型比較上下文,請參閱我們的 完整 Wan 2.7 影片生成器指南 和 多鏡頭 Wan 2.7 提示伴侶。
Wan 2.7 提示工程常見問題
Wan 2.7 提示應該多長?
一個有效的 Wan 2.7 提示是 40 到 80 個字,涵蓋所有五個結構部分。較長的提示會稀釋攝影機意圖。較短的提示會讓模型過多地依賴其先驗知識。上述 12 種模式都在這個範圍內。根據 Alibaba Cloud Model Studio 影片生成概述,模型會截斷超過大約 500 個 token 的提示。
Wan 2.7 支援負面提示嗎?
Wan 2.7 接受負面提示,但與圖像模型相比,它們的權重較輕。保持負面提示簡短,最多三到五個詞。冗長的負面列表效果甚微,並且會消耗提示預算。使用具體的負面詞,例如「文字、浮水印、標誌」,而不是抽象的詞,例如「醜陋」。
我應該在 Wan 2.7 上使用 PromptExtend 嗎?
這取決於情況。當您的基礎提示少於 30 個字時,PromptExtend 會有所幫助。當您的基礎提示已經涵蓋五部分結構時,它會稀釋特定的攝影機指令。在一次渲染上測試兩種方式。我們的 PromptExtend 在 Wan 2.7 中的評論 提供了並排數據。
哪種模式最適合產品廣告?
首尾幀分鏡加上攝影機前推是我們為產品廣告測量到的最強組合。從廣角產品畫面開始,以特寫細節結束。PixMind 產品行銷使用案例群組 提供了完整的案例研究。
如何防止反射表面上的扭曲?
減少提示中的運動幅度。將「快速旋轉」替換為「緩慢漂移」。在場景部分添加明確的光線方向,因為反射會跟隨光線。首先在 720P 測試,因為扭曲在 1080P 下更明顯。
實際操作
X 相關內容:Rel1vs — 討論如何使用 Claude 或 Grok 來描述 Wan 2.7 提示的參考資料。


