Wan 2.7 首尾幀控制:5 步驟操作指南
主要重點
- Wan 2.7 I2V 中的首尾幀模式讓您能夠固定影片的起始和結束狀態,模型會內插中間的動作。
- 五個步驟可實現清晰的渲染:準備關鍵幀、上傳兩幀、設定持續時間、撰寫轉場提示,然後從五個維度進行評估。
- 常見的失敗模式包括反射表面扭曲、角色身份漂移,以及當兩個關鍵幀在角度上不一致時的鏡頭跳動。
- 從 2 到 5 秒的短時間開始;持續時間會線性增加點數成本,且長時間渲染會放大偽影。
- PixMind 首尾幀提示集 包含與本指南中三個範例模式相符的模板。
什麼是首尾幀模式?
首尾幀是 Wan 2.7 圖像轉影片 (I2V) 的一個子模式。您提供兩張圖像:一張用於第一幀,一張用於最後一幀。Wan 2.7 會生成連接它們的中間幀。根據 Alibaba Cloud I2V API 參考,模型接受一對有序的圖像輸入,並輸出最高 1080P 的 MP4 影片。
這很重要,因為單圖像 I2V 會將結束狀態留給模型。如果您的鏡頭必須停在特定幀上,例如產品完全旋轉或盒子完全打開,那麼首尾幀就是您保證這一點的方式。有關模式背景,請參閱 PixMind Wan 2.7 影片生成器,其中一個創作介面處理所有 I2V 子模式。
核心工作流程分為五個步驟:準備兩個關鍵幀、按順序上傳它們、設定持續時間、撰寫轉場提示,然後渲染並評估。每個步驟都有一個決定,決定渲染是否成功。
步驟 1:準備您的關鍵幀
關鍵幀品質是乾淨的首尾幀渲染最主要的預測因素。Wan 2.7 圖像轉影片使用者指南 建議在兩個幀之間匹配構圖、光線和攝影機角度。我們發現,不匹配的關鍵幀會迫使模型發明一個轉場,這就是扭曲和身份漂移出現的地方。
三個一致性規則涵蓋了大多數情況。透過將兩個主體框定在相同的螢幕位置來匹配構圖。透過保持相同的主光源方向和色溫來匹配光線。透過保持焦距、角度和距離不變來匹配攝影機。打破任何一條規則,模型就必須在不連續處進行內插。
引用摘要:關鍵幀一致性是 Wan 2.7 首尾幀品質的主導因素。Alibaba Cloud 圖像轉影片使用者指南建議在兩個輸入幀之間匹配構圖、光線和攝影機角度,以避免模型發明的轉場導致扭曲和身份漂移。
構圖檢查表
- 主體在兩個幀中佔據相同的螢幕象限。
- 背景元素保持固定位置。
- 兩個幀的長寬比與目標輸出長寬比匹配。
- 保留負空間,以便動作有移動的餘地。
光線檢查表
- 兩個幀中的主光源方向相同。
- 色溫在 200K 範圍內匹配。
- 陰影長度和角度與單一光源一致。
- 鏡面高光落在相同的表面區域。
攝影機檢查表
- 焦距相同(使用 EXIF 資料或元資料)。
- 拍攝角度在 5 度內匹配。
- 攝影機高度一致。
- 鏡頭畸變特性匹配(定焦與變焦)。
我們曾因測試第一幀以 35mm 拍攝而最後一幀以 50mm 拍攝的配對而浪費點數。模型在影片中間產生了刺耳的「卡頓」。在生成之前鎖定焦距。
步驟 2:上傳第一幀和最後一幀
Wan 2.7 期望兩個幀以定義的順序排列。您傳遞的第一張圖像成為起始狀態,第二張成為結束狀態。根據 Alibaba Cloud Model Studio 概述,I2V 呼叫接受圖像 URL 或 base64 編碼的負載,模型將輸入陣列視為有序序列。
順序比人們預期的更重要。如果您先上傳打開的盒子圖像,然後上傳關閉的盒子圖像,您將得到一個關閉動畫。顛倒順序,您將得到一個打開動畫。模型不會單獨從提示中推斷意圖;幀序列是方向的真實來源。
上傳格式和尺寸
兩個幀應與目標輸出共享相同的長寬比。如果輸入 9:16 的第一幀和 1:1 的最後一幀,將會強制裁剪,而裁剪會在邊緣引入偽影。在上傳之前,將兩個幀調整為輸出解析度。
實用的尺寸設定:對於 1080P 的 16:9 輸出,目標為 1920x1080;對於 9:16,目標為 1080x1920;對於 1:1,目標為 1080x1080。每個幀的檔案大小應保持在 10MB 以下,以避免慢速連接上的超時失敗。
命名和順序規範
以一種使序列顯而易見的方式命名您的檔案。keyframe-01-closed.png 和 keyframe-02-open.png 消除了上傳時的猜測。這聽起來微不足道,但顛倒順序的上傳是我們看到第二常見的失敗。
步驟 3:設定持續時間(以及為何應從短時間開始)
持續時間控制模型必須在兩個關鍵幀之間產生多少內插幀。更長的持續時間意味著更多的內插,這意味著模型有更多的機會漂移。Wan 2.7 I2V API 參考 支援 I2V 的持續時間從 2 到 15 秒。
我們建議任何新的關鍵幀配對都從 2 到 5 秒開始。短時間渲染可以廉價地揭示失敗模式。如果模型可以在 3 秒內乾淨地內插,您可以在下一次嘗試中自信地延長到 8 或 10 秒。
引用摘要:Wan 2.7 I2V 支援 2 到 15 秒的持續時間,但點數成本與持續時間線性相關。在 2 到 5 秒進行測試,可以以 10 秒渲染成本的一小部分揭示扭曲、漂移和鏡頭跳動的失敗模式。
持續時間與動作幅度
短持續時間適用於小動作。3 秒的渲染適合蓋子從盒子中提起。5 秒的渲染適合角色從背面轉向正面。如果超過 8 秒,模型必須發明兩個關鍵幀都沒有暗示的中間動作,這就是幻覺運動的來源。
點數成本計算
持續時間會線性增加成本。10 秒的 1080P 渲染成本大約是 2 秒 1080P 渲染成本的五倍。如果您在 10 秒時測試失敗,您將為一個無法使用的渲染支付全價。先進行短時間測試,然後再提交。
步驟 4:撰寫轉場提示
首尾幀模式中的提示描述了兩個幀之間的動作。它不會重新描述主體;關鍵幀已經做到了這一點。PixMind 首尾幀提示集 編目了以下三個實例的提示模式。
轉場提示有四個部分:動作、速度、攝影機行為和風格。將每個部分保持為一個簡短的子句。冗長的提示會分散模型的注意力,並產生較柔和的動作。
引用摘要:Wan 2.7 首尾幀模式中的轉場提示應描述動作,而非主體。有效的提示涵蓋四個部分:動作、速度、攝影機行為和風格。每個部分作為一個簡短的子句,其效果優於重新描述關鍵幀已顯示內容的段落式提示。
提示結構
- 動作:什麼在移動。「蓋子升起」、「人物轉身」、「天空變暗」。
- 速度:多快。「緩慢」、「逐漸」、「在三秒內」。
- 攝影機:攝影機的動作。「靜態」、「輕微推入」、「鎖定」。
- 風格:視覺處理。「電影感」、「紀錄片」、「柔焦」。
反模式:過度提示
抵制重新描述主體的衝動。如果第一個關鍵幀是一個關閉的禮物盒,您的提示不需要說「木桌上的一個關閉的禮物盒」。模型已經知道。重新描述會促使模型重新渲染盒子,這會與內插產生衝突。
[獨特見解] 轉場提示的作用是約束動作,而不是宣告主體。將其視為為已經知道服裝的舞者編排的舞蹈筆記。
步驟 5:渲染並從五個維度進行評估
每個首尾幀渲染都需要明確的評估環節。我們從五個維度進行評估,每個維度都評為通過或失敗。任何一個維度失敗的渲染都會回到步驟 1 或步驟 4,而不是最終交付。

這五個維度涵蓋了身份、攝影機、光線、動作和目標幀準確性。前三個來自關鍵幀品質。後兩個來自提示和持續時間的選擇。
引用摘要:Wan 2.7 首尾幀渲染應從五個二元維度進行評估:身份一致性、攝影機連續性、光線連續性、動作合理性以及目標幀達成度。任何一個維度失敗的渲染都應在關鍵幀或提示階段重新製作,而不是盲目地重新渲染。
維度 1:身份一致性
主體在所有幀中看起來是否相同?對於角色,檢查面部幾何。對於產品,檢查輪廓和品牌。這裡的漂移通常源於關鍵幀在角度上的不一致。
維度 2:攝影機連續性
攝影機是否保持在應有的位置?如果您指定了靜態,請檢查是否有意外的推入。如果您指定了推入,請檢查移動是否平滑且沒有卡頓。
維度 3:光線連續性
光線方向是否保持不變?注意影片中間的陰影翻轉,這表示模型在幀之間交換了光源。
維度 4:動作合理性
動作看起來是否符合物理學?蓋子不會穿過盒子。四肢不會向後彎曲。頭髮不會在半空中凝固。不合理的動作通常意味著提示在太短的持續時間內要求太多。
維度 5:目標幀達成度
生成影片的最後一幀是否與您上傳的最後一幀圖像匹配?這是賦予該模式名稱的測試。如果模型接近但不完全精確,請收緊您的提示或縮短持續時間。
三個實例(產品揭示、角色轉身、晝夜變化)
以下三種模式涵蓋了我們在 PixMind 上看到的大約 80% 的首尾幀使用案例。每個案例都包括關鍵幀準備、提示、持續時間以及最常遇到的失敗模式。
範例 1:產品揭示(禮物盒從關閉到打開)
關鍵幀:兩張產品照片,攝影機和光線相同。第一幀:蓋子關閉。第二幀:蓋子完全打開,內部可見。
提示:「蓋子緩慢向上抬起並向後傾斜,露出內部。靜態攝影機,柔和的電影感光線,三秒持續時間。」
持續時間:3 秒,1080P,16:9。
失敗模式:反射表面扭曲。如果盒子有光澤表面,模型會在蓋子移動時塗抹高光。透過減少關鍵幀中的光澤或在提示中添加「啞光表面」來緩解。
範例 2:角色轉身(背面視圖到正面視圖)
關鍵幀:兩張角色渲染圖,光線和焦距相同。第一幀:從背面看到角色。第二幀:角色面向攝影機。
提示:「人物緩慢旋轉以面向攝影機,在四秒內順時針轉動。靜態中景,電影感景深。」
持續時間:4 到 5 秒,1080P。
失敗模式:身份漂移。面部可能在轉身中途發生變化。透過在轉身範圍內盡可能使兩個關鍵幀都正面朝向,或使用參考轉影片 (R2V) 模式以更強的身份保留來緩解。
範例 3:晝夜變化(時間流逝)
關鍵幀:兩張風景照片,構圖相同。第一幀:白天。第二幀:夜晚,人工燈光亮起。
提示:「天空在五秒內從白天逐漸變暗到夜晚,人工燈光漸亮,色溫變冷。靜態攝影機,鎖定三腳架。」
持續時間:5 秒,1080P。
失敗模式:鏡頭跳動。如果兩張風景照片的拍攝位置即使略有不同,模型也會發明一個攝影機移動來連接它們。透過使用鎖定三腳架拍攝兩個關鍵幀,或使用單次拍攝並進行曝光包圍來緩解。
常見失敗模式(以及如何修復)
命名失敗模式是您更快交付的方式。以下三種模式佔我們看到的大多數被拒絕渲染。
反射表面扭曲
玻璃、拋光金屬和水在內插過程中會塗抹,因為模型無法一致地追蹤反射。減少動作幅度,在關鍵幀中切換到啞光表面,或縮短持續時間,以便模型需要發明的幀數更少。
身份漂移
面部和輪廓在幀之間移動。這在兩個關鍵幀在角度或表情上不一致時最常見。以匹配的角度重新拍攝關鍵幀,或切換到 R2V 模式並使用參考圖像來固定身份。
鏡頭跳動
模型發明了一個攝影機移動來連接兩個暗示不同角度的關鍵幀。解決方案在源頭:鎖定兩個關鍵幀的焦距、角度和高度。如果您無法重新拍攝,請接受攝影機移動並將其寫入提示中。
我們發現鏡頭跳動是最常被誤診為「模型錯誤」的失敗模式。模型正在完全按照關鍵幀的指示行事。修復輸入。
Wan 2.7 首尾幀常見問題
Wan 2.7 中的首幀和首尾幀有什麼區別?
首幀模式接受一張圖像作為起始狀態,並讓模型發明結束狀態。首尾幀模式接受兩張圖像,並強制模型停留在第二張圖像上。首尾幀為您提供了首幀無法提供的結束狀態控制。
我的第一個 Wan 2.7 首尾幀渲染應該持續多久?
從 2 到 5 秒開始。短持續時間可以廉價地揭示失敗模式。根據 Alibaba Cloud I2V API 參考,支援 2 到 15 秒的持續時間,但長持續時間會增加內插距離和偽影風險。
Wan 2.7 首尾幀能否處理玻璃和金屬等反射表面?
可以,但需謹慎。反射表面是最常見的扭曲失敗模式。透過減少關鍵幀中的光澤、保持小動作幅度,並在提示中寫入「啞光表面」來緩解。鏡子和拋光鉻仍然是最難處理的情況。
如何防止兩個關鍵幀之間的身份漂移?
在嚴格的公差範圍內,匹配兩個關鍵幀的攝影機角度、焦距和光線。如果漂移持續存在,請切換到參考轉影片 (R2V) 模式,並傳遞參考圖像以固定身份。R2V 在 PixMind Wan 2.7 影片生成器指南 中有詳細說明。
Wan 2.7 首尾幀是否支援 1080P?
是的。Wan 2.7 I2V 支援 720P 和 1080P 輸出。首尾幀繼承了這兩者。1080P 每秒消耗的點數大約是 720P 的兩倍,因此請在 720P 進行迭代,並在 1080P 完成。
實際操作觀看
11 minutes of work turned into 8.7M views in 5 days
— Woody (@woody_research) May 28, 2026
no camera, no real person, no photoshoots, just a 24 year old kid and an ai girl he generated on his laptop.
I've been watching how the page is built. the whole pipeline is three tools running in sequence.
> chatgpt writes… https://t.co/iNPeLY9r3K pic.twitter.com/4jB5QObIvw



