🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 圖像轉影片:4 種模式解析(首幀、末幀、續接、音訊驅動)

文章目錄

Wan 2.7 圖像轉影片:4 種模式解析

重點摘要

  • Wan 2.7 圖像轉影片 (I2V) 將四種子模式整合到一個 API 中:首幀、首末幀、影片續接和音訊驅動。
  • 每種子模式接受不同的輸入參數(first_framelast_framefirst_clipdriving_audio),並透過相同的生成後端進行處理。
  • 首末幀和音訊驅動模式是單一圖像 I2V 模型無法複製的獨特功能。
  • 大多數 I2V 失敗來自於模式與輸入不匹配:為任務選擇了錯誤的參數,或參考幀與請求的長寬比不符。
  • 試用 Wan 2.7 video generator 以跟隨本指南中的任何範例。

Wan 2.7 圖像轉影片並非單一功能。它是透過一個 API 介面路由的四種子模式,每種模式接受不同的輸入形狀。Wan 2.7 I2V API reference 文件記錄了輸入矩陣,但沒有解釋何時選擇哪種模式。本指南將會說明。每個部分都涵蓋了輸入、使用案例、一個實際操作的提示以及我們實際遇到的失敗模式。

若要更全面地了解 I2V 在 Wan 2.7 模型系列中的位置,PixMind Wan 2.7 video generator overview 並列介紹了文字、圖像和參考模式。

什麼是 Wan 2.7 圖像轉影片?

Wan 2.7 圖像轉影片 (I2V) 是 Alibaba 的 Wan 2.7 模型系列中基於圖像條件的生成路徑。根據 Wan 2.7 I2V API reference,該端點接受一個類型化輸入的媒體陣列,並返回最高 1080P 的影片,時長從 2 到 15 秒。

這四種子模式並非獨立的端點。它們是 API 內部路由的輸入組合:

子模式 必要輸入 可選輸入 典型時長
首幀轉影片 first_frame 圖像 提示詞, 音訊 2-10s
首末幀轉影片 first_frame + last_frame 提示詞 2-5s
影片續接 first_clip 影片 提示詞 3-10s
音訊驅動 first_frame + driving_audio 提示詞 5-15s

選擇正確的子模式是 I2V 工作流程中影響最大的決策。當您提供更多限制時,模型需要「發明」的內容就越少。例如,首末幀模式可以確保達到預期的最終狀態。而單獨的首幀模式則將最終狀態留給模型決定。

[UNIQUE INSIGHT] 大多數創作者將 I2V 視為單一功能,並預設所有內容都使用首幀模式。在我們的測試渲染中,將產品展示切換到首末幀模式,將「錯誤最終狀態」的拒絕率降低了大約三分之二,因為模型不再需要猜測鏡頭的走向。

首幀轉影片如何運作?

首幀轉影片是預設的 I2V 路徑。您上傳一張圖像作為 first_frame,編寫一個描述動作的提示詞,Wan 2.7 便會從該起始狀態生成向前移動的幀。 Wan 2.7 image-to-video user guide 將此記錄為最簡單的 I2V 呼叫形式。

輸入

  • first_frame (必要):一張圖像,任何 Wan 2.7 支援的長寬比(16:9、9:16、1:1、4:3、3:4)。
  • prompt (可選但強烈建議):描述動作、鏡頭和風格。
  • resolution:720P 或 1080P。
  • duration:2 到 15 秒。
  • ratio:必須與輸入圖像的長寬比匹配以避免裁剪。

何時使用

  • 您有一張產品照片,需要一個簡短的展示。
  • 您有一個人物肖像,想要微妙的動作。
  • 您正在鎖定最終狀態之前迭代動作風格。

實際操作提示詞

first_frame:一張玻璃香水瓶在深色表面上的照片,單一主光從鏡頭左側照射。prompt:「鏡頭緩慢推入。水滴從右邊緣噴入。柔和的粒子在光束中飄動。電影感、淺景深、暖色邊緣光。」解析度 1080P,時長 5 秒,長寬比 16:9。

失敗模式

  • 提示詞與圖像衝突。 如果提示詞要求廣角平移,但 first_frame 是特寫鏡頭,模型可能會扭曲主體以適應。
  • 長寬比不匹配。 將 9:16 圖像輸入 16:9 生成會意外裁剪。始終將輸入長寬比與輸出 ratio 匹配。
  • 請求的動作過多。 2 秒的渲染無法在不模糊的情況下容納 180 度平移。延長時長或減少動作。

我們對一批護膚品廣告的產品照片進行了 24 次首幀測試渲染。保持鏡頭靜止或使用緩慢推入(幀移動小於 10%)的渲染有 80% 的時間成功交付。要求「動態鏡頭運動」的渲染有 25% 的時間成功交付,並在反光瓶蓋上產生了明顯的扭曲。

首末幀轉影片如何運作?

首末幀轉影片接受兩張圖像,一個 first_frame 和一個 last_frame,並生成中間幀。根據 Wan 2.7 I2V API reference,這兩張圖像必須具有相同的長寬比,理想情況下也應具有相同的構圖。模型會插值出一個合理的過渡。

輸入

  • first_frame (必要):起始狀態圖像。
  • last_frame (必要):結束狀態圖像。
  • prompt (可選):描述過渡的感覺,而非其結束點。
  • resolutiondurationratio:與首幀模式相同的限制。
  • 典型時長:2 到 5 秒。更長的時長會迫使模型「發明」更多內容。

何時使用

  • 產品展示必須停留在特定的最終幀。
  • 起始和結束狀態都經過設計的過渡。
  • 兩個關鍵幀已鎖定的分鏡鏡頭。

實際操作提示詞

first_frame:大理石表面上的閉合禮盒。last_frame:相同的禮盒打開,光線流出,緞帶展開。prompt:「禮盒在 3 秒內平穩打開。鏡頭保持靜止。光暈從第 30 幀開始增強。主體無漂移。」解析度 1080P,時長 3 秒,長寬比 16:9。

失敗模式

  • 反光表面模糊。 玻璃、金屬和水在插值過程中可能會扭曲。透過減少動作幅度或簡化表面來緩解。
  • 鏡頭不匹配。 如果兩個關鍵幀暗示不同的鏡頭角度,模型會「發明」一個過渡,這通常看起來像跳切。
  • 時長過長。 超過 5 秒,模型必須填充過多「發明」的動作。保持簡短。

PixMind first-last-frame prompts cluster 包含與此模式匹配的產品展示、過渡和故事敘述模式的範本。

影片續接如何運作?

影片續接將現有的短片作為 first_clip 並在時間上延伸它。Wan 2.7 I2V guide 將其視為一種獨特的 I2V 子模式,因為輸入是影片而非靜態圖像。模型從源影片中讀取運動向量並繼續它們。

輸入

  • first_clip (必要):一個短影片,通常為 2 到 5 秒。格式和編解碼器必須與 API 接受的列表匹配。
  • prompt (可選):描述續接應如何演變,而非重新開始。
  • resolution:應與源影片匹配,以避免升級偽影。
  • duration:輸出的總長度,而不僅僅是附加部分。

何時使用

  • 一個 3 秒的生成很棒,但您需要 6 秒。
  • 您想將一個精彩鏡頭延伸為更長的廣告剪輯。
  • 第一個影片具有您想要保留的良好動作。

實際操作提示詞

first_clip:一個滑板手滑過鏡頭的 3 秒影片,以 720P 拍攝。prompt:「滑板手繼續滑過鏡頭。鏡頭跟隨。背景從小巷轉變為路燈光芒。無剪輯。」解析度 720P,時長 6 秒,長寬比 16:9。

失敗模式

  • 動作重置。 如果提示詞與源動作衝突,模型可能會凍結主體。將提示詞與影片的現有方向對齊。
  • 解析度升級偽影。 將 720P 源輸入 1080P 輸出會產生模糊或扭曲的幀。將輸出解析度與源匹配。
  • 影片過短。 1 秒的源影片幾乎沒有動作可供模型繼續。至少使用 2 秒。

[UNIQUE INSIGHT] 影片續接是 I2V 子模式中最未被充分利用的。它讓您可以「拯救」一個提早 2 秒停止的渲染,我們發現這大約佔所有生產迭代的三分之一。您無需從頭重新生成,只需附加即可。

音訊驅動模式如何運作?

音訊驅動 I2V 接受一張靜態圖像加上一個 driving_audio 音軌,並生成一個主體與音訊同步移動的影片。根據 Wan 2.7 image-to-video guide,這是用於說話頭像和虛擬人物內容的路徑。模型使用音訊波形來驅動嘴唇動作和整體能量。

輸入

  • first_frame (必要):肖像或人物圖像。正面、光線充足、中性表情效果最佳。
  • driving_audio (必要):一個乾淨的音軌。WAV 或 MP3 格式。錄音室品質的音訊優於手機錄音。
  • prompt (可選):描述環境動作、頭部移動、表情能量。
  • duration:通常與音訊長度匹配,最長 15 秒。

何時使用

  • 從單一肖像製作的說話頭像解說影片。
  • 用於社群媒體的虛擬人物內容。
  • 由旁白驅動的產品演示,其中有人臉進行敘述。

實際操作提示詞

first_frame:一個插畫虛擬人物的正面肖像,中性表情,純色背景。driving_audio:8 秒的旁白問候 WAV 音訊。prompt:「輕微的頭部搖擺,每 3 秒眨眼,句子結尾處笑容逐漸顯現。」解析度 1080P,時長 8 秒,長寬比 16:9。

失敗模式

  • 非正面臉孔的嘴唇漂移。 如果肖像為側面,嘴唇同步會變差。使用正面。
  • 嘈雜的音訊。 背景嘶嘶聲或音樂會滲入動作偽影。先清理音訊。
  • 長時間無呼吸。 15 秒連續無間斷的語音會使模型生成尷尬的嘴形。加入停頓。

若要深入了解音訊與影片配對的模式,PixMind audio-sync prompts cluster 包含說話頭像、旁白和音樂驅動影片的範本。

如何選擇正確的 I2V 模式?

這個決定取決於您手頭擁有的內容。Wan 2.7 T2V API reference 和 I2V 參考共同描述了完整的輸入矩陣,但大多數決策都可以歸結為一個簡單的表格。

您有... 使用此 I2V 模式 原因
一張照片 首幀轉影片 最簡單的路徑。模型「發明」動作。
兩張必須是開始和結束的照片 首末幀轉影片 鎖定最終狀態。減少拒絕。
一個需要更多時間的短片 影片續接 保留現有動作。成本低於重新生成。
一張肖像加上一個音軌 音訊驅動 嘴唇同步和能量跟隨音訊。
一張肖像加上一個聲音加上一個參考影片 考慮使用 R2V R2V 比音訊驅動 I2V 更好地保留身份。

一個實用的啟發式方法:您給模型提供的輸入越多,它需要「發明」的內容就越少。「發明」正是扭曲和漂移出現的地方。

Diagram: Four stacked horizontal panels showing first-frame, first-last-frame, video continuation, and audio-driven I2V modes.

如果您是從零開始且尚未有任何輸入,請先執行 T2V 處理以鎖定鏡頭,然後將最佳幀用作 I2V 中的 first_frame。這種兩階段工作流程優於嘗試一次性獲得完美的 I2V 渲染。

常見的 I2V 失敗模式有哪些?

I2V 的失敗方式是可預測的。了解它們有助於您更快地迭代。

  • 反光表面扭曲。 玻璃、鏡子、拋光金屬在插值過程中會模糊。透過減少動作或簡化源圖像中的表面來緩解。
  • 幀間身份漂移。 人臉會移動,尤其是在超過 5 秒後。對於短鎖定鏡頭,使用首末幀模式緩解;對於更長時間的身份保留,使用 R2V。
  • 長寬比不匹配。 將 9:16 圖像輸入 16:9 生成會裁剪主體。匹配輸入和輸出長寬比。
  • 提示詞與圖像衝突。 在特寫鏡頭上要求「廣角平移」會迫使模型「發明」它看不到的廣角上下文。將提示詞與圖像構圖對齊。
  • 音訊噪音滲入動作。 手機品質的音訊會在臉部產生鬼影動作。先清理音訊。
  • 長時間迭代的點數消耗。 10 秒 1080P 渲染會消耗點數。以 2 到 3 秒和 720P 進行迭代,然後再放大。

在一批為廣告活動製作的 40 個 I2V 渲染中,失敗大致分為:40% 提示詞與圖像衝突,25% 長寬比不匹配,20% 反光扭曲,15% 其他。長寬比不匹配是最便宜的修復方式:它只是一個單一參數檢查,卻造成了四分之一的點數浪費。

若要深入了解跨使用案例的失敗模式,PixMind Wan 2.7 use cases cluster 包含產品、人物和社群影片的每個場景說明。

Wan 2.7 I2V 模式常見問題

Wan 2.7 中的 I2V 和 R2V 有何不同?

I2V (圖像轉影片) 接受靜態圖像或短片作為輸入。R2V (參考轉影片) 接受最多五張參考圖像、五個參考影片和一個參考音軌,並使用它們來保留身份、聲音和風格。R2V 更適合多鏡頭一致性。I2V 對於單鏡頭工作更快。

Wan 2.7 首末幀模式可以處理鏡頭移動嗎?

可以,但兩個關鍵幀應暗示一致的鏡頭角度。如果 first_framelast_frame 暗示不同的角度,模型會「發明」一個過渡,這通常看起來像跳切。保持鏡頭變化微妙,小於 15 度。

Wan 2.7 影片續接可以將影片延長多久?

影片續接可以將源影片延長至 I2V 模式的 15 秒硬性上限。源影片加上生成的續接總長度不能超過 15 秒。對於更長的影片,請連結多個續接呼叫。

Wan 2.7 音訊驅動模式是否需要圖像中有人臉?

有人臉時效果最佳,但並非必要。沒有人臉時,音訊會驅動整體動作能量而非嘴唇同步。使用音訊驅動模式的風景或產品鏡頭會產生跟隨音訊振幅的抽象動作。

Wan 2.7 I2V 可以免費試用嗎?

是的。PixMind Wan 2.7 page 包含免費試用,無需信用卡。只有當您超出試用配額時,才需要付費方案。

觀看實際操作

继续浏览中,生成器即将加载...