🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 影片生成器:文字、圖像與參考影片的完整指南

文章目錄

Wan 2.7 影片生成器:文字、圖像與參考模式的完整指南

主要重點

  • Wan 2.7 是一個統一模型,在單一工作流程中涵蓋了文字轉影片 (T2V)、圖像轉影片 (I2V) 和參考轉影片 (R2V)。
  • 它支援 720P 和 1080P 輸出,影片時長為 2 到 15 秒,並提供五種長寬比,包括 16:9、9:16 和 1:1。
  • 首尾幀和音訊驅動模式提供了單圖像 I2V 模型無法比擬的起始狀態和結束狀態控制。
  • 參考轉影片 (R2V) 在一次呼叫中最多可接受五張參考圖像、五個參考片段和一個參考音軌。
  • 試用 Wan 2.7 影片生成器 以跟隨本指南中的任何範例。

什麼是 Wan 2.7 影片生成器?

Wan 2.7 是 Alibaba Wan 團隊最新的影片生成模型,透過 Alibaba Cloud Model Studio 推出。它將先前四種獨立功能統一為一個模型系列:文字轉影片、圖像轉影片、參考轉影片和影片編輯。根據 Alibaba Cloud 影片生成概述,該模型接受多模態輸入,並輸出最高 1080P 的 MP4 或 MOV 格式。

2.7 的關鍵轉變是工作流程的統一。您無需在文字轉影片和圖像轉影片之間切換供應商,而是呼叫同一個模型,並讓 API 根據您傳遞的輸入進行路由。這與 PixMind Wan 2.7 產品頁面 相符,其中一個創作介面處理所有模式。

對於創作者來說,這很重要,因為模式切換是大部分製作時間的損失之處。您編寫提示、渲染、發現起始狀態錯誤,然後在不同的工具中從頭重建。Wan 2.7 的統一介面讓您無需切換模型即可交換輸入。

Wan 2.7 支援多少種模式?

Wan 2.7 提供了四種模式。I2V API 參考 文件記錄了完整的輸入矩陣。以下是實用細分。

模式 輸入 最佳用途 最長時長 最高解析度
T2V (文字轉影片) 文字提示,可選音訊 分鏡腳本、抽象動態、B-roll 15秒 1080P
I2V (圖像轉影片) 首幀,可選尾幀,可選音訊 產品展示、角色動作、動畫 15秒 1080P
R2V (參考轉影片) 最多 5 張參考圖像 + 5 個參考片段 + 參考音訊 身份保留、語音克隆、多角色場景 10秒 1080P
影片編輯 來源影片 + 指令 風格轉換、基於指令的編輯 10秒 1080P

圖表:四象限網格顯示文字轉影片、圖像轉影片、首尾幀和參考影片模式連接到中央樞紐。

文字轉影片 (T2V)

T2V 接受文字提示並輸出影片。Wan 2.7 T2V API 參考 列出了支援的參數,包括解析度、時長、長寬比和可選音軌。T2V 是從想法到片段最快的路徑。

當您沒有固定的起始幀時,請使用 T2V。抽象動態、B-roll、分鏡腳本和風格化序列都適用。當起始狀態很重要時,請避免使用 T2V:如果您需要在零幀時螢幕上顯示特定產品,請切換到 I2V。

圖像轉影片 (I2V)

I2V 是 Wan 2.7 工作流程統一的體現。Wan 2.7 圖像轉影片使用者指南 記錄了四種子模式:

  1. 首幀轉影片:一張圖像成為起始狀態,模型創造動態。
  2. 首尾幀轉影片:兩張圖像定義起始和結束狀態,模型進行插值。
  3. 影片延續:一個短片段成為起始狀態,模型將其延伸。
  4. 音訊驅動:一張圖像加上音軌驅動唇形同步或動態。

要深入了解四種 I2V 路徑,請參閱 PixMind 首尾幀提示集

參考轉影片 (R2V)

R2V 是功能最強大且文件最少的模式。Wan 2.7 R2V API 參考 描述了一個呼叫,該呼叫最多可接受五張參考圖像、五個參考片段和一個參考音軌。模型使用這些來在輸出中保留身份、語音和風格。

當您需要角色在不同鏡頭中看起來相同,或者想將語音克隆到新場景時,R2V 是您的選擇。權衡點是時長:R2V 最長為 10 秒,比 T2V 和 I2V 的 15 秒上限短。

影片編輯

影片編輯接受來源影片加上文字指令,並返回一個編輯過的片段。Wan 2.7 影片編輯 API 支援基於指令的編輯和風格轉換。此模式超出生成指南的範圍,但值得了解其存在。

首尾幀模式如何運作?

首尾幀是 I2V 的一個子模式。您提供兩張圖像:一張用於第一幀,一張用於最後一幀。Wan 2.7 生成中間幀。

圖表:時間軸顯示兩個關鍵幀,中間有三個插值幀,Wan 2.7 標誌概念標記了中間幀。

這很重要,因為單圖像 I2V 將結束狀態留給模型。如果您的鏡頭需要停在特定幀(產品完全旋轉、盒子完全打開、角色完全轉身),首尾幀是您保證該停頓的方式。

實際模式是:拍攝或生成兩個關鍵幀,將它們作為首幀和尾幀上傳,設定時長,然後渲染。Wan 2.7 在它們之間插值動態。PixMind 首尾幀提示頁面 提供了用於產品展示、轉場和故事敘述模式的提示模板。

常見的失敗模式:

  • 反射表面扭曲:玻璃、金屬和水在插值過程中可能會模糊。
  • 角色身份漂移:臉部可能在幀之間發生變化。
  • 攝影機不一致:如果兩個關鍵幀暗示不同的攝影機角度,模型必須創造一個轉場。

在提交 5-10 秒的渲染之前,請先使用短時長(2-3 秒)進行測試。

音訊驅動影片如何運作?

音訊驅動模式接受一張靜態圖像加上音軌,並生成一個影片,其中主體似乎與音訊同步說話或移動。這是談話頭像和虛擬形象內容的基礎。

模型使用音訊波形來驅動兩件事:唇部運動(如果存在臉部)和整體運動能量。Wan 2.7 I2V API 接受音訊作為媒體陣列的一部分,使用 driving_audio 類型。

對於談話頭像用例,請將此與 PixMind 角色表演集 結合使用。音訊驅動的 I2V 加上清晰的參考肖像的組合是目前無需訓練自訂模型即可實現唇形同步虛擬形象的最佳開放路徑。

兩個實用注意事項:

  • 音訊品質驅動影片品質。乾淨的錄音室錄音優於手機麥克風。
  • 首先使用 3 秒片段進行測試。同步問題更容易及早發現。

您應該選擇什麼解析度、時長和長寬比?

Wan 2.7 支援 720P 和 1080P 輸出。權衡點是成本與清晰度。根據 PixMind 定價策略,每秒 1080P 消耗的點數大約是 720P 的兩倍。

設定 何時選擇 權衡
720P 社群優先內容、垂直影片、測試迭代 成本較低,在大螢幕上可見柔和度
1080P 產品展示、電影預覽、廣告創意 成本較高,細節更銳利
16:9 YouTube、網站嵌入 標準寬螢幕
9:16 Reels、TikTok、Shorts 行動裝置垂直
1:1 動態貼文、方形嵌入 跨平台中性
4:3 / 3:4 編輯、復古風格 利基市場

時長線性驅動成本。相同解析度下,10 秒的渲染成本大約是 2 秒渲染的 5 倍。對於迭代,請使用短時長。對於最終成品,請使用長時長。

新使用者的合理預設值:720P、5 秒、16:9。確認鏡頭有效後,再將最終成品提升至 1080P。

如何選擇正確的 Wan 2.7 模式?

一旦您知道自己有哪些輸入,決策樹就很簡單。

工作流程圖顯示 5 個階段:輸入、模式檢測、模型路由、生成、輸出。

  • 您只有一個想法:使用 T2V。在添加視覺效果之前,先迭代提示。
  • 您有一張產品照片:使用 I2V 首幀模式。
  • 您有兩個必須是起始和結束的關鍵幀:使用 I2V 首尾幀。
  • 您有一個需要延伸的短片段:使用 I2V 影片延續。
  • 您有一張肖像加上旁白:使用 I2V 音訊驅動。
  • 您需要在不同鏡頭中保留身份或語音:使用 R2V。
  • 您有需要編輯或風格變化的現有素材:使用影片編輯。

如果您不確定,請從 PixMind Wan 系列中心 開始,並根據用例而非模式名稱進行選擇。該中心會根據您嘗試製作的內容將您導向正確的介面。

您應該如何提示 Wan 2.7?

提示結構比提示長度更重要。Wan 2.7 獎勵五段式結構:主體、動作、場景、攝影機、風格。

範例結構:

主體:一個放在深色表面上的玻璃香水瓶。動作:一團水珠向右噴發。場景:攝影棚黑色背景,攝影機左側單一主光。攝影機:靜態中景,50mm 等效。風格:電影感,淺景深,暖色邊緣光。

每個片段都縮小了輸出空間。缺失的片段將預設為模型的先驗知識,通常是通用的。

對於更深入的提示模式,PixMind 多鏡頭提示集 涵蓋了 12 種可重複使用的結構,包括多鏡頭序列、音訊同步模式和首尾幀分鏡腳本。

兩個要避免的提示陷阱:

  • 過載提示:一個提示中超過五個主體會使模型混淆。請拆分為多個渲染。
  • 負面提示過度使用:Wan 2.7 不像圖像模型那樣權衡負面提示。請保持簡短。

Wan 2.7 與其他模型相比如何?

Wan 2.7 處於一個擁擠的領域。Sora 2、VEO 3、Kling 2.0 和 Seedance 都針對重疊的用例。區別在於每個模型公開的模式以及成本。

功能 Wan 2.7 Sora 2 VEO 3 Kling 2.0
文字轉影片
圖像轉影片 有限
首尾幀 有限 有限
參考影片 (R2V) 有限
音訊驅動 I2V 有限
最長時長 15秒 20秒 8秒 10秒
最高解析度 1080P 1080P 1080P 1080P

此表格反映了截至 2026 年 7 月供應商發布的規格。獨立的直接測試存在於我們的 Wan 2.7 與 Sora 2 提示測試VEO 與 Kling 對決 中。

Wan 2.7 的獨特優勢是首尾幀結合 R2V。表格中沒有其他模型能同時提供這兩種完整功能。如果您的工作流程需要精確的起始和結束控制以及身份保留,Wan 2.7 是目前唯一的單一模型路徑。

常見的失敗模式有哪些?

每個 AI 影片模型都會失敗。指出失敗模式有助於您更快地交付。

  • 反射表面扭曲:玻璃、鏡子、拋光金屬。透過減少提示中的運動幅度來緩解。
  • 跨鏡頭身份漂移:臉部在生成之間發生變化。透過 R2V 參考輸入來緩解。
  • 幀中幻覺文字:標誌、標籤、商標渲染為亂碼。透過從輸入圖像中移除文字來緩解。
  • 長寬比不匹配:將 9:16 圖像輸入到 16:9 生成中會意外裁剪。將輸入長寬比與輸出長寬比匹配。
  • 長迭代的點數消耗:10 秒的測試渲染會快速消耗點數。請在 2-3 秒內迭代。

PixMind 用例集 針對產品行銷、角色表演、電影預覽和社群鉤子提供了每個場景的失敗模式說明。

Wan 2.7 影片生成器常見問題

Wan 2.7 可以免費試用嗎?

是的。PixMind Wan 2.7 頁面 包含免費試用,無需信用卡。只有當您超出試用配額時,才會啟用付費方案。

Wan 2.7 支援 4K 嗎?

不。Wan 2.7 影片最高支援 1080P。Wan 2.7 圖像模型透過 Pro 等級支援 4K 靜態圖像,但影片輸出上限為 1080P。

Wan 2.7 可以複製特定人物的臉部嗎?

Wan 2.7 可以從參考輸入中保留身份,但 PixMind 政策禁止未經同意複製真實、可識別人物的肖像。請將 R2V 用於原創角色、庫存參考或您自己的肖像。

Wan 2.7 渲染一次需要多長時間?

生成時間取決於時長、解析度和負載。典型的 5 秒 720P 渲染在 60-90 秒內完成。10 秒 1080P 渲染可能需要 3-5 分鐘。API 會返回一個任務 ID,您可以查詢其狀態。

Wan 2.7 會生成音訊嗎?

是的,但僅限於接受音訊輸入的模式。T2V 可以接收音軌並與其進行動態同步。I2V 音訊驅動模式使用音訊來驅動唇形和動態同步。純音訊生成(音樂、音效)是另一個 Alibaba 模型。

我可以將 Wan 2.7 的輸出用於商業用途嗎?

是的。您生成的輸出根據 Alibaba Cloud Model Studio 的條款,可以商業使用。在發布之前,請查閱 Alibaba Cloud Model Studio 概述 上的現行條款。

觀看實際操作

继续浏览中,生成器即将加载...