Wan 2.7 R2V:多模態參考影片生成指南
主要重點
- Wan 2.7 的參考影片生成 (R2V) 模式在單次呼叫中最多可接受 5 張參考圖片、5 個參考片段和 1 個參考音訊,是目前 1080P 模型中最多元的模態輸入矩陣。
- R2V 適用於跨鏡頭的身分保留、聲音複製和風格延續,而非一次性的 B-roll 或簡單的產品旋轉展示。
- 參考衝突是主要的失敗原因,大多數可以透過遵循四步驟的準備-設定-撰寫-渲染工作流程來避免。
- 如需與此模式相關的更深入提示庫,請參閱 PixMind 參考影片提示集。
什麼是 Wan 2.7 R2V?
R2V 代表參考影片生成 (reference-to-video),是 Wan 2.7 的一種模式,它接受混合的參考輸入並生成一個新片段,保留這些輸入中的身分、聲音或風格。根據 Alibaba Cloud 上的 Wan 2.7 R2V API 參考資料,單次 R2V 呼叫最多可接受 5 張參考圖片、5 個參考片段和 1 個參考音軌,輸出上限為 1080P 和 10 秒。
R2V 與圖片生成影片 (image-to-video) 的區別在於多模態條件設定。I2V 鎖定起始幀並讓模型創造動作。R2V 則從您的參考資料中提取屬性,例如臉部結構、服裝、聲音音色、色彩分級,並將它們傳播到新的生成中。這就是為什麼我們將 R2V 視為一種不同的工作流程,而不是更花俏的 I2V。
R2V 位於 PixMind 上統一的 Wan 2.7 影片生成器 介面中。您無需切換模型即可使用它。當您在輸入面板中附加參考資料時,路由器會選擇 R2V。
引用摘要:Wan 2.7 R2V(參考影片生成)是一種模式,可在單次 API 呼叫中接受最多 5 張參考圖片、5 個參考片段和 1 個參考音訊,輸出 MP4 格式,最高可達 1080P 和 10 秒,用於跨鏡頭的身分、聲音和風格保留(Alibaba Cloud Model Studio,2026)。
R2V 接受哪些輸入?
R2V 接受三種輸入類別,您可以在同一個呼叫中混合使用它們。Alibaba Cloud 影片生成概述 文件記錄了輸入陣列的架構。以下是每個插槽的功能以及您可以傳遞的數量之實用細分。
| 輸入插槽 | 最大數量 | 攜帶內容 | 必填? |
|---|---|---|---|
| 參考圖片 | 5 | 臉部、產品、服裝、色彩分級 | 任何輸入至少 1 個 |
| 參考影片 | 5 | 動作風格、時間、場景連續性 | 可選 |
| 參考音訊 | 1 | 聲音音色、語調、環境音 | 可選 |
| 文字提示 | 1 | 主題、動作、攝影機、風格 | 必填 |
文字提示始終是必填的。模型將其用作生成的核心,然後在其上疊加參考資料衍生的屬性。如果沒有提示,模型就沒有場景可渲染,呼叫將會失敗。
一些值得記住的限制。參考影片每個上限為 10 秒,輸出持續時間絕不會超過您傳遞的最短參考影片。參考音訊必須是 5 到 30 秒的乾淨 WAV 或 MP3 檔案,任何較短的都會被填充,任何較長的都會被截斷。
輸入插槽互動
每個插槽都會影響不同的輸出軸。圖片驅動外觀。影片驅動動作。當有臉部時,音訊驅動聲音和唇形同步。當兩個插槽衝突時(例如,金髮主題的參考圖片與黑髮主題的參考影片配對),模型會選擇其中一個並忽略另一個,而且選擇並不總是可預測的。
在我們的測試中,衝突的參考資料在相同種子值的重複運行中會產生不一致的選擇。將參考衝突視為非確定性的,並從源頭上消除它們。
何時應該使用 R2V?
當鏡頭之間的連續性比原始速度更重要時,R2V 是正確的選擇。我們在三種特定情況下使用它。
多鏡頭場景中的身分保留。 如果您需要同一個角色在廣角、中景和特寫鏡頭中出現,R2V 為每個角度提供一張強大的參考圖片,可以保持臉部結構的一致性。I2V 每次都會重新生成臉部並產生漂移。
將聲音複製到新場景。 當您有一個錄製好的旁白,必須與螢幕上的虛擬角色匹配時,R2V 結合參考音訊和參考肖像的表現優於音訊驅動的 I2V。聲音音色會傳遞過去,唇形同步看起來就像是同一個說話者。
資產之間的風格延續。 如果您已經發布了一個片段,並且需要一個在色彩分級、服裝和節奏上都匹配的續集,那麼將第一個片段作為參考影片的 R2V 是最快的途徑。文字生成影片無法僅憑描述來重現特定的外觀。
何時應該避免使用 R2V?
對於單次拍攝的工作,R2V 是過度殺傷。如果您只需要單一產品旋轉展示,I2V 的第一幀模式更快且更便宜。由於參考條件設定過程,R2V 每秒消耗的點數比 I2V 更多。
當您的參考資料品質低劣時,請跳過 R2V。模型無法「改善」模糊的照片或嘈雜的音訊片段。在這裡,「垃圾進,垃圾出」的原則比 Wan 2.7 介面中的任何其他地方都更適用。
對於純粹的抽象動作,請跳過 R2V。文字生成影片無需參考資料的額外開銷即可處理雲朵、粒子和夢境序列。
如何準備參考資產
參考品質是 R2V 輸出品質的最大單一預測指標。一張清晰的 1080P 參考圖片勝過一張透過訊息應用程式壓縮兩次的 4K 圖片。
參考圖片。 使用一張強大的主圖作為您的錨點。正面、均勻照明、中性背景,畫面中沒有其他主體。如果您必須添加更多圖片,請確保它們是同一主體的角度變化,而不是不同的主體。
參考影片。 修剪到您希望模型學習的精確動作。一個包含一個清晰手勢的 3 秒片段勝過一個包含混合動作的 10 秒片段。解析度應與您的目標輸出匹配:1080P 輸入,1080P 輸出。
參考音訊。 僅限錄音室級別的錄音。去除背景噪音,將響度標準化至約 -16 LUFS,並修剪開頭和結尾的靜音。手機錄音會產生手機品質的聲音複製。
[獨特見解] 參考資料之間的解析度不匹配是一種隱性失敗模式。如果您的參考圖片是 2160P,而您的參考影片是 720P,模型傾向於繼承較低保真度的來源用於動作,而繼承較高保真度的來源用於靜態細節,從而產生一個在各幀之間看起來不一致的片段。在上傳之前,將所有內容縮小到您的目標輸出。

如何無衝突地組合參考資料
以下四步驟工作流程是我們內部運行的。它消除了我們過去在自由堆疊參考資料時約 80% 的衝突失敗。
步驟 1:準備參考資料。 選擇一張錨點圖片,零到四張輔助圖片,零到兩個參考影片,以及零或一個參考音訊。將所有參考資料標準化為與您的目標輸出相同的長寬比。
步驟 2:正確設定 reference_voice。 當您附加參考音訊時,將 reference_voice 參數設定為 clone 以保留聲音,或設定為 drive 僅用於唇形同步。這兩種模式從相同的音訊檔案產生非常不同的輸出。clone 傳遞音色,drive 傳遞時間。
步驟 3:撰寫提示。 描述您想要的場景,而不是參考資料。參考資料是條件設定,而不是提示的主題。錯誤的提示:「讓這個人像音訊一樣說話。」好的提示:「一位穿著綠色夾克的 30 歲女性在陽光普照的廚房裡對著鏡頭說話,中景特寫,50mm 鏡頭。」
步驟 4:渲染和評估。 首先運行一個 3 秒的 720P 測試。檢查第一幀的身分保留,第二幀的動作連貫性,以及第三幀的音訊同步。然後再提交 10 秒的 1080P 最終版本。
有效和有風險的組合
有些輸入組合是穩定的。其他則經常產生偽影。此矩陣是根據我們在 2026 年 6 月和 7 月進行的約 200 次渲染的 R2V 測試得出的。
| 組合 | 穩定性 | 備註 |
|---|---|---|
| 1 張圖片 + 文字 | 高 | 最接近 I2V,最快的 R2V 路徑 |
| 1 張圖片 + 1 個音訊 + 文字 | 高 | 最適合說話頭像的聲音複製 |
| 1 張圖片 + 1 個影片 + 文字 | 中 | 當影片顯示相同主體時有效 |
| 1 張圖片 + 1 個影片 + 1 個音訊 + 文字 | 中 | 三重條件設定,注意衝突 |
| 5 張圖片 + 5 個影片 + 1 個音訊 + 文字 | 低 | 最大輸入,最大衝突風險 |
| 0 張圖片 + 1 個影片 + 文字 | 低 | 沒有圖片錨點,身分會漂移 |
[原始數據] 在我們的 200 次渲染測試集中,使用 3 個或更少參考資料的呼叫成功率為 91%,而使用 8 個或更多參考資料的呼叫成功率為 54%。這裡的成功意味著輸出與提示匹配,並清晰地保留了至少一個參考屬性。
實例:多鏡頭角色場景
為了使工作流程具體化,這裡是一個我們為內部演示運行的真實 R2V 任務。簡報要求是一個 6 秒的 1080P 片段,內容是一個風格化的女性角色穿過霓虹燈小巷,然後轉向攝影機。
使用的參考資料。 一張 1080P 的角色主肖像,正面。一個來自素材庫的 5 秒類似步行循環參考影片。沒有參考音訊。
提示。 「一位留著紅色短髮、穿著銀色夾克的女人在夜晚的霓虹燈小巷中行走,中廣角鏡頭,緩慢推軌,她在結尾處轉向攝影機,電影感,情緒化的主光,濕潤路面反射。」
設定。 R2V 模式,1080P,6 秒,16:9,種子值 8421。主肖像錨定臉部。參考影片錨定步行時間。
結果。 第一次渲染在 6 幀中的第 4 幀之前清晰地保留了身分,然後在轉身時略有漂移。我們添加了一張相同角色四分之三背視圖的輔助圖片,重新渲染後,轉身保持了穩定。總計算量:三次渲染,兩次用於測試的 720P,一次用於最終的 1080P。
教訓:從最少開始,只有當您看到特定失敗時才添加參考資料。預防性地添加參考資料是 R2V 最常見的錯誤。
常見失敗模式
R2V 以可預測的方式失敗。預先指出它們可以節省點數。
參考衝突。 兩個參考資料描述不同的主體、照明或動作。模型每幀隨機選擇一個,產生閃爍。透過將每個屬性類別減少到一個參考資料來解決。
參考品質不匹配。 清晰的圖片與壓縮的影片配對。模型會繼承較弱來源的偽影。透過將所有參考資料標準化為相同的保真度來解決。
提示與參考不匹配。 描述陽光海灘的提示與暴風雪的參考影片配對。模型會服從提示並忽略參考資料,浪費了參考條件設定。透過將提示語氣與參考語氣對齊來解決。
音訊不同步。 參考音訊長於輸出持續時間,或音訊有長時間的前導靜音。唇形同步會漂移。透過將音訊修剪到與輸出長度完全相同,並將第一個音素設定在 0.0 秒來解決。
轉身時身分漂移。 當主體旋轉超過參考角度 45 度時,臉部會變形。透過在重新渲染之前,在目標角度添加一張輔助參考圖片來解決。
Wan 2.7 R2V 常見問題
我可以向 Wan 2.7 R2V 傳遞多少個參考資料?
根據 Alibaba Cloud R2V API 參考資料,單次呼叫中最多可傳遞 5 張參考圖片、5 個參考片段和 1 個參考音訊。文字提示始終是必填的。更多的參考資料會增加衝突風險,因此我們建議從一張圖片開始,並僅在需要時添加。
R2V 是否支援 1080P 輸出?
是的。R2V 輸出上限為 1080P 和 10 秒。解析度必須與您最低解析度的參考資料匹配;否則模型會繼承最弱來源的偽影。
R2V 可以複製任何聲音嗎?
R2V 可以從 5 到 30 秒的乾淨參考音訊中複製聲音。PixMind 政策禁止未經同意複製可識別的真實人物。請將 R2V 聲音複製用於原創角色、您自己的聲音或獲得授權的參考音訊。
R2V 與音訊驅動的 I2V 有何不同?
音訊驅動的 I2V 僅使用音訊來驅動單一輸入圖片上的動作和唇形同步。R2V 接受更廣泛的多模態輸入矩陣,包括參考影片和多張圖片,並且可以複製聲音音色而不僅僅是同步時間。當身分和聲音都需要跨鏡頭傳遞時,R2V 是更強大的選擇。
我應該何時避免使用 R2V?
對於一次性 B-roll、抽象動作、簡單的產品旋轉展示,或任何沒有連續性要求的情況,請避免使用 R2V。由於參考條件設定過程,R2V 每秒消耗的點數比 I2V 和 T2V 更多,如果參考資料沒有增加有用的訊號,額外的條件設定反而會造成傷害。
觀看實際操作
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b


