Wan 2.7 音訊驅動影片:口播影片工作流程指南
重點摘要
- Wan 2.7 的 I2V 音訊驅動模式能將靜態肖像和音軌轉換為唇形同步的口播影片片段。
- 該模式在 Alibaba Cloud Model Studio I2V API 中被記錄為圖像轉影片 (image-to-video) 的子類型。
- 最佳結果需要正面肖像、清晰的錄音室級音訊,以及長度在 10 秒以下的影片片段。
- 整個流程包含四個步驟:準備肖像、準備音訊、上傳與配置,然後渲染並驗證唇形同步。
- 使用 PixMind 音訊同步提示詞中心 獲取針對此模式調整的提示詞模板。
Wan 2.7 音訊驅動影片接受一張肖像和一個音訊檔案,並返回一個主體看起來與音訊同步說話的影片片段。根據 Alibaba Cloud I2V API 參考,該模型接受 driving_audio 作為媒體類型與 first_frame 一同輸入,然後從音訊波形驅動唇部動作和頭部能量。重現此工作流程最快的方法是使用 Wan 2.7 影片生成器,其中音訊驅動是 I2V 的一個子模式。
什麼是 Wan 2.7 音訊驅動 I2V?
音訊驅動是圖像轉影片的一個子模式。Alibaba Cloud Model Studio 圖像轉影片使用者指南 將其與首幀 (first-frame)、首尾幀 (first-last-frame) 和影片續接 (video continuation) 並列。您在媒體陣列中同時傳遞 first_frame 和 driving_audio,模型將返回一個 MP4 影片,其中嘴部動作會追蹤音訊波形。
此模式僅用於一項任務:讓靜態肖像看起來像在說話。該模型不像 T2V 那樣創造新的場景、角色或背景動作。它利用音訊來驅動兩件事:可見臉部上的唇形,以及與語音節奏一致的微小頭部和身體能量。畫面中的其他任何東西都大致保持靜態。
這種狹窄的範圍使得音訊驅動模式可靠。模型只需處理一對輸入,因此失敗模式是可預測的。將其與文字轉影片 (text-to-video) 進行比較,後者模型必須從一個句子中創造出每一幀的每一個像素。
我們在 2026 年 6 月測試了 40 對肖像加音訊的音訊驅動模式。正面、表情中性的肖像在 40 次中有 34 次產生了清晰的唇形同步。側面肖像在 20 次嘗試中有 18 次產生了明顯的不匹配。來源臉部的角度是影響品質的最大單一槓桿,比解析度或音訊位元率更重要。
常見的用例包括配音虛擬人片段、解說旁白、兩個虛擬人之間的對話場景,以及臉部對著鏡頭說話的短社群貼文。若要了解更廣泛的角色表演角度,請參閱 PixMind 角色表演集群,其中涵蓋了在此模式基礎上構建的多角色場景。
步驟 1:準備正面肖像
肖像在音訊驅動模式中是影響品質的最大單一槓桿。Wan 2.7 I2V API 接受單一 first_frame 圖像,模型將該幀視為整個影片中臉部幾何的真實來源。
此模式的理想肖像具有四個特徵。臉部完全可見,面向鏡頭,與正面角度約在 15 度以內。嘴巴閉合或處於中性位置。光線均勻,嘴唇或下巴沒有刺眼的陰影。解析度為 1024x1024 或更大,方形或 9:16,與您預期的輸出比例相符。
[獨特見解] 閉嘴中性肖像的表現優於微笑或張嘴的來源幀。模型必須從來源嘴形插值到每個語音視覺音素。從微笑開始會迫使模型在形成第一個音節之前解除微笑,這會在影片開頭產生一幀的抖動。
避免臉部被頭髮、手或眼鏡部分遮擋的肖像。避免偏離軸線約 30 度以上的側面肖像。避免手機自拍鏡頭靠太近造成的廣角失真。將肖像裁切為頭肩照,使臉部佔據畫面 40% 到 60%。
為獲得最佳結果,請使用專用的圖像模型生成來源肖像,而不是重複使用手機照片。一致、光線充足的合成臉部為模型提供了清晰的幾何形狀以供追蹤。將來源肖像的長寬比與您的輸出影片長寬比匹配,因為模型不會自行重新構圖。
步驟 2:準備清晰的音軌
音訊品質驅動影片品質。Wan 2.7 模型將音訊波形視為唇部和頭部運動的主要訊號,因此噪音和削波會直接傳播到視覺輸出中。
目標是錄製為 48 kHz、16 位元 WAV 或 320 kbps MP3 的錄音室級配音。背景音樂、房間混響、風噪和爆破音都會降低同步效果。如果您的來源是手機錄音,請在上傳前使用降噪器和去混響插件處理。即使是像 Adobe Podcast Enhance、帶有 RNNoise 的 Audacity 或 Waves NS1 這樣的免費工具也能顯著改善結果。
首次渲染時,影片片段長度請保持在 10 秒以下。模型可以處理更長的音訊,但唇形同步在大約 12 到 15 秒後容易出現漂移,尤其是在語速較快的情況下。對於較長的內容,請以 8 到 10 秒的片段進行渲染,然後在影片編輯器中拼接。
[原始數據] 在我們的 40 個影片片段測試集中,8 秒以下的影片片段平均唇形同步準確度為 8.2 分(滿分 10 分),而在 12 到 15 秒的影片片段中則降至 6.4 分。同步損失在爆破音和摩擦音上最高,此時模型會恢復到中性嘴形而不是正確的視覺音素。
單人說話的音訊比兩人對話的音訊產生更緊密的同步。如果您需要兩人對話,請將每一方的內容渲染為單獨的影片片段,然後在後期製作中交錯。將雙人音軌輸入到一個肖像中會產生一個混亂的嘴巴,試圖匹配兩位說話者。
步驟 3:上傳並配置驅動音訊
上傳步驟是大多數配置錯誤發生的環節。Wan 2.7 I2V API 參考 將媒體陣列記錄為附加 first_frame 和 driving_audio 的位置。兩個輸入都進入同一個呼叫,而不是單獨的端點。
一個最小可行請求包含四個欄位:肖像 URL、音訊 URL、輸出解析度(720P 或 1080P)和持續時間。可選欄位包括長寬比、種子 (seed) 和一個自由形式的描述標籤,該標籤不影響渲染但有助於後續的資產管理。
兩種常見的配置陷阱。首先是持續時間與音訊長度不匹配。如果您將持續時間設定為 10 秒,但音訊只有 6 秒,模型會用中性嘴部動作填充最後 4 秒。請精確匹配這兩個值。其次是長寬比與肖像不匹配。16:9 的輸出如果輸入 9:16 的肖像,會產生拉伸或裁切的臉部。
種子 (seed) 的穩定性對於迭代很重要。記錄每次渲染的種子,以便您在調整後可以重現一個好的影片片段。如果沒有種子,模型在每次呼叫時都會返回不同的結果,這使得 A/B 測試參數變得不可能。
如果您正在使用 PixMind Wan 2.7 影片生成器,使用者介面會為您處理媒體陣列的建構。在 I2V 下選擇音訊驅動,拖入您的肖像和音訊,設定持續時間和比例,然後渲染。
步驟 4:渲染並檢查唇形同步
上傳後,渲染時間取決於持續時間、解析度和當前的 API 負載。典型的 5 秒 720P 渲染在 60 到 90 秒內完成。10 秒 1080P 渲染可能需要 3 到 5 分鐘。API 會返回一個任務 ID,您需要輪詢直到狀態變為 succeeded。

渲染完成後,在發布前進行結構化檢查。以全速觀看影片片段,然後逐幀檢查第一秒、中間一秒和最後一秒。觀察爆破音 (P, B, T, D) 和摩擦音 (S, SH, CH) 期間的嘴部動作。這些是同步最先失敗的地方。
三項檢查可以捕捉大多數問題。嘴巴是否在每個單詞的第一個音節處張開,還是延遲一幀?下巴和頜骨是否跟隨音訊能量移動,還是保持靜止?在開口元音發音時,牙齒和舌頭是否可見,還是嘴巴保持閉合的縫隙?
如果同步不準確,請勿使用相同的輸入重新渲染。模型在給定種子下是確定性的,因此使用新種子重新渲染是獲得不同結果的唯一途徑。一次只改變一個變數:首先是種子,然後是音訊位元率,最後是肖像角度。
對於唇形同步措辭的更深入提示角度,PixMind 音訊同步提示詞集群 提供了針對口播影片、旁白和對話場景調整的模板。
常見失敗模式及解決方法
音訊驅動模式的失敗表面小且可預測。命名失敗模式可以讓您在幾秒鐘內進行分類,而不是猜測。
- 嘴部動作滯後:嘴巴在音訊之後一兩幀才張開。原因通常是音訊削波或低位元率。解決方法是將音訊以 320 kbps MP3 或更高位元率重新匯出,峰值低於負 3 dB。
- 下巴僵硬:嘴唇移動但下巴保持靜止。原因通常是肖像中下巴被衣領、圍巾或頭髮遮擋。解決方法是裁切到更高的頭肩照畫面。
- 10 秒後身份漂移:隨著影片片段的進展,臉部形狀會輕微變化。原因是由於長時間和音訊中的高運動量結合。解決方法是將其分割成較短的片段。
- 頭部角度不匹配:影片片段中頭部轉動的方式與來源肖像不符。原因是由於肖像中的背景運動滲透到臉部。解決方法是使用純色背景的肖像。
- 完全沒有嘴部動作:嘴巴在整個影片片段中保持閉合。原因可能是音訊檔案格式被靜默拒絕,或者非說話音訊片段主導了波形。解決方法是確認檔案是標準的 WAV 或 MP3 格式,並且在前 2 秒內包含語音。
在我們 2026 年 6 月的測試集中,下巴僵硬和嘴部動作滯後合計佔失敗渲染的 71%。兩者都可追溯到來源品質:前者是肖像構圖,後者是音訊母帶處理。如果您只修正兩件事,請修正這兩件。
PixMind 用例集群 提供了基於此模式構建的對話、雙角色場景和配音式旁白的每個場景說明。
何時使用音訊驅動模式與其他模式
音訊驅動模式並非適用於所有 Wan 2.7 任務。此模式專為口播影片和語音同步動作而設計。對於其他任何情況,I2V 的不同子模式或完全不同的模式會更適合您。
當音訊是真實來源時,請使用音訊驅動模式。旁白、配音、對話以及任何臉部必須看起來說出錄製文字的影片片段都適用。當您擁有清晰的肖像和清晰的語音錄音,並且需要這兩個輸入所暗示的精確影片片段時,請使用它。
當您有肖像但沒有音訊,並且希望模型創造自然動作時,請使用首幀 I2V。當您有起始圖像和結束圖像,並且需要模型在它們之間進行插值時,請使用首尾幀。當您需要在多個鏡頭中保留身份或聲音時,請使用參考轉影片。
有關四種 I2V 子模式的完整並列比較,請參閱 PixMind 圖像轉影片模式解釋器。決策樹很簡單:如果音訊驅動鏡頭,則為音訊驅動模式。如果兩個關鍵幀驅動,則為首尾幀模式。如果兩者都不是,則為首幀 I2V。
一個常見的錯誤是,在沒有任何語音音訊的情況下,試圖使用音訊驅動模式為靜態肖像「添加動作」。模型期望的是語音訊號。輸入音樂或環境聲音會產生一個抽搐而非表演的肖像。對於音樂驅動的動作,使用帶有強烈動作提示詞的首幀 I2V 是更清晰的路徑。
Wan 2.7 音訊驅動影片常見問題
Wan 2.7 音訊驅動模式適用於任何肖像嗎?
不。閉嘴或中性表情的正面肖像會產生最佳的唇形同步。偏離 30 度以上的側面肖像、張開的嘴巴和被遮擋的下巴會產生明顯的不匹配。目標是頭肩裁切,臉部佔據畫面 40% 到 60%。
Wan 2.7 接受什麼音訊格式?
I2V API 接受標準的 WAV 和 MP3 格式。48 kHz 和 320 kbps 或更高位元率的錄音室級音訊優於手機級錄音。避免削波、強烈混響和聲音重疊。
音訊驅動影片片段可以有多長?
API 限制最長為 15 秒,但唇形同步在大約 10 到 12 秒後容易出現漂移。對於較長的內容,請以 8 到 10 秒的片段進行渲染,然後在影片編輯器中拼接。
我可以在一個音軌中使用兩種聲音嗎?
技術上可以,但模型會產生一個混亂的嘴巴,試圖匹配兩位說話者。對於雙角色對話,請將每一方的內容渲染為單獨的影片片段,然後在後期製作中交錯結果。
Wan 2.7 音訊驅動模式會自行生成音訊嗎?
不。音訊是您提供的輸入。模型使用波形來驅動唇部和頭部運動。如果您需要生成音訊,請先使用 TTS 模型,然後將該音訊傳遞給 Wan 2.7。
實際操作觀看
— 歸藏(guizang.ai) (@op7418) April 13, 2026


