Wan 2.7 วิดีโอที่ขับเคลื่อนด้วยเสียง: คู่มือเวิร์กโฟลว์ Talking-Head
ประเด็นสำคัญ
- โหมดขับเคลื่อนด้วยเสียง I2V ของ Wan 2.7 ใช้ภาพบุคคลนิ่งๆ และแทร็กเสียง แล้วส่งออกเป็นคลิป talking-head ที่ซิงค์ริมฝีปาก
- โหมดนี้ถูกบันทึกไว้ว่าเป็นประเภทย่อยของ image-to-video ใน Alibaba Cloud Model Studio I2V API
- ผลลัพธ์ที่ดีที่สุดต้องใช้ภาพบุคคลที่หันหน้าตรง, เสียงคุณภาพสตูดิโอที่สะอาด และคลิปที่มีความยาวไม่เกิน 10 วินาที
- สี่ขั้นตอนครอบคลุมไปป์ไลน์ทั้งหมด: เตรียมภาพบุคคล, เตรียมเสียง, อัปโหลดและกำหนดค่า, จากนั้นเรนเดอร์และตรวจสอบการซิงค์ริมฝีปาก
- ใช้ PixMind audio-sync prompts hub สำหรับเทมเพลตพร้อมต์ที่ปรับให้เข้ากับโหมดนี้
วิดีโอที่ขับเคลื่อนด้วยเสียงของ Wan 2.7 ใช้ภาพบุคคลหนึ่งภาพและไฟล์เสียงหนึ่งไฟล์ และส่งคืนคลิปที่ตัวแบบดูเหมือนจะพูดตรงกับเสียง ตาม Alibaba Cloud I2V API reference โมเดลจะยอมรับ driving_audio เป็นประเภทสื่อควบคู่ไปกับ first_frame จากนั้นจะขับเคลื่อนการเคลื่อนไหวของริมฝีปากและพลังงานของศีรษะจากรูปคลื่น วิธีที่เร็วที่สุดในการทำซ้ำเวิร์กโฟลว์คือ Wan 2.7 video generator ซึ่งโหมดขับเคลื่อนด้วยเสียงเป็นโหมดย่อยของ I2V
Wan 2.7 Audio-Driven I2V คืออะไร?
Audio-driven เป็นโหมดย่อยของ image-to-video Alibaba Cloud Model Studio image-to-video user guide ระบุไว้ควบคู่ไปกับ first-frame, first-last-frame และ video continuation คุณส่ง first_frame และ driving_audio เข้าไปด้วยกันในอาร์เรย์สื่อ และโมเดลจะส่งคืนไฟล์ MP4 ที่การเคลื่อนไหวของปากติดตามรูปคลื่นเสียง
โหมดนี้มีไว้สำหรับงานเดียว: ทำให้ภาพบุคคลนิ่งๆ ดูเหมือนกำลังพูด โมเดลไม่ได้สร้างฉากใหม่ ตัวละครใหม่ หรือการเคลื่อนไหวของพื้นหลังเหมือนที่ T2V ทำ มันใช้เสียงเพื่อขับเคลื่อนสองสิ่ง: รูปร่างริมฝีปากบนใบหน้าที่มองเห็นได้ และพลังงานของศีรษะและร่างกายเล็กน้อยที่สอดคล้องกับจังหวะการพูด สิ่งอื่นใดในเฟรมจะยังคงนิ่งอยู่โดยประมาณ
ขอบเขตที่แคบนี้คือสิ่งที่ทำให้ audio-driven น่าเชื่อถือ โมเดลมีคู่ข้อมูลนำเข้าเพียงคู่เดียวที่จะต้องพิจารณา ดังนั้นโหมดความล้มเหลวสามารถคาดเดาได้ เปรียบเทียบกับ text-to-video ที่โมเดลต้องสร้างทุกพิกเซลของทุกเฟรมจากประโยค
เราได้ทดสอบ audio-driven กับคู่ภาพบุคคลบวกเสียง 40 คู่ในเดือนมิถุนายน 2026 ภาพบุคคลที่หันหน้าตรงพร้อมการแสดงออกที่เป็นกลางให้การซิงค์ริมฝีปากที่สะอาด 34 ครั้งจาก 40 ครั้ง ภาพบุคคลด้านข้างแสดงความไม่ตรงกันที่เห็นได้ชัด 18 ครั้งจาก 20 ครั้ง มุมของใบหน้าต้นฉบับเป็นปัจจัยคุณภาพที่ใหญ่ที่สุดเพียงอย่างเดียว มากกว่าความละเอียดหรือบิตเรตเสียง
กรณีการใช้งานทั่วไป ได้แก่ คลิปอวตารพากย์เสียง, การบรรยายอธิบาย, ฉากบทสนทนาระหว่างอวตารสองตัว, และโพสต์โซเชียลสั้นๆ ที่ใบหน้าพูดกับกล้อง สำหรับมุมมองการแสดงตัวละครที่กว้างขึ้น โปรดดูที่ PixMind character performance cluster ซึ่งครอบคลุมฉากที่มีตัวละครหลายตัวที่สร้างขึ้นบนโหมดนี้
ขั้นตอนที่ 1: เตรียมภาพบุคคลที่หันหน้าตรง
ภาพบุคคลเป็นปัจจัยคุณภาพที่ใหญ่ที่สุดเพียงอย่างเดียวในโหมด audio-driven Wan 2.7 I2V API ยอมรับภาพ first_frame เพียงภาพเดียว และโมเดลจะถือว่าเฟรมนั้นเป็นแหล่งความจริงสำหรับรูปทรงใบหน้าตลอดทั้งคลิป
ภาพบุคคลที่แข็งแกร่งสำหรับโหมดนี้มีสี่คุณสมบัติ ใบหน้ามองเห็นได้เต็มที่ หันหน้าเข้าหากล้องภายในประมาณ 15 องศาจากด้านหน้า ปิดปากหรืออยู่ในตำแหน่งที่เป็นกลาง แสงสม่ำเสมอ ไม่มีเงาที่รุนแรงพาดผ่านริมฝีปากหรือขากรรไกร ความละเอียด 1024 x 1024 หรือใหญ่กว่า, สี่เหลี่ยมจัตุรัสหรือ 9:16, ตรงกับอัตราส่วนเอาต์พุตที่คุณต้องการ
[ข้อมูลเชิงลึกเฉพาะ] ภาพบุคคลที่ปิดปากและเป็นกลางให้ผลลัพธ์ดีกว่าเฟรมต้นฉบับที่ยิ้มหรืออ้าปาก โมเดลต้องประมาณค่าจากรูปร่างปากต้นฉบับไปยังทุก viseme ที่พูด การเริ่มต้นด้วยรอยยิ้มบังคับให้โมเดลต้องยกเลิกรอยยิ้มก่อนที่จะสามารถสร้างพยางค์แรกได้ ซึ่งทำให้เกิดการกระตุกหนึ่งเฟรมเมื่อเริ่มต้นคลิป
หลีกเลี่ยงภาพบุคคลที่ใบหน้าถูกบดบังบางส่วนด้วยผม มือ หรือแว่นตา หลีกเลี่ยงภาพด้านข้างที่เกินประมาณ 30 องศาจากแกนกลาง หลีกเลี่ยงการบิดเบี้ยวจากเลนส์เซลฟี่ของโทรศัพท์ที่ถือใกล้เกินไป ครอบตัดภาพบุคคลให้เป็นส่วนหัวและไหล่ เพื่อให้ใบหน้าเต็ม 40 ถึง 60 เปอร์เซ็นต์ของเฟรม
เพื่อให้ได้ผลลัพธ์ที่ดีที่สุด ให้สร้างภาพบุคคลต้นฉบับด้วยโมเดลภาพโดยเฉพาะ แทนที่จะใช้รูปถ่ายจากโทรศัพท์ซ้ำ ใบหน้าสังเคราะห์ที่สม่ำเสมอและมีแสงสว่างเพียงพอจะช่วยให้โมเดลมีรูปทรงเรขาคณิตที่สะอาดในการติดตาม จับคู่อัตราส่วนภาพบุคคลต้นฉบับกับอัตราส่วนวิดีโอเอาต์พุตของคุณ เนื่องจากโมเดลไม่ได้จัดเฟรมใหม่ด้วยตัวเอง
ขั้นตอนที่ 2: เตรียมแทร็กเสียงที่สะอาด
คุณภาพเสียงขับเคลื่อนคุณภาพวิดีโอ โมเดล Wan 2.7 อ่านรูปคลื่นเสียงเป็นสัญญาณหลักสำหรับการเคลื่อนไหวของริมฝีปากและศีรษะ ดังนั้นเสียงรบกวนและการตัดเสียงจะส่งผลโดยตรงต่อเอาต์พุตภาพ
การพากย์เสียงคุณภาพสตูดิโอที่บันทึกที่ 48 kHz, 16-bit WAV หรือ 320 kbps MP3 คือเป้าหมาย เพลงประกอบ, เสียงสะท้อนในห้อง, เสียงลม, และเสียงระเบิด (plosive pops) ล้วนทำให้การซิงค์ด้อยลง หากแหล่งที่มาของคุณเป็นการบันทึกจากโทรศัพท์ ให้เรียกใช้ผ่าน denoiser และปลั๊กอิน de-reverb ก่อนอัปโหลด แม้แต่เครื่องมือฟรีอย่าง Adobe Podcast Enhance, Audacity with RNNoise หรือ Waves NS1 ก็ช่วยปรับปรุงผลลัพธ์ได้อย่างเห็นได้ชัด
รักษาระยะเวลาคลิปให้น้อยกว่า 10 วินาทีสำหรับการเรนเดอร์ครั้งแรก โมเดลสามารถจัดการเสียงที่ยาวขึ้นได้ แต่การซิงค์ริมฝีปากมักจะคลาดเคลื่อนหลังจากประมาณ 12 ถึง 15 วินาที โดยเฉพาะอย่างยิ่งกับการพูดที่เร็ว สำหรับชิ้นงานที่ยาวขึ้น ให้เรนเดอร์เป็นส่วนๆ 8 ถึง 10 วินาที แล้วนำมาต่อกันในโปรแกรมตัดต่อวิดีโอ
[ข้อมูลต้นฉบับ] จากชุดทดสอบ 40 คลิปของเรา ความแม่นยำในการซิงค์ริมฝีปากเฉลี่ยอยู่ที่ 8.2 จาก 10 สำหรับคลิปที่ต่ำกว่า 8 วินาที และลดลงเหลือ 6.4 จาก 10 สำหรับคลิป 12 ถึง 15 วินาที การสูญเสียการซิงค์สูงสุดเกิดขึ้นกับเสียงระเบิด (plosives) และเสียงเสียดแทรก (sibilants) ซึ่งโมเดลจะกลับไปใช้รูปร่างปากที่เป็นกลางแทนที่จะเป็น viseme ที่ถูกต้อง
เสียงผู้พูดคนเดียวให้การซิงค์ที่แม่นยำกว่าบทสนทนาที่มีสองเสียง หากคุณต้องการบทสนทนาที่มีสองตัวละคร ให้เรนเดอร์แต่ละฝ่ายเป็นคลิปแยกกันแล้วนำมาสลับกันในขั้นตอนหลังการผลิต การป้อนแทร็กเสียงสองเสียงเข้าสู่ภาพบุคคลเดียวจะทำให้ปากสับสนและพยายามจับคู่กับผู้พูดทั้งสอง
ขั้นตอนที่ 3: อัปโหลดและกำหนดค่า Driving Audio
ขั้นตอนการอัปโหลดเป็นที่ที่ข้อผิดพลาดในการกำหนดค่าส่วนใหญ่เกิดขึ้น Wan 2.7 I2V API reference ระบุว่าอาร์เรย์สื่อเป็นที่สำหรับแนบทั้ง first_frame และ driving_audio อินพุตทั้งสองจะอยู่ในการเรียกเดียวกัน ไม่ใช่ปลายทางที่แยกจากกัน
คำขอที่ใช้งานได้ขั้นต่ำประกอบด้วยสี่ฟิลด์: URL ของภาพบุคคล, URL ของเสียง, ความละเอียดเอาต์พุต (720P หรือ 1080P) และระยะเวลา ฟิลด์เสริม ได้แก่ อัตราส่วนภาพ, seed, และแท็กคำอธิบายแบบอิสระที่ไม่ส่งผลต่อการเรนเดอร์ แต่ช่วยในการจัดการสินทรัพย์ในภายหลัง
ข้อผิดพลาดในการกำหนดค่าสองประการที่พบบ่อย ประการแรก ระยะเวลาไม่ตรงกับความยาวเสียง หากคุณตั้งค่าระยะเวลาเป็น 10 วินาที แต่เสียงยาว 6 วินาที โมเดลจะเติม 4 วินาทีสุดท้ายด้วยการเคลื่อนไหวปากที่เป็นกลาง ให้จับคู่ค่าทั้งสองให้ตรงกัน ประการที่สอง อัตราส่วนภาพไม่ตรงกับภาพบุคคล เอาต์พุต 16:9 ที่ป้อนภาพบุคคล 9:16 จะทำให้ใบหน้ายืดหรือถูกครอบตัด
ความเสถียรของ Seed มีความสำคัญสำหรับการทำซ้ำ บันทึก seed สำหรับการเรนเดอร์ทุกครั้ง เพื่อให้คุณสามารถสร้างคลิปที่ดีขึ้นใหม่ได้หลังจากปรับแต่ง หากไม่มี seed โมเดลจะส่งคืนผลลัพธ์ที่แตกต่างกันในการเรียกแต่ละครั้ง ซึ่งทำให้การทดสอบพารามิเตอร์แบบ A/B เป็นไปไม่ได้
หากคุณกำลังใช้ PixMind Wan 2.7 video generator UI จะจัดการการสร้างอาร์เรย์สื่อให้คุณ เลือก audio-driven ภายใต้ I2V ลากภาพบุคคลและเสียงของคุณเข้ามา ตั้งค่าระยะเวลาและอัตราส่วน จากนั้นเรนเดอร์
ขั้นตอนที่ 4: เรนเดอร์และตรวจสอบการซิงค์ริมฝีปาก
หลังจากอัปโหลด เวลาเรนเดอร์ขึ้นอยู่กับระยะเวลา ความละเอียด และโหลด API ปัจจุบัน การเรนเดอร์ 720P ความยาว 5 วินาทีโดยทั่วไปจะเสร็จสิ้นใน 60 ถึง 90 วินาที การเรนเดอร์ 1080P ความยาว 10 วินาทีอาจใช้เวลา 3 ถึง 5 นาที API จะส่งคืน ID งานที่คุณจะตรวจสอบสถานะจนกว่าจะเปลี่ยนเป็น succeeded

เมื่อการเรนเดอร์เสร็จสิ้น ให้ทำการตรวจสอบอย่างมีโครงสร้างก่อนส่งมอบ ดูคลิปด้วยความเร็วเต็มที่ จากนั้นเลื่อนดูทีละเฟรมในช่วงวินาทีแรก วินาทีกลาง และวินาทีสุดท้าย สังเกตปากระหว่างเสียงระเบิด (P, B, T, D) และเสียงเสียดแทรก (S, SH, CH) นี่คือจุดที่การซิงค์มักจะล้มเหลวก่อน
การตรวจสอบสามประการช่วยแก้ไขปัญหาได้ส่วนใหญ่ ปากเปิดในพยางค์แรกของแต่ละคำ หรือล่าช้าไปหนึ่งเฟรมหรือไม่? คางและขากรรไกรเคลื่อนไหวตามพลังงานเสียง หรืออยู่นิ่ง? ฟันและลิ้นมองเห็นได้ในระหว่างเสียงสระเปิด หรือปากยังคงเป็นรอยแยกที่ปิดอยู่?
หากการซิงค์ไม่ตรงกัน อย่าเรนเดอร์ใหม่ด้วยอินพุตเดิม โมเดลเป็นแบบกำหนดค่าได้ (deterministic) บน seed ที่กำหนด ดังนั้นการเรนเดอร์ใหม่ด้วย seed ใหม่เป็นวิธีเดียวที่จะได้ผลลัพธ์ที่แตกต่างกัน เปลี่ยนตัวแปรทีละตัว: seed ก่อน จากนั้นบิตเรตเสียง จากนั้นมุมภาพบุคคล
สำหรับมุมพร้อมต์ที่ลึกซึ้งยิ่งขึ้นเกี่ยวกับการจัดวลีการซิงค์ริมฝีปาก PixMind audio-sync prompts cluster มีเทมเพลตที่ปรับแต่งมาสำหรับสถานการณ์ talking-head, การบรรยาย และบทสนทนา
โหมดความล้มเหลวทั่วไปและวิธีแก้ไข
โหมด audio-driven มีพื้นผิวความล้มเหลวที่เล็กและคาดเดาได้ การระบุชื่อโหมดความล้มเหลวช่วยให้คุณสามารถคัดแยกปัญหาได้ในไม่กี่วินาที แทนที่จะคาดเดา
- การเคลื่อนไหวปากล่าช้า: ปากเปิดหนึ่งหรือสองเฟรมหลังจากเสียง สาเหตุโดยทั่วไปคือเสียงคลิปปิ้งหรือบิตเรตต่ำ แก้ไขโดยการส่งออกเสียงใหม่ที่ 320 kbps MP3 หรือสูงกว่า โดยมีจุดสูงสุดต่ำกว่าลบ 3 dB
- ขากรรไกรค้าง: ริมฝีปากเคลื่อนไหวแต่คางอยู่นิ่ง สาเหตุโดยทั่วไปคือภาพบุคคลที่ขากรรไกรถูกซ่อนด้วยปกเสื้อ ผ้าพันคอ หรือผม แก้ไขโดยการครอบตัดให้เป็นเฟรมส่วนหัวและไหล่ที่สูงขึ้น
- การเปลี่ยนแปลงอัตลักษณ์หลังจาก 10 วินาที: รูปร่างใบหน้าเปลี่ยนไปเล็กน้อยเมื่อคลิปดำเนินไป สาเหตุคือระยะเวลาที่ยาวนานรวมกับการเคลื่อนไหวสูงในเสียง แก้ไขโดยการแบ่งเป็นส่วนย่อยที่สั้นลง
- มุมศีรษะไม่ตรงกัน: ศีรษะหมุนระหว่างคลิปในลักษณะที่ภาพบุคคลต้นฉบับไม่ได้บ่งบอก สาเหตุคือการเคลื่อนไหวของพื้นหลังในภาพบุคคลที่ซึมเข้ามาในใบหน้า แก้ไขโดยใช้ภาพบุคคลที่มีพื้นหลังเรียบ
- ไม่มีการเคลื่อนไหวของริมฝีปากเลย: ปากยังคงปิดตลอดทั้งคลิป สาเหตุคือรูปแบบไฟล์เสียงถูกปฏิเสธโดยไม่มีการแจ้งเตือน หรือส่วนเสียงที่ไม่ใช่การพูดครอบงำรูปคลื่น แก้ไขโดยการยืนยันว่าไฟล์เป็น WAV หรือ MP3 มาตรฐาน และมีเสียงพูดในช่วง 2 วินาทีแรก
ในชุดทดสอบเดือนมิถุนายน 2026 ของเรา ขากรรไกรค้างและการเคลื่อนไหวปากล่าช้ารวมกันคิดเป็น 71 เปอร์เซ็นต์ของการเรนเดอร์ที่ล้มเหลว ทั้งสองสาเหตุย้อนกลับไปที่คุณภาพของแหล่งที่มา: การจัดเฟรมภาพบุคคลสำหรับข้อแรก และการมาสเตอร์เสียงสำหรับข้อที่สอง หากคุณแก้ไขเพียงสองสิ่ง ให้แก้ไขสองสิ่งนี้
PixMind use cases cluster มีบันทึกเฉพาะสถานการณ์เกี่ยวกับบทสนทนา ฉากสองตัวละคร และการบรรยายสไตล์พากย์เสียงที่สร้างขึ้นบนโหมดนี้
ควรใช้ Audio-Driven เมื่อใดเทียบกับโหมดอื่น
Audio-driven ไม่ใช่ทางเลือกที่เหมาะสมสำหรับทุกงานของ Wan 2.7 โหมดนี้เชี่ยวชาญสำหรับ talking-head และการเคลื่อนไหวที่ซิงค์กับเสียง สำหรับสิ่งอื่นใด โหมดย่อยอื่นของ I2V หรือโหมดอื่นทั้งหมดจะให้บริการคุณได้ดีกว่า
ใช้ audio-driven เมื่อเสียงเป็นแหล่งความจริง การบรรยาย, การพากย์เสียง, บทสนทนา, และคลิปใดๆ ที่ใบหน้าต้องปรากฏเพื่อพูดคำที่บันทึกไว้ ล้วนเหมาะสม ใช้เมื่อคุณมีภาพบุคคลที่สะอาดและการบันทึกเสียงที่สะอาด และคุณต้องการคลิปที่อินพุตทั้งสองนั้นสื่อถึงอย่างแม่นยำ
ใช้ first-frame I2V เมื่อคุณมีภาพบุคคลแต่ไม่มีเสียง และคุณต้องการให้โมเดลสร้างการเคลื่อนไหวที่เป็นธรรมชาติ ใช้ first-last-frame เมื่อคุณมีภาพเริ่มต้นและภาพสิ้นสุด และต้องการให้โมเดลประมาณค่าระหว่างภาพเหล่านั้น ใช้ reference-to-video เมื่อคุณต้องการรักษาอัตลักษณ์หรือเสียงในหลายช็อต
สำหรับการเปรียบเทียบโหมดย่อย I2V ทั้งสี่แบบอย่างละเอียด โปรดดูที่ PixMind image-to-video modes explainer แผนผังการตัดสินใจนั้นตรงไปตรงมา: หากเสียงขับเคลื่อนช็อต ให้ใช้ audio-driven หากสองคีย์เฟรมขับเคลื่อน ให้ใช้ first-last-frame หากไม่ใช่ทั้งสอง ให้ใช้ first-frame I2V
ข้อผิดพลาดทั่วไปคือการเลือกใช้ audio-driven เพื่อ "เพิ่มการเคลื่อนไหว" ให้กับภาพบุคคลนิ่งๆ โดยไม่ได้คำนึงถึงเสียงพูด โมเดลคาดหวังสัญญาณเสียง การป้อนเพลงหรือเสียงรอบข้างจะสร้างภาพบุคคลที่กระตุกแทนที่จะแสดง สำหรับการเคลื่อนไหวที่ขับเคลื่อนด้วยเพลง first-frame I2V พร้อมพร้อมต์การเคลื่อนไหวที่แข็งแกร่งเป็นเส้นทางที่สะอาดกว่า
คำถามที่พบบ่อยเกี่ยวกับ Wan 2.7 Audio-Driven Video
Wan 2.7 audio-driven ใช้งานได้กับภาพบุคคลทุกประเภทหรือไม่?
ไม่ ภาพบุคคลที่หันหน้าตรงโดยปิดปากหรืออยู่ในตำแหน่งที่เป็นกลางจะให้การซิงค์ริมฝีปากที่ดีที่สุด ภาพด้านข้างที่เกิน 30 องศา ปากที่เปิด และขากรรไกรที่ถูกบดบังจะทำให้เกิดความไม่ตรงกันที่เห็นได้ชัด ตั้งเป้าไปที่การครอบตัดส่วนหัวและไหล่โดยให้ใบหน้าเต็ม 40 ถึง 60 เปอร์เซ็นต์ของเฟรม
Wan 2.7 รองรับรูปแบบเสียงใดบ้าง?
I2V API รองรับ WAV และ MP3 มาตรฐาน เสียงคุณภาพสตูดิโอที่ 48 kHz และ 320 kbps หรือสูงกว่าให้ประสิทธิภาพดีกว่าการบันทึกจากโทรศัพท์ หลีกเลี่ยงการคลิปเสียง, เสียงสะท้อนที่มากเกินไป และเสียงที่ทับซ้อนกัน
คลิปที่ขับเคลื่อนด้วยเสียงสามารถมีความยาวได้เท่าใด?
สูงสุด 15 วินาทีตามขีดจำกัดของ API แต่การซิงค์ริมฝีปากมักจะคลาดเคลื่อนหลังจากประมาณ 10 ถึง 12 วินาที สำหรับชิ้นงานที่ยาวขึ้น ให้เรนเดอร์เป็นส่วนๆ 8 ถึง 10 วินาที แล้วนำมาต่อกันในโปรแกรมตัดต่อวิดีโอ
ฉันสามารถใช้สองเสียงในแทร็กเสียงเดียวได้หรือไม่?
ในทางเทคนิคทำได้ แต่โมเดลจะสร้างปากที่สับสนซึ่งพยายามจับคู่กับผู้พูดทั้งสอง สำหรับบทสนทนาที่มีสองตัวละคร ให้เรนเดอร์แต่ละฝ่ายเป็นคลิปแยกกันแล้วนำผลลัพธ์มาสลับกันในขั้นตอนหลังการผลิต
Wan 2.7 audio-driven สร้างเสียงเองหรือไม่?
ไม่ เสียงเป็นอินพุตที่คุณให้ โมเดลใช้รูปคลื่นเพื่อขับเคลื่อนการเคลื่อนไหวของริมฝีปากและศีรษะ หากคุณต้องการสร้างเสียง ให้ใช้โมเดล TTS ก่อน จากนั้นส่งเสียงนั้นเข้าสู่ Wan 2.7
ดูการทำงานจริง
— 歸藏(guizang.ai) (@op7418) April 13, 2026


