Wan 2.7 Image-to-Video: อธิบาย 4 โหมด
ประเด็นสำคัญ
- Wan 2.7 image-to-video (I2V) รวมสี่โหมดย่อยไว้ใน API เดียว: เฟรมแรก, เฟรมแรก-เฟรมสุดท้าย, การต่อเนื่องวิดีโอ และการขับเคลื่อนด้วยเสียง
- แต่ละโหมดย่อยใช้พารามิเตอร์อินพุตที่แตกต่างกัน (
first_frame,last_frame,first_clip,driving_audio) และส่งผ่านแบ็กเอนด์การสร้างเดียวกัน - โหมดเฟรมแรก-เฟรมสุดท้ายและการขับเคลื่อนด้วยเสียงเป็นความสามารถเฉพาะตัวที่โมเดล I2V แบบภาพเดียวไม่สามารถทำซ้ำได้
- ความล้มเหลวส่วนใหญ่ของ I2V มาจากการไม่ตรงกันของโหมดอินพุต: พารามิเตอร์ที่ไม่ถูกต้องสำหรับงาน หรือเฟรมอ้างอิงที่ไม่ตรงกับอัตราส่วนภาพที่ร้องขอ
- ลองใช้ Wan 2.7 video generator เพื่อทำตามตัวอย่างใดๆ ในคู่มือนี้
Wan 2.7 image-to-video ไม่ใช่คุณสมบัติเดียว แต่เป็นสี่โหมดย่อยที่ส่งผ่านพื้นผิว API เดียวกัน โดยแต่ละโหมดรับรูปร่างอินพุตที่แตกต่างกัน เอกสารอ้างอิง API ของ Wan 2.7 I2V ได้บันทึกเมทริกซ์อินพุตไว้ แต่ไม่ได้อธิบายว่าจะเลือกโหมดใดเมื่อใด คู่มือนี้จะอธิบาย แต่ละส่วนครอบคลุมอินพุต กรณีการใช้งาน พรอมต์ที่ใช้งานได้จริง และโหมดความล้มเหลวที่เราเคยเจอมาแล้ว
สำหรับการดูภาพรวมที่กว้างขึ้นว่า I2V อยู่ตรงไหนในตระกูลโมเดล Wan 2.7, ภาพรวมตัวสร้างวิดีโอ PixMind Wan 2.7 ครอบคลุมโหมดข้อความ รูปภาพ และการอ้างอิงเคียงข้างกัน
Wan 2.7 Image-to-Video คืออะไร?
Wan 2.7 image-to-video (I2V) คือเส้นทางการสร้างที่ปรับตามรูปภาพภายในตระกูลโมเดล Wan 2.7 ของ Alibaba ตาม เอกสารอ้างอิง API ของ Wan 2.7 I2V ปลายทางจะรับอาร์เรย์สื่อของอินพุตที่พิมพ์และส่งคืนวิดีโอที่ความละเอียดสูงสุด 1080P โดยมีระยะเวลาตั้งแต่ 2 ถึง 15 วินาที
สี่โหมดย่อยไม่ใช่ปลายทางที่แยกจากกัน แต่เป็นการรวมกันของอินพุตที่ API กำหนดเส้นทางภายใน:
| โหมดย่อย | อินพุตที่จำเป็น | อินพุตเสริม | ระยะเวลาทั่วไป |
|---|---|---|---|
| เฟรมแรกเป็นวิดีโอ | รูปภาพ first_frame |
prompt, audio | 2-10s |
| เฟรมแรกและเฟรมสุดท้ายเป็นวิดีโอ | first_frame + last_frame |
prompt | 2-5s |
| การต่อเนื่องวิดีโอ | วิดีโอ first_clip |
prompt | 3-10s |
| ขับเคลื่อนด้วยเสียง | first_frame + driving_audio |
prompt | 5-15s |
การเลือกโหมดย่อยที่ถูกต้องเป็นการตัดสินใจที่มีผลกระทบสูงสุดในเวิร์กโฟลว์ I2V โมเดลจะต้องสร้างสรรค์น้อยลงเมื่อคุณให้ข้อจำกัดมากขึ้น ตัวอย่างเช่น เฟรมแรก-เฟรมสุดท้ายจะลงจอดที่สถานะสิ้นสุดที่รับประกันได้ เฟรมแรกเพียงอย่างเดียวจะปล่อยให้โมเดลตัดสินใจจุดสิ้นสุด
[ข้อมูลเชิงลึกเฉพาะ] ผู้สร้างส่วนใหญ่ถือว่า I2V เป็นคุณสมบัติเดียวและใช้โหมดเฟรมแรกเป็นค่าเริ่มต้นสำหรับทุกสิ่ง ในการเรนเดอร์ทดสอบของเรา การเปลี่ยนไปใช้เฟรมแรก-เฟรมสุดท้ายสำหรับการเปิดเผยผลิตภัณฑ์ช่วยลดการปฏิเสธ "สถานะสิ้นสุดที่ไม่ถูกต้อง" ลงประมาณสองในสาม เนื่องจากโมเดลไม่จำเป็นต้องเดาอีกต่อไปว่าภาพจะไปในทิศทางใด
เฟรมแรกเป็นวิดีโอทำงานอย่างไร?
เฟรมแรกเป็นวิดีโอคือเส้นทาง I2V เริ่มต้น คุณอัปโหลดรูปภาพหนึ่งรูปเป็น first_frame เขียนพรอมต์ที่อธิบายการเคลื่อนไหว และ Wan 2.7 จะสร้างเฟรมที่เคลื่อนไปข้างหน้าจากสถานะเริ่มต้นนั้น คู่มือผู้ใช้ Wan 2.7 image-to-video ระบุว่านี่คือรูปแบบการเรียก I2V ที่ง่ายที่สุด
อินพุต
first_frame(จำเป็น): รูปภาพหนึ่งรูป, อัตราส่วนภาพใดก็ได้ที่ Wan 2.7 รองรับ (16:9, 9:16, 1:1, 4:3, 3:4)prompt(เสริมแต่แนะนำอย่างยิ่ง): อธิบายการเคลื่อนไหว กล้อง และสไตล์resolution: 720P หรือ 1080Pduration: 2 ถึง 15 วินาทีratio: ต้องตรงกับอัตราส่วนภาพอินพุตเพื่อหลีกเลี่ยงการครอบตัด
ควรใช้เมื่อใด
- คุณมีรูปภาพผลิตภัณฑ์หนึ่งรูปและต้องการการเปิดเผยสั้นๆ
- คุณมีภาพบุคคลของตัวละครและต้องการการเคลื่อนไหวที่ละเอียดอ่อน
- คุณกำลังวนซ้ำสไตล์การเคลื่อนไหวก่อนที่จะล็อกสถานะสิ้นสุด
พรอมต์ที่ใช้งานได้จริง
first_frame: ภาพถ่ายขวดน้ำหอมแก้วบนพื้นผิวสีเข้ม, แสงหลักเดียวจากด้านซ้ายของกล้องprompt: "กล้องดันเข้าช้าๆ ละอองน้ำพุ่งเข้ามาจากขอบด้านขวา อนุภาคอ่อนนุ่มลอยผ่านลำแสง ภาพยนตร์, ระยะชัดตื้น, แสงขอบอุ่น" ความละเอียด 1080P, ระยะเวลา 5 วินาที, อัตราส่วน 16:9
โหมดความล้มเหลว
- พรอมต์ขัดแย้งกับรูปภาพ หากพรอมต์ขอการแพนกล้องกว้าง แต่
first_frameเป็นภาพโคลสอัพ โมเดลอาจบิดเบือนวัตถุให้เข้ากัน - อัตราส่วนภาพไม่ตรงกัน การป้อนภาพ 9:16 เข้าไปในการสร้าง 16:9 จะทำให้เกิดการครอบตัดโดยไม่คาดคิด ควรจับคู่อัตราส่วนอินพุตกับ
ratioเอาต์พุตเสมอ - ขอการเคลื่อนไหวมากเกินไป การเรนเดอร์ 2 วินาทีไม่สามารถรองรับการแพนกล้อง 180 องศาได้โดยไม่เกิดการเบลอ ขยายระยะเวลาหรือลดการเคลื่อนไหว
เราทำการเรนเดอร์ทดสอบเฟรมแรก 24 ครั้งบนภาพถ่ายผลิตภัณฑ์สำหรับชุดโฆษณาผลิตภัณฑ์ดูแลผิว การเรนเดอร์ที่รักษากล้องให้คงที่หรือใช้การดันเข้าช้าๆ (การเคลื่อนที่ของเฟรมไม่เกิน 10 เปอร์เซ็นต์) ถูกส่งออกไป 80 เปอร์เซ็นต์ของเวลา การเรนเดอร์ที่ขอ "การเคลื่อนไหวของกล้องแบบไดนามิก" ถูกส่งออกไป 25 เปอร์เซ็นต์ของเวลา และสร้างการบิดเบือนที่มองเห็นได้บนฝาปิดสะท้อนแสง
เฟรมแรกและเฟรมสุดท้ายเป็นวิดีโอทำงานอย่างไร?
เฟรมแรกและเฟรมสุดท้ายเป็นวิดีโอใช้รูปภาพสองรูป คือ first_frame และ last_frame และสร้างเฟรมระหว่างกลาง ตาม เอกสารอ้างอิง API ของ Wan 2.7 I2V รูปภาพทั้งสองต้องมีอัตราส่วนภาพเดียวกันและองค์ประกอบเดียวกันในอุดมคติ โมเดลจะประมาณการเปลี่ยนผ่านที่เป็นไปได้
อินพุต
first_frame(จำเป็น): รูปภาพสถานะเริ่มต้นlast_frame(จำเป็น): รูปภาพสถานะสิ้นสุดprompt(เสริม): อธิบายว่าการเปลี่ยนผ่านควรรู้สึกอย่างไร ไม่ใช่จุดสิ้นสุดresolution,duration,ratio: ข้อจำกัดเดียวกันกับโหมดเฟรมแรก- ระยะเวลาทั่วไป: 2 ถึง 5 วินาที ระยะเวลาที่นานขึ้นจะบังคับให้โมเดลสร้างสรรค์มากขึ้น
ควรใช้เมื่อใด
- การเปิดเผยผลิตภัณฑ์ที่ต้องลงจอดที่เฟรมสิ้นสุดที่เฉพาะเจาะจง
- การเปลี่ยนผ่านที่ทั้งสถานะเริ่มต้นและสถานะสิ้นสุดได้รับการออกแบบไว้แล้ว
- ภาพที่ทำสตอรี่บอร์ดไว้ซึ่งมีคีย์เฟรมสองเฟรมถูกล็อกไว้
พรอมต์ที่ใช้งานได้จริง
first_frame: กล่องของขวัญปิดอยู่บนพื้นผิวหินอ่อนlast_frame: กล่องเดิมเปิดอยู่ มีแสงส่องออกมาและริบบิ้นคลี่ออกprompt: "กล่องเปิดออกอย่างราบรื่นภายใน 3 วินาที กล้องคงที่ แสงสว่างเพิ่มขึ้นจากเฟรมที่ 30 ไม่มีวัตถุลอย" ความละเอียด 1080P, ระยะเวลา 3 วินาที, อัตราส่วน 16:9
โหมดความล้มเหลว
- พื้นผิวสะท้อนแสงเบลอ แก้ว โลหะ และน้ำสามารถบิดเบี้ยวได้ระหว่างการประมาณค่า ลดความกว้างของการเคลื่อนไหวหรือทำให้พื้นผิวเรียบง่ายขึ้น
- กล้องไม่ตรงกัน หากคีย์เฟรมทั้งสองบ่งบอกถึงมุมกล้องที่แตกต่างกัน โมเดลจะสร้างการเปลี่ยนผ่านที่มักจะดูเหมือนการตัดกระโดด
- ระยะเวลานานเกินไป เกิน 5 วินาที โมเดลจะต้องเติมการเคลื่อนไหวที่สร้างขึ้นมากเกินไป ควรใช้ระยะเวลาสั้นๆ
กลุ่มพรอมต์เฟรมแรก-เฟรมสุดท้ายของ PixMind มีเทมเพลตสำหรับการเปิดเผยผลิตภัณฑ์ การเปลี่ยนผ่าน และรูปแบบการเล่าเรื่องที่ตรงกับโหมดนี้
การต่อเนื่องวิดีโอทำงานอย่างไร?
การต่อเนื่องวิดีโอใช้คลิปสั้นที่มีอยู่เป็น first_clip และขยายเวลาออกไป คู่มือ Wan 2.7 I2V ถือว่านี่เป็นโหมดย่อย I2V ที่แตกต่างกันเนื่องจากอินพุตเป็นวิดีโอ ไม่ใช่ภาพนิ่ง โมเดลจะอ่านเวกเตอร์การเคลื่อนไหวจากคลิปต้นฉบับและดำเนินการต่อ
อินพุต
first_clip(จำเป็น): วิดีโอสั้นๆ โดยทั่วไป 2 ถึง 5 วินาที รูปแบบและตัวแปลงสัญญาณต้องตรงกับรายการที่ API ยอมรับprompt(เสริม): อธิบายว่าการต่อเนื่องควรพัฒนาไปอย่างไร ไม่ใช่การเริ่มต้นใหม่resolution: ควรตรงกับคลิปต้นฉบับเพื่อหลีกเลี่ยงสิ่งแปลกปลอมจากการอัปสเกลduration: ความยาวทั้งหมดของเอาต์พุต ไม่ใช่แค่ส่วนที่เพิ่มเข้ามา
ควรใช้เมื่อใด
- การสร้าง 3 วินาทีนั้นยอดเยี่ยม แต่คุณต้องการ 6 วินาที
- คุณต้องการขยายภาพฮีโร่ให้เป็นโฆษณาที่ยาวขึ้น
- คลิปแรกมีการเคลื่อนไหวที่ดีที่คุณต้องการรักษาไว้
พรอมต์ที่ใช้งานได้จริง
first_clip: คลิป 3 วินาทีของนักสเก็ตบอร์ดที่กำลังกลิ้งผ่านกล้อง ถ่ายที่ 720Pprompt: "นักสเก็ตยังคงผ่านกล้อง กล้องติดตาม พื้นหลังเปลี่ยนจากตรอกซอกซอยเป็นแสงไฟถนน ไม่มีรอยตัด" ความละเอียด 720P, ระยะเวลา 6 วินาที, อัตราส่วน 16:9
โหมดความล้มเหลว
- การรีเซ็ตการเคลื่อนไหว โมเดลอาจหยุดวัตถุหากพรอมต์ขัดแย้งกับการเคลื่อนไหวต้นฉบับ ปรับพรอมต์ให้สอดคล้องกับทิศทางที่มีอยู่ของคลิป
- สิ่งแปลกปลอมจากการอัปสเกลความละเอียด การป้อนแหล่งที่มา 720P เข้าไปในเอาต์พุต 1080P จะสร้างเฟรมที่นุ่มนวลหรือบิดเบี้ยว จับคู่ความละเอียดเอาต์พุตกับแหล่งที่มา
- คลิปสั้นเกินไป แหล่งที่มา 1 วินาทีทำให้โมเดลแทบไม่มีการเคลื่อนไหวที่จะดำเนินการต่อ ใช้เวลาอย่างน้อย 2 วินาที
[ข้อมูลเชิงลึกเฉพาะ] การต่อเนื่องวิดีโอเป็นโหมดย่อย I2V ที่ถูกใช้น้อยที่สุด ช่วยให้คุณ "กู้คืน" การเรนเดอร์ที่หยุดเร็วเกินไป 2 วินาที ซึ่งเราพบว่าเป็นประมาณหนึ่งในสามของการวนซ้ำการผลิตทั้งหมด แทนที่จะสร้างใหม่ตั้งแต่ต้น คุณสามารถเพิ่มต่อได้
โหมดขับเคลื่อนด้วยเสียงทำงานอย่างไร?
I2V ที่ขับเคลื่อนด้วยเสียงใช้ภาพนิ่งบวกกับแทร็ก driving_audio และสร้างวิดีโอที่วัตถุเคลื่อนไหวพร้อมกับเสียง ตาม คู่มือ Wan 2.7 image-to-video นี่คือเส้นทางสำหรับเนื้อหาแบบ talking-head และ avatar โมเดลใช้รูปคลื่นเสียงเพื่อขับเคลื่อนการเคลื่อนไหวของริมฝีปากและพลังงานโดยรวม
อินพุต
first_frame(จำเป็น): ภาพบุคคลหรือภาพตัวละคร หันหน้าตรง, มีแสงสว่างเพียงพอ, การแสดงออกที่เป็นกลางจะดีที่สุดdriving_audio(จำเป็น): แทร็กเสียงที่สะอาด WAV หรือ MP3 เสียงคุณภาพสตูดิโอมีประสิทธิภาพดีกว่าการบันทึกจากโทรศัพท์prompt(เสริม): อธิบายการเคลื่อนไหวรอบข้าง, การเคลื่อนไหวศีรษะ, พลังงานการแสดงออกduration: โดยทั่วไปจะตรงกับความยาวของเสียง สูงสุด 15 วินาที
ควรใช้เมื่อใด
- ผู้บรรยายแบบ talking-head จากภาพบุคคลเดียว
- เนื้อหา Avatar สำหรับโซเชียล
- การสาธิตผลิตภัณฑ์ที่ขับเคลื่อนด้วยเสียงบรรยายโดยมีใบหน้าเป็นผู้เล่าเรื่อง
พรอมต์ที่ใช้งานได้จริง
first_frame: ภาพบุคคลด้านหน้าของอวตารที่วาดขึ้น, การแสดงออกที่เป็นกลาง, พื้นหลังเรียบdriving_audio: ไฟล์ WAV 8 วินาทีของการทักทายด้วยเสียงบรรยายprompt: "ศีรษะแกว่งเล็กน้อย, กระพริบตาทุก 3 วินาที, รอยยิ้มปรากฏขึ้นเมื่อสิ้นสุดประโยค" ความละเอียด 1080P, ระยะเวลา 8 วินาที, อัตราส่วน 16:9
โหมดความล้มเหลว
- ริมฝีปากเลื่อนบนใบหน้าที่ไม่หันหน้าตรง หากภาพบุคคลเป็นภาพด้านข้าง การซิงค์ริมฝีปากจะลดลง ควรใช้ภาพหันหน้าตรง
- เสียงรบกวน เสียงฟู่พื้นหลังหรือเพลงจะแทรกซึมเข้าไปในสิ่งแปลกปลอมของการเคลื่อนไหว ทำความสะอาดเสียงก่อน
- ระยะเวลานานโดยไม่มีการหยุดหายใจ การพูดต่อเนื่อง 15 วินาทีโดยไม่มีการหยุดพักทำให้โมเดลสร้างรูปปากที่ดูแปลกๆ ควรแก้ไขโดยเพิ่มการหยุดพัก
สำหรับรูปแบบที่ลึกซึ้งยิ่งขึ้นในการจับคู่เสียงกับวิดีโอ กลุ่มพรอมต์การซิงค์เสียงของ PixMind มีเทมเพลตสำหรับคลิปแบบ talking-head, เสียงบรรยาย และคลิปที่ขับเคลื่อนด้วยเพลง
คุณจะเลือกโหมด I2V ที่ถูกต้องได้อย่างไร?
การตัดสินใจขึ้นอยู่กับสิ่งที่คุณมีอยู่ในมือ เอกสารอ้างอิง API ของ Wan 2.7 T2V และเอกสารอ้างอิง I2V ร่วมกันอธิบายเมทริกซ์อินพุตทั้งหมด แต่การตัดสินใจส่วนใหญ่จะสรุปได้ในตารางง่ายๆ
| คุณมี... | ใช้โหมด I2V นี้ | เหตุผล |
|---|---|---|
| รูปภาพหนึ่งรูป | เฟรมแรกเป็นวิดีโอ | เส้นทางที่ง่ายที่สุด โมเดลสร้างการเคลื่อนไหว |
| รูปภาพสองรูปที่ต้องเป็นจุดเริ่มต้นและจุดสิ้นสุด | เฟรมแรกและเฟรมสุดท้ายเป็นวิดีโอ | ล็อกสถานะสิ้นสุด ลดการปฏิเสธ |
| คลิปสั้นๆ ที่ต้องการเวลาเพิ่ม | การต่อเนื่องวิดีโอ | รักษาสภาพการเคลื่อนไหวที่มีอยู่ ต้นทุนต่ำกว่าการสร้างใหม่ |
| ภาพบุคคลบวกแทร็กเสียง | ขับเคลื่อนด้วยเสียง | การซิงค์ริมฝีปากและพลังงานตามเสียง |
| ภาพบุคคลบวกเสียงบวกวิดีโออ้างอิง | พิจารณา R2V แทน | R2V รักษาเอกลักษณ์ได้ดีกว่า I2V ที่ขับเคลื่อนด้วยเสียง |
หลักการปฏิบัติ: ยิ่งคุณสามารถให้ข้อมูลอินพุตแก่โมเดลได้มากเท่าไหร่ โมเดลก็ยิ่งต้องสร้างสรรค์น้อยลงเท่านั้น การสร้างสรรค์คือจุดที่เกิดการบิดเบือนและการเลื่อน

หากคุณกำลังเริ่มต้นจากศูนย์และยังไม่มีอินพุต ให้รัน T2V ก่อนเพื่อล็อกช็อต จากนั้นใช้เฟรมที่ดีที่สุดเป็น first_frame ใน I2V เวิร์กโฟลว์สองขั้นตอนนี้นั้นดีกว่าการพยายามสร้าง I2V ที่สมบูรณ์แบบในการลองครั้งแรก
โหมดความล้มเหลวทั่วไปของ I2V คืออะไร?
I2V ล้มเหลวในลักษณะที่คาดเดาได้ การระบุชื่อช่วยให้คุณวนซ้ำได้เร็วขึ้น
- การบิดเบือนของพื้นผิวสะท้อนแสง แก้ว กระจก โลหะขัดเงาจะเบลอระหว่างการประมาณค่า บรรเทาได้โดยการลดการเคลื่อนไหวหรือทำให้พื้นผิวในภาพต้นฉบับเรียบง่ายขึ้น
- การเลื่อนของเอกลักษณ์ข้ามเฟรม ใบหน้าจะเปลี่ยนไป โดยเฉพาะอย่างยิ่งหลังจาก 5 วินาที บรรเทาได้ด้วยเฟรมแรก-เฟรมสุดท้ายสำหรับช็อตสั้นๆ ที่ล็อกไว้ หรือ R2V สำหรับการรักษาเอกลักษณ์ที่ยาวนานขึ้น
- อัตราส่วนภาพไม่ตรงกัน การป้อนภาพ 9:16 เข้าไปในการสร้าง 16:9 จะครอบตัดวัตถุ จับคู่อัตราส่วนอินพุตและเอาต์พุต
- พรอมต์ขัดแย้งกับรูปภาพ การขอ "แพนกล้องกว้าง" บนภาพโคลสอัพที่แคบจะบังคับให้โมเดลสร้างบริบทมุมกว้างที่มองไม่เห็น ปรับพรอมต์ให้เข้ากับกรอบภาพ
- เสียงรบกวนแทรกซึมเข้าไปในการเคลื่อนไหว เสียงคุณภาพโทรศัพท์สร้างการเคลื่อนไหวหลอนบนใบหน้า ทำความสะอาดเสียงก่อน
- การใช้เครดิตสิ้นเปลืองในการวนซ้ำที่ยาวนาน การเรนเดอร์ 10 วินาทีที่ 1080P ใช้เครดิตมาก วนซ้ำที่ 2 ถึง 3 วินาทีและ 720P จากนั้นจึงขยายขนาด
ในการเรนเดอร์ I2V 40 ครั้งสำหรับแคมเปญโฆษณา ความล้มเหลวแบ่งออกเป็นประมาณ: 40 เปอร์เซ็นต์จากพรอมต์ขัดแย้งกับรูปภาพ, 25 เปอร์เซ็นต์จากอัตราส่วนภาพไม่ตรงกัน, 20 เปอร์เซ็นต์จากการบิดเบือนของพื้นผิวสะท้อนแสง, 15 เปอร์เซ็นต์จากอื่นๆ อัตราส่วนภาพไม่ตรงกันเป็นสิ่งที่แก้ไขได้ถูกที่สุด: เป็นการตรวจสอบพารามิเตอร์เดียว แต่ก็ทำให้เกิดการสิ้นเปลืองเครดิตถึงหนึ่งในสี่
สำหรับรูปแบบความล้มเหลวที่ลึกซึ้งยิ่งขึ้นในกรณีการใช้งานต่างๆ กลุ่มกรณีการใช้งาน PixMind Wan 2.7 มีบันทึกสำหรับแต่ละสถานการณ์สำหรับวิดีโอผลิตภัณฑ์ ตัวละคร และโซเชียล
คำถามที่พบบ่อยเกี่ยวกับโหมด Wan 2.7 I2V
ความแตกต่างระหว่าง I2V และ R2V ใน Wan 2.7 คืออะไร?
I2V (image-to-video) ใช้อินพุตเป็นภาพนิ่งหรือคลิปสั้นๆ R2V (reference-to-video) ใช้ภาพอ้างอิงสูงสุดห้าภาพ, คลิปอ้างอิงห้าคลิป และแทร็กเสียงอ้างอิงหนึ่งแทร็ก และใช้สิ่งเหล่านี้เพื่อรักษาเอกลักษณ์ เสียง และสไตล์ R2V เหมาะกว่าสำหรับความสอดคล้องของหลายช็อต I2V เร็วกว่าสำหรับงานช็อตเดียว
โหมดเฟรมแรก-เฟรมสุดท้ายของ Wan 2.7 สามารถจัดการกับการเคลื่อนไหวของกล้องได้หรือไม่?
ทำได้ แต่คีย์เฟรมทั้งสองควรบ่งบอกถึงมุมกล้องที่สอดคล้องกัน หาก first_frame และ last_frame บ่งบอกถึงมุมที่แตกต่างกัน โมเดลจะสร้างการเปลี่ยนผ่านที่มักจะดูเหมือนการตัดกระโดด รักษาการเปลี่ยนแปลงของกล้องให้ละเอียดอ่อน ไม่เกิน 15 องศา
การต่อเนื่องวิดีโอของ Wan 2.7 สามารถขยายคลิปได้นานแค่ไหน?
การต่อเนื่องวิดีโอสามารถขยายคลิปต้นฉบับได้สูงสุดถึง 15 วินาที ซึ่งเป็นขีดจำกัดสูงสุดของโหมด I2V คลิปต้นฉบับบวกกับการต่อเนื่องที่สร้างขึ้นจะต้องไม่เกิน 15 วินาทีทั้งหมด สำหรับวิดีโอที่ยาวขึ้น ให้เชื่อมโยงการเรียกต่อเนื่องหลายครั้ง
โหมดขับเคลื่อนด้วยเสียงของ Wan 2.7 ต้องมีใบหน้าในรูปภาพหรือไม่?
ทำงานได้ดีที่สุดกับใบหน้า แต่ไม่จำเป็น หากไม่มีใบหน้า เสียงจะขับเคลื่อนพลังงานการเคลื่อนไหวโดยรวมแทนการซิงค์ริมฝีปาก ภาพทิวทัศน์หรือภาพผลิตภัณฑ์ในโหมดขับเคลื่อนด้วยเสียงจะสร้างการเคลื่อนไหวแบบนามธรรมที่ตามความกว้างของเสียง
Wan 2.7 I2V ทดลองใช้ฟรีหรือไม่?
ใช่ หน้า PixMind Wan 2.7 มีการทดลองใช้ฟรีโดยไม่ต้องใช้บัตรเครดิต แผนแบบชำระเงินจะเริ่มใช้งานเมื่อคุณใช้เกินโควต้าทดลองใช้เท่านั้น
ดูการทำงานจริง
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



