🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: คู่มือการสร้างวิดีโออ้างอิงหลายโมดอล

สารบัญ

Wan 2.7 R2V: คู่มือการสร้างวิดีโออ้างอิงหลายโมดอล

ประเด็นสำคัญ

  • Wan 2.7 reference-to-video (R2V) รับภาพอ้างอิงได้สูงสุด 5 ภาพ, คลิปอ้างอิง 5 คลิป และเสียงอ้างอิง 1 เสียงในการเรียกใช้ครั้งเดียว ซึ่งเป็นเมทริกซ์อินพุตหลายโมดอลที่กว้างที่สุดในบรรดารุ่น 1080P ปัจจุบัน
  • R2V เป็นโหมดที่เหมาะสมสำหรับการรักษารูปลักษณ์, การโคลนเสียง และการรักษาสไตล์ต่อเนื่องในแต่ละช็อต ไม่ใช่สำหรับ B-roll แบบครั้งเดียวจบ หรือการหมุนผลิตภัณฑ์แบบง่ายๆ
  • ความขัดแย้งของข้อมูลอ้างอิงเป็นสาเหตุหลักของความล้มเหลว และส่วนใหญ่สามารถป้องกันได้โดยการทำตามขั้นตอนการทำงานสี่ขั้นตอน: เตรียม-ตั้งค่า-เขียน-เรนเดอร์
  • สำหรับคลังพรอมต์ที่ลึกซึ้งยิ่งขึ้นซึ่งเชื่อมโยงกับโหมดนี้ โปรดดูที่ PixMind reference-video prompts cluster

Wan 2.7 R2V คืออะไร?

R2V ย่อมาจาก reference-to-video ซึ่งเป็นโหมดของ Wan 2.7 ที่รับอินพุตอ้างอิงแบบผสม และสร้างคลิปใหม่ที่รักษารูปลักษณ์, เสียง หรือสไตล์จากอินพุตเหล่านั้น ตาม Wan 2.7 R2V API reference บน Alibaba Cloud การเรียกใช้ R2V ครั้งเดียวสามารถรับภาพอ้างอิงได้สูงสุด 5 ภาพ, คลิปอ้างอิง 5 คลิป และแทร็กเสียงอ้างอิง 1 แทร็ก โดยมีผลลัพธ์สูงสุดที่ 1080P และ 10 วินาที

สิ่งที่แยก R2V ออกจาก image-to-video คือการปรับสภาพแบบหลายโมดอล I2V จะล็อกเฟรมเริ่มต้นและให้โมเดลสร้างการเคลื่อนไหวขึ้นมาเอง แต่ R2V จะดึงคุณลักษณะจากข้อมูลอ้างอิงของคุณ เช่น โครงสร้างใบหน้า, เครื่องแต่งกาย, โทนเสียง, การปรับสี และเผยแพร่คุณลักษณะเหล่านั้นไปยังการสร้างใหม่ นี่คือเหตุผลที่เราถือว่า R2V เป็นขั้นตอนการทำงานที่แตกต่างกัน ไม่ใช่ I2V ที่หรูหรากว่า

R2V อยู่ภายในส่วนหน้าของ Wan 2.7 video generator ที่รวมอยู่ใน PixMind คุณไม่จำเป็นต้องเปลี่ยนโมเดลเพื่อเข้าถึงมัน เราเตอร์จะเลือก R2V เมื่อคุณแนบข้อมูลอ้างอิงในแผงอินพุต

ข้อมูลอ้างอิง: Wan 2.7 R2V (reference-to-video) เป็นโหมดที่รับภาพอ้างอิงได้สูงสุด 5 ภาพ, คลิปอ้างอิง 5 คลิป และเสียงอ้างอิง 1 เสียงในการเรียกใช้ API ครั้งเดียว, ส่งออก MP4 ที่ความละเอียดสูงสุด 1080P และ 10 วินาที และใช้สำหรับการรักษารูปลักษณ์, เสียง และสไตล์ในแต่ละช็อต (Alibaba Cloud Model Studio, 2026)

R2V รับอินพุตประเภทใดบ้าง?

R2V รับอินพุตสามประเภท และคุณสามารถผสมผสานกันได้ในการเรียกใช้ครั้งเดียว Alibaba Cloud video generation overview มีเอกสารเกี่ยวกับโครงสร้างอาร์เรย์อินพุต นี่คือรายละเอียดเชิงปฏิบัติว่าแต่ละช่องทำหน้าที่อะไรและสามารถส่งได้กี่รายการ

ช่องอินพุต จำนวนสูงสุด สิ่งที่นำมา จำเป็นหรือไม่?
ภาพอ้างอิง 5 ใบหน้า, ผลิตภัณฑ์, เครื่องแต่งกาย, การปรับสี อย่างน้อย 1 รายการจากอินพุตใดๆ
วิดีโออ้างอิง 5 สไตล์การเคลื่อนไหว, จังหวะเวลา, ความต่อเนื่องของฉาก ไม่บังคับ
เสียงอ้างอิง 1 โทนเสียง, จังหวะ, เสียงรอบข้าง ไม่บังคับ
พรอมต์ข้อความ 1 หัวข้อ, การกระทำ, กล้อง, สไตล์ จำเป็น

พรอมต์ข้อความจำเป็นเสมอ โมเดลใช้เป็นแกนหลักของการสร้าง จากนั้นจึงเพิ่มคุณลักษณะที่ได้จากข้อมูลอ้างอิงเข้าไป หากไม่มีพรอมต์ โมเดลจะไม่มีฉากที่จะเรนเดอร์และการเรียกใช้จะล้มเหลว

ข้อจำกัดบางประการที่ควรจำ วิดีโออ้างอิงแต่ละรายการจำกัดที่ 10 วินาที และระยะเวลาของผลลัพธ์จะไม่เกินวิดีโออ้างอิงที่สั้นที่สุดที่คุณส่ง เสียงอ้างอิงต้องเป็นไฟล์ WAV หรือ MP3 ที่สะอาด มีความยาว 5 ถึง 30 วินาที หากสั้นกว่านั้นจะถูกเติมให้เต็ม หากยาวกว่านั้นจะถูกตัดออก

การทำงานร่วมกันของช่องอินพุต

แต่ละช่องมีอิทธิพลต่อแกนเอาต์พุตที่แตกต่างกัน รูปภาพขับเคลื่อนรูปลักษณ์ วิดีโอขับเคลื่อนการเคลื่อนไหว เสียงขับเคลื่อนเสียงและการซิงค์ริมฝีปากเมื่อมีใบหน้าอยู่ เมื่อสองช่องขัดแย้งกัน (เช่น ภาพอ้างอิงของตัวละครผมบลอนด์จับคู่กับวิดีโออ้างอิงของตัวละครผมสีเข้ม) โมเดลจะเลือกหนึ่งและละเว้นอีกอัน และการเลือกนั้นไม่สามารถคาดเดาได้เสมอไป

ในการทดสอบของเรา ข้อมูลอ้างอิงที่ขัดแย้งกันทำให้เกิดการเลือกที่ไม่สอดคล้องกันในการรันซ้ำด้วย seed เดียวกัน ให้ถือว่าความขัดแย้งของข้อมูลอ้างอิงเป็นสิ่งที่ไม่สามารถกำหนดได้และกำจัดออกตั้งแต่ต้นทาง

คุณควรใช้ R2V เมื่อใด?

R2V เป็นตัวเลือกที่เหมาะสมเมื่อความต่อเนื่องในแต่ละช็อตมีความสำคัญมากกว่าความเร็ว เราใช้มันในสามสถานการณ์เฉพาะ

การรักษารูปลักษณ์ในฉากที่มีหลายช็อต หากคุณต้องการตัวละครเดียวกันในช็อตกว้าง, กลาง และโคลสอัพ R2V ที่มีภาพอ้างอิงที่แข็งแกร่งหนึ่งภาพต่อมุมจะช่วยให้โครงสร้างใบหน้าสอดคล้องกัน I2V จะสร้างใบหน้าใหม่ทุกครั้งและจะมีการเปลี่ยนแปลง

การโคลนเสียงเข้าสู่ฉากใหม่ เมื่อคุณมีเสียงพากย์ที่บันทึกไว้ซึ่งต้องตรงกับอวตารบนหน้าจอ R2V ที่มีเสียงอ้างอิงและภาพบุคคลอ้างอิงจะทำงานได้ดีกว่า I2V ที่ขับเคลื่อนด้วยเสียง โทนเสียงจะถูกถ่ายทอดไปและลิปซิงค์จะแสดงเป็นผู้พูดคนเดียวกัน

การรักษาสไตล์ต่อเนื่องระหว่างชิ้นงาน หากคุณได้ส่งคลิปหนึ่งไปแล้วและต้องการภาคต่อที่ตรงกับการปรับสี, เครื่องแต่งกาย และจังหวะ R2V โดยใช้คลิปแรกเป็นวิดีโออ้างอิงเป็นวิธีที่เร็วที่สุด Text-to-video ไม่สามารถสร้างรูปลักษณ์เฉพาะจากคำอธิบายเพียงอย่างเดียวได้

คุณควรหลีกเลี่ยง R2V เมื่อใด?

R2V เป็นการใช้เกินความจำเป็นสำหรับงานแบบช็อตเดียว หากคุณต้องการเพียงการหมุนผลิตภัณฑ์ครั้งเดียว โหมด I2V first-frame จะเร็วกว่าและถูกกว่า R2V ใช้เครดิตต่อวินาทีมากกว่า I2V เนื่องจากมีการประมวลผลการปรับสภาพข้อมูลอ้างอิง

ข้าม R2V เมื่อข้อมูลอ้างอิงของคุณมีคุณภาพต่ำ โมเดลไม่มีวิธี "ปรับปรุง" รูปภาพที่เบลอหรือคลิปเสียงที่มีเสียงรบกวน หลักการ "Garbage in, garbage out" ใช้ได้ผลอย่างยิ่งที่นี่มากกว่าที่อื่นใดใน Wan 2.7

ข้าม R2V สำหรับการเคลื่อนไหวที่เป็นนามธรรมโดยสิ้นเชิง Text-to-video สามารถจัดการเมฆ, อนุภาค และลำดับความฝันได้โดยไม่มีค่าใช้จ่ายเพิ่มเติมจากข้อมูลอ้างอิง

วิธีเตรียมข้อมูลอ้างอิง

คุณภาพของข้อมูลอ้างอิงเป็นตัวบ่งชี้ที่ใหญ่ที่สุดเพียงอย่างเดียวของคุณภาพผลลัพธ์ของ R2V ภาพอ้างอิง 1080P ที่สะอาดจะให้ผลลัพธ์ที่ดีกว่าภาพ 4K ที่ถูกบีบอัดสองครั้งผ่านแอปส่งข้อความ

ภาพอ้างอิง ใช้ภาพหลักที่แข็งแกร่งหนึ่งภาพเป็นจุดยึด หันหน้าตรง, แสงสม่ำเสมอ, พื้นหลังเป็นกลาง, ไม่มีวัตถุอื่นในเฟรม หากคุณต้องเพิ่มภาพ ให้ใช้ภาพมุมต่างๆ ของวัตถุเดียวกัน ไม่ใช่วัตถุที่แตกต่างกัน

วิดีโออ้างอิง ตัดให้เหลือเฉพาะการเคลื่อนไหวที่คุณต้องการให้โมเดลเรียนรู้ คลิป 3 วินาทีที่มีท่าทางชัดเจนหนึ่งท่าจะดีกว่าคลิป 10 วินาทีที่มีการกระทำผสมกัน ความละเอียดควรตรงกับผลลัพธ์ที่คุณต้องการ: 1080P เข้า, 1080P ออก

เสียงอ้างอิง ใช้เฉพาะการบันทึกระดับสตูดิโอเท่านั้น ลบเสียงรบกวนรอบข้าง, ปรับความดังให้เป็นประมาณ -16 LUFS และตัดส่วนที่เงียบจากต้นและท้าย การบันทึกจากโทรศัพท์จะให้คุณภาพการโคลนเสียงระดับโทรศัพท์

[ข้อมูลเชิงลึกพิเศษ] ความไม่ตรงกันของความละเอียดระหว่างข้อมูลอ้างอิงเป็นโหมดความล้มเหลวที่เงียบ หากภาพอ้างอิงของคุณเป็น 2160P และวิดีโออ้างอิงของคุณเป็น 720P โมเดลมีแนวโน้มที่จะรับแหล่งข้อมูลที่มีความละเอียดต่ำกว่าสำหรับการเคลื่อนไหว และแหล่งข้อมูลที่มีความละเอียดสูงกว่าสำหรับรายละเอียดภาพนิ่ง ทำให้เกิดคลิปที่ดูไม่สอดคล้องกันในแต่ละเฟรม ปรับลดขนาดทุกอย่างให้เป็นผลลัพธ์ที่คุณต้องการก่อนอัปโหลด

ตารางแสดงการรวมอินพุตที่ถูกต้องสำหรับ R2V พร้อมคอลัมน์ภาพอ้างอิง, วิดีโออ้างอิง และเสียงอ้างอิง

วิธีรวมข้อมูลอ้างอิงโดยไม่มีความขัดแย้ง

ขั้นตอนการทำงานสี่ขั้นตอนด้านล่างนี้คือสิ่งที่เราใช้ภายในองค์กร มันช่วยลดความล้มเหลวจากความขัดแย้งได้ประมาณ 80 เปอร์เซ็นต์ที่เราเคยพบเมื่อจัดเรียงข้อมูลอ้างอิงอย่างอิสระ

ขั้นตอนที่ 1: เตรียมข้อมูลอ้างอิง เลือกภาพหลักหนึ่งภาพ, ภาพสนับสนุนศูนย์ถึงสี่ภาพ, วิดีโออ้างอิงศูนย์ถึงสองรายการ และเสียงอ้างอิงศูนย์หรือหนึ่งรายการ ปรับข้อมูลอ้างอิงทั้งหมดให้มีอัตราส่วนภาพเดียวกันกับผลลัพธ์ที่คุณต้องการ

ขั้นตอนที่ 2: ตั้งค่า reference_voice ให้ถูกต้อง เมื่อคุณแนบเสียงอ้างอิง ให้ตั้งค่าพารามิเตอร์ reference_voice เป็น clone สำหรับการรักษาสภาพเสียง หรือ drive สำหรับการซิงค์ริมฝีปากเท่านั้น สองโหมดนี้ให้ผลลัพธ์ที่แตกต่างกันมากจากไฟล์เสียงเดียวกัน clone จะรักษาโทนเสียง, drive จะรักษาจังหวะเวลา

ขั้นตอนที่ 3: เขียนพรอมต์ อธิบายฉากที่คุณต้องการ ไม่ใช่ข้อมูลอ้างอิง ข้อมูลอ้างอิงเป็นการปรับสภาพ ไม่ใช่หัวข้อของพรอมต์ พรอมต์ที่ไม่ดี: "ให้คนนี้พูดเหมือนเสียง" พรอมต์ที่ดี: "ผู้หญิงอายุ 30 ปีในเสื้อแจ็คเก็ตสีเขียวพูดกับกล้องในห้องครัวที่มีแสงแดดส่องถึง, ช็อตระยะกลางใกล้, เลนส์ 50 มม."

ขั้นตอนที่ 4: เรนเดอร์และประเมินผล รันการทดสอบ 720P 3 วินาทีก่อน ตรวจสอบการรักษารูปลักษณ์ในเฟรมแรก, ความสอดคล้องของการเคลื่อนไหวในเฟรมที่สอง และการซิงค์เสียงในเฟรมที่สาม หลังจากนั้นจึงค่อยดำเนินการเรนเดอร์สุดท้าย 1080P 10 วินาที

การรวมกันที่ถูกต้องและมีความเสี่ยง

การรวมอินพุตบางอย่างมีความเสถียร บางอย่างมักจะสร้างสิ่งแปลกปลอม ตารางนี้มาจากผลการทดสอบ R2V ของเราเองจากการเรนเดอร์ประมาณ 200 ครั้งในเดือนมิถุนายนและกรกฎาคม 2026

การรวมกัน ความเสถียร หมายเหตุ
1 ภาพ + ข้อความ สูง ใกล้เคียงกับ I2V มากที่สุด, เส้นทาง R2V ที่เร็วที่สุด
1 ภาพ + 1 เสียง + ข้อความ สูง ดีที่สุดสำหรับการโคลนเสียงแบบ talking-head
1 ภาพ + 1 วิดีโอ + ข้อความ ปานกลาง ใช้ได้เมื่อวิดีโอแสดงตัวแบบเดียวกัน
1 ภาพ + 1 วิดีโอ + 1 เสียง + ข้อความ ปานกลาง การปรับสภาพสามเท่า, ระวังความขัดแย้ง
5 ภาพ + 5 วิดีโอ + 1 เสียง + ข้อความ ต่ำ อินพุตสูงสุด, ความเสี่ยงความขัดแย้งสูงสุด
0 ภาพ + 1 วิดีโอ + ข้อความ ต่ำ หากไม่มีภาพหลัก, รูปลักษณ์จะมีการเปลี่ยนแปลง

[ข้อมูลต้นฉบับ] ในชุดการทดสอบ 200 ครั้งของเรา การเรียกใช้ที่มีข้อมูลอ้างอิง 3 รายการหรือน้อยกว่าประสบความสำเร็จที่ 91 เปอร์เซ็นต์ ในขณะที่การเรียกใช้ที่มีข้อมูลอ้างอิง 8 รายการหรือมากกว่าประสบความสำเร็จที่ 54 เปอร์เซ็นต์ ความสำเร็จในที่นี้หมายถึงผลลัพธ์ตรงกับพรอมต์และรักษาสภาพคุณลักษณะอ้างอิงอย่างน้อยหนึ่งรายการได้อย่างสะอาด

ตัวอย่างการทำงาน: ฉากตัวละครหลายช็อต

เพื่อให้ขั้นตอนการทำงานเป็นรูปธรรม นี่คืองาน R2V จริงที่เราดำเนินการสำหรับการสาธิตภายใน ข้อกำหนดคือคลิป 1080P 6 วินาทีของตัวละครหญิงที่มีสไตล์กำลังเดินผ่านตรอกที่มีแสงนีออน จากนั้นหันหน้าเข้าหากล้อง

ข้อมูลอ้างอิงที่ใช้ ภาพบุคคลหลัก 1080P ของตัวละคร, หันหน้าตรง วิดีโออ้างอิง 5 วินาทีของการเดินที่คล้ายกันจากคลังภาพ ไม่มีเสียงอ้างอิง

พรอมต์ "ผู้หญิงผมสั้นสีแดงสวมแจ็คเก็ตสีเงินเดินลงตรอกที่มีแสงนีออนในเวลากลางคืน, ช็อตกว้างปานกลาง, ดอลลี่อินช้าๆ, เธอหันหน้าเข้าหากล้องตอนท้าย, แบบภาพยนตร์, แสงหลักอารมณ์, เงาสะท้อนบนพื้นเปียก"

การตั้งค่า โหมด R2V, 1080P, 6 วินาที, 16:9, seed 8421 ภาพบุคคลหลักเป็นจุดยึดใบหน้า วิดีโออ้างอิงเป็นจุดยึดจังหวะการเดิน

ผลลัพธ์ การเรนเดอร์ครั้งแรกสามารถรักษารูปลักษณ์ได้อย่างสะอาดจนถึงเฟรมที่ 4 จาก 6 จากนั้นมีการเปลี่ยนแปลงเล็กน้อยเมื่อหัน เราได้เพิ่มภาพสนับสนุนหนึ่งภาพของตัวละครเดียวกันในมุมมองสามในสี่ด้านหลัง, เรนเดอร์ใหม่ และการหันก็คงที่ การประมวลผลทั้งหมด: สามครั้ง, สองครั้งที่ 720P สำหรับการทดสอบ และหนึ่งครั้งที่ 1080P สำหรับขั้นสุดท้าย

บทเรียน: เริ่มต้นให้น้อยที่สุด, เพิ่มข้อมูลอ้างอิงเฉพาะเมื่อคุณพบข้อผิดพลาดที่เฉพาะเจาะจง การเพิ่มข้อมูลอ้างอิงล่วงหน้าเป็นข้อผิดพลาดที่พบบ่อยที่สุดของ R2V

โหมดความล้มเหลวทั่วไป

R2V ล้มเหลวในลักษณะที่คาดเดาได้ การระบุชื่อล่วงหน้าช่วยประหยัดเครดิต

ความขัดแย้งของข้อมูลอ้างอิง ข้อมูลอ้างอิงสองรายการที่อธิบายหัวข้อ, แสง หรือการเคลื่อนไหวที่แตกต่างกัน โมเดลจะเลือกหนึ่งรายการแบบสุ่มต่อเฟรม ทำให้เกิดการกระพริบ แก้ไขโดยลดเหลือข้อมูลอ้างอิงหนึ่งรายการต่อประเภทคุณลักษณะ

ความไม่ตรงกันของคุณภาพข้อมูลอ้างอิง ภาพที่คมชัดจับคู่กับวิดีโอที่ถูกบีบอัด โมเดลจะรับสิ่งแปลกปลอมจากแหล่งที่อ่อนแอกว่า แก้ไขโดยการปรับข้อมูลอ้างอิงทั้งหมดให้มีคุณภาพเดียวกัน

ความไม่ตรงกันระหว่างพรอมต์และข้อมูลอ้างอิง พรอมต์ที่อธิบายชายหาดที่มีแดดจ้าจับคู่กับวิดีโออ้างอิงของพายุหิมะ โมเดลจะทำตามพรอมต์และละเว้นข้อมูลอ้างอิง ทำให้เสียการปรับสภาพข้อมูลอ้างอิง แก้ไขโดยการปรับโทนของพรอมต์ให้เข้ากับโทนของข้อมูลอ้างอิง

เสียงไม่ซิงค์ เสียงอ้างอิงยาวกว่าระยะเวลาของผลลัพธ์ หรือเสียงที่มีความเงียบนำหน้ายาวนาน ลิปซิงค์จะมีการเปลี่ยนแปลง แก้ไขโดยการตัดเสียงให้มีความยาวเท่ากับผลลัพธ์พอดี โดยให้เสียงแรกเริ่มต้นที่ 0.0 วินาที

การเปลี่ยนแปลงรูปลักษณ์เมื่อหมุน ใบหน้าจะบิดเบี้ยวเมื่อตัวแบบหมุนเกิน 45 องศาจากมุมอ้างอิง แก้ไขโดยการเพิ่มภาพอ้างอิงสนับสนุนที่มุมเป้าหมายก่อนที่จะเรนเดอร์ใหม่

คำถามที่พบบ่อยเกี่ยวกับ Wan 2.7 R2V

ฉันสามารถส่งข้อมูลอ้างอิงได้กี่รายการไปยัง Wan 2.7 R2V?

สูงสุด 5 ภาพอ้างอิง, 5 คลิปอ้างอิง และ 1 เสียงอ้างอิงในการเรียกใช้ครั้งเดียว ตาม Alibaba Cloud R2V API reference พรอมต์ข้อความจำเป็นเสมอ การอ้างอิงที่มากขึ้นจะเพิ่มความเสี่ยงของความขัดแย้ง ดังนั้นเราแนะนำให้เริ่มต้นด้วยภาพเดียวและเพิ่มเฉพาะเมื่อจำเป็น

R2V รองรับเอาต์พุต 1080P หรือไม่?

ใช่ ผลลัพธ์ของ R2V สูงสุดที่ 1080P และ 10 วินาที ความละเอียดต้องตรงกับข้อมูลอ้างอิงที่มีความละเอียดต่ำที่สุดของคุณ มิฉะนั้นโมเดลจะรับสิ่งแปลกปลอมจากแหล่งที่อ่อนแอที่สุด

R2V สามารถโคลนเสียงใดก็ได้หรือไม่?

R2V สามารถโคลนเสียงจากไฟล์เสียงอ้างอิงที่สะอาดความยาว 5 ถึง 30 วินาที นโยบายของ PixMind ห้ามการโคลนบุคคลจริงที่สามารถระบุตัวตนได้โดยไม่ได้รับความยินยอม ใช้การโคลนเสียง R2V กับตัวละครต้นฉบับ, เสียงของคุณเอง หรือเสียงอ้างอิงที่ได้รับอนุญาต

R2V แตกต่างจาก audio-driven I2V อย่างไร?

Audio-driven I2V ใช้เสียงเพื่อขับเคลื่อนการเคลื่อนไหวและการซิงค์ริมฝีปากบนภาพอินพุตเดียวเท่านั้น R2V รับเมทริกซ์อินพุตหลายโมดอลที่กว้างกว่า รวมถึงวิดีโออ้างอิงและภาพหลายภาพ และสามารถโคลนโทนเสียงได้แทนที่จะซิงค์แค่จังหวะเวลา R2V เป็นตัวเลือกที่แข็งแกร่งกว่าเมื่อทั้งรูปลักษณ์และเสียงจำเป็นต้องคงอยู่ตลอดทั้งช็อต

ฉันควรหลีกเลี่ยง R2V เมื่อใด?

หลีกเลี่ยง R2V สำหรับ B-roll แบบช็อตเดียว, การเคลื่อนไหวที่เป็นนามธรรม, การหมุนผลิตภัณฑ์แบบง่ายๆ หรือกรณีใดๆ ที่คุณไม่มีข้อกำหนดด้านความต่อเนื่อง R2V ใช้เครดิตต่อวินาทีมากกว่า I2V และ T2V เนื่องจากมีการประมวลผลการปรับสภาพข้อมูลอ้างอิง และการปรับสภาพเพิ่มเติมนี้จะส่งผลเสียหากข้อมูลอ้างอิงไม่ได้เพิ่มสัญญาณที่เป็นประโยชน์

ดูการทำงานจริง

继续浏览中,生成器即将加载...

บทความที่เกี่ยวข้อง

Wan 2.7 Video Generator: คู่มือฉบับสมบูรณ์สำหรับวิดีโอจากข้อความ รูปภาพ และวิดีโออ้างอิง

Wan 2.7 Video Generator: คู่มือฉบับสมบูรณ์สำหรับวิดีโอจากข้อความ รูปภาพ และวิดีโออ้างอิง

Wan 2.7 สร้างวิดีโอ 1080P จากข้อความ รูปภาพ เฟรมเริ่มต้น สุดท้าย และคลิปอ้างอิงพร้อมเสียงในเวิร์กโฟลว์เดียว นี่คือวิธีการทำงานของแต่ละโหมดและเวลาที่ควรใช้แต่ละโหมด

อ่านเพิ่มเติม

คู่มือการผสานรวม API ของ Wan 2.7: คำอธิบายปลายทาง T2V, I2V และ R2V

คู่มือการผสานรวม API ของ Wan 2.7: คำอธิบายปลายทาง T2V, I2V และ R2V

บทช่วยสอนสำหรับนักพัฒนาสำหรับการผสานรวม API การสร้างวิดีโอ Wan 2.7 ซึ่งครอบคลุม T2V, I2V เฟรมแรก, เฟรมแรก สุดท้าย, ขับเคลื่อนด้วยเสียง และ R2V แบบหลายโมดอล รวมถึงตัวอย่าง cURL…

อ่านเพิ่มเติม

วิดีโออวตารที่ขับเคลื่อนด้วยเสียงด้วย Wan 2.7: เวิร์กโฟลว์วิดีโอแบบ Talking-Head

วิดีโออวตารที่ขับเคลื่อนด้วยเสียงด้วย Wan 2.7: เวิร์กโฟลว์วิดีโอแบบ Talking-Head

โหมดขับเคลื่อนด้วยเสียง I2V ของ Wan 2.7 เปลี่ยนภาพบุคคลนิ่งๆ และเสียงบรรยายที่ชัดเจนให้เป็นวิดีโอ Talking Head ที่ลิปซิงค์กัน นี่คือเวิร์กโฟลว์ 6 ขั้นตอนพร้อมการเตรียมภาพบุคคล…

อ่านเพิ่มเติม