Wan 2.7 R2V: Panduan Pembuatan Video Referensi Multimodal
Poin-Poin Penting
- Wan 2.7 reference-to-video (R2V) menerima hingga 5 gambar referensi, 5 klip referensi, dan 1 audio referensi dalam satu panggilan, matriks input multimodal terluas di antara model 1080P saat ini.
- R2V adalah mode yang tepat untuk pelestarian identitas, kloning suara, dan kelanjutan gaya di seluruh bidikan, bukan untuk B-roll sekali pakai atau putaran produk sederhana.
- Konflik referensi adalah penyebab kegagalan utama, dan sebagian besar dapat dicegah dengan mengikuti alur kerja empat langkah: siapkan-atur-tulis-render.
- Untuk pustaka prompt yang lebih mendalam terkait mode ini, lihat klaster prompt video referensi PixMind.
Apa Itu Wan 2.7 R2V?
R2V adalah singkatan dari reference-to-video, sebuah mode Wan 2.7 yang mengambil input referensi campuran dan menghasilkan klip baru yang mempertahankan identitas, suara, atau gaya dari input tersebut. Menurut referensi API Wan 2.7 R2V di Alibaba Cloud, satu panggilan R2V menerima hingga 5 gambar referensi, 5 klip referensi, dan 1 trek audio referensi, dengan output dibatasi pada 1080P dan 10 detik.
Yang membedakan R2V dari image-to-video adalah pengkondisian multimodal. I2V mengunci bingkai awal dan membiarkan model menciptakan gerakan. R2V justru mengekstrak atribut dari referensi Anda, seperti struktur wajah, pakaian, timbre suara, gradasi warna, dan menyebarkannya ke dalam generasi baru. Inilah mengapa kami memperlakukan R2V sebagai alur kerja yang berbeda, bukan I2V yang lebih mewah.
R2V berada di dalam antarmuka generator video Wan 2.7 terpadu di PixMind. Anda tidak perlu mengganti model untuk mencapainya. Router memilih R2V saat Anda melampirkan referensi di panel input.
Kapsul Kutipan: Wan 2.7 R2V (reference-to-video) adalah mode yang menerima hingga 5 gambar referensi, 5 klip referensi, dan 1 audio referensi dalam satu panggilan API, menghasilkan MP4 hingga 1080P dan 10 detik, dan digunakan untuk pelestarian identitas, suara, dan gaya di seluruh bidikan (Alibaba Cloud Model Studio, 2026).
Input Apa Saja yang Diterima R2V?
R2V mengambil tiga kelas input, dan Anda dapat mencampurnya dalam panggilan yang sama. Ikhtisar pembuatan video Alibaba Cloud mendokumentasikan skema array input. Berikut adalah rincian praktis tentang fungsi setiap slot dan berapa banyak yang dapat Anda berikan.
| Slot Input | Jumlah Maks | Apa yang Dibawa | Wajib? |
|---|---|---|---|
| Gambar referensi | 5 | Wajah, produk, pakaian, gradasi warna | Setidaknya 1 dari input apa pun |
| Video referensi | 5 | Gaya gerakan, waktu, kontinuitas adegan | Opsional |
| Audio referensi | 1 | Timbre suara, irama, suara sekitar | Opsional |
| Prompt teks | 1 | Subjek, aksi, kamera, gaya | Wajib |
Prompt teks selalu wajib. Model menggunakannya sebagai tulang punggung generasi, lalu melapisi atribut yang berasal dari referensi di atasnya. Tanpa prompt, model tidak memiliki adegan untuk dirender dan panggilan akan gagal.
Beberapa batasan yang perlu diingat. Video referensi dibatasi masing-masing 10 detik, dan durasi output tidak pernah melebihi video referensi terpendek yang Anda berikan. Audio referensi harus berupa WAV atau MP3 yang bersih berdurasi 5 hingga 30 detik, yang lebih pendek akan diisi, yang lebih panjang akan dipotong.
Interaksi slot input
Setiap slot memengaruhi sumbu output yang berbeda. Gambar mendorong penampilan. Video mendorong gerakan. Audio mendorong suara dan sinkronisasi bibir saat ada wajah. Ketika dua slot berkonflik (misalnya, gambar referensi subjek berambut pirang dipasangkan dengan video referensi subjek berambut gelap), model memilih salah satu dan mengabaikan yang lain, dan pilihannya tidak selalu dapat diprediksi.
Dalam pengujian kami, referensi yang berkonflik menghasilkan pilihan yang tidak konsisten di seluruh pengulangan dengan seed yang sama. Perlakukan konflik referensi sebagai nondeterministik dan hilangkan di sumbernya.
Kapan Seharusnya Anda Menggunakan R2V?
R2V adalah pilihan yang tepat ketika kontinuitas antar bidikan lebih penting daripada kecepatan mentah. Kami menggunakannya dalam tiga situasi spesifik.
Pelestarian identitas di seluruh adegan multi-bidikan. Jika Anda membutuhkan karakter yang sama dalam bidikan lebar, sedang, dan close-up, R2V dengan satu gambar referensi kuat per sudut menjaga struktur wajah tetap konsisten. I2V meregenerasi wajah setiap kali dan cenderung melayang.
Kloning suara ke adegan baru. Ketika Anda memiliki sulih suara yang direkam yang harus cocok dengan avatar di layar, R2V dengan audio referensi ditambah potret referensi mengungguli I2V yang digerakkan audio. Timbre suara terbawa dan sinkronisasi bibir terbaca sebagai pembicara yang sama.
Kelanjutan gaya antar aset. Jika Anda sudah merilis satu klip dan membutuhkan sekuel yang cocok dengan gradasi warna, pakaian, dan kecepatan, R2V dengan klip pertama sebagai video referensi adalah jalur tercepat. Text-to-video tidak dapat mereproduksi tampilan spesifik dari deskripsi saja.
Kapan Anda Harus Menghindari R2V?
R2V berlebihan untuk pekerjaan satu bidikan. Jika Anda hanya membutuhkan satu putaran produk, mode I2V bingkai pertama lebih cepat dan lebih murah. R2V mengonsumsi lebih banyak kredit per detik daripada I2V karena proses pengkondisian referensi.
Lewati R2V ketika referensi Anda berkualitas rendah. Model tidak memiliki cara untuk "memperbaiki" foto buram atau klip audio yang bising. "Sampah masuk, sampah keluar" berlaku lebih keras di sini daripada di tempat lain di antarmuka Wan 2.7.
Lewati R2V untuk gerakan yang murni abstrak. Text-to-video menangani awan, partikel, dan urutan mimpi tanpa overhead referensi.
Cara Menyiapkan Aset Referensi
Kualitas referensi adalah prediktor terbesar tunggal dari kualitas output R2V. Gambar referensi 1080P yang bersih mengungguli gambar 4K yang telah dikompresi dua kali melalui aplikasi perpesanan.
Gambar referensi. Gunakan satu gambar pahlawan yang kuat sebagai jangkar Anda. Menghadap depan, pencahayaan merata, latar belakang netral, tidak ada subjek lain dalam bingkai. Jika Anda harus menambahkan lebih banyak, jadikan itu variasi sudut dari subjek yang sama, bukan subjek yang berbeda.
Video referensi. Pangkas ke gerakan persis yang Anda ingin model pelajari. Klip 3 detik dengan satu gerakan yang jelas mengalahkan klip 10 detik dengan tindakan campuran. Resolusi harus sesuai dengan output target Anda: 1080P masuk, 1080P keluar.
Audio referensi. Hanya rekaman berkualitas studio. Hapus kebisingan latar belakang, normalisasi kenyaringan hingga sekitar -16 LUFS, dan pangkas keheningan dari awal dan akhir. Rekaman telepon menghasilkan kloning suara berkualitas telepon.
[WAWASAN UNIK] Ketidakcocokan resolusi antara referensi adalah mode kegagalan yang tidak terlihat. Jika gambar referensi Anda 2160P dan video referensi Anda 720P, model cenderung mewarisi sumber dengan fidelitas lebih rendah untuk gerakan dan sumber dengan fidelitas lebih tinggi untuk detail diam, menghasilkan klip yang terlihat tidak konsisten di seluruh bingkai. Skalakan semua ke output target Anda sebelum mengunggah.

Cara Menggabungkan Referensi Tanpa Konflik
Alur kerja empat langkah di bawah ini adalah yang kami jalankan secara internal. Ini menghilangkan sekitar 80 persen kegagalan konflik yang biasa kami lihat saat menumpuk referensi secara bebas.
Langkah 1: siapkan referensi. Pilih satu gambar jangkar, nol hingga empat gambar pendukung, nol hingga dua video referensi, dan nol atau satu audio referensi. Normalisasi semua referensi ke rasio aspek yang sama dengan output target Anda.
Langkah 2: atur reference_voice dengan benar. Saat Anda melampirkan audio referensi, atur parameter reference_voice ke clone untuk pelestarian suara atau drive hanya untuk sinkronisasi bibir. Kedua mode menghasilkan output yang sangat berbeda dari file audio yang sama. Klon membawa timbre, drive membawa waktu.
Langkah 3: tulis prompt. Jelaskan adegan yang Anda inginkan, bukan referensinya. Referensi adalah pengkondisian, bukan subjek prompt. Prompt buruk: "buat orang ini berbicara seperti audio." Prompt bagus: "seorang wanita berusia 30 tahun dengan jaket hijau berbicara ke kamera di dapur yang diterangi matahari, close-up sedang, lensa 50mm."
Langkah 4: render dan evaluasi. Jalankan tes 720P 3 detik terlebih dahulu. Periksa pelestarian identitas di bingkai pertama, koherensi gerakan di bingkai kedua, dan sinkronisasi audio di bingkai ketiga. Baru kemudian berkomitmen pada final 1080P 10 detik.
Kombinasi yang Valid dan Berisiko
Beberapa kombinasi input stabil. Yang lain secara teratur menghasilkan artefak. Matriks ini diambil dari pengujian R2V kami sendiri di sekitar 200 render pada bulan Juni dan Juli 2026.
| Kombinasi | Stabilitas | Catatan |
|---|---|---|
| 1 gambar + teks | Tinggi | Paling dekat dengan I2V, jalur R2V tercepat |
| 1 gambar + 1 audio + teks | Tinggi | Terbaik untuk kloning suara talking-head |
| 1 gambar + 1 video + teks | Sedang | Berfungsi ketika video menunjukkan subjek yang sama |
| 1 gambar + 1 video + 1 audio + teks | Sedang | Pengkondisian tiga kali lipat, perhatikan konflik |
| 5 gambar + 5 video + 1 audio + teks | Rendah | Input maksimum, risiko konflik maksimum |
| 0 gambar + 1 video + teks | Rendah | Tanpa jangkar gambar, identitas melayang |
[DATA ASLI] Di seluruh set pengujian 200 render kami, panggilan dengan 3 referensi atau kurang berhasil pada 91 persen, sementara panggilan dengan 8 referensi atau lebih berhasil pada 54 persen. Keberhasilan di sini berarti output cocok dengan prompt dan mempertahankan setidaknya satu atribut referensi dengan bersih.
Contoh Terapan: Adegan Karakter Multi-Bidikan
Untuk membuat alur kerja lebih konkret, berikut adalah pekerjaan R2V nyata yang kami jalankan untuk demo internal. Briefnya adalah klip 1080P berdurasi 6 detik dari karakter wanita bergaya yang berjalan melalui gang yang diterangi neon, lalu berbalik ke kamera.
Referensi yang digunakan. Satu potret pahlawan 1080P karakter, menghadap depan. Satu video referensi 5 detik dari siklus berjalan serupa dari perpustakaan stok. Tidak ada audio referensi.
Prompt. "Seorang wanita dengan rambut merah pendek dan jaket perak berjalan menyusuri gang yang diterangi neon di malam hari, bidikan medium-wide, dolly-in lambat, dia berbalik ke kamera di akhir, sinematik, cahaya kunci yang murung, pantulan trotoar basah."
Pengaturan. Mode R2V, 1080P, 6 detik, 16:9, seed 8421. Potret pahlawan menjadi jangkar wajah. Video referensi menjadi jangkar waktu berjalan.
Hasil. Render pertama mempertahankan identitas dengan bersih hingga bingkai 4 dari 6, lalu sedikit melayang pada belokan. Kami menambahkan satu gambar pendukung karakter yang sama dalam tampilan belakang tiga perempat, dirender ulang, dan belokan tetap stabil. Total komputasi: tiga render, dua pada 720P untuk pengujian dan satu pada 1080P untuk final.
Pelajaran: mulailah dengan minimal, tambahkan referensi hanya ketika Anda melihat kegagalan spesifik. Menambahkan referensi secara preemptif adalah kesalahan R2V yang paling umum.
Mode Kegagalan Umum
R2V gagal dengan cara yang dapat diprediksi. Menyebutkannya di awal menghemat kredit.
Konflik referensi. Dua referensi yang menggambarkan subjek, pencahayaan, atau gerakan yang berbeda. Model memilih satu secara random per bingkai, menghasilkan kedipan. Perbaiki dengan mengurangi menjadi satu referensi per kelas atribut.
Ketidakcocokan kualitas referensi. Gambar tajam dipasangkan dengan video terkompresi. Model mewarisi artefak dari sumber yang lebih lemah. Perbaiki dengan menormalisasi semua referensi ke fidelitas yang sama.
Ketidakcocokan prompt-referensi. Prompt yang menggambarkan pantai cerah dipasangkan dengan video referensi badai salju. Model mematuhi prompt dan mengabaikan referensi, menyia-nyiakan pengkondisian referensi. Perbaiki dengan menyelaraskan nada prompt dengan nada referensi.
Desinkronisasi audio. Audio referensi lebih panjang dari durasi output, atau audio dengan keheningan awal yang panjang. Sinkronisasi bibir melayang. Perbaiki dengan memangkas audio persis ke panjang output, dengan fonem pertama pada 0,0 detik.
Pergeseran identitas pada belokan. Wajah melengkung ketika subjek berputar melewati 45 derajat dari sudut referensi. Perbaiki dengan menambahkan gambar referensi pendukung pada sudut target sebelum merender ulang.
FAQ Wan 2.7 R2V
Berapa banyak referensi yang bisa saya berikan ke Wan 2.7 R2V?
Hingga 5 gambar referensi, 5 klip referensi, dan 1 audio referensi dalam satu panggilan, sesuai referensi API R2V Alibaba Cloud. Prompt teks selalu wajib. Lebih banyak referensi meningkatkan risiko konflik, jadi kami merekomendasikan untuk memulai dengan satu gambar dan menambahkan hanya jika diperlukan.
Apakah R2V mendukung output 1080P?
Ya. Output R2V dibatasi pada 1080P dan 10 detik. Resolusi harus cocok dengan referensi resolusi terendah Anda; jika tidak, model akan mewarisi artefak dari sumber terlemah.
Bisakah R2V mengkloning suara apa pun?
R2V dapat mengkloning suara dari audio referensi bersih berdurasi 5 hingga 30 detik. Kebijakan PixMind melarang kloning non-konsensual terhadap orang sungguhan yang dapat diidentifikasi. Gunakan kloning suara R2V dengan karakter asli, suara Anda sendiri, atau audio referensi berlisensi.
Bagaimana R2V berbeda dari I2V yang digerakkan audio?
I2V yang digerakkan audio hanya menggunakan audio untuk menggerakkan gerakan dan sinkronisasi bibir pada satu gambar input. R2V menerima matriks input multimodal yang lebih luas, termasuk video referensi dan beberapa gambar, dan dapat mengkloning timbre suara daripada hanya waktu sinkronisasi. R2V adalah pilihan yang lebih kuat ketika identitas dan suara keduanya perlu dibawa di seluruh bidikan.
Kapan saya harus menghindari R2V?
Hindari R2V untuk B-roll satu bidikan, gerakan abstrak, putaran produk sederhana, atau kasus apa pun di mana Anda tidak memiliki persyaratan kontinuitas. R2V membutuhkan lebih banyak kredit per detik daripada I2V dan T2V karena proses pengkondisian referensi, dan pengkondisian tambahan ini merugikan jika referensi tidak menambahkan sinyal yang berguna.
Saksikan Aksinya
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



