Wan 2.7 R2V: Çok Modlu Referans Video Oluşturma Rehberi
Temel Çıkarımlar
- Wan 2.7 referanstan videoya (R2V), mevcut 1080P modelleri arasında en geniş çok modlu girdi matrisi olarak, tek bir çağrıda 5 adede kadar referans görsel, 5 adede kadar referans klip ve 1 referans ses kabul eder.
- R2V, tek seferlik B-roll veya basit ürün döndürmeleri için değil, çekimler arasında kimlik koruma, ses klonlama ve stil devamlılığı için doğru moddur.
- Referans çakışmaları en büyük hata nedenidir ve çoğu, dört adımlı bir hazırlama-ayarlama-yazma-oluşturma iş akışı izlenerek önlenebilir.
- Bu moda bağlı daha kapsamlı bir istem kütüphanesi için PixMind reference-video prompts cluster bölümüne bakın.
Wan 2.7 R2V Nedir?
R2V, referanstan videoya anlamına gelir; Wan 2.7'nin karma referans girdileri alarak bu girdilerden kimliği, sesi veya stili koruyan yeni bir klip üreten bir modudur. Alibaba Cloud üzerindeki Wan 2.7 R2V API referansına göre, tek bir R2V çağrısı 5 adede kadar referans görsel, 5 adede kadar referans klip ve 1 referans ses parçası kabul eder ve çıktı 1080P ve 10 saniye ile sınırlıdır.
R2V'yi görüntüden videoya (I2V) ayıran şey çok modlu koşullandırmadır. I2V başlangıç karesini kilitler ve modelin hareketi icat etmesine izin verir. R2V ise referanslarınızdan yüz yapısı, gardırop, ses tınısı, renk derecesi gibi özellikleri çıkarır ve bunları yeni bir üretime yayar. Bu nedenle R2V'yi daha süslü bir I2V değil, farklı bir iş akışı olarak ele alıyoruz.
R2V, PixMind üzerindeki birleşik Wan 2.7 video oluşturucu arayüzünde yer alır. Ona ulaşmak için modelleri değiştirmezsiniz. Giriş panelinde referansları eklediğinizde yönlendirici R2V'yi seçer.
Alıntı özeti: Wan 2.7 R2V (referanstan videoya), tek bir API çağrısında 5 adede kadar referans görsel, 5 adede kadar referans klip ve 1 referans ses kabul eden, 1080P ve 10 saniyeye kadar MP4 çıktı veren ve çekimler arasında kimlik, ses ve stil koruması için kullanılan bir moddur (Alibaba Cloud Model Studio, 2026).
R2V Hangi Girdileri Kabul Eder?
R2V üç girdi sınıfı alır ve bunları aynı çağrıda karıştırabilirsiniz. Alibaba Cloud video oluşturma genel bakışı girdi dizisi şemasını belgeler. Her bir yuvanın ne işe yaradığının ve kaç tane geçirebileceğinizin pratik dökümü aşağıdadır.
| Giriş Yuvası | Maks. Sayı | Ne Taşır | Gerekli mi? |
|---|---|---|---|
| Referans görsel | 5 | Yüz, ürün, gardırop, renk derecesi | Herhangi bir girdiden en az 1 tane |
| Referans video | 5 | Hareket stili, zamanlama, sahne devamlılığı | İsteğe bağlı |
| Referans ses | 1 | Ses tınısı, ritim, ortam sesi | İsteğe bağlı |
| Metin istemi | 1 | Konu, eylem, kamera, stil | Gerekli |
Metin istemi her zaman gereklidir. Model bunu üretimin omurgası olarak kullanır, ardından referanstan türetilmiş özellikleri üzerine katmanlar. Bir istem olmadan, modelin oluşturacak bir sahnesi olmaz ve çağrı başarısız olur.
Ezberlemeye değer birkaç kısıtlama. Referans videoların her biri 10 saniye ile sınırlıdır ve çıktı süresi, geçirdiğiniz en kısa referans videoyu asla aşmaz. Referans ses, 5 ila 30 saniyelik temiz bir WAV veya MP3 olmalıdır; daha kısa olanlar doldurulur, daha uzun olanlar kesilir.
Giriş yuvası etkileşimleri
Her yuva farklı bir çıktı eksenini etkiler. Görseller görünümü yönlendirir. Videolar hareketi yönlendirir. Ses, bir yüz mevcut olduğunda sesi ve dudak senkronizasyonunu yönlendirir. İki yuva çakıştığında (örneğin, sarışın bir konunun referans görseli ile koyu saçlı bir konunun referans videosu eşleştirildiğinde), model birini seçer ve diğerini göz ardı eder ve bu seçim her zaman tahmin edilebilir değildir.
Testlerimizde, çakışan referanslar aynı tohumla yapılan tekrarlanan çalıştırmalarda tutarsız seçimler üretir. Referans çakışmalarını deterministik olmayan olarak kabul edin ve bunları kaynaktan kaldırın.
R2V'yi Ne Zaman Kullanmalısınız?
R2V, çekimler arasında devamlılığın ham hızdan daha önemli olduğu durumlarda doğru seçimdir. Üç özel durumda ona başvururuz.
Çoklu çekim sahnelerinde kimlik koruma. Aynı karakteri geniş, orta ve yakın çekimde istiyorsanız, her açı için güçlü bir referans görseli olan R2V yüz yapısını tutarlı tutar. I2V her seferinde yüzü yeniden oluşturur ve kaymalar yaşanır.
Yeni bir sahneye ses klonlama. Ekrandaki bir avatara uyması gereken kaydedilmiş bir seslendirmeye sahip olduğunuzda, referans ses ve referans portre içeren R2V, ses odaklı I2V'den daha iyi performans gösterir. Ses tınısı aktarılır ve dudak senkronizasyonu aynı konuşmacı olarak okunur.
Varlıklar arasında stil devamlılığı. Zaten bir klip yayınladıysanız ve renk derecesi, gardırop ve tempoya uyan bir devam filmi istiyorsanız, ilk klibi referans video olarak kullanan R2V en hızlı yoldur. Metinden videoya, yalnızca bir açıklamadan belirli bir görünümü yeniden üretemez.
R2V'den ne zaman kaçınmalısınız?
R2V, tek çekimlik işler için aşırıdır. Yalnızca tek bir ürün döndürmeye ihtiyacınız varsa, I2V ilk kare modu daha hızlı ve daha ucuzdur. R2V, referans koşullandırma geçişi nedeniyle I2V'den saniye başına daha fazla kredi tüketir.
Referanslarınız düşük kalitede olduğunda R2V'yi atlayın. Modelin bulanık bir fotoğrafı veya gürültülü bir ses klibini "iyileştirme" yolu yoktur. Çöp girdi, çöp çıktı kuralı, Wan 2.7 arayüzündeki diğer her yerden daha sert bir şekilde burada geçerlidir.
Tamamen soyut hareketler için R2V'yi atlayın. Metinden videoya, referans yükü olmadan bulutları, parçacıkları ve rüya dizilerini işler.
Referans Varlıkları Nasıl Hazırlanır?
Referans kalitesi, R2V çıktı kalitesinin en büyük tek belirleyicisidir. Temiz bir 1080P referans görseli, mesajlaşma uygulamaları aracılığıyla iki kez sıkıştırılmış 4K bir görselden daha iyi performans gösterir.
Referans görseller. Çapanız olarak güçlü bir kahraman görseli kullanın. Öne dönük, eşit aydınlatma, nötr arka plan, karede başka konu yok. Daha fazla eklemeniz gerekiyorsa, bunları farklı konular değil, aynı konunun açı varyasyonları yapın.
Referans videolar. Modelin öğrenmesini istediğiniz tam harekete göre kırpın. Tek bir net jest içeren 3 saniyelik bir klip, karışık eylemler içeren 10 saniyelik bir klibi yener. Çözünürlük hedef çıktınızla eşleşmelidir: 1080P girdi, 1080P çıktı.
Referans ses. Yalnızca stüdyo kalitesinde kayıtlar. Arka plan gürültüsünü giderin, ses yüksekliğini yaklaşık -16 LUFS'ye normalleştirin ve başından ve sonundan sessizlikleri kırpın. Telefon kayıtları, telefon kalitesinde ses klonlama üretir.
[BENZERSİZ BİLGİ] Referanslar arasındaki çözünürlük uyumsuzluğu, sessiz bir hata modudur. Referans görseliniz 2160P ve referans videonuz 720P ise, model hareket için daha düşük kaliteli kaynağı ve durağan detay için daha yüksek kaliteli kaynağı miras alma eğilimindedir, bu da kareler arasında tutarsız görünen bir klip üretir. Yüklemeden önce her şeyi hedef çıktınıza göre küçültün.

Referansları Çakışma Olmadan Nasıl Birleştirirsiniz?
Aşağıdaki dört adımlı iş akışı, dahili olarak uyguladığımız yöntemdir. Referansları serbestçe istiflerken gördüğümüz çakışma hatalarının yaklaşık yüzde 80'ini ortadan kaldırır.
Adım 1: referansları hazırlayın. Bir çapa görseli, sıfırdan dörde kadar destekleyici görsel, sıfırdan ikiye kadar referans video ve sıfır veya bir referans ses seçin. Tüm referansları hedef çıktınızla aynı en boy oranına normalleştirin.
Adım 2: reference_voice'ı doğru ayarlayın. Bir referans ses eklediğinizde, ses koruması için reference_voice parametresini clone olarak veya yalnızca dudak senkronizasyonu için drive olarak ayarlayın. İki mod, aynı ses dosyasından çok farklı çıktılar üretir. Klon tınıyı taşır, sürücü zamanlamayı taşır.
Adım 3: istemi yazın. Referansları değil, istediğiniz sahneyi tanımlayın. Referanslar koşullandırmadır, istemin konusu değildir. Kötü istem: "bu kişiyi ses gibi konuştur." İyi istem: "yeşil ceketli 30 yaşında bir kadın, güneşli bir mutfakta kameraya konuşuyor, orta yakın çekim, 50mm lens."
Adım 4: oluşturun ve değerlendirin. Önce 3 saniyelik 720P bir test çalıştırın. İlk karede kimlik korumasını, ikincide hareket tutarlılığını ve üçüncüde ses senkronizasyonunu kontrol edin. Ancak o zaman 10 saniyelik 1080P finale geçin.
Geçerli ve riskli kombinasyonlar
Bazı girdi kombinasyonları kararlıdır. Diğerleri düzenli olarak artefaktlar üretir. Bu matris, Haziran ve Temmuz 2026'da yaklaşık 200 oluşturma üzerinden kendi R2V testlerimizden alınmıştır.
| Kombinasyon | Kararlılık | Notlar |
|---िजन|---|---|
| 1 görsel + metin | Yüksek | I2V'ye en yakın, en hızlı R2V yolu |
| 1 görsel + 1 ses + metin | Yüksek | Konuşan kafa ses klonlama için en iyisi |
| 1 görsel + 1 video + metin | Orta | Video aynı konuyu gösterdiğinde çalışır |
| 1 görsel + 1 video + 1 ses + metin | Orta | Üçlü koşullandırma, çakışmalara dikkat edin |
| 5 görsel + 5 video + 1 ses + metin | Düşük | Maksimum girdi, maksimum çakışma riski |
| 0 görsel + 1 video + metin | Düşük | Görsel çapası olmadan kimlik kayar |
[ORİJİNAL VERİ] 200 oluşturma test setimizde, 3 veya daha az referans içeren çağrılar yüzde 91 oranında başarılı olurken, 8 veya daha fazla referans içeren çağrılar yüzde 54 oranında başarılı oldu. Buradaki başarı, çıktının istemle eşleştiği ve en az bir referans özelliğini temiz bir şekilde koruduğu anlamına gelir.
Uygulamalı Bir Örnek: Çoklu Çekim Karakter Sahnesi
İş akışını somutlaştırmak için, dahili bir demo için yürüttüğümüz gerçek bir R2V işi aşağıdadır. Özet, neon ışıklı bir ara sokakta yürüyen, ardından kameraya dönen stilize bir kadın karakterin 6 saniyelik 1080P klibiydi.
Kullanılan referanslar. Karakterin öne dönük, 1080P kahraman portresi. Bir stok kütüphanesinden benzer bir yürüme döngüsünün 5 saniyelik referans videosu. Referans ses yok.
İstem. "Kısa kızıl saçlı ve gümüş ceketli bir kadın, gece neon ışıklı bir ara sokakta yürüyor, orta geniş çekim, yavaş dolly-in, sonunda kameraya dönüyor, sinematik, kasvetli ana ışık, ıslak kaldırım yansımaları."
Ayarlar. R2V modu, 1080P, 6 saniye, 16:9, tohum 8421. Kahraman portresi yüzü sabitledi. Referans video yürüme zamanlamasını sabitledi.
Sonuç. İlk oluşturma, kimliği 6 karenin 4'üne kadar temiz bir şekilde korudu, ardından dönüşte hafifçe kaydı. Aynı karakterin üç çeyrek arka görünümünde bir destekleyici görsel ekledik, yeniden oluşturduk ve dönüş sabit kaldı. Toplam hesaplama: üç oluşturma, ikisi test için 720P ve biri final için 1080P.
Ders: minimal başlayın, referansları yalnızca belirli bir hata gördüğünüzde ekleyin. Referansları önceden eklemek en yaygın R2V hatasıdır.
Yaygın Hata Modları
R2V tahmin edilebilir şekillerde başarısız olur. Bunları baştan adlandırmak kredi tasarrufu sağlar.
Referans çakışması. Farklı konuları, aydınlatmayı veya hareketi tanımlayan iki referans. Model kare başına rastgele birini seçer ve titreme üretir. Öznitelik sınıfı başına bir referansa indirgeyerek düzeltin.
Referans kalitesi uyumsuzluğu. Sıkıştırılmış bir video ile eşleştirilmiş keskin bir görsel. Model, daha zayıf kaynaktan artefaktları miras alır. Tüm referansları aynı doğruluk seviyesine normalleştirerek düzeltin.
İstem-referans uyumsuzluğu. Güneşli bir plajı tanımlayan bir istem, kar fırtınası videosuyla eşleştirilmiş. Model isteme uyar ve referansı göz ardı eder, referans koşullandırmayı boşa harcar. İstem tonunu referans tonuyla hizalayarak düzeltin.
Ses senkronizasyon bozukluğu. Çıktı süresinden daha uzun referans ses veya uzun başlangıç sessizliği olan ses. Dudak senkronizasyonu kayar. Sesi tam olarak çıktı uzunluğuna, ilk fonem 0.0 saniyede olacak şekilde kırparak düzeltin.
Dönüşlerde kimlik kayması. Konu referans açısından 45 dereceden fazla döndüğünde yüzler bozulur. Yeniden oluşturmadan önce hedef açıda destekleyici bir referans görseli ekleyerek düzeltin.
Wan 2.7 R2V SSS
Wan 2.7 R2V'ye kaç referans geçirebilirim?
Alibaba Cloud R2V API referansına göre, tek bir çağrıda 5 adede kadar referans görsel, 5 adede kadar referans klip ve 1 referans ses. Metin istemi her zaman gereklidir. Daha fazla referans çakışma riskini artırır, bu nedenle tek bir görselle başlamanızı ve yalnızca gerektiğinde eklemenizi öneririz.
R2V 1080P çıktıyı destekliyor mu?
Evet. R2V çıktısı 1080P ve 10 saniye ile sınırlıdır. Çözünürlük en düşük çözünürlüklü referansınızla eşleşmelidir; aksi takdirde model, en zayıf kaynaktan artefaktları miras alır.
R2V herhangi bir sesi klonlayabilir mi?
R2V, 5 ila 30 saniyelik temiz bir referans sesten bir sesi klonlayabilir. PixMind politikası, tanımlanabilir gerçek kişilerin rızasız klonlanmasını yasaklar. R2V ses klonlamayı orijinal karakterler, kendi sesiniz veya lisanslı referans ses ile kullanın.
R2V, ses odaklı I2V'den nasıl farklıdır?
Ses odaklı I2V, tek bir girdi görselinde hareketi ve dudak senkronizasyonunu yönlendirmek için yalnızca sesi kullanır. R2V, referans videolar ve birden fazla görsel dahil olmak üzere daha geniş bir çok modlu girdi matrisini kabul eder ve yalnızca zamanlamayı senkronize etmek yerine ses tınısını klonlayabilir. R2V, kimlik ve sesin çekimler arasında taşınması gerektiğinde daha güçlü bir seçimdir.
R2V'den ne zaman kaçınmalıyım?
Tek çekimlik B-roll, soyut hareket, basit ürün döndürmeleri veya devamlılık gereksiniminizin olmadığı herhangi bir durum için R2V'den kaçının. R2V, referans koşullandırma geçişi nedeniyle I2V ve T2V'den saniye başına daha fazla kredi maliyetine sahiptir ve referanslar faydalı sinyal eklemezse ekstra koşullandırma zarar verir.
Çalışırken İzleyin
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



