🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: Przewodnik po multimodalnym generowaniu wideo z referencji

Spis treści

Wan 2.7 R2V: Przewodnik po multimodalnym generowaniu wideo z referencji

Kluczowe wnioski

  • Wan 2.7 reference-to-video (R2V) akceptuje do 5 obrazów referencyjnych, 5 klipów referencyjnych i 1 audio referencyjne w jednym wywołaniu, co stanowi najszerszą multimodalną matrycę wejściową wśród obecnych modeli 1080P.
  • R2V to właściwy tryb do zachowania tożsamości, klonowania głosu i kontynuacji stylu w ujęciach, a nie do jednorazowych materiałów B-roll czy prostych obrotów produktów.
  • Konflikty referencji są główną przyczyną błędów, a większości z nich można zapobiec, stosując czterostopniowy proces przygotowania, ustawienia, pisania i renderowania.
  • Aby uzyskać bardziej szczegółową bibliotekę promptów związanych z tym trybem, zobacz klaster promptów wideo referencyjnych PixMind.

Czym jest Wan 2.7 R2V?

R2V oznacza reference-to-video, tryb Wan 2.7, który przyjmuje mieszane dane wejściowe referencyjne i tworzy nowy klip, który zachowuje tożsamość, głos lub styl z tych danych. Zgodnie z dokumentacją API Wan 2.7 R2V na Alibaba Cloud, pojedyncze wywołanie R2V akceptuje do 5 obrazów referencyjnych, 5 klipów referencyjnych i 1 ścieżkę audio referencyjną, z wyjściem ograniczonym do 1080P i 10 sekund.

To, co odróżnia R2V od image-to-video, to multimodalne warunkowanie. I2V blokuje klatkę początkową i pozwala modelowi wymyślać ruch. R2V zamiast tego wyodrębnia atrybuty z twoich referencji, takie jak struktura twarzy, garderoba, barwa głosu, gradacja kolorów i propaguje je do nowej generacji. Dlatego traktujemy R2V jako inny przepływ pracy, a nie bardziej wyszukane I2V.

R2V znajduje się w ujednoliconym interfejsie generatora wideo Wan 2.7 na PixMind. Nie zmieniasz modeli, aby do niego dotrzeć. Router wybiera R2V, gdy dołączysz referencje w panelu wejściowym.

Kapsuła cytatu: Wan 2.7 R2V (reference-to-video) to tryb, który akceptuje do 5 obrazów referencyjnych, 5 klipów referencyjnych i 1 audio referencyjne w jednym wywołaniu API, generuje MP4 w rozdzielczości do 1080P i długości 10 sekund, i jest używany do zachowania tożsamości, głosu i stylu w ujęciach (Alibaba Cloud Model Studio, 2026).

Jakie dane wejściowe akceptuje R2V?

R2V przyjmuje trzy klasy danych wejściowych, które można mieszać w tym samym wywołaniu. Przegląd generowania wideo Alibaba Cloud dokumentuje schemat tablicy wejściowej. Oto praktyczne zestawienie, co robi każde gniazdo i ile można ich przekazać.

| Gniazdo wejściowe | Maks. liczba | Co przenosi | Wymagane? |
|---|
| Obraz referencyjny | 5 | Twarz, produkt, garderoba, gradacja kolorów | Co najmniej 1 z dowolnego wejścia |
| Wideo referencyjne | 5 | Styl ruchu, synchronizacja, ciągłość sceny | Opcjonalne |
| Audio referencyjne | 1 | Barwa głosu, kadencja, dźwięk otoczenia | Opcjonalne |
| Prompt tekstowy | 1 | Temat, akcja, kamera, styl | Wymagane |

Prompt tekstowy jest zawsze wymagany. Model używa go jako podstawy generacji, a następnie nakłada na niego atrybuty pochodzące z referencji. Bez promptu model nie ma sceny do wyrenderowania, a wywołanie kończy się niepowodzeniem.

Kilka ograniczeń wartych zapamiętania. Wideo referencyjne są ograniczone do 10 sekund każde, a czas trwania wyjścia nigdy nie przekracza najkrótszego wideo referencyjnego, które przekazujesz. Audio referencyjne musi być czystym plikiem WAV lub MP3 o długości od 5 do 30 sekund; wszystko krótsze zostanie uzupełnione, wszystko dłuższe zostanie obcięte.

Interakcje gniazd wejściowych

Każde gniazdo wpływa na inną oś wyjściową. Obrazy napędzają wygląd. Wideo napędzają ruch. Audio napędza głos i synchronizację ust, gdy obecna jest twarz. Gdy dwa gniazda kolidują (na przykład obraz referencyjny blondynki sparowany z wideo referencyjnym osoby z ciemnymi włosami), model wybiera jedno i ignoruje drugie, a wybór nie zawsze jest przewidywalny.

W naszych testach, sprzeczne referencje dają niespójne wybory w kolejnych uruchomieniach z tym samym seedem. Traktuj konflikty referencji jako niedeterministyczne i usuwaj je u źródła.

Kiedy należy używać R2V?

R2V jest właściwym wyborem, gdy ciągłość między ujęciami jest ważniejsza niż surowa szybkość. Sięgamy po niego w trzech konkretnych sytuacjach.

Zachowanie tożsamości w scenach wieloujęciowych. Jeśli potrzebujesz tej samej postaci w ujęciu szerokim, średnim i zbliżeniu, R2V z jednym silnym obrazem referencyjnym na kąt utrzymuje spójną strukturę twarzy. I2V regeneruje twarz za każdym razem i dryfuje.

Klonowanie głosu do nowej sceny. Gdy masz nagraną narrację, która musi pasować do awatara na ekranie, R2V z audio referencyjnym plus portret referencyjny przewyższa I2V sterowane audio. Barwa głosu przenosi się, a synchronizacja ust wygląda tak, jakby mówił ten sam mówca.

Kontynuacja stylu między zasobami. Jeśli już wydałeś jeden klip i potrzebujesz kontynuacji, która pasuje do gradacji kolorów, garderoby i tempa, R2V z pierwszym klipem jako wideo referencyjnym jest najszybszą ścieżką. Text-to-video nie jest w stanie odtworzyć konkretnego wyglądu na podstawie samego opisu.

Kiedy należy unikać R2V?

R2V jest przesadą do pracy jednorazowej. Jeśli potrzebujesz tylko jednego obrotu produktu, tryb pierwszej klatki I2V jest szybszy i tańszy. R2V zużywa więcej kredytów na sekundę niż I2V z powodu przejścia warunkowania referencyjnego.

Pomiń R2V, gdy twoje referencje są niskiej jakości. Model nie ma sposobu na „poprawienie” rozmytego zdjęcia lub zaszumionego klipu audio. Zasada „śmieci na wejściu, śmieci na wyjściu” ma tu większe zastosowanie niż gdziekolwiek indziej w interfejsie Wan 2.7.

Pomiń R2V dla czysto abstrakcyjnego ruchu. Text-to-video obsługuje chmury, cząsteczki i sekwencje snów bez dodatkowych kosztów referencji.

Jak przygotować zasoby referencyjne

Jakość referencji jest największym pojedynczym predyktorem jakości wyjścia R2V. Czysty obraz referencyjny 1080P przewyższa obraz 4K, który został dwukrotnie skompresowany przez aplikacje do przesyłania wiadomości.

Obrazy referencyjne. Użyj jednego silnego obrazu głównego jako kotwicy. Z przodu, równomierne oświetlenie, neutralne tło, brak innych obiektów w kadrze. Jeśli musisz dodać więcej, niech będą to wariacje kątowe tego samego obiektu, a nie różne obiekty.

Wideo referencyjne. Przytnij do dokładnie takiego ruchu, jakiego chcesz, aby model się nauczył. 3-sekundowy klip z jednym wyraźnym gestem jest lepszy niż 10-sekundowy klip z mieszanymi akcjami. Rozdzielczość powinna odpowiadać docelowej rozdzielczości wyjściowej: 1080P wejście, 1080P wyjście.

Audio referencyjne. Tylko nagrania studyjnej jakości. Usuń szumy tła, znormalizuj głośność do około -16 LUFS i przytnij ciszę z początku i końca. Nagrania telefoniczne dają klonowanie głosu o jakości telefonicznej.

[UNIKALNA WSKAZÓWKA] Niezgodność rozdzielczości między referencjami to cichy tryb awarii. Jeśli obraz referencyjny ma 2160P, a wideo referencyjne 720P, model ma tendencję do dziedziczenia źródła o niższej wierności dla ruchu i źródła o wyższej wierności dla szczegółów statycznych, co prowadzi do powstania klipu, który wygląda niespójnie w poszczególnych klatkach. Przed przesłaniem zmniejsz skalę wszystkiego do docelowej rozdzielczości wyjściowej.

Matrix showing valid input combinations for R2V, with reference image, reference video, and reference audio columns.

Jak łączyć referencje bez konfliktów

Poniższy czterostopniowy przepływ pracy jest tym, co stosujemy wewnętrznie. Eliminuje on około 80 procent błędów konfliktów, które obserwowaliśmy, swobodnie układając referencje.

Krok 1: przygotuj referencje. Wybierz jeden obraz kotwiczny, od zera do czterech obrazów wspierających, od zera do dwóch wideo referencyjnych oraz zero lub jedno audio referencyjne. Znormalizuj wszystkie referencje do tego samego współczynnika proporcji, co docelowe wyjście.

Krok 2: prawidłowo ustaw reference_voice. Gdy dołączasz audio referencyjne, ustaw parametr reference_voice na clone dla zachowania głosu lub drive tylko dla synchronizacji ust. Te dwa tryby dają bardzo różne wyniki z tego samego pliku audio. Clone przenosi barwę, drive przenosi synchronizację.

Krok 3: napisz prompt. Opisz scenę, którą chcesz, a nie referencje. Referencje są warunkowaniem, a nie tematem promptu. Zły prompt: „spraw, aby ta osoba mówiła jak audio”. Dobry prompt: „30-letnia kobieta w zielonej kurtce mówi do kamery w nasłonecznionej kuchni, średnie zbliżenie, obiektyw 50mm”.

Krok 4: renderuj i oceniaj. Najpierw uruchom 3-sekundowy test 720P. Sprawdź zachowanie tożsamości w pierwszej klatce, spójność ruchu w drugiej i synchronizację audio w trzeciej. Dopiero wtedy zatwierdź 10-sekundowy finał 1080P.

Ważne i ryzykowne kombinacje

Niektóre kombinacje wejściowe są stabilne. Inne regularnie generują artefakty. Ta matryca została opracowana na podstawie naszych własnych testów R2V, obejmujących około 200 renderów w czerwcu i lipcu 2026 roku.

| Kombinacja | Stabilność | Uwagi |
|---|
| 1 obraz + tekst | Wysoka | Najbliżej I2V, najszybsza ścieżka R2V |
| 1 obraz + 1 audio + tekst | Wysoka | Najlepsze do klonowania głosu w ujęciach typu „gadająca głowa” |
| 1 obraz + 1 wideo + tekst | Średnia | Działa, gdy wideo przedstawia ten sam obiekt |
| 1 obraz + 1 wideo + 1 audio + tekst | Średnia | Potrójne warunkowanie, uważaj na konflikty |
| 5 obrazów + 5 wideo + 1 audio + tekst | Niska | Maksymalne wejście, maksymalne ryzyko konfliktu |
| 0 obrazów + 1 wideo + tekst | Niska | Bez kotwicy obrazu tożsamość dryfuje |

[ORYGINALNE DANE] W naszym zestawie testowym obejmującym 200 renderów, wywołania z 3 lub mniej referencjami zakończyły się sukcesem w 91 procentach, podczas gdy wywołania z 8 lub więcej referencjami zakończyły się sukcesem w 54 procentach. Sukces oznacza tutaj, że wynik pasował do promptu i czysto zachował co najmniej jeden atrybut referencyjny.

Przykład: Scena z postacią w wielu ujęciach

Aby przepływ pracy był bardziej konkretny, oto prawdziwe zadanie R2V, które wykonaliśmy na potrzeby wewnętrznego demo. Zadaniem było stworzenie 6-sekundowego klipu 1080P stylizowanej postaci kobiecej idącej przez oświetloną neonami alejkę, a następnie odwracającej się do kamery.

Użyte referencje. Jeden portret głównej postaci 1080P, skierowany przodem. Jedno 5-sekundowe wideo referencyjne podobnego cyklu chodu z biblioteki stockowej. Brak audio referencyjnego.

Prompt. „Kobieta z krótkimi rudymi włosami i srebrną kurtką idzie nocą neonową alejką, ujęcie średnio-szerokie, powolne najazd kamery, na końcu odwraca się do kamery, kinowe, nastrojowe światło kluczowe, mokre odbicia na chodniku.”

Ustawienia. Tryb R2V, 1080P, 6 sekund, 16:9, seed 8421. Portret głównej postaci zakotwiczył twarz. Wideo referencyjne zakotwiczyło synchronizację chodu.

Wynik. Pierwszy render zachował tożsamość czysto do klatki 4 z 6, następnie lekko dryfował przy obrocie. Dodaliśmy jeden obraz wspierający tej samej postaci w widoku trzy-czwarte z tyłu, ponownie wyrenderowaliśmy, a obrót został utrzymany. Całkowite obliczenia: trzy rendery, dwa w 720P do testowania i jeden w 1080P do finalizacji.

Lekcja: zacznij od minimum, dodawaj referencje tylko wtedy, gdy zauważysz konkretną awarię. Dodawanie referencji zapobiegawczo jest najczęstszym błędem R2V.

Typowe tryby awarii

R2V zawodzi w przewidywalny sposób. Nazwanie ich z góry oszczędza kredyty.

Konflikt referencji. Dwie referencje opisujące różne obiekty, oświetlenie lub ruch. Model wybiera jedną losowo na klatkę, co powoduje migotanie. Napraw to, redukując do jednej referencji na klasę atrybutów.

Niezgodność jakości referencji. Ostry obraz sparowany ze skompresowanym wideo. Model dziedziczy artefakty ze słabszego źródła. Napraw to, normalizując wszystkie referencje do tej samej wierności.

Niezgodność promptu z referencją. Prompt opisujący słoneczną plażę sparowany z wideo referencyjnym burzy śnieżnej. Model przestrzega promptu i ignoruje referencję, marnując warunkowanie referencyjne. Napraw to, dopasowując ton promptu do tonu referencji.

Desynchronizacja audio. Audio referencyjne dłuższe niż czas trwania wyjścia, lub audio z długą początkową ciszą. Synchronizacja ust dryfuje. Napraw to, przycinając audio do dokładnie takiej samej długości jak wyjście, z pierwszym fonemem na 0.0 sekundy.

Dryf tożsamości przy obrotach. Twarze zniekształcają się, gdy obiekt obraca się o ponad 45 stopni od kąta referencyjnego. Napraw to, dodając wspierający obraz referencyjny pod docelowym kątem przed ponownym renderowaniem.

Wan 2.7 R2V – Często zadawane pytania

Ile referencji mogę przekazać do Wan 2.7 R2V?

Do 5 obrazów referencyjnych, 5 klipów referencyjnych i 1 audio referencyjne w jednym wywołaniu, zgodnie z dokumentacją API R2V Alibaba Cloud. Prompt tekstowy jest zawsze wymagany. Więcej referencji zwiększa ryzyko konfliktu, dlatego zalecamy rozpoczęcie od jednego obrazu i dodawanie tylko w razie potrzeby.

Czy R2V obsługuje wyjście 1080P?

Tak. Wyjście R2V jest ograniczone do 1080P i 10 sekund. Rozdzielczość musi odpowiadać twojej referencji o najniższej rozdzielczości; w przeciwnym razie model dziedziczy artefakty z najsłabszego źródła.

Czy R2V może sklonować dowolny głos?

R2V może sklonować głos z czystego audio referencyjnego o długości od 5 do 30 sekund. Polityka PixMind zabrania niekonsensualnego klonowania rozpoznawalnych prawdziwych osób. Używaj klonowania głosu R2V z oryginalnymi postaciami, własnym głosem lub licencjonowanym audio referencyjnym.

Czym R2V różni się od I2V sterowanego audio?

I2V sterowane audio używa audio tylko do napędzania ruchu i synchronizacji ust na pojedynczym obrazie wejściowym. R2V akceptuje szerszą multimodalną matrycę wejściową, w tym wideo referencyjne i wiele obrazów, i może klonować barwę głosu, a nie tylko synchronizować czas. R2V jest lepszym wyborem, gdy tożsamość i głos muszą być przeniesione przez ujęcia.

Kiedy należy unikać R2V?

Unikaj R2V dla jednorazowych materiałów B-roll, abstrakcyjnego ruchu, prostych obrotów produktów lub w każdym przypadku, gdy nie masz wymagań dotyczących ciągłości. R2V kosztuje więcej kredytów na sekundę niż I2V i T2V z powodu przejścia warunkowania referencyjnego, a dodatkowe warunkowanie szkodzi, jeśli referencje nie dodają użytecznego sygnału.

Zobacz w akcji

继续浏览中,生成器即将加载...