Wan 2.7 Image-to-Video: Wyjaśnienie 4 trybów
Kluczowe wnioski
- Wan 2.7 image-to-video (I2V) łączy cztery podtryby w jednym API: pierwszą klatkę, pierwszą i ostatnią klatkę, kontynuację wideo oraz sterowany audio.
- Każdy podtryb przyjmuje różne parametry wejściowe (
first_frame,last_frame,first_clip,driving_audio) i jest przetwarzany przez ten sam backend generujący. - Tryby pierwszej i ostatniej klatki oraz sterowany audio to unikalne możliwości, których nie są w stanie odtworzyć modele I2V oparte na pojedynczych obrazach.
- Większość błędów I2V wynika z niedopasowania trybu do danych wejściowych: niewłaściwy parametr dla zadania lub klatka referencyjna, która nie pasuje do żądanego współczynnika proporcji.
- Wypróbuj generator wideo Wan 2.7, aby śledzić dowolny przykład z tego przewodnika.
Wan 2.7 image-to-video to nie jedna funkcja. To cztery podtryby kierowane przez jedną powierzchnię API, z których każdy akceptuje inny kształt danych wejściowych. Dokumentacja API Wan 2.7 I2V opisuje macierz wejściową, ale nie wyjaśnia, kiedy wybrać który tryb. Ten przewodnik to robi. Każda sekcja obejmuje dane wejściowe, przypadki użycia, przykład promptu oraz typowe błędy, które faktycznie napotkaliśmy.
Aby uzyskać szerszy obraz miejsca I2V w rodzinie modeli Wan 2.7, przegląd generatora wideo PixMind Wan 2.7 przedstawia tryby tekstowe, obrazowe i referencyjne obok siebie.
Czym jest Wan 2.7 Image-to-Video?
Wan 2.7 image-to-video (I2V) to ścieżka generowania warunkowana obrazem w rodzinie modeli Wan 2.7 firmy Alibaba. Zgodnie z dokumentacją API Wan 2.7 I2V, punkt końcowy akceptuje tablicę mediów z typowanymi danymi wejściowymi i zwraca wideo w rozdzielczości do 1080P, o długości od 2 do 15 sekund.
Cztery podtryby nie są oddzielnymi punktami końcowymi. Są to kombinacje danych wejściowych, które API obsługuje wewnętrznie:
| Podtryb | Wymagane dane wejściowe | Opcjonalne dane wejściowe | Typowa długość |
|---|---|---|---|
| Od pierwszej klatki do wideo | obraz first_frame |
prompt, audio | 2-10s |
| Od pierwszej i ostatniej klatki do wideo | first_frame + last_frame |
prompt | 2-5s |
| Kontynuacja wideo | wideo first_clip |
prompt | 3-10s |
| Sterowany audio | first_frame + driving_audio |
prompt | 5-15s |
Wybór odpowiedniego podtrybu to najważniejsza decyzja w procesie I2V. Model musi mniej wymyślać, gdy dostarczysz mu więcej ograniczeń. Na przykład, tryb pierwszej i ostatniej klatki gwarantuje określony stan końcowy. Sama pierwsza klatka pozostawia zakończenie modelowi.
[UNIKALNA WSKAZÓWKA] Większość twórców traktuje I2V jako jedną funkcję i domyślnie używa trybu pierwszej klatki do wszystkiego. W naszych testowych renderach, przełączenie na tryb pierwszej i ostatniej klatki dla prezentacji produktów zmniejszyło odrzucenia z powodu "niewłaściwego stanu końcowego" o około dwie trzecie, ponieważ model nie musiał już zgadywać, dokąd zmierza ujęcie.
Jak działa tryb od pierwszej klatki do wideo?
Tryb od pierwszej klatki do wideo to domyślna ścieżka I2V. Przesyłasz jeden obraz jako first_frame, piszesz prompt opisujący ruch, a Wan 2.7 generuje klatki, które rozwijają się od tego stanu początkowego. Przewodnik użytkownika Wan 2.7 image-to-video dokumentuje to jako najprostszą formę wywołania I2V.
Dane wejściowe
first_frame(wymagane): jeden obraz, dowolny współczynnik proporcji obsługiwany przez Wan 2.7 (16:9, 9:16, 1:1, 4:3, 3:4).prompt(opcjonalny, ale zdecydowanie zalecany): opisuje ruch, kamerę i styl.resolution: 720P lub 1080P.duration: od 2 do 15 sekund.ratio: musi odpowiadać współczynnikowi proporcji obrazu wejściowego, aby uniknąć przycinania.
Kiedy go używać
- Masz jedno zdjęcie produktu i potrzebujesz krótkiej prezentacji.
- Masz portret postaci i chcesz subtelnego ruchu.
- Iterujesz nad stylem ruchu przed zablokowaniem stanu końcowego.
Przykład promptu
first_frame: zdjęcie szklanej butelki perfum na ciemnej powierzchni, pojedyncze światło kluczowe z lewej strony kamery.prompt: "Powolne zbliżenie kamery. Strumień kropelek wchodzi z prawej krawędzi. Miękkie cząsteczki unoszą się w promieniu światła. Kinematograficzne, płytka głębia ostrości, ciepłe światło konturowe." Rozdzielczość 1080P, długość 5s, proporcje 16:9.
Typowe błędy
- Prompt koliduje z obrazem. Jeśli prompt prosi o szerokie panoramowanie, ale
first_frameto ciasne zbliżenie, model może zniekształcić obiekt, aby dopasować go do kadru. - Niedopasowanie proporcji. Wprowadzenie obrazu 9:16 do generacji 16:9 powoduje nieoczekiwane przycięcie. Zawsze dopasuj proporcje wejściowe do wyjściowego
ratio. - Zbyt duży ruch. 2-sekundowy render nie zmieści panoramowania o 180 stopni bez rozmycia. Wydłuż czas trwania lub zmniejsz ruch.
Przeprowadziliśmy 24 testowe rendery w trybie pierwszej klatki na zdjęciach produktów dla partii reklam produktów do pielęgnacji skóry. Rendery, które utrzymywały kamerę statycznie lub używały powolnego zbliżenia (poniżej 10 procent ruchu kadru), były akceptowane w 80 procentach przypadków. Rendery, które prosiły o "dynamiczny ruch kamery", były akceptowane w 25 procentach przypadków i powodowały widoczne zniekształcenia na odblaskowych nakrętkach.
Jak działa tryb od pierwszej i ostatniej klatki do wideo?
Tryb od pierwszej i ostatniej klatki do wideo przyjmuje dwa obrazy, first_frame i last_frame, i generuje klatki pośrednie. Zgodnie z dokumentacją API Wan 2.7 I2V, oba obrazy muszą mieć ten sam współczynnik proporcji i idealnie tę samą kompozycję. Model interpoluje wiarygodne przejście.
Dane wejściowe
first_frame(wymagane): obraz stanu początkowego.last_frame(wymagane): obraz stanu końcowego.prompt(opcjonalny): opisuje, jak powinno wyglądać przejście, a nie gdzie się kończy.resolution,duration,ratio: te same ograniczenia co w trybie pierwszej klatki.- Typowa długość: od 2 do 5 sekund. Dłuższe czasy trwania zmuszają model do większej inwencji.
Kiedy go używać
- Prezentacje produktów, które muszą zakończyć się na konkretnej klatce.
- Przejścia, w których zarówno stan początkowy, jak i końcowy są zaprojektowane.
- Ujęcia z storyboardu, gdzie dwie kluczowe klatki są zablokowane.
Przykład promptu
first_frame: zamknięte pudełko prezentowe na marmurowej powierzchni.last_frame: to samo pudełko otwarte, ze strumieniem światła i rozwijającą się wstążką.prompt: "Pudełko otwiera się płynnie przez 3 sekundy. Kamera pozostaje statyczna. Rozbłysk światła narasta od 30. klatki. Brak dryfu obiektu." Rozdzielczość 1080P, długość 3s, proporcje 16:9.
Typowe błędy
- Odblaskowe powierzchnie rozmywają się. Szkło, metal i woda mogą ulegać zniekształceniom podczas interpolacji. Zmniejsz amplitudę ruchu lub uprość powierzchnię.
- Niedopasowanie kamery. Jeśli dwie kluczowe klatki sugerują różne kąty kamery, model wymyśla przejście, które często wygląda jak cięcie skokowe.
- Zbyt długa długość. Po 5 sekundach model musi wypełnić zbyt wiele wymyślonego ruchu. Zachowaj krótki czas.
Klaster promptów PixMind dla pierwszej i ostatniej klatki zawiera szablony dla prezentacji produktów, przejść i wzorców narracyjnych, które pasują do tego trybu.
Jak działa kontynuacja wideo?
Kontynuacja wideo przyjmuje istniejący krótki klip jako first_clip i rozszerza go w czasie. Przewodnik Wan 2.7 I2V traktuje to jako odrębny podtryb I2V, ponieważ wejściem jest wideo, a nie nieruchomy obraz. Model odczytuje wektory ruchu z klipu źródłowego i je kontynuuje.
Dane wejściowe
first_clip(wymagane): krótki film, zazwyczaj od 2 do 5 sekund. Format i kodek muszą odpowiadać liście akceptowanej przez API.prompt(opcjonalny): opisuje, jak kontynuacja powinna się rozwijać, a nie zaczynać od nowa.resolution: powinno odpowiadać klipowi źródłowemu, aby uniknąć artefaktów skalowania.duration: całkowita długość wyjścia, a nie tylko dołączonej sekcji.
Kiedy go używać
- 3-sekundowa generacja jest świetna, ale potrzebujesz 6.
- Chcesz rozszerzyć ujęcie główne na dłuższy spot reklamowy.
- Pierwszy klip ma dobry ruch, który chcesz zachować.
Przykład promptu
first_clip: 3-sekundowy klip deskorolkarza przejeżdżającego obok kamery, nagrany w 720P.prompt: "Skater kontynuuje jazdę obok kamery. Kamera podąża za nim. Tło zmienia się z zaułka na blask latarni ulicznej. Bez cięć." Rozdzielczość 720P, długość 6s, proporcje 16:9.
Typowe błędy
- Reset ruchu. Model może zamrozić obiekt, jeśli prompt jest sprzeczny z ruchem źródłowym. Dopasuj prompt do istniejącego kierunku klipu.
- Artefakty skalowania rozdzielczości. Wprowadzenie źródła 720P do wyjścia 1080P powoduje miękkie lub zniekształcone klatki. Dopasuj rozdzielczość wyjściową do źródła.
- Zbyt krótki klip. 1-sekundowe źródło daje modelowi prawie żaden ruch do kontynuowania. Użyj co najmniej 2 sekund.
[UNIKALNA WSKAZÓWKA] Kontynuacja wideo to najmniej wykorzystywany podtryb I2V. Pozwala "uratować" render, który zatrzymał się o 2 sekundy za wcześnie, co, jak odkryliśmy, stanowi około jednej trzeciej wszystkich iteracji produkcyjnych. Zamiast generować od nowa, po prostu dodajesz.
Jak działa tryb sterowany audio?
I2V sterowany audio przyjmuje nieruchomy obraz plus ścieżkę driving_audio i tworzy wideo, w którym obiekt porusza się synchronicznie z dźwiękiem. Zgodnie z przewodnikiem Wan 2.7 image-to-video, jest to ścieżka dla treści typu "gadająca głowa" i awatarów. Model wykorzystuje przebieg fali dźwiękowej do sterowania ruchem ust i ogólną energią.
Dane wejściowe
first_frame(wymagane): portret lub obraz postaci. Najlepiej sprawdza się skierowany do przodu, dobrze oświetlony, z neutralnym wyrazem twarzy.driving_audio(wymagane): czysta ścieżka audio. WAV lub MP3. Dźwięk studyjnej jakości przewyższa nagrania telefoniczne.prompt(opcjonalny): opisuje ruch otoczenia, ruch głowy, energię ekspresji.duration: zazwyczaj odpowiada długości audio, do 15 sekund.
Kiedy go używać
- Wyjaśnienia typu "gadająca głowa" z pojedynczego portretu.
- Treści awatarowe dla mediów społecznościowych.
- Demonstracje produktów z lektorem, gdzie twarz narratora.
Przykład promptu
first_frame: portret awatara z przodu, neutralny wyraz twarzy, jednolite tło.driving_audio: 8-sekundowy plik WAV z powitaniem lektora.prompt: "Subtelne kołysanie głową, mruganie co 3 sekundy, uśmiech narasta pod koniec zdania." Rozdzielczość 1080P, długość 8s, proporcje 16:9.
Typowe błędy
- Dryf ust na twarzach niefrontalnych. Jeśli portret jest z profilu, synchronizacja ust pogarsza się. Użyj ujęcia frontalnego.
- Hałaśliwe audio. Szum tła lub muzyka przenika do artefaktów ruchu. Najpierw oczyść audio.
- Długie czasy trwania bez oddechu. 15 sekund ciągłej mowy bez przerw sprawia, że model generuje niezręczne kształty ust. Dodaj przerwy w edycji.
Aby uzyskać głębsze wzorce dotyczące łączenia audio z wideo, klaster promptów PixMind do synchronizacji audio zawiera szablony dla klipów typu "gadająca głowa", z lektorem i sterowanych muzyką.
Jak wybrać odpowiedni tryb I2V?
Decyzja jest podyktowana tym, co masz pod ręką. Dokumentacja API Wan 2.7 T2V i dokumentacja I2V razem opisują pełną macierz wejściową, ale większość decyzji sprowadza się do prostej tabeli.
| Masz... | Użyj tego trybu I2V | Dlaczego |
|---|---|---|
| Jedno zdjęcie | Od pierwszej klatki do wideo | Najprostsza ścieżka. Model wymyśla ruch. |
| Dwa zdjęcia, które muszą być początkiem i końcem | Od pierwszej i ostatniej klatki do wideo | Blokuje stan końcowy. Zmniejsza odrzucenia. |
| Krótki klip, który potrzebuje więcej czasu | Kontynuacja wideo | Zachowuje istniejący ruch. Niższy koszt niż ponowne generowanie. |
| Portret plus ścieżka głosowa | Sterowany audio | Synchronizacja ust i energia podążają za dźwiękiem. |
| Portret plus głos plus wideo referencyjne | Zamiast tego rozważ R2V | R2V lepiej zachowuje tożsamość niż I2V sterowany audio. |
Praktyczna heurystyka: im więcej danych wejściowych możesz dostarczyć modelowi, tym mniej musi on wymyślać. Inwencja to miejsce, gdzie pojawiają się zniekształcenia i dryf.

Jeśli zaczynasz od zera i nie masz jeszcze żadnych danych wejściowych, najpierw wykonaj przejście T2V, aby zablokować ujęcie, a następnie użyj najlepszej klatki jako first_frame w I2V. Ten dwuetapowy proces jest lepszy niż próba uzyskania idealnego renderu I2V za pierwszym razem.
Jakie są typowe błędy I2V?
I2V zawodzi w przewidywalny sposób. Nazwanie ich pomaga szybciej iterować.
- Zniekształcenia powierzchni odblaskowych. Szkło, lustra, polerowany metal rozmywają się podczas interpolacji. Złagodź to, zmniejszając ruch lub upraszczając powierzchnię w obrazie źródłowym.
- Dryf tożsamości między klatkami. Twarze zmieniają się, zwłaszcza po 5 sekundach. Złagodź to, używając trybu pierwszej i ostatniej klatki dla krótkich, zablokowanych ujęć, lub R2V dla dłuższej ochrony tożsamości.
- Niedopasowanie współczynnika proporcji. Wprowadzenie obrazu 9:16 do generacji 16:9 przycina obiekt. Dopasuj współczynnik proporcji wejściowy i wyjściowy.
- Sprzeczność promptu z obrazem. Prośba o "szerokie panoramowanie" na ciasnym zbliżeniu zmusza model do wymyślania szerokokątnego kontekstu, którego nie widzi. Dopasuj prompt do kadrowania obrazu.
- Szum audio przenikający do ruchu. Dźwięk o jakości telefonicznej tworzy ruch "ducha" na twarzy. Najpierw oczyść audio.
- Zużycie kredytów przy długich iteracjach. 10-sekundowe rendery 1080P zużywają kredyty. Iteruj przy 2 do 3 sekundach i 720P, a następnie skaluj w górę.
W partii 40 renderów I2V dla kampanii reklamowej, błędy rozłożyły się mniej więcej następująco: 40 procent sprzeczności promptu z obrazem, 25 procent niedopasowania proporcji, 20 procent zniekształceń odblaskowych, 15 procent inne. Niedopasowanie proporcji jest najtańsze do naprawienia: to pojedyncza kontrola parametru, a jednak spowodowało jedną czwartą zmarnowanych kredytów.
Aby uzyskać głębsze wzorce błędów w różnych przypadkach użycia, klaster przypadków użycia PixMind Wan 2.7 zawiera notatki dla poszczególnych scenariuszy dla wideo produktowych, postaci i społecznościowych.
Wan 2.7 I2V Tryby FAQ
Jaka jest różnica między I2V a R2V w Wan 2.7?
I2V (image-to-video) przyjmuje jako dane wejściowe nieruchome obrazy lub krótkie klipy. R2V (reference-to-video) przyjmuje do pięciu obrazów referencyjnych, pięciu klipów referencyjnych i jednej ścieżki audio referencyjnej, i wykorzystuje je do zachowania tożsamości, głosu i stylu. R2V jest lepsze dla spójności wielu ujęć. I2V jest szybsze dla pracy z pojedynczym ujęciem.
Czy tryb pierwszej i ostatniej klatki Wan 2.7 może obsługiwać ruchy kamery?
Może, ale dwie kluczowe klatki powinny sugerować spójny kąt kamery. Jeśli first_frame i last_frame sugerują różne kąty, model wymyśla przejście, które często wygląda jak cięcie skokowe. Zachowaj subtelne zmiany kamery, poniżej 15 stopni.
Jak długo kontynuacja wideo Wan 2.7 może rozszerzyć klip?
Kontynuacja wideo może rozszerzyć klip źródłowy do maksymalnie 15 sekund w trybie I2V. Klip źródłowy plus wygenerowana kontynuacja nie mogą przekroczyć łącznie 15 sekund. W przypadku dłuższych filmów, połącz wiele wywołań kontynuacji.
Czy tryb sterowany audio Wan 2.7 wymaga twarzy na obrazie?
Najlepiej działa z twarzą, ale nie jest to wymagane. Bez twarzy, audio napędza ogólną energię ruchu zamiast synchronizacji ust. Ujęcia krajobrazowe lub produktowe w trybie sterowanym audio generują abstrakcyjny ruch, który podąża za amplitudą dźwięku.
Czy Wan 2.7 I2V jest darmowy do wypróbowania?
Tak. Strona PixMind Wan 2.7 zawiera bezpłatną wersję próbną, bez konieczności podawania karty kredytowej. Płatne plany aktywują się dopiero po przekroczeniu limitu próbnego.
Zobacz w akcji
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J


