Sterowanie pierwszą i ostatnią klatką w Wan 2.7: 5-etapowy przewodnik
Kluczowe wnioski
- Tryb pierwszej i ostatniej klatki w Wan 2.7 I2V pozwala ustalić zarówno stan początkowy, jak i końcowy klipu, a model interpoluje ruch pomiędzy nimi.
- Pięć kroków prowadzi do czystego renderu: przygotuj klatki kluczowe, prześlij obie klatki, ustaw czas trwania, napisz podpowiedź przejścia, a następnie oceń na pięciu osiach.
- Typowe błędy to zniekształcenia powierzchni odbijających światło, dryf tożsamości postaci oraz skoki kamery, gdy dwie klatki kluczowe różnią się kątem.
- Zacznij od krótkich klipów trwających od 2 do 5 sekund; czas trwania liniowo skaluje koszt kredytów, a długie renderowania wzmacniają artefakty.
- Klaster podpowiedzi pierwszej i ostatniej klatki PixMind zawiera szablony, które odpowiadają trzem wzorcom przykładów w tym przewodniku.
Czym jest tryb pierwszej i ostatniej klatki?
Tryb pierwszej i ostatniej klatki to podtryb funkcji Wan 2.7 image-to-video (I2V). Dostarczasz dwa obrazy: jeden dla pierwszej klatki, jeden dla ostatniej. Wan 2.7 generuje klatki pośrednie, które je łączą. Zgodnie z dokumentacją API I2V Alibaba Cloud, model akceptuje uporządkowaną parę obrazów wejściowych i generuje plik MP4 w rozdzielczości do 1080P.
Jest to ważne, ponieważ I2V z pojedynczym obrazem pozostawia stan końcowy modelowi. Jeśli Twoje ujęcie musi zakończyć się na konkretnej klatce, np. produkt w pełni obrócony lub pudełko w pełni otwarte, tryb pierwszej i ostatniej klatki gwarantuje to zakończenie. Aby uzyskać kontekst trybu, zobacz generator wideo PixMind Wan 2.7, gdzie jedna powierzchnia tworzenia obsługuje każdy podtryb I2V.
Główny proces pracy składa się z pięciu kroków: przygotuj dwie klatki kluczowe, prześlij je w odpowiedniej kolejności, ustaw czas trwania, napisz podpowiedź przejścia, a następnie wyrenderuj i oceń. Każdy krok zawiera jedną decyzję, która decyduje o powodzeniu renderowania.
Krok 1: Przygotuj klatki kluczowe
Jakość klatek kluczowych jest największym pojedynczym czynnikiem decydującym o czystym renderowaniu w trybie pierwszej i ostatniej klatki. Instrukcja obsługi Wan 2.7 image-to-video zaleca dopasowanie kompozycji, oświetlenia i kąta kamery w obu klatkach. Odkryliśmy, że niedopasowane klatki kluczowe zmuszają model do wymyślania przejścia, co prowadzi do zniekształceń i dryfu tożsamości.
Trzy zasady spójności obejmują większość przypadków. Dopasuj kompozycję, kadrując oba obiekty w tej samej pozycji na ekranie. Dopasuj oświetlenie, zachowując ten sam kierunek światła kluczowego i temperaturę barwową. Dopasuj kamerę, utrzymując stałą ogniskową, kąt i odległość. Złamanie którejkolwiek z tych zasad zmusza model do interpolacji przez nieciągłość.
Kapsuła cytatowa: Spójność klatek kluczowych jest dominującym czynnikiem wpływającym na jakość trybu pierwszej i ostatniej klatki w Wan 2.7. Instrukcja obsługi image-to-video Alibaba Cloud zaleca dopasowanie kompozycji, oświetlenia i kąta kamery w obu klatkach wejściowych, aby uniknąć wymyślonych przez model przejść, które powodują zniekształcenia i dryf tożsamości.
Lista kontrolna kompozycji
- Obiekt zajmuje ten sam kwadrant ekranu w obu klatkach.
- Elementy tła pozostają w stałych pozycjach.
- Proporcje obrazu obu klatek odpowiadają docelowym proporcjom wyjściowym.
- Zachowana jest przestrzeń negatywna, aby ruch miał gdzie się odbywać.
Lista kontrolna oświetlenia
- Kierunek światła kluczowego jest identyczny w obu klatkach.
- Temperatura barwowa jest zgodna w zakresie 200K.
- Długość i kąt cienia są zgodne z pojedynczym źródłem światła.
- Odbicia lustrzane padają na te same obszary powierzchni.
Lista kontrolna kamery
- Ogniskowa jest identyczna (użyj danych EXIF lub metadanych).
- Kąt ujęcia jest zgodny w zakresie 5 stopni.
- Wysokość kamery jest spójna.
- Charakterystyka zniekształceń obiektywu jest zgodna (stałoogniskowy kontra zmiennoogniskowy).
Zmarnowaliśmy kredyty, testując pary, gdzie pierwsza klatka była nagrana na 35mm, a ostatnia na 50mm. Model wygenerował nieprzyjemny "przeskok" w środku klipu. Zablokuj ogniskową przed generowaniem.
Krok 2: Prześlij pierwszą i ostatnią klatkę
Wan 2.7 oczekuje dwóch klatek w określonej kolejności. Pierwszy obraz, który przekażesz, staje się stanem początkowym, drugi staje się stanem końcowym. Zgodnie z przeglądem Alibaba Cloud Model Studio, wywołanie I2V akceptuje adresy URL obrazów lub ładunki zakodowane w base64, a model traktuje tablicę wejściową jako uporządkowaną sekwencję.
Kolejność ma większe znaczenie, niż ludzie się spodziewają. Jeśli najpierw prześlesz obraz otwartego pudełka, a następnie obraz zamkniętego pudełka, otrzymasz animację zamykania. Odwróć kolejność, a otrzymasz animację otwierania. Model nie wnioskuje intencji wyłącznie z podpowiedzi; sekwencja klatek jest źródłem prawdy o kierunku.
Format i rozmiar przesyłania
Obie klatki powinny mieć ten sam współczynnik proporcji co docelowy wynik. Podanie pierwszej klatki w formacie 9:16 i ostatniej w formacie 1:1 wymusza przycięcie, a przycięcia wprowadzają artefakty na krawędziach. Zmień rozmiar obu klatek do rozdzielczości wyjściowej przed przesłaniem.
Praktyczna recepta na rozmiar: celuj w 1920x1080 dla wyjścia 16:9 w 1080P, 1080x1920 dla 9:16 i 1080x1080 dla 1:1. Zachowaj rozmiar pliku poniżej 10MB na klatkę, aby uniknąć błędów przekroczenia limitu czasu na wolnych połączeniach.
Dyscyplina nazewnictwa i kolejności
Nazywaj pliki w sposób, który jasno wskazuje sekwencję. keyframe-01-closed.png i keyframe-02-open.png eliminuje zgadywanie podczas przesyłania. Brzmi to trywialnie, ale przesyłanie w odwróconej kolejności to drugi najczęstszy błąd, jaki obserwujemy.
Krok 3: Ustaw czas trwania (i dlaczego warto zacząć od krótkich klipów)
Czas trwania kontroluje, ile interpolowanych klatek model musi wygenerować między dwiema klatkami kluczowymi. Dłuższe czasy trwania oznaczają więcej interpolacji, co oznacza więcej szans na dryf modelu. Dokumentacja API I2V Wan 2.7 obsługuje czasy trwania od 2 do 15 sekund dla I2V.
Zalecamy rozpoczęcie od 2 do 5 sekund dla każdej nowej pary klatek kluczowych. Krótkie renderowania tanio ujawniają tryby awarii. Jeśli model potrafi czysto interpolować przez 3 sekundy, możesz śmiało wydłużyć czas do 8 lub 10 sekund w kolejnym przebiegu.
Kapsuła cytatowa: Wan 2.7 I2V obsługuje czasy trwania od 2 do 15 sekund, ale koszt kredytów skaluje się liniowo z czasem trwania. Testowanie w zakresie od 2 do 5 sekund ujawnia tryby awarii takie jak zniekształcenia, dryf i skoki kamery za ułamek kosztów 10-sekundowego renderowania.
Czas trwania a amplituda ruchu
Krótkie czasy trwania sprawdzają się przy małych ruchach. 3-sekundowe renderowanie pasuje do podnoszenia pokrywki z pudełka. 5-sekundowe renderowanie pasuje do postaci obracającej się od tyłu do przodu. Przekroczenie 8 sekund sprawia, że model musi wymyślić ruch pośredni, którego żadna klatka kluczowa nie sugeruje, co prowadzi do halucynacji ruchu.
Matematyka kosztów kredytów
Czas trwania skaluje koszt liniowo. 10-sekundowe renderowanie w 1080P kosztuje mniej więcej pięć razy więcej niż 2-sekundowe renderowanie w 1080P. Jeśli testujesz przez 10 sekund i ponosisz porażkę, płacisz pełną cenę za render, którego nie możesz użyć. Testuj krótko, a następnie zatwierdź.
Krok 4: Napisz podpowiedź przejścia
Podpowiedź w trybie pierwszej i ostatniej klatki opisuje ruch między dwiema klatkami. Nie opisuje ponownie obiektu; klatki kluczowe już to robią. Klaster podpowiedzi pierwszej i ostatniej klatki PixMind kataloguje wzorce podpowiedzi dla trzech poniższych przykładów.
Podpowiedź przejścia składa się z czterech części: akcji, szybkości, zachowania kamery i stylu. Każdą część ogranicz do jednej krótkiej frazy. Długie podpowiedzi rozpraszają uwagę modelu i generują łagodniejszy ruch.
Kapsuła cytatowa: Podpowiedzi przejścia w trybie pierwszej i ostatniej klatki Wan 2.7 powinny opisywać ruch, a nie obiekt. Skuteczne podpowiedzi obejmują cztery części: akcję, szybkość, zachowanie kamery i styl. Każda część jako jedna krótka fraza przewyższa podpowiedzi o długości akapitu, które ponownie opisują to, co już pokazują klatki kluczowe.
Anatomia podpowiedzi
- Akcja: co się porusza. "Pokrywka się podnosi," "postać się obraca," "niebo ciemnieje."
- Szybkość: jak szybko. "Powoli," "stopniowo," "przez trzy sekundy."
- Kamera: co robi kamera. "Statyczna," "subtelne zbliżenie," "zablokowana."
- Styl: obróbka wizualna. "Kinowy," "dokumentalny," "miękka ostrość."
Anty-wzorzec: nadmierne podpowiadanie
Oprzyj się pokusie ponownego opisywania obiektu. Jeśli pierwsza klatka kluczowa to zamknięte pudełko prezentowe, Twoja podpowiedź nie musi mówić "zamknięte pudełko prezentowe na drewnianym stole". Model już to wie. Ponowne opisywanie zmusza model do ponownego renderowania pudełka, co utrudnia interpolację.
[UNIKALNA WSKAZÓWKA] Zadaniem podpowiedzi przejścia jest ograniczenie ruchu, a nie deklarowanie obiektu. Traktuj ją jako notatki choreograficzne dla tancerza, który już zna kostium.
Krok 5: Renderuj i oceń na pięciu osiach
Każde renderowanie w trybie pierwszej i ostatniej klatki wymaga wyraźnej oceny. Oceniamy na pięciu osiach, każda z nich jest oceniana jako zaliczona lub niezaliczone. Renderowanie, które nie przejdzie żadnej osi, wraca do kroku 1 lub kroku 4, a nie do ostatecznej dostawy.

Pięć osi obejmuje tożsamość, kamerę, oświetlenie, ruch i dokładność klatki docelowej. Pierwsze trzy wynikają z jakości klatek kluczowych. Dwie ostatnie wynikają z wyboru podpowiedzi i czasu trwania.
Kapsuła cytatowa: Renderowania w trybie pierwszej i ostatniej klatki Wan 2.7 powinny być oceniane na pięciu binarnych osiach: spójność tożsamości, ciągłość kamery, ciągłość oświetlenia, wiarygodność ruchu i osiągnięcie klatki docelowej. Renderowanie, które nie przejdzie żadnej osi, powinno zostać przerobione na etapie klatki kluczowej lub podpowiedzi, zamiast być ślepo powtarzane.
Oś 1: Spójność tożsamości
Czy obiekt wygląda tak samo we wszystkich klatkach? W przypadku postaci sprawdź geometrię twarzy. W przypadku produktów sprawdź sylwetkę i branding. Dryf w tym miejscu zazwyczaj wynika z klatek kluczowych, które różnią się kątem.
Oś 2: Ciągłość kamery
Czy kamera pozostaje tam, gdzie powinna? Jeśli określiłeś statyczną, sprawdź, czy nie ma niezamierzonych zbliżeń. Jeśli określiłeś zbliżenie, sprawdź, czy ruch jest płynny i nie zacina się.
Oś 3: Ciągłość oświetlenia
Czy kierunek światła pozostaje stały? Zwróć uwagę na odwrócenia cieni w środku klipu, które wskazują, że model zamienił źródła światła między klatkami.
Oś 4: Wiarygodność ruchu
Czy ruch wygląda fizycznie wiarygodnie? Pokrywki nie przechodzą przez pudełka. Kończyny nie zginają się do tyłu. Włosy nie zamarzają w powietrzu. Niewiarygodny ruch zazwyczaj oznacza, że podpowiedź prosiła o zbyt wiele w zbyt krótkim czasie.
Oś 5: Osiągnięcie klatki docelowej
Czy ostatnia klatka wygenerowanego wideo odpowiada przesłanemu obrazowi ostatniej klatki? To jest test, który nadaje nazwę temu trybowi. Jeśli model ląduje gdzieś blisko, ale nie dokładnie, doprecyzuj podpowiedź lub skróć czas trwania.
Trzy przykłady (Odsłonięcie produktu, Obrót postaci, Dzień w noc)
Trzy poniższe wzorce obejmują około 80 procent przypadków użycia trybu pierwszej i ostatniej klatki, które obserwujemy na PixMind. Każdy zawiera przygotowanie klatki kluczowej, podpowiedź, czas trwania i najczęściej występujący tryb awarii.
Przykład 1: Odsłonięcie produktu (pudełko prezentowe zamknięte do otwartego)
Klatki kluczowe: dwa ujęcia produktu, identyczna kamera i oświetlenie. Pierwsza klatka: pokrywka zamknięta. Druga klatka: pokrywka w pełni otwarta z widocznym wnętrzem.
Podpowiedź: "Pokrywka powoli unosi się do góry i odchyla do tyłu, odsłaniając wnętrze. Statyczna kamera, miękkie oświetlenie kinowe, czas trwania trzy sekundy."
Czas trwania: 3 sekundy w 1080P, 16:9.
Tryb awarii: zniekształcenia powierzchni odbijających światło. Jeśli pudełko ma błyszczące wykończenie, model rozmazuje odblask podczas ruchu pokrywki. Złagodź, zmniejszając połysk w klatkach kluczowych lub dodając "matowa powierzchnia" do podpowiedzi.
Przykład 2: Obrót postaci (widok z tyłu do widoku z przodu)
Klatki kluczowe: dwa renderowania postaci, identyczne oświetlenie i ogniskowa. Pierwsza klatka: postać widziana od tyłu. Druga klatka: postać zwrócona w stronę kamery.
Podpowiedź: "Postać powoli obraca się, aby stanąć twarzą do kamery, obracając się zgodnie z ruchem wskazówek zegara przez cztery sekundy. Statyczne średnie ujęcie, kinowa głębia ostrości."
Czas trwania: 4 do 5 sekund w 1080P.
Tryb awarii: dryf tożsamości. Twarz może się przesuwać w trakcie obrotu. Złagodź, tworząc obie klatki kluczowe jak najbardziej frontalne w ramach obrotu, lub używając trybu reference-to-video (R2V) dla silniejszego zachowania tożsamości.
Przykład 3: Dzień w noc (upływ czasu)
Klatki kluczowe: dwa ujęcia krajobrazu, identyczna kompozycja. Pierwsza klatka: światło dzienne. Druga klatka: noc z włączonymi sztucznymi światłami.
Podpowiedź: "Niebo stopniowo ciemnieje z dnia w noc przez pięć sekund, sztuczne światła zapalają się, temperatura barwowa spada. Statyczna kamera, zablokowany statyw."
Czas trwania: 5 sekund w 1080P.
Tryb awarii: skok kamery. Jeśli dwa ujęcia krajobrazu zostały wykonane nawet z nieco różnych pozycji, model wymyśla ruch kamery, aby je połączyć. Złagodź, wykonując oba klatki kluczowe z zablokowanego statywu lub używając pojedynczego ujęcia z bracketingiem ekspozycji.
Typowe tryby awarii (i jak je naprawić)
Nazywanie trybów awarii to sposób na szybsze dostarczanie. Trzy poniższe odpowiadają za większość odrzuconych renderów, które widzimy.
Zniekształcenia powierzchni odbijających światło
Szkło, polerowany metal i woda rozmazują się podczas interpolacji, ponieważ model nie jest w stanie konsekwentnie śledzić odbić. Zmniejsz amplitudę ruchu, przełącz się na matowe powierzchnie w klatkach kluczowych lub skróć czas trwania, aby model miał mniej klatek do wymyślenia.
Dryf tożsamości
Twarze i sylwetki przesuwają się między klatkami. Jest to najczęstsze, gdy dwie klatki kluczowe różnią się kątem lub wyrazem. Ponownie nagraj klatki kluczowe pod dopasowanymi kątami lub przełącz się na tryb R2V z obrazem referencyjnym, aby zakotwiczyć tożsamość.
Skok kamery
Model wymyśla ruch kamery, aby połączyć dwie klatki kluczowe, które sugerują różne kąty. Rozwiązanie jest na wcześniejszym etapie: zablokuj ogniskową, kąt i wysokość w obu klatkach kluczowych. Jeśli nie możesz ponownie nagrać, zaakceptuj ruch kamery i wpisz go do podpowiedzi.
Odkryliśmy, że skoki kamery to tryb awarii najczęściej błędnie diagnozowany jako "błąd modelu". Model robi dokładnie to, co mówią mu klatki kluczowe. Napraw dane wejściowe.
Wan 2.7 Pierwsza i Ostatnia Klatka FAQ
Jaka jest różnica między trybem pierwszej klatki a trybem pierwszej i ostatniej klatki w Wan 2.7?
Tryb pierwszej klatki akceptuje jeden obraz jako stan początkowy i pozwala modelowi wymyślić stan końcowy. Tryb pierwszej i ostatniej klatki akceptuje dwa obrazy i zmusza model do lądowania na drugim obrazie. Tryb pierwszej i ostatniej klatki daje kontrolę nad stanem końcowym, czego nie potrafi tryb pierwszej klatki.
Jak długie powinno być moje pierwsze renderowanie w trybie pierwszej i ostatniej klatki Wan 2.7?
Zacznij od 2 do 5 sekund. Krótkie czasy trwania tanio ujawniają tryby awarii. Zgodnie z dokumentacją API I2V Alibaba Cloud, obsługiwane są czasy trwania od 2 do 15 sekund, ale długie czasy trwania zwiększają odległość interpolacji i ryzyko artefaktów.
Czy tryb pierwszej i ostatniej klatki Wan 2.7 radzi sobie z powierzchniami odbijającymi światło, takimi jak szkło i metal?
Tak, ale z ostrożnością. Powierzchnie odbijające światło są najczęstszym trybem awarii zniekształceń. Złagodź, zmniejszając połysk w klatkach kluczowych, utrzymując małą amplitudę ruchu i wpisując "matowa powierzchnia" do podpowiedzi. Lustra i polerowany chrom pozostają najtrudniejszymi przypadkami.
Jak zapobiec dryfowi tożsamości między dwiema klatkami kluczowymi?
Dopasuj kąt kamery, ogniskową i oświetlenie w obu klatkach kluczowych z dużą precyzją. Jeśli dryf nadal występuje, przełącz się na tryb reference-to-video (R2V) i przekaż obraz referencyjny, aby zakotwiczyć tożsamość. R2V jest udokumentowane w przewodniku generatora wideo PixMind Wan 2.7.
Czy tryb pierwszej i ostatniej klatki Wan 2.7 obsługuje 1080P?
Tak. Wan 2.7 I2V obsługuje wyjście 720P i 1080P. Tryb pierwszej i ostatniej klatki dziedziczy oba. 1080P zużywa mniej więcej dwukrotnie więcej kredytów na sekundę niż 720P, więc iteruj w 720P i zakończ w 1080P.
Zobacz to w akcji
11 minutes of work turned into 8.7M views in 5 days
— Woody (@woody_research) May 28, 2026
no camera, no real person, no photoshoots, just a 24 year old kid and an ai girl he generated on his laptop.
I've been watching how the page is built. the whole pipeline is three tools running in sequence.
> chatgpt writes… https://t.co/iNPeLY9r3K pic.twitter.com/4jB5QObIvw



