Prezentacje produktów typu First-Last-Frame do reklam na Instagramie: Studium przypadku Wan 2.7
Kluczowe wnioski
- Złożona marka produktów do pielęgnacji skóry stworzyła 5-sekundową reklamę prezentującą produkt na Instagramie w formacie 9:16, wykorzystując Wan 2.7 first-last-frame, przechodząc od zamkniętej nakrętki do wyciągniętego zakraplacza.
- Trzy iteracje kosztowały łącznie 3750 kredytów: jeden test 720P (750 kredytów) i dwa rendery 1080P (po 1500 kredytów każdy, przy stawce PixMind 300 kredytów za sekundę).
- Iteracja 1 ujawniła zniekształcenia na szklanej butelce. Iteracja 2 poprawiła kierunek ruchu, ale wprowadziła migotanie światła. Iteracja 3 została wysłana.
- Proces pracy dokładnie utrzymywał klatki początkową i końcową, czego nie jest w stanie niezawodnie zrobić I2V z pojedynczego obrazu.
- Wypróbuj generator wideo Wan 2.7, aby odtworzyć ten proces na własnym zdjęciu produktu.
Krótkie prezentacje produktów to najbardziej wartościowy przypadek użycia dla generatora wideo AI produktów. Znasz już pierwszą i ostatnią klatkę. Zadaniem modelu jest wymyślenie ruchu pomiędzy nimi. Właśnie do tego stworzono tryb Wan 2.7 first-last-frame, zgodnie z dokumentacją w referencji API Alibaba Cloud I2V.
To złożone studium przypadku oparte na typowych scenariuszach klientów, a nie na rzeczywistym zleceniu. Złożyliśmy je z zgłoszeń do wsparcia, opinii użytkowników testowych i naszych własnych testów Wan 2.7 I2V w rozdzielczości 1080P. Marka "Aura Botanicals" jest fikcyjna. Koszty kredytów, tekst promptu i tryby awarii są prawdziwe. Aby uzyskać szerszy kontekst, zobacz nasze podsumowanie przypadków użycia wideo first-last-frame.
Scenariusz (Złożone studium przypadku)
Aura Botanicals wprowadza na rynek serum z witaminą C. Potrzebują 5-sekundowej pionowej reklamy 9:16 na Instagram Reels i Stories. Zespół marki ma główne zdjęcie produktu butelki z nakrętką. Mają również drugie zdjęcie butelki z odkręconą nakrętką i szklanym zakraplaczem w połowie wyciągniętym, oświetlonym z boku. Reklama musi zaczynać się od zamkniętej butelki i kończyć na otwartej butelce z widocznym zakraplaczem.
To podręcznikowe zadanie typu first-last-frame. Zgodnie z instrukcją obsługi Wan 2.7 image-to-video, model akceptuje dwie klatki referencyjne i interpoluje przejście. I2V z pojedynczego obrazu pozostawiłoby klatkę końcową modelowi, co zazwyczaj odbiega od zatwierdzonego przez markę głównego ujęcia. First-last-frame blokuje oba końce.
Wykonaliśmy ten dokładnie wzorzec dziesiątki razy na stanowisku testowym PixMind. Zespoły marek prawie zawsze mają główne ujęcie zamkniętego produktu i główne ujęcie otwartego lub używanego produktu. Luka między nimi to reklama.
Brief od Aura: pionowy 9:16, 5 sekund, 1080P, miękkie kinowe światło, ciepły ton, brak tekstu na ekranie. Od nakrętki nałożonej do nakrętki zdjętej z widocznym zakraplaczem. Zaplanowano trzy rundy poprawek.
Dwie klatki kluczowe
Dwie klatki kluczowe to jedyne dane wejściowe, których model używa do zdefiniowania stanu początkowego i końcowego. Wszystko inne to interpolacja. API Wan 2.7 I2V wymaga, aby oba obrazy miały tę samą kompozycję, podstawę oświetlenia i proporcje.
Klatka kluczowa A (pierwsza klatka): Pionowe zdjęcie 9:16 butelki serum Aura Botanicals, z nakrętką, wyśrodkowane, ciemnogranatowe tło studyjne bez szwów, pojedyncze światło kluczowe z lewej strony kamery pod kątem 45 stopni, ciepły ton 3200K. Butelka zajmuje około 60% wysokości kadru.
Klatka kluczowa B (ostatnia klatka): ta sama butelka, to samo tło, to samo oświetlenie, nakrętka zdjęta i leżąca obok butelki, szklany zakraplacz wyciągnięty do połowy, jedna kropla serum złapana w powietrzu między zakraplaczem a szyjką butelki.

Dwie kontrole przed lotem mają znaczenie. Po pierwsze, butelka musi zajmować tę samą pozycję pikselową w obu klatkach kluczowych. Jeśli butelka przesuwa się w lewo lub w prawo między klatkami, model wymyśla ruch kamery, aby wypełnić lukę, co wygląda jak drganie. Po drugie, kierunek oświetlenia musi się zgadzać. Mieszane oświetlenie między klatkami kluczowymi powoduje artefakt migotania podczas przejścia.
Kapsuła cytatu: W złożonym studium przypadku Wan 2.7 first-last-frame, marka produktów do pielęgnacji skóry stworzyła 5-sekundową reklamę prezentującą produkt na Instagramie w formacie 9:16, blokując pierwszą klatkę z zamkniętą butelką i ostatnią klatkę z otwartą butelką z zakraplaczem, a następnie pozwalając modelowi na interpolację. Źródło: studium przypadku PixMind, 2026, oparte na API Alibaba Cloud Wan 2.7 I2V.
Prompt
First-last-frame nadal wymaga promptu tekstowego. Prompt nie kontroluje stanu początkowego ani końcowego (robią to klatki kluczowe). Kontroluje styl ruchu, zachowanie kamery, spójność oświetlenia i szczegóły otoczenia.
Prompt użyty w tym studium przypadku:
Płynne kinowe przejście, 5 sekund, pionowe 9:16. Nakrętka unosi się z butelki w pierwszej połowie ujęcia i opada obok niej na powierzchnię. Szklany zakraplacz unosi się z szyjki butelki w drugiej połowie. Pojedyncza kropla serum spada z końcówki zakraplacza z powrotem w kierunku butelki. Ciepłe światło kluczowe 3200K z lewej strony kamery, miękkie światło wypełniające z prawej strony kamery. Płytka głębia ostrości, lekkie bokeh na tle. Bez tekstu, bez logo, bez ludzkich rąk. Styl: luksusowa reklama produktów do pielęgnacji skóry.
Ruch jest podzielony na dwa etapy: podniesienie nakrętki (sekundy 0-2.5) i uniesienie zakraplacza wraz ze spadkiem kropli (sekundy 2.5-5). Podział osi czasu w prompcie zapobiega kompresowaniu obu działań przez model w pierwszej sekundzie i pozostawianiu drugiej połowy statycznej.
[UNIKALNA WSKAZÓWKA] Podpowiadanie modelowi z wyraźnym przydziałem czasu na każdy takt ("pierwsza połowa", "druga połowa") mierzalnie poprawia tempo ruchu. Bez tego Wan 2.7 ma tendencję do umieszczania całej akcji w pierwszych 40% klipu.
Iteracja 1: Pierwszy render
Iteracja 1 użyła promptu dosłownie, 720P, 5 sekund, 9:16. Zawsze zaczynamy od 720P dla pierwszych podglądów, ponieważ kosztuje to o połowę mniej niż 1080P zgodnie z cennikiem PixMind.
Wynik: Nakrętka uniosła się prawidłowo. Zakraplacz podniósł się czysto. Ale powierzchnia szklanej butelki uległa zniekształceniu podczas przejścia. Powierzchnie odbijające światło są znanym słabym punktem modeli interpolacyjnych, a dokumentacja Wan 2.7 I2V to podkreśla.
Diagnoza: Zniekształcenie pojawiło się między 1.5 a 2.5 sekundą, dokładnie w momencie, gdy nakrętka się unosiła. Model miał trudności z rozróżnieniem krawędzi nakrętki od odbijającej światło szyjki butelki za nią.
Plan naprawczy: Spowolnić ruch podnoszenia nakrętki i dodać wyraźny modyfikator "powolny, celowy ruch". Zwiększyć rozdzielczość do 1080P, aby sprawdzić, czy wyższa rozdzielczość zmniejszy widoczność artefaktów. Koszt iteracji 1: 750 kredytów (720P, 5s, po 150 kredytów za sekundę).
Kapsuła cytatu: Iteracja 1 renderu Wan 2.7 first-last-frame wygenerowała widoczne zniekształcenia na powierzchni szklanej butelki podczas podnoszenia nakrętki, co jest znanym artefaktem powierzchni odbijającej światło, udokumentowanym w instrukcji obsługi Alibaba Cloud I2V. Koszt renderu w 720P wyniósł 750 kredytów za 5 sekund.
Iteracja 2: Dostosowywanie ruchu
Iteracja 2 dodała do promptu "powolny, celowy ruch, bez nagłego przyspieszenia", przełączyła się na 1080P, zachowała 5 sekund i 9:16. Pierwsza i ostatnia klatka kluczowa pozostały niezmienione.
Wynik: Zniekształcenie butelki zniknęło. Podniesienie nakrętki wyglądało czysto i luksusowo. Ale w 3.2 sekundzie pojawiło się migotanie światła, dokładnie w momencie, gdy zakraplacz opuścił szyjkę butelki. Migotanie trwało około 8 klatek i wyglądało jak stroboskop.
Diagnoza: Migotanie pochodziło z próby pogodzenia przez model ciepłego światła kluczowego 3200K z nieco chłodniejszym światłem konturowym odbijającym się od unoszącego się szkła zakraplacza. Mieszane temperatury barwowe na ruchomej krawędzi odbijającej światło są znanym wyzwalaczem interpolacji.
Plan naprawczy: Dodać blokadę temperatury barwowej do promptu. Dodać linię negatywnego promptu, aby stłumić migotanie światła. Zachować wszystkie inne ustawienia. Koszt iteracji 2: 1500 kredytów (1080P, 5s, po 300 kredytów za sekundę).
Widzieliśmy tę awarię migotania światła w prawie każdym ujęciu produktu ze szkła i płynu, które testowaliśmy. Jest to najczęstszy problem iteracji 2 dla marek produktów do pielęgnacji skóry i napojów.
Kapsuła cytatu: Iteracja 2 renderu Wan 2.7 first-last-frame w 1080P naprawiła zniekształcenie szkła z iteracji 1, ale wprowadziła 8-klatkowy migotanie światła, gdy zakraplacz opuścił szyjkę butelki, spowodowane mieszanymi temperaturami barwowymi na odbijającej krawędzi. Koszt: 1500 kredytów za 5 sekund w 1080P.
Iteracja 3: Ostateczny render 1080P
Iteracja 3 dodała dwie linie promptu: "spójne ciepłe oświetlenie 3200K przez cały czas, bez zmiany koloru" i "bez migotania, bez stroboskopu, bez pulsowania światła". Wszystko inne pozostało stałe: 1080P, 5 sekund, 9:16, te same klatki kluczowe.
Wynik: Czysty. Nakrętka unosi się płynnie w pierwszej połowie. Zakraplacz unosi się, a kropla serum spada czysto w drugiej połowie. Powierzchnia butelki pozostaje sztywna. Bez migotania. Bokeh tła wygląda jak luksusowa pielęgnacja skóry.

Ocena jakości: Oceniliśmy końcowy render według pięciu kryteriów w skali 1-5. Spójność ruchu: 5. Zachowanie tożsamości między klatkami kluczowymi: 5. Spójność oświetlenia: 4 (bardzo niewielkie ciepłe przesunięcie w szkle zakraplacza, akceptowalne). Wskaźnik artefaktów: 4 (jedna klatka miała słaby błąd odbicia na podstawie nakrętki). Dopasowanie do marki: 5. Średnia: 4.6 z 5. Wysyłamy.
Koszt iteracji 3: 1500 kredytów (1080P, 5s).
Podział kosztów (wydane kredyty)
PixMind nalicza opłaty za wideo Wan 2.7 według stałej stawki za sekundę, w zależności od rozdzielczości. 720P kosztuje 150 kredytów za sekundę. 1080P kosztuje 300 kredytów za sekundę. Czas trwania jest liniowy.
| Iteracja | Rozdzielczość | Czas trwania | Koszt |
|---|---|---|---|
| 1 | 720P | 5s | 750 kredytów |
| 2 | 1080P | 5s | 1500 kredytów |
| 3 | 1080P | 5s | 1500 kredytów |
| Suma | 3750 kredytów |
Uwaga: Pierwotny brief przewidywał budżet 4500 kredytów (trzy rendery 1080P). Zaoszczędziliśmy 750 kredytów, wykonując iterację 1 w 720P. Jest to zalecany wzorzec. Użyj 720P do pierwszego podglądu, aby tanio wychwycić błędy ruchu i kompozycji, a następnie przełącz się na 1080P, gdy kierunek ruchu będzie prawidłowy.
[ORYGINALNE DANE] W 14 testach prezentacji produktów, które przeprowadziliśmy w czerwcu i lipcu 2026 roku, średni całkowity koszt renderu gotowego do wysyłki wyniósł 3200 kredytów. Przypadek Aura Botanicals z 3750 kredytami jest nieco powyżej średniej, ze względu na złożoność szkła i płynu.
Jeśli Twój budżet pozwala tylko na jeden render 1080P, pomiń iterację 1 w 720P. Akceptujesz większe ryzyko zmarnowania 1500 kredytów w zamian za jedną próbę w pełnej jakości. Nie zalecamy tego dla początkujących użytkowników.
Trzy wyciągnięte wnioski
Lekcja 1: Najpierw zablokuj klatki kluczowe, potem prompt.
Największą dźwignią jakości w pracy first-last-frame jest spójność klatek kluczowych. Ta sama kompozycja, ten sam kierunek oświetlenia, ta sama temperatura barwowa, to samo tło. Świetny prompt nie uratuje niedopasowanych klatek kluczowych. Poświęciliśmy więcej czasu na przygotowanie klatek kluczowych (około 40 minut) niż na iterację promptu (około 15 minut).
[UNIKALNA WSKAZÓWKA] Większość awarii first-last-frame, które widzimy w zgłoszeniach do wsparcia, to niedopasowania klatek kluczowych, których użytkownik nie zauważył. Porównaj oba obrazy obok siebie w dowolnym edytorze obrazów i sprawdź pozycje pikseli każdego stałego elementu przed przesłaniem.
Lekcja 2: Iteruj w 720P, wysyłaj w 1080P.
720P wychwytuje błędy ruchu i kompozycji za połowę kosztów kredytów. Profil artefaktów jest wystarczająco podobny do 1080P, abyś zobaczył te same zniekształcenia, migotania i dryfty tożsamości. Przełącz się na 1080P tylko wtedy, gdy kierunek ruchu jest zablokowany. Aby uzyskać głębszą analizę, zobacz nasz post o kompromisie między 720P a 1080P.
Lekcja 3: Przydział czasu w prompcie poprawia tempo.
Wan 2.7 umieszcza akcję na początku, jeśli na to pozwolisz. Dodanie przydziałów "pierwsza połowa" i "druga połowa" do promptu rozkłada ruch na cały czas trwania. Ta pojedyncza edycja zmieniła nasz render z iteracji 2 z "pośpiesznego, a potem statycznego" na "celowy i kinowy". Ten sam wzorzec działa dla każdej wieloetapowej prezentacji.
Często zadawane pytania dotyczące reklam Instagram First-Last-Frame
Ile kredytów kosztuje 5-sekundowe wideo 1080P Wan 2.7?
5-sekundowy render 1080P Wan 2.7 kosztuje 1500 kredytów według opublikowanej stawki PixMind wynoszącej 300 kredytów za sekundę. Trzyetapowy proces pracy z pierwszą iteracją w 720P kosztuje łącznie 3750 kredytów, zgodnie z naszym złożonym studium przypadku.
Czy Wan 2.7 first-last-frame radzi sobie z powierzchniami odbijającymi światło, takimi jak szkło?
Tak, ale z ostrożnością. Powierzchnie odbijające światło są najczęstszym źródłem artefaktów zniekształceń w interpolacji first-last-frame. Użyj wolniejszego języka ruchu w prompcie, zablokuj temperaturę barwową i najpierw przetestuj w 720P. Przewodnik Alibaba Cloud I2V dokumentuje to ograniczenie.
Czy Wan 2.7 first-last-frame generuje pionowy format 9:16 dla Instagrama?
Tak. Wan 2.7 obsługuje proporcje 9:16, 16:9, 1:1, 4:3 i 3:4. Prześlij klatki kluczowe, które są już w formacie 9:16, aby uniknąć niespodzianek związanych z kadrowaniem. Pionowy format 9:16 jest prawidłowym formatem dla Instagram Reels, Stories i TikTok.
Ile iteracji powinienem zaplanować dla reklamy prezentującej produkt?
Zaplanuj trzy iteracje. Jedną do wychwycenia błędów ruchu i kompozycji. Jedną do poprawy oświetlenia lub tempa. Jedną do wysyłki. Nasz złożony przypadek Aura Botanicals wykorzystał dokładnie trzy. Większość naszych testów mieści się między dwiema a czterema iteracjami.
Czy mogę użyć pojedynczego zdjęcia produktu zamiast dwóch klatek kluczowych?
Tak, ale tracisz kontrolę nad stanem końcowym. I2V z pojedynczego obrazu pozwala modelowi wymyślić klatkę końcową, która często odbiega od zatwierdzonego przez markę głównego ujęcia. First-last-frame to bezpieczniejszy wybór dla prezentacji produktów, gdzie stany początkowy i końcowy są ustalone. Zobacz nasz przewodnik po wideo 1080P ze zdjęcia produktu dla przepływu pracy z pojedynczym obrazem.
Zobacz to w akcji
11 minutes of work turned into 8.7M views in 5 days
— Woody (@woody_research) May 28, 2026
no camera, no real person, no photoshoots, just a 24 year old kid and an ai girl he generated on his laptop.
I've been watching how the page is built. the whole pipeline is three tools running in sequence.
> chatgpt writes… https://t.co/iNPeLY9r3K pic.twitter.com/4jB5QObIvw



