Wieloklatkowe podpowiedzi wideo z Wan 2.7
Kluczowe wnioski
- Wieloklatkowa podpowiedź Wan 2.7 łączy od trzech do pięciu ujęć w jednym wpisie tekstowym, gdzie każde ujęcie definiuje temat, akcję, kamerę i styl.
- Szablon 4-klatkowy (ustalający, średni, zbliżenie, rozdzielczość) obejmuje około 80% przypadków użycia wieloklatkowego, które obserwujemy w pracach produktowych, narracyjnych i samouczkach.
- Archetypy sekwencji, które sprawdzają się najlepiej, to łuk narracyjny, prezentacja produktu, krok samouczka i utwór nastrojowy, każdy z wyraźną krzywą tempa.
- Wan 2.7 generuje jeden ciągły plik MP4 na podpowiedź, więc planuj granice ujęć na 2 do 4 sekund każde w ramach renderu trwającego od 10 do 15 sekund.
- Zacznij od klastra podpowiedzi wieloklatkowych PixMind i generatora wideo Wan 2.7, aby odtworzyć dowolny szablon stąd.
Czym jest wieloklatkowa podpowiedź wideo?
Wieloklatkowa podpowiedź wideo to pojedynczy wpis tekstowy, który opisuje dwa lub więcej ujęć w sekwencji, gdzie każde ujęcie ma swój własny temat, kadrowanie i ruch. Zgodnie z przewodnikiem generowania wideo Alibaba Cloud Model Studio, Wan 2.7 T2V akceptuje tekst w dowolnej formie do około 800 znaków, co wystarcza na rozbicie na cztery ujęcia, jeśli każda linia jest zwięzła.
Kapsuła cytatu: Wan 2.7 obsługuje wieloklatkowe podpowiedzi wideo w trybie T2V. Każda podpowiedź może opisywać do czterech ujęć z tematem, kamerą i stylem, a model generuje jeden ciągły plik MP4 w rozdzielczości do 1080P i długości 15 sekund (Alibaba Cloud Model Studio, 2026).
Wieloklatkowe kontra jednoklatkowe
Podpowiedź jednoklatkowa opisuje jedno ciągłe ujęcie. Podpowiedź wieloklatkowa opisuje kilka ujęć, które model łączy w jeden render. Jednoklatkowe jest łatwiejsze do kontrolowania. Wieloklatkowe dostarcza pełniejszą historię w ramach jednego wydatku kredytowego.
Kompromisem jest dyscyplina podpowiedzi. Przy jednym ujęciu model może opierać się na swoich wcześniejszych danych. Przy czterech ujęciach, niejasne wskazówki kumulują się. Przewodnik inżynierii podpowiedzi PixMind Wan 2.7 szczegółowo omawia podstawową anatomię.
W naszych wewnętrznych testach, podpowiedzi, które wyraźnie numerują ujęcia (Ujęcie 1, Ujęcie 2, Ujęcie 3), śledzą wskazówki dotyczące tempa bardziej niezawodnie niż opisy oddzielone przecinkami. Numerowana struktura jest odczytywana jako lista ujęć, co jest formatem, na którym Wan 2.7 był trenowany.
Struktura sekwencji 4-klatkowej
Sekwencja 4-klatkowa to szablon roboczy. Odwzorowuje on bezpośrednio sposób, w jaki montażyści filmowi tną scenę: ustal świat, pokaż temat, ujawnij szczegół, rozwiąż. Dokumentacja API Alibaba T2V potwierdza, że podpowiedzi są czytane od góry do dołu, z późniejszymi klauzulami o niższej wadze, więc kontekst ustalający umieść na początku (Aliyun Model Studio T2V API reference, 2026).
Kapsuła cytatu: W Wan 2.7 T2V, klauzule podpowiedzi są ważone w kolejności, przy czym pierwsze zdanie napędza dominującą wizualizację. Struktura 4-klatkowa umieszcza ujęcie ustalające na początku, aby model zakotwiczył się na ustawieniu przed akcją (Aliyun Model Studio, 2026).
Szablon
Użyj tego szkieletu dla każdej podpowiedzi 4-klatkowej:
Shot 1 (establishing): [setting], [wide framing], [ambient motion].
Shot 2 (medium): [subject], [primary action], [camera move].
Shot 3 (close): [detail of subject or action], [tight framing].
Shot 4 (resolution): [wider or alternate angle], [final beat].
Style: [look, lighting, grain].
Duration: [8s | 10s | 15s]. Ratio: [16:9 | 9:16 | 1:1].

Czas i liczba ujęć
Większość awarii, które obserwujemy, wynika z przeciążenia. Każde ujęcie potrzebuje od 2 do 4 sekund, aby być czytelnym na ekranie. Sekwencja 4-klatkowa wymaga zatem co najmniej 8 sekund, idealnie 10. Wciśnięcie 6 ujęć w 10 sekund sprawia, że każde ujęcie trwa mniej niż 2 sekundy, co zamienia się w migotanie.
| Długość sekwencji | Min. czas trwania | Domyślny współczynnik | Przypadek użycia |
|---|---|---|---|
| 2 ujęcia | 5s | 16:9 | Prezentacja produktu, przed-po |
| 3 ujęcia | 8s | 16:9 | Haczyk społeczny, intro reklamy |
| 4 ujęcia | 10s | 16:9 lub 9:16 | Samouczek, punkt narracyjny |
| 5 ujęć | 15s | 16:9 | Utwór nastrojowy, film marki |
[UNIKALNY WGLĄD] Liczba ujęć powinna być zgodna z budżetem historii, a nie z apetytem. Dwa mocne ujęcia konsekwentnie przewyższają pięć pośpiesznych w ślepej recenzji, ponieważ Wan 2.7 przydziela szczegóły wizualne na ujęcie, a nie na klatkę.
Sekwencja 1: Łuk narracyjny
Sekwencja łuku narracyjnego ustanawia postać lub świat, wprowadza napięcie i rozwiązuje je. Wan 2.7 dobrze sobie z tym radzi w T2V, ponieważ podpowiedzi narracyjne mają wyraźny łańcuch przyczynowo-skutkowy, co pomaga modelowi zachować tożsamość tematu w kolejnych ujęciach.
Kapsuła cytatu: Podpowiedzi łuku narracyjnego działają w Wan 2.7 T2V, gdy każde ujęcie dzieli co najmniej jedną wizualną kotwicę z poprzednim ujęciem, taką jak paleta kolorów lub sylwetka tematu. Bez wspólnej kotwicy, dryf tożsamości pojawia się przy ujęciu 3 (Alibaba Cloud Model Studio, 2026).
Szablon podpowiedzi
Shot 1 (establishing wide): a quiet coastal town at dawn, slow camera dolly forward over rooftops.
Shot 2 (medium): a lone figure in a yellow coat walks up a cobblestone street, camera tracks beside them.
Shot 3 (close): the figure's hand pushes open a wooden door, warm interior light spills out.
Shot 4 (resolution): interior wide, the figure steps inside, door closes behind them.
Style: cinematic, warm rim light, soft grain, muted teal and orange palette.
Duration: 10s. Ratio: 16:9.
Kiedy tego używać
Łuki narracyjne pasują do filmów marki, otwarć krótkich opowiadań i każdej sceny, w której emocje narastają w kolejnych ujęciach. Mają trudności z szybkimi prezentacjami produktów, ponieważ tempo jest z założenia wolne.
Dostarczyliśmy ten dokładny szablon podpowiedzi dla klienta z branży turystycznej. Pierwszy render trwający 8 sekund wydawał się pośpieszny. Zwiększenie do 10 sekund pozwoliło ujęciu 3 "oddetchnąć", a pchnięcie drzwi było czytelne.
Sekwencja 2: Prezentacja produktu
Prezentacja produktu pokazuje ten sam obiekt z wielu kątów w jednym ciągłym renderze. Wan 2.7 I2V z first-last-frame jest właściwym trybem, gdy masz zdjęcia produktów. T2V multi-shot jest właściwym trybem, gdy masz tylko podpowiedź.
Kapsuła cytatu: Podpowiedzi prezentacji produktu w Wan 2.7 T2V najlepiej zachowują tożsamość tematu w kolejnych ujęciach, gdy każde ujęcie ponownie wykorzystuje ten sam deskryptor produktu dosłownie, np. matowy czarny ceramiczny korpus aparatu. Zmiany w sformułowaniach powodują dryf materiału przy ujęciu 3 (Aliyun Model Studio, 2026).
Szablon podpowiedzi
Shot 1 (establishing): a matte black ceramic coffee mug on a concrete ledge, soft morning light from camera-left.
Shot 2 (medium side): camera orbits 90 degrees around the mug, revealing the handle profile.
Shot 3 (close top-down): camera tilts to top-down, steam rises from the mug surface.
Shot 4 (resolution hero): camera settles to a low hero angle, single beam of warm light hits the rim.
Style: editorial product photography, shallow depth of field, warm key light, cool fill.
Duration: 10s. Ratio: 16:9. Resolution: 1080P.

Tryby awarii
Prezentacje produktów zawodzą na dwa przewidywalne sposoby. Po pierwsze, orbita w ujęciu 2 może się zniekształcić, jeśli powierzchnia jest odblaskowa. Po drugie, pochylenie z góry w ujęciu 3 może zmienić proporcje kubka, ponieważ Wan 2.7 nie ma prawdziwego trójwymiarowego zrozumienia obiektu.
Aby zmniejszyć zniekształcenia, utrzymuj ruchy kamery poniżej 90 stopni na ujęcie. Aby zmniejszyć zmianę proporcji, powtarzaj deskryptor produktu w każdym ujęciu, zamiast polegać na zaimkach.
Sekwencja 3: Krok samouczka
Sekwencja kroku samouczka pokazuje proces podzielony na wyraźne etapy. Wan 2.7 jest w tym przyzwoity, gdy każde ujęcie opisuje pojedynczą akcję, i słaby, gdy jedno ujęcie próbuje zrobić dwie rzeczy naraz.
Kapsuła cytatu: Podpowiedzi samouczków w Wan 2.7 T2V odnoszą sukces, gdy każde ujęcie zawiera dokładnie jeden czasownik. Ujęcia z wieloma czasownikami zlewają się w rozmycie ruchu, ponieważ model próbuje renderować dwie akcje w ciągu 2-sekundowego okna (Aliyun Model Studio, 2026).
Szablon podpowiedzi
Shot 1 (establishing overhead): a wooden cutting board on a marble counter, a chef's knife rests beside a whole lemon.
Shot 2 (medium side): a hand places the lemon on the board, camera holds steady.
Shot 3 (close): the knife slices the lemon in half, juice sprays lightly.
Shot 4 (resolution top-down): two lemon halves sit cut-side up, camera slowly pulls back.
Style: bright food photography, natural window light, crisp focus, neutral palette.
Duration: 10s. Ratio: 9:16.
Dlaczego 9:16 dla samouczków
Treści samouczków żyją na Reels, Shorts i TikTok. Ramka 9:16 przycina szerokie ujęcie ustalające, więc ważniejsze jest tutaj umieszczenie tematu centralnie w każdym ujęciu. Przewodnik PixMind po haczykach wideo społecznościowych szczegółowo omawia kadrowanie pionowe.
[UNIKALNY WGLĄD] Podpowiedzi samouczków zyskują na dokładności, gdy nazywasz narzędzie w każdym ujęciu. Napisanie "noża szefa kuchni" w ujęciu 1, a następnie "noża" w ujęciu 3, pozwala modelowi dryfować w kierunku noża do obierania. Dosłowne powtórzenie wydaje się zbędne, ale jest to najtańszy sposób na zablokowanie tożsamości.
Sekwencja 4: Utwór nastrojowy
Utwór nastrojowy jest nienarracyjny. Tworzy atmosferę poprzez ton, światło i teksturę, a nie akcję. Utwory nastrojowe to obszar, gdzie priorytetowe style kinowe Wan 2.7 wykonują najwięcej pracy, i gdzie nadmierne podpowiadanie najbardziej szkodzi.
Kapsuła cytatu: Podpowiedzi utworów nastrojowych w Wan 2.7 T2V korzystają z krótkich, sensorycznych klauzul i pojedynczej dominującej kotwicy stylu. Długie opisy ciągną model w stronę dosłownej narracji i oddalają od atmosfery (Alibaba Cloud Model Studio, 2026).
Szablon podpowiedzi
Shot 1: rain falls on a neon-lit alley, slow dolly in.
Shot 2: reflections ripple in a puddle, camera holds.
Shot 3: a paper lantern sways overhead, slow tilt up.
Shot 4: the alley empties into an open square, camera tracks forward.
Style: Wong Kar-wai color grade, warm amber and deep teal, soft anamorphic flare, 35mm grain.
Duration: 15s. Ratio: 16:9. Resolution: 1080P.
Kotwice stylu, które działają
Kotwica stylu to jedno nazwane odniesienie, które blokuje wygląd. Odniesienia filmowe przewyższają abstrakcyjne terminy. Powiedzenie "miękki anamorficzny blask" mówi modelowi coś konkretnego. Powiedzenie "kinowy" mówi mu prawie nic.
Podpowiedzi nastrojowe były jedyną kategorią, w której PromptExtend konsekwentnie nam pomagał. Rozszerzanie szczegółów sensorycznych bez nadpisywania kotwic stylu dawało bogatszą teksturę w około 60% renderów testowych. Dla innych typów sekwencji, PromptExtend rozmywał kierunek kamery.
Łączenie i postprodukcja
Wan 2.7 generuje jeden ciągły plik MP4. Wieloklatkowe podpowiedzi tworzą cięcia w renderze, a nie oddzielne pliki. Postprodukcja jest zatem lżejsza niż ręczna edycja, ale nadal należy zaplanować trzy rzeczy.
Kapsuła cytatu: Wyniki wieloklatkowe Wan 2.7 są dostarczane jako pojedynczy plik MP4 z twardymi cięciami na granicach ujęć. Dodanie 200ms crossfade w dowolnym NLE wygładza cięcie, ponieważ model nie wstawia przejść między ujęciami (Aliyun Model Studio, 2026).
3-etapowy proces postprodukcji
- Sprawdź granice ujęć: otwórz plik w swoim NLE i umieść znacznik co 2 do 4 sekund. Jeśli ujęcie było za długie, możesz je podzielić i przyciąć bez ponownego renderowania.
- Dodaj 200ms crossfade: twarde cięcia z Wan 2.7 czasami wydają się nagłe. Krótki crossfade na każdej granicy zmiękcza cięcie i ukrywa drobny dryf tożsamości.
- Dopasuj kolory: ujęcia mogą dryfować w balansie bieli. Jedna korekcja Lumetri lub oparta na węzłach dla wszystkich ujęć sprowadza sekwencję do jednego wyglądu.
!(https://cdn.pixmind.io/posts/multi-shot-video-prompts-wan-2-7/chart-post-time.png)
Kiedy renderować ponownie zamiast naprawiać
Niektóre awarie nie są możliwe do naprawienia w postprodukcji. Renderuj ponownie, jeśli tożsamość produktu dryfuje o ponad 20% w kolejnych ujęciach, jeśli ruch kamery jest sprzeczny z podpowiedzią, lub jeśli ujęcie całkowicie brakuje. Kolor, tempo i przejścia to obszar postprodukcji. Tożsamość i struktura to obszar podpowiedzi.
Aby uzyskać głębsze porównanie, jak Wan 2.7 wypada w porównaniu z Sora 2 i VEO 3 pod względem spójności wieloklatkowej, zobacz nasz test podpowiedzi Wan 2.7 kontra Sora 2 oraz pojedynki Wan 2.7 kontra Kling kontra VEO.
Często zadawane pytania dotyczące wieloklatkowego Wan 2.7
Czy Wan 2.7 może generować prawdziwe wieloklatkowe wideo w jednej podpowiedzi?
Tak, z ograniczeniami. Wan 2.7 T2V akceptuje wieloklatkowe podpowiedzi do około 800 znaków. Każde ujęcie powinno trwać od 2 do 4 sekund w ramach renderu trwającego od 10 do 15 sekund. Dłuższe sekwencje zlewają się w migotanie. Zobacz przewodnik generowania wideo Alibaba Cloud dla limitu długości wejścia.
Czy wieloklatkowe działa w trybie obraz-na-wideo?
Nie bezpośrednio. I2V kotwiczy się na obrazie wejściowym jako pierwszej klatce. Wieloklatkowe to natywny wzorzec T2V. Dla wieloklatkowych z kotwicami obrazu, uruchom wiele renderów I2V z first-last-frame i połącz w postprodukcji. Klaster PixMind first-last-frame obejmuje ten przepływ pracy.
Jak zachować spójność tożsamości tematu w kolejnych ujęciach?
Powtórz deskryptor tematu dosłownie w każdym ujęciu. Unikaj zaimków. Jeśli opisałeś matowy czarny ceramiczny kubek w ujęciu 1, użyj tej samej frazy w ujęciach 2, 3 i 4. Dryf tożsamości koreluje z dryfem deskryptora w naszych testach.
Jaką długość powinienem wybrać dla podpowiedzi 4-klatkowej?
Minimum 10 sekund, 12 sekund jako bezpieczna wartość domyślna. Daje to każdemu ujęciu od 2,5 do 3 sekund, co wystarcza na odczytanie akcji. Skrócenie do 8 sekund sprawia, że każde ujęcie trwa mniej niż 2 sekundy, co staje się migotaniem.
Gdzie mogę wypróbować te podpowiedzi?
Generator wideo PixMind Wan 2.7 udostępnia T2V z pełnym oknem podpowiedzi. Wklej dowolny szablon z tego przewodnika, dostosuj temat i styl, a następnie renderuj najpierw w 720P, aby tanio iterować przed przejściem na 1080P.
Zobacz to w akcji
Powiązane na X: Rel1vs — Omawia użycie Claude lub Grok dla wieloklatkowych podpowiedzi Wan 2.7..



