🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 Generator Wideo: Kompletny Przewodnik po Tekście, Obrazie i Wideo Referencyjnym

Spis treści

Wan 2.7 Generator Wideo: Kompletny Przewodnik po Trybach Tekstu, Obrazu i Referencyjnych

Kluczowe wnioski

  • Wan 2.7 to jeden ujednolicony model obejmujący generowanie wideo z tekstu (T2V), z obrazu (I2V) i z referencji (R2V) w jednym procesie.
  • Obsługuje wyjście 720P i 1080P, czas trwania od 2 do 15 sekund oraz pięć proporcji obrazu, w tym 16:9, 9:16 i 1:1.
  • Tryby pierwszej i ostatniej klatki oraz sterowane dźwiękiem zapewniają kontrolę nad stanem początkowym i końcowym, której nie są w stanie zapewnić modele I2V oparte na pojedynczym obrazie.
  • Generowanie wideo z referencji (R2V) akceptuje do pięciu obrazów referencyjnych, pięciu klipów referencyjnych i jednej ścieżki dźwiękowej referencyjnej w jednym wywołaniu.
  • Wypróbuj generator wideo Wan 2.7, aby śledzić dowolny przykład z tego przewodnika.

Czym jest generator wideo Wan 2.7?

Wan 2.7 to najnowszy model generowania wideo od zespołu Wan firmy Alibaba, udostępniony za pośrednictwem Alibaba Cloud Model Studio. Unifikuje on cztery wcześniej oddzielne funkcjonalności w jedną rodzinę modeli: generowanie wideo z tekstu, generowanie wideo z obrazu, generowanie wideo z referencji i edycję wideo. Zgodnie z przeglądem generowania wideo Alibaba Cloud, model akceptuje wejścia multimodalne i generuje pliki MP4 lub MOV w rozdzielczości do 1080P.

Kluczową zmianą w wersji 2.7 jest unifikacja przepływu pracy. Zamiast przełączać się między dostawcami dla generowania wideo z tekstu i z obrazu, wywołujesz ten sam model i pozwalasz API na routing w oparciu o przekazane dane wejściowe. Odpowiada to stronie produktu PixMind Wan 2.7, gdzie jedna powierzchnia tworzenia obsługuje każdy tryb.

Dla twórców ma to znaczenie, ponieważ przełączanie trybów to miejsce, gdzie traci się większość czasu produkcji. Piszesz prompt, renderujesz, zdajesz sobie sprawę, że stan początkowy jest błędny, a następnie odbudowujesz od zera w innym narzędziu. Ujednolicona powierzchnia Wan 2.7 pozwala na wymianę danych wejściowych bez wymiany modeli.

Ile trybów obsługuje Wan 2.7?

Wan 2.7 udostępnia cztery tryby. Dokumentacja API I2V dokumentuje pełną macierz wejściową. Oto praktyczne zestawienie.

Tryb Wejście Najlepsze dla Maks. czas trwania Maks. rozdzielczość
T2V (Tekst-do-Wideo) Prompt tekstowy, opcjonalny dźwięk Storyboarding, ruch abstrakcyjny, B-roll 15s 1080P
I2V (Obraz-do-Wideo) Pierwsza klatka, opcjonalna ostatnia klatka, opcjonalny dźwięk Prezentacje produktów, akcje postaci, animacje 15s 1080P
R2V (Referencja-do-Wideo) Do 5 obrazów referencyjnych + 5 klipów referencyjnych + dźwięk referencyjny Zachowanie tożsamości, klonowanie głosu, sceny z wieloma postaciami 10s 1080P
Edycja Wideo Wideo źródłowe + instrukcja Transfer stylu, edycje oparte na instrukcjach 10s 1080P

Diagram: Siatka czterech kwadrantów przedstawiająca tryby Tekst-do-Wideo, Obraz-do-Wideo, Pierwsza-Ostatnia-Klatka i Wideo-Referencyjne połączone z centralnym hubem.

Tekst-do-Wideo (T2V)

T2V przyjmuje prompt tekstowy i generuje wideo. Dokumentacja API Wan 2.7 T2V wymienia obsługiwane parametry, w tym rozdzielczość, czas trwania, proporcje i opcjonalną ścieżkę dźwiękową. T2V to najszybsza droga od pomysłu do klipu.

Użyj T2V, gdy nie masz ustalonej klatki początkowej. Ruch abstrakcyjny, B-roll, storyboardy i stylizowane sekwencje pasują idealnie. Unikaj T2V, gdy stan początkowy ma znaczenie: jeśli potrzebujesz konkretnego produktu na ekranie w klatce zerowej, przełącz się na I2V.

Obraz-do-Wideo (I2V)

I2V to miejsce, gdzie ujawnia się unifikacja przepływu pracy Wan 2.7. Podręcznik użytkownika Wan 2.7 obraz-do-wideo dokumentuje cztery podtryby:

  1. Pierwsza-klatka-do-wideo: jeden obraz staje się stanem początkowym, model wymyśla ruch.
  2. Pierwsza-i-ostatnia-klatka-do-wideo: dwa obrazy definiują stany początkowy i końcowy, model interpoluje.
  3. Kontynuacja wideo: krótki klip staje się stanem początkowym, model go rozszerza.
  4. Sterowane dźwiękiem: obraz plus ścieżka dźwiękowa napędza synchronizację ruchu warg lub ruch.

Aby uzyskać głębsze omówienie czterech ścieżek I2V, zobacz klaster promptów pierwszej i ostatniej klatki PixMind.

Referencja-do-Wideo (R2V)

R2V to najpotężniejszy i najmniej udokumentowany tryb. Dokumentacja API Wan 2.7 R2V opisuje wywołanie, które akceptuje do pięciu obrazów referencyjnych, pięciu klipów referencyjnych i jednej ścieżki dźwiękowej referencyjnej. Model wykorzystuje je do zachowania tożsamości, głosu i stylu w całym wyjściowym materiale.

R2V to tryb, którego należy użyć, gdy potrzebujesz, aby postać wyglądała tak samo w różnych ujęciach, lub gdy chcesz sklonować głos do nowej sceny. Kompromisem jest czas trwania: R2V ogranicza się do 10 sekund, krócej niż 15-sekundowy limit T2V i I2V.

Edycja Wideo

Edycja wideo przyjmuje wideo źródłowe plus instrukcję tekstową i zwraca edytowany klip. API edycji wideo Wan 2.7 obsługuje edycje oparte na instrukcjach i transfer stylu. Ten tryb wykracza poza zakres przewodnika po generowaniu, ale warto wiedzieć, że istnieje.

Jak działa tryb Pierwsza-Ostatnia-Klatka?

Pierwsza-ostatnia-klatka to podtryb I2V. Dostarczasz dwa obrazy: jeden dla pierwszej klatki, jeden dla ostatniej. Wan 2.7 generuje klatki pośrednie.

Diagram: Oś czasu pokazująca dwie klatki kluczowe z trzema interpolowanymi klatkami pomiędzy nimi, z koncepcją logo Wan 2.7 oznaczającą klatki pośrednie.

Ma to znaczenie, ponieważ I2V z pojedynczym obrazem pozostawia stan końcowy modelowi. Jeśli Twoje ujęcie musi zakończyć się na konkretnej klatce (produkt w pełni obrócony, pudełko w pełni otwarte, postać w pełni obrócona), tryb pierwszej i ostatniej klatki to sposób na zagwarantowanie tego zakończenia.

Praktyczny schemat to: nagraj lub wygeneruj dwie klatki kluczowe, prześlij je jako pierwszą i ostatnią, ustaw czas trwania, renderuj. Wan 2.7 interpoluje ruch między nimi. Strona promptów pierwszej i ostatniej klatki PixMind zawiera szablony promptów do prezentacji produktów, przejść i wzorców narracyjnych.

Typowe tryby awarii, na które należy uważać:

  • Zniekształcenia na powierzchniach odbijających światło: szkło, metal i woda mogą się rozmazywać podczas interpolacji.
  • Dryf tożsamości postaci: twarze mogą zmieniać się między klatkami.
  • Niespójność kamery: jeśli dwie klatki kluczowe sugerują różne kąty kamery, model musi wymyślić przejście.

Najpierw testuj z krótkimi czasami trwania (2-3 sekundy), zanim zdecydujesz się na renderowanie 5-10 sekundowych klipów.

Jak działa wideo sterowane dźwiękiem?

Tryb sterowany dźwiękiem przyjmuje nieruchomy obraz plus ścieżkę dźwiękową i generuje wideo, w którym obiekt wydaje się mówić lub poruszać w synchronizacji z dźwiękiem. Jest to podstawa treści typu "talking-head" i awatarów.

Model wykorzystuje przebieg dźwięku do sterowania dwoma elementami: ruchem warg (jeśli obecna jest twarz) i ogólną energią ruchu. API Wan 2.7 I2V akceptuje dźwięk jako część tablicy mediów, używając typu driving_audio.

W przypadku zastosowań typu "talking-head", połącz to z klastrem wydajności postaci PixMind. Połączenie I2V sterowanego dźwiękiem z czystym portretem referencyjnym to obecnie najlepsza otwarta ścieżka do awatara z synchronizacją ruchu warg bez trenowania niestandardowego modelu.

Dwie praktyczne uwagi:

  • Jakość dźwięku wpływa na jakość wideo. Czyste nagranie studyjne przewyższa mikrofon telefoniczny.
  • Najpierw przetestuj z 3-sekundowym klipem. Problemy z synchronizacją łatwiej wychwycić na wczesnym etapie.

Jaką rozdzielczość, czas trwania i proporcje obrazu wybrać?

Wan 2.7 obsługuje wyjście 720P i 1080P. Kompromisem jest koszt w stosunku do ostrości. Zgodnie z strategią cenową PixMind, 1080P zużywa mniej więcej dwa razy więcej kredytów niż 720P na sekundę.

Ustawienie Kiedy wybrać Kompromis
720P Treści zorientowane na media społecznościowe, wideo pionowe, iteracje testowe Niższy koszt, widoczna miękkość na dużych ekranach
1080P Prezentacje produktów, kinowe prewizualizacje, kreacje reklamowe Wyższy koszt, ostrzejsze detale
16:9 YouTube, osadzenia na stronach internetowych Standardowy szeroki ekran
9:16 Reels, TikTok, Shorts Pionowy mobilny
1:1 Posty w feedzie, kwadratowe osadzenia Neutralny dla wielu platform
4:3 / 3:4 Redakcyjny, styl vintage Nisza

Czas trwania wpływa na koszt liniowo. Renderowanie 10-sekundowego klipu kosztuje mniej więcej 5 razy więcej niż 2-sekundowego w tej samej rozdzielczości. Do iteracji, pracuj krótko. Do finalnej wersji, idź na całość.

Rozsądne ustawienia domyślne dla nowych użytkowników: 720P, 5 sekund, 16:9. Potwierdź, że ujęcie działa, a następnie przejdź na 1080P dla wersji finalnej.

Jak wybrać odpowiedni tryb Wan 2.7?

Drzewo decyzyjne jest proste, gdy wiesz, jakie masz dane wejściowe.

Diagram przepływu pracy pokazujący 5 etapów: Wejście, Wykrywanie Trybu, Routing Modelu, Generowanie, Wyjście.

  • Masz tylko pomysł: użyj T2V. Iteruj nad promptem przed dodaniem wizualizacji.
  • Masz jedno zdjęcie produktu: użyj trybu I2V pierwszej klatki.
  • Masz dwie klatki kluczowe, które muszą być początkiem i końcem: użyj I2V pierwszej i ostatniej klatki.
  • Masz krótki klip, który wymaga rozszerzenia: użyj I2V kontynuacji wideo.
  • Masz portret plus lektora: użyj I2V sterowanego dźwiękiem.
  • Potrzebujesz zachowania tożsamości lub głosu w różnych ujęciach: użyj R2V.
  • Masz istniejący materiał, który wymaga edycji lub zmiany stylu: użyj edycji wideo.

Jeśli nie jesteś pewien, zacznij od centrum rodziny PixMind Wan i wybierz według przypadku użycia, a nie nazwy trybu.

Jak tworzyć prompty dla Wan 2.7?

Struktura promptu ma większe znaczenie niż jego długość. Wan 2.7 nagradza pięciosegmentową anatomię: podmiot, akcja, sceneria, kamera, styl.

Przykładowa struktura:

Podmiot: szklana butelka perfum na ciemnej powierzchni. Akcja: strumień kropelek wybucha w prawo. Sceneria: czarne tło studyjne, pojedyncze światło kluczowe z lewej strony kamery. Kamera: statyczne ujęcie średnie, ekwiwalent 50mm. Styl: kinowy, płytka głębia ostrości, ciepłe światło konturowe.

Każdy segment zawęża przestrzeń wyjściową. Brakujące segmenty domyślnie przyjmują wcześniejsze ustawienia modelu, które są zazwyczaj ogólne.

Aby uzyskać głębsze wzorce promptów, klaster promptów wieloujęciowych PixMind obejmuje 12 struktur wielokrotnego użytku, w tym sekwencje wieloujęciowe, wzorce synchronizacji dźwięku i storyboardy pierwszej i ostatniej klatki.

Dwie pułapki promptów, których należy unikać:

  • Przeładowane prompty: więcej niż pięć tematów w jednym prompcie myli model. Podziel na wiele renderów.
  • Nadmierne użycie negatywnych promptów: Wan 2.7 nie waży negatywnych promptów tak, jak robią to modele obrazu. Utrzymuj je krótkie.

Jak Wan 2.7 wypada w porównaniu z innymi modelami?

Wan 2.7 znajduje się w zatłoczonym polu. Sora 2, VEO 3, Kling 2.0 i Seedance wszystkie celują w nakładające się przypadki użycia. Różnica polega na tym, które tryby każdy model udostępnia i jakim kosztem.

Zdolność Wan 2.7 Sora 2 VEO 3 Kling 2.0
Tekst-do-Wideo Tak Tak Tak Tak
Obraz-do-Wideo Tak Ograniczone Tak Tak
Pierwsza-Ostatnia-Klatka Tak Nie Ograniczone Ograniczone
Wideo Referencyjne (R2V) Tak Nie Nie Ograniczone
I2V Sterowane Dźwiękiem Tak Tak Tak Ograniczone
Maks. czas trwania 15s 20s 8s 10s
Maks. rozdzielczość 1080P 1080P 1080P 1080P

Ta tabela odzwierciedla specyfikacje opublikowane przez dostawców na lipiec 2026. Niezależne testy bezpośrednie znajdują się w naszym teście promptów Wan 2.7 kontra Sora 2 oraz w pojedynku VEO i Kling.

Charakterystyczną przewagą Wan 2.7 jest połączenie trybu pierwszej i ostatniej klatki z R2V. Żaden inny model w tabeli nie udostępnia obu tych funkcji w pełnym zakresie. Jeśli Twój przepływ pracy wymaga precyzyjnej kontroli początku i końca oraz zachowania tożsamości, Wan 2.7 jest obecnie jedyną ścieżką z jednym modelem.

Jakie są typowe tryby awarii?

Każdy model wideo AI zawodzi. Nazwanie trybów awarii pomaga szybciej dostarczać.

  • Zniekształcenia na powierzchniach odbijających światło: szkło, lustra, polerowany metal. Złagodź, zmniejszając amplitudę ruchu w prompcie.
  • Dryf tożsamości w ujęciach: twarze zmieniają się między generacjami. Złagodź za pomocą referencyjnych danych wejściowych R2V.
  • Halucynowany tekst w klatkach: znaki, etykiety, loga renderują się jako bełkot. Złagodź, usuwając tekst z obrazów wejściowych.
  • Niezgodność proporcji obrazu: podanie obrazu 9:16 do generacji 16:9 powoduje nieoczekiwane przycięcie. Dopasuj proporcje wejściowe do wyjściowych.
  • Wypalanie kredytów przy długich iteracjach: 10-sekundowe rendery testowe szybko zużywają kredyty. Iteruj przy 2-3 sekundach.

Klaster przypadków użycia PixMind zawiera notatki dotyczące trybów awarii dla każdego scenariusza, w tym marketingu produktów, wydajności postaci, kinowej prewizualizacji i haczyków społecznościowych.

Wan 2.7 Generator Wideo FAQ

Czy Wan 2.7 jest darmowy do wypróbowania?

Tak. Strona PixMind Wan 2.7 zawiera darmową wersję próbną bez wymaganej karty kredytowej. Płatne plany aktywują się dopiero po przekroczeniu limitu próbnego.

Czy Wan 2.7 obsługuje 4K?

Nie. Wideo Wan 2.7 osiąga maksymalnie 1080P. Model obrazu Wan 2.7 obsługuje zdjęcia 4K poprzez poziom Pro, ale wyjście wideo jest ograniczone do 1080P.

Czy Wan 2.7 może sklonować twarz konkretnej osoby?

Wan 2.7 może zachować tożsamość z danych referencyjnych, ale polityka PixMind zabrania niekonsensualnego klonowania wizerunku prawdziwych, możliwych do zidentyfikowania osób. Użyj R2V z oryginalnymi postaciami, referencjami stockowymi lub własnym wizerunkiem.

Ile czasu zajmuje jedno renderowanie w Wan 2.7?

Czas generowania zależy od czasu trwania, rozdzielczości i obciążenia. Typowe 5-sekundowe rendery 720P kończą się w 60-90 sekund. 10-sekundowe rendery 1080P mogą trwać 3-5 minut. API zwraca identyfikator zadania, który można odpytywać o status.

Czy Wan 2.7 generuje dźwięk?

Tak, ale tylko w trybach, które akceptują wejście audio. T2V może przyjąć ścieżkę dźwiękową i zsynchronizować z nią ruch. Tryb I2V sterowany dźwiękiem wykorzystuje dźwięk do synchronizacji ruchu warg i ruchu. Czyste generowanie dźwięku (muzyka, efekty dźwiękowe) to oddzielny model Alibaba.

Czy mogę używać wyników Wan 2.7 komercyjnie?

Tak. Wygenerowane przez Ciebie materiały możesz wykorzystywać komercyjnie zgodnie z warunkami Alibaba Cloud Model Studio. Przed wysyłką zapoznaj się z aktualnymi warunkami na przeglądzie Alibaba Cloud Model Studio.

Zobacz to w akcji

继续浏览中,生成器即将加载...