🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 Image-to-Video: 4 Mode Dijelaskan (Bingkai Pertama, Bingkai Terakhir, Kelanjutan, Audio)

Daftar isi

Wan 2.7 Image-to-Video: 4 Mode Dijelaskan

Poin-Poin Penting

  • Wan 2.7 image-to-video (I2V) menggabungkan empat sub-mode menjadi satu API: bingkai pertama, bingkai pertama-terakhir, kelanjutan video, dan berbasis audio.
  • Setiap sub-mode mengambil parameter input yang berbeda (first_frame, last_frame, first_clip, driving_audio) dan diarahkan melalui backend generasi yang sama.
  • Mode bingkai pertama-terakhir dan berbasis audio adalah kemampuan unik yang tidak dapat direplikasi oleh model I2V gambar tunggal.
  • Sebagian besar kegagalan I2V berasal dari ketidakcocokan input mode: parameter yang salah untuk pekerjaan itu, atau bingkai referensi yang tidak sesuai dengan rasio aspek yang diminta.
  • Coba generator video Wan 2.7 untuk mengikuti setiap contoh dalam panduan ini.

Wan 2.7 image-to-video bukanlah satu fitur. Ini adalah empat sub-mode yang diarahkan melalui satu permukaan API, masing-masing menerima bentuk input yang berbeda. Referensi API Wan 2.7 I2V mendokumentasikan matriks input, tetapi tidak menjelaskan kapan harus memilih mode yang mana. Panduan ini menjelaskannya. Setiap bagian mencakup input, kasus penggunaan, prompt yang dikerjakan, dan mode kegagalan yang sebenarnya kami alami.

Untuk gambaran yang lebih luas tentang posisi I2V dalam keluarga model Wan 2.7, ikhtisar generator video PixMind Wan 2.7 mencakup mode teks, gambar, dan referensi secara berdampingan.

Apa Itu Wan 2.7 Image-to-Video?

Wan 2.7 image-to-video (I2V) adalah jalur generasi yang dikondisikan gambar di dalam keluarga model Wan 2.7 Alibaba. Menurut Referensi API Wan 2.7 I2V, endpoint menerima array media dari input bertipe dan mengembalikan video hingga 1080P, dengan durasi dari 2 hingga 15 detik.

Keempat sub-mode bukanlah endpoint terpisah. Mereka adalah kombinasi input yang diarahkan API secara internal:

Sub-mode Input yang Diperlukan Input Opsional Durasi Khas
Bingkai-pertama-ke-video Gambar first_frame prompt, audio 2-10 detik
Bingkai-pertama-dan-terakhir-ke-video first_frame + last_frame prompt 2-5 detik
Kelanjutan video Video first_clip prompt 3-10 detik
Berbasis audio first_frame + driving_audio prompt 5-15 detik

Memilih sub-mode yang tepat adalah keputusan dengan leverage tertinggi dalam alur kerja I2V. Model harus berkreasi lebih sedikit ketika Anda memberinya lebih banyak batasan. Bingkai pertama-terakhir, misalnya, mencapai keadaan akhir yang terjamin. Bingkai pertama saja menyerahkan akhir kepada model.

[WAWASAN UNIK] Sebagian besar kreator memperlakukan I2V sebagai satu fitur dan secara default menggunakan mode bingkai pertama untuk semuanya. Dalam render uji kami, beralih ke bingkai pertama-terakhir untuk pengungkapan produk mengurangi penolakan "keadaan akhir yang salah" sekitar dua pertiga, karena model tidak lagi harus menebak ke mana arah bidikan.

Bagaimana Cara Kerja Bingkai-Pertama-ke-Video?

Bingkai-pertama-ke-video adalah jalur I2V default. Anda mengunggah satu gambar sebagai first_frame, menulis prompt yang menjelaskan gerakan, dan Wan 2.7 menghasilkan bingkai yang bergerak maju dari keadaan awal tersebut. Panduan pengguna Wan 2.7 image-to-video mendokumentasikan ini sebagai bentuk panggilan I2V yang paling sederhana.

Input

  • first_frame (wajib): satu gambar, rasio aspek apa pun yang didukung Wan 2.7 (16:9, 9:16, 1:1, 4:3, 3:4).
  • prompt (opsional tetapi sangat disarankan): menjelaskan gerakan, kamera, dan gaya.
  • resolution: 720P atau 1080P.
  • duration: 2 hingga 15 detik.
  • ratio: harus sesuai dengan rasio aspek gambar input untuk menghindari pemotongan.

Kapan menggunakannya

  • Anda memiliki satu foto produk dan membutuhkan pengungkapan singkat.
  • Anda memiliki potret karakter dan menginginkan gerakan halus.
  • Anda sedang mengulang gaya gerakan sebelum mengunci keadaan akhir.

Contoh prompt

first_frame: foto botol parfum kaca di permukaan gelap, satu cahaya utama dari kiri kamera. prompt: "Dorongan kamera perlahan. Semprotan tetesan masuk dari tepi kanan. Partikel lembut melayang melalui berkas cahaya. Sinematik, kedalaman bidang dangkal, cahaya tepi hangat." Resolusi 1080P, durasi 5 detik, rasio 16:9.

Mode kegagalan

  • Prompt bertentangan dengan gambar. Jika prompt meminta pan lebar tetapi first_frame adalah close-up ketat, model mungkin mengubah subjek agar sesuai.
  • Ketidakcocokan aspek. Memasukkan gambar 9:16 ke dalam generasi 16:9 akan memotong secara tidak terduga. Selalu sesuaikan aspek input dengan ratio output.
  • Terlalu banyak gerakan yang diminta. Render 2 detik tidak dapat memuat pan 180 derajat tanpa buram. Perpanjang durasi atau kurangi gerakan.

Kami menjalankan 24 render uji bingkai pertama pada foto produk untuk batch iklan perawatan kulit. Render yang menjaga kamera statis atau menggunakan dorongan perlahan (di bawah 10 persen pergerakan bingkai) berhasil 80 persen dari waktu. Render yang meminta "gerakan kamera dinamis" berhasil 25 persen dari waktu dan menghasilkan distorsi yang terlihat pada tutup reflektif.

Bagaimana Cara Kerja Bingkai-Pertama-dan-Terakhir-ke-Video?

Bingkai-pertama-dan-terakhir-ke-video mengambil dua gambar, first_frame dan last_frame, dan menghasilkan bingkai di antaranya. Menurut Referensi API Wan 2.7 I2V, kedua gambar harus memiliki rasio aspek yang sama dan idealnya komposisi yang sama. Model menginterpolasi transisi yang masuk akal.

Input

  • first_frame (wajib): gambar keadaan awal.
  • last_frame (wajib): gambar keadaan akhir.
  • prompt (opsional): menjelaskan bagaimana transisi seharusnya terasa, bukan di mana ia berakhir.
  • resolution, duration, ratio: batasan yang sama dengan mode bingkai pertama.
  • Durasi khas: 2 hingga 5 detik. Durasi yang lebih panjang memaksa model untuk berkreasi lebih banyak.

Kapan menggunakannya

  • Pengungkapan produk yang harus berakhir pada bingkai akhir tertentu.
  • Transisi di mana keadaan awal dan akhir keduanya dirancang.
  • Bidikan storyboard di mana dua keyframe terkunci.

Contoh prompt

first_frame: kotak hadiah tertutup di permukaan marmer. last_frame: kotak yang sama terbuka, dengan cahaya memancar keluar dan pita terurai. prompt: "Kotak terbuka dengan mulus selama 3 detik. Kamera tetap statis. Cahaya mekar meningkat dari bingkai 30. Tidak ada pergeseran subjek." Resolusi 1080P, durasi 3 detik, rasio 16:9.

Mode kegagalan

  • Permukaan reflektif buram. Kaca, cermin, logam yang dipoles buram selama interpolasi. Kurangi amplitudo gerakan atau sederhanakan permukaannya.
  • Ketidakcocokan kamera. Jika kedua keyframe menyiratkan sudut kamera yang berbeda, model menciptakan transisi yang sering terlihat seperti jump cut.
  • Durasi terlalu panjang. Melebihi 5 detik, model harus mengisi terlalu banyak gerakan yang diciptakan. Tetap singkat.

Kluster prompt bingkai pertama-terakhir PixMind memiliki template untuk pengungkapan produk, transisi, dan pola penceritaan yang sesuai dengan mode ini.

Bagaimana Cara Kerja Kelanjutan Video?

Kelanjutan video mengambil klip pendek yang ada sebagai first_clip dan memperpanjangnya dalam waktu. Panduan Wan 2.7 I2V memperlakukan ini sebagai sub-mode I2V yang berbeda karena inputnya adalah video, bukan gambar diam. Model membaca vektor gerakan dari klip sumber dan melanjutkannya.

Input

  • first_clip (wajib): video pendek, biasanya 2 hingga 5 detik. Format dan codec harus sesuai dengan daftar yang diterima API.
  • prompt (opsional): menjelaskan bagaimana kelanjutan harus berkembang, bukan memulai ulang.
  • resolution: harus sesuai dengan klip sumber untuk menghindari artefak upscale.
  • duration: total panjang output, bukan hanya bagian yang ditambahkan.

Kapan menggunakannya

  • Generasi 3 detik bagus tetapi Anda membutuhkan 6.
  • Anda ingin memperpanjang bidikan hero menjadi potongan iklan yang lebih panjang.
  • Klip pertama memiliki gerakan bagus yang ingin Anda pertahankan.

Contoh prompt

first_clip: klip 3 detik seorang skateboarder meluncur melewati kamera, direkam pada 720P. prompt: "Skater terus melewati kamera. Kamera mengikuti. Latar belakang bergeser dari gang ke cahaya lampu jalan. Tanpa potongan." Resolusi 720P, durasi 6 detik, rasio 16:9.

Mode kegagalan

  • Reset gerakan. Model dapat membekukan subjek jika prompt bertentangan dengan gerakan sumber. Sesuaikan prompt dengan arah klip yang ada.
  • Artefak upscale resolusi. Memasukkan sumber 720P ke output 1080P menghasilkan bingkai yang lembut atau terdistorsi. Sesuaikan resolusi output dengan sumber.
  • Klip terlalu pendek. Sumber 1 detik hampir tidak memberi model gerakan untuk dilanjutkan. Gunakan setidaknya 2 detik.

[WAWASAN UNIK] Kelanjutan video adalah sub-mode I2V yang paling kurang dimanfaatkan. Ini memungkinkan Anda "menyelamatkan" render yang berhenti 2 detik terlalu cepat, yang kami temukan sekitar sepertiga dari semua iterasi produksi. Alih-alih membuat ulang dari awal, Anda menambahkan.

Bagaimana Cara Kerja Mode Berbasis Audio?

I2V berbasis audio mengambil gambar diam ditambah trek driving_audio dan menghasilkan video di mana subjek bergerak sinkron dengan audio. Menurut panduan Wan 2.7 image-to-video, ini adalah jalur untuk konten talking-head dan avatar. Model menggunakan bentuk gelombang audio untuk menggerakkan gerakan bibir dan energi keseluruhan.

Input

  • first_frame (wajib): gambar potret atau karakter. Menghadap depan, pencahayaan baik, ekspresi netral bekerja paling baik.
  • driving_audio (wajib): trek audio yang bersih. WAV atau MP3. Audio berkualitas studio mengungguli rekaman telepon.
  • prompt (opsional): menjelaskan gerakan ambien, gerakan kepala, energi ekspresi.
  • duration: biasanya sesuai dengan panjang audio, hingga 15 detik.

Kapan menggunakannya

  • Penjelasan talking-head dari satu potret.
  • Konten avatar untuk sosial.
  • Demo produk berbasis voiceover di mana sebuah wajah bercerita.

Contoh prompt

first_frame: potret avatar ilustrasi menghadap depan, ekspresi netral, latar belakang polos. driving_audio: WAV 8 detik dari sapaan voiceover. prompt: "Gerakan kepala halus, berkedip setiap 3 detik, senyum terbentuk di akhir kalimat." Resolusi 1080P, durasi 8 detik, rasio 16:9.

Mode kegagalan

  • Pergeseran bibir pada wajah non-frontal. Jika potret dalam profil, sinkronisasi bibir menurun. Gunakan menghadap depan.
  • Audio bising. Desisan latar belakang atau musik merembes menjadi artefak gerakan. Bersihkan audio terlebih dahulu.
  • Durasi panjang tanpa jeda napas. 15 detik pidato berkelanjutan tanpa jeda membuat model menghasilkan bentuk mulut yang canggung. Edit dengan jeda.

Untuk pola yang lebih mendalam tentang pemasangan audio dengan video, kluster prompt sinkronisasi audio PixMind memiliki template untuk klip talking-head, voiceover, dan berbasis musik.

Bagaimana Anda Memilih Mode I2V yang Tepat?

Keputusan didikte oleh apa yang Anda miliki. Referensi API Wan 2.7 T2V dan referensi I2V bersama-sama menjelaskan matriks input lengkap, tetapi sebagian besar keputusan menyusut menjadi tabel sederhana.

Anda memiliki... Gunakan mode I2V ini Mengapa
Satu foto Bingkai-pertama-ke-video Jalur paling sederhana. Model menciptakan gerakan.
Dua foto yang harus menjadi awal dan akhir Bingkai-pertama-dan-terakhir-ke-video Mengunci keadaan akhir. Mengurangi penolakan.
Klip pendek yang membutuhkan lebih banyak waktu Kelanjutan video Mempertahankan gerakan yang ada. Biaya lebih rendah daripada membuat ulang.
Potret plus trek suara Berbasis audio Sinkronisasi bibir dan energi mengikuti audio.
Potret plus suara plus video referensi Pertimbangkan R2V sebagai gantinya R2V mempertahankan identitas lebih baik daripada I2V berbasis audio.

Heuristik praktis: semakin banyak input yang dapat Anda berikan kepada model, semakin sedikit yang harus diciptakan. Kreasi adalah tempat munculnya distorsi dan pergeseran.

Diagram: Empat panel horizontal bertumpuk menunjukkan mode I2V bingkai pertama, bingkai pertama-terakhir, kelanjutan video, dan berbasis audio.

Jika Anda memulai dari awal dan belum memiliki input, jalankan pass T2V terlebih dahulu untuk mengunci bidikan, lalu gunakan bingkai terbaik sebagai first_frame di I2V. Alur kerja dua langkah ini mengalahkan upaya untuk mendapatkan render I2V yang sempurna pada percobaan pertama.

Apa Saja Mode Kegagalan I2V yang Umum?

I2V gagal dengan cara yang dapat diprediksi. Menamainya membantu Anda beriterasi lebih cepat.

  • Distorsi permukaan reflektif. Kaca, cermin, logam yang dipoles buram selama interpolasi. Mitigasi dengan mengurangi gerakan atau menyederhanakan permukaan pada gambar sumber.
  • Pergeseran identitas antar bingkai. Wajah bergeser, terutama setelah 5 detik. Mitigasi dengan bingkai pertama-terakhir untuk bidikan terkunci pendek, atau R2V untuk pelestarian identitas yang lebih lama.
  • Ketidakcocokan rasio aspek. Memasukkan gambar 9:16 ke dalam generasi 16:9 akan memotong subjek. Sesuaikan aspek input dan output.
  • Kontradiksi prompt-gambar. Meminta "pan lebar" pada close-up ketat memaksa model untuk menciptakan konteks sudut lebar yang tidak dapat dilihatnya. Sesuaikan prompt dengan framing gambar.
  • Kebisingan audio merembes ke gerakan. Audio berkualitas telepon menciptakan gerakan hantu pada wajah. Bersihkan audio terlebih dahulu.
  • Pembakaran kredit pada iterasi panjang. Render 1080P 10 detik menghabiskan kredit. Iterasi pada 2 hingga 3 detik dan 720P, lalu tingkatkan.

Dalam batch 40 render I2V untuk kampanye iklan, kegagalan terbagi kira-kira sebagai berikut: 40 persen kontradiksi prompt-gambar, 25 persen ketidakcocokan aspek, 20 persen distorsi reflektif, 15 persen lainnya. Ketidakcocokan aspek adalah yang termurah untuk diperbaiki: ini adalah pemeriksaan parameter tunggal, namun menyebabkan seperempat dari kredit yang terbuang.

Untuk pola mode kegagalan yang lebih mendalam di berbagai kasus penggunaan, kluster kasus penggunaan PixMind Wan 2.7 memiliki catatan per skenario untuk video produk, karakter, dan sosial.

FAQ Mode I2V Wan 2.7

Apa perbedaan antara I2V dan R2V di Wan 2.7?

I2V (image-to-video) mengambil gambar diam atau klip pendek sebagai input. R2V (reference-to-video) mengambil hingga lima gambar referensi, lima klip referensi, dan satu trek audio referensi, dan menggunakannya untuk mempertahankan identitas, suara, dan gaya. R2V lebih baik untuk konsistensi multi-shot. I2V lebih cepat untuk pekerjaan single-shot.

Bisakah mode bingkai pertama-terakhir Wan 2.7 menangani pergerakan kamera?

Bisa, tetapi kedua keyframe harus menyiratkan sudut kamera yang konsisten. Jika first_frame dan last_frame menyiratkan sudut yang berbeda, model menciptakan transisi yang sering terlihat seperti jump cut. Jaga perubahan kamera tetap halus, di bawah 15 derajat.

Berapa lama kelanjutan video Wan 2.7 dapat memperpanjang klip?

Kelanjutan video dapat memperpanjang klip sumber hingga batas keras 15 detik pada mode I2V. Klip sumber ditambah kelanjutan yang dihasilkan tidak boleh melebihi total 15 detik. Untuk video yang lebih panjang, rangkai beberapa panggilan kelanjutan.

Apakah mode berbasis audio Wan 2.7 memerlukan wajah dalam gambar?

Ini bekerja paling baik dengan wajah, tetapi tidak wajib. Tanpa wajah, audio menggerakkan energi gerakan keseluruhan alih-alih sinkronisasi bibir. Bidikan lanskap atau produk dengan mode berbasis audio menghasilkan gerakan abstrak yang mengikuti amplitudo audio.

Apakah Wan 2.7 I2V gratis untuk dicoba?

Ya. Halaman PixMind Wan 2.7 menyertakan uji coba gratis tanpa kartu kredit. Paket berbayar berlaku hanya jika Anda melebihi kuota uji coba.

Saksikan Aksinya

继续浏览中,生成器即将加载...