Wan 2.7 Video Generator: Panduan Lengkap untuk Mode Teks, Gambar, dan Referensi
Poin-Poin Penting
- Wan 2.7 adalah satu model terpadu yang mencakup text-to-video (T2V), image-to-video (I2V), dan reference-to-video (R2V) dalam satu alur kerja.
- Ini mendukung output 720P dan 1080P, durasi 2 hingga 15 detik, dan lima rasio aspek termasuk 16:9, 9:16, dan 1:1.
- Mode bingkai awal-akhir dan berbasis audio memberi Anda kontrol status awal dan status akhir yang tidak dapat ditandingi oleh model I2V gambar tunggal.
- Reference-to-video (R2V) menerima hingga lima gambar referensi, lima klip referensi, dan satu trek audio referensi dalam satu panggilan.
- Coba Wan 2.7 video generator untuk mengikuti contoh apa pun dalam panduan ini.
Apa Itu Wan 2.7 Video Generator?
Wan 2.7 adalah model generasi video terbaru dari tim Wan Alibaba, yang diekspos melalui Alibaba Cloud Model Studio. Ini menyatukan empat kemampuan yang sebelumnya terpisah menjadi satu keluarga model: text-to-video, image-to-video, reference-to-video, dan pengeditan video. Menurut ikhtisar generasi video Alibaba Cloud, model ini menerima input multimodal dan menghasilkan MP4 atau MOV hingga 1080P.
Pergeseran kunci dalam 2.7 adalah penyatuan alur kerja. Daripada beralih antar vendor untuk text-to-video dan image-to-video, Anda memanggil model yang sama dan membiarkan API merutekan berdasarkan input yang Anda berikan. Ini sesuai dengan halaman produk PixMind Wan 2.7, di mana satu antarmuka pembuatan menangani setiap mode.
Bagi para kreator, ini penting karena perpindahan mode adalah tempat sebagian besar waktu produksi terbuang. Anda menulis prompt, merender, menyadari status awal salah, lalu membangun kembali dari awal di alat yang berbeda. Antarmuka terpadu Wan 2.7 memungkinkan Anda menukar input tanpa menukar model.
Berapa Banyak Mode yang Didukung Wan 2.7?
Wan 2.7 mengekspos empat mode. Referensi API I2V mendokumentasikan matriks input lengkap. Berikut adalah rincian praktisnya.
| Mode | Input | Terbaik Untuk | Durasi Maks | Resolusi Maks |
|---|---|---|---|---|
| T2V (Text-to-Video) | Prompt teks, audio opsional | Storyboarding, gerakan abstrak, B-roll | 15dtk | 1080P |
| I2V (Image-to-Video) | Bingkai pertama, bingkai terakhir opsional, audio opsional | Pengungkapan produk, aksi karakter, animasi | 15dtk | 1080P |
| R2V (Reference-to-Video) | Hingga 5 gambar referensi + 5 klip referensi + audio referensi | Pelestarian identitas, kloning suara, adegan multi-karakter | 10dtk | 1080P |
| Video Edit | Video sumber + instruksi | Transfer gaya, pengeditan berbasis instruksi | 10dtk | 1080P |

Text-to-Video (T2V)
T2V mengambil prompt teks dan menghasilkan video. Referensi API T2V Wan 2.7 mencantumkan parameter yang didukung termasuk resolusi, durasi, rasio, dan trek audio opsional. T2V adalah jalur tercepat dari ide ke klip.
Gunakan T2V ketika Anda tidak memiliki bingkai awal yang tetap. Gerakan abstrak, B-roll, storyboard, dan urutan bergaya semuanya cocok. Hindari T2V ketika status awal penting: jika Anda memerlukan produk tertentu di layar pada bingkai nol, beralihlah ke I2V.
Image-to-Video (I2V)
I2V adalah tempat penyatuan alur kerja Wan 2.7 terlihat. Panduan pengguna image-to-video Wan 2.7 mendokumentasikan empat sub-mode:
- First-frame-to-video: satu gambar menjadi status awal, model menciptakan gerakan.
- First-and-last-frame-to-video: dua gambar mendefinisikan status awal dan akhir, model melakukan interpolasi.
- Video continuation: klip pendek menjadi status awal, model memperpanjangnya.
- Audio-driven: gambar ditambah trek audio menggerakkan sinkronisasi bibir atau gerakan.
Untuk panduan lebih mendalam tentang empat jalur I2V, lihat kluster prompt bingkai awal-akhir PixMind.
Reference-to-Video (R2V)
R2V adalah mode yang paling kuat dan paling kurang terdokumentasi. Referensi API R2V Wan 2.7 menjelaskan panggilan yang menerima hingga lima gambar referensi, lima klip referensi, dan satu trek audio referensi. Model ini menggunakan ini untuk mempertahankan identitas, suara, dan gaya di seluruh output.
R2V adalah yang harus digunakan ketika Anda membutuhkan karakter untuk terlihat sama di seluruh bidikan, atau ketika Anda ingin mengkloning suara ke adegan baru. Komprominya adalah durasi: R2V dibatasi 10 detik, lebih pendek dari batas 15 detik T2V dan I2V.
Pengeditan Video
Pengeditan video mengambil video sumber ditambah instruksi teks dan mengembalikan klip yang diedit. API pengeditan video Wan 2.7 mendukung pengeditan berbasis instruksi dan transfer gaya. Mode ini berada di luar cakupan panduan generasi, tetapi patut diketahui keberadaannya.
Bagaimana Cara Kerja Mode Bingkai Awal-Akhir?
Bingkai awal-akhir adalah sub-mode dari I2V. Anda memberikan dua gambar: satu untuk bingkai pertama, satu untuk yang terakhir. Wan 2.7 menghasilkan bingkai di antaranya.

Ini penting karena I2V gambar tunggal menyerahkan status akhir kepada model. Jika bidikan Anda perlu mendarat pada bingkai tertentu (produk yang diputar sepenuhnya, kotak yang terbuka sepenuhnya, karakter yang berbalik sepenuhnya), bingkai awal-akhir adalah cara Anda menjamin pendaratan tersebut.
Pola praktisnya adalah: ambil atau hasilkan dua keyframe, unggah sebagai yang pertama dan terakhir, atur durasi, render. Wan 2.7 menginterpolasi gerakan di antara keduanya. Halaman prompt bingkai awal-akhir PixMind memiliki templat prompt untuk pengungkapan produk, transisi, dan pola penceritaan.
Mode kegagalan umum yang perlu diperhatikan:
- Distorsi pada permukaan reflektif: kaca, logam, dan air dapat buram selama interpolasi.
- Pergeseran identitas pada karakter: wajah dapat bergeser antar bingkai.
- Inkonsistensi kamera: jika kedua keyframe menyiratkan sudut kamera yang berbeda, model harus menciptakan transisi.
Uji dengan durasi pendek terlebih dahulu (2-3 detik) sebelum berkomitmen pada render 5-10 detik.
Bagaimana Cara Kerja Video Berbasis Audio?
Mode berbasis audio mengambil gambar diam ditambah trek audio dan menghasilkan video di mana subjek tampak berbicara atau bergerak sinkron dengan audio. Ini adalah dasar dari konten talking-head dan avatar.
Model ini menggunakan bentuk gelombang audio untuk menggerakkan dua hal: gerakan bibir (jika ada wajah) dan energi gerakan keseluruhan. API I2V Wan 2.7 menerima audio sebagai bagian dari array media, menggunakan tipe driving_audio.
Untuk kasus penggunaan talking-head, pasangkan ini dengan kluster kinerja karakter PixMind. Kombinasi I2V berbasis audio ditambah potret referensi yang bersih adalah jalur terbuka terbaik saat ini untuk avatar yang disinkronkan bibir tanpa melatih model kustom.
Dua catatan praktis:
- Kualitas audio mendorong kualitas video. Rekaman studio yang bersih mengungguli mikrofon ponsel.
- Uji dengan klip 3 detik terlebih dahulu. Masalah sinkronisasi lebih mudah ditangkap lebih awal.
Resolusi, Durasi, dan Rasio Aspek Apa yang Harus Anda Pilih?
Wan 2.7 mendukung output 720P dan 1080P. Komprominya adalah biaya versus ketajaman. Menurut strategi harga PixMind, 1080P mengonsumsi sekitar dua kali lipat kredit 720P per detik.
| Pengaturan | Kapan Memilih | Kompromi |
|---|---|---|
| 720P | Konten yang mengutamakan sosial, video vertikal, iterasi pengujian | Biaya lebih rendah, kelembutan terlihat di layar besar |
| 1080P | Showcase produk, previs sinematik, materi iklan | Biaya lebih tinggi, detail lebih tajam |
| 16:9 | YouTube, sematan situs web | Layar lebar standar |
| 9:16 | Reels, TikTok, Shorts | Vertikal seluler |
| 1:1 | Postingan feed, sematan persegi | Netral lintas platform |
| 4:3 / 3:4 | Editorial, gaya vintage | Niche |
Durasi mendorong biaya secara linier. Render 10 detik berharga sekitar 5x render 2 detik pada resolusi yang sama. Untuk iterasi, kerjakan yang pendek. Untuk final, kerjakan yang panjang.
Default yang masuk akal untuk pengguna baru: 720P, 5 detik, 16:9. Konfirmasikan bidikan berfungsi, lalu tingkatkan ke 1080P untuk final.
Bagaimana Cara Memilih Mode Wan 2.7 yang Tepat?
Pohon keputusan mudah setelah Anda tahu input apa yang Anda miliki.

- Anda hanya punya ide: gunakan T2V. Ulangi prompt sebelum menambahkan visual.
- Anda punya satu foto produk: gunakan mode bingkai pertama I2V.
- Anda punya dua keyframe yang harus menjadi awal dan akhir: gunakan bingkai awal-akhir I2V.
- Anda punya klip pendek yang perlu diperpanjang: gunakan kelanjutan video I2V.
- Anda punya potret ditambah sulih suara: gunakan I2V berbasis audio.
- Anda membutuhkan pelestarian identitas atau suara di seluruh bidikan: gunakan R2V.
- Anda punya rekaman yang ada yang membutuhkan pengeditan atau perubahan gaya: gunakan pengeditan video.
Jika Anda tidak yakin, mulailah di pusat keluarga PixMind Wan dan pilih berdasarkan kasus penggunaan daripada nama mode. Pusat ini akan mengarahkan Anda ke antarmuka yang tepat berdasarkan apa yang ingin Anda buat.
Bagaimana Seharusnya Anda Memberi Prompt pada Wan 2.7?
Struktur prompt lebih penting daripada panjang prompt. Wan 2.7 menghargai anatomi lima segmen: subjek, aksi, latar, kamera, gaya.
Struktur contoh:
Subjek: botol parfum kaca di permukaan gelap. Aksi: semprotan tetesan meletus ke kanan. Latar: latar belakang hitam studio, satu lampu kunci dari kiri kamera. Kamera: bidikan medium statis, setara 50mm. Gaya: sinematik, kedalaman bidang dangkal, cahaya tepi hangat.
Setiap segmen mempersempit ruang output. Segmen yang hilang akan menggunakan default model sebelumnya, yang biasanya generik.
Untuk pola prompt yang lebih mendalam, kluster prompt multi-bidikan PixMind mencakup 12 struktur yang dapat digunakan kembali termasuk urutan multi-bidikan, pola sinkronisasi audio, dan storyboard bingkai awal-akhir.
Dua jebakan prompt yang harus dihindari:
- Prompt berlebihan: lebih dari lima subjek dalam satu prompt membingungkan model. Pisahkan menjadi beberapa render.
- Penggunaan berlebihan prompt negatif: Wan 2.7 tidak memberi bobot pada prompt negatif seperti yang dilakukan model gambar. Buatlah singkat.
Bagaimana Wan 2.7 Dibandingkan dengan Model Lain?
Wan 2.7 berada di bidang yang ramai. Sora 2, VEO 3, Kling 2.0, dan Seedance semuanya menargetkan kasus penggunaan yang tumpang tindih. Diferensiasinya terletak pada mode apa yang diekspos setiap model dan berapa biayanya.
| Kemampuan | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Text-to-Video | Ya | Ya | Ya | Ya |
| Image-to-Video | Ya | Terbatas | Ya | Ya |
| First-Last-Frame | Ya | Tidak | Terbatas | Terbatas |
| Reference-Video (R2V) | Ya | Tidak | Tidak | Terbatas |
| Audio-Driven I2V | Ya | Ya | Ya | Terbatas |
| Durasi Maks | 15dtk | 20dtk | 8dtk | 10dtk |
| Resolusi Maks | 1080P | 1080P | 1080P | 1080P |
Tabel ini mencerminkan spesifikasi yang diterbitkan vendor per Juli 2026. Pengujian head-to-head independen ada di uji prompt Wan 2.7 versus Sora 2 kami dan pertarungan VEO dan Kling.
Keunggulan khas Wan 2.7 adalah bingkai awal-akhir yang dikombinasikan dengan R2V. Tidak ada model lain dalam tabel yang mengekspos keduanya dengan kemampuan penuh. Jika alur kerja Anda membutuhkan kontrol awal-akhir yang tepat ditambah pelestarian identitas, Wan 2.7 saat ini adalah satu-satunya jalur model tunggal.
Apa Saja Mode Kegagalan Umum?
Setiap model video AI gagal. Menamai mode kegagalan membantu Anda mengirimkan lebih cepat.
- Distorsi pada permukaan reflektif: kaca, cermin, logam yang dipoles. Mitigasi dengan mengurangi amplitudo gerakan dalam prompt.
- Pergeseran identitas di seluruh bidikan: wajah bergeser antar generasi. Mitigasi dengan input referensi R2V.
- Teks yang terhalusinasi dalam bingkai: tanda, label, logo dirender sebagai omong kosong. Mitigasi dengan menghapus teks dari gambar input.
- Ketidaksesuaian rasio aspek: memasukkan gambar 9:16 ke dalam generasi 16:9 memotong secara tidak terduga. Sesuaikan aspek input dengan aspek output.
- Pembakaran kredit pada iterasi panjang: render uji 10 detik menghabiskan kredit dengan cepat. Ulangi pada 2-3 detik.
Kluster kasus penggunaan PixMind memiliki catatan mode kegagalan per skenario untuk pemasaran produk, kinerja karakter, previs sinematik, dan kait sosial.
FAQ Wan 2.7 Video Generator
Apakah Wan 2.7 gratis untuk dicoba?
Ya. Halaman PixMind Wan 2.7 menyertakan uji coba gratis tanpa memerlukan kartu kredit. Paket berbayar hanya berlaku jika Anda melebihi kuota uji coba.
Apakah Wan 2.7 mendukung 4K?
Tidak. Video Wan 2.7 mencapai puncaknya pada 1080P. Model gambar Wan 2.7 mendukung gambar diam 4K melalui tingkat Pro, tetapi output video dibatasi pada 1080P.
Bisakah Wan 2.7 mengkloning wajah orang tertentu?
Wan 2.7 dapat mempertahankan identitas dari input referensi, tetapi kebijakan PixMind melarang kloning kemiripan non-konsensual dari orang sungguhan yang dapat diidentifikasi. Gunakan R2V dengan karakter asli, referensi stok, atau kemiripan Anda sendiri.
Berapa lama waktu yang dibutuhkan untuk satu render Wan 2.7?
Waktu generasi tergantung pada durasi, resolusi, dan beban. Render 720P 5 detik biasanya selesai dalam 60-90 detik. Render 1080P 10 detik bisa memakan waktu 3-5 menit. API mengembalikan ID tugas yang Anda polling untuk status.
Apakah Wan 2.7 menghasilkan audio?
Ya, tetapi hanya dalam mode yang menerima input audio. T2V dapat mengambil trek audio dan menyinkronkan gerakan dengannya. Mode I2V berbasis audio menggunakan audio untuk menggerakkan sinkronisasi bibir dan gerakan. Generasi audio murni (musik, efek suara) adalah model Alibaba yang terpisah.
Bisakah saya menggunakan output Wan 2.7 secara komersial?
Ya. Output yang Anda hasilkan adalah milik Anda untuk digunakan secara komersial di bawah ketentuan Alibaba Cloud Model Studio. Tinjau ketentuan saat ini di ikhtisar Alibaba Cloud Model Studio sebelum pengiriman.
Tonton Aksinya
Wan 2.7 shipped 5 features that collectively turn it from a video generator into a video production suite...
— Machina (@EXM7777) April 3, 2026
> First/Last Frame control (define start and end, AI fills the middle)
> 9-grid multi-reference (upload 9 images in a 3x3 grid, model understands your subject from every… https://t.co/dBq6X5XP36 pic.twitter.com/Gzbpcg971b



