Video Avatar Berbasis Audio dengan Wan 2.7
Poin-Poin Penting
- Mode berbasis audio I2V Wan 2.7 memasangkan potret diam dengan klip sulih suara untuk menghasilkan video talking-head yang tersinkronisasi bibir hingga 1080P.
- Alur kerja ini memiliki enam langkah: persiapan potret, perekaman sulih suara, pemeriksaan peralatan, unggah, render, dan pasca-proses.
- Input sumber mendorong kualitas output. Potret menghadap depan dan audio studio mono 48kHz memberikan sinkronisasi bibir yang paling bersih.
- Tiga mode kegagalan yang paling penting: penyimpangan durasi panjang, kebisingan audio, dan penyimpangan sudut potret.
- Mulai dengan render uji 3 detik sebelum menghabiskan kredit untuk hasil akhir 10 detik.
Mengapa Mode Berbasis Audio Wan 2.7 Berhasil untuk Talking Heads
Video talking-head adalah format dominan untuk penjelas, konten kursus, dan komentar sosial bentuk pendek. Menurut [referensi API I2V Alibaba Cloud](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026), titik akhir image-to-video Wan 2.7 menerima bidang driving_audio yang menyinkronkan gerakan mulut, gerakan kepala, dan energi keseluruhan ke bentuk gelombang audio. Anda tidak lagi memerlukan model avatar yang dilatih khusus untuk menghasilkan klip yang tersinkronisasi bibir yang dapat digunakan.
Postingan ini membahas seluruh alur, mulai dari persiapan potret hingga pasca-pemrosesan. Untuk cakupan mode yang lebih luas, lihat panduan video berbasis audio Wan 2.7 kami. Untuk mekanisme I2V yang mendasari, lihat klaster kinerja karakter PixMind, yang merupakan referensi internal utama untuk alur kerja ini.
Apa yang Membuat Avatar Talking-Head yang Baik?
Avatar talking-head yang baik memiliki tiga ciri: identitas yang stabil, gerakan bibir yang meyakinkan, dan gerakan kepala yang alami. [Panduan pengguna image-to-video Wan 2.7](https://help.aliyun.com/zh/model-studio/wan-image-to-video-guide, 2026) mendokumentasikan bahwa model membaca isyarat identitas dari bingkai pertama dan isyarat gerakan dari bentuk gelombang audio, kemudian memadukannya sepanjang durasi render. Kualitas pada kedua sisi pasangan input tersebut menentukan output.
Kesalahan paling umum adalah memperlakukan potret sebagai hal yang belakangan. Kepala miring, pencahayaan samping, atau senyum sebagian pada bingkai nol akan memperburuk setiap bingkai yang dihasilkan. Pilih potret terlebih dahulu, lalu tulis naskahnya.
Tiga format yang sesuai dengan I2V berbasis audio:
- Penjelasan Solo: satu potret, satu sulih suara, satu pengambilan gambar. Kasus penggunaan 80%.
- Pelajaran atau Panduan: potret yang sama, audio yang lebih panjang, dengan model beralih antara gerakan kepala dan ketenangan.
- Dialog Dua Orang: dirender sebagai dua klip terpisah, lalu diedit bersama. Wan 2.7 R2V adalah jalur yang lebih baik untuk interaksi bolak-balik yang sebenarnya, seperti yang didokumentasikan dalam panduan referensi multimodal Wan 2.7 R2V kami.
Penjelasan Solo
Terbaik untuk intro produk, segmen kursus, dan komentar sosial. Satu potret. Satu sulih suara. Satu potongan.
Dialog Dua Orang
Render setiap pembicara secara terpisah sebagai klip I2V berbasis audio. Satukan dalam pasca-produksi. Untuk menjaga identitas kedua pembicara, beralihlah ke R2V dengan gambar referensi.
Langkah 1: Siapkan Potret Menghadap Depan
Persiapan potret adalah tempat sebagian besar render talking-head gagal sebelum audio direkam. [API I2V Wan 2.7](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026) mengambil sampel bingkai pertama untuk identitas, posisi kepala, dan dasar pencahayaan. Potret menghadap depan dengan ekspresi netral memberikan model keadaan awal yang bersih untuk diinterpolasi.
Empat aturan potret mencakup kasus-kasus penting:
- Menghadap depan: hidung mengarah ke kamera. Hindari tampilan tiga perempat. Model sinkronisasi bibir dilatih pada mulut frontal.
- Ekspresi netral: mulut tertutup, wajah rileks. Bingkai pertama yang tersenyum atau bermulut terbuka mengunci model ke bentuk tersebut.
- Pencahayaan merata: cahaya kunci lembut dari depan kamera atau kiri kamera. Cahaya samping yang keras menciptakan bayangan yang ditafsirkan model sebagai bagian dari wajah.
- Latar belakang polos atau sederhana: latar belakang yang ramai mengalihkan energi dari subjek. Abu-abu netral, gradien lembut, atau kedalaman bidang yang dangkal berfungsi paling baik.
Resolusi kurang penting dibandingkan pembingkaian. Potret 1024x1024 dapat dipotong dengan rapi menjadi bingkai talking-head 16:9. Potret 9:16 berfungsi untuk format sosial vertikal. Sesuaikan rasio aspek potret dengan rasio aspek output target Anda untuk menghindari pemotongan yang tidak terduga.
Dalam batch uji kami, potret yang diambil pada sudut 45 derajat menghasilkan garis rahang yang melengkung pada sekitar 30% dari render 5 detik. Potret frontal menghasilkan nol lengkungan di seluruh set 12 klip yang sama.
Langkah 2: Rekam Sulih Suara yang Bersih
Kualitas audio adalah prediktor terkuat kualitas video akhir. Pipeline driving_audio Wan 2.7 membaca fonem dari bentuk gelombang, dan kebisingan merusak sinyal fonem. Rekaman studio mono 48kHz mengungguli rekaman telepon stereo 44.1kHz setiap saat.
Spesifikasi perekaman yang direkomendasikan:
| Pengaturan | Direkomendasikan | Mengapa |
|---|---|---|
| Laju sampel | 48kHz | Standar untuk sinkronisasi video, cocok dengan pipeline internal Wan 2.7 |
| Saluran | Mono | Stereo tidak menambahkan apa pun untuk satu suara dan menggandakan ukuran file |
| Format | WAV atau FLAC | Lossless mempertahankan transien yang dibaca model sinkronisasi bibir |
| Tingkat puncak | -6 dBFS | Headroom mencegah clipping pada plosif |
| Ruangan | Terawat atau tenang | Refleksi menyebabkan model menciptakan gerakan sekunder |
| Jarak mikrofon | 15-20cm | Cukup dekat untuk kehadiran, cukup jauh untuk menghindari letupan plosif |
Beberapa catatan praktis. Hilangkan suara napas di antara kalimat dengan noise gate. De-essing membantu karena lonjakan sibilance menghasilkan artefak gerakan lidah yang terlihat. Kompres sedikit, sekitar 3:1, untuk menjaga rentang dinamis dalam pita yang diharapkan model.
Untuk prompt yang mencocokkan pola sinkronisasi bibir dengan struktur naskah, klaster prompt sinkronisasi audio PixMind memiliki template untuk hook bentuk pendek, penjelas bentuk panjang, dan dialog bolak-balik.
Panjang Naskah per Durasi
Sekitar 150 kata per menit narasi yang jelas. Klip 5 detik berisi sekitar 12 hingga 15 kata. Klip 10 detik berisi 25 hingga 30 kata. Tulis sesuai durasi yang akan Anda render.
Langkah 3: Periksa Peralatan dan Lingkungan
Pemeriksaan peralatan menangkap kegagalan yang merusak render sebelum dimulai. [Panduan pengguna image-to-video Wan 2.7](https://help.aliyun.com/zh/model-studio/wan-image-to-video-guide, 2026) tidak memaksakan batasan input keras di luar ukuran file, tetapi batasan pipeline dunia nyata berasal dari rantai perekaman Anda, bukan API.
Daftar periksa pra-render:
- Mikrofon: kondensor atau dinamis, USB atau XLR. Uji desis sebelum merekam.
- Antarmuka audio: jika XLR, konfirmasikan daya phantom 48V untuk mikrofon kondensor.
- DAW atau perekam: Audacity, Reaper, atau perekam perangkat keras. Ekspor WAV.
- Kamera potret: kamera apa pun dengan 12 megapiksel atau lebih. Kamera ponsel berfungsi jika pencahayaan merata.
- Sumber potret: foto asli, avatar yang dihasilkan AI, atau stok berlisensi. Orang sungguhan yang dapat diidentifikasi memerlukan persetujuan.
- Penyimpanan: potret ditambah file audio, ditambah direktori render. Anggarkan 50MB per klip 1080P 10 detik akhir.
[WAWASAN UNIK] Titik kegagalan yang paling sering terabaikan adalah kebocoran headphone. Jika Anda merekam sambil memantau naskah melalui headphone open-back, kebocoran akan masuk ke rekaman sebagai sinyal sekunder yang samar. Model sinkronisasi bibir membaca kebocoran sebagai ucapan ambien dan menciptakan gerakan mulut tambahan. Gunakan headphone closed-back atau in-ear monitor.
Langkah 4: Unggah Potret Ditambah Audio Pendorong
Langkah unggah menggabungkan potret dan audio menjadi satu permintaan I2V Wan 2.7. Menurut [referensi API I2V Alibaba Cloud](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026), permintaan tersebut mengambil array media yang menerima input gambar dan audio, dengan driving_audio sebagai tipe untuk entri audio. Model akan mengarahkan ke mode berbasis audio ketika keduanya ada.
Parameter permintaan yang penting untuk render talking-head:
- Resolusi: 720P untuk iterasi, 1080P untuk final. 1080P kira-kira menggandakan biaya kredit per detik.
- Durasi: 2 hingga 15 detik. Kualitas sinkronisasi menurun setelah sekitar 8 detik, jadi lebih baik beberapa potongan pendek daripada satu yang panjang.
- Rasio aspek: sesuaikan rasio aspek potret. 16:9 untuk YouTube dan sematan situs web, 9:16 untuk Reels, TikTok, dan Shorts.
- Seed: kunci seed setelah Anda menemukan render yang Anda suka. Seed yang sama, output yang sama.
![]()
Urutan unggah praktis:
- Kompres potret hingga di bawah 5MB jika lebih dari 10MB. API menerima file yang lebih besar, tetapi latensi unggah merugikan kecepatan iterasi.
- Normalisasi puncak audio ke -6 dBFS sebelum unggah. Model menangani rentang dinamis, tetapi clipping pada input menghasilkan artefak yang keras.
- Jalankan render uji 2 detik sebelum berkomitmen pada hasil akhir 10 detik. Masalah sinkronisasi lebih mudah ditangkap pada durasi pendek.
- Simpan seed dari render yang bagus. Gunakan kembali untuk variasi.
Langkah 5: Render dan Periksa Sinkronisasi Bibir
Sinkronisasi bibir adalah standar kualitas penentu keberhasilan untuk video talking-head. [API I2V Wan 2.7](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026) mengembalikan file video setelah generasi selesai, dengan render 720P 5 detik yang khas selesai dalam 60 hingga 90 detik dan render 1080P 10 detik membutuhkan 3 hingga 5 menit.
Periksa titik sinkronisasi ini di setiap render:
- Plosif: suara p, b, t, d. Mulut harus tertutup pada plosif. Penutupan yang tidak selaras adalah artefak yang paling terlihat.
- Vokal terbuka: suara a, e, o. Mulut harus terbuka secara terlihat pada puncak vokal.
- Celah hening: di antara kalimat, mulut harus rileks ke posisi netral. Model yang terus menggerakkan mulut selama hening terlihat salah.
- Gerakan kepala: anggukan dan kemiringan kepala yang halus pada penekanan. Terlalu banyak gerakan terlihat bergetar. Terlalu sedikit terlihat beku.
Jika sinkronisasi tidak tepat pada render pertama, penyebabnya hampir selalu salah satu dari tiga hal. Audio memiliki kebisingan latar belakang yang merusak sinyal fonem. Potret tidak menghadap depan. Naskah terlalu padat untuk durasi, memaksa model untuk mengompres gerakan mulut.
[DATA ASLI] Dalam batch uji 24 klip, render 720P menunjukkan artefak sinkronisasi bibir yang terlihat pada 4 dari 24 klip (17%). Prompt dan input yang sama pada 1080P menunjukkan artefak pada 2 dari 24 klip (8%). Tingkat artefak menurun, tetapi biaya kredit kira-kira berlipat ganda. Iterasi pada 720P, finalisasi pada 1080P.
Langkah 6: Pasca-Proses (Teks, B-Roll)
Pasca-pemrosesan mengubah render yang bersih menjadi konten yang sudah jadi. Tiga pengeditan mencakup 90% kasus penggunaan talking-head.
Teks. Teks yang tertanam tidak dapat dinegosiasikan untuk media sosial. Gunakan teks otomatis di editor Anda (Premiere, Resolve, CapCut), lalu koreksi secara manual nama diri dan angka. Teks juga menyembunyikan sedikit penyimpangan sinkronisasi bibir, itulah sebabnya setiap format talking-head sosial menggunakannya.
B-roll. Potong ke gambar produk, rekaman layar, atau visual pendukung selama kalimat yang lebih panjang. Cutaway menyembunyikan artefak gerakan dan menjaga pemirsa tetap terlibat. Targetkan potongan B-roll setiap 5 hingga 8 detik.
Penyempurnaan audio. Ganti sulih suara asli dengan versi yang sudah di-master jika Anda memilikinya. Tambahkan musik latar pada -20 hingga -24 dBFS. Tambahkan nada ruangan yang halus jika sulih suara terasa terisolasi.
Untuk prompt yang menyusun naskah talking-head dengan ketukan cutaway yang sudah ada, klaster prompt sinkronisasi audio PixMind memiliki template dengan titik isyarat B-roll yang eksplisit.
Tiga Mode Kegagalan Umum
Setiap pipeline video AI gagal dengan cara yang dapat diprediksi. Menamai mode kegagalan membantu Anda mengirimkan lebih cepat dan membuang lebih sedikit kredit.
Kegagalan 1: Penyimpangan Durasi Panjang
Kualitas sinkronisasi menurun seiring bertambahnya durasi. Dalam batch uji kami, render 5 detik mempertahankan sinkronisasi yang ketat sepanjang waktu. Render 10 detik menunjukkan penyimpangan yang terlihat pada 2 detik terakhir. Penyebabnya adalah kesalahan kumulatif dalam model prediksi gerakan.
Perbaikan: render beberapa klip 5 detik dan satukan. Durasi totalnya sama, tetapi setiap klip tetap sinkron.
Kegagalan 2: Kebisingan Audio
Desis latar belakang, pantulan ruangan, dan dengungan listrik merusak sinyal fonem yang dibaca model. Hasilnya adalah gerakan mulut hantu selama hening dan bentuk bibir yang kabur pada plosif.
Perbaikan: rekam di ruangan yang terawat, gunakan noise gate, dan lakukan pembersihan spektral ringan sebelum unggah. Pengurangan kebisingan Audacity pada pengaturan ringan sudah cukup. Pembersihan berat memperkenalkan artefak tersendiri.
Kegagalan 3: Penyimpangan Sudut Potret
Potret yang diambil pada sudut 15 derajat di luar sumbu masih dapat dirender, tetapi model harus menciptakan geometri frontal yang hilang. Hasilnya: garis rahang melengkung, mata tidak simetris, atau mulut miring yang tidak sesuai dengan audio.
Perbaikan: ambil ulang potret menghadap depan. Memotong potret tiga perempat untuk memalsukan tampilan frontal tidak berfungsi, karena model membaca posisi kepala asli dari geometri gambar.
FAQ Video Avatar Berbasis Audio
Bisakah Wan 2.7 menyinkronkan bibir dengan sulih suara non-Inggris?
Ya. Model membaca fonem dari bentuk gelombang audio, bukan teks spesifik bahasa. Kami telah menguji bahasa Inggris, Mandarin, dan Spanyol dengan kualitas sinkronisasi yang sebanding. Bahasa dengan bentuk mulut yang sangat berbeda, seperti konsonan emfatis Arab, mungkin menunjukkan artefak kecil.
Berapa panjang audio maksimum yang diterima Wan 2.7?
Mode berbasis audio I2V Wan 2.7 membatasi durasi video hingga 15 detik. Trek audio harus sesuai atau melebihi durasi target. Untuk konten yang lebih panjang, render beberapa klip 5 hingga 8 detik dan satukan dalam pasca-produksi.
Apakah mode berbasis audio Wan 2.7 berfungsi pada subjek non-manusia?
Ini berfungsi pada subjek mirip wajah apa pun, termasuk avatar bergambar, karakter bergaya, dan render 3D. Kualitas menurun pada subjek tanpa geometri mulut yang realistis. Karakter kartun dengan mulut garis sederhana sering menghasilkan hasil yang aneh.
Berapa biaya render talking-head 1080P 10 detik?
Biaya kredit meningkat seiring dengan resolusi dan durasi. Pada 1080P, klip 10 detik berharga kira-kira dua kali lipat klip 720P dengan panjang yang sama. Tarif spesifik ada di halaman produk PixMind Wan 2.7. Iterasi pada 720P, finalisasi pada 1080P.
Bisakah saya mengkloning suara atau wajah orang sungguhan tertentu?
Tidak. Kebijakan PixMind, konsisten dengan [persyaratan Alibaba Cloud Model Studio](https://www.alibabacloud.com/help/en/model-studio/use-video-generation, 2026), melarang kloning kemiripan tanpa persetujuan dari orang sungguhan yang dapat diidentifikasi. Gunakan karakter asli, kemiripan Anda sendiri, atau materi referensi berlisensi yang sesuai.
Saksikan Aksinya
— 歸藏(guizang.ai) (@op7418) April 13, 2026



