مقاطع فيديو أفاتار تعمل بالصوت مع Wan 2.7
النقاط الرئيسية
- يقرن وضع Wan 2.7 I2V الذي يعمل بالصوت صورة ثابتة بمقطع تعليق صوتي لإنتاج فيديو رأس متحدث متزامن الشفاه بدقة تصل إلى 1080P.
- يتكون سير العمل من ست خطوات: إعداد الصورة، تسجيل التعليق الصوتي، فحص المعدات، الرفع، التقديم، والمعالجة اللاحقة.
- تحدد المدخلات المصدرية جودة المخرجات. الصور الأمامية والصوت الأحادي الاستوديو بتردد 48 كيلو هرتز يعطيان أنظف تزامن للشفاه.
- ثلاثة أوضاع فشل هي الأكثر أهمية: الانجراف طويل الأمد، ضوضاء الصوت، وانحراف زاوية الصورة.
- ابدأ بتقديم تجريبي لمدة 3 ثوانٍ قبل إنفاق الرصيد على مقطع نهائي مدته 10 ثوانٍ.
لماذا يعمل وضع Wan 2.7 الذي يعمل بالصوت للرؤوس المتحدثة
تعد مقاطع فيديو الرأس المتحدث هي التنسيق السائد للشروحات ومحتوى الدورات والتعليقات الاجتماعية القصيرة. وفقًا لـ [مرجع Alibaba Cloud I2V API](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026)، تقبل نقطة نهاية Wan 2.7 لتحويل الصورة إلى فيديو حقل driving_audio الذي يزامن حركة الفم وحركة الرأس والطاقة الكلية مع شكل الموجة الصوتية. لم تعد بحاجة إلى نموذج أفاتار مدرب خصيصًا لإنتاج مقطع متزامن الشفاه قابل للاستخدام.
تتناول هذه المقالة سير العمل الكامل، من إعداد الصورة إلى المعالجة اللاحقة. لتغطية أوسع للوضع، راجع دليل فيديو Wan 2.7 الذي يعمل بالصوت. للميكانيكا الأساسية لـ I2V، راجع مجموعة أداء شخصيات PixMind، وهو المرجع الداخلي الأساسي لسير العمل هذا.
ما الذي يجعل أفاتار الرأس المتحدث جيدًا؟
يمتلك أفاتار الرأس المتحدث الجيد ثلاث سمات: هوية مستقرة، حركة شفاه قابلة للتصديق، وحركة رأس طبيعية. يوثق [دليل مستخدم Wan 2.7 لتحويل الصورة إلى فيديو](https://help.aliyun.com/zh/model-studio/wan-image-to-video-guide, 2026) أن النموذج يقرأ إشارات الهوية من الإطار الأول وإشارات الحركة من شكل الموجة الصوتية، ثم يمزجها عبر مدة التقديم. تحدد الجودة على جانبي هذا الزوج من المدخلات المخرجات.
الخطأ الأكثر شيوعًا هو التعامل مع الصورة كأمر ثانوي. الرأس المائل، الإضاءة الجانبية، أو ابتسامة جزئية في الإطار صفر ستتفاقم عبر كل إطار يتم إنشاؤه. اختر الصورة أولاً، ثم اكتب النص.
ثلاثة تنسيقات تناسب I2V الذي يعمل بالصوت:
- شرح فردي: صورة واحدة، تعليق صوتي واحد، لقطة واحدة. حالة الاستخدام الأكثر شيوعًا (80%).
- درس أو جولة إرشادية: نفس الصورة، صوت أطول، مع تبديل النموذج بين حركة الرأس والثبات.
- حوار بين شخصين: يتم تقديمه كمقطعين منفصلين، ثم يتم تحريرهما معًا. Wan 2.7 R2V هو المسار الأفضل للحوار الحقيقي ذهابًا وإيابًا، كما هو موثق في دليلنا المرجعي متعدد الوسائط لـ Wan 2.7 R2V.
شرح فردي
الأفضل لمقدمات المنتجات، أجزاء الدورات، والتعليقات الاجتماعية. صورة واحدة. تعليق صوتي واحد. لقطة واحدة.
حوار بين شخصين
قدم كل متحدث على حدة كمقطع I2V يعمل بالصوت. ادمجهم معًا في مرحلة ما بعد الإنتاج. للحفاظ على الهوية عبر المتحدثين، انتقل إلى R2V مع صور مرجعية.
الخطوة 1: إعداد صورة أمامية
يعد إعداد الصورة هو المكان الذي تفشل فيه معظم عروض الرأس المتحدث قبل تسجيل الصوت. يقوم [Wan 2.7 I2V API](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026) بأخذ عينات من الإطار الأول للهوية، ووضعية الرأس، وخط الأساس للإضاءة. تمنح الصورة الأمامية ذات التعبير المحايد النموذج حالة بداية نظيفة للاستيفاء منها.
تغطي أربع قواعد للصور الحالات المهمة:
- أمامية: الأنف يشير إلى الكاميرا. تجنب المناظر ثلاثية الأرباع. تم تدريب نموذج مزامنة الشفاه على الأفواه الأمامية.
- تعبير محايد: فم مغلق، وجه مسترخٍ. إطار أول مبتسم أو مفتوح الفم يحبس النموذج في هذا الشكل.
- إضاءة متساوية: إضاءة رئيسية ناعمة من أمام الكاميرا أو يسارها. الإضاءة الجانبية القوية تخلق ظلالًا يفسرها النموذج كجزء من الوجه.
- خلفية بسيطة أو عادية: الخلفيات المزدحمة تستنزف الطاقة من الموضوع. تعمل الألوان الرمادية المحايدة، والتدرجات الناعمة، أو عمق المجال الضحل بشكل أفضل.
الدقة أقل أهمية من التأطير. صورة 1024x1024 تقص بشكل نظيف في إطار رأس متحدث بنسبة 16:9. صورة 9:16 تعمل لتنسيقات الوسائط الاجتماعية العمودية. طابق نسبة أبعاد الصورة مع نسبة أبعاد الإخراج المستهدفة لتجنب القص المفاجئ.
في دفعة الاختبار لدينا، أنتجت الصور الملتقطة بزوايا 45 درجة خطوط فك مشوهة في حوالي 30% من العروض التي تبلغ مدتها 5 ثوانٍ. أنتجت الصور الأمامية صفر تشوهات عبر نفس مجموعة المقاطع الـ 12.
الخطوة 2: تسجيل تعليق صوتي نظيف
جودة الصوت هي أقوى مؤشر على جودة الفيديو النهائية. يقرأ مسار driving_audio الخاص بـ Wan 2.7 الفونيمات من شكل الموجة الصوتية، وتفسد الضوضاء إشارة الفونيم. يتفوق التسجيل الاستوديو بتردد 48 كيلو هرتز أحادي على تسجيل الهاتف بتردد 44.1 كيلو هرتز ستريو في كل مرة.
مواصفات التسجيل الموصى بها:
| الإعداد | موصى به | السبب |
|---|---|---|
| معدل العينة | 48 كيلو هرتز | معيار لمزامنة الفيديو، يتطابق مع مسار Wan 2.7 الداخلي |
| القنوات | أحادي | الاستريو لا يضيف شيئًا لصوت واحد ويضاعف حجم الملف |
| التنسيق | WAV أو FLAC | يحافظ على الانتقالات التي يقرأها نموذج مزامنة الشفاه |
| مستوى الذروة | -6 ديسيبل FS | يمنع التشويش على الأصوات الانفجارية |
| الغرفة | معالجة أو هادئة | الانعكاسات تتسبب في اختراع النموذج لحركة ثانوية |
| مسافة الميكروفون | 15-20 سم | قريب بما يكفي للحضور، وبعيد بما يكفي لتجنب فرقعات الأصوات الانفجارية |
بعض الملاحظات العملية. قم بإزالة أصوات التنفس بين الجمل باستخدام بوابة ضوضاء. يساعد إزالة الصفير لأن ارتفاعات الصفير تنتج تشوهات مرئية في حركة اللسان. اضغط الصوت بخفة، حوالي 3:1، للحفاظ على النطاق الديناميكي ضمن النطاق المتوقع للنموذج.
للمطالبات التي تطابق أنماط مزامنة الشفاه مع بنية النص، تحتوي مجموعة مطالبات مزامنة الصوت من PixMind على قوالب لمقدمات قصيرة، وشروحات طويلة، وحوارات ذهابًا وإيابًا.
طول النص حسب المدة
حوالي 150 كلمة في الدقيقة من السرد الواضح. يحتوي مقطع مدته 5 ثوانٍ على حوالي 12 إلى 15 كلمة. يحتوي مقطع مدته 10 ثوانٍ على 25 إلى 30 كلمة. اكتب للمدة التي ستقوم بتقديمها فعليًا.
الخطوة 3: فحص المعدات والبيئة
تكتشف فحوصات المعدات الأعطال التي تفسد عمليات التقديم قبل أن تبدأ. لا يفرض [دليل مستخدم Wan 2.7 لتحويل الصورة إلى فيديو](https://help.aliyun.com/zh/model-studio/wan-image-to-video-guide, 2026) قيودًا صارمة على المدخلات تتجاوز حجم الملف، ولكن قيود مسار العمل في العالم الحقيقي تأتي من سلسلة التسجيل الخاصة بك، وليس من واجهة برمجة التطبيقات.
قائمة التحقق قبل التقديم:
- الميكروفون: مكثف أو ديناميكي، USB أو XLR. اختبر وجود الهسهسة قبل التسجيل.
- واجهة الصوت: إذا كانت XLR، تأكد من طاقة فانتوم 48 فولت لميكروفونات المكثف.
- محطة عمل صوتية رقمية (DAW) أو مسجل: Audacity، Reaper، أو مسجل أجهزة. تصدير WAV.
- كاميرا الصورة: أي كاميرا بدقة 12 ميجابكسل أو أعلى. تعمل كاميرات الهاتف إذا كانت الإضاءة متساوية.
- مصدر الصورة: صورة أصلية، أفاتار تم إنشاؤه بواسطة الذكاء الاصطناعي، أو مخزون مرخص. يتطلب الأشخاص الحقيقيون القابلون للتحديد موافقة.
- التخزين: الصورة بالإضافة إلى ملفات الصوت، بالإضافة إلى دليل التقديم. خصص 50 ميجابايت لكل مقطع نهائي بدقة 1080P ومدته 10 ثوانٍ.
[رؤية فريدة] نقطة الفشل الأكثر تجاهلاً هي تسرب الصوت من سماعات الرأس. إذا قمت بالتسجيل أثناء مراقبة النص من خلال سماعات رأس مفتوحة الظهر، فإن التسرب يدخل التسجيل كإشارة ثانوية خافتة. يقرأ نموذج مزامنة الشفاه التسرب ككلام محيط ويخترع حركة فم إضافية. استخدم سماعات رأس مغلقة الظهر أو سماعات أذن داخلية.
الخطوة 4: رفع الصورة بالإضافة إلى الصوت المحرك
تجمع خطوة الرفع الصورة والصوت في طلب Wan 2.7 I2V واحد. وفقًا لـ [مرجع Alibaba Cloud I2V API](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026)، يقبل الطلب مصفوفة وسائط تقبل كلاً من مدخلات الصور والصوت، مع driving_audio كنوع لإدخال الصوت. ينتقل النموذج إلى الوضع الذي يعمل بالصوت عندما يكون كلاهما موجودًا.
معلمات الطلب المهمة لتقديمات الرأس المتحدث:
- الدقة: 720P للتكرار، 1080P للنهائي. تضاعف دقة 1080P تقريبًا تكلفة الرصيد لكل ثانية.
- المدة: من 2 إلى 15 ثانية. تتدهور جودة المزامنة بعد حوالي 8 ثوانٍ، لذا يفضل استخدام مقاطع قصيرة متعددة بدلاً من مقطع واحد طويل.
- نسبة العرض إلى الارتفاع: طابق نسبة عرض الصورة. 16:9 لـ YouTube وتضمينات المواقع، 9:16 لـ Reels و TikTok و Shorts.
- البذرة (Seed): قم بتثبيت بذرة بمجرد العثور على تقديم يعجبك. نفس البذرة، نفس الإخراج.
![]()
تسلسل رفع عملي:
- اضغط الصورة إلى أقل من 5 ميجابايت إذا كانت أكبر من 10 ميجابايت. تقبل واجهة برمجة التطبيقات ملفات أكبر، لكن زمن انتقال الرفع يضر بسرعة التكرار.
- قم بتطبيع ذروة الصوت إلى -6 ديسيبل FS قبل الرفع. يتعامل النموذج مع النطاق الديناميكي، لكن التشويش عند الإدخال ينتج تشوهات قاسية.
- قم بتشغيل تقديم تجريبي لمدة ثانيتين قبل الالتزام بتقديم نهائي لمدة 10 ثوانٍ. من الأسهل اكتشاف مشكلات المزامنة في المدة القصيرة.
- احفظ البذرة من أي تقديم جيد. أعد استخدامها للتنوعات.
الخطوة 5: التقديم والتحقق من مزامنة الشفاه
مزامنة الشفاه هي معيار الجودة الفاصل لمقاطع فيديو الرأس المتحدث. يعيد [Wan 2.7 I2V API](https://www.alibabacloud.com/help/en/model-studio/image-to-video-general-api-reference, 2026) ملف فيديو بمجرد اكتمال الإنشاء، حيث تستغرق عمليات التقديم النموذجية بدقة 720P لمدة 5 ثوانٍ من 60 إلى 90 ثانية، وتستغرق عمليات التقديم بدقة 1080P لمدة 10 ثوانٍ من 3 إلى 5 دقائق.
تحقق من نقاط المزامنة هذه في كل تقديم:
- الأصوات الانفجارية: أصوات p، b، t، d. يجب أن يغلق الفم عند الصوت الانفجاري. الإغلاقات غير المتطابقة هي أكثر التشوهات وضوحًا.
- حروف العلة المفتوحة: أصوات a، e، o. يجب أن يفتح الفم بشكل واضح عند ذروة حرف العلة.
- فجوات الصمت: بين الجمل، يجب أن يسترخي الفم إلى وضع محايد. النماذج التي تحافظ على حركة الفم أثناء الصمت تبدو خاطئة.
- حركة الرأس: إيماءات وإمالات رأس خفية عند التركيز. الكثير من الحركة تبدو متقطعة. القليل جدًا تبدو مجمدة.
إذا كانت المزامنة غير صحيحة في التقديم الأول، فإن السبب يكون دائمًا واحدًا من ثلاثة أشياء. كان الصوت يحتوي على ضوضاء خلفية أفسدت إشارة الفونيم. لم تكن الصورة أمامية. كان النص كثيفًا جدًا بالنسبة للمدة، مما أجبر النموذج على ضغط حركة الفم.
[بيانات أصلية] في دفعة اختبار مكونة من 24 مقطعًا، أظهرت عروض 720P تشوهات مرئية في مزامنة الشفاه في 4 من 24 مقطعًا (17%). أظهرت نفس المطالبات والمدخلات بدقة 1080P تشوهات في 2 من 24 مقطعًا (8%). انخفض معدل التشوهات، لكن تكلفة الرصيد تضاعفت تقريبًا. كرر بدقة 720P، ثم قم بالإنهاء بدقة 1080P.
الخطوة 6: المعالجة اللاحقة (التعليقات التوضيحية، لقطات B-Roll)
تحول المعالجة اللاحقة التقديم النظيف إلى قطعة محتوى جاهزة. تغطي ثلاث تعديلات 90% من حالات استخدام الرأس المتحدث.
التعليقات التوضيحية. التعليقات التوضيحية المدمجة لا غنى عنها للوسائط الاجتماعية. استخدم التسميات التوضيحية التلقائية في محرر الفيديو الخاص بك (Premiere، Resolve، CapCut)، ثم صحح يدويًا الأسماء والأرقام الخاصة. تخفي التسميات التوضيحية أيضًا الانجراف الطفيف في مزامنة الشفاه، وهذا هو السبب في أن كل تنسيق رأس متحدث اجتماعي يستخدمها.
لقطات B-roll. قم بالانتقال إلى لقطات المنتج، أو تسجيلات الشاشة، أو المرئيات الداعمة خلال الجمل الأطول. تخفي اللقطات الانتقالية تشوهات الحركة وتحافظ على تفاعل المشاهدين. استهدف لقطة B-roll كل 5 إلى 8 ثوانٍ.
تحسين الصوت. استبدل التعليق الصوتي الأصلي بنسخة محسنة إذا كانت لديك. أضف موسيقى خلفية بمستوى -20 إلى -24 ديسيبل FS. أضف نغمة غرفة خفية إذا كان التعليق الصوتي يبدو معزولًا.
للمطالبات التي تنظم نصوص الرأس المتحدث مع إيقاعات لقطات انتقالية مدمجة، تحتوي مجموعة مطالبات مزامنة الصوت من PixMind على قوالب بنقاط إشارة واضحة لـ B-roll.
ثلاثة أوضاع فشل شائعة
تفشل كل مسارات عمل الفيديو بالذكاء الاصطناعي بطرق يمكن التنبؤ بها. تسمية أوضاع الفشل يساعدك على الإنتاج بشكل أسرع وإهدار عدد أقل من الأرصدة.
الفشل 1: الانجراف طويل الأمد
تتدهور جودة المزامنة مع زيادة المدة. في دفعة الاختبار لدينا، حافظت عروض 5 ثوانٍ على مزامنة محكمة طوال الوقت. أظهرت عروض 10 ثوانٍ انجرافًا مرئيًا في الثواني الأخيرة. السبب هو الخطأ التراكمي في نموذج التنبؤ بالحركة.
الحل: قدم مقاطع متعددة مدتها 5 ثوانٍ وادمجها معًا. المدة الإجمالية هي نفسها، لكن كل مقطع يبقى متزامنًا.
الفشل 2: ضوضاء الصوت
الهسهسة الخلفية، انعكاسات الغرفة، والضجيج الكهربائي يفسدون إشارة الفونيم التي يقرأها النموذج. والنتيجة هي حركة فم وهمية أثناء الصمت وأشكال شفاه مشوهة على الأصوات الانفجارية.
الحل: سجل في غرفة معالجة، استخدم بوابة ضوضاء، وقم بتنظيف طيفي خفيف قبل الرفع. تقليل الضوضاء في Audacity بإعدادات خفيفة يكفي. التنظيف الثقيل يقدم تشوهات خاصة به.
الفشل 3: انحراف زاوية الصورة
صورة ملتقطة بزاوية 15 درجة خارج المحور لا تزال تُعرض، لكن النموذج يجب أن يخترع الهندسة الأمامية المفقودة. النتيجة: خط فك مشوه، عيون غير متماثلة، أو فم مائل لا يتطابق مع الصوت.
الحل: أعد تصوير الصورة بحيث تكون أمامية. قص صورة ثلاثية الأرباع لتزييف منظر أمامي لا يعمل، لأن النموذج يقرأ وضعية الرأس الأصلية من هندسة الصورة.
الأسئلة الشائعة حول فيديو الأفاتار الذي يعمل بالصوت
هل يمكن لـ Wan 2.7 مزامنة الشفاه مع تعليق صوتي غير إنجليزي؟
نعم. يقرأ النموذج الفونيمات من شكل الموجة الصوتية، وليس من نص خاص بلغة معينة. لقد اختبرنا الإنجليزية والماندرين والإسبانية بجودة مزامنة مماثلة. قد تظهر اللغات ذات أشكال الفم المختلفة جدًا، مثل الحروف الساكنة العربية المشددة، تشوهات طفيفة.
ما هو الحد الأقصى لطول الصوت الذي يقبله Wan 2.7؟
يحدد وضع Wan 2.7 I2V الذي يعمل بالصوت مدة الفيديو بـ 15 ثانية. يجب أن يتطابق المسار الصوتي مع المدة المستهدفة أو يتجاوزها. للمحتوى الأطول، قم بتقديم مقاطع متعددة تتراوح مدتها من 5 إلى 8 ثوانٍ وادمجها معًا في مرحلة ما بعد الإنتاج.
هل يعمل وضع Wan 2.7 الذي يعمل بالصوت على مواضيع غير بشرية؟
يعمل على أي موضوع يشبه الوجه، بما في ذلك الأفاتارات المصورة، والشخصيات المنمقة، والعروض ثلاثية الأبعاد. تنخفض الجودة على المواضيع التي لا تحتوي على هندسة فم واقعية. غالبًا ما تنتج شخصيات الرسوم المتحركة ذات الأفواه الخطية البسيطة نتائج غريبة.
كم تكلفة تقديم رأس متحدث بدقة 1080P لمدة 10 ثوانٍ؟
تتغير تكلفة الرصيد مع الدقة والمدة. بدقة 1080P، يكلف مقطع مدته 10 ثوانٍ ضعف تكلفة مقطع 720P بنفس الطول تقريبًا. الأسعار المحددة موجودة على صفحة منتج PixMind Wan 2.7. كرر بدقة 720P، ثم قم بالإنهاء بدقة 1080P.
هل يمكنني استنساخ صوت أو وجه شخص حقيقي معين؟
لا. تحظر سياسة PixMind، المتوافقة مع [شروط Alibaba Cloud Model Studio](https://www.alibabacloud.com/help/en/model-studio/use-video-generation, 2026)، استنساخ الشبه غير التوافقي لأشخاص حقيقيين يمكن التعرف عليهم. استخدم شخصيات أصلية، أو شبهك الخاص، أو مواد مرجعية مرخصة بشكل صحيح.
شاهدها في العمل
— 歸藏(guizang.ai) (@op7418) April 13, 2026



