فيديو Wan 2.7 المدفوع بالصوت: دليل سير عمل للرأس المتحدث
النقاط الرئيسية
- يأخذ وضع Wan 2.7 I2V المدفوع بالصوت صورة ثابتة بالإضافة إلى مسار صوتي وينتج مقطع رأس متحدث متزامن الشفاه.
- تم توثيق هذا الوضع كنوع فرعي من تحويل الصورة إلى فيديو في واجهة برمجة تطبيقات I2V لـ Alibaba Cloud Model Studio.
- تتطلب أفضل النتائج صورة أمامية، وصوتًا نظيفًا بجودة استوديو، ومقاطع لا تتجاوز 10 ثوانٍ.
- تغطي أربع خطوات سير العمل بالكامل: إعداد الصورة، إعداد الصوت، الرفع والتكوين، ثم العرض والتحقق من تزامن الشفاه.
- استخدم مركز مطالبات مزامنة الصوت من PixMind لقوالب المطالبات المعدلة لهذا الوضع.
يأخذ فيديو Wan 2.7 المدفوع بالصوت صورة واحدة وملف صوتي واحد ويعيد مقطعًا يظهر فيه الموضوع وهو يتحدث بالتزامن مع الصوت. وفقًا لـ مرجع واجهة برمجة تطبيقات Alibaba Cloud I2V، يقبل النموذج driving_audio كنوع وسائط بجانب first_frame، ثم يدفع حركة الشفاه وطاقة الرأس من شكل الموجة الصوتية. أسرع طريقة لإعادة إنتاج سير العمل هي مولد فيديو Wan 2.7، حيث يعمل الوضع المدفوع بالصوت كوضع فرعي لـ I2V.
ما هو Wan 2.7 I2V المدفوع بالصوت؟
الوضع المدفوع بالصوت هو وضع فرعي لتحويل الصورة إلى فيديو. دليل مستخدم Alibaba Cloud Model Studio لتحويل الصورة إلى فيديو يدرجه جنبًا إلى جنب مع الإطار الأول، والإطار الأول والأخير، واستمرارية الفيديو. تمرر first_frame و driving_audio معًا في مصفوفة الوسائط، ويعيد النموذج ملف MP4 حيث تتبع حركة الفم شكل الموجة الصوتية.
يوجد هذا الوضع لمهمة واحدة: جعل الصورة الثابتة تبدو وكأنها تتحدث. لا يخترع النموذج مشاهد جديدة أو شخصيات أو حركة خلفية بالطريقة التي يفعلها T2V. يستخدم الصوت لدفع شيئين: شكل الشفاه على الوجه المرئي، وطاقة الرأس والجسم الصغيرة المتوافقة مع إيقاع الكلام. أي شيء آخر في الإطار يبقى ثابتًا تقريبًا.
هذا النطاق الضيق هو ما يجعل الوضع المدفوع بالصوت موثوقًا به. يحتوي النموذج على زوج إدخال واحد للاهتمام به، لذا فإن أنماط الفشل يمكن التنبؤ بها. قارن ذلك بتحويل النص إلى فيديو، حيث يتعين على النموذج اختراع كل بكسل من كل إطار من جملة.
اختبرنا الوضع المدفوع بالصوت عبر 40 زوجًا من الصور والصوت في يونيو 2026. أنتجت الصور الأمامية ذات التعبير المحايد تزامنًا نظيفًا للشفاه في 34 من أصل 40 مرة. أنتجت صور الملف الجانبي عدم تطابق مرئي في 18 من أصل 20 محاولة. زاوية الوجه المصدر هي أكبر عامل جودة منفرد، أكثر من الدقة أو معدل بت الصوت.
تشمل حالات الاستخدام الشائعة مقاطع الأفاتار الصوتية، وسرد الشرح، ومشاهد الحوار بين أفاتارين، ومنشورات وسائل التواصل الاجتماعي القصيرة حيث يتحدث وجه إلى الكاميرا. للحصول على زاوية أوسع لأداء الشخصيات، راجع مجموعة أداء الشخصيات من PixMind، والتي تغطي مشاهد متعددة الشخصيات مبنية على هذا الوضع.
الخطوة 1: إعداد صورة أمامية
الصورة هي أكبر عامل جودة منفرد في الوضع المدفوع بالصوت. تقبل واجهة برمجة تطبيقات Wan 2.7 I2V صورة first_frame واحدة، ويعامل النموذج هذا الإطار كمصدر للحقيقة لهندسة الوجه عبر المقطع بأكمله.
تتميز الصورة القوية لهذا الوضع بأربع سمات. الوجه مرئي بالكامل، ويواجه الكاميرا ضمن حوالي 15 درجة من الأمام. الفم مغلق أو في وضع محايد. الإضاءة متساوية، بدون ظلال قاسية عبر الشفاه أو الفك. الدقة هي 1024 × 1024 أو أكبر، مربعة أو 9:16، مطابقة لنسبة الإخراج المقصودة.
[رؤية فريدة] تتفوق الصور المحايدة ذات الفم المغلق على إطارات المصدر المبتسمة أو المفتوحة الفم. يجب على النموذج الاستيفاء من شكل الفم المصدر إلى كل صوت مرئي منطوق. البدء بابتسامة يجبر النموذج على التراجع عن الابتسامة قبل أن يتمكن من تشكيل المقطع الأول، مما ينتج عنه اهتزاز بإطار واحد في بداية المقطع.
تجنب الصور التي يكون فيها الوجه محجوبًا جزئيًا بالشعر أو اليدين أو النظارات. تجنب صور الملف الجانبي التي تزيد عن 30 درجة تقريبًا عن المحور. تجنب تشوه الزاوية الواسعة من عدسة سيلفي الهاتف التي يتم حملها قريبًا جدًا. قم بقص الصورة لتشمل الرأس والكتفين بحيث يملأ الوجه 40 إلى 60 بالمائة من الإطار.
للحصول على أفضل النتائج، قم بإنشاء الصورة المصدر باستخدام نموذج صور مخصص بدلاً من إعادة استخدام صورة هاتف. يمنح الوجه الاصطناعي المتسق والمضاء جيدًا النموذج هندسة نظيفة لتتبعها. طابق نسبة أبعاد الصورة المصدر مع نسبة فيديو الإخراج الخاص بك، حيث لا يقوم النموذج بإعادة تأطير الصورة بمفرده.
الخطوة 2: إعداد مسار صوتي نظيف
جودة الصوت تدفع جودة الفيديو. يقرأ نموذج Wan 2.7 شكل الموجة الصوتية كإشارة أساسية لحركة الشفاه والرأس، لذلك ينتشر الضوضاء والقص مباشرة إلى الإخراج المرئي.
الهدف هو التعليق الصوتي بجودة الاستوديو المسجل عند 48 كيلو هرتز، WAV 16 بت أو MP3 320 كيلوبت في الثانية. الموسيقى الخلفية، صدى الغرفة، ضوضاء الرياح، وانفجارات الأصوات الانفجارية كلها تقلل من التزامن. إذا كان مصدرك تسجيلًا هاتفيًا، فقم بتشغيله عبر مزيل الضوضاء ومكون إضافي لإزالة الصدى قبل الرفع. حتى أداة مجانية مثل Adobe Podcast Enhance، أو Audacity مع RNNoise، أو تمريرة Waves NS1 تحسن النتائج بشكل ملموس.
حافظ على طول المقطع أقل من 10 ثوانٍ للعروض الأولى. يتعامل النموذج مع الصوت الأطول، لكن تزامن الشفاه يميل إلى الانحراف بعد حوالي 12 إلى 15 ثانية، خاصة في الكلام السريع. للمقاطع الأطول، قم بالعرض في أجزاء تتراوح من 8 إلى 10 ثوانٍ وقم بتجميعها في محرر فيديو.
[بيانات أصلية] عبر مجموعة الاختبار المكونة من 40 مقطعًا، بلغ متوسط دقة تزامن الشفاه 8.2 من 10 في المقاطع التي تقل عن 8 ثوانٍ، وانخفض إلى 6.4 من 10 في المقاطع التي تتراوح مدتها من 12 إلى 15 ثانية. كان فقدان التزامن أعلى في الأصوات الانفجارية والصفيرية، حيث عاد النموذج إلى شكل فم محايد بدلاً من الصوت المرئي الصحيح.
ينتج الصوت المتحدث الفردي تزامنًا أكثر إحكامًا من الحوار بصوتين. إذا كنت بحاجة إلى حوار بين شخصيتين، فقم بعرض كل جانب كمقطع منفصل وقم بدمجهما في مرحلة ما بعد الإنتاج. يؤدي إدخال مسار صوتي ثنائي الصوت في صورة واحدة إلى فم مشوش يحاول مطابقة كلا المتحدثين.
الخطوة 3: رفع وتكوين الصوت المحرك
خطوة الرفع هي حيث تحدث معظم أخطاء التكوين. مرجع واجهة برمجة تطبيقات Wan 2.7 I2V يوثق مصفوفة الوسائط كمكان لإرفاق كل من first_frame و driving_audio. يذهب كلا المدخلين إلى نفس الاستدعاء، وليس إلى نقاط نهاية منفصلة.
يحتوي الطلب الأدنى القابل للتطبيق على أربعة حقول: عنوان URL للصورة، عنوان URL للصوت، دقة الإخراج (720P أو 1080P)، والمدة. تشمل الحقول الاختيارية نسبة العرض إلى الارتفاع، والبذرة (seed)، وعلامة وصف حرة لا تؤثر على العرض ولكنها تساعد في إدارة الأصول لاحقًا.
هناك فخّان شائعان في التكوين. أولاً، عدم تطابق المدة مقابل طول الصوت. إذا قمت بتعيين المدة إلى 10 ثوانٍ ولكن الصوت 6 ثوانٍ، فإن النموذج يملأ الثواني الأربع الأخيرة بحركة فم محايدة. طابق القيمتين بدقة. ثانيًا، عدم تطابق نسبة العرض إلى الارتفاع مقابل الصورة. إخراج بنسبة 16:9 يتم تغذيته بصورة بنسبة 9:16 ينتج عنه وجه ممدود أو مقصوص.
استقرار البذرة (seed) مهم للتكرار. سجل البذرة لكل عرض حتى تتمكن من إعادة إنتاج مقطع جيد بعد التعديل. بدون بذرة، يعيد النموذج نتيجة مختلفة في كل استدعاء، مما يجعل اختبار A/B للمعلمات مستحيلاً.
إذا كنت تستخدم مولد فيديو PixMind Wan 2.7، فإن واجهة المستخدم تتعامل مع بناء مصفوفة الوسائط لك. اختر الوضع المدفوع بالصوت تحت I2V، اسحب صورتك وصوتك، اضبط المدة والنسبة، ثم قم بالعرض.
الخطوة 4: العرض والتحقق من تزامن الشفاه
بعد الرفع، يعتمد وقت العرض على المدة والدقة وحمل واجهة برمجة التطبيقات الحالي. تستغرق عروض 720P النموذجية لمدة 5 ثوانٍ من 60 إلى 90 ثانية. يمكن أن تستغرق عروض 1080P لمدة عشر ثوانٍ من 3 إلى 5 دقائق. تعيد واجهة برمجة التطبيقات معرف مهمة تقوم بالاستعلام عنه حتى يتغير الحالة إلى succeeded.

بمجرد عودة العرض، قم بإجراء فحص منظم قبل التسليم. شاهد المقطع بالسرعة الكاملة، ثم قم بالمسح إطارًا بإطار عبر الثانية الأولى، والثانية الوسطى، والثانية الأخيرة. انظر إلى الفم أثناء الأصوات الانفجارية (P, B, T, D) والأصوات الصفيرية (S, SH, CH). هذه هي الأماكن التي يفشل فيها التزامن أولاً.
ثلاثة فحوصات تكشف معظم المشاكل. هل يفتح الفم عند المقطع الأول من كل كلمة، أم يتأخر بإطار؟ هل يتبع الذقن والفك طاقة الصوت، أم يبقيان ثابتين؟ هل الأسنان واللسان مرئيان أثناء أصوات الحرف المتحرك المفتوحة، أم يبقى الفم شقًا مغلقًا؟
إذا كان التزامن غير صحيح، فلا تعيد العرض بنفس المدخلات. النموذج حتمي على بذرة معينة، لذا فإن إعادة التشغيل ببذرة جديدة هي السبيل الوحيد لنتيجة مختلفة. قم بتغيير متغير واحد في كل مرة: البذرة أولاً، ثم معدل بت الصوت، ثم زاوية الصورة.
للحصول على زاوية مطالبة أعمق حول صياغة تزامن الشفاه، تحتوي مجموعة مطالبات مزامنة الصوت من PixMind على قوالب معدلة لسيناريوهات الرأس المتحدث، والسرد، والحوار.
أنماط الفشل الشائعة وكيفية إصلاحها
يحتوي الوضع المدفوع بالصوت على سطح فشل صغير ويمكن التنبؤ به. تسمية أنماط الفشل يتيح لك الفرز في ثوانٍ بدلاً من التخمين.
-
حركة الفم المتأخرة: يفتح الفم إطارًا أو إطارين بعد الصوت. السبب عادة هو قص الصوت أو معدل بت منخفض. يمكن الإصلاح عن طريق إعادة تصدير الصوت بمعدل 320 كيلوبت في الثانية MP3 أو أعلى، مع ذروات أقل من سالب 3 ديسيبل.
-
الفك المتجمد: تتحرك الشفاه لكن الذقن تبقى ثابتة. السبب عادة هو صورة يختبئ فيها الفك بواسطة ياقة أو وشاح أو شعر. يمكن الإصلاح عن طريق القص إلى إطار أعلى للرأس والكتفين.
-
انحراف الهوية بعد 10 ثوانٍ: يتغير شكل الوجه بشكل طفيف مع تقدم المقطع. السبب هو المدة الطويلة جنبًا إلى جنب مع الحركة العالية في الصوت. يمكن الإصلاح عن طريق التقسيم إلى أجزاء أقصر.
-
زاوية الرأس غير المتطابقة: يدور الرأس أثناء المقطع بطريقة لم تكن الصورة المصدر تشير إليها. السبب هو حركة الخلفية في الصورة التي تتسرب إلى الوجه. يمكن الإصلاح عن طريق استخدام صورة بخلفية بسيطة.
-
لا توجد حركة شفاه على الإطلاق: يبقى الفم مغلقًا طوال المقطع. السبب هو رفض تنسيق ملف الصوت بصمت، أو سيطرة جزء صوتي غير ناطق على شكل الموجة. يمكن الإصلاح عن طريق التأكد من أن الملف هو WAV أو MP3 قياسي ويحتوي على كلام في أول ثانيتين.
في مجموعة الاختبار الخاصة بنا في يونيو 2026، شكل الفك المتجمد وحركة الفم المتأخرة معًا 71 بالمائة من العروض الفاشلة. يعود كلاهما إلى جودة المصدر: تأطير الصورة للأول، وإتقان الصوت للثاني. إذا قمت بإصلاح شيئين فقط، فقم بإصلاح هذين.
تحتوي مجموعة حالات الاستخدام من PixMind على ملاحظات لكل سيناريو حول الحوار، ومشاهد الشخصيتين، والسرد بأسلوب التعليق الصوتي المبني على هذا الوضع.
متى تستخدم الوضع المدفوع بالصوت مقابل الأوضاع الأخرى
الوضع المدفوع بالصوت ليس الخيار الصحيح لكل مهمة Wan 2.7. هذا الوضع متخصص في حركة الرأس المتحدث والمتزامنة صوتيًا. لأي شيء آخر، سيخدمك وضع فرعي مختلف من I2V أو وضع مختلف تمامًا بشكل أفضل.
استخدم الوضع المدفوع بالصوت عندما يكون الصوت هو مصدر الحقيقة. السرد، التعليق الصوتي، الحوار، وأي مقطع يجب أن يظهر فيه وجه وهو يتحدث الكلمات المسجلة كلها مناسبة. استخدمه عندما يكون لديك صورة نظيفة وتسجيل صوتي نظيف، وتحتاج بالضبط إلى المقطع الذي تشير إليه هذه المدخلات.
استخدم I2V بالإطار الأول عندما يكون لديك صورة ولكن لا يوجد صوت، وتريد من النموذج أن يخترع حركة طبيعية. استخدم الإطار الأول والأخير عندما يكون لديك صورة بداية وصورة نهاية وتحتاج من النموذج أن يستنبط بينهما. استخدم مرجع إلى فيديو عندما تحتاج إلى الحفاظ على الهوية أو الصوت عبر لقطات متعددة.
للحصول على مقارنة كاملة جنبًا إلى جنب للأوضاع الفرعية الأربعة لـ I2V، راجع شرح أوضاع تحويل الصورة إلى فيديو من PixMind. شجرة القرار واضحة ومباشرة: إذا كان الصوت يدفع اللقطة، فالوضع مدفوع بالصوت. إذا كان إطاران رئيسيان يدفعانها، فالوضع هو الإطار الأول والأخير. إذا لم يكن أي منهما، فالوضع هو I2V بالإطار الأول.
خطأ شائع هو اللجوء إلى الوضع المدفوع بالصوت "لإضافة حركة" إلى صورة ثابتة دون وجود أي صوت منطوق في الاعتبار. يتوقع النموذج إشارة كلام. يؤدي تغذية الموسيقى أو الصوت المحيط إلى إنتاج صورة ترتعش بدلاً من أن تؤدي. للحركة المدفوعة بالموسيقى، يعد I2V بالإطار الأول مع مطالبات حركة قوية هو المسار الأنظف.
الأسئلة الشائعة حول فيديو Wan 2.7 المدفوع بالصوت
هل يعمل Wan 2.7 المدفوع بالصوت على أي صورة؟
لا. تنتج الصور الأمامية ذات الفم المغلق أو المحايد أفضل تزامن للشفاه. تنتج صور الملف الجانبي التي تزيد عن 30 درجة، والأفواه المفتوحة، والفكوك المحجوبة عدم تطابق مرئي. استهدف قصًا للرأس والكتفين بحيث يملأ الوجه 40 إلى 60 بالمائة من الإطار.
ما هو تنسيق الصوت الذي يقبله Wan 2.7؟
تقبل واجهة برمجة تطبيقات I2V تنسيقات WAV و MP3 القياسية. يتفوق الصوت بجودة الاستوديو عند 48 كيلو هرتز و 320 كيلوبت في الثانية أو أعلى على التسجيلات بجودة الهاتف. تجنب القص، والصدى الثقيل، والأصوات المتداخلة.
ما هو أقصى طول يمكن أن يكون عليه المقطع المدفوع بالصوت؟
يصل إلى 15 ثانية كحد أقصى لواجهة برمجة التطبيقات، لكن تزامن الشفاه يميل إلى الانحراف بعد حوالي 10 إلى 12 ثانية. للمقاطع الأطول، قم بعرض أجزاء تتراوح من 8 إلى 10 ثوانٍ وقم بتجميعها في محرر فيديو.
هل يمكنني استخدام صوتين في مسار صوتي واحد؟
تقنيًا نعم، لكن النموذج ينتج فمًا مشوشًا يحاول مطابقة كلا المتحدثين. لحوار بين شخصيتين، قم بعرض كل جانب كمقطع منفصل وقم بدمج النتيجة في مرحلة ما بعد الإنتاج.
هل يقوم Wan 2.7 المدفوع بالصوت بتوليد الصوت نفسه؟
لا. الصوت هو إدخال تقوم بتقديمه. يستخدم النموذج شكل الموجة لدفع حركة الشفاه والرأس. إذا كنت بحاجة إلى توليد الصوت، فاستخدم نموذج TTS أولاً، ثم مرر هذا الصوت إلى Wan 2.7.
شاهده وهو يعمل
— 歸藏(guizang.ai) (@op7418) April 13, 2026


