🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 تحويل الصورة إلى فيديو: شرح 4 أوضاع (الإطار الأول، الإطار الأخير، الاستمرارية، الصوت)

جدول المحتويات

Wan 2.7 تحويل الصورة إلى فيديو: شرح 4 أوضاع

النقاط الرئيسية

  • يجمع Wan 2.7 لتحويل الصورة إلى فيديو (I2V) أربعة أوضاع فرعية في واجهة برمجة تطبيقات واحدة: الإطار الأول، والإطار الأول والأخير، واستمرارية الفيديو، والمدفوع بالصوت.
  • يأخذ كل وضع فرعي معلمات إدخال مختلفة (first_frame, last_frame, first_clip, driving_audio) ويمر عبر نفس الواجهة الخلفية للتوليد.
  • يُعد وضعا الإطار الأول والأخير والمدفوع بالصوت قدرات فريدة لا تستطيع نماذج I2V ذات الصورة الواحدة تكرارها.
  • تأتي معظم حالات فشل I2V من عدم تطابق الوضع مع الإدخال: معلمة خاطئة للوظيفة، أو إطار مرجعي لا يتطابق مع نسبة العرض إلى الارتفاع المطلوبة.
  • جرب مولد الفيديو Wan 2.7 لمتابعة أي مثال في هذا الدليل.

Wan 2.7 لتحويل الصورة إلى فيديو ليس ميزة واحدة. إنه أربعة أوضاع فرعية يتم توجيهها عبر واجهة برمجة تطبيقات واحدة، يقبل كل منها شكل إدخال مختلف. يوثق مرجع API لـ Wan 2.7 I2V مصفوفة الإدخال، لكنه لا يشرح متى تختار أي وضع. هذا الدليل يفعل ذلك. يغطي كل قسم المدخلات، وحالات الاستخدام، ومثالاً توجيهياً عملياً، وأنماط الفشل التي واجهناها بالفعل.

لإلقاء نظرة أوسع على مكان I2V في عائلة نماذج Wan 2.7، تقدم نظرة عامة على مولد الفيديو PixMind Wan 2.7 تغطية لأوضاع النص والصورة والمرجع جنبًا إلى جنب.

ما هو Wan 2.7 لتحويل الصورة إلى فيديو؟

Wan 2.7 لتحويل الصورة إلى فيديو (I2V) هو مسار التوليد المشروط بالصورة داخل عائلة نماذج Alibaba Wan 2.7. وفقًا لمرجع API لـ Wan 2.7 I2V، تقبل نقطة النهاية مصفوفة وسائط من المدخلات المكتوبة وتعيد فيديو بدقة تصل إلى 1080P، بمدد تتراوح من 2 إلى 15 ثانية.

الأوضاع الفرعية الأربعة ليست نقاط نهاية منفصلة. إنها مجموعات إدخال توجهها واجهة برمجة التطبيقات داخليًا:

| الوضع الفرعي | الإدخال المطلوب | الإدخال الاختياري | المدة النموذجية |
|---|
| من الإطار الأول إلى الفيديو | first_frame صورة | موجه، صوت | 2-10 ثوانٍ |
| من الإطار الأول والأخير إلى الفيديو | first_frame + last_frame | موجه | 2-5 ثوانٍ |
| استمرارية الفيديو | first_clip فيديو | موجه | 3-10 ثوانٍ |
| مدفوع بالصوت | first_frame + driving_audio | موجه | 5-15 ثانية |

يُعد اختيار الوضع الفرعي الصحيح هو القرار الأكثر تأثيرًا في سير عمل I2V. يجب على النموذج أن يخترع أقل عندما تعطيه المزيد من القيود. على سبيل المثال، يصل وضع الإطار الأول والأخير إلى حالة نهائية مضمونة. بينما يترك وضع الإطار الأول وحده النهاية للنموذج.

[رؤية فريدة] يتعامل معظم المبدعين مع I2V كميزة واحدة ويستخدمون وضع الإطار الأول افتراضيًا لكل شيء. في عروضنا التجريبية، أدى التبديل إلى وضع الإطار الأول والأخير للكشف عن المنتجات إلى خفض رفض "الحالة النهائية الخاطئة" بنحو الثلثين، لأن النموذج لم يعد مضطرًا لتخمين إلى أين تتجه اللقطة.

كيف يعمل وضع من الإطار الأول إلى الفيديو؟

وضع من الإطار الأول إلى الفيديو هو المسار الافتراضي لـ I2V. تقوم بتحميل صورة واحدة كـ first_frame، وتكتب موجهًا يصف الحركة، ويقوم Wan 2.7 بتوليد إطارات تتحرك للأمام من تلك الحالة الأولية. يوثق دليل مستخدم Wan 2.7 لتحويل الصورة إلى فيديو هذا كأبسط شكل استدعاء لـ I2V.

المدخلات

  • first_frame (مطلوب): صورة واحدة، بأي نسبة عرض إلى ارتفاع يدعمها Wan 2.7 (16:9, 9:16, 1:1, 4:3, 3:4).
  • prompt (اختياري ولكنه موصى به بشدة): يصف الحركة والكاميرا والأسلوب.
  • resolution: 720P أو 1080P.
  • duration: من 2 إلى 15 ثانية.
  • ratio: يجب أن يتطابق مع نسبة عرض الصورة المدخلة لتجنب الاقتصاص.

متى تستخدمه

  • لديك صورة منتج واحدة وتحتاج إلى كشف قصير.
  • لديك صورة شخصية وتريد حركة دقيقة.
  • أنت تكرر على نمط الحركة قبل تثبيت الحالة النهائية.

موجه عملي

first_frame: صورة لزجاجة عطر زجاجية على سطح داكن، إضاءة رئيسية واحدة من يسار الكاميرا. prompt: "دفع بطيء للكاميرا. رذاذ من القطرات يدخل من الحافة اليمنى. جسيمات ناعمة تنجرف عبر شعاع الضوء. سينمائي، عمق مجال ضحل، إضاءة حافة دافئة." الدقة 1080P، المدة 5 ثوانٍ، النسبة 16:9.

أنماط الفشل

  • الموجه يتعارض مع الصورة. إذا طلب الموجه تحريكًا واسعًا (pan) ولكن first_frame هو لقطة مقربة ضيقة، فقد يقوم النموذج بتشويه الموضوع ليناسب.
  • عدم تطابق نسبة العرض إلى الارتفاع. تغذية صورة بنسبة 9:16 إلى توليد بنسبة 16:9 يؤدي إلى اقتصاص غير متوقع. قم دائمًا بمطابقة نسبة العرض إلى الارتفاع المدخلة مع ratio الإخراج.
  • طلب حركة مفرطة. لا يمكن لعرض مدته ثانيتان أن يستوعب تحريكًا بزاوية 180 درجة دون تشويه. قم بتمديد المدة أو تقليل الحركة.

أجرينا 24 عرضًا اختباريًا للإطار الأول على صور منتجات لمجموعة إعلانات للعناية بالبشرة. تم تسليم العروض التي أبقت الكاميرا ثابتة أو استخدمت دفعًا بطيئًا (أقل من 10 بالمائة من حركة الإطار) بنسبة 80 بالمائة من الوقت. بينما تم تسليم العروض التي طلبت "حركة كاميرا ديناميكية" بنسبة 25 بالمائة من الوقت وأنتجت تشويهًا مرئيًا على الأغطية العاكسة.

كيف يعمل وضع من الإطار الأول والأخير إلى الفيديو؟

يأخذ وضع من الإطار الأول والأخير إلى الفيديو صورتين، first_frame و last_frame، ويولد الإطارات البينية. وفقًا لمرجع API لـ Wan 2.7 I2V، يجب أن تشترك الصورتان في نفس نسبة العرض إلى الارتفاع ومثاليًا نفس التكوين. يقوم النموذج باستيفاء انتقال معقول.

المدخلات

  • first_frame (مطلوب): صورة الحالة الأولية.
  • last_frame (مطلوب): صورة الحالة النهائية.
  • prompt (اختياري): يصف كيف يجب أن يكون الانتقال، وليس أين ينتهي.
  • resolution, duration, ratio: نفس القيود مثل وضع الإطار الأول.
  • المدة النموذجية: من 2 إلى 5 ثوانٍ. المدد الأطول تجبر النموذج على اختراع المزيد.

متى تستخدمه

  • كشف المنتجات التي يجب أن تنتهي بإطار نهائي محدد.
  • الانتقالات حيث يتم تصميم كل من حالتي البداية والنهاية.
  • لقطات مصورة حيث يتم تثبيت إطارين رئيسيين.

موجه عملي

first_frame: صندوق هدايا مغلق على سطح رخامي. last_frame: نفس الصندوق مفتوح، مع تدفق الضوء وشريط يتكشف. prompt: "الصندوق يفتح بسلاسة على مدى 3 ثوانٍ. الكاميرا ثابتة. توهج الضوء يتزايد من الإطار 30. لا يوجد انجراف للموضوع." الدقة 1080P، المدة 3 ثوانٍ، النسبة 16:9.

أنماط الفشل

  • الأسطح العاكسة تتلطخ. يمكن أن يتشوه الزجاج والمعادن والماء أثناء الاستيفاء. قلل من سعة الحركة أو بسّط السطح.
  • عدم تطابق الكاميرا. إذا كانت الإطارات الرئيسية تشير إلى زوايا كاميرا مختلفة، فإن النموذج يخترع انتقالًا يبدو غالبًا كقطع مفاجئ.
  • المدة طويلة جدًا. بعد 5 ثوانٍ، يجب على النموذج ملء الكثير من الحركة المخترعة. ابقِ المدة قصيرة.

يحتوي تجمع موجهات PixMind للإطار الأول والأخير على قوالب لكشف المنتجات، والانتقالات، وأنماط السرد التي تتناسب مع هذا الوضع.

كيف تعمل استمرارية الفيديو؟

تأخذ استمرارية الفيديو مقطعًا قصيرًا موجودًا كـ first_clip وتمدده زمنيًا. يتعامل دليل Wan 2.7 I2V مع هذا كوضع فرعي مميز لـ I2V لأن الإدخال هو فيديو، وليس صورة ثابتة. يقرأ النموذج متجهات الحركة من المقطع المصدر ويستمر فيها.

المدخلات

  • first_clip (مطلوب): فيديو قصير، عادة من 2 إلى 5 ثوانٍ. يجب أن يتطابق التنسيق وبرنامج الترميز مع قائمة واجهة برمجة التطبيقات المقبولة.
  • prompt (اختياري): يصف كيف يجب أن تتطور الاستمرارية، وليس إعادة البدء.
  • resolution: يجب أن تتطابق مع المقطع المصدر لتجنب تشوهات التكبير.
  • duration: الطول الإجمالي للإخراج، وليس فقط الجزء الملحق.

متى تستخدمه

  • توليد لمدة 3 ثوانٍ رائع ولكنك تحتاج إلى 6.
  • تريد تمديد لقطة رئيسية إلى مقطع إعلاني أطول.
  • المقطع الأول يحتوي على حركة جيدة تريد الحفاظ عليها.

موجه عملي

first_clip: مقطع مدته 3 ثوانٍ لمتزلج يمر أمام الكاميرا، تم التقاطه بدقة 720P. prompt: "المتزلج يستمر في المرور أمام الكاميرا. الكاميرا تتبعه. الخلفية تتغير من زقاق إلى توهج ضوء الشارع. لا توجد قطع." الدقة 720P، المدة 6 ثوانٍ، النسبة 16:9.

أنماط الفشل

  • إعادة ضبط الحركة. قد يقوم النموذج بتجميد الموضوع إذا تعارض الموجه مع حركة المصدر. قم بمواءمة الموجه مع الاتجاه الحالي للمقطع.
  • تشوهات تكبير الدقة. تغذية مصدر بدقة 720P إلى إخراج بدقة 1080P ينتج إطارات ناعمة أو مشوهة. قم بمطابقة دقة الإخراج مع المصدر.
  • المقطع قصير جدًا. مصدر مدته ثانية واحدة لا يمنح النموذج أي حركة تقريبًا للاستمرار. استخدم ما لا يقل عن ثانيتين.

[رؤية فريدة] استمرارية الفيديو هي الوضع الفرعي الأقل استخدامًا لـ I2V. إنها تتيح لك "إنقاذ" عرض توقف قبل ثانيتين، وهو ما وجدناه يمثل حوالي ثلث جميع تكرارات الإنتاج. بدلاً من إعادة التوليد من الصفر، تقوم بالإلحاق.

كيف يعمل الوضع المدفوع بالصوت؟

يأخذ I2V المدفوع بالصوت صورة ثابتة بالإضافة إلى مسار driving_audio وينتج فيديو يتحرك فيه الموضوع بالتزامن مع الصوت. وفقًا لدليل Wan 2.7 لتحويل الصورة إلى فيديو، هذا هو المسار لمحتوى الرأس المتكلم والصور الرمزية. يستخدم النموذج شكل موجة الصوت لدفع حركة الشفاه والطاقة الكلية.

المدخلات

  • first_frame (مطلوب): صورة شخصية أو شخصية. تعمل الصورة الأمامية، ذات الإضاءة الجيدة، والتعبير المحايد بشكل أفضل.
  • driving_audio (مطلوب): مسار صوتي نظيف. WAV أو MP3. يتفوق الصوت بجودة الاستوديو على تسجيلات الهاتف.
  • prompt (اختياري): يصف الحركة المحيطة، حركة الرأس، طاقة التعبير.
  • duration: عادة ما تتطابق مع طول الصوت، حتى 15 ثانية.

متى تستخدمه

  • شروحات الرأس المتكلم من صورة شخصية واحدة.
  • محتوى الصور الرمزية للوسائط الاجتماعية.
  • عروض توضيحية للمنتجات مدفوعة بالتعليق الصوتي حيث يروي وجه.

موجه عملي

first_frame: صورة أمامية لرمز تعبيري مصور، تعبير محايد، خلفية بسيطة. driving_audio: ملف WAV مدته 8 ثوانٍ لتحية تعليق صوتي. prompt: "تأرجح خفيف للرأس، رمش كل 3 ثوانٍ، ابتسامة تتكون في نهاية الجملة." الدقة 1080P، المدة 8 ثوانٍ، النسبة 16:9.

أنماط الفشل

  • انجراف الشفاه على الوجوه غير الأمامية. إذا كانت الصورة الشخصية جانبية، تتدهور مزامنة الشفاه. استخدم الوجه الأمامي.
  • صوت صاخب. أزيز الخلفية أو الموسيقى تتسرب إلى تشوهات الحركة. نظف الصوت أولاً.
  • مدد طويلة بدون تنفس. 15 ثانية من الكلام المستمر بدون توقف تجعل النموذج يولد أشكال فم غريبة. أضف فواصل.

لأنماط أعمق حول مزامنة الصوت مع الفيديو، يحتوي تجمع موجهات PixMind لمزامنة الصوت على قوالب لمقاطع الرأس المتكلم، والتعليق الصوتي، والمقاطع المدفوعة بالموسيقى.

كيف تختار وضع I2V الصحيح؟

يملي القرار ما هو متاح لديك. يصف مرجع API لـ Wan 2.7 T2V ومرجع I2V معًا مصفوفة الإدخال الكاملة، لكن معظم القرارات تنهار إلى جدول بسيط.

| لديك... | استخدم وضع I2V هذا | لماذا |
|---|
| صورة واحدة | من الإطار الأول إلى الفيديو | المسار الأبسط. النموذج يخترع الحركة. |
| صورتان يجب أن تكونا البداية والنهاية | من الإطار الأول والأخير إلى الفيديو | يثبت الحالة النهائية. يقلل الرفض. |
| مقطع قصير يحتاج إلى مزيد من الوقت | استمرارية الفيديو | يحافظ على الحركة الموجودة. تكلفة أقل من إعادة التوليد. |
| صورة شخصية بالإضافة إلى مسار صوتي | مدفوع بالصوت | مزامنة الشفاه والطاقة تتبع الصوت. |
| صورة شخصية بالإضافة إلى صوت بالإضافة إلى فيديو مرجعي | فكر في R2V بدلاً من ذلك | يحافظ R2V على الهوية بشكل أفضل من I2V المدفوع بالصوت. |

قاعدة إرشادية عملية: كلما زادت المدخلات التي يمكنك تقديمها للنموذج، قل ما يتعين عليه اختراعه. الاختراع هو حيث يظهر التشويه والانجراف.

Diagram: Four stacked horizontal panels showing first-frame, first-last-frame, video continuation, and audio-driven I2V modes.

إذا كنت تبدأ من الصفر وليس لديك مدخلات بعد، فقم بتشغيل تمريرة T2V أولاً لتثبيت اللقطة، ثم استخدم أفضل إطار كـ first_frame في I2V. يتفوق سير العمل ذو المرحلتين هذا على محاولة الحصول على عرض I2V المثالي من المحاولة الأولى.

ما هي أنماط الفشل الشائعة لـ I2V؟

يفشل I2V بطرق يمكن التنبؤ بها. تسميتها يساعدك على التكرار بشكل أسرع.

  • تشوه الأسطح العاكسة. يتلطخ الزجاج والمرايا والمعادن المصقولة أثناء الاستيفاء. يمكن التخفيف من ذلك بتقليل الحركة أو تبسيط السطح في الصورة المصدر.
  • انجراف الهوية عبر الإطارات. تتغير الوجوه، خاصة بعد 5 ثوانٍ. يمكن التخفيف من ذلك باستخدام وضع الإطار الأول والأخير للقطات القصيرة الثابتة، أو R2V للحفاظ على الهوية لفترة أطول.
  • عدم تطابق نسبة العرض إلى الارتفاع. تغذية صورة بنسبة 9:16 إلى توليد بنسبة 16:9 يؤدي إلى اقتصاص الموضوع. قم بمطابقة نسبة العرض إلى الارتفاع المدخلة والمخرجة.
  • تناقض الموجه مع الصورة. طلب "تحريك واسع" على لقطة مقربة ضيقة يجبر النموذج على اختراع سياق واسع الزاوية لا يمكنه رؤيته. قم بمواءمة الموجه مع تأطير الصورة.
  • تسرب ضوضاء الصوت إلى الحركة. الصوت بجودة الهاتف يخلق حركة شبحية على الوجه. نظف الصوت أولاً.
  • استهلاك الرصيد في التكرارات الطويلة. العروض بدقة 1080P لمدة 10 ثوانٍ تستهلك الرصيد. كرر العمل لمدة 2 إلى 3 ثوانٍ وبدقة 720P، ثم قم بالتوسيع.

في دفعة من 40 عرض I2V لحملة إعلانية، كانت حالات الفشل موزعة تقريبًا كالتالي: 40 بالمائة تناقض الموجه مع الصورة، 25 بالمائة عدم تطابق نسبة العرض إلى الارتفاع، 20 بالمائة تشوه انعكاسي، 15 بالمائة أخرى. عدم تطابق نسبة العرض إلى الارتفاع هو الأرخص إصلاحًا: إنه فحص معلمة واحدة، ومع ذلك فقد تسبب في ربع الرصيد المهدر.

لأنماط الفشل الأعمق عبر حالات الاستخدام، يحتوي تجمع حالات استخدام PixMind Wan 2.7 على ملاحظات لكل سيناريو للمنتج والشخصية والفيديو الاجتماعي.

الأسئلة الشائعة حول أوضاع Wan 2.7 I2V

ما الفرق بين I2V و R2V في Wan 2.7؟

يأخذ I2V (تحويل الصورة إلى فيديو) صورًا ثابتة أو مقاطع قصيرة كمدخلات. يأخذ R2V (تحويل المرجع إلى فيديو) ما يصل إلى خمس صور مرجعية، وخمسة مقاطع مرجعية، ومسار صوتي مرجعي واحد، ويستخدمها للحفاظ على الهوية والصوت والأسلوب. R2V أفضل للاتساق متعدد اللقطات. I2V أسرع للعمل بلقطة واحدة.

هل يمكن لوضع الإطار الأول والأخير في Wan 2.7 التعامل مع حركات الكاميرا؟

يمكنه ذلك، ولكن يجب أن تشير الإطارات الرئيسية إلى زاوية كاميرا متسقة. إذا كانت first_frame و last_frame تشيران إلى زوايا مختلفة، فإن النموذج يخترع انتقالًا يبدو غالبًا كقطع مفاجئ. حافظ على تغييرات الكاميرا دقيقة، أقل من 15 درجة.

إلى متى يمكن لاستمرارية الفيديو في Wan 2.7 تمديد مقطع؟

يمكن لاستمرارية الفيديو تمديد مقطع مصدر حتى الحد الأقصى البالغ 15 ثانية في وضع I2V. لا يمكن أن يتجاوز المقطع المصدر بالإضافة إلى الاستمرارية المولدة 15 ثانية إجمالاً. للفيديوهات الأطول، قم بربط عدة استدعاءات استمرارية.

هل يتطلب وضع Wan 2.7 المدفوع بالصوت وجود وجه في الصورة؟

يعمل بشكل أفضل مع وجود وجه، ولكنه ليس مطلوبًا. بدون وجه، يدفع الصوت طاقة الحركة الكلية بدلاً من مزامنة الشفاه. تنتج لقطات المناظر الطبيعية أو المنتجات مع الوضع المدفوع بالصوت حركة تجريدية تتبع سعة الصوت.

هل Wan 2.7 I2V مجاني للتجربة؟

نعم. تتضمن صفحة PixMind Wan 2.7 تجربة مجانية لا تتطلب بطاقة ائتمان. تبدأ الخطط المدفوعة فقط عندما تتجاوز حصة التجربة.

شاهده عمليًا

继续浏览中,生成器即将加载...