🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

مولد الفيديو Wan 2.7: دليل كامل للنص والصورة والفيديو المرجعي

جدول المحتويات

مولد الفيديو Wan 2.7: الدليل الكامل لأوضاع النص والصورة والمرجع

النقاط الرئيسية

  • Wan 2.7 هو نموذج موحد يغطي تحويل النص إلى فيديو (T2V)، والصورة إلى فيديو (I2V)، والفيديو المرجعي (R2V) في سير عمل واحد.
  • يدعم إخراج بدقة 720P و 1080P، ومدة تتراوح من 2 إلى 15 ثانية، وخمس نسب عرض إلى ارتفاع بما في ذلك 16:9، 9:16، و 1:1.
  • تمنحك أوضاع الإطار الأول والأخير والأوضاع التي تعتمد على الصوت تحكمًا في حالة البداية وحالة النهاية لا يمكن لنماذج I2V ذات الصورة الواحدة أن تضاهيه.
  • يقبل تحويل الفيديو المرجعي (R2V) ما يصل إلى خمس صور مرجعية، وخمسة مقاطع مرجعية، ومسار صوتي مرجعي في استدعاء واحد.
  • جرب مولد الفيديو Wan 2.7 لتتبع أي مثال في هذا الدليل.

ما هو مولد الفيديو Wan 2.7؟

Wan 2.7 هو أحدث نموذج لتوليد الفيديو من فريق Wan التابع لـ Alibaba، ويتم عرضه من خلال Alibaba Cloud Model Studio. يوحد أربع قدرات كانت منفصلة سابقًا في عائلة نماذج واحدة: تحويل النص إلى فيديو، والصورة إلى فيديو، والفيديو المرجعي، وتحرير الفيديو. وفقًا لـ نظرة عامة على توليد الفيديو في Alibaba Cloud، يقبل النموذج مدخلات متعددة الوسائط ويخرج MP4 أو MOV بدقة تصل إلى 1080P.

التحول الرئيسي في 2.7 هو توحيد سير العمل. بدلاً من التبديل بين البائعين لتحويل النص إلى فيديو والصورة إلى فيديو، يمكنك استدعاء نفس النموذج والسماح لواجهة برمجة التطبيقات بالتوجيه بناءً على المدخلات التي تمررها. يتطابق هذا مع صفحة منتج PixMind Wan 2.7، حيث تتعامل واجهة إنشاء واحدة مع كل وضع.

بالنسبة للمبدعين، هذا مهم لأن تبديل الأوضاع هو المكان الذي يضيع فيه معظم وقت الإنتاج. تكتب موجهًا، تقوم بالمعالجة، تدرك أن حالة البداية خاطئة، ثم تعيد البناء من الصفر في أداة مختلفة. تتيح لك واجهة Wan 2.7 الموحدة تبديل المدخلات دون تبديل النماذج.

كم عدد الأوضاع التي يدعمها Wan 2.7؟

يكشف Wan 2.7 عن أربعة أوضاع. يوثق مرجع واجهة برمجة تطبيقات I2V مصفوفة الإدخال الكاملة. إليك التفصيل العملي.

| الوضع | الإدخال | الأفضل لـ | المدة القصوى | الدقة القصوى |
|---|
| T2V (نص إلى فيديو) | موجه نصي، صوت اختياري | القصص المصورة، الحركة التجريدية، لقطات B-roll | 15 ثانية | 1080P |
| I2V (صورة إلى فيديو) | الإطار الأول، الإطار الأخير الاختياري، الصوت الاختياري | كشف المنتجات، حركة الشخصيات، الرسوم المتحركة | 15 ثانية | 1080P |
| R2V (فيديو مرجعي) | ما يصل إلى 5 صور مرجعية + 5 مقاطع مرجعية + مسار صوتي مرجعي | الحفاظ على الهوية، استنساخ الصوت، مشاهد متعددة الشخصيات | 10 ثوانٍ | 1080P |
| تحرير الفيديو | فيديو المصدر + تعليمات | نقل الأسلوب، التعديلات القائمة على التعليمات | 10 ثوانٍ | 1080P |

مخطط: شبكة رباعية الأرباع تظهر أوضاع النص إلى فيديو، الصورة إلى فيديو، الإطار الأول والأخير، والفيديو المرجعي متصلة بمركز محوري.

نص إلى فيديو (T2V)

يأخذ T2V موجهًا نصيًا ويخرج فيديو. يدرج مرجع واجهة برمجة تطبيقات T2V لـ Wan 2.7 المعلمات المدعومة بما في ذلك الدقة والمدة والنسبة ومسار صوتي اختياري. T2V هو أسرع مسار من الفكرة إلى المقطع.

استخدم T2V عندما لا يكون لديك إطار بداية ثابت. الحركة التجريدية، لقطات B-roll، القصص المصورة، والتسلسلات المنسقة كلها مناسبة. تجنب T2V عندما تكون حالة البداية مهمة: إذا كنت بحاجة إلى منتج معين على الشاشة في الإطار صفر، انتقل إلى I2V.

صورة إلى فيديو (I2V)

I2V هو المكان الذي يظهر فيه توحيد سير عمل Wan 2.7. يوثق دليل مستخدم Wan 2.7 لتحويل الصورة إلى فيديو أربعة أوضاع فرعية:

  1. الإطار الأول إلى فيديو: تصبح صورة واحدة حالة البداية، ويخترع النموذج الحركة.
  2. الإطار الأول والأخير إلى فيديو: تحدد صورتان حالتي البداية والنهاية، ويقوم النموذج بالاستيفاء.
  3. استمرارية الفيديو: يصبح مقطع قصير حالة البداية، ويقوم النموذج بتمديده.
  4. مدفوع بالصوت: صورة بالإضافة إلى مسار صوتي يدفع مزامنة الشفاه أو الحركة.

للحصول على شرح أعمق لمسارات I2V الأربعة، راجع مجموعة موجهات الإطار الأول والأخير في PixMind.

فيديو مرجعي (R2V)

R2V هو الوضع الأقوى والأقل توثيقًا. يصف مرجع واجهة برمجة تطبيقات R2V لـ Wan 2.7 استدعاءً يقبل ما يصل إلى خمس صور مرجعية، وخمسة مقاطع مرجعية، ومسار صوتي مرجعي واحد. يستخدم النموذج هذه للحفاظ على الهوية والصوت والأسلوب عبر الإخراج.

R2V هو ما يجب استخدامه عندما تحتاج إلى أن تبدو الشخصية كما هي عبر اللقطات، أو عندما تريد استنساخ صوت في مشهد جديد. المقايضة هي المدة: يقتصر R2V على 10 ثوانٍ، وهو أقصر من الحد الأقصى البالغ 15 ثانية لـ T2V و I2V.

تحرير الفيديو

يأخذ تحرير الفيديو فيديو مصدرًا بالإضافة إلى تعليمات نصية ويعيد مقطعًا محررًا. تدعم واجهة برمجة تطبيقات تحرير الفيديو Wan 2.7 التعديلات القائمة على التعليمات ونقل الأسلوب. هذا الوضع خارج نطاق دليل التوليد، ولكنه يستحق المعرفة بوجوده.

كيف يعمل وضع الإطار الأول والأخير؟

الإطار الأول والأخير هو وضع فرعي لـ I2V. توفر صورتين: واحدة للإطار الأول، وواحدة للأخير. يقوم Wan 2.7 بإنشاء الإطارات البينية.

مخطط: خط زمني يظهر إطارين رئيسيين مع ثلاثة إطارات مستوفاة بينهما، مع مفهوم شعار Wan 2.7 الذي يحدد الإطارات البينية.

هذا مهم لأن I2V ذو الصورة الواحدة يترك الحالة النهائية للنموذج. إذا كانت لقطتك تحتاج إلى الهبوط على إطار معين (منتج يدور بالكامل، صندوق مفتوح بالكامل، شخصية مستديرة بالكامل)، فإن الإطار الأول والأخير هو كيف تضمن هذا الهبوط.

النمط العملي هو: قم بتصوير أو إنشاء إطارين رئيسيين، وقم بتحميلهما كأول وآخر، واضبط المدة، ثم قم بالمعالجة. يقوم Wan 2.7 باستيفاء الحركة بينهما. تحتوي صفحة موجهات الإطار الأول والأخير في PixMind على قوالب موجهات لكشف المنتجات، والانتقالات، وأنماط سرد القصص.

أوضاع الفشل الشائعة التي يجب الانتباه إليها:

  • التشوه على الأسطح العاكسة: يمكن أن تتلطخ الزجاج والمعادن والماء أثناء الاستيفاء.
  • انحراف الهوية في الشخصيات: قد تتغير الوجوه بين الإطارات.
  • عدم اتساق الكاميرا: إذا كانت الإطارات الرئيسية تشير إلى زوايا كاميرا مختلفة، يجب على النموذج اختراع انتقال.

اختبر بمدد قصيرة أولاً (2-3 ثوانٍ) قبل الالتزام بالمعالجة لمدة 5-10 ثوانٍ.

كيف يعمل الفيديو المدفوع بالصوت؟

يأخذ الوضع المدفوع بالصوت صورة ثابتة بالإضافة إلى مسار صوتي وينتج فيديو يظهر فيه الموضوع يتحدث أو يتحرك بالتزامن مع الصوت. هذا هو أساس محتوى الرؤوس المتحدثة والصور الرمزية.

يستخدم النموذج شكل الموجة الصوتية لدفع شيئين: حركة الشفاه (إذا كان هناك وجه) وطاقة الحركة الكلية. تقبل واجهة برمجة تطبيقات I2V لـ Wan 2.7 الصوت كجزء من مصفوفة الوسائط، باستخدام نوع driving_audio.

لحالات استخدام الرؤوس المتحدثة، قم بإقران هذا بـ مجموعة أداء الشخصيات في PixMind. إن الجمع بين I2V المدفوع بالصوت وصورة مرجعية نظيفة هو أفضل مسار مفتوح حاليًا لإنشاء صورة رمزية متزامنة الشفاه دون تدريب نموذج مخصص.

ملاحظتان عمليتان:

  • جودة الصوت تدفع جودة الفيديو. تسجيل استوديو نظيف يتفوق على ميكروفون الهاتف.
  • اختبر بمقطع مدته 3 ثوانٍ أولاً. مشاكل المزامنة أسهل في اكتشافها مبكرًا.

ما هي الدقة والمدة ونسبة العرض إلى الارتفاع التي يجب أن تختارها؟

يدعم Wan 2.7 إخراج بدقة 720P و 1080P. المقايضة هي التكلفة مقابل الحدة. وفقًا لـ استراتيجية تسعير PixMind، يستهلك 1080P ما يقرب من ضعف أرصدة 720P لكل ثانية.

| الإعداد | متى تختار | المقايضة |
|---|
| 720P | المحتوى الموجه للمنصات الاجتماعية، الفيديو العمودي، تكرارات الاختبار | تكلفة أقل، نعومة مرئية على الشاشات الكبيرة |
| 1080P | عروض المنتجات، المعاينة السينمائية، إعلانات إبداعية | تكلفة أعلى، تفاصيل أكثر حدة |
| 16:9 | YouTube، تضمينات المواقع | شاشة عريضة قياسية |
| 9:16 | Reels، TikTok، Shorts | عمودي للهاتف المحمول |
| 1:1 | منشورات الخلاصة، تضمينات مربعة | محايد عبر المنصات |
| 4:3 / 3:4 | تحريري، أسلوب عتيق | متخصص |

تؤثر المدة على التكلفة خطيًا. تكلفة معالجة 10 ثوانٍ تبلغ حوالي 5 أضعاف تكلفة معالجة ثانيتين بنفس الدقة. للتكرار، اعمل على مدد قصيرة. للنسخة النهائية، اعمل على مدد طويلة.

إعداد افتراضي معقول للمستخدمين الجدد: 720P، 5 ثوانٍ، 16:9. تأكد من أن اللقطة تعمل، ثم ارفعها إلى 1080P للنسخة النهائية.

كيف تختار الوضع الصحيح في Wan 2.7؟

شجرة القرار واضحة بمجرد أن تعرف المدخلات التي لديك.

مخطط سير العمل يظهر 5 مراحل: الإدخال، اكتشاف الوضع، توجيه النموذج، التوليد، الإخراج.

  • لديك فكرة فقط: استخدم T2V. كرر على الموجه قبل إضافة المرئيات.
  • لديك صورة منتج واحدة: استخدم وضع الإطار الأول في I2V.
  • لديك إطاران رئيسيان يجب أن يكونا البداية والنهاية: استخدم وضع الإطار الأول والأخير في I2V.
  • لديك مقطع قصير يحتاج إلى التمديد: استخدم استمرارية الفيديو في I2V.
  • لديك صورة شخصية بالإضافة إلى تعليق صوتي: استخدم I2V المدفوع بالصوت.
  • تحتاج إلى الحفاظ على الهوية أو الصوت عبر اللقطات: استخدم R2V.
  • لديك لقطات موجودة تحتاج إلى تعديل أو تغيير في الأسلوب: استخدم تحرير الفيديو.

إذا كنت غير متأكد، ابدأ من مركز عائلة PixMind Wan واختر حسب حالة الاستخدام بدلاً من اسم الوضع. يوجهك المركز إلى الواجهة الصحيحة بناءً على ما تحاول إنشائه.

كيف يجب أن توجه Wan 2.7؟

هيكل الموجه أهم من طول الموجه. يكافئ Wan 2.7 تشريحًا من خمسة أجزاء: الموضوع، الحركة، الإعداد، الكاميرا، الأسلوب.

هيكل نموذجي:

الموضوع: زجاجة عطر زجاجية على سطح داكن. الحركة: رذاذ من القطرات ينفجر إلى اليمين. الإعداد: خلفية استوديو سوداء، ضوء رئيسي واحد من يسار الكاميرا. الكاميرا: لقطة متوسطة ثابتة، مكافئ 50 مم. الأسلوب: سينمائي، عمق مجال ضحل، إضاءة حافة دافئة.

يضيق كل جزء مساحة الإخراج. الأجزاء المفقودة تعود إلى افتراضات النموذج السابقة، والتي تكون عامة عادةً.

لأنماط الموجهات الأعمق، تغطي مجموعة موجهات PixMind متعددة اللقطات 12 هيكلًا قابلاً لإعادة الاستخدام بما في ذلك تسلسلات متعددة اللقطات، وأنماط مزامنة الصوت، ولوحات القصص المصورة للإطار الأول والأخير.

مزالق الموجه الشائعة التي يجب تجنبها:

  • الموجهات المحملة بشكل زائد: أكثر من خمسة مواضيع في موجه واحد يربك النموذج. قسمها إلى معالجات متعددة.
  • الإفراط في استخدام الموجهات السلبية: لا يزن Wan 2.7 الموجهات السلبية بالطريقة التي تفعلها نماذج الصور. اجعلها قصيرة.

كيف يقارن Wan 2.7 بالنماذج الأخرى؟

يقع Wan 2.7 في مجال مزدحم. تستهدف Sora 2 و VEO 3 و Kling 2.0 و Seedance جميعها حالات استخدام متداخلة. يكمن التمايز في الأوضاع التي يكشف عنها كل نموذج وبتكلفة.

| القدرة | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|
| نص إلى فيديو | نعم | نعم | نعم | نعم |
| صورة إلى فيديو | نعم | محدود | نعم | نعم |
| الإطار الأول والأخير | نعم | لا | محدود | محدود |
| فيديو مرجعي (R2V) | نعم | لا | لا | محدود |
| I2V المدفوع بالصوت | نعم | نعم | نعم | محدود |
| المدة القصوى | 15 ثانية | 20 ثانية | 8 ثوانٍ | 10 ثوانٍ |
| الدقة القصوى | 1080P | 1080P | 1080P | 1080P |

يعكس هذا الجدول المواصفات المنشورة من قبل البائعين اعتبارًا من يوليو 2026. توجد الاختبارات المستقلة المباشرة في اختبار موجه Wan 2.7 مقابل Sora 2 و مواجهة VEO و Kling.

الميزة المميزة لـ Wan 2.7 هي الإطار الأول والأخير المدمج مع R2V. لا يوجد نموذج آخر في الجدول يكشف عن كليهما بقدرة كاملة. إذا كان سير عملك يتطلب تحكمًا دقيقًا في البداية والنهاية بالإضافة إلى الحفاظ على الهوية، فإن Wan 2.7 هو المسار الوحيد حاليًا بنموذج واحد.

ما هي أوضاع الفشل الشائعة؟

كل نموذج فيديو بالذكاء الاصطناعي يفشل. تسمية أوضاع الفشل يساعدك على النشر بشكل أسرع.

  • التشوه على الأسطح العاكسة: الزجاج، المرايا، المعدن المصقول. يمكن التخفيف من ذلك عن طريق تقليل سعة الحركة في الموجه.
  • انحراف الهوية عبر اللقطات: تتغير الوجوه بين التوليدات. يمكن التخفيف من ذلك باستخدام مدخلات مرجعية R2V.
  • نص وهمي في الإطارات: العلامات، الملصقات، الشعارات تظهر ككلام غير مفهوم. يمكن التخفيف من ذلك عن طريق إزالة النص من صور الإدخال.
  • عدم تطابق نسبة العرض إلى الارتفاع: يؤدي إدخال صورة بنسبة 9:16 إلى توليد بنسبة 16:9 إلى اقتصاص غير متوقع. طابق نسبة العرض إلى الارتفاع المدخلة مع نسبة العرض إلى الارتفاع المخرجة.
  • استهلاك الأرصدة في التكرارات الطويلة: معالجة الاختبار لمدة 10 ثوانٍ تستهلك الأرصدة بسرعة. كرر لمدة 2-3 ثوانٍ.

تحتوي مجموعة حالات استخدام PixMind على ملاحظات حول أوضاع الفشل لكل سيناريو لتسويق المنتجات، أداء الشخصيات، المعاينة السينمائية، وخطافات وسائل التواصل الاجتماعي.

الأسئلة الشائعة حول مولد الفيديو Wan 2.7

هل Wan 2.7 مجاني للتجربة؟

نعم. تتضمن صفحة PixMind Wan 2.7 تجربة مجانية لا تتطلب بطاقة ائتمان. تبدأ الخطط المدفوعة فقط عندما تتجاوز حصة التجربة.

هل يدعم Wan 2.7 دقة 4K؟

لا. يصل فيديو Wan 2.7 إلى 1080P كحد أقصى. يدعم نموذج صور Wan 2.7 الصور الثابتة بدقة 4K من خلال الفئة الاحترافية، ولكن إخراج الفيديو يقتصر على 1080P.

هل يمكن لـ Wan 2.7 استنساخ وجه شخص معين؟

يمكن لـ Wan 2.7 الحفاظ على الهوية من المدخلات المرجعية، لكن سياسة PixMind تحظر استنساخ الشبه غير التوافقي لأشخاص حقيقيين يمكن التعرف عليهم. استخدم R2V مع شخصيات أصلية، أو مراجع جاهزة، أو شبهك الخاص.

كم يستغرق معالجة واحدة في Wan 2.7؟

يعتمد وقت التوليد على المدة والدقة والحمل. عادةً ما تنتهي معالجة 720P لمدة 5 ثوانٍ في 60-90 ثانية. يمكن أن تستغرق معالجة 1080P لمدة 10 ثوانٍ من 3-5 دقائق. تعيد واجهة برمجة التطبيقات معرف مهمة تستعلم عنه للحالة.

هل يولد Wan 2.7 الصوت؟

نعم، ولكن فقط في الأوضاع التي تقبل إدخال الصوت. يمكن لـ T2V أن يأخذ مسارًا صوتيًا ويقوم بمزامنة الحركة معه. يستخدم وضع I2V المدفوع بالصوت الصوت لدفع مزامنة الشفاه والحركة. توليد الصوت النقي (الموسيقى، المؤثرات الصوتية) هو نموذج Alibaba منفصل.

هل يمكنني استخدام مخرجات Wan 2.7 تجاريًا؟

نعم. المخرجات التي تولدها هي ملكك لاستخدامها تجاريًا بموجب شروط Alibaba Cloud Model Studio. راجع الشروط الحالية على نظرة عامة على Alibaba Cloud Model Studio قبل النشر.

شاهده وهو يعمل

继续浏览中,生成器即将加载...