🔥MiniMax H3 official 50% off|Annual membership includes unlimited H3 access Get 30% off annual membership Offer ends Aug 15Upgrade now
Pixmind

Wan 2.7 R2V: دليل إنشاء الفيديو المرجعي متعدد الوسائط

جدول المحتويات

Wan 2.7 R2V: دليل إنشاء الفيديو المرجعي متعدد الوسائط

النقاط الرئيسية

  • يقبل Wan 2.7 reference-to-video (R2V) ما يصل إلى 5 صور مرجعية، و5 مقاطع مرجعية، وصوتًا مرجعيًا واحدًا في مكالمة واحدة، وهي أوسع مصفوفة إدخال متعددة الوسائط بين نماذج 1080P الحالية.
  • R2V هو الوضع الصحيح للحفاظ على الهوية، واستنساخ الصوت، واستمرارية النمط عبر اللقطات، وليس لقطات B-roll لمرة واحدة أو تدوير المنتجات البسيط.
  • تعد تعارضات المراجع السبب الرئيسي للفشل، ويمكن منع معظمها باتباع سير عمل من أربع خطوات: التحضير-الضبط-الكتابة-التقديم.
  • للحصول على مكتبة مطالبات أعمق مرتبطة بهذا الوضع، راجع مجموعة مطالبات الفيديو المرجعي لـ PixMind.

ما هو Wan 2.7 R2V؟

R2V تعني reference-to-video، وهو وضع في Wan 2.7 يأخذ مدخلات مرجعية مختلطة وينتج مقطعًا جديدًا يحافظ على الهوية أو الصوت أو النمط من تلك المدخلات. وفقًا لـ مرجع Wan 2.7 R2V API على Alibaba Cloud، تقبل مكالمة R2V واحدة ما يصل إلى 5 صور مرجعية، و5 مقاطع مرجعية، ومسار صوتي مرجعي واحد، مع تحديد الإخراج بحد أقصى 1080P و10 ثوانٍ.

ما يميز R2V عن image-to-video هو التكييف متعدد الوسائط. يقوم I2V بقفل الإطار الأول ويسمح للنموذج بابتكار الحركة. بدلاً من ذلك، يستخرج R2V السمات من مراجعك، مثل بنية الوجه، والملابس، ونبرة الصوت، وتدرج الألوان، وينشرها في جيل جديد. لهذا السبب نتعامل مع R2V كسير عمل مختلف، وليس I2V أكثر تطوراً.

يقع R2V داخل واجهة Wan 2.7 video generator الموحدة على PixMind. لا تقوم بتبديل النماذج للوصول إليه. يختار الموجه R2V عندما تقوم بإرفاق مراجع في لوحة الإدخال.

كبسولة اقتباس: Wan 2.7 R2V (reference-to-video) هو وضع يقبل ما يصل إلى 5 صور مرجعية، و5 مقاطع مرجعية، وصوتًا مرجعيًا واحدًا في مكالمة API واحدة، ويخرج MP4 بدقة تصل إلى 1080P و10 ثوانٍ، ويستخدم للحفاظ على الهوية والصوت والنمط عبر اللقطات (Alibaba Cloud Model Studio، 2026).

ما هي المدخلات التي يقبلها R2V؟

يأخذ R2V ثلاث فئات من المدخلات، ويمكنك خلطها في نفس المكالمة. يوثق نظرة عامة على إنشاء الفيديو في Alibaba Cloud مخطط مصفوفة المدخلات. إليك التفصيل العملي لما تفعله كل خانة وعدد ما يمكنك تمريره.

خانة الإدخال الحد الأقصى للعدد ما تحمله مطلوب؟
صورة مرجعية 5 الوجه، المنتج، الملابس، تدرج الألوان مطلوب واحد على الأقل من أي إدخال
فيديو مرجعي 5 نمط الحركة، التوقيت، استمرارية المشهد اختياري
صوت مرجعي 1 نبرة الصوت، الإيقاع، الصوت المحيط اختياري
موجه نصي 1 الموضوع، الحركة، الكاميرا، النمط مطلوب

الموجه النصي مطلوب دائمًا. يستخدمه النموذج كعمود فقري للإنشاء، ثم يضيف سمات مستمدة من المراجع فوقه. بدون موجه، لا يملك النموذج مشهدًا لتقديمه وتفشل المكالمة.

بعض القيود التي تستحق الحفظ. تقتصر مقاطع الفيديو المرجعية على 10 ثوانٍ لكل منها، ولا تتجاوز مدة الإخراج أبدًا أقصر فيديو مرجعي تمرره. يجب أن يكون الصوت المرجعي ملف WAV أو MP3 نظيفًا يتراوح من 5 إلى 30 ثانية، وأي شيء أقصر يتم حشوه، وأي شيء أطول يتم اقتطاعه.

تفاعلات خانات الإدخال

تؤثر كل خانة على محور إخراج مختلف. الصور تدفع المظهر. مقاطع الفيديو تدفع الحركة. الصوت يدفع الصوت ومزامنة الشفاه عند وجود وجه. عندما تتعارض خانتان (على سبيل المثال، صورة مرجعية لشخص أشقر مقترنة بفيديو مرجعي لشخص ذي شعر داكن)، يختار النموذج واحدة ويتجاهل الأخرى، ولا يكون الاختيار دائمًا قابلاً للتنبؤ.

في اختباراتنا، تنتج المراجع المتعارضة اختيارات غير متناسقة عبر عمليات إعادة التشغيل بنفس البذرة. تعامل مع تعارضات المراجع على أنها غير حتمية وقم بإزالتها من المصدر.

متى يجب عليك استخدام R2V؟

R2V هو الخيار الصحيح عندما تكون الاستمرارية عبر اللقطات أهم من السرعة الخام. نلجأ إليه في ثلاث حالات محددة.

الحفاظ على الهوية عبر المشاهد متعددة اللقطات. إذا كنت بحاجة إلى نفس الشخصية في لقطة واسعة ومتوسطة ومقربة، فإن R2V مع صورة مرجعية قوية واحدة لكل زاوية يحافظ على اتساق بنية الوجه. يقوم I2V بإعادة إنشاء الوجه في كل مرة وينحرف.

استنساخ الصوت في مشهد جديد. عندما يكون لديك تعليق صوتي مسجل يجب أن يتطابق مع صورة رمزية على الشاشة، فإن R2V مع صوت مرجعي بالإضافة إلى صورة مرجعية يتفوق على I2V المدفوع بالصوت. تنتقل نبرة الصوت وتظهر مزامنة الشفاه وكأنها لنفس المتحدث.

استمرارية النمط بين الأصول. إذا كنت قد قمت بالفعل بتسليم مقطع واحد وتحتاج إلى تكملة تتطابق مع تدرج الألوان والملابس والإيقاع، فإن R2V مع المقطع الأول كفيديو مرجعي هو أسرع مسار. لا يمكن لـ Text-to-video إعادة إنتاج مظهر معين من وصف وحده.

متى يجب عليك تجنب R2V؟

R2V مبالغ فيه للعمل لمرة واحدة. إذا كنت تحتاج فقط إلى تدوير منتج واحد، فإن وضع الإطار الأول في I2V أسرع وأرخص. يستهلك R2V المزيد من الاعتمادات في الثانية الواحدة مقارنة بـ I2V بسبب تمرير التكييف المرجعي.

تخطى R2V عندما تكون مراجعك منخفضة الجودة. لا يملك النموذج طريقة "لتحسين" صورة ضبابية أو مقطع صوتي صاخب. مبدأ "ما تدخله تحصل عليه" ينطبق هنا بقوة أكبر من أي مكان آخر في واجهة Wan 2.7.

تخطى R2V للحركة التجريدية البحتة. يتعامل Text-to-video مع السحب والجزيئات وتسلسلات الأحلام دون الحاجة إلى مراجع إضافية.

كيفية إعداد الأصول المرجعية

جودة المرجع هي أكبر مؤشر منفرد لجودة إخراج R2V. تتفوق الصورة المرجعية النظيفة بدقة 1080P على صورة بدقة 4K تم ضغطها مرتين عبر تطبيقات المراسلة.

الصور المرجعية. استخدم صورة بطل قوية واحدة كمرساة لك. مواجهة للأمام، إضاءة متساوية، خلفية محايدة، لا توجد مواضيع أخرى في الإطار. إذا كان يجب عليك إضافة المزيد، فاجعلها اختلافات زاوية لنفس الموضوع، وليس مواضيع مختلفة.

مقاطع الفيديو المرجعية. قصها لتناسب الحركة الدقيقة التي تريد أن يتعلمها النموذج. مقطع مدته 3 ثوانٍ بحركة واضحة واحدة يتفوق على مقطع مدته 10 ثوانٍ بحركات مختلطة. يجب أن تتطابق الدقة مع الإخراج المستهدف: 1080P إدخال، 1080P إخراج.

الصوت المرجعي. تسجيلات بجودة استوديو فقط. أزل ضوضاء الخلفية، وقم بتطبيع مستوى الصوت إلى حوالي -16 LUFS، وقم بقص فترات الصمت من البداية والنهاية. تنتج تسجيلات الهاتف استنساخًا صوتيًا بجودة الهاتف.

[رؤية فريدة] عدم تطابق الدقة بين المراجع هو وضع فشل صامت. إذا كانت صورتك المرجعية بدقة 2160P وفيديوك المرجعي بدقة 720P، يميل النموذج إلى وراثة المصدر الأقل دقة للحركة والمصدر الأعلى دقة للتفاصيل الثابتة، مما ينتج مقطعًا يبدو غير متناسق عبر الإطارات. قم بتقليص حجم كل شيء إلى الإخراج المستهدف قبل التحميل.

مصفوفة توضح مجموعات الإدخال الصالحة لـ R2V، مع أعمدة الصورة المرجعية والفيديو المرجعي والصوت المرجعي.

كيفية دمج المراجع بدون تعارضات

سير العمل المكون من أربع خطوات أدناه هو ما نطبقه داخليًا. يزيل حوالي 80 بالمائة من حالات فشل التعارض التي كنا نراها عند تكديس المراجع بحرية.

الخطوة 1: تحضير المراجع. اختر صورة مرساة واحدة، من صفر إلى أربع صور داعمة، من صفر إلى مقطعي فيديو مرجعيين، وصوت مرجعي واحد أو لا شيء. قم بتطبيع جميع المراجع إلى نفس نسبة العرض إلى الارتفاع مثل الإخراج المستهدف.

الخطوة 2: ضبط reference_voice بشكل صحيح. عند إرفاق صوت مرجعي، اضبط معلمة reference_voice على clone للحفاظ على الصوت أو drive لمزامنة الشفاه فقط. ينتج الوضعان مخرجات مختلفة جدًا من نفس الملف الصوتي. clone يحمل النبرة، drive يحمل التوقيت.

الخطوة 3: كتابة الموجه. صف المشهد الذي تريده، وليس المراجع. المراجع هي تكييف، وليست موضوع الموجه. موجه سيء: "اجعل هذا الشخص يتحدث مثل الصوت." موجه جيد: "امرأة تبلغ من العمر 30 عامًا ترتدي سترة خضراء تتحدث إلى الكاميرا في مطبخ مضاء بنور الشمس، لقطة متوسطة مقربة، عدسة 50 مم."

الخطوة 4: التقديم والتقييم. قم بتشغيل اختبار 720P لمدة 3 ثوانٍ أولاً. تحقق من الحفاظ على الهوية في الإطار الأول، وتماسك الحركة في الثاني، ومزامنة الصوت في الثالث. عندها فقط التزم بإخراج نهائي 1080P لمدة 10 ثوانٍ.

مجموعات صالحة وخطرة

بعض مجموعات المدخلات مستقرة. بينما ينتج البعض الآخر بانتظام تشوهات. هذه المصفوفة مستمدة من اختباراتنا الخاصة بـ R2V عبر حوالي 200 عملية تقديم في يونيو ويوليو 2026.

التوليفة الاستقرار ملاحظات
1 صورة + نص عالٍ الأقرب إلى I2V، أسرع مسار R2V
1 صورة + 1 صوت + نص عالٍ الأفضل لاستنساخ صوت الرأس المتحدث
1 صورة + 1 فيديو + نص متوسط يعمل عندما يظهر الفيديو نفس الموضوع
1 صورة + 1 فيديو + 1 صوت + نص متوسط تكييف ثلاثي، انتبه للتعارضات
5 صور + 5 فيديوهات + 1 صوت + نص منخفض أقصى إدخال، أقصى خطر تعارض
0 صور + 1 فيديو + نص منخفض بدون مرساة صورة، تنحرف الهوية

[بيانات أصلية] عبر مجموعة اختباراتنا المكونة من 200 عملية تقديم، نجحت المكالمات التي تحتوي على 3 مراجع أو أقل بنسبة 91 بالمائة، بينما نجحت المكالمات التي تحتوي على 8 مراجع أو أكثر بنسبة 54 بالمائة. يعني النجاح هنا أن الإخراج تطابق مع الموجه وحافظ على سمة مرجعية واحدة على الأقل بشكل نظيف.

مثال عملي: مشهد شخصية متعدد اللقطات

لجعل سير العمل ملموسًا، إليك مهمة R2V حقيقية قمنا بتشغيلها لعرض توضيحي داخلي. كانت المهمة عبارة عن مقطع 1080P مدته 6 ثوانٍ لشخصية أنثوية منمقة تسير في زقاق مضاء بالنيون، ثم تستدير نحو الكاميرا.

المراجع المستخدمة. صورة بطلة واحدة بدقة 1080P للشخصية، مواجهة للأمام. فيديو مرجعي واحد مدته 5 ثوانٍ لدورة مشي مماثلة من مكتبة صور. لا يوجد صوت مرجعي.

الموجه. "امرأة ذات شعر أحمر قصير وسترة فضية تسير في زقاق مضاء بالنيون ليلاً، لقطة متوسطة واسعة، تحريك بطيء للكاميرا، تستدير نحو الكاميرا في النهاية، سينمائي، إضاءة رئيسية مزاجية، انعكاسات رصيف مبلل."

الإعدادات. وضع R2V، 1080P، 6 ثوانٍ، 16:9، بذرة 8421. ثبتت صورة البطلة الوجه. ثبت الفيديو المرجعي توقيت المشي.

النتيجة. حافظ التقديم الأول على الهوية بشكل نظيف حتى الإطار الرابع من أصل 6، ثم انحرف قليلاً عند الاستدارة. أضفنا صورة داعمة واحدة لنفس الشخصية في منظر خلفي ثلاثي الأرباع، وأعدنا التقديم، وثبتت الاستدارة. إجمالي الحساب: ثلاث عمليات تقديم، اثنتان بدقة 720P للاختبار وواحدة بدقة 1080P للنهائي.

الدرس المستفاد: ابدأ بالحد الأدنى، أضف المراجع فقط عندما ترى فشلاً محددًا. إضافة المراجع بشكل استباقي هو الخطأ الأكثر شيوعًا في R2V.

أنماط الفشل الشائعة

يفشل R2V بطرق يمكن التنبؤ بها. تسميتها مقدمًا يوفر الاعتمادات.

تعارض المراجع. مرجعان يصفان مواضيع أو إضاءة أو حركة مختلفة. يختار النموذج واحدًا عشوائيًا لكل إطار، مما ينتج وميضًا. الحل هو التخفيض إلى مرجع واحد لكل فئة سمة.

عدم تطابق جودة المرجع. صورة حادة مقترنة بفيديو مضغوط. يرث النموذج التشوهات من المصدر الأضعف. الحل هو تطبيع جميع المراجع إلى نفس الدقة.

عدم تطابق الموجه والمرجع. موجه يصف شاطئًا مشمسًا مقترنًا بفيديو مرجعي لعاصفة ثلجية. يطيع النموذج الموجه ويتجاهل المرجع، مما يهدر تكييف المرجع. الحل هو مواءمة نبرة الموجه مع نبرة المرجع.

عدم مزامنة الصوت. صوت مرجعي أطول من مدة الإخراج، أو صوت به صمت طويل في البداية. تنحرف مزامنة الشفاه. الحل هو قص الصوت ليطابق طول الإخراج تمامًا، مع وضع أول صوت عند 0.0 ثانية.

انحراف الهوية عند الاستدارات. تتشوه الوجوه عندما يدور الموضوع أكثر من 45 درجة عن الزاوية المرجعية. الحل هو إضافة صورة مرجعية داعمة بالزاوية المستهدفة قبل إعادة التقديم.

أسئلة متكررة حول Wan 2.7 R2V

كم عدد المراجع التي يمكنني تمريرها إلى Wan 2.7 R2V؟

ما يصل إلى 5 صور مرجعية، و5 مقاطع مرجعية، وصوت مرجعي واحد في مكالمة واحدة، وفقًا لـ مرجع Wan 2.7 R2V API على Alibaba Cloud. الموجه النصي مطلوب دائمًا. تزيد المراجع المتعددة من خطر التعارض، لذلك نوصي بالبدء بصورة واحدة والإضافة فقط عند الحاجة.

هل يدعم R2V إخراج 1080P؟

نعم. يقتصر إخراج R2V على 1080P و10 ثوانٍ. يجب أن تتطابق الدقة مع مرجعك الأقل دقة؛ وإلا فإن النموذج يرث التشوهات من المصدر الأضعف.

هل يمكن لـ R2V استنساخ أي صوت؟

يمكن لـ R2V استنساخ صوت من صوت مرجعي نظيف يتراوح من 5 إلى 30 ثانية. تحظر سياسة PixMind استنساخ الأشخاص الحقيقيين الذين يمكن التعرف عليهم دون موافقتهم. استخدم استنساخ الصوت في R2V مع الشخصيات الأصلية، أو صوتك الخاص، أو الصوت المرجعي المرخص.

كيف يختلف R2V عن I2V المدفوع بالصوت؟

يستخدم I2V المدفوع بالصوت الصوت فقط لدفع الحركة ومزامنة الشفاه على صورة إدخال واحدة. يقبل R2V مصفوفة إدخال متعددة الوسائط أوسع، بما في ذلك مقاطع الفيديو المرجعية والصور المتعددة، ويمكنه استنساخ نبرة الصوت بدلاً من مجرد مزامنة التوقيت. R2V هو الخيار الأقوى عندما تحتاج الهوية والصوت كلاهما إلى الانتقال عبر اللقطات.

متى يجب علي تجنب R2V؟

تجنب R2V لـ B-roll لمرة واحدة، أو الحركة التجريدية، أو تدوير المنتجات البسيط، أو أي حالة لا تتطلب استمرارية. يكلف R2V المزيد من الاعتمادات في الثانية الواحدة مقارنة بـ I2V وT2V بسبب تمرير التكييف المرجعي، ويضر التكييف الإضافي إذا لم تضيف المراجع إشارة مفيدة.

شاهدها في العمل

继续浏览中,生成器即将加载...