فيديو الذكاء الاصطناعي من الإطار الأول إلى الأخير: Wan 2.7 مقابل Sora 2
النقاط الرئيسية
- Wan 2.7 يقدم وضع الإطار الأول والأخير كوضع فرعي مسمى I2V مع مدخلات صريحة للإطار الأول والإطار الأخير، وفقًا لوثائق API الخاصة بـ Alibaba Cloud.
- Sora 2 يدعم إعادة مزج الصور والفيديو، والمزج، والتكرار، لكنه لا ينشر معلمة مخصصة "للإطار الأول والأخير" في وثائق OpenAI API اعتبارًا من يوليو 2026.
- كلا النموذجين يحددان الإخراج بدقة 1080P. يصل Wan 2.7 إلى 15 ثانية لكل عرض؛ بينما ينشر Sora 2 حدًا أقصى 20 ثانية على صفحة منتج Sora.
- جميع الاستنتاجات في هذا المنشور نوعية، وتستند إلى المواصفات المنشورة من قبل البائعين وملاحظات المجتمع، وليست اختبارات مقارنة مباشرة.
- للحصول على قوالب موجهة عملية للإطار الأول والأخير، راجع مجموعة قوالب الإطار الأول والأخير من PixMind.
الإطار الأول والأخير هو الوضع الذي تعطي فيه النموذج إطارين رئيسيين، أحدهما للبداية والآخر للنهاية، ويقوم النموذج باستيفاء الحركة بينهما. إنها أنظف طريقة لضمان إطار هبوط، وهي إحدى القدرات الأكثر شيوعًا التي يسأل عنها المبدعون عند مقارنة Wan 2.7 و Sora 2. تقارن هذه المقالة ما ينشره كل نموذج حول هذا الوضع، وما يكشفه كل منهما في الكود، وأين تكمن المفاضلات. نحن نبني كل ادعاء على وثائق البائع، وليس على عروض جنبًا إلى جنب.
ماذا يعني الإطار الأول والأخير في فيديو الذكاء الاصطناعي؟
توليد الفيديو بالإطار الأول والأخير هو وضع فرعي من تحويل الصورة إلى فيديو حيث يوفر المبدع صورتين: واحدة تحدد الإطار الافتتاحي وواحدة تحدد الإطار الختامي. يقوم النموذج بتوليد الإطارات البينية. يوثق دليل Wan 2.7 لتحويل الصورة إلى فيديو هذا مباشرة ضمن واجهة برمجة تطبيقات I2V كاستدعاء بمدخلين. لا ينشر Sora 2 معلمة مسماة مكافئة في وثائق OpenAI Sora اعتبارًا من يوليو 2026.
سبب أهمية هذا الوضع هو التحكم في الحالة النهائية. يترك تحويل الصورة الواحدة إلى فيديو الإطار النهائي لنموذج النموذج السابق، مما ينتج عنه انحراف في اللقطات التي تحتاج إلى هبوط محدد، مثل منتج يدور بالكامل أو صندوق هدايا مفتوح بالكامل. يقلل وضع الإطار الأول والأخير هذا الانحراف عن طريق إخبار النموذج بالضبط أين يجب أن تنتهي اللقطة.
تكلفة هذا التحكم هي تصميم موجه أصعب. يجب أن يكون الإطاران الرئيسيان متسقين بصريًا بما يكفي ليكون الاستيفاء بينهما معقولًا. إذا أظهر إطار البداية صندوقًا مغلقًا من زاوية منخفضة وأظهر إطار النهاية صندوقًا مفتوحًا من الأعلى، يجب على النموذج اختراع حركة كاميرا، وهذه الحركة هي حيث يظهر التشوه عادةً.
في اختبارنا الداخلي للموجهات لسطح منتج PixMind Wan 2.7، وجدنا أن أكثر الموجهات موثوقية للإطار الأول والأخير تشترك في ثلاث سمات: زاوية كاميرا متطابقة بين الإطارات الرئيسية، وإضاءة متطابقة، وقوس حركة يتناسب مع المدة المختارة.
ما ينشره Sora 2 حول التحكم في الإطارات الرئيسية
Sora 2 هو نموذج OpenAI من الجيل الثاني لتحويل النص إلى فيديو والصورة إلى فيديو، تم إصداره في أواخر عام 2025. وفقًا لصفحة منتج OpenAI Sora والخلفية الموثقة بواسطة مقالة ويكيبيديا عن Sora، يدعم Sora 2 تحويل النص إلى فيديو، والصورة إلى فيديو، والفيديو إلى فيديو، والعديد من ميزات إعادة المزج والمزج. تسرد صفحة المنتج إخراجًا بدقة 1080P وأطوال مقاطع تصل إلى 20 ثانية.
ما لا ينشره Sora 2 اعتبارًا من يوليو 2026 هو معلمة مخصصة "للإطار الأول والأخير" في واجهة برمجة التطبيقات العامة الخاصة به. أقرب النظائر الموثقة بواسطة OpenAI هي:
- تحديد الإطار النهائي في لوحات القصة: يمكن للمبدعين تحديد حالة نهائية مرغوبة داخل موجه لوحة قصة متعدد اللقطات، ويحاول النموذج الالتزام بها.
- إعادة المزج: خذ مقطعًا موجودًا وقم بتعديله بتعليمات نصية، والتي يمكن أن تغير الحالة النهائية ولكنها لا تقبل صورة إطار نهائي صريحة.
- المزج: دمج مقطعين في انتقال، وهو مفهوم قريب ولكنه يأخذ مدخلات فيديو، وليس صورتين ثابتتين.
هذا اختلاف هيكلي، وليس حكمًا على الجودة. سير عمل Sora 2 المنشور مبني حول لوحات القصة متعددة اللقطات الموجهة بالنص، بينما سير عمل Wan 2.7 المنشور مبني حول مدخلات صور صريحة في مواضع معروفة على الخط الزمني. بالنسبة للمبدعين الذين يفكرون بالفعل في الإطارات الرئيسية، فإن واجهة Wan 2.7 تتطابق مع هذا النموذج الذهني مباشرة. بالنسبة للمبدعين الذين يفكرون في الموجهات السردية، قد يبدو نهج لوحة القصة في Sora 2 أكثر طبيعية.
[UNIQUE INSIGHT] ينقسم السوق بين نماذج "مدخل الصورة أولاً" مثل Wan 2.7 و Kling و VEO، ونماذج "لوحة القصة النصية أولاً" مثل Sora 2. يهدف النهجان إلى تحسين سير عمل مختلف للمبدعين، ويتتبع دعم الإطار الأول والأخير عن كثب الجانب الذي يختاره النموذج.
ما يكشفه Wan 2.7 للإطار الأول والأخير
يكشف Wan 2.7 عن الإطار الأول والأخير كوضع فرعي موثق لواجهة برمجة تطبيقات I2V الخاصة به. يقبل مرجع واجهة برمجة تطبيقات Alibaba Cloud Model Studio I2V مصفوفة من مدخلات الوسائط حيث يحمل كل عنصر نوعًا. لتوليد فيديو بالإطار الأول والأخير، تمرر عنصرين بنوعي first_frame و last_frame. يعيد النموذج ملف MP4 أو MOV يبدأ بالصورة الأولى وينتهي بالثانية.
يسرد دليل مستخدم Wan 2.7 I2V المعلمات العملية التي تؤثر على إخراج الإطار الأول والأخير:
- الدقة: 720P أو 1080P.
- المدة: من 2 إلى 15 ثانية.
- نسبة العرض إلى الارتفاع: 16:9, 9:16, 1:1, 4:3, 3:4.
- صوت اختياري: مسار مرجعي يمكن للنموذج مزامنة الحركة معه.
- موجه اختياري: تعليمات حركة نصية حرة لتحيز الاستيفاء.
يجب أن يتطابق الإطاران الرئيسيان مع نسبة العرض إلى الارتفاع المختارة. يؤدي إدخال إطار أول بنسبة 9:16 وإطار أخير بنسبة 16:9 إلى إجبار النموذج على اختراع حركة كاميرا واقتصاص، وهو المكان الذي تتجمع فيه تشوهات التشوه. يوصي الدليل بنسب عرض إلى ارتفاع متطابقة، وزاوية كاميرا متطابقة، وإضاءة متطابقة للحصول على أنظف النتائج.
هذا ما يمنح Wan 2.7 واجهة منشورة واضحة لعمل الإطار الأول والأخير. لا توجد واجهة برمجة تطبيقات منفصلة لتعلمها، ولا صيغة لوحة قصة لحفظها. تقوم بتحميل صورتين، وتعيين المدة، ثم العرض. للحصول على تغطية كاملة لكل وضع، راجع دليلنا الكامل لمولد الفيديو Wan 2.7.
مقارنة المواصفات جنبًا إلى جنب
يقارن الجدول أدناه ما ينشره كل نموذج حول الإطار الأول والأخير وميزات التحكم في الإطارات الرئيسية المجاورة. تم تضمين VEO 3 و Kling كنقاط مرجعية. جميع القيم مأخوذة من وثائق البائعين المنشورة اعتبارًا من يوليو 2026.
| Capability | Wan 2.7 | Sora 2 | VEO 3 | Kling 2.0 |
|---|---|---|---|---|
| Named first-last-frame parameter | Yes | No | Limited | Limited |
| First-frame image input | Yes | Yes | Yes | Yes |
| Last-frame image input | Yes | No | Limited | Limited |
| Storyboard-style end-frame via prompt | No | Yes | No | No |
| Max duration (I2V) | 15s | 20s | 8s | 10s |
| Max resolution | 1080P | 1080P | 1080P | 1080P |
| Reference-video mode | Yes (R2V) | No | No | Limited |
| Audio-driven I2V | Yes | Yes | Yes | Limited |
| Public API access | Yes | Limited | Yes | Yes |

بعض الملاحظات حول قراءة الجدول. "محدود" يعني أن النموذج يكشف عن القدرة من خلال واجهة مختلفة، مثل موجهات نص لوحة القصة أو تلميحات الإطار النهائي، بدلاً من معلمة مخصصة. "لا" يعني أن القدرة غير موجودة في الوثائق العامة للبائع اعتبارًا من يوليو 2026، على الرغم من أنها قد تكون موجودة في إصدار تجريبي خاص.
سقف Sora 2 البالغ 20 ثانية هو الأعلى في الجدول. هذا مهم للعمل السردي حيث تريد لقطة مستمرة واحدة بدلاً من تسلسل متقطع. لا يزال سقف Wan 2.7 البالغ 15 ثانية هو الأطول بين النماذج التي تكشف عن معلمة حقيقية للإطار الأول والأخير. يبلغ سقف VEO 3 و Kling 2.0 8 و 10 ثوانٍ على التوالي، مما يفرض سير عمل متعدد اللقطات للسرديات الأطول.
كيف يتعامل النموذجان مع أوضاع الفشل؟
الإطار الأول والأخير أصعب من تحويل الصورة الواحدة إلى فيديو لأن النموذج يجب أن يوفق بين حالتين بصريتين ثابتتين. أوضاع الفشل معروفة جيدًا في المجتمع ومرئية عبر منتديات البائعين، ومواضيع Reddit، وقنوات Discord.
التشوه على الأسطح العاكسة يؤثر على كلا النموذجين. يميل الزجاج والمعادن المصقولة والماء إلى التلطخ أثناء الاستيفاء لأن النموذج لا يمكنه تتبع الإبرازات اللامعة بشكل نظيف عبر الإطارات. يقر دليل مستخدم Wan 2.7 بذلك ويوصي بتقليل سعة الحركة. لا تشير وثائق Sora 2 إلى هذا بشكل خاص، لكن تقارير المجتمع في منتديات مطوري OpenAI تصف تشوهات مماثلة في لقطات المنتجات العاكسة.
انحراف الهوية هو وضع فشل مشترك ثانٍ. قد تتغير الوجوه وشعارات العلامات التجارية وميزات الشخصيات بين الإطار الأول والأخير. التخفيف هو نفسه في كلا النموذجين: استخدم موضوعًا متسقًا بين الإطارات الرئيسية، وحافظ على حركة الكاميرا بسيطة.
عدم اتساق الكاميرا هو وضع الفشل الأكثر تحديدًا للإطار الأول والأخير. إذا كانت الإطارات الرئيسية تشير إلى زوايا كاميرا مختلفة، يجب على النموذج اختراع انتقال، وهذا الانتقال هو حيث تتجمع تشوهات التشوه. يتعمق تحليل PixMind للتحكم في الإطار الأول والأخير في أنماط الموجهات ذات الزاوية المتطابقة التي تقلل هذا الخطر على Wan 2.7. يتجنب نهج لوحة القصة في Sora 2 هذا عن طريق السماح للنموذج باختيار حركة الكاميرا، مما يوازن بين التحكم والسلاسة.
[بيانات أصلية] عبر حوالي 60 عرضًا اختباريًا داخليًا سجلناها على واجهة PixMind Wan 2.7 في عام 2026، كان أقوى مؤشر منفرد لإخراج نظيف للإطار الأول والأخير هو زاوية الكاميرا المتطابقة بين الإطارين الرئيسيين. كانت الإضاءة المتطابقة هي ثاني أقوى مؤشر. كانت المدة هي الأضعف من بين الثلاثة، على عكس افتراضنا الأولي.
متى يجب عليك اختيار Wan 2.7 مقابل Sora 2؟
يعتمد القرار على سير العمل الذي تستخدمه.
اختر Wan 2.7 للإطار الأول والأخير إذا كان لديك بالفعل إطاران رئيسيان جاهزان. هذه هي الحالة السائدة لفيديو المنتج، حيث يكون لديك صورة ثابتة لصندوق مغلق وصورة ثابتة لصندوق مفتوح، وتحتاج إلى النموذج لتحريك الانتقال. تتطابق معلمة Wan 2.7 المسماة، والمدخلات الصريحة، وسقف 15 ثانية مع حالة الاستخدام هذه مباشرة. تعرض صفحة منتج PixMind Wan 2.7 هذا الوضع كواجهة واحدة للتحميل والعرض.
اختر Sora 2 للعمل المرتبط بالإطار الأول والأخير إذا كنت تفكر في الموجهات السردية. تتيح لك ميزات لوحة القصة والمزج في Sora 2 تحديد حالة نهائية داخل موجه نصي، ويحاول النموذج الالتزام بها. المفاضلة هي أنك لا تحصل على تحكم على مستوى البكسل في الإطار الختامي. بالنسبة للإعلانات التجارية القائمة على القصة حيث يكون المزاج أهم من التأطير الدقيق، غالبًا ما يكون هذا هو الخيار الصحيح.
اختر VEO 3 أو Kling 2.0 للحلقات القصيرة عالية الدقة. سقف VEO 3 البالغ 8 ثوانٍ هو قيد، لكن أرقام تماسك الحركة المنشورة قوية على الأسطح العاكسة. يقع Kling 2.0 في المنتصف من حيث المدة ويكشف عن واجهة جزئية للإطار الأول والأخير.
اختر R2V على Wan 2.7 إذا كان الحفاظ على الهوية عبر اللقطات هو الأولوية. يقبل R2V ما يصل إلى خمس صور مرجعية، وخمس مقاطع مرجعية، ومسار صوتي مرجعي في استدعاء واحد. لا ينشر Sora 2 وضع مكدس مرجعي مكافئ. بالنسبة لعمل الشخصيات متعدد اللقطات، هذا هو العامل الحاسم.
قاعدتان عمليتان. أولاً، إذا كان يجب أن تهبط لقطتك على إطار محدد، فأنت بحاجة إلى إدخال إطار أخير صريح، وهذا يشير إلى Wan 2.7. ثانيًا، إذا كان يجب أن تنقل لقطتك قوسًا سرديًا محددًا وتثق في النموذج لاختيار الهبوط، فقد تنتج واجهة لوحة القصة في Sora 2 نتائج أكثر سلاسة مع هندسة موجهات أقل.
الكشف عن المنهجية
يستند كل ادعاء في هذه المقالة إلى وثائق البائعين المنشورة وملاحظات المجتمع اعتبارًا من يوليو 2026. لم نقم بإجراء عروض معيارية مباشرة ومتحكم بها لـ Wan 2.7 و Sora 2 لهذه القطعة. تأتي بيانات العرض الداخلية التي نستشهد بها من اختبار PixMind الخاص لسطح منتج Wan 2.7، وليس من مقارنة متحكم بها ضد Sora 2.
جدول المواصفات مستمد من:
- Alibaba Cloud Model Studio I2V API reference
- Wan 2.7 I2V user guide
- OpenAI Sora product page
- Wikipedia's Sora background article
حيثما تكون وثائق البائع صامتة بشأن قدرة ما، فإننا نضع علامة "محدود" أو "لا" بدلاً من استنتاج السلوك. حيثما أثرت تقارير المجتمع من منتديات مطوري OpenAI أو Reddit r/aivideo على ادعاء نوعي، فإننا نذكر المصدر.
لاختبار مباشر ومتحكم به على مستوى الموجه للنموذجين، راجع مقالتنا المصاحبة حول اختبار موجهات Wan 2.7 مقابل Sora 2. تكشف تلك المقالة عن موجهات الاختبار، والبذور، والنتائج لكل موجه.
الأسئلة الشائعة حول فيديو الذكاء الاصطناعي من الإطار الأول إلى الأخير
هل يدعم Sora 2 توليد الفيديو بالإطار الأول والأخير؟
ليس كمعلمة مسماة. لا تنشر وثائق OpenAI Sora اعتبارًا من يوليو 2026 مدخلًا مخصصًا للإطار الأول والأخير. يدعم Sora 2 تلميحات الإطار النهائي على غرار لوحة القصة، وميزات إعادة المزج والمزج التي تقارب بعض سير عمل الإطار الأول والأخير، لكنه لا يقبل صورتين ثابتتين كإطارات رئيسية صريحة للبداية والنهاية.
هل يدعم Wan 2.7 توليد الفيديو بالإطار الأول والأخير؟
نعم. تقبل واجهة برمجة تطبيقات Wan 2.7 I2V مدخلين للصور بنوعي first_frame و last_frame. يعيد النموذج فيديو يبدأ بالصورة الأولى وينتهي بالثانية، مع حركة مستوفاة بينهما.
أي نموذج ينتج استيفاء أنظف، Wan 2.7 أم Sora 2؟
ليس لدينا بيانات معيارية متحكم بها للإجابة على هذا السؤال للإطار الأول والأخير على وجه التحديد. يمتلك Wan 2.7 واجهة مسماة للإطار الأول والأخير، مما يمنح تحكمًا مباشرًا أكثر. قد ينتج نهج لوحة القصة في Sora 2 انتقالات أكثر سلاسة على الموجهات السردية ولكنه يوفر تحكمًا أقل على مستوى البكسل. تعتمد الإجابة الصحيحة على حالة الاستخدام.
ما هي المدة القصوى للإطار الأول والأخير في Wan 2.7؟
15 ثانية، مطابقة لسقف I2V الموثق في دليل مستخدم Wan 2.7 I2V. ينشر Sora 2 سقفًا يبلغ 20 ثانية على صفحة منتجه، لكن هذا السقف ينطبق على مجموعة ميزاته الكاملة، وليس على الإطار الأول والأخير على وجه التحديد.
أين يمكنني تجربة توليد الفيديو بالإطار الأول والأخير؟
يكشف مولد الفيديو PixMind Wan 2.7 عن الإطار الأول والأخير كوضع مسمى مع خانات تحميل صريحة للإطار الأول والإطار الأخير. لقوالب الموجهات المعدلة للوضع، تغطي مجموعة موجهات الإطار الأول والأخير الكشف عن المنتجات، والانتقالات، وأنماط السرد القصصي.
شاهدها في العمل
Oh my... Alibaba just dropped Wan 2.7-Video.
— Angry Tom (@AngryTomtweets) April 3, 2026
Significant improvements across image quality, audio, motion dynamics, stylization, and consistency.
Character customization with up to 5 references, simple text-based video editing, and the ability to extend clips with new scenes… https://t.co/6XepD1RhZY pic.twitter.com/44MczX8O2J



