خادم MCP لتوليد الفيديو: Veo وKling وSeedance في محادثة واحدة
يتيح خادم MCP لتوليد الفيديو لمحادثة واحدة أن تطلب مقاطع من Veo وKling وSeedance دون تبديل علامات التبويب. يشرح هذا المقال كيف تعمل الأدوات والمهام غير المتزامنة والاستطلاع الدوري، وأي نموذج يناسب كل لقطة، وما الحدود المتوقعة، وكيف تكتب أوامر نصية تصمد أمام أول تصيير.
لديك علامة تبويب Veo مفتوحة، وعلامة Kling في نافذة أخرى، وعلامة Seedance نسيت إغلاقها، واللقطة التي تبحث عنها قد تكون في أي منها. كل مولّد يريد صيغة أوامر نصية خاصة به، ولوحة إعدادات خاصة به، وزر تنزيل خاص به. يستبدل خادم MCP لتوليد الفيديو هذا الروتين بجملة واحدة تكتبها في محادثة: تصف المقطع، فيختار المساعد النموذج، ويرسل المهمة، ويتابعها، ثم يعطيك رابطًا. يشرح هذا المقال كيف يعمل هذا الإعداد، وما الذي يتفوق فيه Veo 3.1 وKling v3 Video وSeedance 2.5 Lite، وكيف تكتب أوامر نصية تصمد أمام أول تصيير.
لماذا تتفوق محادثة واحدة على خمس علامات تبويب
تكلفة التنقل الخفية بين علامات التبويب
يبدو تبديل الأدوات أمرًا بسيطًا حتى تحسب خطواته. تنسخ أمرًا نصيًا إلى موقع، وتنتظر، وتنزّل الملف، وتعيد تسميته، وتفتح الموقع التالي، وتلصق النص، ثم تكتشف أن النموذج الثاني يريد وصف الصوت بطريقة مختلفة، فتعيد الكتابة. وبعد المحاولة الثالثة تكون قد فقدت الأثر لأي بذرة أنتجت أي مقطع، ويصبح مجلد سطح المكتب كومة من الملفات المسماة "final_v2_really".
تقلب المحادثة هذا الوضع. تصبح المحادثة نفسها ملف المشروع: كل أمر نصي وكل إعداد وكل رابط نتيجة يبقى في سجل واحد يمكنك البحث فيه لاحقًا. كما يستطيع المساعد أن يحوّل موجزًا إبداعيًا واحدًا إلى ثلاثة أوامر نصية مخصصة لكل نموذج، وهذا هو الجزء المرهق الذي لا يحب أحد إنجازه يدويًا.
ما الذي يفعله MCP فعليًا
بروتوكول سياق النموذج (Model Context Protocol) معيار مفتوح قدّمته Anthropic في أواخر 2024، ويتيح لتطبيق المحادثة التواصل مع أدوات خارجية بطريقة متوقعة. يعلن الخادم عن قائمة من الأدوات. لكل أداة اسم ووصف بلغة بسيطة ومخطط JSON يحدد مدخلاتها. يعرض تطبيق المحادثة هذه القائمة على النموذج، ويقرر النموذج متى تناسبه أداة ما، ويرسل التطبيق الاستدعاء إلى الخادم ويعيد النتيجة إلى المحادثة.
تعمل الخوادم محليًا عبر stdio أو عن بُعد عبر HTTP، لذلك يمكن أن يكون خادم الفيديو عملية صغيرة على حاسوبك المحمول، أو نقطة نهاية مستضافة تتصل بها مرة واحدة. من منظور المحادثة، يتحول الطلب "أنشئ مقطعًا مدته خمس ثوانٍ لطاهٍ في سوق ليلي" من أمنية غامضة إلى استدعاء منظم يتضمن أمرًا نصيًا ومدة ودقة.
💡 نصيحة: وصف الأدوات أهم مما يظن كثيرون. يقرأه النموذج ليقرر أي أداة يستدعي، لذلك يُستخدم الخادم الذي يقول "توليد فيديو من أمر نصي" بثقة أكبر بكثير من خادم يقول "تشغيل مهمة".
كيف يتعامل الخادم مع مهام الفيديو
الأدوات والمخططات والاستطلاع الدوري
يصلح موصل PicassoIA مثالًا عمليًا واضحًا لأن قائمة أدواته قصيرة وسهلة القراءة. وقت كتابة هذا المقال يعرض الأدوات التالية:
تعيد كل أداة توليد predict_id بمجرد أن يقبل GPU المهمة، مع وقت تقديري. ثم يستدعي المساعد get_generation بعد الانتظار المقترح، ويكرر ذلك بعد كل انتظار يعيده، حتى تظهر الحالة "succeeded" أو "failed". والفشل نهائي، لذلك يرسل المساعد توليدًا جديدًا بدلًا من إعادة المحاولة على المهمة نفسها.
لماذا يحتاج الفيديو إلى مهام غير متزامنة
يعود استدعاء تحويل النص إلى صورة خلال ثوانٍ، أما الفيديو فلا. وتعطي أمثلة التصيير في صفحات النماذج فكرة عن ذلك: استغرقت أمثلة Veo 3.1 نحو دقيقة إلى دقيقتين، واستغرقت أمثلة Seedance 2.5 Lite نحو دقيقتين إلى ثلاث دقائق، وتراوحت أمثلة Kling v3 Video بين خمس وثماني عشرة دقيقة تقريبًا حسب المدة والإعدادات. ولا يستطيع استدعاء أداة في المحادثة أن ينتظر كل هذا الوقت.
لذلك يعيد الخادم تذكرة ويترك المساعد يتابعها. وهذا أيضًا ما يسمح لمحادثتك بالاستمرار أثناء تصيير المقطع: اطلب الأمر النصي للقطة التالية بينما تنضج الأولى.
كيف تبدو الجلسة
إليك تبادلًا واقعيًا بعد ربط الخادم:
تكتب: "أنشئ مقطعًا مدته 5 ثوانٍ بنسبة 16:9 لطاهٍ يقلب المعكرونة في سوق مسائي، مع مصابيح دافئة وصوت قلي."
يختار المساعد أداة الفيديو، ويملأ الأمر النصي والمدة والدقة، ثم يرسل الطلب.
يجيب الخادم برقم predict_id ووقت تقديري.
ينتظر المساعد الفترة المقترحة، ويستدعي get_generation، فيرى أن المهمة ما زالت قيد المعالجة، فينتظر مرة أخرى.
تتحول الحالة إلى succeeded، فينشر المساعد رابط MP4 في المحادثة.
تقول: "نفس اللقطة، لكن يرفع الطاهي نظره نحو الكاميرا"، فيعيد المساعد الإرسال بالبذرة نفسها مع تعديل سطر الحركة.
تبقى الحلقة كلها داخل نافذة واحدة، ولا يتطلب منك أي شيء قراءة مرجع API.
خمس مهام في وقت واحد
تنص وثائق PicassoIA API على حد قدره 5 تنبؤات متزامنة لكل حساب، مشتركة بين وصولك إلى API واتصالات MCP. بالنسبة إلى لوحة قصة مصورة من ثماني لقطات، هذا يعني أن على المساعد أن يرسل خمسة تنبؤات، ويستعلم عنها، ويضع الباقي في الطابور كلما تحررت خانات. يمكنك أن تقول ذلك بكلمات بسيطة: "نفّذ اللقطات على دفعات من خمسة، وانشر كل رابط عند انتهائه."
ثلاثة نماذج، ثلاث نقاط قوة
لا يفوز نموذج واحد بكل لقطة، وهذا هو السبب الحقيقي لوضع عدة نماذج خلف محادثة واحدة. فيما يلي ما تقوله صفحات النماذج عن الغرض من كل واحد منها.
عندما تهم الواقعية والصوت
يحوّل Veo 3.1 أمرًا نصيًا إلى لقطات بدقة 1080p مع صوت مدرك للسياق، فيصل الطقطقة أو الرياح أو الأصوات متطابقة مع الصورة. تمتد المقاطع 4 أو 6 أو 8 ثوانٍ بنسبة 16:9 أو 9:16. يمكنك تحديد إطار أول وإطار أخير للانتقال بين لحظتين، أو تزويده بما يصل إلى ثلاث صور مرجعية للحفاظ على ثبات الموضوع عبر اللقطات. يتيح حقل الأمر النصي السلبي استبعاد ما لا تريده. ويوجد إصدار أسرع، Veo 3.1 Fast، للمسودات السريعة.
استعن به عندما تكون اللقطة لحظة واقعية قابلة للتصديق: سيارة على طريق ساحلي، أو حوار في مقهى، أو منتج على طاولة بصوت محيط طبيعي.
عندما تحتاج إلى تحكم متعدد اللقطات
Kling v3 Video هو الخيار الطويل. ينتج مقاطع تصل إلى 15 ثانية، ويدعم كتابة السيناريو متعدد اللقطات: تحدد حتى 6 مشاهد، لكل منها أمره النصي ومدته، داخل توليد واحد. يصيّر الوضع القياسي بدقة 720p، ويصيّر الوضع الاحترافي بدقة 1080p. يمكنك تثبيت الإطار الأول والأخير بصور، واختيار 16:9 أو 9:16 أو 1:1، وإضافة أمر نصي سلبي. توليد الصوت مفتاح افتراضي مغلق، لذلك أخبر المحادثة بتشغيله عندما تريد صوتًا.
هو الخيار المناسب عندما يحتاج المقطع إلى قوس صغير، مثل لقطة عريضة ثم لقطة مقربة ثم ردة فعل، دون جمع ثلاثة ملفات منفصلة. وتوقع أطول أوقات الانتظار في المجموعة.
عندما تريد تكرارات سريعة
Seedance 2.5 Lite مصمم للكمية. يصنع مقاطع مدتها 5 أو 10 ثوانٍ بدقة 480p أو 720p، مع صوت متزامن مفعّل افتراضيًا، سواء من نص أو من صورة بداية، ويقبل بذرة يمكنك تثبيتها لإعادة إنتاج النتيجة. تصف صفحة النموذج استخدامه بأنه غير محدود لأعضاء Wonder، مما يجعله النموذج الطبيعي لتجربة عشرة تنويعات للأمر النصي قبل الغداء. توجد نسخ أكبر عند الحاجة: Seedance 2.5 مدرج بمقاطع تصل إلى 30 ثانية، ويقدم Seedance 2.0 تحويل النص إلى فيديو مع صوت مدمج.
اختيار النموذج الصحيح لكل لقطة
عندما تضع المواصفات جنبًا إلى جنب تصبح قرارات التوجيه أسهل. تأتي أوقات التصيير من أمثلة التوليد في صفحة كل نموذج، لذا تعامل معها كتقديرات تقريبية لا كوعود.
مسودات أولية، وتنويعات كثيرة، ومقاطع قصيرة للتواصل الاجتماعي:Seedance 2.5 Lite.
💡 نصيحة: أعدّ المسودة بالنموذج السريع، وأنهِ العمل بالنموذج البطيء. ثبّت الفكرة والتأطير والحركة بتكرارات سريعة، ثم أنفق التصييرات الطويلة على اللقطات التي وافقت عليها.
نادرًا ما تكون المقاطع الخام الخطوة الأخيرة. تسرد PicassoIA أيضًا تحرير الفيديو ورفع دقته ومكتبة واسعة من المؤثرات البصرية، وهنا تضيف مظهرًا أسلوبيًا أو مرحلة تنظيف بعد أن يؤدي المولّد دوره. القائمة الكاملة موجودة في picassoia.com/en/all-models.
كتابة أوامر نصية يمكن للمحادثة إعادة استخدامها
قوائم اللقطات تتفوق على الصفات
تقول صفحة نموذج Seedance 2.5 Lite إن الأوصاف السينمائية المرتبة زمنيًا تعمل بأفضل شكل، والعادة نفسها تساعد مع كل نموذج فيديو. صِف ما يحدث بالترتيب، كما يقرأ المخرج قائمة اللقطات، بدلًا من تكديس صفات مثل "ملحمي" و"مذهل". لا يستطيع النموذج تصوير صفة، لكنه يستطيع تصوير طاهٍ يقلب المعكرونة مرة واحدة فيما تتوهج النيران.
قالب أمر نصي يعمل
تحافظ بنية من أربعة أسطر على اتساق الأوامر النصية عندما يعيد المساعد كتابتها لنماذج مختلفة:
Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.
وعند ملئه يبدو هكذا:
طاهٍ للطعام في الشارع يرتدي مريلة قماشية يمسك مقلاة فوق لهب غاز. يقلب المعكرونة مرة واحدة، فتتوهج النيران ويتصاعد البخار نحو العدسة. دفعة بطيئة للداخل من مستوى الصدر. مصابيح دافئة في الأعلى، وزيت يقرقع، وأصوات السوق.
ثم اطلب من المحادثة تكييفه لكل نموذج. بالنسبة إلى Veo 3.1 صِف الصوت بالتفصيل، لأن الصوت يتبع الأمر النصي. وبالنسبة إلى Kling v3 Video قسّم اللحظات إلى مشاهد واجعل مدد اللقطات تساوي المدة الإجمالية، مع ثانية واحدة على الأقل لكل لقطة. وبالنسبة إلى Seedance 2.5 Lite أبقه فقرة واحدة متصلة، واقفل البذرة عندما يعجبك الناتج.
إذا كان نموذج الدردشة لديك ضعيفًا في وصف اللقطات، فأعدّ الأوامر النصية بكاتب أقوى مثل Claude Sonnet 5 أو Gemini 3.5 Flash والصق النتيجة في المحادثة.
إصلاح تصيير أول ضعيف
غيّر متغيرًا واحدًا في كل مرة. ثبّت البذرة، ثم عدّل سطر الحركة فقط. وتوفر بعض العادات ساعات كثيرة:
انحراف الشخص: وفّر صورة للإطار الأول حتى يبدأ النموذج من مظهر ثابت.
ظهور أشياء غير مرغوب فيها: استخدم حقل الأمر النصي السلبي الذي يقدمه كل من Veo 3.1 وKling v3 Video.
المقطع يبدو مزدحمًا: قصّره. مقطع مدته خمس ثوانٍ بحركة واحدة أفضل من مقطع مدته عشر ثوانٍ بثلاث حركات.
💡 نصيحة: اجمع الأدوات معًا. ولّد صورة ثابتة بأداة الصور، ووافق على التأطير، ثم أدخل تلك الصورة كإطار أول حتى يبدأ الفيديو من المكان الذي تريده تمامًا.
يُعد Seedance 2.5 Lite المحطة العملية الأولى لأنه سريع، ويتعامل مع الصوت افتراضيًا، وهو إحدى أداتي الفيديو في الموصل. فيما يلي التدفق على PicassoIA:
افتح صفحة Seedance 2.5 Lite، أو اطلب من محادثتك استدعاء generate_video_seedance.
اكتب الأمر النصي بالترتيب الزمني باستخدام القالب ذي الأسطر الأربعة أعلاه.
اختر المدة 5 أو 10 ثوانٍ. استخدم 5 أثناء الاختبار.
اختر الدقة. يصيّر 480p أسرع ويناسب المسودات، أما 720p فأوضح ويناسب النسخة التي تحتفظ بها.
اختر نسبة العرض إلى الارتفاع، أو ارفع صورة لتستخدمها كإطار افتتاحي. مع وجود صورة، يطابق المقطع الصورة ويتجاهل إعداد النسبة.
أبقِ خيار حفظ الصوت مفعّلًا إلا إذا أردت مقطعًا صامتًا.
اضبط البذرة إذا أردت إعادة إنتاج النتيجة لاحقًا.
أرسل الطلب، واستطلع حتى تنجح المهمة، ثم افتح الرابط المعاد.
الإعداد
الخيارات
متى تغيّره
المدة
5 أو 10 ثوانٍ
انتقل إلى 10 عندما يحتاج الفعل إلى مساحة
الدقة
480p أو 720p
480p للمسودات، و720p للنسخ المحفوظة
نسبة العرض إلى الارتفاع
16:9، 9:16، 1:1، 4:3، 3:4، 3:2، 2:3
طابقها مع المنصة التي تنشر عليها
صورة الإدخال
اختيارية
لتثبيت مظهر الإطار الأول
صورة الإطار الأخير
اختيارية، وتحتاج إلى صورة إدخال
للتحكم في طريقة انتهاء اللقطة
البذرة
أي عدد صحيح
لإعادة إنتاج المحاولات أو مقارنتها
حفظ الصوت
مفعّل أو مغلق
مغلق للقطات المساندة الصامتة
التدفق نفسه لـ Veo وKling
تنطبق الخطوات نفسها مع بعض التبديلات. في Veo 3.1 اختر 4 أو 6 أو 8 ثوانٍ، و720p أو 1080p. الصور المرجعية تعمل فقط مع 16:9 ومدة 8 ثوانٍ، ويُتجاهل الإطار الأخير عند وجود مراجع. وفي Kling v3 Video اختر الوضع القياسي (720p) أو الاحترافي (1080p)، وفعّل الصوت، وأبقِ الأمر النصي دون 2,500 حرف، وأضف قائمة متعددة اللقطات عندما تريد عدة مشاهد.
حدود يجب التخطيط حولها
الطابور والمحاولات والإخفاقات
حد التوازي: 5 تنبؤات متزامنة لكل حساب، مشتركة بين الاتصالات. خطّط لدفعاتك في مجموعات من خمسة.
الإخفاقات النهائية: الاستعلام عن مهمة فاشلة لن يعيدها إلى العمل. على المساعد أن يرسل مهمة جديدة، ويفضّل أن تكون بأمر نصي أبسط.
حجم الأمر النصي: تقبل واجهة PicassoIA API أوامر نصية حتى 4,000 حرف، ويحدّ Kling v3 Video أمره النصي عند 2,500 حرف، لذا اكتب النسخة الأقصر أولًا.
الإلغاء: يمكن إلغاء المهمة حتى تبدأ GPU بتصيير الفيديو. بعد ذلك تعمل حتى النهاية.
ما لا يفعله الموصل
يستحق النطاق جملة صريحة. وقت كتابة هذا المقال، يسرد موصل PicassoIA أربعة نماذج: مولّد صور، ومحرر صور، وPicassoIA Video وSeedance 2.5 Lite. يعمل Veo 3.1 وKling v3 Video من موقع PicassoIA، ولإدخالهما في المحادثة نفسها تحتاج إلى خادم MCP خاص بك يغلّف واجهات API الخاصة بمزوّديهما.
شغّل list_models في حسابك لترى ما هو معروض اليوم، وراجع picassoia.com/en/pricing لتعرف أي الخطط تتضمن اتصالات MCP قبل أن تبني سير عمل يعتمد عليها.
أنشئ أول مقطع لك اليوم
اختر لقطة واحدة كنت ستصورها عادةً أو تشتريها كلقطات مخزنة، واكتبها كأمر نصي من أربعة أسطر، وشغّلها عبر النماذج الثلاثة. ضع Seedance 2.5 Lite في المقدمة لمسودة سريعة، وأرسل النسخة المعتمدة إلى Veo 3.1 للصوت الواقعي، أو إلى Kling v3 Video لمقطع متعدد اللقطات، وقارن النتائج جنبًا إلى جنب. وخلال فترة بعد الظهر ستعرف النموذج الذي يميل إليه أسلوبك.
يمكنك تجربة كل هذا على PicassoIA. ولّد صورة ثابتة بأحد نماذج الصور، واستخدمها كإطار أول، وشاهدها تتحرك. تصفح الكتالوج الكامل على picassoia.com/en/all-models وشغّل أول أمر نصي لك الليلة.