واجهة Veo 3 API في n8n: سير عمل لفيديو بلا وجه يعمل تلقائيًا
ابنِ سير عمل لفيديو بلا وجه يقرأ فيه n8n جدول الموضوعات، ويطلب من نموذج لغوي مشاهد الفيديو، ويرسل كل أمر نصي إلى Veo 3 API، ويتابع عملية التصيير الطويلة، ويضيف التعليق الصوتي، ثم يرفع المقطع القصير الجاهز. يتضمن إعدادات العُقد، وقواعد إعادة المحاولة، وتتبع التكلفة.
تتوقف معظم القنوات بلا وجه عند المكان نفسه: اللقطات. كتابة السيناريوهات سريعة، والصوت الاصطناعي يكلف القليل جدًا، لكن تأمين أربعين ثانية مقنعة من الفيديو لكل رفعة يستهلك الأسبوع كله. ربط Veo 3 API مع n8n يزيل هذا الاختناق. يتحول صف في جدول البيانات إلى سيناريو، ويتحول السيناريو إلى مشاهد مدة كل منها ثماني ثوانٍ، وتتحول المشاهد إلى لقطات يأتي معها الصوت، ويصل فيديو عمودي جاهز إلى قائمة الرفع بينما تنام.
يبني هذا الدليل سير عمل الفيديو بلا وجه عقدةً عقدة. سترى عقد n8n التي تحمل معظم العبء، وكيف تتعامل مع الاستجابات غير المتزامنة البطيئة من Veo، وأين تتسرب التكاليف، وكيف تختبر الأوامر النصية على Veo 3 في Picasso IA قبل أن تثبّتها في الأتمتة.
لماذا يناسب Veo 3 القنوات بلا وجه
تعتمد القناة بلا وجه على الحجم والتماثل. يعود المشاهدون إلى صيغة معينة لا إلى مقدّم بعينه، لذلك يهم خط الإنتاج أكثر من أي مقطع منفرد. وهذا بالضبط نوع المشكلة الذي تحسنه أتمتة سير العمل: الخطوات نفسها، بالترتيب نفسه، مع موضوع مختلف في كل تشغيل.
يناسب Veo 3 هذا الخط لسبب عملي واحد. هو نموذج لتحويل النص إلى فيديو يصيّر الصورة والصوت معًا من أمر نصي واحد، ويقبل أيضًا صورة ثابتة كإطار بداية، فيمكنك الحفاظ على مظهر واحد عبر كل مشاهد الحلقة.
من الأنواع المناسبة لهذه الصيغة شروحات السفر والطبيعة، ومقاطع الطعام والوصفات، وقصص التاريخ المعروضة بلقطات أجواء، وعروض المنتجات، والحلقات المحيطة للنوم أو التركيز. كلها تعتمد على الأشياء والأماكن والأيدي بدلًا من مقدّم يتحدث أمام الكاميرا، وهذا ما يُبقي الصيغة بلا وجه أصلًا.
الصوت الأصلي يلغي فرعًا كاملًا
كانت خطوط الإنتاج القديمة تسير في ثلاثة فروع: الفيديو والموسيقى والمؤثرات الصوتية. يولّد Veo 3 الصوت المحيط والمؤثرات والجمل المنطوقة داخل المقطع نفسه. في شرح للطبيعة أو مونتاج لطعام الشارع أو إعلان منتج، قد يكون ذلك هو المسار الصوتي النهائي. لا تضيف تعليقًا صوتيًا منفصلًا إلا عندما تحتاج إلى صياغة دقيقة للكلام أو إلى راوٍ واحد عبر سلسلة كاملة.
ما الذي يحتاجه الفيديو بلا وجه فعلًا
قبل أن تفتح n8n، اكتب المخرج الذي تريده. يحتاج الفيديو القصير النموذجي بلا وجه إلى:
خطّاف في الثانيتين الأوليين، عادةً لقطة بصرية لافتة لا جملة
أربعة إلى ستة مشاهد، كل منها قصير بما يكفي لمقطع Veo واحد
تأطير عمودي بنسبة 9:16 لـ Shorts وReels وTikTok
صوت راوٍ واحد أو خلفية موسيقية واحدة، لا الاثنان متنازعين على المساحة
عنوان ووصف ووسوم جاهزة لخطوة الرفع
💡 نصيحة: حدّد عدد المشاهد أولًا. كل مشهد إضافي يضيف استدعاء واجهة برمجية آخر، وانتظارًا آخر، وفرصة أخرى لفشل شيء ما.
سير العمل في لمحة
يتكون خط الإنتاج كله من عشر عقد. ولا واحدة منها غريبة، ويعمل على n8n Cloud أو على تثبيت ذاتي الاستضافة، مع استثناء واحد يُشرح في خطوة التجميع.
الخطوة
عقدة n8n
المهمة
1
Schedule Trigger
يعمل مرة واحدة يوميًا في ساعة ثابتة
2
Google Sheets
يقرأ صف الموضوع غير المستخدم التالي
3
HTTP Request أو AI Agent
يطلب من نموذج لغوي قائمة مشاهد بصيغة JSON
4
Code
يحوّل كل مشهد إلى أمر نصي لـ Veo
5
HTTP Request
يرسل الأمر النصي إلى نقطة نهاية Veo 3
6
Wait + IF
يستطلع الحالة حتى ينتهي التصيير
7
HTTP Request
ينزّل ملف MP4 الجاهز
8
Execute Command
يدمج المقاطع ويضيف التعليق الصوتي
9
YouTube
يرفع الفيديو النهائي
10
Google Sheets
يسجّل الحالة والرابط والتكلفة
الترتيب أهم من اختيار العقدة. ابنِ من الأعلى إلى الأسفل، وشغّل كل عقدة مرة واحدة باستخدام بيانات الاختبار المثبتة، ثم صل العقدة التالية. الأمر النصي المعطوب للمشهد يُكتشف في الخطوة الرابعة بكلفة أقل بكثير من اكتشافه بعد ثلاثة مقاطع مدفوعة.
بناء عقد المشغّل والسيناريو
Schedule Trigger وجدول الموضوعات
ابدأ بعقدة Schedule Trigger مضبوطة على تشغيل واحد يوميًا. ثم أضف عقدة Google Sheets تقرأ أول صف يكون فيه عمود الحالة فارغًا. أبقِ الأعمدة بسيطة: الموضوع، والنبرة، والحالة، ورابط الفيديو، والتكلفة. يصبح هذا الجدول تقويمك للمحتوى وقائمة انتظارك وسجل مراجعتك في مكان واحد.
اطلب من نموذج لغوي المشاهد
أضف خطوة الكتابة. أبسط طريق هو عقدة HTTP Request، أو عقدة AI Agent في n8n، موجّهة إلى نموذج دردشة مثل Claude Sonnet 5 أو Gemini 3.5 Flash أو GPT 5.4. اطلب JSON صارمًا: مصفوفة من المشاهد، ولكل مشهد وصف بصري، وحركة كاميرا، وملاحظة صوتية من سطر واحد.
المخرجات المنظمة مهمة هنا. إذا أعاد النموذج نثرًا فضفاضًا، فستتعطل عقدة Code في التشغيل الثالث، غالبًا في الثانية صباحًا.
حوّل كل مشهد إلى أمر نصي
تمر عقدة Code على المشاهد وتبني الأمر النصي النهائي لكل مشهد. الأمر النصي القوي لـ Veo يتبع الترتيب نفسه دائمًا:
الشخص أو الموضوع وما يفعله
المكان ووقت اليوم
حركة الكاميرا وإحساس العدسة
الإضاءة واللون
الصوت المطلوب في المقطع
أضف سطرًا ثابتًا للأسلوب إلى كل مشهد، مثل "ضوء طبيعي، تصوير محمول باليد، مظهر فيلم 35 ملم"، حتى تتطابق المقاطع عند دمجها. وألحق أمرًا نصيًا سلبيًا يمنع النصوص المتراكبة والعلامات المائية والشعارات.
إليك مثالًا جاهزًا لشرح عن زراعة القهوة: تقطف يدا مزارع متجعدتان من العمل والطقس حبات كرز حمراء من سفح منحدر عند شروق الشمس، دفع بطيء للكاميرا عند مستوى الخصر، ضباب يرتفع بين الصفوف، إضاءة خلفية دافئة، حفيف أوراق خفيف وتغريد طيور بعيد. ضوء طبيعي، تصوير محمول باليد، مظهر فيلم 35 ملم. لاحظ أن الأمر لا يطلب أي وجه. الأيدي والمناظر والأشياء تُبقي الصيغة بلا وجه، وتتجنب أيضًا المشكلة الشائعة لشخص يتغير وجهه من مشهد إلى آخر.
استدعِ Veo 3 API من n8n
هذا هو قلب سير العمل، وهو يتصرف بطريقة تختلف عن استدعاء API عادي.
اضبط عقدة HTTP Request
يُتاح Veo عبر واجهة Gemini API من Google كـ عملية طويلة التشغيل. طلبك الأول لا يعيد فيديو. بل يعيد اسم عملية تتحقق منه لاحقًا. اضبط العقدة هكذا:
يمنع تغليف الأمر النصي بـ JSON.stringify أن تُفسد علامةُ اقتباس عابرة داخل أحد المشاهد الطلبَ. تعود المقاطع بمدة ثماني ثوانٍ على نقطة نهاية Google، ودقة 1080p مرتبطة بالإخراج العريض، فتحقق من الدقة التي تدعمها نسبة العرض إلى الارتفاع التي اخترتها قبل أن تلتزم بالتنسيق العمودي.
استطلع الحالة باستخدام Wait وIF
تحتوي الاستجابة على حقل name. خزّنه، ثم ابنِ حلقة صغيرة:
تتوقف عقدة Wait لمدة 60 ثانية.
ترسل عقدة HTTP Request طلب GET إلى https://generativelanguage.googleapis.com/v1beta/ متبوعًا بالاسم المخزن.
تتحقق عقدة IF مما إذا كان done صحيحًا.
إذا كان خاطئًا، يعود التدفق إلى Wait أقصر مدتها 20 ثانية. وإذا كان صحيحًا، ينتقل التدفق إلى الخطوة التالية.
في صفحة Veo 3 على PicassoIA، انتهت عمليات التصيير النموذجية في نحو 68 إلى 145 ثانية. اعتبر ذلك تقديرًا أوليًا لتأخيراتك الخاصة. مع انتظار أولي مدته 60 ثانية واستطلاعات كل 20 ثانية، تنتهي معظم عمليات التصيير خلال أربع أو خمس مرات تحقق.
أضف عدادًا داخل الحلقة. تزيد عقدة Code رقم المحاولة، وتوقف عقدة IF ثانية التشغيل بعد خمس عشرة مرة تحقق. بدون هذا الحد الأقصى، قد تدور عملية تصيير عالقة واحدة إلى ما لا نهاية وتملأ سجل التنفيذ.
نزّل قبل أن يختفي الملف
عندما يصبح done صحيحًا، يقع عنوان الفيديو داخل الاستجابة تحت generateVideoResponse.generatedSamples. أضف عقدة HTTP Request أخرى، واضبط صيغة الاستجابة على File، وأرسل بيانات الاعتماد نفسها، والتقط البيانات الثنائية. تحتفظ Google بالملفات المولّدة لفترة قصيرة فقط، لذلك ادفع ملف MP4 إلى تخزينك الخاص (S3 أو R2 أو Drive) في العقدة التالية مباشرة. لا تخزن رابط Google في جدولك وتفترض أنه سيعمل الأسبوع المقبل.
أضف الصوت وجمّع الفيديو
متى يكفي الصوت الأصلي
اختبر مشهدًا واحدًا بالمسار المدمج قبل أن تضيف أي شيء. إذا كان الصوت المحيط مناسبًا ولا تحتاج إلى جملة منطوقة، فتخلَّ عن فرع الصوت كليًا. كل فرع تحذفه هو شيء أقل قد يفشل بين عشية وضحاها.
أضف راويًا بتحويل النص إلى كلام
في الصيغ التي تتضمن تعليقًا صوتيًا، أرسل السيناريو إلى نموذج كلام. يتعامل ElevenLabs v3 مع القراءات المعبّرة، ويقدم Speech 2.8 HD من MiniMax تعليقًا صوتيًا نظيفًا بجودة الاستوديو، وGemini 3.1 Flash TTS هو الخيار عندما تحتاج إلى لغات كثيرة. يعيد كل منها ملف صوت تحفظه بجانب المقاطع.
💡 نصيحة: أضف "بلا حوار" إلى أمر Veo عندما تنوي وضع راوٍ فوقه، حتى لا تتنافس أصوات المقطع نفسه مع صوتك.
اربط المشاهد معًا
دمج المقاطع مهمة لـ FFmpeg داخل عقدة Execute Command. يقرأ أمر أساسي قائمة المشاهد، ويضع التعليق الصوتي فوقها، ويكتب ملفًا واحدًا:
وهنا الفخ. تعمل عقدة Execute Command على n8n ذاتي الاستضافة فقط. على n8n Cloud، أرسل روابط المقاطع إلى خدمة تصيير خارجية عبر عقدة HTTP Request بدلًا من ذلك. في الحالتين، يكون الناتج ملف MP4 واحدًا لكل حلقة، جاهزًا لخطوة الرفع.
انشر وتتبع التكلفة
الرفع إلى Shorts وReels وTikTok
تأتي n8n بعقدة YouTube ترفع ملفًا ثنائيًا مع عنوان ووصف وحالة خصوصية. أما المنصات الأخرى، فاستدعِ واجهة النشر الرسمية لكل منصة عبر عقدة HTTP Request، أو استخدم خدمة جدولة تقدم webhook. اضبط الخصوصية على خاص في التشغيلات الأولى، وراجع كل فيديو بنفسك حتى تثق بالمخرجات.
سجّل كل تشغيل في الجدول
اكتب الحالة ورابط الفيديو النهائي وعدد محاولات التصيير وعدد المشاهد والتكلفة المقدّرة. تحتسب Google تكلفة Veo بحسب كل ثانية من الفيديو المولّد، وقد تغيّرت الأسعار أكثر من مرة منذ الإطلاق، لذلك احفظ سعر الثانية في متغير واحد في n8n أو في خلية واحدة من الجدول، بدلًا من ترميزه في ست عقد. مع ثماني ثوانٍ لكل مشهد وخمسة مشاهد، تعني الحلقة الواحدة 40 ثانية مفوترة قبل احتساب أي إعادة محاولة.
قواعد إعادة المحاولة التي تحمي ميزانيتك
الإخفاقات أمر طبيعي مع الفيديو التوليدي، لذلك حدد سياستك مسبقًا:
أعد محاولة التصيير الفاشل مرة واحدة بالأمر النصي نفسه
عند الفشل الثاني، اطلب من النموذج اللغوي إعادة كتابة الأمر النصي، ثم جرّب مرة أخيرة
بعد ذلك،ضع علامة "يحتاج مراجعة" على الصف وتوقف
أضف سير عمل Error Trigger يرسل إليك تنبيهًا بالبريد الإلكتروني أو عبر الدردشة
حدّد عدد التشغيلات اليومية حتى لا يستنزف خطأ في الحلقة رصيدك
اختبر الأوامر النصية مع Veo 3 على PicassoIA
قبل أن تنفق من ميزانية API، جرّب كل أمر نصي لمشهد يدويًا. يقبل Veo 3 على PicassoIA أمرًا نصيًا، ودقة، ونسبة عرض إلى ارتفاع، وصورة بداية اختيارية، وأمرًا نصيًا سلبيًا، وقيمة بذرة. إليك الروتين:
افتح صفحة Veo 3 وسجّل الدخول.
الصق أمرًا نصيًا لمشهد مكتوبًا بالترتيب نفسه الذي تستخدمه عقدة Code.
اضبط الدقة على 720p للاختبارات، ولا تنتقل إلى 1080p إلا للتصيير النهائي.
اختر 9:16 للمقاطع العمودية القصيرة أو 16:9 للإخراج العريض.
ارفع صورة بداية اختيارية إن أردت. الإطارات المثالية بمقاس 1280x720.
أضف أمرًا نصيًا سلبيًا مثل "نص، علامة مائية، شعار".
عندما يعمل المظهر، ثبّت قيمة البذرة حتى تعيد عمليات إعادة التشغيل إنتاجه.
ولّد وانتظر. استغرقت عمليات التصيير النموذجية في الصفحة نحو دقيقة إلى دقيقتين ونصف.
تستحق نماذج الفيديو الأخرى الاختبار بالأمر النصي نفسه:
💡 نصيحة: تشغّل PicassoIA أيضًا واجهة برمجية للمطورين على https://api.picassoia.com/v1 بنقاط نهاية على نمط Replicate: طلب POST إلى /v1/models/{owner}/{name}/predictions، ثم طلب GET على /v1/predictions/{id} حتى تنتهي المهمة. حتى تاريخ الكتابة، تتيح للفيديو PicassoIA Video وSeedance 2.5 Lite، وتسمح بخمسة تنبؤات متزامنة لكل حساب. Veo 3 ليس ضمن هذه القائمة، ولهذا يستهدف سير العمل أعلاه نقطة نهاية Google. نمط الإنشاء ثم الاستطلاع متطابق، لذلك تعمل حلقة Wait وIF نفسها مع الاثنين.
أنشئ أول مقطع لك اليوم
لا تحتاج إلى خط الإنتاج الكامل المكوّن من عشر عقد لترى إن كانت الفكرة تنجح في مجالك. اختر موضوعًا واحدًا، واكتب خمسة أوامر نصية لمشاهد بالترتيب الوارد في الروتين أعلاه، وشغّلها على Picasso IA. قارن مسودة بدقة 720p مع تصيير بدقة 1080p، وجرّب نسخة عمودية وأخرى عريضة، ولاحظ أي الأوامر تصمد عبر المشاهد.
عندما تملك ثلاثة أوامر تثق بها، انسخها إلى عقدة Code ودع n8n يتولى العمل المتكرر. ابدأ صغيرًا، وسجّل كل شيء، وأضف فرعًا واحدًا في كل مرة. افتح Picasso IA، وشغّل مشهدك الأول، وانظر إلى المدى الذي يمكن أن يبلغه أمر نصي جيد واحد في قناة بلا وجه.