واجهة API لتوليد الصور المصغرة بالذكاء الاصطناعي لمنصة YouTube: الخيارات والأسعار

تحدد الصورة المصغرة ما إذا كان الفيديو سيُنقر أم لا، وتتيح لك API إنتاجها بأعداد كبيرة. يقارن هذا العرض خيارات API الرئيسية للصور المصغرة في YouTube، ويوضح كيف تحسب التكلفة الفعلية لكل صورة منشورة، ويعرض مسار عمل بسيطًا يمكنك بناؤه في بعد ظهر واحد.

واجهة API لتوليد الصور المصغرة بالذكاء الاصطناعي لمنصة YouTube: الخيارات والأسعار
Cristian Da Conceicao
مؤسس Picasso IA

تملك الصورة المصغرة في YouTube جزءًا من الثانية لتكسب النقرة، والقناة الجادة تحتاج عدة صور لكل فيديو. إنتاجها يدويًا يصلح لمنشئ واحد، لكنه ينهار عند وكالة تدير أربعين قناة، أو أداة تنشر ملخصات آلية، أو غرفة أخبار تنشر مقاطع طوال اليوم. هنا تثبت واجهة API لتوليد الصور المصغرة بالذكاء الاصطناعي لـ YouTube قيمتها: يرسل الكود أمرًا نصيًا، فيستلم صورة، ويتولى بقية مسار النشر دون تدخل من مصمم.

المهمة الصعبة ليست استدعاء الواجهة. الصعوبة في الاختيار بين نحو اثني عشر مزوّدًا تعرض صفحات أسعارهم وحدات قياس مختلفة، ثم حساب ما تكلفه الصورة المصغرة المنشورة فعليًا بعد احتساب الرفض وإعادة المحاولة وتغيير الحجم. يقارن هذا المقال الخيارات الواقعية، ويضع حسابات فعلية خلف الأسعار، وينتهي بمسار إنتاج يمكنك تشغيله خلال فترة بعد الظهر.

💡 الخلاصة السريعة: لمعظم القنوات، يتفوق نموذج صور عام يُستخدم عبر واجهة API واحدة، مع خطوة صغيرة لإضافة النص فوق الصورة، على خدمات الصور المصغرة المتخصصة من حيث التكلفة والمرونة. خصّص ميزانية لإنتاج 5 إلى 8 صور مرشحة لكل فيديو، وليس صورة واحدة.

ماذا تفعل واجهة الصور المصغرة فعليًا

واجهة الصور المصغرة هي أي خدمة HTTP تحوّل أمرًا نصيًا، وأحيانًا صورة مرجعية، إلى ملف صورة جاهز. لا شيء فيها خاص بمنصة YouTube. الجزء الخاص بـ YouTube يعيش في كودك: ضبط أبعاد الناتج، ومراعاة حدود حجم الملفات، وربط النتيجة بالفيديو الصحيح. تعامل مع المولّد بوصفه كتلة قابلة للاستبدال في خط إنتاج صغير، لأن أفضل نموذج هذا الشهر لن يكون الأفضل في الربع القادم.

مطوّر يكتب طلب توليد صورة مصغرة في محرر أكواد على مكتب في منزل

تدفق الطلب الأساسي

كل إعداد عملي يتبع الخطوات الخمس نفسها:

  1. الإحاطة: ابنِ الأمر النصي من عنوان الفيديو وملخص من سطر واحد والأسلوب البصري للقناة.
  2. التوليد: استدعِ نموذج الصور، واطلب عدة إصدارات في دفعة واحدة عندما يسمح المزوّد بذلك.
  3. المعالجة: اقتطع الصورة بنسبة 16:9، وغيّر حجمها إلى 1280 × 720 بكسل، وضغطها لتقع دون حد الرفع.
  4. الرفع: أرفق الملف بالفيديو عبر طريقة thumbnails.set في YouTube.
  5. القياس: اقرأ بيانات نسبة النقر لاحقًا، وأعد الصفات الفائزة إلى أوامرك النصية.

الخطوتان 1 و5 هما المكان الذي تختصر فيه معظم الفرق، وهما أيضًا المكان الذي تكمن فيه أكبر المكاسب. الأمر النصي المكتوب من موضوع الفيديو الفعلي يتفوق على القالب العام تقريبًا في كل مرة، وحلقة التغذية الراجعة تحوّل كل رفع إلى بيانات للرفع التالي.

المواصفات التي يتوقعها YouTube

المواصفةالمتطلب
الدقة1280 x 720 بكسل، والعرض الأدنى 640
نسبة العرض إلى الارتفاع16:9
حجم الملفأقل من 2 ميغابايت
الصيغ المقبولةJPG وGIF وPNG
حالة القناةيلزم حساب موثّق لرفع الصور المصغرة المخصصة

مهما كان النموذج الذي تختاره، نادرًا ما يطابق ناتجه الخام هذه الأرقام تمامًا، لذلك خطّط لخطوة تغيير الحجم منذ اليوم الأول.

💡 انتبه للصيغة: تعيد عدة واجهات صور صيغة WebP افتراضيًا. يقبل YouTube صيغ JPG وGIF وPNG، لذا اطلب ناتج JPEG مباشرة أو حوّله قبل الرفع.

أربع طرق للبناء

تغطي أربع بنى تقريبًا كل مشروع حقيقي. تختلف في شكل التكلفة، ومستوى التحكم، وكمية الكود الذي ستصونه.

كاميرا بدون مرآة وإضاءة حلقية مرتبة في استوديو صغير لـ YouTube

نماذج صور عامة عبر واجهة API واحدة

تستدعي نموذج تحويل النص إلى صورة مباشرة وتكتب الأمر النصي بنفسك. هذا أكثر المسارات مرونة: تغيّر الأسلوب بتغيير الكلمات، ويمكنك استبدال النماذج دون لمس بقية المسار. تفيد هنا منصة متعددة النماذج مثل Picasso IA، لأنها تتيح اختبار عدة نماذج جنبًا إلى جنب قبل أن تلتزم بمزوّد واحد في الكود.

خدمات الصور المصغرة القائمة على القوالب

توفّر الأدوات المتخصصة تخطيطات جاهزة، وقصاصات للوجوه، وحزم هوية بصرية. أنت تضحّي بالتحكم مقابل السرعة. تناسب هذه الأدوات الفرق غير التقنية، لكن تسعيرها حسب المقعد أو حسب التصدير يرتفع بسرعة مع نمو الحجم، وكثير منها يقدّم واجهة API محدودة أو لا يقدّم أي واجهة. تأكد من وجود واجهة API موثقة قبل أن تخطط لدمج مبني على أيٍّ منها.

نماذج مفتوحة مستضافة ذاتيًا

تشغيل الأوزان المفتوحة على وحدات GPU مستأجرة يمنحك أقل تكلفة لكل صورة عند الاستخدام المرتفع، ويُبقي بياناتك داخل المؤسسة. لكنه يضع على عاتقك أيضًا برامج التشغيل وطوابير المهام والتوسّع وتحديثات النموذج. يبدأ منطقيًا بعد بضعة آلاف من الصور شهريًا، أو عندما لا تترك قواعد الخصوصية بديلًا.

مسارات هجينة مع إضافة النص

هذا النمط هو الأكثر صمودًا في الإنتاج. دع النموذج يرسم الخلفية والشخص، ثم أضف العنوان بكودك الخاص باستخدام Pillow أو Sharp أو مكتبة canvas. تحسّن عرض النص داخل النماذج كثيرًا، لكن التراكب الحتمي لا يخطئ في تهجئة كلمة أبدًا، ولا يبدّل الخطوط بين الرفعات. تحب الوكالات هذا تحديدًا لأنه يحافظ على اتساق العلامة التجارية.

الخيارالأنسب لـجودة النصشكل التكلفةالجهد الهندسي
واجهة API لتوليد الصور العامةمعظم القنوات والأدواتجيدة إلى جيدة جدًا في النماذج الأحدثالدفع لكل صورةمنخفض
خدمة قوالبالفرق غير التقنيةخطوط ثابتة وموثوقةاشتراك أو حسب المقعدمنخفض جدًا
نماذج مستضافة ذاتيًاحجم كبير، بيانات خاصةيعتمد على النموذجساعات GPUمرتفع
هجين مع تراكبقواعد علامة تجارية صارمةدقيق، بخطوطك الخاصةلكل صورة مع الحوسبةمتوسط

نماذج تستحق التجربة للصور المصغرة

اختيار النموذج أهم من اختيار الاستضافة، لأن فجوة الجودة بين النماذج أكبر من فجوة الأسعار بين المزوّدين. هذه العائلات تستحق تجربة فعلية.

تصيير نص قوي

صُمم GPT Image 2 لوضع كلمات مقروءة داخل الصور، ويتبع الأوامر الطويلة متعددة الأجزاء بدقة، ما يناسب التخطيطات التي تضم عنوانًا وشخصًا ولوحة ألوان محددة. يتمتع Ideogram V3 Quality بسمعة طويلة في الخطوط والحروف، بينما يضحّي Ideogram V3 Turbo بقدر من التفاصيل مقابل السرعة. يميل Recraft V4 نحو المظاهر المصممة والرسومية ذات الطباعة النظيفة.

مسودات سريعة ومنخفضة التكلفة

استخدم نماذج سريعة ورخيصة للمرور الأول، واحتفظ بالنماذج المتميزة للمرشحين النهائيين. P-Image مصمم للسرعة، وقد أُنتجت منه كل صورة في هذا المقال. FLUX Schnell خيار آخر يركز على السرعة، ويستحق Qwen Image 2 أن يُضاف إلى مجموعة المقارنة.

الواقعية الفوتوغرافية

تعتمد الصور المصغرة التي تبرز الوجوه على ملمس الجلد والإضاءة. FLUX 2 Pro، وImagen 4، وSeedream 4.5، وNano Banana 2 هي المرشحون المعتادون للوجوه الواقعية ولقطات المنتجات. شغّل أمرًا واحدًا عبر الأربعة وقارن الوجوه بحجم الصورة المصغرة، لأن الأخطاء الصغيرة في العيون والأيدي تظهر بسرعة على شاشة الهاتف.

يد تمسك هاتفًا ذكيًا يعرض خلاصة فيديوهات مليئة بالصور المصغرة في مقهى مضاء بضوء الشمس

💡 طريقة الاختبار: اختر 10 مواضيع فيديو حقيقية من قناتك. ولّد 4 صور لكل موضوع على كل نموذج، ثم اطلب من ثلاثة أشخاص ترتيبها دون معرفة المصدر. ساعة من الترتيب توفر أشهرًا من دفع ثمن النموذج الخاطئ.

التكلفة الحقيقية لكل صورة مصغرة

تعرض صفحات الأسعار سعر الصورة الواحدة، أو سعر المليون توكن للنماذج المحسوبة بالتوكنات، أو سعر ثانية GPU للنماذج المفتوحة المستضافة. لا شيء من ذلك هو الرقم المهم. ما تحتاجه هو تكلفة الصورة المصغرة المنشورة.

أربعة نماذج تسعير ستصادفها

وحدة الفوترةكيف تعملانتبه إلى
سعر ثابت للصورةسعر واحد محدد لكل ناتجالمستويات المتميزة تكلف أضعاف مستويات المسودات
لكل توكنيتبع السعر طول الأمر، وحجم الناتج، وإعداد الجودةإعداد الجودة الأعلى قد يضاعف الفاتورة
ثواني GPUتدفع مقابل وقت الحوسبةبدايات التشغيل الباردة والوقت الخامل تُحتسب أيضًا
نقاط الاشتراكحصة شهرية من التوليداتالنقاط غير المستخدمة تنتهي عادة

المعادلة بأرقام حقيقية

تكلفة الصورة المصغرة المنشورة = (N × P) + U + L N هو عدد الصور المولَّدة لكل فيديو، وP سعر الصورة الواحدة، وU أي خطوة رفع دقة أو قصّ، وL استدعاء النموذج اللغوي الذي يكتب الإحاطة.

الأسعار التالية أرقام توضيحية، وليست عروض أسعار من أي مزوّد. تحقق من قائمة الأسعار الحالية لأي مزوّد تختاره.

  • قناة فردية: 12 فيديو شهريًا، و6 مرشحين لكل فيديو، بسعر 0.04 دولار للصورة: 72 صورة، أي 2.88 دولار شهريًا.
  • وكالة: 40 قناة، و12 فيديو لكل قناة، و8 مرشحين لكل فيديو: 3,840 صورة. وهذا يساوي 153.60 دولارًا بسعر 0.04 دولار للصورة، و460.80 دولارًا بسعر متميز قدره 0.12 دولار.

يأتي التفاوت من N وP، لا من شعار المزوّد. توليد المسودات بسعر منخفض وإنهاؤها بالنسخ المتميزة يخفض التكلفة في الاتجاهين. ست مسودات بسعر 0.01 دولار ونسختان نهائيتان بسعر 0.12 دولار تكلّف 0.30 دولار لكل فيديو، بينما تكلّف ثماني صور متميزة 0.96 دولار.

منظر من الأعلى لمكتب فيه حاسوب محمول وهاتف ذكي ودفتر حسابات وآلة حاسبة

نقطة التعادل للاستضافة الذاتية

لنفترض أن وحدة GPU مستأجرة تكلف 1.20 دولار في الساعة، وتُصيّر صورة واحدة في 6 ثوانٍ. عند الحمل الكامل يعني ذلك 600 صورة في الساعة، أي 0.002 دولار لكل صورة. لكن الخوادم الحقيقية تبقى خاملة. عند استخدام بنسبة 5% تكلف الأجهزة نفسها 0.04 دولار لكل صورة، وهو السعر الذي تفرضه واجهة مستضافة في المثال السابق. الاستضافة الذاتية تربح فقط عندما تستطيع إبقاء GPU مشغولة.

لقطة مقربة لآلة حاسبة وفاتورة مطبوعة وقلم على مكتب من خشب البلوط

التكاليف الخفية التي تنساها الفرق

  • معدل الرفض: إذا فشلت نصف الصور في المراجعة، يتضاعف N الحقيقي لديك.
  • رفع الدقة: تحتاج الناتجات الصغيرة إلى مرور للتحسين الحاد قبل الرفع.
  • التخزين والتسليم: تتراكم النسخ البديلة والملفات الأصلية والسجلات.
  • إعادة المحاولة: الاستدعاءات الفاشلة أو المنتهية بسبب المهلة تكلّف وقت المطوّر أيضًا.
  • ضبط الأوامر النصية: أسبوع التكرار الأول عمل فعلي.
  • الإيجابيات الكاذبة في الإشراف: الأوامر المحظورة تهدر استدعاءً.

حدود المعدل والتوسّع

تحدد مزودات الصور عدد المهام التي تعمل في الوقت نفسه، وغالبًا ما يكون الحد في المستوى المبتدئ عددًا محدودًا لكل حساب. سكربت يرسل 50 طلبًا في حلقة سيجمع أخطاء بدلًا من الصور المصغرة، لذلك عامل الحدود كمدخل تصميمي منذ البداية.

الطوابير وإعادة المحاولة والتخزين المؤقت

ضع طابور مهام أمام المولّد، واجعل التزامن الأقصى أقل من حد المزوّد. أعد المحاولة بتأخير أُسّي عند أخطاء حد المعدل وأخطاء الخادم، وتوقف بعد عدد قليل من المحاولات. خزّن الأمر النصي وقيمة البذرة واسم النموذج بجانب كل ملف، حتى يمكن إعادة إنتاج أي صورة مصغرة لاحقًا، وخزّن النتائج مؤقتًا بتجزئة الأمر النصي حتى لا تكلّف عمليات إعادة التشغيل شيئًا.

خزانة شبكة صغيرة في مكتب فيها رف أسود وكابلات إيثرنت مرتبة

سقف حصة YouTube

على جانب YouTube، تكلّف كل عملية استدعاء thumbnails.set 50 وحدة حصة، ويبدأ المشروع الجديد بـ 10,000 وحدة يوميًا. يتيح ذلك نحو 200 عملية رفع للصور المصغّرة يوميًا، وهو عدد كافٍ لقناة واحدة، لكنه ضيق على وكالة تعمل على آلاف مقاطع الفيديو. تتطلب الأحجام الأكبر تقديم طلب زيادة إلى Google عبر عملية الحصص الخاصة بها، لذا قدّم الطلب قبل الإطلاق، لا بعد فشل أول دفعة. كما تتطلب عمليات الرفع موافقة OAuth من مالك القناة.

ابنِ مسار عمل يعمل

هذا مسار يبقى صغيرًا ويُبقي كل جزء قابلًا للاستبدال.

  1. اكتب الإحاطة بنموذج لغوي. يحوّل Claude Sonnet 5 وGemini 3.5 Flash كلاهما عنوان الفيديو وملخص نص مختصر إلى ثلاثة مفاهيم متمايزة للصور المصغرة. اطلب JSON يتضمن الموضوع والانفعال والخلفية ولوحة الألوان وعنوانًا من ثلاث كلمات كحد أقصى.
  2. ولّد ثلاثة إصدارات متمايزة. نوّع التكوين لا اللون فقط: لقطة مقربة للوجه، ولقطة بطل للمنتج، ومقارنة مقسومة. ميزة Test & Compare في Studio لدى YouTube تتيح للقنوات المؤهلة تشغيل ما يصل إلى ثلاث صور مصغرة ضد بعضها، لذلك فالثلاثة حجم دفعة طبيعي.
  3. اقطع وارفع الدقة واضغط. إزالة الخلفية تعزل الشخص لتخطيط متعدد الطبقات. وReal-ESRGAN يرفع دقة الناتج الصغير إلى 1280 × 720 مع حواف حادة. احفظ بصيغة JPEG بجودة 85 إلى 90 للبقاء دون 2 ميغابايت.
  4. اختبر وسجّل وكرّر. عند انتهاء الاختبار، سجّل صفات الفائز: حجم الوجه، واللون السائد، وطول العنوان. أدخل هذه الصفات في الإحاطة التالية.

فريق تسويق حول طاولة يراجع عدة تنويعات لصور مصغرة على شاشتين

for each video:
  concepts = llm_brief(title, summary)       # 3 concepts as JSON
  images   = generate(concepts)              # one image per concept
  files    = [to_jpeg(resize(i, 1280, 720)) for i in images]
  upload_via_api(files[0])                   # lead thumbnail
  queue_for_studio_test(files[1:])           # remaining variants

ميزة Test & Compare جزء من Studio، لذا خطّط لخطوة يدوية قصيرة للإصدارات الإضافية، أو احتفظ بشخص في الحلقة للموافقة النهائية على أي حال. شخص يفحص ثلاثة مرشحين نهائيين يستغرق ثوانٍ، ويلتقط الإصبع الزائد أو الكلمة المشوهة قبل أن تُنشر.

مصمم يرتب بطاقات مطبوعة لاختبار الصور المصغرة على طاولة رمادية

استخدم GPT Image 2 على PicassoIA

الصور المصغرة الغنية بالنص تناسب GPT Image 2، لذلك فهو نموذج منطقي للبداية عند اختبار تخطيط العنوان. يستغرق المسار على PicassoIA بضع دقائق:

  1. افتح صفحة GPT Image 2.
  2. اكتب الأمر النصي. صف الشخص والانفعال والخلفية والإضاءة، ثم ضع العنوان بين علامتي اقتباس، مثلًا: دراج مندهش يمسك سلسلة انقطعت على طريق ريفي، ضوء صباحي ذهبي، عنوان بارز "FIX IT FAST" في الأعلى على اليسار.
  3. اضبط aspect_ratio. الخيارات هي 1:1 و3:2 و2:3، فاختر 3:2 ثم اقتطع بنسبة 16:9 لاحقًا. يقص الاقتطاع نحو 16% من الارتفاع، لذا اترك مساحة تنفس فوق الشخص وتحته.
  4. اضبط quality. منخفضة أو متوسطة للمسودات، وعالية للمرشحين النهائيين.
  5. اضبط number_of_images. حتى 10 صور لكل تشغيل، و3 أو 4 تكفي للمرور الأول.
  6. اختر output_format وbackground. اختر JPEG أو PNG بدلًا من WebP الافتراضية، وأبقِ الخلفية غير شفافة للصورة المصغرة النهائية. استخدم الشفافية فقط عندما تحتاج إلى شخص معزول.
  7. ولّد وحمّل وأنهِ. غيّر الحجم إلى 1280 × 720 وارفع.

💡 الصور المرجعية: يقبل النموذج صورًا للإدخال إلى جانب الأمر النصي. ارفع مرجعًا لوجهك أو منتجك أو تخطيطك للحفاظ على اتساق سلسلة كاملة.

جرّبه على Picasso IA اليوم

قراءة الأسعار وحدها لا تكفي. أسرع طريقة لإيجاد النموذج المناسب لقناتك هي تشغيل الأمر النصي نفسه على ثلاثة نماذج والحكم على النتائج جنبًا إلى جنب. افتح Picasso IA، والصق أمرًا واحدًا في GPT Image 2، وIdeogram V3 Quality، وFLUX 2 Pro، وانظر أيّها ينتج وجهًا وعنوانًا تنقر عليهما فعلًا.

ثم غيّر شيئًا واحدًا في كل مرة: الإضاءة أو العنوان أو الاقتطاع. عدة جولات من التجارب ستكشف بنية الأمر النصي التي يتفاعل معها جمهورك، وهذه البنية هي بالضبط ما ستسلمه لاحقًا لمسار API. ابدأ بفيديو واحد، وأنشئ صورك المصغرة الخاصة اليوم، ودع النتائج تحدد أين تُصرف الميزانية.

شاب مبدع يبتسم أمام حاسوب محمول يعرض مخططًا صاعدًا وصورة مصغرة زاهية

شارك هذا المقال

اختر لغتك

مقالات ذات صلة