أسعار Gemini Batch API: الحدود والمستوى المجاني ووقت الاستجابة
تحتسب Gemini Batch API 50% من السعر القياسي مقابل مدة إنجاز مستهدفة تبلغ 24 ساعة. يعرض هذا المقال أسعار الدفعات لكل نموذج، وقواعد المستوى المجاني، وحدود الطلبات والتوكنات حسب المستوى، وأوقات الاستجابة الفعلية، ومثالًا محسوبًا للتكلفة مع كود Python.
دفع السعر الكامل مقابل إجابات لا يحتاجها أحد في هذه اللحظة هو أكثر الهدر شيوعًا في مشاريع Gemini. صُممت Gemini Batch API لهذا الموقف تحديدًا: ترسل إلى Google كومة من الطلبات، وتنصرف، ثم تستلم النتائج لاحقًا بسعر 50% من التكلفة القياسية. لكن الثمن هو الوقت. تستهدف Google إنجاز المهمة خلال 24 ساعة، وتنتهي صلاحية المهام بعد 48 ساعة، وتحدد بعض الحدود حجم الكومة المسموح لك بإرسالها.
يجمع هذا المقال الأرقام في مكان واحد: أسعار الدفعات لكل نموذج، وما يتيحه المستوى المجاني فعلًا، وحدود الحجم والتوكنات حسب المستوى، والمدة التي تستغرقها النتائج، واستدعاءات Python الدقيقة لإرسال المهمة. تأتي كل الأرقام من صفحات Google العامة للتسعير والدفعات وحدود المعدل كما تم التحقق منها في أكتوبر 2026، لذا تأكد منها قبل أن تلتزم بميزانية كبيرة.
💡 الإجابة السريعة: سعر الدفعة نصف السعر العادي، ويستهدف 24 ساعة، ويقبل أقل من 20 ميغابايت مضمنة أو 2 غيغابايت لكل ملف، ويسمح بحد أقصى 100 مهمة متزامنة. ويدرج المستوى المجاني الدفعات كمجانية لنموذجين فقط من فئة Flash-Lite.
ماذا تفعل Batch API فعليًا
مهام غير متزامنة بنصف السعر
الاستدعاء العادي لـ Gemini متزامن: ترسل أمرًا نصيًا، وتنتظر بضع ثوانٍ، وتدفع سعر التفاعل المباشر. أما مهمة الدفعة فتعمل مثل إيداع صندوق من المظاريف في مكتب فرز البريد. ترسل طلبات كثيرة كـ مهمة واحدة، فتضعها Google في طابور وتشغّلها عندما تتوفر السعة، وتحتفظ بالمخرجات جاهزة لتنزيلها. النماذج وصيغة الأوامر والإعدادات تبقى كما هي. الذي يتغير هو طريقة التسليم، وتحتسب Google مقابل هذا التنازل 50% من التكلفة القياسية.
توليد الصور باستخدام عائلة Nano Banana من نماذج Gemini للصور
المخرجات المنظمة بمخططات JSON
Google Search كأداة داخل الطلب
أين تناسب Batch أكثر
تكون Batch مجدية عندما لا ينتظر أحد الإجابة. ومن الاستخدامات المناسبة تصنيف كتالوج منتجات، وتلخيص آلاف تذاكر الدعم الفني، ووسم مجموعة بيانات، وتشغيل مجموعة تقييم خلال الليل، وكتابة النص البديل للصور في مكتبة صور، أو إنتاج التضمينات لفهرس بحث. كما تناسب أي خط معالجة يعمل وفق جدول زمني، مثل التحديث الليلي لأوصاف المنتجات التي تغيّرت في ذلك اليوم. أما الاستخدامات غير المناسبة فهي روبوتات الدردشة، والبحث المباشر، وأي شاشة يراقب فيها شخص دائرة التحميل.
💡 قاعدة عامة: إذا كان تأخير ست ساعات لن يزعج أحدًا، فالمهمة تنتمي إلى Batch.
أسعار Gemini Batch API حسب النموذج
كل سعر في الجدول أدناه مخفّض مسبقًا. الأسعار بالدولار الأمريكي لكل مليون توكن في المستوى المدفوع، وهي مأخوذة من صفحة تسعير Google في أكتوبر 2026.
هناك تفصيلان مهمان هنا. أولًا، أسعار الدفعات لـ Gemini 3.8 و 3.7 و 3.6 Flash ترويجية حتى 31 ديسمبر 2026، وتتضاعف في 1 يناير 2027، لذا تحتاج أي ميزانية تكتبها الآن إلى الصفين معًا. ثانيًا، Gemini 2.5 Pro هو النموذج الوحيد في الجدول الذي يغيّر فيه طول الأمر سعر الوحدة.
مثال محسوب للتكلفة
لنأخذ مهمة من 10,000 طلب، كل طلب يحتوي على 1,500 توكن إدخال و300 توكن إخراج. هذا يعني 15 مليون توكن إدخال و3 ملايين توكن إخراج.
الخصم نصف السعر بالضبط، لذا توفر مهمة Flash-Lite مبلغ 6.00 دولارات، وتوفر مهمة Flash مبلغ 24.75 دولارًا. وعند 1,000,000 طلب توفر المهمتان نفسهما 600 دولار و2,475 دولارًا. وإذا كانت أوامرك تستدعي استدلالًا طويلًا، فتذكّر أن توكنات التفكير تُحتسب كمخرجات، لذا قد يكبر عمود الإخراج أسرع من عمود الإدخال.
لا تخمّن أعداد التوكنات. شغّل أولًا 50 طلبًا تمثيليًا عبر API العادية، واقرأ بيانات الاستخدام في كل استجابة، ثم احسب متوسط أرقام الإدخال والإخراج. اضربها في عدد طلباتك وفي سعر الدفعة. تستغرق العينة المكونة من 50 طلبًا بضع دقائق، وغالبًا ما تكشف الشكل الواحد من الأوامر الذي يستغرق ثلاثة أضعاف وقت البقية.
تكاليف توليد الصور
مخرجات الصور هي الجزء المكلف في مهام الصور. يعلن Gemini 3.1 Flash Image، النموذج المعروف باسم Nano Banana 2، عن أسعار دفعات تبلغ 0.25 دولار لكل مليون توكن إدخال نصي أو صوري، و1.50 دولار لكل مليون توكن إخراج نصي وتفكير، و30.00 دولارًا لكل مليون توكن إخراج صوري. ولعدد قليل من الصور لا تحتاج إلى مهمة أصلًا: يولّد Nano Banana 2 على PicassoIA الصور دون سقف للنقاط، وهذا يجعله مكانًا أرخص لاختبار أمر قبل أن تضع 5,000 صورة في الطابور.
المستوى المجاني: ماذا تحصل عليه فعلًا
النماذج التي تتيح الدفعات مجانًا
يضم جدول تسعير Google صفًا للدفعات لكل نموذج، مع عمودين منفصلين هما المستوى المجاني والمستوى المدفوع. وقت كتابة هذا المقال، يُكتب في عمود المستوى المجاني مجاني لنموذجين: Gemini 3.5 Flash-Lite و Gemini 3.1 Flash-Lite. ويُكتب غير متاح لنماذج Gemini 3.8 و 3.7 و 3.6 و3.5 Flash، وGemini 3.1 Flash Image، وGemini 2.5 Pro، وGemini 2.5 Flash، وGemini 2.5 Flash-Lite.
حيث تصمت الوثائق
لا تذكر صفحة الدفعات ما إذا كان حسابات المستوى المجاني تستطيع إرسال المهام. وتسرد صفحة حدود المعدل أرقام التوكنات في الطابور للمستويات المدفوعة الثلاثة، ولا تذكر أي رقم للمستوى المجاني. لذا اقرأ كلمة "مجاني" بمعنى مسعّرة بصفر لهذين النموذجين، لا بمعنى غير محدودة.
💡 اختبر قبل أن تخطط: أرسل مهمة من عشرة طلبات على أحد نموذجي Flash-Lite، وراقب حالتها، وتحقق من صفحة حدود المعدل لمشروعك في AI Studio. ولا تبنِ جدولًا إنتاجيًا حول صف دفعات مجانية قبل أن تنجح هذه المهمة الصغيرة.
الحدود التي ستصطدم بها
تنقسم حدود Batch إلى مجموعتين: مدى ضخامة مهمة واحدة، وكمية العمل التي يمكن أن تنتظر في وقت واحد.
سقوف حجم الطلب والملف
الحد
القيمة
حمولة الطلب المضمّن
أقل من 20 ميغابايت في المجموع
حجم ملف الإدخال
2 غيغابايت لكل ملف
تخزين الملفات
20 غيغابايت
طلبات الدفعات المتزامنة
100
انتهاء صلاحية المهمة
48 ساعة إذا كانت معلّقة أو قيد التشغيل
المدة المستهدفة لإنجاز المهمة
24 ساعة
تناسب الطلبات المضمّنة المهام الصغيرة. وعندما تقترب الحمولة من 20 ميغابايت، انتقل إلى ملف JSONL: طلب واحد في كل سطر، يحمل كل سطر معرّف طلب مع جسم الطلب، ويُرفع عبر Files API.
التوكنات في الطابور حسب المستوى
أشد الحدود ليس حجم الملف، بل التوكنات في الطابور: إجمالي التوكنات المنتظرة عبر كل مهام الدفعات النشطة لنموذج واحد. ويتدرج هذا الحد مع مستوى الفوترة لديك.
المستوى
كيف تتأهل
التوكنات في الطابور (مثال)
المستوى 1
ربط حساب الفوترة
3,000,000 لنموذج Gemini 3.8 Flash
المستوى 2
دفع 100 دولار ومرور 3 أيام منذ أول دفعة ناجحة
400,000,000 لنموذج Gemini 3.8 Flash
المستوى 3
دفع 1,000 دولار ومرور 30 يومًا منذ أول دفعة ناجحة
1,000,000,000 لمعظم النماذج
بالنسبة إلى نموذج له حد المستوى 1 البالغ 3,000,000 توكن، سيحتاج مثالنا البالغ 15 مليون توكن إدخال إلى خمس موجات منفصلة على الأقل. أما في المستوى 2 فيتسع لها في مهمة واحدة مع هامش وافر. والقفزة من المستوى 1 إلى المستوى 2 هي التي تغيّر طريقة تصميم خط المعالجة.
وقت الاستجابة وحالات المهام
ماذا تعني الـ 24 ساعة فعلًا
تسمي Google الـ 24 ساعة المدة المستهدفة لإنجاز المهمة، وتضيف أن النتائج تصل في معظم الحالات أسرع بكثير. تعامل مع ذلك كسقف تخطط حوله، لا كسرعة يمكنك الاعتماد عليها. فالمهام الصغيرة تعود غالبًا بسرعة، بينما تنتظر المهام الكبيرة توفر السعة.
الحد الصارم هو 48 ساعة: المهمة التي تظل معلّقة أو قيد التشغيل عند هذه النقطة تنتهي صلاحيتها. ويعني تقسيم عمل كبير إلى عدة مهام أن انتهاء الصلاحية أو الفشل يكلفك شريحة واحدة بدلًا من التشغيل كله.
فخ آخر: إرسال مهمة دفعة ليس idempotent. إذا انتهت مهلة السكربت بعد استدعاء الإنشاء وأعدت المحاولة، فستنشئ مهمة ثانية وتدفع ثمن الاثنتين. احفظ اسم المهمة من الاستجابة الأولى قبل أن تفعل أي شيء آخر.
إيقاع عملي هو التشغيل الليلي. أرسل المهمة في نهاية يوم العمل، ودعها تمضي الليل، واقرأ النتائج مع قهوة الصباح. وإذا بقيت المهمة معلّقة بعد يوم كامل، فلا تنتظر انتهاء الصلاحية بعد 48 ساعة لتعرف ما حدث: تحقق من حالتها، وانظر إلى إجمالي التوكنات في الطابور لذلك النموذج، وفكّر في إلغائها وإعادة إرسالها على شرائح أصغر.
حالات المهام التي يجب مراقبتها
مثل دورة الخَبز، تمر المهمة بمراحل، ولا تجمع المخرجات إلا في النهاية.
الحالة
معناها
JOB_STATE_PENDING
في الطابور ولم تبدأ بعد
JOB_STATE_RUNNING
يجري معالجة الطلبات
JOB_STATE_SUCCEEDED
النتائج جاهزة للقراءة
JOB_STATE_FAILED
فشلت المهمة، راجع حقل الخطأ
JOB_STATE_CANCELLED
أُلغيت المهمة
JOB_STATE_EXPIRED
تجاوزت المهمة نافذة الـ 48 ساعة
يستطلع كود Google النموذجي الحالة كل 30 ثانية. أما المهام التي يُتوقع أن تعمل لساعات، فتوفر فترة أبطأ استدعاءات لا فائدة منها.
أرسل مهمة دفعة باستخدام Python
الطلبات المضمّنة
مع SDK الخاصة بـ google-genai، تأخذ المهمة المضمّنة قائمة من الطلبات، واسم نموذج، واسم عرض اختياريًا:
from google import genai
client = genai.Client()
inline_requests = [
{"contents": [{"parts": [{"text": "Tell me a one-sentence joke."}], "role": "user"}]},
{"contents": [{"parts": [{"text": "Why is the sky blue?"}], "role": "user"}]},
]
job = client.batches.create(
model="gemini-3.8-flash",
src=inline_requests,
config={"display_name": "inlined-requests-job-1"},
)
print(job.name)
بالنسبة إلى مهمة ملف، ارفع JSONL باستخدام client.files.upload، مع mime_type='jsonl'، ثم مرّر uploaded_file.name بوصفه src.
الاستطلاع وقراءة النتائج
import time
finished_states = {
"JOB_STATE_SUCCEEDED",
"JOB_STATE_FAILED",
"JOB_STATE_CANCELLED",
"JOB_STATE_EXPIRED",
}
job = client.batches.get(name=job.name)
while job.state.name not in finished_states:
time.sleep(30)
job = client.batches.get(name=job.name)
if job.state.name == "JOB_STATE_SUCCEEDED":
for i, item in enumerate(job.dest.inlined_responses):
if item.response:
print(i, item.response.text)
elif item.error:
print(i, item.error)
تعيد مهام الملفات بدلًا من ذلك ملف نتائج: اقرأ job.dest.file_name واجلب الملف باستخدام client.files.download.
اختبر الأوامر قبل التجميع في دفعة
مهمة الدفعة تغذية راجعة بطيئة. الأمر السيئ يكلفك نافذة انتظار كاملة وفاتورة كاملة. اختبر الأمر تفاعليًا أولًا، على اثنتي عشرة عينة متنوعة، ثم ضع الآلاف في الطابور بعد ذلك فقط.
استخدم Gemini 3.5 Flash على PicassoIA
يشغّل Gemini 3.5 Flash على PicassoIA الأوامر المفردة في متصفحك، ما يجعله منصة اختبار سريعة. لكنه لا يرسل مهام Batch API، فهذه ما زالت تمر عبر SDK من Google. هذا هو الروتين:
افتح صفحة النموذج وابحث عن حقل Prompt.
الصق الأمر الدقيق الذي تنوي إرساله في الدفعة، بما في ذلك أي أمثلة.
أضف تعليمات نظام تحدد الدور وصيغة المخرجات، مثل "أعد كائن JSON واحدًا لكل منتج".
اختر مستوى التفكير: بلا، أو منخفض، أو مرتفع. المستويات الأعلى تكلّف توكنات إخراج أكثر في دفعتك الفعلية، لذا استخدم الأدنى الذي ينجح.
اخفض درجة الحرارة في الاستخلاص أو التصنيف. القيمة الافتراضية هي 1 على مقياس من 0 إلى 2.
أرفق الوسائط إذا احتاجتها المهمة. يقبل النموذج حتى 10 صور بحجم 7 ميغابايت لكل منها، وصوتًا حتى 8.4 ساعة، وفيديو حتى 45 دقيقة.
شغّل عشر عينات متنوعة واقرأ كل إجابة. عدّل الأمر، ثم شغّلها مرة أخرى.
انسخ الأمر النهائي وتعليمات النظام إلى طلبات الدفعة.
حد الإخراج الافتراضي هو 65,535 توكنًا، لذا اضبط سقفًا أقل للمهام القصيرة. في الدفعة، كل توكن غير مستخدم ترفض توليده هو مال تحتفظ به.
تريد رأيًا ثانيًا في الجودة؟ يوجد Gemini 3.1 Pro، وGemini 3 Flash، وGemini 2.5 Flash ضمن مجموعة نماذج اللغة الكبيرة نفسها، لذا يمكنك تشغيل أمر واحد عليها جميعًا قبل أن تختار النموذج الذي سيدخل المهمة.
أنفق أقل، ثم أنشئ الصور
ثلاث طرق لتخفيض الفاتورة
خزّن الجزء المشترك مؤقتًا. يعمل التخزين المؤقت للسياق داخل مهام الدفعات بأسعار التخزين المؤقت القياسية، لذا لا ينبغي أن يُدفع ثمن تعليمات نظام طويلة مكررة عبر 10,000 طلب عشرة آلاف مرة.
اختر أصغر نموذج يحقق النتيجة. يكلّف إدخال Gemini 3.5 Flash-Lite 0.15 دولار لكل مليون توكن مقابل 0.75 دولار لنموذج Gemini 3.5 Flash، أي أقل بخمسة أضعاف، وسعر إخراجه البالغ 1.25 دولار يساوي نحو 28% من 4.50 دولارات.
ضع سقفًا للمخرجات. الإجابات القصيرة، ومستوى التفكير المنخفض، وحد إخراج محكم، كلها تقلص العمود الأغلى في فاتورتك.
تجنّب Batch تمامًا عندما ينتظر شخص النتيجة، أو عندما تغذي النتائج شاشة مباشرة، أو عندما تكون المهمة صغيرة إلى حد أن كلفة الاستطلاع تفوق الخصم.
العادة نفسها، أي الاختبار الرخيص قبل الإنفاق الكبير، تنطبق على المرئيات. إذا كانت مهمة الدفعة تغذي مدونة أو كتالوجًا أو تطبيقًا، فغالبًا ستحتاج إلى صور ترافق النص. افتح Nano Banana 2 على PicassoIA وولّد الصور دون عداد نقاط يعمل، أو جرّب Seedream 5 Pro أو FLUX 2 Pro للحصول على مظهر مختلف، وكرر حتى تصل إلى النتيجة الصحيحة. تصفح كل الخيارات على picassoia.com/en/all-models وأنشئ أول صورة لك اليوم.