الطبقة المجانية في Hugging Face Inference API: الحدود والتسعير

لم تعد حسابات Hugging Face المجانية تذكر أرصدة شهرية مشمولة للاستدلال، وتضيف خطة PRO رصيدًا بقيمة 2.00 دولار مقابل 9 دولارات شهريًا، وتقيّد Hub حركة المرور في نوافذ مدتها 5 دقائق. اطّلع على الأرقام الفعلية للأرصدة وحدود المعدل وقواعد الفوترة وتكلفة نقاط النهاية المخصصة.

الطبقة المجانية في Hugging Face Inference API: الحدود والتسعير
Cristian Da Conceicao
مؤسس Picasso IA

إذا كتبت Hugging Face Inference API free tier limits and pricing في شريط البحث، فمن المرجح أنك كنت تأمل في حصة شهرية واضحة من الاستدعاءات المجانية. الصورة في أكتوبر 2026 أكثر تعقيدًا، والكثير من منشورات المنتديات والدروس القديمة صار متجاوزًا. دُمجت واجهة Inference API القديمة بدون خادم ضمن Inference Providers، وانتقلت معها قواعد الأرصدة والفوترة والتقييد.

يعرض هذا المقال ما يمكن للحساب المجاني فعله اليوم، وما تضيفه اشتراكات PRO، وكيف تتصرف حدود المعدل، وأين تظهر التكاليف الفعلية عندما تتجاوز مرحلة التجربة. كل الأرقام مأخوذة من صفحات التسعير الرسمية وحدود المعدل وInference Endpoints كما كانت وقت الكتابة، لذا افتح صفحة الفوترة في حسابك قبل أن تخصص ميزانية.

ما الذي تمنحه الخطة المجانية

منظر علوي لدفتر عليه حسابات مكتوبة بقلم رصاص وآلة حاسبة وقهوة سوداء بجانب حاسوب محمول

الخلاصة المختصرة: الحساب المجاني وسيلة لتجربة فكرة، وليس حصة لبيئة الإنتاج. تحصل على حساب ورمز وصول (token) و Hub و Playground، وخيار شراء الأرصدة عندما تريد تشغيل حركة مرور فعلية. ما لا تحصل عليه، وفق صفحة التسعير الحالية، هو رصيد استدلال شهري مشمول.

الأرصدة للحسابات المجانية

وقت الكتابة، لا تذكر صفحة التسعير الرسمية أي أرصدة شهرية مشمولة للمستخدمين المجانيين. يمكن للحسابات المجانية استدعاء Inference Providers، لكن بعد شراء الأرصدة فقط. ما زالت ملخصات كثيرة من جهات خارجية تذكر 0.10 دولار شهريًا للحسابات المجانية، لذلك ستجد هذا الرقم متكررًا على الإنترنت. إذا أظهرت صفحة الفوترة في حسابك حصة، فثق بها. وإذا لم تظهر شيئًا، فالحصة غير متاحة لك.

أين تقع خطة PRO

تكلّف خطة PRO 9 دولارات شهريًا وتتضمن رصيدًا شهريًا بقيمة 2.00 دولار. هذه أرصدة حوسبة عامة الاستخدام، لذلك يمكن إنفاقها أيضًا على Inference Endpoints، وأجهزة CPU وGPU المرقّاة في Spaces (بما في ذلك استخدام ZeroGPU بعد تجاوز حصتك)، وJobs. تُضاف هذه الأرصدة كل شهر وتُطبّق تلقائيًا قبل أي استخدام يُفوتر حسب الاستهلاك.

مقاعد الفرق والمؤسسات

تحصل مؤسسات Team وEnterprise على 2.00 دولار لكل مقعد، تُشارك بين جميع الأعضاء. ولإنفاق هذا المجمع يجب تسمية المؤسسة في كل طلب، إما عبر الترويسة X-HF-Bill-To أو عبر المعامل bill_to في عميل Python. ويمكن للمسؤولين أيضًا ضبط حد للإنفاق وتعطيل مزودين محددين.

نوع الحسابالأرصدة الشهرية المشمولةالاستخدام الإضافي
مجانيلا يوجدنعم، بعد شراء الأرصدة
PRO (9 دولارات شهريًا)2.00 دولارنعم، الدفع حسب الاستخدام
Team أو Enterprise2.00 دولار لكل مقعدنعم، الدفع حسب الاستخدام

💡 نصيحة: تنطبق الأرصدة فقط على الطلبات الموجهة عبر Hugging Face. إذا ربطت حساب المزود الخاص بك، فإن ذلك المزود يفوترك مباشرة وتبقى أرصدتك المشمولة دون مساس.

كيف تعمل الفوترة خلف الكواليس

منظور من زاوية منخفضة لممر في مركز بيانات بين صفوف من خزائن الخوادم السوداء مع حزم كابلات مرتبة في الأعلى

تقول Hugging Face إنها تمرر أسعار المزودين مباشرة دون هامش ربح. ما يتغير هو الجهة التي تصدر الفاتورة، وهذا يعتمد على طريقة إجراء الاستدعاء.

الطلبات الموجهة مقابل مزودك الخاص

موجَّه عبر Hugging Faceحساب المزود الخاص بك
من يفوتركHugging Faceالمزود
تنطبق الأرصدة المشمولةنعملا
يلزم حساب مزودلانعم
الأنسب لـالبساطة وفاتورة واحدةالتحكم في الفوترة، ومزودون غير مدمجين

الطلبات الموجهة هي الخيار الافتراضي. ترسل رمز Hugging Face الخاص بك إلى الموجِّه (router)، فيمرر الموجِّه الاستدعاء إلى المزود. يتحدث الموجِّه صيغة متوافقة مع OpenAI عند router.huggingface.co/v1، لذلك يعمل معظم كود عميل OpenAI الحالي بعد تغيير عنوان الأساس (base URL) والرمز.

لماذا يبدو hf-inference مختلفًا

المزود hf-inference هو الخليفة المباشر لخدمة "Inference API (serverless)" القديمة. بعد تجاوز أرصدتك المشمولة، تدفع زمن الحوسبة مضروبًا في سعر الأجهزة الأساسية. ومنذ يوليو 2025 يركز بشكل أساسي على استدلال CPU: التضمينات (embeddings)، وترتيب النصوص، وتصنيف النصوص، والنماذج الصغيرة ذات الأهمية التاريخية مثل BERT أو GPT-2. أما نماذج الدردشة الكبيرة ومولّدات الصور فيخدمها عادة مزودون شركاء.

مثال تكلفة بأرقام فعلية

تتضمن وثائق التسعير مثالًا محسوبًا. طلب إلى FLUX.1-dev يستغرق 10 ثوانٍ على GPU تكلّف 0.00012 دولار في الثانية يُفوتر بمبلغ 0.0012 دولار. بهذا السعر:

  • 2.00 دولار من رصيد PRO يكفي لتوليد نحو 1,666 صورة.
  • 0.10 دولار (الحصة التي تذكرها المنشورات القديمة) كان سيكفي لتوليد نحو 83 صورة.

اعتبر هذا توضيحًا. تختلف الأسعار الفعلية حسب النموذج والمزود، وقد تستغرق طلباتك أكثر من 10 ثوانٍ. مئات قليلة من صور الاختبار شهريًا تتسع بسهولة داخل هذا الرصيد، بينما قد ينفد الرصيد في فترة ما بعد الظهر إذا كان تطبيق عام يخدم مستخدمين حقيقيين.

حدود المعدل وأخطاء 429

لقطة مقربة ليدَيْ مطوّر وهي تكتب على مكتب مع شيفرة غير واضحة على شاشة خلفها

بعيدًا عن الفوترة، يقيّد Hub الطلبات في نوافذ ثابتة مدتها 5 دقائق. القيم أدناه مأخوذة من جدول سبتمبر 2025 في صفحة حدود المعدل، وتشير الوثائق إلى أن أرقام المستخدمين المجهولين والمجانيين قابلة للتغيير حسب صحة المنصة.

فئات الطلبات الثلاث

تصنّف Hugging Face حركة المرور في ثلاث فئات:

  • واجهات Hub API: البحث عن النماذج ومجموعات البيانات، وإنشاء المستودعات، وإدارة المستخدمين.
  • المحلّلات (Resolvers): العناوين التي تحتوي على /resolve/، وتقدم ملفات النماذج ومجموعات البيانات للمكتبات والتطبيقات.
  • الصفحات: صفحات الويب على huggingface.co.
الخطةAPIResolversالصفحات
مجهول (لكل IP)5003,000100
مجاني1,0005,000200
PRO2,50012,000400
Team3,00020,000400
Enterprise6,00050,000600

كل الأرقام هي طلبات لكل 5 دقائق. بالنسبة للمؤسسات، تُطبّق الحدود على كل عضو بشكل فردي وليس على المجموعة. قد يضيف المزودون الفرديون حدودًا خاصة بهم فوق ذلك، لذا اقرأ نص الخطأ قبل أن تحدد أي طبقة رفضت الطلب.

قراءة ترويسات RateLimit

كل استدعاء مقيَّد يعيد 429 Too Many Requests. تتبع الاستجابات مسودة IETF الخاصة بترويسات حدود المعدل: تُظهر RateLimit عدد الطلبات المتبقية والثواني حتى إعادة الضبط، بينما تحدد RateLimit-Policy النافذة، مثلًا 100 طلب كل 5 دقائق. كما تعرض صفحة الفوترة لديك ثلاثة مؤشرات مباشرة، واحدًا لكل فئة، تتحول إلى اللون الأحمر عند تجاوز الحد.

الإصلاح الأكثر شيوعًا بسيط تقريبًا: مرّر HF_TOKEN في كل مكان. تبقى الحركة المجهولة عند أدنى الحدود، وأي مكتبة تنسى تمرير الرمز ستستنفد هذه الحدود بسرعة.

نمط إعادة المحاولة الذي ينجح

من الإصدار 1.2.0، تقرأ مكتبة huggingface_hub الترويسة RateLimit عند ورود 429 وتنتظر المدة المحددة بالضبط قبل إعادة المحاولة، وذلك لتنزيلات الملفات واستدعاءات Hub API المقسّمة إلى صفحات. أما استدعاءات الاستدلال الخاصة بك فيكفيها غلاف صغير للتأخير التراجعي (backoff):

import os
import time
from huggingface_hub import InferenceClient

client = InferenceClient(token=os.environ["HF_TOKEN"])

def ask(prompt, retries=4):
    for attempt in range(retries):
        try:
            reply = client.chat.completions.create(
                model="deepseek-ai/DeepSeek-V3-0324",
                messages=[{"role": "user", "content": prompt}],
                max_tokens=200,
            )
            return reply.choices[0].message.content
        except Exception as err:
            if "429" not in str(err):
                raise
            time.sleep(2 ** attempt)
    raise RuntimeError("Still rate limited after retries")

وزّع المهام على فترات أطول، وفضّل عناوين Resolver على استدعاءات Hub API حيثما أمكن، ولا ترقِّ خطتك إلا عندما تثبت المؤشرات أنك تحتاج إلى ذلك.

السرعة على السعة المشتركة

لقطة مقربة شديدة ليد تمسك ساعة توقيت من الفولاذ المصقول فوق مكتب خشبي

تشارك الحركة المجانية ومنخفضة التكلفة عادة السعة مع الجميع، وينعكس ذلك على زمن الاستجابة. لا تنشر صفحات التسعير التي راجعتها أي ضمان لزمن الاستجابة، لذلك قِس الأمر بنفسك.

  • اختبر عشرة طلبات في أوقات مختلفة من اليوم، وسجّل الوسيط وأبطأ استجابة.
  • اختر نموذجًا أصغر عندما تكفي إجابة قصيرة. الحوسبة الأقل تعني فاتورة أصغر واستجابة أسرع.
  • حدّد max_tokens حتى لا يعمل نموذج ثرثار لمدة 30 ثانية على سؤال من سطر واحد.
  • خزّن الأوامر النصية المتكررة في قاعدة بياناتك بدلًا من الدفع مرتين.
  • شغّل المهام الكبيرة خارج أوقات الذروة ودع قائمة انتظار تستوعب الانتظار.

قد يتقبل النموذج الأولي استجابة أولى بطيئة. أما تدفق الدفع فلا يتقبلها، وعادة ما يكون هذا هو الوقت الذي يبدأ فيه الناس بالنظر إلى العتاد المخصص. احتفظ بسجل صغير لتوقيتاتك في جدول بيانات، لأن تغيير الأسعار أو أسبوعًا مزدحمًا يكونان أسهل في الرصد عندما تملك خط أساس للمقارنة.

متى تصبح Inference Endpoints مجدية

فني منحنٍ بجانب خادم GPU مفتوح مثبت في رف، يحمل مصباحًا يدويًا وجهاز لوحي

تمنحك Inference Endpoints جهازًا مخصصًا لنموذج واحد. تُفوتر بالدقيقة طالما كانت النقطة تعمل أو تُهيَّأ. النقاط المتوقفة مؤقتًا لا تكلف شيئًا، بينما النقاط المخفّضة إلى الصفر ما زالت تُحتسب من حصتك، لذا أوقفها مؤقتًا إذا كنت تحتاج إلى الفتحة من جديد.

الأسعار بالساعة حسب العتاد

هذه أسعار AWS من صفحة Inference Endpoints:

العتادالذاكرةالسعر بالساعة
CPU x1 (vCPU واحد)2 GB0.033 دولار
CPU x4 (4 vCPUs)8 GB0.134 دولار
GPU T4 x114 GB0.50 دولار
GPU L4 x124 GB0.80 دولار
GPU A10G x124 GB1.00 دولار
GPU A100 x180 GB2.50 دولار
GPU H200 x1141 GB5.00 دولار

تسرد GCP أيضًا H100 بذاكرة 80 GB بسعر 10.00 دولار في الساعة.

ما الذي تكلفه الشهر فعلًا

اضرب السعر في عدد الساعات. نقطة نهاية تبقى مفعّلة 730 ساعة تكلّف نحو 24 دولارًا على أصغر CPU، و365 دولارًا على T4، و730 دولارًا على A10G، و1,825 دولارًا على A100. وإذا شغّلتها 8 ساعات يوميًا على 22 يوم عمل (176 ساعة)، تنخفض التكلفة على T4 إلى نحو 88 دولارًا وعلى A10G إلى 176 دولارًا.

💡 نظرة واقعية: رصيد PRO الشهري البالغ 2.00 دولار يشتري نحو أربع ساعات من نقطة نهاية T4. إنه ميزانية تجريبية للتجارب، وليس خطة استضافة.

اختيار الخطة المناسبة

المطورون المستقلون والهواة

ابقَ على الحساب المجاني أثناء تطوير النماذج الأولية بنماذج صغيرة وPlayground. اشترِ بضعة دولارات من الأرصدة عندما تحتاج إلى حركة مرور حقيقية، واضبط حد إنفاق شخصيًا تشعر بالارتياح تجاهه. تبرّر خطة PRO سعرها البالغ 9 دولارات عندما تريد أيضًا حدود Hub الأعلى (2,500 طلب API لكل نافذة مقابل 1,000)، ورصيد الحوسبة بقيمة 2.00 دولار، واستجابات دعم أسرع.

الفرق الصغيرة والشركات الناشئة

أربعة زملاء مجتمعون حول طاولة طويلة من خشب البلوط في مساحة عمل مشتركة مشرقة ينظرون إلى حاسوب محمول

تجمع خطط الفرق مبلغ 2.00 دولار لكل مقعد وتتيح الفوترة المركزية عبر الترويسة X-HF-Bill-To، فتغطي فاتورة واحدة تكلفة توكنات الجميع. حدّد حد الإنفاق منذ اليوم الأول وعطّل المزوّدين الذين لا تستخدمهم. وتضيف خطة Enterprise نقطة وصول لسحب بيانات الاستخدام على شكل سلسلة يومية مقسّمة حسب العضو والنموذج والمزوّد، مع ظهور الطلبات بعد مرور ما يصل إلى 2 ساعة على إرسالها.

الطلاب والباحثون

طالب بوجه جانبي على طاولة مكتبة خشبية طويلة مع حاسوب محمول وكتب دراسية وقلم تمييز

الميزانيات الأكاديمية ضيقة، لذا امزج أدواتك. استخدم Hub للتنزيلات، حيث يحصل المستخدمون المجانيون على أعلى فئة بحد 5,000 طلب Resolver كل 5 دقائق، وشغّل التجارب الصغيرة على عتادك المحلي، واشترِ الأرصدة فقط لتشغيل التقييم النهائي. تحصل مؤسسات Academia Hub على حدود بمستوى Team: 3,000 طلب API و20,000 طلب Resolver و400 طلب صفحة.

تتبّع الإنفاق قبل أن يفاجئك. تعرض صفحة إعدادات Inference Providers استخدام الشهر الماضي حسب النموذج والمزود، بينما تعرض صفحة الفوترة الأرصدة ومؤشرات حدود المعدل. تحقق من الصفحتين مرة كل أسبوع.

منظر من فوق كتف رجل على طاولة مقهى يتابع مخططًا بيانيًا عموديًا غير واضح على حاسوب محمول بجانب قهوة بيضاء

شغّل النماذج نفسها على PicassoIA

مصوّر يفحص لوحات طبيعية كبيرة مطبوعة لبحيرات جبلية في استوديو عند الغسق

إذا كان هدفك استخدام نماذج مفتوحة الأوزان دون التعامل مع الرموز والأرصدة وأخطاء 429، فإن PicassoIA يستضيف الكثير منها داخل المتصفح. تضم فئة النماذج اللغوية الكبيرة GPT OSS 120B وLlama 4 Scout Instruct وQwen3 235B A22B Instruct 2507 وDeepSeek v3.1 وKimi K2.6 والنموذج المدمج Granite 4.1 8B.

كيفية استخدام GPT OSS على PicassoIA

GPT OSS 120B نموذج مفتوح الأوزان بحجم 120 مليار معامل للكتابة والملخصات والأسئلة والأجوبة والكود. الإعدادات أدناه هي التي تعرضها صفحته:

  1. افتح صفحة GPT OSS 120B وابحث عن حقل Prompt.
  2. اكتب تعليمة محددة. سمِّ الصيغة والجمهور والطول الذي تريده.
  3. أبقِ Temperature على قيمته الافتراضية 0.1 للحصول على إجابات مركزة وقائمة على الحقائق، وارفعها عندما تريد صياغة أكثر تنوعًا.
  4. اترك Max Tokens على 2048، وهو الحد الأقصى الافتراضي للمخرجات، أو خفّضه للردود القصيرة.
  5. عدّل Top P وPresence Penalty وFrequency Penalty فقط إذا بدأت الإجابة الطويلة تكرر نفسها أو تبدو باهتة.
  6. شغّل النموذج واقرأ النتيجة، ثم شدّد الأمر النصي وأعد تشغيله.
الإعدادالافتراضيما الذي يغيّره
Temperature0.1صياغة مركزة مقابل صياغة متنوعة
Top P1مدى اتساع أخذ النموذج للعينات من المفردات
Max Tokens2048الحد الأقصى لطول الإجابة
Presence Penalty0يدفع النموذج نحو موضوعات جديدة
Frequency Penalty0يقلل الكلمات والعبارات المتكررة

💡 نصيحة: استخدم النموذج اللغوي لكتابة أوامرك النصية للصور، ثم الصقها في نموذج تحويل النص إلى صورة. تتولى علامة تبويب واحدة في المتصفح المسودة والصورة معًا.

يصل الحساب نفسه أيضًا إلى فئتي الصور والفيديو. للصور الثابتة، جرّب FLUX 2 Pro وSeedream 4.5 وImagen 4 Fast وP-Image أو FLUX Dev، وهي العائلة نفسها المستخدمة في مثال التسعير أعلاه. للحركة، تحوّل Wan 2.6 T2V وVeo 3.1 Fast وSeedance 2.0 الأمر النصي إلى مقطع، أما PicassoIA Video فمدرج كمولّد مجاني وغير محدود لتحويل النص أو الصورة إلى فيديو.

أنشئ صورك الخاصة اليوم

قراءة جداول التسعير مفيدة، لكن لا شيء يضاهي تشغيل أمر نصي ومشاهدة النتيجة. افتح PicassoIA واكتب وصفًا قصيرًا لصورة منتج أو منظر طبيعي أو بورتريه، ودع نموذج تحويل النص إلى صورة يولّدها. ثم اطلب من GPT OSS 120B إعادة كتابة أمرك النصي بثلاث نبرات مختلفة، وقارن النتائج جنبًا إلى جنب.

لا تحتاج إلى رمز أو رصيد أو حلقة لإعادة المحاولة لتبدأ. اختر نموذجًا من الكتالوج الكامل، وجرّب بضعة أوامر نصية، واحتفظ بما يفاجئك. صورتك الأولى على بعد دقائق قليلة.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة