Hugging Face Inference API फ़्री टियर: सीमाएँ और प्राइसिंग

मुफ़्त Hugging Face अकाउंट अब मासिक इनफ़रेंस क्रेडिट की सूची नहीं दिखाते, PRO $9 प्रति माह में $2.00 जोड़ता है, और Hub 5-मिनट की विंडो में ट्रैफ़िक को थ्रॉटल करता है। क्रेडिट, रेट लिमिट, बिलिंग नियमों और डेडिकेटेड एंडपॉइंट की लागत के असली आँकड़े देखें।

Hugging Face Inference API फ़्री टियर: सीमाएँ और प्राइसिंग
Cristian Da Conceicao
Picasso IA के संस्थापक

अगर आपने सर्च बार में Hugging Face Inference API free tier limits and pricing टाइप किया है, तो शायद आप मुफ़्त कॉल्स की एक साफ़ मासिक सीमा की उम्मीद कर रहे थे। अक्टूबर 2026 की स्थिति इससे ज़्यादा जटिल है, और कई फ़ोरम थ्रेड्स व पुराने ट्यूटोरियल अब पुराने हो चुके हैं। पुराना सर्वरलेस Inference API Inference Providers में मिला दिया गया है, और क्रेडिट, बिलिंग और थ्रॉटलिंग के नियम उसी के साथ बदल गए हैं।

इस लेख में बताया गया है कि मुफ़्त अकाउंट आज क्या कर सकता है, PRO सब्सक्रिप्शन क्या जोड़ता है, रेट लिमिट कैसे व्यवहार करती हैं, और प्लेग्राउंड से बाहर निकलने पर असली लागत कहाँ से शुरू होती है। हर आँकड़ा लिखे जाने के समय की आधिकारिक प्राइसिंग, रेट लिमिट और Inference Endpoints पेजों से लिया गया है, इसलिए बजट तय करने से पहले अपने अकाउंट का बिलिंग पेज ज़रूर खोलें।

फ़्री टियर आपको क्या देता है

नोटबुक की फ़्लैट ले शॉट जिसमें हाथ से लिखे पेंसिल के हिसाब, एक कैलकुलेटर और लैपटॉप के बगल में ब्लैक कॉफ़ी है

छोटी बात यह है कि मुफ़्त अकाउंट किसी विचार को आज़माने का तरीका है, प्रोडक्शन के लिए कोई भत्ता नहीं। आपको एक अकाउंट, एक एक्सेस टोकन, Hub, प्लेग्राउंड, और असली ट्रैफ़िक चलाने के लिए क्रेडिट ख़रीदने का विकल्प मिलता है। मौजूदा प्राइसिंग पेज के अनुसार, जो आपको नहीं मिलता वह है शामिल मासिक इनफ़रेंस क्रेडिट का कोई बकेट।

फ़्री अकाउंट्स के लिए क्रेडिट

लिखे जाने के समय, आधिकारिक प्राइसिंग पेज फ़्री यूज़र्स के लिए कोई शामिल मासिक क्रेडिट नहीं दिखाता। फ़्री अकाउंट फिर भी Inference Providers को कॉल कर सकते हैं, लेकिन केवल क्रेडिट ख़रीदने के बाद। कई थर्ड-पार्टी सारांश अब भी फ़्री अकाउंट्स के लिए प्रति माह $0.10 बताते हैं, इसलिए यह आँकड़ा वेब पर बार-बार दिखेगा। अगर आपका अपना बिलिंग पेज कोई सीमा दिखाता है, तो उस पर भरोसा करें। अगर वह कुछ नहीं दिखाता, तो आपके लिए वह सीमा खत्म हो चुकी है।

PRO कहाँ आता है

PRO की कीमत प्रति माह $9 है और इसमें $2.00 के मासिक क्रेडिट शामिल हैं। ये सामान्य-उद्देश्य वाले कंप्यूट क्रेडिट हैं, इसलिए ये Inference Endpoints, Spaces के लिए अपग्रेड किए गए CPU और GPU हार्डवेयर (जिसमें आपके कोटा से ज़्यादा ZeroGPU उपयोग भी शामिल है) और Jobs का भुगतान भी करते हैं। ये हर महीने जमा होते हैं और किसी भी पे-एज़-यू-गो उपयोग के बिल होने से पहले अपने-आप लागू हो जाते हैं।

टीम और एंटरप्राइज़ सीट्स

Team और Enterprise संगठनों को प्रति सीट $2.00 मिलते हैं, जो सभी सदस्यों के बीच साझा होते हैं। इस पूल को खर्च करने के लिए आपको हर रिक्वेस्ट पर संगठन का नाम देना होगा, या तो X-HF-Bill-To हेडर से या Python क्लाइंट के bill_to पैरामीटर से। एडमिन स्पेंडिंग लिमिट भी सेट कर सकते हैं और खास प्रोवाइडर बंद कर सकते हैं।

अकाउंट प्रकारशामिल मासिक क्रेडिटअतिरिक्त उपयोग
Freeकोई नहींहाँ, क्रेडिट ख़रीदने के बाद
PRO ($9 प्रति माह)$2.00हाँ, पे एज़ यू गो
Team या Enterpriseप्रति सीट $2.00हाँ, पे एज़ यू गो

💡 टिप: क्रेडिट केवल उन रिक्वेस्ट पर लागू होते हैं जो Hugging Face के ज़रिए रूट होती हैं। अगर आप अपना प्रोवाइडर अकाउंट जोड़ते हैं, तो वह प्रोवाइडर सीधे बिल करता है और आपके शामिल क्रेडिट इस्तेमाल नहीं होते।

बिलिंग पर्दे के पीछे कैसे काम करती है

डेटा सेंटर के गलियारे में नीचे से देखा गया दृश्य, जिसमें ऊपर साफ़ केबल बंडलों के साथ काले सर्वर रैक की पंक्तियाँ हैं

Hugging Face कहता है कि वह प्रोवाइडर की कीमतें बिना किसी मार्कअप के सीधे आगे भेजता है। जो बदलता है वह यह है कि इनवॉइस कौन भेजता है, और यह इस पर निर्भर करता है कि आप कॉल कैसे करते हैं।

रूटेड रिक्वेस्ट बनाम आपका अपना प्रोवाइडर

Hugging Face द्वारा रूटेडआपका अपना प्रोवाइडर अकाउंट
आपको कौन बिल करता हैHugging Faceप्रोवाइडर
शामिल क्रेडिट लागू होते हैंहाँनहीं
प्रोवाइडर अकाउंट चाहिएनहींहाँ
किसके लिए बेहतरसरलता और एक इनवॉइसबिलिंग पर नियंत्रण, वे प्रोवाइडर जो इंटीग्रेटेड नहीं हैं

रूटेड रिक्वेस्ट डिफ़ॉल्ट हैं। आप अपना Hugging Face टोकन राउटर को भेजते हैं, और राउटर कॉल को प्रोवाइडर तक पहुँचाता है। राउटर router.huggingface.co/v1 पर OpenAI-संगत फ़ॉर्मेट में काम करता है, इसलिए बेस URL और टोकन बदलने के बाद ज़्यादातर मौजूदा OpenAI क्लाइंट कोड चल जाता है।

hf-inference अलग क्यों दिखता है

hf-inference प्रोवाइडर पुराने "Inference API (serverless)" का सीधा उत्तराधिकारी है। शामिल क्रेडिट के बाद, आप कंप्यूट समय को अंतर्निहित हार्डवेयर की कीमत से गुणा करके भुगतान करते हैं। जुलाई 2025 तक यह ज़्यादातर CPU इनफ़रेंस पर केंद्रित है: एम्बेडिंग, टेक्स्ट रैंकिंग, टेक्स्ट क्लासिफ़िकेशन और BERT या GPT-2 जैसे ऐतिहासिक महत्व के छोटे मॉडल। बड़े चैट मॉडल और इमेज जनरेटर आम तौर पर इसके बजाय पार्टनर प्रोवाइडर सर्व करते हैं।

असली आँकड़ों के साथ लागत का उदाहरण

प्राइसिंग डॉक्स में एक हल किया हुआ उदाहरण है। FLUX.1-dev के लिए एक रिक्वेस्ट, जो GPU पर 10 सेकंड लेती है और जिसकी लागत $0.00012 प्रति सेकंड है, $0.0012 में बिल होती है। इस दर पर:

  • $2.00 का PRO क्रेडिट लगभग 1,666 इमेज का खर्च उठाता है।
  • $0.10 (वह भत्ता जिसका पुरानी पोस्ट ज़िक्र करती हैं) लगभग 83 इमेज का खर्च उठा लेता।

इसे एक उदाहरण मानें। असली कीमतें मॉडल और प्रोवाइडर के हिसाब से बदलती हैं, और आपकी अपनी रिक्वेस्ट 10 सेकंड से ज़्यादा समय ले सकती हैं। महीने में कुछ सौ टेस्ट इमेज उस क्रेडिट में आराम से आ जाती हैं, जबकि असली यूज़र्स की सेवा करने वाला पब्लिक ऐप उसे एक दोपहर में ख़त्म कर सकता है।

रेट लिमिट और 429 एरर

एक डेवलपर के हाथों का क्लोज़-अप, जो डेस्क पर टाइप कर रहे हैं, पीछे मॉनिटर पर धुंधला कोड है

बिलिंग से अलग, Hub रिक्वेस्ट को 5-मिनट की फ़िक्स्ड विंडो में थ्रॉटल करता है। नीचे दिए मान रेट लिमिट पेज की सितंबर 2025 की तालिका से लिए गए हैं, और डॉक्स बताते हैं कि अनाम और फ़्री संख्याएँ प्लेटफ़ॉर्म की स्थिति के आधार पर बदल सकती हैं।

तीन रिक्वेस्ट बकेट

Hugging Face ट्रैफ़िक को तीन बकेट में बाँटता है:

  • Hub APIs: मॉडल और डेटासेट सर्च, रेपो बनाना, यूज़र मैनेजमेंट।
  • Resolvers: /resolve/ वाले URL, जो लाइब्रेरी और ऐप्स को मॉडल और डेटासेट फ़ाइलें देते हैं।
  • Pages: huggingface.co के वेब पेज।
प्लानAPIResolversPages
अनाम (प्रति IP)5003,000100
Free1,0005,000200
PRO2,50012,000400
Team3,00020,000400
Enterprise6,00050,000600

सभी संख्याएँ प्रति 5 मिनट रिक्वेस्ट हैं। संगठनों के लिए, सीमाएँ समूह पर नहीं, बल्कि हर सदस्य पर अलग से लागू होती हैं। अलग-अलग इनफ़रेंस प्रोवाइडर इनके अलावा अपनी अतिरिक्त सीमाएँ भी जोड़ सकते हैं, इसलिए यह तय करने से पहले कि किस लेयर ने मना किया, एरर बॉडी ज़रूर पढ़ें।

RateLimit हेडर पढ़ना

हर थ्रॉटल की गई कॉल 429 Too Many Requests लौटाती है। रिस्पॉन्स IETF के रेट लिमिट हेडर ड्राफ़्ट का पालन करते हैं: RateLimit बताता है कि कितनी रिक्वेस्ट बाकी हैं और रीसेट तक कितने सेकंड बचे हैं, जबकि RateLimit-Policy विंडो बताता है, जैसे 5 मिनट में 100 रिक्वेस्ट। आपका बिलिंग पेज तीन लाइव गेज भी दिखाता है, हर बकेट के लिए एक, जो सीमा पार करने पर लाल हो जाते हैं।

सबसे आम उपाय लगभग उबाऊ है: हर जगह अपना HF_TOKEN भेजें। अनाम ट्रैफ़िक सबसे निचली सीमाओं पर रहता है, और जो लाइब्रेरी टोकन आगे भेजना भूल जाती है, वह उन सीमाओं को तेज़ी से ख़त्म कर देगी।

एक रिट्राई पैटर्न जो काम करता है

संस्करण 1.2.0 से, huggingface_hub लाइब्रेरी 429 पर RateLimit हेडर पढ़ती है और रिट्राई से पहले ठीक उतनी देर इंतज़ार करती है, फ़ाइल डाउनलोड और पेजिनेटेड Hub API कॉल्स के लिए। अपनी इनफ़रेंस कॉल्स के लिए एक छोटा बैकऑफ़ रैपर काफ़ी है:

import os
import time
from huggingface_hub import InferenceClient

client = InferenceClient(token=os.environ["HF_TOKEN"])

def ask(prompt, retries=4):
    for attempt in range(retries):
        try:
            reply = client.chat.completions.create(
                model="deepseek-ai/DeepSeek-V3-0324",
                messages=[{"role": "user", "content": prompt}],
                max_tokens=200,
            )
            return reply.choices[0].message.content
        except Exception as err:
            if "429" not in str(err):
                raise
            time.sleep(2 ** attempt)
    raise RuntimeError("Still rate limited after retries")

काम को लंबी अवधि में फैलाएँ, जहाँ संभव हो Hub API कॉल्स की जगह Resolver URL चुनें, और अपग्रेड तभी करें जब गेज साबित करें कि आपको इसकी ज़रूरत है।

साझा क्षमता पर स्पीड

लकड़ी की मेज़ के ऊपर ब्रश्ड स्टील का स्टॉपवॉच पकड़े हुए हाथ का टाइट क्लोज़-अप

फ़्री और कम लागत वाला ट्रैफ़िक आम तौर पर बाकी सभी के साथ क्षमता साझा करता है, और यह रिस्पॉन्स टाइम में दिखता है। मैंने जिन प्राइसिंग पेजों को देखा, उनमें कोई लेटेंसी गारंटी प्रकाशित नहीं है, इसलिए अपना खुद मापें।

  • दस रिक्वेस्ट अलग-अलग समय पर चलाएँ और मीडियन व सबसे धीमी कॉल दर्ज करें।
  • जब छोटा जवाब काफ़ी हो तब छोटा मॉडल चुनें। कम कंप्यूट का मतलब छोटा बिल और तेज़ जवाब।
  • max_tokens सीमित करें, ताकि कोई बातूनी मॉडल एक लाइन के सवाल पर 30 सेकंड तक न चलता रहे।
  • बार-बार आने वाले प्रॉम्प्ट अपने डेटाबेस में कैश करें, ताकि दोबारा भुगतान न करना पड़े।
  • बल्क जॉब्स ऑफ़-पीक समय पर चलाएँ और इंतज़ार को एक queue में संभालने दें।

एक प्रोटोटाइप धीमा पहला जवाब बर्दाश्त कर सकता है। चेकआउट फ़्लो उसे बर्दाश्त नहीं कर सकता, और ज़्यादातर तभी लोग डेडिकेटेड हार्डवेयर देखना शुरू करते हैं। अपने टाइमिंग का एक छोटा लॉग स्प्रेडशीट में रखें, क्योंकि जब आपके पास बेसलाइन होती है, तब प्राइसिंग बदलाव या व्यस्त हफ़्ता पहचानना कहीं आसान होता है।

Inference Endpoints कब फ़ायदेमंद होते हैं

रैक-माउंटेड GPU सर्वर के खुले हिस्से के पास झुका हुआ टेक्नीशियन, जिसके हाथ में टॉर्च और टैबलेट है

Inference Endpoints आपको एक मॉडल के लिए एक डेडिकेटेड मशीन देते हैं। जब एंडपॉइंट चल रहा हो या इनिशियलाइज़ हो रहा हो, तब बिलिंग प्रति मिनट होती है। पॉज़ किए गए एंडपॉइंट का कोई खर्च नहीं होता, जबकि शून्य तक स्केल किए गए एंडपॉइंट अब भी आपके कोटा में गिने जाते हैं, इसलिए अगर आपको स्लॉट वापस चाहिए तो उन्हें पॉज़ करें।

हार्डवेयर के अनुसार प्रति घंटा दरें

ये Inference Endpoints पेज की AWS कीमतें हैं:

हार्डवेयरमेमोरीप्रति घंटा दर
CPU x1 (1 vCPU)2 GB$0.033
CPU x4 (4 vCPUs)8 GB$0.134
GPU T4 x114 GB$0.50
GPU L4 x124 GB$0.80
GPU A10G x124 GB$1.00
GPU A100 x180 GB$2.50
GPU H200 x1141 GB$5.00

GCP भी 80 GB वाला H100 $10.00 प्रति घंटा पर सूचीबद्ध करता है।

एक महीने की असली लागत

दर को घंटों से गुणा करें। 730 घंटे तक चालू रहने वाले एंडपॉइंट की लागत सबसे छोटे CPU पर लगभग $24, T4 पर $365, A10G पर $730 और A100 पर $1,825 है। अगर आप इसे 22 कार्यदिवसों पर रोज़ 8 घंटे चलाते हैं (176 घंटे), तो T4 लगभग $88 और A10G लगभग $176 पर आ जाता है।

💡 असलियत की जाँच: PRO का $2.00 मासिक क्रेडिट लगभग चार घंटे के T4 एंडपॉइंट के बराबर है। यह प्रयोगों के लिए एक ट्रायल बजट है, होस्टिंग प्लान नहीं।

सही प्लान चुनना

सोलो डेवलपर और हॉबिस्ट

छोटे मॉडल और प्लेग्राउंड से प्रोटोटाइप करते समय फ़्री अकाउंट पर रहें। जब असली ट्रैफ़िक चाहिए तब कुछ डॉलर के क्रेडिट ख़रीदें, और एक निजी स्पेंडिंग कैप सेट करें जिसके साथ आप सहज हों। PRO अपनी $9 की कीमत तब वसूल करता है जब आपको ऊँची Hub सीमाएँ (विंडो में 1,000 के मुकाबले 2,500 API रिक्वेस्ट), $2.00 का कंप्यूट क्रेडिट और तेज़ सपोर्ट रिस्पॉन्स भी चाहिए।

छोटी टीमें और स्टार्टअप

एक चमकदार को-वर्किंग स्पेस में लंबी ओक की मेज़ के चारों ओर इकट्ठा चार साथी, जो लैपटॉप देख रहे हैं

Team प्लान प्रति सीट $2.00 को साझा करते हैं और X-HF-Bill-To हेडर के ज़रिए केंद्रीकृत बिलिंग की अनुमति देते हैं, इसलिए एक इनवॉइस सबके टोकन का भुगतान करता है। पहले ही दिन स्पेंडिंग लिमिट सेट करें और जो प्रोवाइडर आप इस्तेमाल नहीं करते उन्हें बंद करें। Enterprise में एक एंडपॉइंट जुड़ता है जो उपयोग को रोज़ाना सीरीज़ के रूप में खींचता है, जो सदस्य, मॉडल और प्रोवाइडर के अनुसार बँटी होती है, और रिक्वेस्ट बनाने के 2 घंटे बाद तक दिखाई दे सकती हैं।

छात्र और शोधकर्ता

लैपटॉप, पाठ्यपुस्तकों और हाइलाइटर के साथ लंबी लकड़ी की लाइब्रेरी मेज़ पर बैठा छात्र, साइड प्रोफ़ाइल में

अकादमिक बजट तंग होते हैं, इसलिए अपने टूल्स मिलाकर इस्तेमाल करें। डाउनलोड के लिए Hub चलाएँ, जहाँ फ़्री यूज़र्स को 5 मिनट में 5,000 Resolver रिक्वेस्ट के सबसे ऊँचे बकेट मिलते हैं, छोटे प्रयोग लोकल हार्डवेयर पर करें, और क्रेडिट केवल अंतिम मूल्यांकन रन के लिए ख़रीदें। Academia Hub संगठनों को 3,000 API, 20,000 Resolver और 400 पेज रिक्वेस्ट की Team-स्तर की सीमाएँ मिलती हैं।

खर्च पर नज़र रखें, इससे पहले कि वह आपको चौंका दे। Inference Providers सेटिंग्स पेज मॉडल और प्रोवाइडर के अनुसार पिछले महीने का उपयोग दिखाता है, जबकि बिलिंग पेज क्रेडिट और रेट लिमिट गेज दिखाता है। हफ़्ते में एक बार दोनों जाँचें।

कैफ़े की मेज़ पर फ़्लैट व्हाइट के बगल में बैठे आदमी का कंधे के ऊपर से दृश्य, जो लैपटॉप पर धुंधला बार चार्ट देख रहा है

वही मॉडल PicassoIA पर चलाएँ

स्टूडियो में शाम के समय बड़े प्रिंटेड पहाड़ी झील के लैंडस्केप देखते फ़ोटोग्राफ़र

अगर आपका लक्ष्य टोकन, क्रेडिट और 429 एरर से जूझे बिना ओपन-वेट मॉडल इस्तेमाल करना है, तो PicassoIA उनमें से कई को ब्राउज़र में होस्ट करता है। लार्ज लैंग्वेज मॉडल कैटेगरी में GPT OSS 120B, Llama 4 Scout Instruct, Qwen3 235B A22B Instruct 2507, DeepSeek v3.1, Kimi K2.6 और छोटा Granite 4.1 8B शामिल हैं।

PicassoIA पर GPT OSS कैसे इस्तेमाल करें

GPT OSS 120B एक 120-बिलियन-पैरामीटर ओपन-वेट मॉडल है, जो लेखन, सारांश, Q&A और कोड के लिए है। नीचे की सेटिंग्स वही हैं जो उसका पेज दिखाता है:

  1. GPT OSS 120B पेज खोलें और Prompt फ़ील्ड ढूँढें।
  2. एक साफ़-साफ़ निर्देश लिखें। वह फ़ॉर्मेट, ऑडियंस और लंबाई बताएँ जो आपको चाहिए।
  3. तथ्यात्मक, केंद्रित जवाबों के लिए Temperature को डिफ़ॉल्ट 0.1 पर रखें, और ज़्यादा विविध शब्दों के लिए बढ़ाएँ।
  4. Max Tokens को डिफ़ॉल्ट आउटपुट सीमा 2048 पर छोड़ें, या छोटे जवाबों के लिए घटाएँ।
  5. Top P, Presence Penalty और Frequency Penalty को तभी छुएँ जब लंबा जवाब लूप करने लगे या फीका लगे।
  6. मॉडल चलाएँ, नतीजा पढ़ें, फिर प्रॉम्प्ट को और कसें और दोबारा चलाएँ।
सेटिंगडिफ़ॉल्टक्या बदलती है
Temperature0.1केंद्रित बनाम विविध शब्दावली
Top P1मॉडल शब्दावली को कितनी व्यापकता से सैंपल करता है
Max Tokens2048जवाब की लंबाई की सीमा
Presence Penalty0मॉडल को नए विषयों की ओर धकेलता है
Frequency Penalty0दोहराए गए शब्दों और वाक्यांशों को घटाता है

💡 टिप: लैंग्वेज मॉडल से अपने इमेज प्रॉम्प्ट लिखवाएँ, फिर उन्हें टेक्स्ट-टू-इमेज मॉडल में पेस्ट करें। एक ब्राउज़र टैब ड्राफ़्ट और तस्वीर दोनों संभाल लेता है।

वही अकाउंट इमेज और वीडियो कैटेगरी तक भी पहुँचता है। स्टिल इमेज के लिए FLUX 2 Pro, Seedream 4.5, Imagen 4 Fast, P-Image या FLUX Dev आज़माएँ, वही परिवार जो ऊपर प्राइसिंग उदाहरण में इस्तेमाल हुआ। मोशन के लिए Wan 2.6 T2V, Veo 3.1 Fast और Seedance 2.0 टेक्स्ट प्रॉम्प्ट को क्लिप में बदलते हैं, और PicassoIA Video टेक्स्ट या इमेज से मुफ़्त और असीमित जनरेटर के रूप में सूचीबद्ध है।

आज ही अपनी इमेज बनाएँ

प्राइसिंग टेबल पढ़ना उपयोगी है, लेकिन प्रॉम्प्ट चलाकर देखना कि क्या वापस आता है, इससे बेहतर कुछ नहीं। PicassoIA खोलें, किसी प्रोडक्ट शॉट, लैंडस्केप या पोर्ट्रेट के लिए एक छोटा ब्रीफ़ लिखें, और टेक्स्ट-टू-इमेज मॉडल को उसे रेंडर करने दें। फिर GPT OSS 120B से अपने प्रॉम्प्ट को तीन अलग मूड में दोबारा लिखवाएँ और नतीजों की साथ-साथ तुलना करें।

शुरू करने के लिए आपको टोकन, क्रेडिट बैलेंस या रिट्राई लूप की ज़रूरत नहीं है। पूरी कैटलॉग से कोई मॉडल चुनें, कुछ प्रॉम्प्ट आज़माएँ, और जो आपको चौंकाएँ उन्हें रखें। आपकी पहली इमेज बस कुछ मिनट दूर है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख