Open WebUI और SillyTavern में OpenRouter से इमेज बनाना: क्या सच में काम करता है

OpenRouter पर OpenAI, Google, ByteDance और Black Forest Labs के इमेज मॉडल मिलते हैं, लेकिन Open WebUI और SillyTavern उनसे अलग-अलग तरीके से जुड़ते हैं। यहाँ सही सेटिंग्स, Open WebUI के लिए गेटवे वाला तरीका, SillyTavern के सोर्स और प्रीफ़िक्स विकल्प, लागत के जाल और एरर की छोटी चेकलिस्ट देखें।

Open WebUI और SillyTavern में OpenRouter से इमेज बनाना: क्या सच में काम करता है
Cristian Da Conceicao
Picasso IA के संस्थापक

आप पहले से ही OpenRouter के ज़रिए चैट मॉडल के लिए भुगतान करते हैं, इसलिए इमेज रिक्वेस्ट भी उसी अकाउंट से भेजना आसान रास्ता लगता है। कोई दूसरी सदस्यता नहीं, कोई अतिरिक्त डैशबोर्ड नहीं, बस एक बैलेंस पर नज़र रखनी है। पेच यह है कि Open WebUI और SillyTavern OpenRouter तक बहुत अलग तरीकों से पहुँचते हैं। Open WebUI एक OpenAI-स्टाइल images रूट बोलता है, और मैंने जिन दस्तावेज़ों की जाँच की उनमें OpenRouter का नाम विकल्प के रूप में कहीं नहीं आता। SillyTavern OpenRouter को तैयार इमेज सोर्स के रूप में दिखाता है, पर सेटअप के बारे में बहुत कम बताता है। यह लेख दोनों रास्ते समझाता है, बताता है कि दस्तावेज़ कहाँ चुप हो जाते हैं, और उस पल के लिए एक छोटी चेकलिस्ट देता है जब रेंडर खाली लौटे।

OpenRouter इमेज के लिए क्या देता है

OpenRouter कई प्रोवाइडर्स के सामने बैठता है, और इसके कैटलॉग में अब Google, OpenAI, Black Forest Labs, xAI, ByteDance, Microsoft, Recraft, Krea और Sourceful के इमेज मॉडल शामिल हैं। हर लैब में अलग अकाउंट खोलने के बजाय आप एक क्रेडिट बैलेंस टॉप अप करते हैं, और एक ही स्ट्रिंग बदलकर मॉडल बदल लेते हैं।

लकड़ी की मेज़ पर बैठा डेवलपर, जिसके सामने दो मॉनिटर हैं जिन पर धुंधली चैट विंडो दिख रही हैं, शाम की गर्म रोशनी में

इमेज एंडपॉइंट कैसे काम करता है

OpenRouter के मौजूदा दस्तावेज़ एक समर्पित इमेज रूट बताते हैं। आप अपने बेयरर टोकन के साथ /api/v1/images पर POST रिक्वेस्ट भेजते हैं, और बॉडी में नीचे दिए फ़ील्ड होते हैं।

फ़ील्डयह क्या करता है
modelमॉडल स्लग, जैसे bytedance-seed/seedream-4.5
promptतस्वीर का टेक्स्ट विवरण
aspect_ratioएक नॉर्मलाइज़्ड रेशियो, या प्रोवाइडर को चुनने देने के लिए auto
resolution512 से 4K तक का एक टियर
sizeसाफ़ पिक्सल के लिए शॉर्टहैंड, जैसे 2048x2048
qualityauto, low, medium या high
output_formatpng, jpeg, webp या svg
nइमेज की संख्या, 1 से 10 तक
streamसर्वर-सेंट इवेंट्स के रूप में आंशिक प्रीव्यू भेजता है

जवाब में हर इमेज data ऐरे में b64_json के अंदर base64 टेक्स्ट के रूप में आती है, साथ में media_type जैसे image/png और टोकन गिनती व लागत वाला usage ब्लॉक। आपको कोई होस्टेड लिंक नहीं मिलता। OpenRouter और आपके फ्रंट एंड के बीच की किसी भी परत को वह टेक्स्ट डिकोड करना होता है या फ़ाइल के रूप में सेव करना होता है, और यही बात आगे के कई एरर समझाती है।

इमेज-टू-इमेज काम के लिए वही रूट input_references स्वीकार करता है, जो HTTP(S) पते या base64 डेटा URL हो सकते हैं।

💡 टिप: पुराने ट्यूटोरियल चैट रूट के ज़रिए इमेज आउटपुट को modalities पैरामीटर के साथ बताते हैं, जिसमें टेक्स्ट भी लिखने वाले मॉडल के लिए ["image", "text"] और सिर्फ़ इमेज देने वाले मॉडल के लिए ["image"] इस्तेमाल होता है। अगर कोई ट्यूटोरियल और मौजूदा दस्तावेज़ एक-दूसरे से अलग बात कहें, तो दस्तावेज़ और उस मॉडल के पेज पर भरोसा करें जिसे आप असल में कॉल कर रहे हैं।

आज़माने लायक मॉडल

पूरा कैटलॉग स्क्रॉल करने के बजाय छोटी शॉर्टलिस्ट से शुरू करें। नीचे दिए ID OpenRouter के दस्तावेज़ों या कम्युनिटी गेटवे उदाहरणों में दिखते हैं, और दाईं ओर का कॉलम उसी मॉडल फ़ैमिली की ओर इशारा करता है जो PicassoIA पर है, ताकि आप पहले प्रॉम्प्ट आज़मा सकें।

OpenRouter मॉडल IDमेकरPicassoIA पर वही फ़ैमिली
openai/gpt-image-2OpenAIGPT Image 2
bytedance-seed/seedream-4.5ByteDanceSeedream 4.5
black-forest-labs/flux.2-proBlack Forest LabsFLUX.2 Pro
google/gemini-2.5-flash-imageGoogleGemini 2.5 Flash Image

कैटलॉग अक्सर बदलता है। कोई भी ID कॉपी करने से पहले OpenRouter के models पेज पर इमेज आउटपुट से फ़िल्टर करें और स्लग को अक्षर-दर-अक्षर जाँच लें।

कुछ भी जोड़ने से पहले

दस मिनट की तैयारी उलझन भरी एरर की एक शाम बचाती है। दोनों फ्रंट एंड को दो चीज़ों की ज़रूरत है: एक ऐसा टोकन जिसे आप बेझिझक बदल सकें, और यह साफ़ अंदाज़ा कि एक रेंडर पर कितना खर्च होता है।

अलग टोकन बनाएँ

सिर्फ़ इमेज काम के लिए एक नया OpenRouter क्रेडेंशियल बनाएँ। अगर कोई फ्रंट एंड उसे लॉग करे, कोई रोलप्ले चैट लूप में फँस जाए, या गलती से आप उसे स्क्रीनशॉट में चिपका दें, तो आप एक टोकन रद्द करते हैं और आपका नियमित चैट सेटअप चलता रहता है। उसे फ्रंट एंड के नाम पर रखें, जैसे Open WebUI के लिए एक और SillyTavern के लिए एक, ताकि एक्टिविटी लॉग बता सके कि किस ऐप ने कितना खर्च किया।

लकड़ी की मेज़ पर लैपटॉप पर टाइप करते हाथ, पास में एक सादा पेपर कार्ड और एक USB सिक्योरिटी डिवाइस

क्रेडिट और बिलिंग जाँचें

OpenRouter बताता है कि इमेज बिलिंग में या तो पूरा चार्ज लगता है या कुछ नहीं। एक जनरेशन या तो पूरी होती है और पूरी बिल होती है, या विफल होती है और बिल नहीं होती। स्ट्रीम्ड रिक्वेस्ट के दौरान भेजे गए आंशिक प्रीव्यू इमेज से आंशिक चार्ज नहीं बनता। विफल कोशिशों के लिए यह अच्छी खबर है, लेकिन इसका मतलब यह भी है कि सफल रेंडर का लूप पूरी कीमत पर क्रेडिट खत्म कर देगा, इसलिए टेस्ट करते समय छोटा बैलेंस रखें।

Open WebUI सेटअप

Open WebUI दोनों में से कठिन है, और इसकी वजह आपका कॉन्फ़िगरेशन नहीं है। मामला इतना है कि दोनों तरफ़ कौन सा रिक्वेस्ट शेप अपेक्षित है।

सेटिंग्स कहाँ हैं

Admin Settings खोलें और Images सेक्शन ढूँढें। दस्तावेज़ रास्ता Settings, Admin, Experience, Images बताता है, और मेनू के नाम रिलीज़ के हिसाब से बदलते हैं, इसलिए अगर आपका अलग है तो "Images" खोजें। Image Generation Engine को Default (Open AI) पर सेट करें। आपको ये फ़ील्ड दिखेंगे:

  • API Base URL, वह पता जहाँ रिक्वेस्ट भेजी जाती हैं
  • API credential, जहाँ आपका टोकन जाता है
  • Model, ड्रॉपडाउन या टाइप किया हुआ नाम
  • Image Size, जो इंजन की अनुमति तक सीमित है

OpenAI इंजन के लिए दस्तावेज़ में दी गई साइज़ सूचियाँ ये हैं: DALL·E 2 के लिए 256x256, 512x512 और 1024x1024; फिर DALL·E 3 के लिए 1024x1024, 1792x1024 और 1024x1792; और GPT-Image मॉडलों के लिए auto, 1024x1024, 1536x1024 और 1024x1536।

रूट का मेल न खाना

यहीं सेटअप अटकते हैं। Open WebUI का OpenAI इंजन OpenAI-स्टाइल रिक्वेस्ट भेजता है, जिसमें prompt, model, n, size, quality जैसे फ़ील्ड और एक response format होता है। OpenRouter का दस्तावेज़ीकृत इमेज रूट उसका अपना /api/v1/images है, जिसमें aspect_ratio और resolution जैसे अलग फ़ील्ड हैं। Open WebUI के जिन पन्नों की मैंने जाँच की, वे OpenAI खुद, Azure OpenAI, एक LiteLLM प्रॉक्सी और एक Image Router शैली की सर्विस का वर्णन करते हैं। उनमें से किसी में OpenRouter का ज़िक्र नहीं है।

⚠️ चेतावनी: मैं पक्का नहीं कर सका कि OpenAI इंजन को सीधे OpenRouter की ओर इंगित करना हर रिलीज़ में काम करता है। सीधे रूट को प्रयोग मानें। एक टेस्ट इमेज भेजें, सटीक एरर पढ़ें, और उसके बाद ही तय करें कि आपको ट्रांसलेशन लेयर चाहिए या नहीं।

आपके पास तीन व्यावहारिक विकल्प हैं:

  1. सीधा रूट आज़माएँ। बेस URL के रूप में https://openrouter.ai/api/v1 डालें, अपना टोकन पेस्ट करें, मॉडल ID हाथ से टाइप करें, और एक इमेज बनाएँ।
  2. ट्रांसलेशन गेटवे चलाएँ। एक छोटी सर्विस OpenAI-स्टाइल इमेज रिक्वेस्ट स्वीकार करती है और उन्हें OpenRouter को भेजती है। अगला हिस्सा एक ऐसा उदाहरण दिखाता है।
  3. कोई दूसरा OpenAI-संगत इमेज राउटर इस्तेमाल करें। Open WebUI उन सर्विसों के लिए यह पैटर्न दस्तावेज़ करता है जो OpenAI सिंटैक्स की नकल करती हैं।

Docker में गेटवे का उपयोग

Docker Hub पर OpenRouter Image Gateway नाम का एक कम्युनिटी प्रोजेक्ट इसी कमी के लिए मौजूद है। उसके विवरण के अनुसार यह POST /v1/images/generations, GET /v1/models और GET /health एक्सपोज़ करता है। यह OpenAI-स्टाइल पैरामीटर (prompt, model, n, size, quality, response_format) स्वीकार करता है, आपका बेयरर टोकन OpenRouter को आगे भेजता है, पिक्सल साइज़ को OpenRouter के आस्पेक्ट रेशियो में बदलता है, और इमेज b64_json के रूप में या URL के रूप में लौटाता है।

गेटवे चालू होने पर Open WebUI के फ़ील्ड कुछ ऐसे दिखते हैं:

Image Generation Engine: Default (Open AI)
API Base URL:  http://openrouter-image-gateway:8000/v1
API credential: <your OpenRouter token>
Model:         google/gemini-2.5-flash-image

जब दोनों कंटेनर एक ही Docker नेटवर्क पर हों तो http://openrouter-image-gateway:8000/v1 इस्तेमाल करें, और उसी मशीन पर लोकल टेस्ट के लिए http://localhost:8000/v1।

⚠️ Heads up: यह तीसरे पक्ष का सॉफ़्टवेयर है, और यह आपका टोकन देखेगा। ऐसे क्रेडेंशियल पर भरोसा करने से पहले जिसके पीछे असली बैलेंस हो, इसका सोर्स पढ़ें या इसे अपनी मशीन पर चलाएँ। विवरण में सिर्फ़ टेक्स्ट-टू-इमेज का ज़िक्र है, इसलिए इसके ज़रिए इमेज एडिटिंग के काम करने की उम्मीद न रखें।

ऊपर से देखे गए दृश्य में, पाइन की शेल्फ़ पर राउटर और लिपटी हुई ईथरनेट केबल के बगल में रखा एक कॉम्पैक्ट मिनी PC

साइज़ और मॉडल चुनना

ड्रॉपडाउन के बजाय मॉडल का नाम खुद टाइप करें। Open WebUI के अपने Image Router निर्देश गैर-OpenAI प्रोवाइडर्स के लिए ठीक यही करने को कहते हैं, क्योंकि ड्रॉपडाउन में OpenAI के नाम होते हैं और उसमें google/gemini-2.5-flash-image कभी नहीं दिखेगा।

साइज़ के लिए, जिस शेप की आपको चाहत है उसके सबसे करीब लैंडस्केप विकल्प चुनें और आउटपुट जाँचें। जब बीच में गेटवे हो, तो वह आपके पिक्सल चुनाव को सबसे नज़दीकी आस्पेक्ट रेशियो में बदल देता है, इसलिए 1536x1024 रिक्वेस्ट के बदले साफ़ 3:2 इमेज आ सकती है, ठीक वे पिक्सल नहीं। चैट के लिए यह ठीक है, लेकिन सटीक डाइमेंशन पर वर्कफ़्लो बनाने से पहले जाँच लें।

SillyTavern सेटअप

SillyTavern उल्टा तरीका अपनाता है। इमेज जनरेशन एक बिल्ट-इन एक्सटेंशन है, और OpenRouter उसकी सोर्स सूची में एक प्रविष्टि है।

OpenRouter को सोर्स चुनें

आधिकारिक दस्तावेज़ OpenRouter को OpenAI, Black Forest Labs, FAL.AI, Google, x.AI, Stability AI और दूसरों के साथ एक क्लाउड सोर्स के रूप में सूचीबद्ध करता है। Extensions पैनल खोलें, Image Generation का विस्तार करें, सोर्स के रूप में OpenRouter चुनें, अपना टोकन डालें और एक इमेज मॉडल चुनें।

ध्यान रखें कि दस्तावेज़ में OpenRouter के लिए कोई समर्पित सेटअप सेक्शन नहीं है, जबकि Stability AI जैसे सोर्स के लिए ऐसा सेक्शन है। लेबल और फ़ील्ड का क्रम रिलीज़ के बीच अलग हो सकता है, इसलिए ऊपर के चरणों को स्क्रिप्ट नहीं, एक नक्शा मानें।

कोने वाले कैफ़े में लैपटॉप पर कहानी लिखता एक युवक, खिड़की पर बारिश हो रही है

जनरेशन मोड जो आप इस्तेमाल करेंगे

SillyTavern चैट से आपके लिए प्रॉम्प्ट बनाता है, और मोड तय करता है कि प्रॉम्प्ट किस चीज़ का वर्णन करेगा।

मोडस्लैश कमांडआपको क्या मिलता है
Yourselfyouमौजूदा कैरेक्टर का फ़ुल-बॉडी पोर्ट्रेट
Your Facefaceमौजूदा कैरेक्टर का क्लोज़-अप पोर्ट्रेट
Memeआपके यूज़र पर्सोना का पोर्ट्रेट
The Whole Storysceneचैट की घटनाओं का विज़ुअल रीकैप
The Last Messagelastआखिरी मैसेज का विज़ुअल रीकैप
Raw Last Messageraw_lastआखिरी मैसेज जैसा है वैसे ही प्रॉम्प्ट के रूप में भेजा गया
Backgroundbackgroundकहानी के संदर्भ से बना चैट बैकग्राउंड

इन तक तीन तरीकों से पहुँचा जा सकता है: वैंड मेनू में Image Generation आइटम, /sd कमांड जिसके बाद कोई मोड या आपका अपना फ़्री टेक्स्ट आता है, या किसी एक मैसेज पर पेंटब्रश आइकन, जो raw मोड के लिए है। कमांड नामित आर्गुमेंट भी स्वीकार करता है, जैसे negative="blurry, extra fingers"।

ओक की मेज़ के चारों ओर बैठे चार दोस्त, लैपटॉप और मिनिएचर के साथ टेबलटॉप रोल-प्लेइंग गेम खेलते हुए

scene और last मोड कहानी-प्रधान चैट के लिए अच्छे हैं, जहाँ एक तस्वीर बता सकती है कि मेज़ पर अभी-अभी क्या हुआ।

प्रीफ़िक्स जो कैरेक्टर को स्थिर रखते हैं

तीन टेक्स्ट बॉक्स तय करते हैं कि एक रेंडर से अगले रेंडर तक आपकी तस्वीरें कितनी स्थिर दिखती हैं:

  • Common Prompt Prefix हर प्रॉम्प्ट से पहले जुड़ता है और कुल स्टाइल तय करता है।
  • Character-Specific Prompt Prefix एक कैरेक्टर का रूप बताता है। यह सिर्फ़ वन-टू-वन चैट में काम करता है, ग्रुप में नहीं।
  • Negative Prompt बताता है कि आप क्या नहीं देखना चाहते।

एक काम करने वाली शुरुआती जोड़ी कुछ ऐसी है। Common prefix: candid 35mm photograph, natural window light, fine film grain। Character prefix: woman in her thirties, freckles, loose auburn braid, denim jacket। कैरेक्टर प्रीफ़िक्स छोटा और शारीरिक वर्णन वाला रखें, और स्टाइल प्रीफ़िक्स में रोशनी और लेंस से जुड़ी भाषा रखें।

💡 टिप: मैंने जिस OpenRouter फ़ील्ड लिस्ट की समीक्षा की, उसमें कोई नेगेटिव प्रॉम्प्ट फ़ील्ड नहीं है, इसलिए इस स्रोत पर वह बॉक्स कुछ नहीं कर सकता। इसके बजाय मुख्य प्रॉम्प्ट के अंदर वह सकारात्मक शब्दों में लिखें जो आप चाहते हैं।

ऊपर से देखी गई इलस्ट्रेटर की मेज़, जिस पर प्रिंट किए हुए पोर्ट्रेट, रंगीन पेंसिलें और एक स्केचबुक रखी हैं

दोनों में काम करने वाले प्रॉम्प्ट

आप जो भी फ्रंट एंड इस्तेमाल करें, दूसरी तरफ़ का मॉडल एक ही टेक्स्ट प्रॉम्प्ट पढ़ता है। थोड़ी संरचना दोनों ऐप में नतीजे बेहतर करती है।

फ़ोटोग्राफ़िक प्रॉम्प्ट लिखें

हर प्रॉम्प्ट पाँच हिस्सों से बनाएँ: सब्जेक्ट, सेटिंग, रोशनी, लेंस और टेक्सचर। SillyTavern से बने चैट-आधारित प्रॉम्प्ट अक्सर कहानी के सार होते हैं, और मॉडल उन्हें ठीक से नहीं संभालते, इसलिए जब तस्वीर मायने रखती हो तो उन्हें कैमरा वर्णन में बदल दें।

कमज़ोर प्रॉम्प्टबेहतर प्रॉम्प्ट
a girl in a tavernwoman in a wool cloak at a candlelit tavern table, 35mm f/1.8, warm side light, wood grain and pewter cups in sharp focus
my roomsmall attic bedroom at dusk, low-angle shot, soft window light from the right, linen sheets, visible dust in the air
a battle scenetwo riders on a muddy road at dawn, 70mm lens, overcast light, wet leather and mud splashes, shallow depth of field

अगर ये हाथ से लिखना धीमा लगे, तो रीराइटिंग का काम किसी चैट मॉडल से करवाएँ। Claude Sonnet 5 और Gemini 3.5 Flash दोनों कुछ ही सेकंड में एक कच्चे दृश्य सार को कैमरा-तैयार वाक्य में बदल देते हैं।

काम के हिसाब से आस्पेक्ट रेशियो चुनें

मॉडल चुनने से पहले शेप चुनें। गलत रेशियो एक रेंडर बर्बाद करता है।

कामसुझाया गया रेशियोकारण
कैरेक्टर पोर्ट्रेट2:3 या 3:4लंबे फ़्रेम और चेहरे-और-कंधों वाले क्रॉप में फिट होता है
सीन रीकैप3:2 या 16:9पूरी सेटिंग के लिए जगह
चैट बैकग्राउंड16:9चौड़ी स्क्रीन से मेल खाता है
Open WebUI का त्वरित टेस्ट1:1यह पुष्टि करने का सबसे सस्ता तरीका कि रूट काम करता है

कॉन्सेप्ट आर्टिस्ट का क्लोज़-अप पोर्ट्रेट, जो मॉनिटर को गौर से देख रहा है, बगल की खिड़की से नरम रोशनी में

लागत और सीमाएँ जो लोगों को चौंकाती हैं

ज़्यादातर चौंकाने वाले बिल कीमतों से नहीं, सेटिंग्स से आते हैं। नीचे की तालिका आम कारण बताती है।

स्थितिज़्यादा लागत क्योंक्या करें
SillyTavern में Interactive modedraw या send जैसी क्रिया के बाद photo या picture जैसी संज्ञा वाले मैसेज रेंडर ट्रिगर करते हैंआम चैट के लिए इसे बंद करें
n 1 से ऊपरएक रिक्वेस्ट में 10 इमेज तक लौट सकती हैंटेस्ट करते समय इसे 1 पर रखें
हाई रेज़ोल्यूशन टियरresolution फ़ील्ड 4K तक जाता हैकम टियर से शुरू करें और फ़ाइनल के लिए बढ़ाएँ
रीट्राई लूपविफल रन बिल नहीं होते, पर दोहराए गए सफल रन होते हैंदो या तीन कोशिशों के बाद रुकें और प्रॉम्प्ट ठीक करें

SillyTavern के interactive mode पर दोबारा नज़र डालना ज़रूरी है। यह send, make, draw, paint, render, imagine, create और mail जैसी एक्शन क्रियाओं को देखता है, जिनके कुछ अक्षरों के भीतर pic, picture, image, drawing, painting, photo या photograph जैसे शब्द आएँ। रोलप्ले की एक लाइन जिसमें संयोग से "draw a picture" लिखा हो, आपके कुछ दबाए बिना क्रेडिट खर्च कर सकती है।

नरम खिड़की की रोशनी में मेज़ का ऊपर से लिया गया दृश्य, जिस पर कैलकुलेटर, नोटबुक, लैपटॉप और कॉफ़ी रखी है

💡 टिप: पहले दस रेंडर के बाद अपना OpenRouter एक्टिविटी पेज देखें। हर इमेज की लागत की तुलना उससे करें जो आपने सोचा था, फिर लंबे सेशन से पहले मॉडल और रिज़ॉल्यूशन एडजस्ट करें।

आम एरर ठीक करना

जब कोई इमेज विफल होती है, तो कारण आम तौर पर इन चार में से एक होता है: रूट, टोकन, मॉडल स्लग, या base64 हैंडलिंग।

खाली इमेज या एरर टोस्ट

इस चेकलिस्ट को क्रम से देखें:

  1. 404 या 405 एरर। फ्रंट एंड ऐसा रूट कॉल कर रहा है जो सर्वर पर नहीं है। बेस URL और यह जाँचें कि आपको गेटवे चाहिए या नहीं।
  2. 401 एरर। टोकन गलत है, रद्द हो गया है, या गेटवे बेयरर हेडर आगे नहीं भेज रहा।
  3. मॉडल नहीं मिला। स्लग में टाइपो है या प्रीफ़िक्स छूटा है। याद से टाइप करने के बजाय OpenRouter से कॉपी करें।
  4. फ़ाइल सेव होती है पर खुलती नहीं। base64 टेक्स्ट बिना डिकोड किए सेव हुआ। चूँकि OpenRouter b64_json लौटाता है, बीच की परत को उसे इमेज फ़ाइल या URL में बदलना होगा।
  5. कुछ भी नहीं होता। सेटिंग्स बदलने से पहले अपना ब्राउज़र कंसोल या सर्वर लॉग खोलें और पहली लाल लाइन पढ़ें।

स्लेटी राउटर के पोर्ट में लगी नीली ईथरनेट केबल, पीछे धुंधली इंडिकेटर लाइटें

गलत साइज़ या रेशियो मिलना

OpenRouter आस्पेक्ट रेशियो और रेज़ोल्यूशन टियर में सोचता है, जबकि Open WebUI पिक्सल में। गेटवे इनके बीच अनुवाद करता है, और यह अनुवाद अनुमानित होता है। अगर आपको सटीक शेप चाहिए, तो aspect_ratio और resolution के साथ OpenRouter को सीधे कॉल करें, या बाद में क्रॉप करें। अगर तस्वीर खिंची हुई लगे, तो मॉडल को दोष देने से पहले जाँचें कि फ्रंट एंड किसी तय डिस्प्ले बॉक्स में ज़बरदस्ती तो नहीं डाल रहा।

क्रेडिट खर्च करने से पहले टेस्ट प्रॉम्प्ट

हर बेकार रेंडर में असली पैसे खर्च होते हैं, इसलिए प्रॉम्प्ट वहाँ ट्यून करें जहाँ दोहराना सस्ता हो। PicassoIA GPT Image 2, Seedream 4.5, FLUX.2 Pro और Gemini 2.5 Flash Image को एक ही जगह रखता है, ताकि आप किसी एक को SillyTavern प्रीफ़िक्स या Open WebUI डिफ़ॉल्ट में डालने से पहले एक ही प्रॉम्प्ट को अलग-अलग मेकर्स पर तुलना कर सकें।

यह एक त्वरित दिनचर्या है जो काम करती है:

  1. PicassoIA पर एक मॉडल पेज खोलें और अपना बेहतर, कैमरा-शैली प्रॉम्प्ट पेस्ट करें।
  2. चैट में इस्तेमाल करने वाला आस्पेक्ट रेशियो सेट करें, जैसे पोर्ट्रेट के लिए 2:3 या बैकग्राउंड के लिए 16:9।
  3. दो या तीन वैरिएशन बनाएँ और नोट करें कि कौन से शब्दों ने नतीजे को सबसे ज़्यादा बदला।
  4. वही प्रॉम्प्ट दूसरे मॉडल पर चलाएँ और वह रखें जो आपके कैरेक्टर से सबसे ज़्यादा मेल खाए।
  5. जीतने वाले शब्द अपने Common Prompt Prefix या Open WebUI प्रॉम्प्ट में कॉपी करें, फिर लंबे सेशन के लिए OpenRouter पर स्विच करें।

आज़माने के लिए तैयार हैं? PicassoIA खोलें, अपने तीन पसंदीदा प्रॉम्प्ट दो मॉडलों पर चलाएँ, और देखें कि कौन सा आपके सेटअप में जगह बनाता है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख