Ideogram 4.0: ComfyUI वर्कफ़्लो, प्रॉम्प्ट टिप्स और Krea 2 से तुलना
ComfyUI में Ideogram 4.0 का व्यावहारिक परिचय: पाँच मॉडल फ़ाइलें और उन्हें कहाँ रखें, JSON प्रॉम्प्ट कैसे काम करते हैं, कारगर प्रॉम्प्ट की आदतें, और कंट्रोल, टेक्स्ट और कीमत पर Krea 2 के साथ आमने-सामने तुलना, साथ ही PicassoIA पर दोनों को चलाने की सेटिंग्स।
ज़्यादातर लोग Ideogram 4.0 को किसी होस्टेड ऐप के ज़रिए जानते हैं और वह हिस्सा कभी नहीं देखते जो इसे अलग बनाता है: इसके वेट्स ओपन हैं, और ComfyUI एक तैयार वर्कफ़्लो देता है जो इन्हें आपकी अपनी मशीन पर चलाता है। इससे यह बदल जाता है कि आप क्या डाउनलोड करते हैं, प्रॉम्प्ट कैसे लिखते हैं, और यह मॉडल Krea 2 के मुकाबले कहाँ खड़ा होता है, जो उलटा रास्ता लेता है और एक ही क्रिएटिविटी डायल व स्टाइल रेफ़रेंस का ढेर देता है। नीचे आपको फ़ाइल-दर-फ़ाइल ComfyUI सेटअप, JSON प्रॉम्प्ट फ़ॉर्मैट, वे प्रॉम्प्ट आदतें जो फ़ायदेमंद रहती हैं, Krea 2 के साथ सरल तुलना, और PicassoIA पर ब्राउज़र में दोनों को चलाने का शॉर्टकट मिलेगा।
Ideogram 4.0 असल में क्या है
Ideogram ने अपनी पहचान एक चीज़ से बनाई: इमेज के अंदर ऐसा टेक्स्ट जो सही पढ़ा जाए। वर्ज़न 4.0 यह ताकत बनाए रखता है और दृश्य का वर्णन करने का एक संरचित तरीका जोड़ता है, ताकि पोस्टर, प्रोडक्ट शॉट या पोर्ट्रेट को संयोग पर छोड़ने के बजाय एक पन्ने की तरह व्यवस्थित किया जा सके।
ओपन वेट्स, सिर्फ़ API नहीं
सबसे अहम बदलाव वितरण का है। मॉडल ओपन वेट्स के साथ जारी हुआ, और ComfyUI ने पहले ही दिन इसका सपोर्ट जोड़ा, यानी आप किसी और के सर्वर पर हर इमेज का भुगतान करने के बजाय इसे लोकली चला सकते हैं। ComfyUI के डॉक्यूमेंटेशन में एक अलग पार्टनर नोड रूट भी सूचीबद्ध है जो होस्टेड सेवा को कॉल करता है, तो आप अपने हार्डवेयर के हिसाब से लोकल फ़ाइलों और रिमोट कॉल में से चुनते हैं।
दो प्रॉम्प्ट फ़ॉर्मैट
आप सादी नेचुरल लैंग्वेज में लिख सकते हैं, जो त्वरित विचारों के लिए ठीक है, या लेआउट, रंगों और स्टाइल पर सटीक नियंत्रण के लिए एक संरचित JSON कैप्शन। JSON रास्ता वही है जिसके लिए मॉडल बना था, और समुदाय की ज़्यादातर चर्चा इसी पर केंद्रित है। Ideogram v4 Quality पर वही बँटवारा दो अलग इनपुट में दिखता है: नेचुरल लैंग्वेज के लिए prompt और संरचित वर्ज़न के लिए json_prompt। इनमें से एक ही उपयोग करें, दोनों नहीं।
💡 त्वरित नियम: अगर इमेज में कोई ऐसा लेआउट है जो मायने रखता है (पोस्टर, लेबल, किसी तय बैकग्राउंड पर प्रोडक्ट), तो JSON चुनें। अगर मामला मूड या पोर्ट्रेट का है, तो सादा टेक्स्ट तेज़ रहता है।
ComfyUI सेटअप, फ़ाइल-दर-फ़ाइल
लोकल सेटअप ज़्यादातर डाउनलोड का काम है। आधिकारिक वर्कफ़्लो पाँच फ़ाइलें तय फ़ोल्डरों में चाहता है, और उन्हें गलत जगह रखना वर्कफ़्लो के लोड न होने का सबसे आम कारण है।
पाँच मॉडल फ़ाइलें
फ़ाइल
फ़ोल्डर
आकार
ideogram4_fp8_scaled.safetensors
models/diffusion_models/
लगभग 13.8 GB
ideogram4_unconditional_fp8_scaled.safetensors
models/diffusion_models/
लगभग 13.8 GB
qwen3vl_8b_fp8_scaled.safetensors
models/text_encoders/
लगभग 8 GB
gemma4_e4b_it_fp8_scaled.safetensors
models/text_encoders/
लगभग 2 GB
flux2-vae.safetensors
models/vae/
लगभग 335 MB
इन सबका डिस्क पर कुल मिलाकर लगभग 38 GB होता है। फ़ाइलें Hugging Face पर Comfy-Org/Ideogram-4 रिपॉज़िटरी से आती हैं। दूसरी डिफ्यूज़न फ़ाइल अनकंडीशनल पास संभालती है, और इसी वजह से मॉडल को नेगेटिव प्रॉम्प्ट की ज़रूरत नहीं पड़ती: अनकंडीशनल साइड टेक्स्ट टोकन को बस हटा देती है, इसलिए भरने के लिए कोई अलग "इससे बचें" स्ट्रिंग नहीं होती।
वर्कफ़्लो लोड करना
ComfyUI के डॉक्यूमेंटेशन पेज से वर्कफ़्लो फ़ाइल डाउनलोड करें और उसे कैनवास पर खींचकर छोड़ दें। ग्राफ़ छोटा है: एक Ideogram4 subgraph node जो भारी काम करता है, आउटपुट साइज़ के लिए एक ResolutionSelector, और एक Save Image नोड। अगर ComfyUI लाल रंग में गायब नोड दिखाए, तो पहले ComfyUI अपडेट करें, क्योंकि वर्कफ़्लो हाल के जोड़ों पर निर्भर है।
डिफ़ॉल्ट वर्कफ़्लो में पहले से एक संरचित JSON प्रॉम्प्ट भरा होता है। खाली बॉक्स से शुरू करने के बजाय उसी उदाहरण को संपादित करें, क्योंकि उससे साफ़ दिखता है कि नोड किन फ़ील्ड्स की अपेक्षा करता है। अगर आप प्रॉम्प्ट दृश्य रूप से बनाना चाहते हैं, तो KJNodes में Ideogram 4 Prompt Builder आपको कैनवास पर तत्व रखने देता है और JSON अपने आप लिख देता है।
हार्डवेयर की असली जाँच
यहाँ असली कमी यह है: डॉक्यूमेंटेशन VRAM का आंकड़ा या न्यूनतम सिस्टम स्पेक नहीं बताता। फ़ाइल आकार डॉक्स से ज़्यादा बताते हैं। दो 13.8 GB डिफ्यूज़न फ़ाइलें और 8 GB का टेक्स्ट एनकोडर मतलब है कि आपके पास काफ़ी मेमोरी वाला कार्ड, तेज़ स्टोरेज और पहली बार लोड होने में धैर्य होना चाहिए। डिफ़ॉल्ट वर्कफ़्लो एक बार चलाएँ, अपनी मेमोरी का उपयोग देखें, और उसके बाद ही उसके आसपास बड़ी पाइपलाइन बनाएँ। अगर आपका GPU तंग है, तो होस्टेड रास्ता समझदारी भरा विकल्प है।
काम करने वाले JSON प्रॉम्प्ट कैसे लिखें
संरचित कैप्शन एक दृश्य सार, एक स्टाइल ब्लॉक, एक बैकग्राउंड, और वैकल्पिक प्रति-ऑब्जेक्ट विवरण से बनता है, जिनमें बाउंडिंग बॉक्स और हेक्स रंग पैलेट होते हैं। डिफ़ॉल्ट ComfyUI वर्कफ़्लो इसे तीन शीर्ष-स्तरीय नामों के तहत रखता है।
तीन शीर्ष ब्लॉक
high_level_description: एक या दो वाक्य जो पूरे दृश्य का नाम बताएँ।
style_description: लेंस, रोशनी, फ़िल्म स्टॉक, मूड। "डॉक्यूमेंट्री फ़ोटोग्राफ़, सॉफ़्ट विंडो लाइट, बारीक ग्रेन" यहीं रहता है।
compositional_deconstruction: तत्वों की सूची, जिनमें से हर एक का बॉक्स, विवरण और पैलेट है।
बॉक्स और रंग
एक तत्व तक सीमित करके प्रॉम्प्ट का आकार यह है:
{
"high_level_description": "A white ceramic mug on a walnut desk beside an open notebook, morning window light",
"style_description": "Documentary photograph, 50mm lens, soft shadows, fine film grain, natural colors",
"compositional_deconstruction": [
{
"description": "White ceramic mug with a thin blue rim, steam rising",
"bounding_box": [0.55, 0.40, 0.80, 0.75],
"colors": ["#F4F1EA", "#3C6E9E"]
}
]
}
इसे एक आकार समझें, स्कीमा नहीं। हर तत्व के भीतर के सटीक फ़ील्ड नाम और बॉक्स कोऑर्डिनेट्स कैसे लिखे जाते हैं, यह डिफ़ॉल्ट वर्कफ़्लो से आता है, इसलिए उन्हें वहीं से कॉपी करें, इस स्केच से नहीं।
रंगों के लिए अतिरिक्त टाइपिंग की कीमत है। एक हेक्स मान मग को एक खास नीले रंग पर टिका देता है, जबकि अकेला "नीला" हर रन में थोड़ा बदलता है। बॉक्स स्थिति के लिए यही काम करते हैं: "दाईं ओर मग" का इंतज़ार करने के बजाय आप मॉडल को एक आयत दे देते हैं।
सरल दृश्यों के लिए भी JSON को पसंद करने का एक व्यावहारिक कारण है। ComfyUI के नोट्स के अनुसार सादे टेक्स्ट प्रॉम्प्ट में सेफ़्टी फ़िल्टर का फ़ॉल्स-पॉज़िटिव रेट ज़्यादा होता है, और संरचित प्रॉम्प्ट इस ब्लॉकिंग को कम करते हैं।
प्रॉम्प्ट की कारगर टिप्स
ध्यान JSON पर जाता है, लेकिन ज़्यादातर असफल इमेज अस्पष्ट शब्दों से जुड़ी होती हैं, गायब संरचना से नहीं। तीन आदतें उनमें से ज़्यादातर को ठीक कर देती हैं।
बताएँ कि कैमरा क्या देखता है
विचार नहीं, फ़ोटो का वर्णन करें। इस मॉडल के लिए PicassoIA के अपने उदाहरण प्रॉम्प्ट एक कैमरा नोट की तरह पढ़ते हैं: कलर फ़िल्म पोर्ट्रेट, शैलो डेप्थ ऑफ़ फ़ील्ड, आँख पर शार्प फ़ोकस, धुंधला बैकग्राउंड बोकेह, हाई ISO फ़िल्म ग्रेन, कैंडिड डॉक्यूमेंट्री स्टाइल। लेंस, रोशनी की दिशा और फ़िल्म स्टॉक मॉडल को रेंडर करने के लिए कुछ ठोस देते हैं, और नतीजों को चमकदार, ज़रूरत से ज़्यादा पॉलिश वाली दिखावट से दूर रखते हैं।
टेक्स्ट छोटा रखें
अगर इमेज में शब्द चाहिए, तो उन्हें उद्धरण चिह्नों में रखें और बताएँ कि वे इमेज में कहाँ दिखें। मॉडल पेजों के उदाहरण प्रॉम्प्ट यही करते हैं, एक छोटे उद्धृत लेबल और "centered" जैसी स्थिति के साथ। हर टेक्स्ट तत्व में एक से तीन शब्द सबसे अच्छे रहते हैं। इमेज के अंदर लंबे वाक्य वह जगह है जहाँ हर मॉडल फिसलने लगता है, इस मॉडल समेत।
नेगेटिव प्रॉम्प्ट छोड़ें
"इससे बचें" वाला हिस्सा आर्किटेक्चर पहले से संभालता है, इसलिए जो चाहिए वह लिखें और वहीं रुकें। होस्टेड वर्ज़न पर नेचुरल-लैंग्वेज prompt देने से Magic Prompt अपने आप चालू हो जाता है, जो जनरेट करने से पहले एक कच्चे विवरण का विस्तार करता है। यह शुरुआती लोगों के लिए मददगार है और अगर आपने सटीक प्रॉम्प्ट लिखा है तो रास्ते में आता है, इसलिए आउटपुट को अपने इरादे से मिलाकर देखें। अगर Magic Prompt बहुत ज़्यादा बदल दे, तो वही विचार json_prompt में ले जाएँ।
Ideogram 4.0 बनाम Krea 2
Krea 2 PicassoIA पर दो आकारों में आता है। Krea 2 Large एक ही मॉडल में फ़ोटोरियलिज़्म और कलात्मक रेंज के लिए सूचीबद्ध है, और Krea 2 Medium एनीमे और पेंटरली काम के लिए स्थित है।
तालिका से पहले एक चेतावनी: यह तुलना मॉडल स्पेक्स, ComfyUI डॉक्यूमेंटेशन और सार्वजनिक लिस्टिंग पर आधारित है। यह पिक्सल-स्तर की शूटआउट नहीं है, इसलिए किसी प्रोजेक्ट को किसी एक पर सौंपने से पहले दोनों पर एक ही प्रॉम्प्ट चलाकर देखें।
कंट्रोल बनाम स्वाद
दोनों मॉडल आपसे अलग-अलग तरीकों से मार्गदर्शन माँगते हैं।
Ideogram 4.0 आपको संरचना देता है। बॉक्स तत्व रखते हैं, हेक्स मान रंग तय करते हैं, और उद्धृत टेक्स्ट वहीं उतरता है जहाँ आपने कहा। फ़ैसला आप करते हैं, मॉडल उसे लागू करता है।
Krea 2 आपको एक डायल देता है। creativity सेटिंग raw से चलती है, जो सिर्फ़ वही रेंडर करती है जो आपने बताया, फिर low और medium से होकर high तक जाती है, जहाँ मॉडल रोशनी, वातावरण और कंपोज़िशन में असली आज़ादी लेता है। आप 10 स्टाइल रेफ़रेंस इमेज तक जोड़ सकते हैं और 0 से 1 के बीच ताकत (डिफ़ॉल्ट 0.5) सेट कर सकते हैं, यह तय करने के लिए कि उनका लुक नतीजे को कितनी मज़बूती से आकार देता है।
लागत और गति
एक सार्वजनिक तुलना साइट Krea 2 Medium Turbo को लगभग $15 प्रति 1,000 इमेज और Ideogram 4.0 को लगभग $60 प्रति 1,000 पर सूचीबद्ध करती है। ब्लाइंड प्रेफ़रेंस वोटिंग में दोनों लगभग बराबर रहे, 1,223 और 1,217 Elo पर, कोई साफ़ लीडर नहीं। ध्यान दें कि सस्ता आंकड़ा Medium Turbo वैरिएंट का है, Large का नहीं।
गति पर, PicassoIA के मॉडल पेजों पर सूचीबद्ध उदाहरण रन एक मोटा अंदाज़ा देते हैं: एक Ideogram v4 Quality सैंपल लगभग 67 सेकंड, एक Ideogram v4 Balanced सैंपल लगभग 41 सेकंड, और दो Krea 2 Large सैंपल लगभग 103 और 143 सेकंड। ये एकल रन हैं, बेंचमार्क नहीं, लेकिन ये संकेत देते हैं कि Balanced इटरेशन मॉडल है और Quality फ़ाइनल पास है।
Ideogram 4.0
Krea 2
प्रॉम्प्ट इनपुट
नेचुरल लैंग्वेज या संरचित JSON
नेचुरल लैंग्वेज के साथ क्रिएटिविटी सेटिंग
लेआउट कंट्रोल
बाउंडिंग बॉक्स और रंग पैलेट
आस्पेक्ट रेशियो प्रीसेट और स्टाइल रेफ़रेंस
इमेज के अंदर टेक्स्ट
हेडलाइन की मज़बूती, पढ़ने योग्य लेबल
संभव है, पर मुख्य ख़ासियत नहीं
स्टाइल ट्रांसफ़र
स्टाइल ब्लॉक में लिखा जाता है
10 रेफ़रेंस इमेज तक
नेगेटिव प्रॉम्प्ट
ज़रूरत नहीं
इनपुट का हिस्सा नहीं
सार्वजनिक कीमत का आंकड़ा
लगभग $60 प्रति 1,000 इमेज
लगभग $15 प्रति 1,000 (Medium Turbo)
छोटा फ़ैसला: जब इमेज एक लेआउट हो (पोस्टर, पैकेजिंग, शब्दों वाले थंबनेल) तो Ideogram चुनें। जब इमेज एक मूड हो (पोर्ट्रेट, एडिटोरियल दृश्य, वह कुछ भी जहाँ आप चाहते हैं कि मॉडल अपनी रुचि लाए) तो Krea 2 चुनें।
PicassoIA पर दोनों चलाएँ
अगर 38 GB के डाउनलोड और अज्ञात VRAM ज़रूरत किसी बुरे सपने जैसी लगती है, तो दोनों परिवार PicassoIA पर ब्राउज़र में बिना सेटअप, बिना वॉटरमार्क और साफ़ डाउनलोड के साथ चलते हैं।
नेचुरल-लैंग्वेज विवरण prompt में, या JSON ऑब्जेक्ट json_prompt में चिपकाएँ। सिर्फ़ एक भरें।
resolution चुनें। 2048x2048 से 3328x1248 तक 20 से ज़्यादा साइज़ हैं। इसे None पर छोड़ें तो मॉडल आस्पेक्ट रेशियो खुद तय करता है। ब्लॉग हेडर के लिए 2560x1440 एक साफ़ 16:9 है।
अगर आप व्यावसायिक रूप से प्रकाशित करने की योजना रखते हैं तो copyright detection चालू करें। यह ऑप्ट-इन है और डिफ़ॉल्ट रूप से बंद रहता है।
जनरेट करें, फिर अंतिम रेंडर से पहले तेज़ ड्राफ़्ट चाहिए तो वही प्रॉम्प्ट Ideogram v4 Balanced पर दोहराएँ।
creativity: प्रोडक्ट शॉट्स के लिए raw रखें जो आपके शब्दों से मेल खाने चाहिए, रोज़मर्रा के डिफ़ॉल्ट के लिए medium, और कॉन्सेप्ट आर्ट के लिए high।
aspect_ratio: बैनर के लिए 16:9, सिनेमैटिक स्ट्रिप के लिए 2.35:1, वर्टिकल पोस्ट के लिए 9:16। आठ रेशियो उपलब्ध हैं।
seed: जो कंपोज़िशन पसंद आए उसे लॉक करें, फिर एक बार में एक वाक्यांश बदलकर तुलना करें।
स्टाइल रेफ़रेंस: ताकत 0.5 से शुरू करें और तभी ऊपर ले जाएँ जब रेफ़रेंस मुश्किल से दिखे।
सही मॉडल चुनना
फ़ैसला करने का एक त्वरित तरीका:
टेक्स्ट और लेआउट पहले: Ideogram v4 Quality।
उसी विचार के तेज़ ड्राफ़्ट: Ideogram v4 Balanced।
फ़ोटोग्राफ़िक मूड या रेफ़रेंस से कोई खास लुक: Krea 2 Large।
पेंटरली या एनीमे दिशा: Krea 2 Medium।
अगर इनमें से कोई फ़िट न बैठे, तो FLUX 2 Pro, Seedream 5 Pro और GPT Image 2 को उसी प्रॉम्प्ट के साथ परखना उपयोगी है। और जब किसी तैयार ग्राफ़िक से उसका टेक्स्ट संपादन योग्य हिस्सों में निकालना हो, तो Layerize टेक्स्ट लेयर अलग कर देता है।
आज ही अपनी इमेज बनाएँ
Ideogram बनाम Krea के सवाल को सुलझाने का सबसे तेज़ तरीका है अपना प्रॉम्प्ट दोनों पर चलाना। PicassoIA खोलें, Ideogram v4 Quality और Krea 2 Large को दो टैब में लोड करें, हर एक में वही एक-वाक्य का विचार चिपकाएँ, और नतीजों की साथ-साथ तुलना करें। फिर पहले के लिए प्रॉम्प्ट को JSON में लिखें और दूसरे पर क्रिएटिविटी सेटिंग थोड़ी घुमाएँ।
उतने दस मिनट किसी भी स्पेक शीट से ज़्यादा बताते हैं। अपने काम का कोई दृश्य चुनें, उसे दो बार चलाएँ, और जो मॉडल पहली कोशिश में करीब पहुँचे उसे रखें।