Kling Avatar 2.0 API: लिप सिंक प्राइसिंग और उदाहरण

Kling Avatar 2.0 एक फ़ोटो और एक ऑडियो फ़ाइल से बोलता हुआ वीडियो बनाता है। यह लेख fal, PoYo और Picsart पर प्रति-सेकंड API कीमतें बताता है, एक काम करने वाला रिक्वेस्ट दिखाता है, असली क्लिप की लंबाई पर लागत का हिसाब लगाता है, और उन टॉकिंग-फ़ोटो मॉडलों की तुलना करता है जिन्हें आप PicassoIA पर चला सकते हैं।

Kling Avatar 2.0 API: लिप सिंक प्राइसिंग और उदाहरण
Cristian Da Conceicao
Picasso IA के संस्थापक

Kling Avatar 2.0 एक पोर्ट्रेट फ़ोटो और एक ऑडियो फ़ाइल लेता है और एक बोलता हुआ वीडियो लौटाता है, जिसमें होंठ, आँखें और सिर की हरकत बोली जा रही बात के साथ चलती हैं। यह मॉडल ऑडियो के प्रति सेकंड के हिसाब से बिकता है, इसलिए Kling Avatar 2.0 API लिप सिंक प्राइसिंग का अनुमान लगाना आसान है, बस यह जानना होता है कि आप किस प्रोवाइडर को कॉल कर रहे हैं और कौन सा टियर चुन रहे हैं। यह लेख असली आँकड़े साथ-साथ रखता है: fal पर $0.056 प्रति सेकंड, PoYo पर $0.035, Picsart पर 2 क्रेडिट, और Pro दरें इन सबसे लगभग दोगुनी। आपको एक काम करने वाला रिक्वेस्ट, तीन प्रोडक्शन-जैसे उदाहरण, इनपुट के नियम जो खराब रेंडर रोकते हैं, और PicassoIA पर सबसे मिलते-जुलते लिप सिंक मॉडलों का ट्यूटोरियल भी मिलेगा।

Kling Avatar 2.0 क्या करता है

Kling Avatar 2.0 Kling परिवार का एक ऑडियो-संचालित अवतार मॉडल है। आप इसे एक स्थिर इमेज और एक स्पीच रिकॉर्डिंग देते हैं, और यह चेहरे को इस तरह एनिमेट करता है कि मुँह के आकार अक्षरों के साथ मेल खाएँ, आँखें लेंस से संपर्क बनाए रखें, और सिर व कंधे उसी तरह हिलें जैसे एक असली वक्ता के हिलते हैं। इसमें कोई कैमरा फ़ुटेज या 3D रिग शामिल नहीं है, और फ़ोटो में मौजूद व्यक्ति की पहचान पहले फ़्रेम से आख़िरी फ़्रेम तक स्थिर रहती है।

एक फ़ोटोग्राफ़र नेवी ब्लेज़र में मुस्कुराती हुई महिला के स्टूडियो पोर्ट्रेट पर रोशनी सेट करता हुआ

एक फ़ोटो, एक ऑडियो फ़ाइल

इनपुट का ढाँचा छोटा है। मैंने जितने भी प्रोवाइडर देखे, सभी तीन चीज़ें माँगते हैं:

  • एक इमेज किसी व्यक्ति, जानवर, कार्टून या स्टाइलाइज़्ड कैरेक्टर की। PoYo JPEG, PNG और WebP फ़ाइलें 10 MB तक स्वीकार करता है।
  • एक ऑडियो फ़ाइल जिसमें स्पीच हो। PoYo 2 से 60 सेकंड और 5 MB तक स्वीकार करता है, जबकि Hedra 2 से 300 सेकंड की रेंज देता है, इसलिए जिस प्रोवाइडर को आप कॉल करने वाले हैं उसकी सीमा जाँच लें।
  • एक वैकल्पिक टेक्स्ट प्रॉम्प्ट जो भावना, इशारे या कैमरा व्यवहार बताए, जैसे "शांत प्रस्तुतकर्ता, हर वाक्य के अंत में हल्का सिर हिलाना।"

आउटपुट एक MP4 है। Hedra 16:9, 9:16 और 1:1 को समर्थित आस्पेक्ट रेशियो बताता है, जो YouTube, Reels और स्क्वायर फ़ीड पोस्ट के लिए ठीक बैठते हैं।

Standard बनाम Pro टियर

दोनों टियर एक जैसे इनपुट लेते हैं। फ़र्क आउटपुट की क्वालिटी और कीमत में है।

StandardPro
किसके लिए बना हैबल्क जनरेशन, तेज़ प्रोटोटाइपिंग, शैक्षिक वीडियोमार्केटिंग वीडियो, क्लाइंट का काम, हीरो कंटेंट
दूसरे टियर की तुलना में कीमतबेसलाइनStandard से लगभग 2x
fal एंडपॉइंटfal-ai/kling-video/ai-avatar/v2/standardfal-ai/kling-video/ai-avatar/v2/pro
इनपुटइमेज, ऑडियो, वैकल्पिक प्रॉम्प्टवही

💡 रिज़ॉल्यूशन के दावे प्रोवाइडर के हिसाब से अलग हैं। APIPass Standard के लिए 720p और Pro के लिए 1080p बताता है, जबकि Hedra Pro के लिए 720p नेटिव बताता है। कोई बैच तय करने से पहले एक टेस्ट क्लिप रेंडर करें और फ़ाइल जाँच लें।

Kling Avatar 2.0 API प्राइसिंग की तुलना

कीमत में प्रोवाइडर सबसे ज़्यादा अलग हैं। बिलिंग प्रति सेकंड ऑडियो के हिसाब से होती है, इसलिए फ़ोटो चाहे कितनी भी सरल हो, लंबा वॉइसओवर ज़्यादा खर्च करेगा।

ऊपर से दिखता एक डेस्क, जिस पर कैलकुलेटर, नोटबुक और एस्प्रेसो कप रखे हैं

प्रोवाइडर के अनुसार प्रति-सेकंड दरें

प्रोवाइडरStandardProबिलिंग नोट्स
fal$0.056 प्रति सेकंड$0.115 प्रति सेकंडदरें PoYo और Hedra द्वारा बताई गई अनुसार
PoYo$0.035 प्रति सेकंड (7 क्रेडिट)$0.070 प्रति सेकंड (14 क्रेडिट)ऑडियो अवधि अगले सेकंड तक राउंड अप की जाती है
Picsart API2 क्रेडिट प्रति सेकंड4 क्रेडिट प्रति सेकंडक्रेडिट की कीमत आपके Picsart प्लान पर निर्भर है
APIPassप्रति सेकंड क्रेडिटप्रति सेकंड क्रेडिटमुझे मिले आँकड़े आपस में मेल नहीं खाते थे

PoYo का पेज उसकी Standard दर को fal से लगभग 38% और Pro दर को लगभग 39% कम बताता है, और यह अंकगणित से मेल खाता है: $0.035 बनाम $0.056, और $0.070 बनाम $0.115।

💡 बजट बनाने से पहले जाँचें। APIPass के प्राइसिंग पेज के दो स्नैपशॉट लगभग दस गुना के अंतर से अलग थे, इसलिए मैंने उसकी दर नीचे के लागत हिसाब से बाहर रखी। कोई बड़ा बैच लगाने से पहले किसी भी प्रोवाइडर की कीमत उसके अपने डैशबोर्ड में पक्की कर लें।

असली मात्रा पर लागत के उदाहरण

बिलिंग रैखिक है: ऑडियो के सेकंड गुणा दर। पहले हर क्लिप को ऊपर राउंड करें। 12.3 सेकंड का वॉइसओवर 13 सेकंड गिना जाता है, इसलिए fal Standard पर यह 13 × $0.056 होगा, यानी $0.73।

क्लिप की लंबाईfal Standardfal ProPoYo StandardPoYo Pro
10 सेकंड$0.56$1.15$0.35$0.70
30 सेकंड$1.68$3.45$1.05$2.10
60 सेकंड$3.36$6.90$2.10$4.20

मात्रा बढ़ने पर अंतर भी बढ़ता है। 30 सेकंड की 500 क्लिप का बैच कुल 15,000 सेकंड ऑडियो होगा:

प्रोवाइडर और टियर30 सेकंड की 500 क्लिप
fal Standard$840
fal Pro$1,725
PoYo Standard$525
PoYo Pro$1,050

Pro का अतिरिक्त खर्च तब सार्थक है जब चेहरा पूरे एक मिनट स्क्रीन पर रहे, जैसे कोई पेड विज्ञापन। आंतरिक ट्रेनिंग क्लिप, ड्राफ़्ट और स्क्रिप्ट के A/B टेस्ट के लिए Standard एक समझदार डिफ़ॉल्ट है।

💡 रीट्राई के लिए बजट रखें। फ़ोटो और प्रॉम्प्ट ट्यून करते समय कुछ क्लिप को दूसरी बार रेंडर करना पड़ेगा। अपने पहले बैच के अनुमान में 20 से 30 प्रतिशत का बफ़र जोड़ें, फिर सेटिंग स्थिर होने पर उसे कम कर दें।

रिक्वेस्ट फ़ॉर्मेट और सीमाएँ

हर प्रोवाइडर वही मॉडल थोड़े अलग ढाँचे में लपेटता है। दो उदाहरण इसका आकार दिखाते हैं।

दो मॉनिटर वाले स्टैंडिंग डेस्क पर टाइप करता एक डेवलपर

इनपुट और फ़ाइल सीमाएँ

पैरामीटरज़रूरीनोट्स
image_url / imageहाँJPEG, PNG या WebP, 10 MB तक। APIPass कम से कम 300 px और 1:2.5 से 2.5:1 के बीच आस्पेक्ट रेशियो भी माँगता है
audio_url / audioहाँAPIPass पर MP3, WAV, M4A या AAC; PoYo और APIPass पर अधिकतम 5 MB
promptनहींfal पर डिफ़ॉल्ट "." है। APIPass 2,500 अक्षरों तक स्वीकार करता है
modeकेवल APIPassstd या pro

एक काम करने वाला fal रिक्वेस्ट

fal पर हर टियर का अपना एंडपॉइंट होता है और जॉब एक queue से चलता है। यह JavaScript कॉल आधिकारिक क्लाइंट इस्तेमाल करता है और नतीजे का इंतज़ार करता है:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
  input: {
    image_url: "https://example.com/presenter.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
  },
  logs: true,
});

console.log(result.data.video.url, result.data.duration);

Pro टियर के लिए एंडपॉइंट को fal-ai/kling-video/ai-avatar/v2/pro कर दें। रिस्पॉन्स में डाउनलोड URL वाली एक video फ़ाइल होती है और सेकंड में एक duration होता है, जिसे अपने इनवॉइस के साथ लॉग करना आसान है।

APIPass एक ही create-task रूट और उसकी जगह एक mode फ़ील्ड इस्तेमाल करता है:

{
  "model": "kling/avatar-v2",
  "callBackUrl": "https://your-domain.com/api/callback",
  "input": {
    "image": "https://example.com/avatar-image.jpg",
    "audio": "https://example.com/speech-audio.mp3",
    "prompt": "Professional spokesperson with confident gestures",
    "mode": "std"
  }
}

आप उस बॉडी को Authorization हेडर में bearer टोकन के साथ https://api.apipass.dev/api/v1/jobs/createTask पर POST करते हैं, और जवाब में taskId मिलता है। PoYo भी यही पैटर्न अपनाता है: पहले एक एसिंक्रोनस सबमिट कॉल, फिर या तो वेबहुक कॉलबैक या टास्क ID के आधार पर स्टेटस पोलिंग।

💡 प्रोडक्शन में webhooks इस्तेमाल करें। अवतार रेंडर queue में लगे जॉब होते हैं, तुरंत मिलने वाले जवाब नहीं। webhook आपके workers को खाली रखता है, जबकि polling लूप इंतज़ार के दौरान रिक्वेस्ट खर्च करता रहता है।

काम करने वाले लिप सिंक उदाहरण

तीन सेटअप दिखाते हैं कि प्रति-सेकंड कीमत कहाँ फ़ायदा देती है।

स्पोक्सपर्सन वीडियो

चारकोल ब्लेज़र में एक महिला कैमरे की ओर एक छोटी एम्बर बोतल दिखाती हुई

एक स्किनकेयर ब्रांड को हर सामग्री के लिए एक-एक, 20-20 सेकंड के 40 प्रोडक्ट क्लिप चाहिए। यानी कुल 800 सेकंड ऑडियो। fal Standard पर यह $44.80 लगेगा, PoYo Pro पर $56, और fal Pro पर $92। इसकी तुलना हर वैरिएशन के लिए प्रेज़ेंटर और स्टूडियो का एक दिन बुक करने से करें। एक ही पोर्ट्रेट हर क्लिप में दोबारा इस्तेमाल होता है, इसलिए पूरी सीरीज़ में चेहरा एक जैसा रहता है।

💡 आज़माने लायक प्रॉम्प्ट: "गर्मजोशी भरा, आत्मविश्वासी प्रस्तुतकर्ता, स्थिर आई कॉन्टैक्ट, हल्के सिर हिलाना, आराम से कंधे।"

कोर्स नैरेशन

घर के अध्ययन कक्ष में ऑनलाइन लेक्चर रिकॉर्ड करता एक प्रवक्ता

10 मिनट के लेक्चर में 600 सेकंड का नैरेशन होता है। इसे 60-60 सेकंड के दस हिस्सों में बाँटें ताकि हर हिस्सा मेरे मिले सबसे सख़्त ऑडियो सीमा में आ जाए, फिर सभी के लिए एक ही फ़ोटो दोबारा इस्तेमाल करें। PoYo Standard पर लेक्चर की लागत $21.00 होगी, और fal Standard पर $33.60। वाक्यों की सीमाओं पर काटने से जोड़ नज़र नहीं आते, क्योंकि वक्ता वाक्यों के बीच पहले से ही शांत रहता है।

बहुभाषी संस्करण

काँच के पीछे बोलते वक्ता के दौरान फ़ेडर समायोजित करता एक ऑडियो इंजीनियर

एक फ़ोटो और तीन भाषाओं की एक स्क्रिप्ट से तीन क्लिप बनती हैं। fal Standard पर हर एक 30 सेकंड की हो, तो कुल 90 सेकंड और $5.04 होगा। हर भाषा का ऑडियो MiniMax Speech 2.8 HD या ElevenLabs V3 जैसे टेक्स्ट-टू-स्पीच मॉडल से बनाएँ, फिर हर फ़ाइल को अवतार मॉडल में डालें। अगर आपके पास पहले से तैयार वीडियो है, तो HeyGen Video Translate उसे सीधे डब कर देता है।

स्टाइलाइज़्ड कैरेक्टर और जानवर भी काम करते हैं, क्योंकि मॉडल कार्टून और गैर-मानवीय चेहरे स्वीकार करता है। किसी मैस्कॉट पर पूरी सीरीज़ बनाने से पहले कुछ रेंडर आज़माएँ।

बेहतर नतीजों के लिए इनपुट तैयार करें

ज़्यादातर खराब रेंडर की जड़ मॉडल में नहीं, इनपुट में होती है। क्रेडिट खर्च करने से पहले इन्हें ठीक करें।

फ़ोटो के नियम

ग्रे छोटे बालों और नेवी शर्ट वाले एक आदमी का कैमरे की ओर देखता सामने का पोर्ट्रेट

  • कैमरे की ओर चेहरा रखें। सीधे सामने से सिर और कंधों वाला फ़्रेम मॉडल को एनिमेट करने के लिए सबसे ज़्यादा चेहरे की ज्यामिति देता है।
  • मुँह बंद या सामान्य रखें। स्रोत में दिखते दाँतों वाली चौड़ी मुस्कान होंठ हिलने पर अजीब लग सकती है।
  • कान और हेयरलाइन दिखाएँ। साफ़ किनारे गति के दौरान सिर की बाहरी रेखा को स्थिर रखने में मदद करते हैं।
  • चेहरे पर रोशनी समान रखें। सामने से आती नरम खिड़की की रोशनी तेज़ साइड शैडो से बेहतर है।
  • छोटी भुजा पर कम से कम 300 px से शुरू करें। अगर आपका पोर्ट्रेट छोटा है, तो पहले उसे Crystal Upscaler से अपस्केल करें, जो पोर्ट्रेट के लिए बना है।

ऑडियो और प्रॉम्प्ट के नियम

फ़ोम से ढके कोने में माइक्रोफ़ोन पर बोलता चाँदी जैसी दाढ़ी वाला एक आदमी

  • हर फ़ाइल में एक वक्ता। आपस में मिली आवाज़ें मुँह को कोई साफ़ चीज़ फ़ॉलो करने के लिए नहीं देतीं।
  • आवाज़ के नीचे संगीत न रखें। अवतार रेंडर के बाद संगीत मिक्स करें।
  • दोनों सिरों से सन्नाटा हटाएँ। आप ऑडियो के हर सेकंड का भुगतान करते हैं, खाली आवाज़ सहित।
  • प्रोवाइडर की सीमा के भीतर रहें। मुझे मिली सबसे छोटी सीमा 60 सेकंड की है, और न्यूनतम 2 सेकंड है।
  • प्रॉम्प्ट छोटा रखें। भावना पर एक पंक्ति, इशारे पर एक, कैमरे पर एक काफ़ी है। लंबा प्रॉम्प्ट ऑडियो को सहारा देने के बजाय उससे होड़ करता है।

Kling लिप सिंक कैसे इस्तेमाल करें

लिखे जाने के समय Kling Avatar 2.0 खुद PicassoIA की lipsync कैटलॉग में सूचीबद्ध नहीं है। वहाँ मौजूद Kling विकल्प, Kling Lip Sync, एक मिलती-जुलती समस्या हल करता है: यह किसी मौजूदा वीडियो क्लिप में बोलने वाले के होंठों को नए ऑडियो ट्रैक से, या आपकी टाइप की हुई स्क्रिप्ट से मिलाता है। यह 720p से 1080p पर 2 से 10 सेकंड की MP4 और MOV क्लिप स्वीकार करता है।

एक चमकदार वर्कस्पेस में मॉनिटर पर वीडियो टाइमलाइन के साथ बैठी एक महिला

चरण-दर-चरण

  1. PicassoIA पर Kling Lip Sync पेज खोलें।
  2. अपनी क्लिप अपलोड करें या उसका लिंक video_url में चिपकाएँ। 100 MB से कम, 2 से 10 सेकंड की MP4 या MOV इस्तेमाल करें।
  3. आवाज़ जोड़ें। या तो 5 MB से कम की MP3, WAV, M4A या AAC फ़ाइल audio_file में अपलोड करें, या text में एक स्क्रिप्ट टाइप करें।
  4. अगर आपने स्क्रिप्ट टाइप की है, तो अंग्रेज़ी या चीनी सूची से voice_id चुनें और voice_speed सेट करें।
  5. जनरेशन चलाएँ, नतीजा देखें और क्लिप डाउनलोड करें।

पैरामीटर के सुझाव

  • किसी एक रन के लिए या तो ऑडियो या टेक्स्ट इस्तेमाल करें। text फ़ील्ड उन स्थितियों के लिए है जब आपके पास ऑडियो फ़ाइल नहीं है।
  • voice_id का डिफ़ॉल्ट en_AOT है। एक ही लाइन पर दो-तीन आवाज़ें सुनकर फिर चुनें।
  • voice_speed का डिफ़ॉल्ट 1 है। स्पीच की लय फ़ुटेज की गति से मेल खाने तक इसे थोड़ा बदलें।
  • video_url और video_id एक साथ इस्तेमाल नहीं हो सकते, इसलिए हर रन में एक ही स्रोत चुनें।
  • लंबे दृश्यों को अपलोड से पहले 10 सेकंड के टुकड़ों में काटें।

टॉकिंग फ़ोटो के लिए PicassoIA के विकल्प

जब आप वीडियो के बजाय फ़ोटो से शुरू करते हैं, तो तीन PicassoIA मॉडल Kling Avatar 2.0 जैसे ही फ़ोटो प्लस ऑडियो पैटर्न को फ़ॉलो करते हैं।

मॉडलइनपुटआवाज़आउटपुट नोट्स
Omni Human 1.5फ़ोटो, ऑडियो, वैकल्पिक प्रॉम्प्टआपका ऑडियो, 35 सेकंड से कमचेहरे, पूरे शरीर के शॉट और इलस्ट्रेटेड कैरेक्टर। तेज़ मोड और दोहराने योग्य नतीजों के लिए सीड
Fabric 1.0फ़ोटो और ऑडियोआपका ऑडियो480p या 720p
P Video Avatarफ़ोटो, साथ में स्क्रिप्ट या ऑडियो10 भाषाओं में 30+ बिल्ट-इन आवाज़ें720p या 1080p
Kling Lip Syncवीडियो, साथ में ऑडियो या टेक्स्टआपका ऑडियो या बिल्ट-इन आवाज़2 से 10 सेकंड की क्लिप

चुनने का एक त्वरित तरीका:

  • आपके पास फ़ोटो और रिकॉर्डेड आवाज़ है: Omni Human 1.5 या Fabric 1.0 से शुरू करें।
  • आपके पास फ़ोटो और सिर्फ़ स्क्रिप्ट है: P Video Avatar आपके लिए आवाज़ बना देता है।
  • आपके पास फ़ुटेज है और नया ऑडियो चाहिए: Kling Lip Sync सही टूल है।
  • पहले आवाज़ चाहिए: Realtime TTS 2 और ElevenLabs V3 ऐसा ऑडियो बनाते हैं जिसे ऊपर के किसी भी मॉडल में डाला जा सकता है।

💡 बैच से पहले एक क्लिप टेस्ट करें। वही पोर्ट्रेट और ऑडियो के 10 सेकंड दो मॉडलों से चलाएँ, फिर "p", "b" और "m" जैसे कठिन अक्षरों पर मुँह के आकार की तुलना करें।

अपना लिप सिंक वीडियो आज़माएँ

बैच की योजना बनाने से पहले एक क्लिप चुनकर उसे टेस्ट करें: एक पोर्ट्रेट, दस सेकंड का साफ़ ऑडियो, एक टियर। इसे PicassoIA पर Omni Human 1.5 या Fabric 1.0 से चलाएँ, मुँह के आकार को ऑडियो से मिलाकर तुलना करें, और जो सेटिंग जीते उसे अपना टेम्पलेट बनाकर रखें। फिर प्लेटफ़ॉर्म के इमेज मॉडलों से पोर्ट्रेट खुद बनाएँ, आवाज़ रिकॉर्ड या सिंथेसाइज़ करें, और उसे एनिमेट करें। Picasso IA खोलें, अपनी पहली फ़ोटो अपलोड करें, और देखें कि एक ही स्थिर इमेज और एक छोटी आवाज़ की रिकॉर्डिंग कितनी दूर तक जा सकती है।

यह लेख शेयर करें

अपनी भाषा चुनें

संबंधित लेख