Kling Avatar 2.0 API: लिप सिंक प्राइसिंग और उदाहरण
Kling Avatar 2.0 एक फ़ोटो और एक ऑडियो फ़ाइल से बोलता हुआ वीडियो बनाता है। यह लेख fal, PoYo और Picsart पर प्रति-सेकंड API कीमतें बताता है, एक काम करने वाला रिक्वेस्ट दिखाता है, असली क्लिप की लंबाई पर लागत का हिसाब लगाता है, और उन टॉकिंग-फ़ोटो मॉडलों की तुलना करता है जिन्हें आप PicassoIA पर चला सकते हैं।
Kling Avatar 2.0 एक पोर्ट्रेट फ़ोटो और एक ऑडियो फ़ाइल लेता है और एक बोलता हुआ वीडियो लौटाता है, जिसमें होंठ, आँखें और सिर की हरकत बोली जा रही बात के साथ चलती हैं। यह मॉडल ऑडियो के प्रति सेकंड के हिसाब से बिकता है, इसलिए Kling Avatar 2.0 API लिप सिंक प्राइसिंग का अनुमान लगाना आसान है, बस यह जानना होता है कि आप किस प्रोवाइडर को कॉल कर रहे हैं और कौन सा टियर चुन रहे हैं। यह लेख असली आँकड़े साथ-साथ रखता है: fal पर $0.056 प्रति सेकंड, PoYo पर $0.035, Picsart पर 2 क्रेडिट, और Pro दरें इन सबसे लगभग दोगुनी। आपको एक काम करने वाला रिक्वेस्ट, तीन प्रोडक्शन-जैसे उदाहरण, इनपुट के नियम जो खराब रेंडर रोकते हैं, और PicassoIA पर सबसे मिलते-जुलते लिप सिंक मॉडलों का ट्यूटोरियल भी मिलेगा।
Kling Avatar 2.0 क्या करता है
Kling Avatar 2.0 Kling परिवार का एक ऑडियो-संचालित अवतार मॉडल है। आप इसे एक स्थिर इमेज और एक स्पीच रिकॉर्डिंग देते हैं, और यह चेहरे को इस तरह एनिमेट करता है कि मुँह के आकार अक्षरों के साथ मेल खाएँ, आँखें लेंस से संपर्क बनाए रखें, और सिर व कंधे उसी तरह हिलें जैसे एक असली वक्ता के हिलते हैं। इसमें कोई कैमरा फ़ुटेज या 3D रिग शामिल नहीं है, और फ़ोटो में मौजूद व्यक्ति की पहचान पहले फ़्रेम से आख़िरी फ़्रेम तक स्थिर रहती है।
एक फ़ोटो, एक ऑडियो फ़ाइल
इनपुट का ढाँचा छोटा है। मैंने जितने भी प्रोवाइडर देखे, सभी तीन चीज़ें माँगते हैं:
एक इमेज किसी व्यक्ति, जानवर, कार्टून या स्टाइलाइज़्ड कैरेक्टर की। PoYo JPEG, PNG और WebP फ़ाइलें 10 MB तक स्वीकार करता है।
एक ऑडियो फ़ाइल जिसमें स्पीच हो। PoYo 2 से 60 सेकंड और 5 MB तक स्वीकार करता है, जबकि Hedra 2 से 300 सेकंड की रेंज देता है, इसलिए जिस प्रोवाइडर को आप कॉल करने वाले हैं उसकी सीमा जाँच लें।
एक वैकल्पिक टेक्स्ट प्रॉम्प्ट जो भावना, इशारे या कैमरा व्यवहार बताए, जैसे "शांत प्रस्तुतकर्ता, हर वाक्य के अंत में हल्का सिर हिलाना।"
आउटपुट एक MP4 है। Hedra 16:9, 9:16 और 1:1 को समर्थित आस्पेक्ट रेशियो बताता है, जो YouTube, Reels और स्क्वायर फ़ीड पोस्ट के लिए ठीक बैठते हैं।
Standard बनाम Pro टियर
दोनों टियर एक जैसे इनपुट लेते हैं। फ़र्क आउटपुट की क्वालिटी और कीमत में है।
Standard
Pro
किसके लिए बना है
बल्क जनरेशन, तेज़ प्रोटोटाइपिंग, शैक्षिक वीडियो
मार्केटिंग वीडियो, क्लाइंट का काम, हीरो कंटेंट
दूसरे टियर की तुलना में कीमत
बेसलाइन
Standard से लगभग 2x
fal एंडपॉइंट
fal-ai/kling-video/ai-avatar/v2/standard
fal-ai/kling-video/ai-avatar/v2/pro
इनपुट
इमेज, ऑडियो, वैकल्पिक प्रॉम्प्ट
वही
💡 रिज़ॉल्यूशन के दावे प्रोवाइडर के हिसाब से अलग हैं। APIPass Standard के लिए 720p और Pro के लिए 1080p बताता है, जबकि Hedra Pro के लिए 720p नेटिव बताता है। कोई बैच तय करने से पहले एक टेस्ट क्लिप रेंडर करें और फ़ाइल जाँच लें।
Kling Avatar 2.0 API प्राइसिंग की तुलना
कीमत में प्रोवाइडर सबसे ज़्यादा अलग हैं। बिलिंग प्रति सेकंड ऑडियो के हिसाब से होती है, इसलिए फ़ोटो चाहे कितनी भी सरल हो, लंबा वॉइसओवर ज़्यादा खर्च करेगा।
प्रोवाइडर के अनुसार प्रति-सेकंड दरें
प्रोवाइडर
Standard
Pro
बिलिंग नोट्स
fal
$0.056 प्रति सेकंड
$0.115 प्रति सेकंड
दरें PoYo और Hedra द्वारा बताई गई अनुसार
PoYo
$0.035 प्रति सेकंड (7 क्रेडिट)
$0.070 प्रति सेकंड (14 क्रेडिट)
ऑडियो अवधि अगले सेकंड तक राउंड अप की जाती है
Picsart API
2 क्रेडिट प्रति सेकंड
4 क्रेडिट प्रति सेकंड
क्रेडिट की कीमत आपके Picsart प्लान पर निर्भर है
APIPass
प्रति सेकंड क्रेडिट
प्रति सेकंड क्रेडिट
मुझे मिले आँकड़े आपस में मेल नहीं खाते थे
PoYo का पेज उसकी Standard दर को fal से लगभग 38% और Pro दर को लगभग 39% कम बताता है, और यह अंकगणित से मेल खाता है: $0.035 बनाम $0.056, और $0.070 बनाम $0.115।
💡 बजट बनाने से पहले जाँचें। APIPass के प्राइसिंग पेज के दो स्नैपशॉट लगभग दस गुना के अंतर से अलग थे, इसलिए मैंने उसकी दर नीचे के लागत हिसाब से बाहर रखी। कोई बड़ा बैच लगाने से पहले किसी भी प्रोवाइडर की कीमत उसके अपने डैशबोर्ड में पक्की कर लें।
असली मात्रा पर लागत के उदाहरण
बिलिंग रैखिक है: ऑडियो के सेकंड गुणा दर। पहले हर क्लिप को ऊपर राउंड करें। 12.3 सेकंड का वॉइसओवर 13 सेकंड गिना जाता है, इसलिए fal Standard पर यह 13 × $0.056 होगा, यानी $0.73।
क्लिप की लंबाई
fal Standard
fal Pro
PoYo Standard
PoYo Pro
10 सेकंड
$0.56
$1.15
$0.35
$0.70
30 सेकंड
$1.68
$3.45
$1.05
$2.10
60 सेकंड
$3.36
$6.90
$2.10
$4.20
मात्रा बढ़ने पर अंतर भी बढ़ता है। 30 सेकंड की 500 क्लिप का बैच कुल 15,000 सेकंड ऑडियो होगा:
प्रोवाइडर और टियर
30 सेकंड की 500 क्लिप
fal Standard
$840
fal Pro
$1,725
PoYo Standard
$525
PoYo Pro
$1,050
Pro का अतिरिक्त खर्च तब सार्थक है जब चेहरा पूरे एक मिनट स्क्रीन पर रहे, जैसे कोई पेड विज्ञापन। आंतरिक ट्रेनिंग क्लिप, ड्राफ़्ट और स्क्रिप्ट के A/B टेस्ट के लिए Standard एक समझदार डिफ़ॉल्ट है।
💡 रीट्राई के लिए बजट रखें। फ़ोटो और प्रॉम्प्ट ट्यून करते समय कुछ क्लिप को दूसरी बार रेंडर करना पड़ेगा। अपने पहले बैच के अनुमान में 20 से 30 प्रतिशत का बफ़र जोड़ें, फिर सेटिंग स्थिर होने पर उसे कम कर दें।
रिक्वेस्ट फ़ॉर्मेट और सीमाएँ
हर प्रोवाइडर वही मॉडल थोड़े अलग ढाँचे में लपेटता है। दो उदाहरण इसका आकार दिखाते हैं।
इनपुट और फ़ाइल सीमाएँ
पैरामीटर
ज़रूरी
नोट्स
image_url / image
हाँ
JPEG, PNG या WebP, 10 MB तक। APIPass कम से कम 300 px और 1:2.5 से 2.5:1 के बीच आस्पेक्ट रेशियो भी माँगता है
audio_url / audio
हाँ
APIPass पर MP3, WAV, M4A या AAC; PoYo और APIPass पर अधिकतम 5 MB
prompt
नहीं
fal पर डिफ़ॉल्ट "." है। APIPass 2,500 अक्षरों तक स्वीकार करता है
mode
केवल APIPass
std या pro
एक काम करने वाला fal रिक्वेस्ट
fal पर हर टियर का अपना एंडपॉइंट होता है और जॉब एक queue से चलता है। यह JavaScript कॉल आधिकारिक क्लाइंट इस्तेमाल करता है और नतीजे का इंतज़ार करता है:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
input: {
image_url: "https://example.com/presenter.jpg",
audio_url: "https://example.com/voiceover.mp3",
prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
},
logs: true,
});
console.log(result.data.video.url, result.data.duration);
Pro टियर के लिए एंडपॉइंट को fal-ai/kling-video/ai-avatar/v2/pro कर दें। रिस्पॉन्स में डाउनलोड URL वाली एक video फ़ाइल होती है और सेकंड में एक duration होता है, जिसे अपने इनवॉइस के साथ लॉग करना आसान है।
APIPass एक ही create-task रूट और उसकी जगह एक mode फ़ील्ड इस्तेमाल करता है:
आप उस बॉडी को Authorization हेडर में bearer टोकन के साथ https://api.apipass.dev/api/v1/jobs/createTask पर POST करते हैं, और जवाब में taskId मिलता है। PoYo भी यही पैटर्न अपनाता है: पहले एक एसिंक्रोनस सबमिट कॉल, फिर या तो वेबहुक कॉलबैक या टास्क ID के आधार पर स्टेटस पोलिंग।
💡 प्रोडक्शन में webhooks इस्तेमाल करें। अवतार रेंडर queue में लगे जॉब होते हैं, तुरंत मिलने वाले जवाब नहीं। webhook आपके workers को खाली रखता है, जबकि polling लूप इंतज़ार के दौरान रिक्वेस्ट खर्च करता रहता है।
काम करने वाले लिप सिंक उदाहरण
तीन सेटअप दिखाते हैं कि प्रति-सेकंड कीमत कहाँ फ़ायदा देती है।
स्पोक्सपर्सन वीडियो
एक स्किनकेयर ब्रांड को हर सामग्री के लिए एक-एक, 20-20 सेकंड के 40 प्रोडक्ट क्लिप चाहिए। यानी कुल 800 सेकंड ऑडियो। fal Standard पर यह $44.80 लगेगा, PoYo Pro पर $56, और fal Pro पर $92। इसकी तुलना हर वैरिएशन के लिए प्रेज़ेंटर और स्टूडियो का एक दिन बुक करने से करें। एक ही पोर्ट्रेट हर क्लिप में दोबारा इस्तेमाल होता है, इसलिए पूरी सीरीज़ में चेहरा एक जैसा रहता है।
💡 आज़माने लायक प्रॉम्प्ट: "गर्मजोशी भरा, आत्मविश्वासी प्रस्तुतकर्ता, स्थिर आई कॉन्टैक्ट, हल्के सिर हिलाना, आराम से कंधे।"
कोर्स नैरेशन
10 मिनट के लेक्चर में 600 सेकंड का नैरेशन होता है। इसे 60-60 सेकंड के दस हिस्सों में बाँटें ताकि हर हिस्सा मेरे मिले सबसे सख़्त ऑडियो सीमा में आ जाए, फिर सभी के लिए एक ही फ़ोटो दोबारा इस्तेमाल करें। PoYo Standard पर लेक्चर की लागत $21.00 होगी, और fal Standard पर $33.60। वाक्यों की सीमाओं पर काटने से जोड़ नज़र नहीं आते, क्योंकि वक्ता वाक्यों के बीच पहले से ही शांत रहता है।
बहुभाषी संस्करण
एक फ़ोटो और तीन भाषाओं की एक स्क्रिप्ट से तीन क्लिप बनती हैं। fal Standard पर हर एक 30 सेकंड की हो, तो कुल 90 सेकंड और $5.04 होगा। हर भाषा का ऑडियो MiniMax Speech 2.8 HD या ElevenLabs V3 जैसे टेक्स्ट-टू-स्पीच मॉडल से बनाएँ, फिर हर फ़ाइल को अवतार मॉडल में डालें। अगर आपके पास पहले से तैयार वीडियो है, तो HeyGen Video Translate उसे सीधे डब कर देता है।
स्टाइलाइज़्ड कैरेक्टर और जानवर भी काम करते हैं, क्योंकि मॉडल कार्टून और गैर-मानवीय चेहरे स्वीकार करता है। किसी मैस्कॉट पर पूरी सीरीज़ बनाने से पहले कुछ रेंडर आज़माएँ।
बेहतर नतीजों के लिए इनपुट तैयार करें
ज़्यादातर खराब रेंडर की जड़ मॉडल में नहीं, इनपुट में होती है। क्रेडिट खर्च करने से पहले इन्हें ठीक करें।
फ़ोटो के नियम
कैमरे की ओर चेहरा रखें। सीधे सामने से सिर और कंधों वाला फ़्रेम मॉडल को एनिमेट करने के लिए सबसे ज़्यादा चेहरे की ज्यामिति देता है।
मुँह बंद या सामान्य रखें। स्रोत में दिखते दाँतों वाली चौड़ी मुस्कान होंठ हिलने पर अजीब लग सकती है।
कान और हेयरलाइन दिखाएँ। साफ़ किनारे गति के दौरान सिर की बाहरी रेखा को स्थिर रखने में मदद करते हैं।
चेहरे पर रोशनी समान रखें। सामने से आती नरम खिड़की की रोशनी तेज़ साइड शैडो से बेहतर है।
छोटी भुजा पर कम से कम 300 px से शुरू करें। अगर आपका पोर्ट्रेट छोटा है, तो पहले उसे Crystal Upscaler से अपस्केल करें, जो पोर्ट्रेट के लिए बना है।
ऑडियो और प्रॉम्प्ट के नियम
हर फ़ाइल में एक वक्ता। आपस में मिली आवाज़ें मुँह को कोई साफ़ चीज़ फ़ॉलो करने के लिए नहीं देतीं।
आवाज़ के नीचे संगीत न रखें। अवतार रेंडर के बाद संगीत मिक्स करें।
दोनों सिरों से सन्नाटा हटाएँ। आप ऑडियो के हर सेकंड का भुगतान करते हैं, खाली आवाज़ सहित।
प्रोवाइडर की सीमा के भीतर रहें। मुझे मिली सबसे छोटी सीमा 60 सेकंड की है, और न्यूनतम 2 सेकंड है।
प्रॉम्प्ट छोटा रखें। भावना पर एक पंक्ति, इशारे पर एक, कैमरे पर एक काफ़ी है। लंबा प्रॉम्प्ट ऑडियो को सहारा देने के बजाय उससे होड़ करता है।
Kling लिप सिंक कैसे इस्तेमाल करें
लिखे जाने के समय Kling Avatar 2.0 खुद PicassoIA की lipsync कैटलॉग में सूचीबद्ध नहीं है। वहाँ मौजूद Kling विकल्प, Kling Lip Sync, एक मिलती-जुलती समस्या हल करता है: यह किसी मौजूदा वीडियो क्लिप में बोलने वाले के होंठों को नए ऑडियो ट्रैक से, या आपकी टाइप की हुई स्क्रिप्ट से मिलाता है। यह 720p से 1080p पर 2 से 10 सेकंड की MP4 और MOV क्लिप स्वीकार करता है।
आपके पास फ़ोटो और सिर्फ़ स्क्रिप्ट है:P Video Avatar आपके लिए आवाज़ बना देता है।
आपके पास फ़ुटेज है और नया ऑडियो चाहिए:Kling Lip Sync सही टूल है।
पहले आवाज़ चाहिए:Realtime TTS 2 और ElevenLabs V3 ऐसा ऑडियो बनाते हैं जिसे ऊपर के किसी भी मॉडल में डाला जा सकता है।
💡 बैच से पहले एक क्लिप टेस्ट करें। वही पोर्ट्रेट और ऑडियो के 10 सेकंड दो मॉडलों से चलाएँ, फिर "p", "b" और "m" जैसे कठिन अक्षरों पर मुँह के आकार की तुलना करें।
अपना लिप सिंक वीडियो आज़माएँ
बैच की योजना बनाने से पहले एक क्लिप चुनकर उसे टेस्ट करें: एक पोर्ट्रेट, दस सेकंड का साफ़ ऑडियो, एक टियर। इसे PicassoIA पर Omni Human 1.5 या Fabric 1.0 से चलाएँ, मुँह के आकार को ऑडियो से मिलाकर तुलना करें, और जो सेटिंग जीते उसे अपना टेम्पलेट बनाकर रखें। फिर प्लेटफ़ॉर्म के इमेज मॉडलों से पोर्ट्रेट खुद बनाएँ, आवाज़ रिकॉर्ड या सिंथेसाइज़ करें, और उसे एनिमेट करें। Picasso IA खोलें, अपनी पहली फ़ोटो अपलोड करें, और देखें कि एक ही स्थिर इमेज और एक छोटी आवाज़ की रिकॉर्डिंग कितनी दूर तक जा सकती है।