OmniHuman 1.5 एक पोर्ट्रेट फ़ोटो और एक ऑडियो फ़ाइल से बोलता हुआ वीडियो बनाता है, जिसकी कीमत fal.ai पर $0.16 प्रति सेकंड है। यह लेख हर क्लिप की असली लागत, इनपुट की सीमाएँ, लिप सिंक की गुणवत्ता और बिना कोड लिखे PicassoIA पर इस मॉडल को चलाने का तरीका बताता है।
एक पोर्ट्रेट फ़ोटो और 30 सेकंड की वॉइस रिकॉर्डिंग से $4.80 में बोलता हुआ वीडियो बन सकता है। OmniHuman 1.5 API के पीछे यही गणित है। यह ByteDance का ऑडियो-संचालित अवतार मॉडल है, जिसे fal.ai जनरेट हुए वीडियो के प्रति सेकंड $0.16 पर बिल करता है। न कैमरा चाहिए, न स्टूडियो, न कोई एक्टर। बस एक चेहरा, एक आवाज़ और कुछ मिनटों का इंतज़ार।
यह लेख इसके असली आँकड़े देता है। आप देखेंगे कि अलग-अलग लंबाई की क्लिप की लागत कितनी है, कौन-सी सीमाएँ सच में आपका काम रोकेंगी (ऑडियो की लंबाई, रिज़ॉल्यूशन, फ़ाइल फ़ॉर्मेट), असली चेहरों पर लिप सिंक कितना टिकता है, और बोलती फ़ोटो कहाँ शूटिंग से बेहतर है। इसमें OmniHuman 1.5 को PicassoIA पर ब्राउज़र से चलाने का चरण-दर-चरण तरीका भी है, साथ ही इसे परखने के लिए कुछ विकल्पों की सूची।
💡 त्वरित उत्तर: OmniHuman 1.5 एक व्यक्ति की इमेज और एक ऑडियो फ़ाइल लेता है और ऐसा वीडियो लौटाता है जिसमें बोलने के साथ चेहरा और सिर हिलते हैं। fal.ai पर इसकी कीमत $0.16 प्रति सेकंड है और यह 720p पर 60 सेकंड तक या 1080p पर 30 सेकंड तक का ऑडियो स्वीकार करता है।
OmniHuman 1.5 असल में क्या करता है
OmniHuman 1.5 ऑडियो पर आधारित एक इमेज-टू-वीडियो मॉडल है। यह टेक्स्ट प्रॉम्प्ट से कोई दृश्य गढ़ने के बजाय उस व्यक्ति से शुरू करता है जो आपके पास पहले से है, और उसे वह सब बुलवाता, गवाता या प्रतिक्रिया देता है जो आप ऑडियो में देते हैं।
एक फ़ोटो, एक ऑडियो फ़ाइल
वर्कफ़्लो लगभग इतना सरल है कि भरोसा न हो। एक ऐसी इमेज अपलोड करें जिसमें कोई व्यक्ति, चेहरा या कैरेक्टर हो। फिर एक ऑडियो ट्रैक अपलोड करें। मॉडल सब्जेक्ट को ऐसे एनिमेट करता है कि मुँह, चेहरे के भाव और सिर की हरकत आवाज़ के साथ चलें। एक वैकल्पिक टेक्स्ट प्रॉम्प्ट से आप इशारे, दृश्य की संरचना या कैमरे की मूवमेंट तय कर सकते हैं।
तीन बातें इसे पुराने टॉकिंग फ़ोटो टूल्स से अलग करती हैं:
होंठों से आगे की हरकत। चेहरे के भाव, इशारे और सिर की हरकत सिर्फ़ शब्दों पर नहीं, बल्कि बोलने के भाव और लय पर भी प्रतिक्रिया देते हैं।
लचीले सब्जेक्ट।OmniHuman 1.5 PicassoIA पर असली पोर्ट्रेट, पूरे शरीर के शॉट और चित्रित कैरेक्टर, तीनों स्वीकार करता है।
बहुभाषी ऑडियो। PicassoIA के पेज पर अंग्रेज़ी, स्पेनिश, जापानी, कोरियाई, चीनी और इंडोनेशियाई वॉइसओवर की सूची है।
OmniHuman 1 से क्या बदला
मूल मॉडल अब भी उपलब्ध है, और दोनों के बीच का फ़र्क इतना कम है कि कीमत भी फ़ैसले का हिस्सा बन जाती है। fal.ai की अपनी तुलना दोनों को साथ रखती है:
फ़ीचर
OmniHuman (मूल)
OmniHuman 1.5
fal.ai पर कीमत
$0.14 प्रति सेकंड
$0.16 प्रति सेकंड
रिज़ॉल्यूशन
तय, चुनने का विकल्प नहीं
720p या 1080p
ऑडियो सीमा
30 सेकंड
720p पर 60 सेकंड, 1080p पर 30 सेकंड
टर्बो मोड
उपलब्ध नहीं
उपलब्ध
कठिन इनपुट
कई बार कई प्रयास चाहिए
पहली बार में ज़्यादा भरोसेमंद
"कठिन इनपुट" का मतलब है आंशिक रूप से छिपे चेहरे, शोर वाला ऑडियो, कड़ी रोशनी और तिरछे पोर्ट्रेट। ये वही स्थितियाँ हैं जो पहले टेक को बिगाड़ देती थीं।
PicassoIA पर भी फ़र्क उतना ही साफ़ दिखता है। मूल OmniHuman पेज 15 सेकंड या उससे कम के ऑडियो की सलाह देता है, क्योंकि उससे ज़्यादा पर गुणवत्ता गिरने लगती है। OmniHuman 1.5 35 सेकंड से छोटी क्लिप स्वीकार करता है और इसमें टेक्स्ट प्रॉम्प्ट, फ़ास्ट मोड और सीड भी जुड़ते हैं।
OmniHuman 1.5 API की कीमत समझें
इस मॉडल में कीमत सबसे सरल हिस्सा है। आप जनरेट हुए वीडियो के हर सेकंड का भुगतान करते हैं, और आउटपुट उतना ही लंबा होता है जितना आपका ऑडियो। 12 सेकंड के वॉइसओवर पर आपको 12 सेकंड का वीडियो मिलता है और बिल $1.92 का आता है।
वीडियो के प्रति सेकंड की लागत
fal.ai की $0.16 प्रति सेकंड की दर पर आम क्लिप लंबाइयों की लागत यह है:
क्लिप की लंबाई
लागत
आम उपयोग
5 सेकंड
$0.80
पूरा रन करने से पहले का टेस्ट स्निपेट
15 सेकंड
$2.40
सोशल पोस्ट या छोटा अभिवादन
30 सेकंड
$4.80
प्रोडक्ट पिच, 1080p पर सबसे लंबी क्लिप
60 सेकंड
$9.60
एक्सप्लेनर, 720p पर सबसे लंबी क्लिप
पैमाने पर जाते ही तस्वीर तेज़ी से बदल जाती है। 30 सेकंड की सौ क्लिप $480 की पड़ती हैं। पूरे साल की हफ़्तेवार 20 सेकंड की अपडेट (52 क्लिप) की लागत $166.40 है। ठोस तस्वीर के लिए तीन यथार्थवादी मासिक बजट यह हैं:
परिदृश्य
आउटपुट
सेकंड
मासिक लागत
अकेला क्रिएटर
20 सेकंड की 8 क्लिप
160
$25.60
छोटी ऑनलाइन दुकान
15 सेकंड की 30 क्लिप
450
$72.00
ट्रेनिंग टीम
45 सेकंड के 40 लेसन
1,800
$288.00
1.5 रिलीज़ मूल से महंगा है, और fal.ai मूल की कीमत $0.14 प्रति सेकंड बताता है। 30 सेकंड की क्लिप पर यह $4.20 बनाम $4.80 है, यानी 60 सेंट ज़्यादा, या 14 प्रतिशत। 100 ऐसी क्लिप पर फ़र्क $60 का है। लंबी ऑडियो सीमा और रिज़ॉल्यूशन का चुनाव इस अतिरिक्त खर्च को सही ठहराता है या नहीं, यह पूरी तरह आपकी मात्रा पर निर्भर करता है।
💡 अपना होस्ट जाँचें। ऊपर के आँकड़े fal.ai से हैं। दूसरे API प्रोवाइडर अपनी दरें खुद तय करते हैं, इसलिए किसी अभियान का बजट बनाने से पहले अपने प्रोवाइडर की कीमत वाली लाइन ज़रूर पढ़ लें।
बिल घटाने के तरीके
आप हर सेकंड का भुगतान करते हैं, इसलिए बचत तब होती है जब कम सेकंड बर्बाद हों:
पहले 5 सेकंड पर टेस्ट करें। $0.80 का स्निपेट बता देगा कि पोर्ट्रेट काम करेगा या नहीं, इससे पहले कि आप पूरे मिनट के लिए $9.60 खर्च करें।
सन्नाटा काटें। ऑडियो फ़ाइल की शुरुआत और अंत की खामोशी भी बिलिंग वाला वीडियो बन जाती है।
ड्राफ़्ट जल्दी, फ़ाइनल धीरे। ड्राफ़्ट के लिए 720p या टर्बो मोड इस्तेमाल करें, फिर मंज़ूर किया हुआ टेक 1080p पर रेंडर करें। जाँचें कि आपका होस्ट टर्बो की कीमत अलग लेता है या नहीं।
B-roll पर कट करें। अवतार को 10 सेकंड बोलने दें, फिर 5 सेकंड प्रोडक्ट दिखाएँ। आप सिर्फ़ बोलने वाले सेकंडों का भुगतान करते हैं।
सीड सँभालकर रखें। जब कोई टेक अच्छा बने, तो PicassoIA पर उसका सीड दोबारा इस्तेमाल करें, ताकि एक ही तुक्के के लिए दो बार पैसे न देने पड़ें।
इनपुट, सीमाएँ और पैरामीटर
ज़्यादातर असफल रन इन्हीं कुछ इनपुट गलतियों से होते हैं। ये वे सीमाएँ हैं जो मायने रखती हैं।
इमेज और ऑडियो की ज़रूरतें
मॉडल को चलाने की दो जगहों के नियम थोड़े अलग हैं:
इनपुट
fal.ai API
PicassoIA
इमेज
image_url, JPEG या PNG, सार्वजनिक रूप से पहुँच योग्य
एक व्यक्ति, चेहरे या कैरेक्टर वाली फ़ोटो अपलोड करें
ऑडियो
audio_url, MP3, WAV या M4A
MP3, WAV और मिलते-जुलते फ़ॉर्मेट
ऑडियो की लंबाई
720p पर 60 सेकंड, 1080p पर 30 सेकंड
35 सेकंड से कम, लंबी फ़ाइलें फ़ेल होती हैं
रिज़ॉल्यूशन
720p या 1080p, डिफ़ॉल्ट 1080p
सेटिंग के रूप में उपलब्ध नहीं
वैकल्पिक इनपुट
prompt, turbo_mode, mask_url
प्रॉम्प्ट, फ़ास्ट मोड, सीड
अगर आप मॉडल को fal.ai के ज़रिए कॉल करते हैं, तो एंडपॉइंट fal-ai/bytedance/omnihuman/v1.5 है। @fal-ai/client इंस्टॉल करें, अपना fal.ai API टोकन एनवायरनमेंट वेरिएबल में सेट करें, और कॉल कुछ ऐसी दिखती है:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
input: {
image_url: "https://example.com/portrait.jpg",
audio_url: "https://example.com/voiceover.mp3",
resolution: "720p",
turbo_mode: false,
prompt: "Warm smile, small hand gestures, steady medium shot"
},
logs: true
});
console.log(result.data.video.url);
वीडियो का URL data.video.url पर वापस आता है। fal.ai बताता है कि यह लिंक लगभग 24 घंटे तक वैध रहता है, इसलिए फ़ाइल तुरंत डाउनलोड करके कहीं स्थायी जगह पर सेव कर लें।
रिज़ॉल्यूशन, टर्बो मोड और प्रॉम्प्ट
रिज़ॉल्यूशन। 1080p डिफ़ॉल्ट है और ऑडियो को 30 सेकंड तक सीमित करता है। 60 सेकंड तक की ज़रूरत हो या तेज़ जनरेशन चाहिए, तो 720p पर जाएँ।
टर्बो मोड। कुछ गुणवत्ता की कीमत पर तेज़ आउटपुट। पोर्ट्रेट जाँचने के लिए बढ़िया, फ़ाइनल डिलीवरी के लिए नहीं। PicassoIA इसी विचार को फ़ास्ट मोड कहता है।
प्रॉम्प्ट। भाव, मूवमेंट और कैमरे के लिए वैकल्पिक टेक्स्ट। PicassoIA चीनी, अंग्रेज़ी, जापानी, कोरियाई, स्पेनिश और इंडोनेशियाई में प्रॉम्प्ट स्वीकार करता है।
मास्क। fal.ai पर mask_url उस व्यक्ति को अलग करता है जिसे बोलना है, जब फ़्रेम में कई लोग हों।
प्रॉम्प्ट व्यवहार के बारे में लिखें, होंठों के बारे में नहीं। "शांत मुस्कान, हल्का सिर हिलाना, मेज़ पर टिके हाथ" "मुँह शब्दों के साथ चलता है" से बेहतर काम करता है, क्योंकि मुँह का काम ऑडियो पहले ही कर देता है।
व्यवहार में लिप सिंक की गुणवत्ता
लिप सिंक वह जगह है जहाँ अवतार मॉडल जीतते या हारते हैं, इसलिए इसे वैसे परखें जैसे दर्शक परखेंगे: फ़ोन पर, पूरी रफ़्तार से, आवाज़ चालू करके।
कहाँ यह अच्छा करता है
भावनात्मक मेल। मुस्कान, भौंहों की हरकत और सिर का झुकाव आवाज़ के लहजे के साथ चलते हैं, इसलिए उत्साह से भरी अदायगी सचमुच उत्साही लगती है।
उलझे इनपुट। fal.ai के अनुसार आंशिक रूप से छिपे चेहरों, शोर वाले ऑडियो, कठिन रोशनी और तिरछे पोर्ट्रेट को मूल मॉडल से बेहतर संभाला जाता है।
एकल वक्ता वाली क्लिप। 10 से 30 सेकंड का एकालाप सबसे अच्छा रहता है: एक पिच, एक घोषणा, एक पाठ की भूमिका।
चित्रित कैरेक्टर। मैस्कॉट और स्टाइलाइज़्ड पोर्ट्रेट भी एनिमेट होते हैं, जो बिना स्पोक्सपर्सन वाले ब्रांड के काम आता है।
अब भी कहाँ दिक्कत है
लंबाई की सीमा। PicassoIA पर 35 सेकंड से कम और fal.ai पर अधिकतम 60 सेकंड। लंबी स्क्रिप्ट को दृश्यों में बाँटकर एक साथ जोड़ना होगा।
इंतज़ार का समय। PicassoIA के फ़ास्ट मोड के तीन प्रकाशित उदाहरण 197, 280 और 370 सेकंड, यानी हर एक लगभग 3 से 6 मिनट, में पूरे हुए। इससे लाइव चैट या रीयल-टाइम उपयोग संभव नहीं।
दोबारा रन। बेहतर भरोसेमंदता के बावजूद कठिन पोर्ट्रेट पर कभी-कभार दूसरे प्रयास का बजट रखें।
कमज़ोर इनपुट। बहुत छोटा, धुंधला या भारी फ़िल्टर वाला चेहरा कमज़ोर नतीजा देता है। सपाट, एक-सुर वाला वॉइसओवर सपाट प्रदर्शन देता है।
अवतार वीडियो के असली उपयोग
सबसे मज़बूत उपयोग-मामलों में एक बात समान है: स्क्रीन पर किसी व्यक्ति का दिखना ज़रूरी है, लेकिन उस व्यक्ति की शूटिंग धीमी, महँगी या असंभव है।
प्रोडक्ट एक्सप्लेनर और विज्ञापन
एक छोटा दुकानदार अपने एक फ़ाउंडर की फ़ोटो से हर नए आइटम के लिए 20 सेकंड की प्रोडक्ट पिच बना सकता है। इसे एक बार ऑडियो में रिकॉर्ड करें और स्क्रिप्ट बदलने पर ताज़ा करते रहें।
यह फ़ॉर्मेट लैंडिंग पेज, पेड सोशल और मार्केटप्लेस लिस्टिंग के लिए अच्छा काम करता है, जहाँ एक छोटा मानवीय चेहरा भरोसा बढ़ाता है। बोलने वाली क्लिप को प्रोडक्ट B-roll के साथ जोड़ें, तो अवतार को सिर्फ़ शुरुआती हुक और अंतिम ऑफ़र के लिए बोलना पड़ता है।
ट्रेनिंग और शिक्षा
कोर्स बनाने वाले कैमरे पर रिकॉर्ड किए बिना हर लेसन के लिए एक प्रेज़ेंटर बना सकते हैं। लेसन का परिचय लिखें, ऑडियो रिकॉर्ड करें, और पोर्ट्रेट से उसे बुलवाएँ। हर क्लिप को लंबाई की सीमा के भीतर रखें और पूरे लेसन में कई छोटी क्लिप जोड़ें।
आंतरिक टीमें यही तरकीब ऑनबोर्डिंग संदेशों और पॉलिसी अपडेट के लिए इस्तेमाल करती हैं, जहाँ सिनेमाई चमक से ज़्यादा ज़रूरी एक स्थिर चेहरा होता है।
बहुभाषी संदेश
एक पोर्ट्रेट कई आवाज़ें ले जा सकता है। एक ही स्क्रिप्ट को स्पेनिश, जापानी और अंग्रेज़ी में रिकॉर्ड या जनरेट करें, फिर हर फ़ाइल को उसी फ़ोटो पर चलाएँ। होंठ भाषा के साथ चलते हैं, उसके खिलाफ़ नहीं।
अगर आपके पास पहले से शूट किया हुआ फ़ुटेज है और उसे सिर्फ़ डब करना है, तो Video Translate यह काम करता है, जबकि जब आपके पास सिर्फ़ एक स्थिर फ़ोटो हो तो OmniHuman 1.5 बेहतर विकल्प है।
💡 असली चेहरों का ज़िम्मेदारी से इस्तेमाल करें। किसी असली व्यक्ति की फ़ोटो को तभी एनिमेट करें जब आपके पास उसकी अनुमति हो, दर्शकों को गुमराह करने के लिए किसी की नकल न करें, और जहाँ प्लेटफ़ॉर्म माँगे वहाँ सिंथेटिक वीडियो पर लेबल लगाएँ।
PicassoIA पर OmniHuman 1.5 कैसे इस्तेमाल करें
आपको किसी API अकाउंट या कोड की ज़रूरत नहीं है। OmniHuman 1.5 PicassoIA पर ब्राउज़र से चलता है: दो अपलोड, एक वैकल्पिक प्रॉम्प्ट, और एक क्लिक।
पोर्ट्रेट तैयार करें
ऐसी फ़ोटो चुनें जिसमें चेहरा साफ़ दिखे, रोशनी समान हो और चेहरा कैमरे की ओर या हल्का मुड़ा हो। धूप के चश्मे, भारी फ़िल्टर और भीड़ में छोटे चेहरों से बचें।
कोई सही फ़ोटो नहीं है? Seedream 4.5 से एक बनाएँ, जो 16:9 और दूसरे अनुपातों में 2K या 4K इमेज देता है। एक यथार्थवादी व्यक्ति, तटस्थ भाव और नरम खिड़की की रोशनी का वर्णन करें, फिर नतीजे को अपने अवतार के रूप में इस्तेमाल करें।
अपना ऑडियो जोड़ें
अपनी आवाज़ रिकॉर्ड करें, या Speech 2.8 HD या ElevenLabs v3 से वॉइसओवर जनरेट करें। इसे MP3 या WAV में एक्सपोर्ट करें और 35 सेकंड से कम रखें, क्योंकि लंबी फ़ाइलें जनरेशन को फ़ेल कर देती हैं। बैकग्राउंड संगीत हटा दें, क्योंकि साफ़ बोली हुई आवाज़ से सबसे अच्छा सिंक मिलता है।
रन करें और नतीजा जाँचें
इमेज और ऑडियो अपलोड करें, दिशा चाहिए तो प्रॉम्प्ट जोड़ें, और रन शुरू करें। PicassoIA के प्रकाशित फ़ास्ट मोड उदाहरण लगभग 3 से 6 मिनट में पूरे हुए। फिर क्लिप को इस क्रम में देखें:
पहले दो सेकंड, जहाँ सिंक की गलतियाँ सबसे पहले दिखती हैं।
लंबे स्वरों पर दाँत और होंठों के कोने।
हाथ और कंधे, ताकि देखा जा सके कि हरकत स्वाभाविक लगती है या नहीं।
हर पैरामीटर कैसे व्यवहार करता है:
पैरामीटर
क्या करता है
सुझाव
इमेज
बोलने वाला व्यक्ति
सामने से, साफ़, अच्छी रोशनी में
ऑडियो
बोलने और लंबाई को चलाता है
35 सेकंड से कम, बिना संगीत
प्रॉम्प्ट
दृश्य, मूवमेंट और कैमरा
व्यवहार बताएँ, होंठ नहीं
फ़ास्ट मोड
बारीकी के बदले रफ़्तार
ड्राफ़्ट के लिए चालू, फ़ाइनल के लिए बंद
सीड
टेक को दोहराने लायक बनाता है
जो भी अच्छा टेक हो, उसका सीड सेव करें
शुरुआत के लिए कॉपी करने लायक तीन प्रॉम्प्ट:
"Friendly presenter, relaxed shoulders, small nods, steady medium shot."
"Energetic delivery, wide smile, expressive hand gestures, soft daylight."
"Calm and serious tone, minimal movement, slow push in on the face."
परखने लायक दूसरे अवतार मॉडल
कोई एक मॉडल हर काम नहीं जीतता, और इनमें से हर एक उसी प्लेटफ़ॉर्म पर उपलब्ध है, इसलिए साथ-साथ टेस्ट करने में बस कुछ मिनट लगते हैं।
इनपुट के हिसाब से चुनें। अगर आप एक फ़ोटो और एक रिकॉर्डिंग से शुरू कर रहे हैं, तो OmniHuman 1.5 से शुरू करें और उसकी तुलना Fabric 1.0 या Kling Avatar v2 से करें। अगर आपके पास सिर्फ़ लिखी हुई स्क्रिप्ट है और आवाज़ नहीं, तो P Video Avatar उसे बोल सकता है। अगर वीडियो पहले ही शूट हो चुका है और आपको सिर्फ़ नए होंठ चाहिए, तो Lipsync 2 Pro नए ऑडियो ट्रैक से मेल खाने के लिए मुँह की हरकत फिर से बनाता है।
आज ही अपनी पहली बोलती फ़ोटो बनाएँ
कीमत के बारे में पढ़ना एक हद तक ही मदद करता है। OmniHuman 1.5 को परखने का सबसे तेज़ तरीका यह है कि अपना पोर्ट्रेट और 10 सेकंड का वॉइस नोट दें, फिर पूरी रफ़्तार पर नतीजा देखें।
Seedream 4.5 से एक चेहरा बनाएँ, एक छोटी पंक्ति रिकॉर्ड या सिंथेसाइज़ करें, और दोनों को OmniHuman 1.5 से चलाएँ। एक ही फ़ोटो को तीन अलग आवाज़ों के साथ आज़माएँ। प्रॉम्प्ट को "calm and steady" से "energetic, wide smile" में बदलें और टेक की तुलना करें।
यहाँ बताया गया हर मॉडल picassoia.com/en/all-models पर एक ही जगह मौजूद है। उसे खोलें, दो अवतार मॉडल चुनें, और कॉफ़ी ठंडी होने से पहले अपना पहला बोलता वीडियो बना लें।