Kling Avatar 2.0 API: تسعير مزامنة الشفاه وأمثلة عملية
يحوّل Kling Avatar 2.0 صورة واحدة وملف صوتي واحدًا إلى فيديو يتحدث فيه الشخص. يعرض هذا المقال أسعار الثانية الواحدة في واجهات fal وPoYo وPicsart، ويقدّم طلبًا يعمل فعليًا، ويجري حسابات التكلفة على أطوال مقاطع حقيقية، ويقارن بين نماذج تحويل الصورة الناطقة التي يمكنك تشغيلها على PicassoIA.
يأخذ Kling Avatar 2.0 صورة شخصية واحدة وملفًا صوتيًا واحدًا، ويُعيد فيديو ناطقًا تتبع فيه الشفاه والعينان وحركة الرأس الكلام. يُباع النموذج بحسب الثانية من الصوت، ما يجعل تسعير مزامنة الشفاه في Kling Avatar 2.0 API سهل التوقع بمجرد أن تعرف أي مزوّد تستخدم وأي فئة تختار. يضع هذا المقال الأرقام الفعلية جنبًا إلى جنب: 0.056 دولار للثانية على fal، و0.035 دولار على PoYo، و2 نقطة على Picsart، وأسعار Pro تقارب ضعف كل واحد منها. كما ستجد طلبًا يعمل، وثلاثة أمثلة بأسلوب الإنتاج، وقواعد للمدخلات تمنع المخرجات الرديئة، ودليلًا لأقرب نماذج مزامنة الشفاه على PicassoIA.
ما الذي يفعله Kling Avatar 2.0
Kling Avatar 2.0 نموذج أفاتار يعتمد على الصوت من عائلة Kling. تزوّده بصورة ثابتة وتسجيل كلام، فيحرّك الوجه بحيث تتبع أشكال الفم المقاطع الصوتية، وتحافظ العينان على التواصل مع العدسة، وتتحرك الرأس والكتفان كما يتحرك متحدث حقيقي. لا يتطلب ذلك لقطات كاميرا ولا هيكلًا ثلاثي الأبعاد، ويبقى تعريف الشخص في الصورة ثابتًا من الإطار الأول حتى الأخير.
صورة واحدة وملف صوتي واحد
متطلبات المدخلات بسيطة. تطلب كل الجهات التي راجعتها الأشياء الثلاثة نفسها:
صورة واحدة لشخص أو حيوان أو شخصية كرتونية أو شخصية مُنمّطة. يقبل PoYo ملفات JPEG وPNG وWebP حتى 10 ميغابايت.
ملف صوتي واحد يحتوي على الكلام. يقبل PoYo من 2 إلى 60 ثانية وحتى 5 ميغابايت، بينما تذكر Hedra نطاقًا من 2 إلى 300 ثانية، لذا تحقق من حد المزوّد الذي تنوي استدعاءه.
أمر نصي اختياري يصف العاطفة أو الإيماءة أو سلوك الكاميرا، مثل "مقدّم هادئ، إيماءة صغيرة من الرأس في نهاية كل جملة."
المخرجات ملف MP4. تذكر Hedra أن نسب العرض إلى الارتفاع المدعومة هي 16:9 و9:16 و1:1، وهي مناسبة لـ YouTube وReels ومنشورات المربعات.
فئتا Standard وPro
تقبل الفئتان المدخلات نفسها. الفرق في جودة المخرجات وفي السعر.
Standard
Pro
موجّهة لـ
التوليد بكميات كبيرة، النماذج الأولية السريعة، الفيديوهات التعليمية
الفيديوهات التسويقية، أعمال العملاء، المحتوى الرئيسي
السعر مقارنة بالفئة الأخرى
الأساس
نحو 2x سعر Standard
نقطة نهاية fal
fal-ai/kling-video/ai-avatar/v2/standard
fal-ai/kling-video/ai-avatar/v2/pro
المدخلات
صورة، صوت، أمر نصي اختياري
نفسها
💡 تختلف ادعاءات الدقة بحسب المزوّد. تذكر APIPass دقة 720p لفئة Standard و1080p لفئة Pro، بينما تذكر Hedra دقة 720p أصلية لفئة Pro. صيّر مقطعًا تجريبيًا واحدًا وتحقق من الملف قبل أن تشغّل دفعة كاملة.
مقارنة تسعير Kling Avatar 2.0 API
التسعير هو أكثر ما يختلف فيه المزوّدون. يُحتسب السعر بحسب الثانية من الصوت، لذا تكلّف التعليقات الصوتية الأطول أكثر مهما كانت الصورة بسيطة.
أسعار الثانية الواحدة لكل مزوّد
المزوّد
Standard
Pro
ملاحظات الفوترة
fal
0.056 دولار للثانية
0.115 دولار للثانية
الأسعار كما ذكرها PoYo وHedra
PoYo
0.035 دولار للثانية (7 نقاط)
0.070 دولار للثانية (14 نقطة)
تُقرّب مدة الصوت إلى الثانية التالية
Picsart API
2 نقطة للثانية
4 نقاط للثانية
سعر النقطة يعتمد على خطتك في Picsart
APIPass
نقاط للثانية
نقاط للثانية
الأرقام التي وجدتها كانت غير متسقة
تضع صفحة PoYo سعر Standard أقل بنحو 38% من سعر fal، وسعر Pro أقل بنحو 39%، وهذا يطابق الحساب: 0.035 مقابل 0.056، و0.070 مقابل 0.115.
💡 تحقق قبل وضع الميزانية. اختلفت لقطتان من صفحة تسعير APIPass بنحو عشرة أضعاف، لذا استبعدت سعرها من حسابات التكلفة أدناه. أكّد سعر أي مزوّد من لوحة التحكم الخاصة به قبل أن تضع دفعة كبيرة في الطابور.
أمثلة التكلفة بالأحجام الحقيقية
الفوترة خطية: ثواني الصوت مضروبة في السعر. قرّب كل مقطع إلى الأعلى أولًا. يُحتسب تعليق صوتي مدته 12.3 ثانية على أنه 13 ثانية، فيكلّف على fal Standard 13 × 0.056، أي 0.73 دولار.
طول المقطع
fal Standard
fal Pro
PoYo Standard
PoYo Pro
10 ثوانٍ
0.56 دولار
1.15 دولار
0.35 دولار
0.70 دولار
30 ثانية
1.68 دولار
3.45 دولار
1.05 دولار
2.10 دولار
60 ثانية
3.36 دولار
6.90 دولار
2.10 دولار
4.20 دولار
تتسع الفجوة مع الحجم. تبلغ دفعة من 500 مقطع بطول 30 ثانية لكل منها 15,000 ثانية من الصوت:
المزوّد والفئة
500 مقطع بطول 30 ثانية
fal Standard
840 دولارًا
fal Pro
1,725 دولارًا
PoYo Standard
525 دولارًا
PoYo Pro
1,050 دولارًا
يستحق Pro علاوته عندما يبقى الوجه على الشاشة دقيقة كاملة، مثل إعلان مدفوع. أما Standard فهو الخيار المنطقي الافتراضي لمقاطع التدريب الداخلي والمسودات واختبارات A/B للنصوص.
💡 خصّص ميزانية لإعادة المحاولة. أثناء ضبط الصور والأوامر النصية ستحتاج بعض المقاطع إلى تصيير ثانٍ. أضف هامشًا بنسبة 20 إلى 30 بالمئة إلى تقدير دفعتك الأولى، ثم قلّصه بعد أن تستقر إعداداتك.
تنسيق الطلب وحدوده
يغلّف كل مزوّد النموذج نفسه بهيكل مختلف قليلًا. يوضح المثالان الشكل العام.
المدخلات وحدود الملفات
المعامل
مطلوب
ملاحظات
image_url / image
نعم
JPEG أو PNG أو WebP حتى 10 ميغابايت. تطلب APIPass أيضًا 300 بكسل على الأقل ونسبة عرض إلى ارتفاع بين 1:2.5 و2.5:1
audio_url / audio
نعم
MP3 أو WAV أو M4A أو AAC في APIPass، والحد الأقصى 5 ميغابايت في PoYo وAPIPass
prompt
لا
القيمة الافتراضية "." في fal. تقبل APIPass حتى 2,500 حرف
mode
APIPass فقط
std أو pro
طلب fal يعمل
في fal، لكل فئة نقطة نهاية خاصة بها، ويمرّ العمل عبر طابور. يستخدم استدعاء JavaScript التالي العميل الرسمي وينتظر النتيجة:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
input: {
image_url: "https://example.com/presenter.jpg",
audio_url: "https://example.com/voiceover.mp3",
prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
},
logs: true,
});
console.log(result.data.video.url, result.data.duration);
بدّل نقطة النهاية إلى fal-ai/kling-video/ai-avatar/v2/pro لفئة Pro. تحتوي الاستجابة على ملف video برابط تنزيل، وعلى duration بالثواني، وهو رقم مفيد لتسجيله مقابل فاتورتك.
تستخدم APIPass مسار إنشاء مهمة واحدًا وحقلًا mode بدلًا من ذلك:
ترسل هذا الجسم بطريقة POST إلى https://api.apipass.dev/api/v1/jobs/createTask مع رمز Bearer في ترويسة Authorization، فترجع الاستجابة taskId. يتبع PoYo النمط نفسه: استدعاء إرسال غير متزامن، ثم إما استدعاء ارتجاعي عبر webhook أو استطلاع الحالة بمعرّف المهمة.
💡 استخدم webhooks في الإنتاج. تصيير الأفاتار مهام في طابور، وليس استجابات فورية. يُبقي webhook عمّالك متفرغين، بينما تستهلك حلقة الاستطلاع الطلبات أثناء انتظارك.
أمثلة مزامنة الشفاه التي تنجح
تُظهر ثلاثة إعدادات أين يكون السعر لكل ثانية مجزيًا.
فيديوهات المتحدثين الرسميين
تريد علامة تجارية للعناية بالبشرة 40 مقطعًا تسويقيًا بطول 20 ثانية لكل منها، واحد لكل مكوّن. أي 800 ثانية من الصوت. على fal Standard تكلّف 44.80 دولارًا، وعلى PoYo Pro تكلّف 56 دولارًا، وعلى fal Pro تكلّف 92 دولارًا. قارن ذلك بحجز مقدّم وأستوديو ليوم كامل لكل نسخة. تُستخدم الصورة الشخصية نفسها في كل مقطع، فيبقى الوجه ثابتًا عبر السلسلة كلها.
💡 أمر نصي تجربه: "مقدّمة دافئة وواثقة، تواصل بصري ثابت، إيماءات خفيفة من الرأس، كتفان مسترخيان."
سرد الدورات التعليمية
درس مدته 10 دقائق يعني 600 ثانية من السرد. قسّمه إلى عشرة مقاطع بطول 60 ثانية لكل منها، حتى يلائم كل مقطع أصرم حد صوتي وجدته، ثم أعد استخدام صورة واحدة لها جميعًا. على PoYo Standard يكلّف الدرس 21.00 دولارًا، وعلى fal Standard يكلّف 33.60 دولارًا. يُبقي القطع عند حدود الجمل الوصلات غير ملحوظة، لأن المتحدث يكون في حالة استرخاء بين الجمل.
نسخ متعددة اللغات
صورة واحدة مع نص واحد بثلاث لغات تعطيك ثلاثة مقاطع. بطول 30 ثانية لكل منها على fal Standard، يكون المجموع 90 ثانية و5.04 دولار. أنشئ صوت كل لغة بنموذج تحويل نص إلى كلام مثل MiniMax Speech 2.8 HD أو ElevenLabs V3، ثم مرّر كل ملف إلى نموذج الأفاتار. وإذا كان لديك فيديو جاهز بالفعل، فإن HeyGen Video Translate يدبلجه مباشرة بدلًا من ذلك.
تعمل الشخصيات المُنمّطة والحيوانات أيضًا، لأن النموذج يقبل الرسوم الكرتونية والوجوه غير البشرية. جرّب بعض التصييرات قبل أن تبني سلسلة كاملة حول شخصية الماسكوت (mascot).
جهّز المدخلات لنتائج أفضل
تعود معظم التصييرات الرديئة إلى المدخلات، لا إلى النموذج. أصلح هذه الأمور قبل أن تنفق النقاط.
قواعد الصور
واجه الكاميرا. يمنح إطار الرأس والكتفين المستقيم أمام العدسة النموذج أكبر قدر من البنية الوجهية ليحركها.
أبقِ الفم مغلقًا أو محايدًا. قد تبدو الابتسامة العريضة التي تظهر فيها الأسنان في المصدر غريبة بمجرد أن تبدأ الشفاه في الحركة.
أظهر الأذنين وخط الشعر. الحواف الواضحة تساعد الرأس على الحفاظ على خط خارجي ثابت أثناء الحركة.
أضئ الوجه بالتساوي. ضوء النافذة الناعم من الأمام أفضل من ظل جانبي قاسٍ.
ابدأ من 300 بكسل أو أكثر في الضلع القصير. إذا كانت صورتك الشخصية صغيرة، فارفع دقتها أولًا باستخدام Crystal Upscaler، وهي مصممة للصور الشخصية.
قواعد الصوت والأمر النصي
متحدث واحد في كل ملف. الأصوات المتداخلة لا تعطي الفم شيئًا واضحًا يتبعه.
لا موسيقى تحت الصوت. أضف الموسيقى بعد تصيير الأفاتار.
اقطع الصمت من الطرفين. تدفع مقابل كل ثانية من الصوت، بما في ذلك الصمت.
التزم بحد المزوّد. أقصر حد وجدته هو 60 ثانية، والحد الأدنى هو 2 ثانيتان.
اجعل الأمر النصي قصيرًا. يكفي سطر عن الانفعال، وسطر عن الإيماءات، وسطر عن الكاميرا. الأمر النصي الطويل ينافس الصوت بدلًا من أن يدعمه.
كيف تستخدم مزامنة شفاه Kling
Kling Avatar 2.0 نفسه غير مدرج في كتالوج مزامنة الشفاه على PicassoIA وقت كتابة هذا المقال. الخيار الخاص بـ Kling الموجود هناك، Kling Lip Sync، يحل مشكلة مجاورة: يطابق فم المتحدث في مقطع فيديو موجود مع مسار صوتي جديد، أو مع نص تكتبه. يقبل مقاطع MP4 وMOV بطول بين 2 و10 ثوانٍ وبدقة من 720p إلى 1080p.
💡 جرّب مقطعًا واحدًا قبل الدفعة. شغّل الصورة الشخصية نفسها و10 ثوانٍ من الصوت نفسه عبر نموذجين، ثم قارن أشكال الفم في الأصوات الصعبة مثل "p" و"b" و"m".
جرّب فيديو مزامنة الشفاه الخاص بك
اختر مقطعًا واحدًا واختبره قبل أن تخطط لدفعة: صورة شخصية واحدة، و10 ثوانٍ من صوت نظيف، فئة واحدة. شغّله عبر Omni Human 1.5 أو Fabric 1.0 على PicassoIA، وقارن أشكال الفم بالصوت، واحفظ الإعدادات الفائزة كقالب لك. بعد ذلك أنشئ الصورة الشخصية نفسها باستخدام نماذج الصور في المنصة، ثم سجّل الصوت أو ولّده، وحرّكه. افتح PicassoIA، وارفع أول صورة لك، وانظر إلى المدى الذي يمكن أن تصل إليه صورة ثابتة واحدة وتسجيل صوتي قصير.