Kling Avatar 2.0 API: تسعير مزامنة الشفاه وأمثلة عملية

يحوّل Kling Avatar 2.0 صورة واحدة وملف صوتي واحدًا إلى فيديو يتحدث فيه الشخص. يعرض هذا المقال أسعار الثانية الواحدة في واجهات fal وPoYo وPicsart، ويقدّم طلبًا يعمل فعليًا، ويجري حسابات التكلفة على أطوال مقاطع حقيقية، ويقارن بين نماذج تحويل الصورة الناطقة التي يمكنك تشغيلها على PicassoIA.

Kling Avatar 2.0 API: تسعير مزامنة الشفاه وأمثلة عملية
Cristian Da Conceicao
مؤسس Picasso IA

يأخذ Kling Avatar 2.0 صورة شخصية واحدة وملفًا صوتيًا واحدًا، ويُعيد فيديو ناطقًا تتبع فيه الشفاه والعينان وحركة الرأس الكلام. يُباع النموذج بحسب الثانية من الصوت، ما يجعل تسعير مزامنة الشفاه في Kling Avatar 2.0 API سهل التوقع بمجرد أن تعرف أي مزوّد تستخدم وأي فئة تختار. يضع هذا المقال الأرقام الفعلية جنبًا إلى جنب: 0.056 دولار للثانية على fal، و0.035 دولار على PoYo، و2 نقطة على Picsart، وأسعار Pro تقارب ضعف كل واحد منها. كما ستجد طلبًا يعمل، وثلاثة أمثلة بأسلوب الإنتاج، وقواعد للمدخلات تمنع المخرجات الرديئة، ودليلًا لأقرب نماذج مزامنة الشفاه على PicassoIA.

ما الذي يفعله Kling Avatar 2.0

Kling Avatar 2.0 نموذج أفاتار يعتمد على الصوت من عائلة Kling. تزوّده بصورة ثابتة وتسجيل كلام، فيحرّك الوجه بحيث تتبع أشكال الفم المقاطع الصوتية، وتحافظ العينان على التواصل مع العدسة، وتتحرك الرأس والكتفان كما يتحرك متحدث حقيقي. لا يتطلب ذلك لقطات كاميرا ولا هيكلًا ثلاثي الأبعاد، ويبقى تعريف الشخص في الصورة ثابتًا من الإطار الأول حتى الأخير.

مصوّر يضبط الإضاءة لصورة استوديو لامرأة مبتسمة ترتدي بليزر كحلي

صورة واحدة وملف صوتي واحد

متطلبات المدخلات بسيطة. تطلب كل الجهات التي راجعتها الأشياء الثلاثة نفسها:

  • صورة واحدة لشخص أو حيوان أو شخصية كرتونية أو شخصية مُنمّطة. يقبل PoYo ملفات JPEG وPNG وWebP حتى 10 ميغابايت.
  • ملف صوتي واحد يحتوي على الكلام. يقبل PoYo من 2 إلى 60 ثانية وحتى 5 ميغابايت، بينما تذكر Hedra نطاقًا من 2 إلى 300 ثانية، لذا تحقق من حد المزوّد الذي تنوي استدعاءه.
  • أمر نصي اختياري يصف العاطفة أو الإيماءة أو سلوك الكاميرا، مثل "مقدّم هادئ، إيماءة صغيرة من الرأس في نهاية كل جملة."

المخرجات ملف MP4. تذكر Hedra أن نسب العرض إلى الارتفاع المدعومة هي 16:9 و9:16 و1:1، وهي مناسبة لـ YouTube وReels ومنشورات المربعات.

فئتا Standard وPro

تقبل الفئتان المدخلات نفسها. الفرق في جودة المخرجات وفي السعر.

StandardPro
موجّهة لـالتوليد بكميات كبيرة، النماذج الأولية السريعة، الفيديوهات التعليميةالفيديوهات التسويقية، أعمال العملاء، المحتوى الرئيسي
السعر مقارنة بالفئة الأخرىالأساسنحو 2x سعر Standard
نقطة نهاية falfal-ai/kling-video/ai-avatar/v2/standardfal-ai/kling-video/ai-avatar/v2/pro
المدخلاتصورة، صوت، أمر نصي اختيارينفسها

💡 تختلف ادعاءات الدقة بحسب المزوّد. تذكر APIPass دقة 720p لفئة Standard و1080p لفئة Pro، بينما تذكر Hedra دقة 720p أصلية لفئة Pro. صيّر مقطعًا تجريبيًا واحدًا وتحقق من الملف قبل أن تشغّل دفعة كاملة.

مقارنة تسعير Kling Avatar 2.0 API

التسعير هو أكثر ما يختلف فيه المزوّدون. يُحتسب السعر بحسب الثانية من الصوت، لذا تكلّف التعليقات الصوتية الأطول أكثر مهما كانت الصورة بسيطة.

مكتب عليه آلة حاسبة ودفتر وفنجان قهوة إسبريسو يُرى من الأعلى

أسعار الثانية الواحدة لكل مزوّد

المزوّدStandardProملاحظات الفوترة
fal0.056 دولار للثانية0.115 دولار للثانيةالأسعار كما ذكرها PoYo وHedra
PoYo0.035 دولار للثانية (7 نقاط)0.070 دولار للثانية (14 نقطة)تُقرّب مدة الصوت إلى الثانية التالية
Picsart API2 نقطة للثانية4 نقاط للثانيةسعر النقطة يعتمد على خطتك في Picsart
APIPassنقاط للثانيةنقاط للثانيةالأرقام التي وجدتها كانت غير متسقة

تضع صفحة PoYo سعر Standard أقل بنحو 38% من سعر fal، وسعر Pro أقل بنحو 39%، وهذا يطابق الحساب: 0.035 مقابل 0.056، و0.070 مقابل 0.115.

💡 تحقق قبل وضع الميزانية. اختلفت لقطتان من صفحة تسعير APIPass بنحو عشرة أضعاف، لذا استبعدت سعرها من حسابات التكلفة أدناه. أكّد سعر أي مزوّد من لوحة التحكم الخاصة به قبل أن تضع دفعة كبيرة في الطابور.

أمثلة التكلفة بالأحجام الحقيقية

الفوترة خطية: ثواني الصوت مضروبة في السعر. قرّب كل مقطع إلى الأعلى أولًا. يُحتسب تعليق صوتي مدته 12.3 ثانية على أنه 13 ثانية، فيكلّف على fal Standard 13 × 0.056، أي 0.73 دولار.

طول المقطعfal Standardfal ProPoYo StandardPoYo Pro
10 ثوانٍ0.56 دولار1.15 دولار0.35 دولار0.70 دولار
30 ثانية1.68 دولار3.45 دولار1.05 دولار2.10 دولار
60 ثانية3.36 دولار6.90 دولار2.10 دولار4.20 دولار

تتسع الفجوة مع الحجم. تبلغ دفعة من 500 مقطع بطول 30 ثانية لكل منها 15,000 ثانية من الصوت:

المزوّد والفئة500 مقطع بطول 30 ثانية
fal Standard840 دولارًا
fal Pro1,725 دولارًا
PoYo Standard525 دولارًا
PoYo Pro1,050 دولارًا

يستحق Pro علاوته عندما يبقى الوجه على الشاشة دقيقة كاملة، مثل إعلان مدفوع. أما Standard فهو الخيار المنطقي الافتراضي لمقاطع التدريب الداخلي والمسودات واختبارات A/B للنصوص.

💡 خصّص ميزانية لإعادة المحاولة. أثناء ضبط الصور والأوامر النصية ستحتاج بعض المقاطع إلى تصيير ثانٍ. أضف هامشًا بنسبة 20 إلى 30 بالمئة إلى تقدير دفعتك الأولى، ثم قلّصه بعد أن تستقر إعداداتك.

تنسيق الطلب وحدوده

يغلّف كل مزوّد النموذج نفسه بهيكل مختلف قليلًا. يوضح المثالان الشكل العام.

مطوّر يكتب على مكتب قائم مع شاشتين

المدخلات وحدود الملفات

المعاملمطلوبملاحظات
image_url / imageنعمJPEG أو PNG أو WebP حتى 10 ميغابايت. تطلب APIPass أيضًا 300 بكسل على الأقل ونسبة عرض إلى ارتفاع بين 1:2.5 و2.5:1
audio_url / audioنعمMP3 أو WAV أو M4A أو AAC في APIPass، والحد الأقصى 5 ميغابايت في PoYo وAPIPass
promptلاالقيمة الافتراضية "." في fal. تقبل APIPass حتى 2,500 حرف
modeAPIPass فقطstd أو pro

طلب fal يعمل

في fal، لكل فئة نقطة نهاية خاصة بها، ويمرّ العمل عبر طابور. يستخدم استدعاء JavaScript التالي العميل الرسمي وينتظر النتيجة:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
  input: {
    image_url: "https://example.com/presenter.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
  },
  logs: true,
});

console.log(result.data.video.url, result.data.duration);

بدّل نقطة النهاية إلى fal-ai/kling-video/ai-avatar/v2/pro لفئة Pro. تحتوي الاستجابة على ملف video برابط تنزيل، وعلى duration بالثواني، وهو رقم مفيد لتسجيله مقابل فاتورتك.

تستخدم APIPass مسار إنشاء مهمة واحدًا وحقلًا mode بدلًا من ذلك:

{
  "model": "kling/avatar-v2",
  "callBackUrl": "https://your-domain.com/api/callback",
  "input": {
    "image": "https://example.com/avatar-image.jpg",
    "audio": "https://example.com/speech-audio.mp3",
    "prompt": "Professional spokesperson with confident gestures",
    "mode": "std"
  }
}

ترسل هذا الجسم بطريقة POST إلى https://api.apipass.dev/api/v1/jobs/createTask مع رمز Bearer في ترويسة Authorization، فترجع الاستجابة taskId. يتبع PoYo النمط نفسه: استدعاء إرسال غير متزامن، ثم إما استدعاء ارتجاعي عبر webhook أو استطلاع الحالة بمعرّف المهمة.

💡 استخدم webhooks في الإنتاج. تصيير الأفاتار مهام في طابور، وليس استجابات فورية. يُبقي webhook عمّالك متفرغين، بينما تستهلك حلقة الاستطلاع الطلبات أثناء انتظارك.

أمثلة مزامنة الشفاه التي تنجح

تُظهر ثلاثة إعدادات أين يكون السعر لكل ثانية مجزيًا.

فيديوهات المتحدثين الرسميين

امرأة ترتدي بليزر فحمي تقدّم زجاجة عنبرية صغيرة أمام الكاميرا

تريد علامة تجارية للعناية بالبشرة 40 مقطعًا تسويقيًا بطول 20 ثانية لكل منها، واحد لكل مكوّن. أي 800 ثانية من الصوت. على fal Standard تكلّف 44.80 دولارًا، وعلى PoYo Pro تكلّف 56 دولارًا، وعلى fal Pro تكلّف 92 دولارًا. قارن ذلك بحجز مقدّم وأستوديو ليوم كامل لكل نسخة. تُستخدم الصورة الشخصية نفسها في كل مقطع، فيبقى الوجه ثابتًا عبر السلسلة كلها.

💡 أمر نصي تجربه: "مقدّمة دافئة وواثقة، تواصل بصري ثابت، إيماءات خفيفة من الرأس، كتفان مسترخيان."

سرد الدورات التعليمية

محاضر يسجّل درسًا على الإنترنت في ركن دراسة منزلي

درس مدته 10 دقائق يعني 600 ثانية من السرد. قسّمه إلى عشرة مقاطع بطول 60 ثانية لكل منها، حتى يلائم كل مقطع أصرم حد صوتي وجدته، ثم أعد استخدام صورة واحدة لها جميعًا. على PoYo Standard يكلّف الدرس 21.00 دولارًا، وعلى fal Standard يكلّف 33.60 دولارًا. يُبقي القطع عند حدود الجمل الوصلات غير ملحوظة، لأن المتحدث يكون في حالة استرخاء بين الجمل.

نسخ متعددة اللغات

مهندس صوت يضبط مفتاح تحكم بينما يسجّل متحدث خلف زجاج

صورة واحدة مع نص واحد بثلاث لغات تعطيك ثلاثة مقاطع. بطول 30 ثانية لكل منها على fal Standard، يكون المجموع 90 ثانية و5.04 دولار. أنشئ صوت كل لغة بنموذج تحويل نص إلى كلام مثل MiniMax Speech 2.8 HD أو ElevenLabs V3، ثم مرّر كل ملف إلى نموذج الأفاتار. وإذا كان لديك فيديو جاهز بالفعل، فإن HeyGen Video Translate يدبلجه مباشرة بدلًا من ذلك.

تعمل الشخصيات المُنمّطة والحيوانات أيضًا، لأن النموذج يقبل الرسوم الكرتونية والوجوه غير البشرية. جرّب بعض التصييرات قبل أن تبني سلسلة كاملة حول شخصية الماسكوت (mascot).

جهّز المدخلات لنتائج أفضل

تعود معظم التصييرات الرديئة إلى المدخلات، لا إلى النموذج. أصلح هذه الأمور قبل أن تنفق النقاط.

قواعد الصور

صورة أمامية لرجل بشعر رمادي قصير وقميص كحلي

  • واجه الكاميرا. يمنح إطار الرأس والكتفين المستقيم أمام العدسة النموذج أكبر قدر من البنية الوجهية ليحركها.
  • أبقِ الفم مغلقًا أو محايدًا. قد تبدو الابتسامة العريضة التي تظهر فيها الأسنان في المصدر غريبة بمجرد أن تبدأ الشفاه في الحركة.
  • أظهر الأذنين وخط الشعر. الحواف الواضحة تساعد الرأس على الحفاظ على خط خارجي ثابت أثناء الحركة.
  • أضئ الوجه بالتساوي. ضوء النافذة الناعم من الأمام أفضل من ظل جانبي قاسٍ.
  • ابدأ من 300 بكسل أو أكثر في الضلع القصير. إذا كانت صورتك الشخصية صغيرة، فارفع دقتها أولًا باستخدام Crystal Upscaler، وهي مصممة للصور الشخصية.

قواعد الصوت والأمر النصي

رجل بلحية فضية يحكي إلى ميكروفون في ركن مبطّن بالإسفنج

  • متحدث واحد في كل ملف. الأصوات المتداخلة لا تعطي الفم شيئًا واضحًا يتبعه.
  • لا موسيقى تحت الصوت. أضف الموسيقى بعد تصيير الأفاتار.
  • اقطع الصمت من الطرفين. تدفع مقابل كل ثانية من الصوت، بما في ذلك الصمت.
  • التزم بحد المزوّد. أقصر حد وجدته هو 60 ثانية، والحد الأدنى هو 2 ثانيتان.
  • اجعل الأمر النصي قصيرًا. يكفي سطر عن الانفعال، وسطر عن الإيماءات، وسطر عن الكاميرا. الأمر النصي الطويل ينافس الصوت بدلًا من أن يدعمه.

كيف تستخدم مزامنة شفاه Kling

Kling Avatar 2.0 نفسه غير مدرج في كتالوج مزامنة الشفاه على PicassoIA وقت كتابة هذا المقال. الخيار الخاص بـ Kling الموجود هناك، Kling Lip Sync، يحل مشكلة مجاورة: يطابق فم المتحدث في مقطع فيديو موجود مع مسار صوتي جديد، أو مع نص تكتبه. يقبل مقاطع MP4 وMOV بطول بين 2 و10 ثوانٍ وبدقة من 720p إلى 1080p.

امرأة في مساحة عمل مشرقة وعلى شاشتها خط زمني لفيديو

خطوة بخطوة

  1. افتح صفحة Kling Lip Sync على PicassoIA.
  2. ارفع مقطعك أو الصق رابطه في video_url. استخدم ملف MP4 أو MOV أقل من 100 ميغابايت، بطول من ثانيتين إلى 10 ثوانٍ.
  3. أضف الصوت. إما أن ترفع ملف MP3 أو WAV أو M4A أو AAC أقل من 5 ميغابايت في audio_file، أو أن تكتب نصًا في text.
  4. إذا كتبت نصًا، فاختر voice_id من القائمة الإنجليزية أو الصينية، واضبط voice_speed.
  5. شغّل التوليد، وعاين النتيجة، ثم نزّل المقطع.

نصائح المعاملات

  • استخدم إما الصوت أو النص في كل تشغيل. حقل text مخصص للحالة التي لا يتوفر فيها ملف صوتي.
  • القيمة الافتراضية لـ voice_id هي en_AOT. استمع إلى صوتين أو ثلاثة على السطر نفسه قبل أن تختار.
  • القيمة الافتراضية لـ voice_speed هي 1. عدّلها قليلًا حتى يتطابق إيقاع الكلام مع سرعة اللقطات.
  • لا يمكن الجمع بين video_url وvideo_id، لذا اختر مصدرًا واحدًا في كل تشغيل.
  • قسّم المشاهد الطويلة إلى مقاطع بطول 10 ثوانٍ قبل رفعها.

بدائل PicassoIA للصور الناطقة

عندما تبدأ من صورة بدلًا من فيديو، تتبع ثلاثة نماذج على PicassoIA نمط الصورة مع الصوت نفسه الذي يتبعه Kling Avatar 2.0.

النموذجالمدخلاتالصوتملاحظات المخرجات
Omni Human 1.5صورة، صوت، أمر نصي اختياريصوتك، بأقل من 35 ثانيةوجوه، ولقطات للجسم كاملًا، وشخصيات مرسومة. وضع سريع وقيمة بذرة لنتائج قابلة للتكرار
Fabric 1.0صورة وصوتصوتك480p أو 720p
P Video Avatarصورة، مع نص أو صوتأكثر من 30 صوتًا مدمجًا في 10 لغات720p أو 1080p
Kling Lip Syncفيديو، مع صوت أو نصصوتك أو صوت مدمجمقاطع من 2 إلى 10 ثوانٍ

طريقة سريعة للاختيار:

  • لديك صورة وصوت مسجّل: ابدأ بـ Omni Human 1.5 أو Fabric 1.0.
  • لديك صورة ونص فقط: P Video Avatar يكتب الصوت لك.
  • لديك لقطات وتحتاج إلى صوت جديد: Kling Lip Sync هو الأداة المناسبة.
  • تحتاج إلى صوت أولًا: Realtime TTS 2 وElevenLabs V3 ينتجان صوتًا يمكنك تمريره إلى أي من النماذج أعلاه.

💡 جرّب مقطعًا واحدًا قبل الدفعة. شغّل الصورة الشخصية نفسها و10 ثوانٍ من الصوت نفسه عبر نموذجين، ثم قارن أشكال الفم في الأصوات الصعبة مثل "p" و"b" و"m".

جرّب فيديو مزامنة الشفاه الخاص بك

اختر مقطعًا واحدًا واختبره قبل أن تخطط لدفعة: صورة شخصية واحدة، و10 ثوانٍ من صوت نظيف، فئة واحدة. شغّله عبر Omni Human 1.5 أو Fabric 1.0 على PicassoIA، وقارن أشكال الفم بالصوت، واحفظ الإعدادات الفائزة كقالب لك. بعد ذلك أنشئ الصورة الشخصية نفسها باستخدام نماذج الصور في المنصة، ثم سجّل الصوت أو ولّده، وحرّكه. افتح PicassoIA، وارفع أول صورة لك، وانظر إلى المدى الذي يمكن أن تصل إليه صورة ثابتة واحدة وتسجيل صوتي قصير.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة