واجهة API لدبلجة الفيديو بالذكاء الاصطناعي: ترجم فيديوهاتك تلقائيًا
تحوّل واجهة API لدبلجة الفيديو بالذكاء الاصطناعي فيديو واحدًا إلى لغات متعددة، لكن المخرجات تختلف: بعضها يعيد مسارًا صوتيًا، وبعضها يعيد فيديو متزامنًا مع الشفاه. تعرّف على المراحل الخمس خلف كل طلب، ونماذج الدبلجة على Picasso IA، ونمط مشغّل المهام، والفحوصات التي تُجريها قبل النشر.
كانت دبلجة الفيديو تعني في السابق مترجمًا، وممثلًا صوتيًا، واستوديو محجوزًا، ومهندس صوت يضبط المقاطع الصوتية لتتناسب مع حركة الشفاه. تختصر واجهة API لدبلجة الفيديو بالذكاء الاصطناعي هذه السلسلة كلها في طلب واحد: ترسل فيديوًا واللغة المستهدفة، فيعود إليك مقطع جاهز بلغة أخرى. لكن كلمة "API" تعني أشياء مختلفة حسب المكان الذي تنظر منه. بعض الخدمات تعيد مسار صوت مدبلجًا، وبعضها يعيد فيديو متزامن الشفاه، وبعضها يوفّر لبنات بناء فقط (النسخ النصي والترجمة والكلام) ويترك عملية التجميع لك.
يفرز هذا المقال هذه الأنواع ويميّز بينها. سترى ما يحدث داخل طلب الدبلجة، وأي نماذج دبلجة يمكنك تشغيلها على Picasso IA اليوم، وكيف تلفّ مشغّل مهام حول أي خدمة دبلجة غير متزامنة، وما الذي يجب التحقق منه قبل نشر فيديو مترجم. ملاحظة صريحة في البداية: على Picasso IA تعمل نماذج الدبلجة داخل المتصفح، بينما تسرد واجهة API للمطورين حاليًا أربعة نماذج للصور والفيديو. الحقيقتان مهمتان إن كنت تخطط لخط معالجة آلي، لذلك سنشرحهما بالتفصيل أدناه.
ما الذي تفعله واجهة API للدبلجة فعلًا
تبدو معظم واجهات API للدبلجة بسيطة من الخارج: طلب واحد يدخل، وفيديو مترجم واحد يخرج. داخليًا، تتكرر المراحل الخمس نفسها في كل مرة، ومعرفتها تخبرك أين نشأت النتيجة السيئة.
المراحل الخمس خلف طلب واحد
المرحلة
ما الذي يحدث
أين تسوء الأمور عادة
1. النسخ
يتحول الكلام إلى نص مؤقّت
تُسمع الأسماء والمصطلحات المتخصصة والكلام المتداخل بشكل خاطئ
2. الترجمة
ينتقل النص إلى اللغة الهدف
صياغة حرفية، ومستوى من الرسمية لا يناسب الموقف
3. توليد الصوت
تُنطق الأسطر المترجمة، ويفضل أن يكون ذلك بصوت مستنسخ من الصوت الأصلي
أداء باهت، وفقدان للعاطفة
4. محاذاة التوقيت
يُمدّ الصوت الجديد أو يُقص ليناسب كل مشهد
الجمل تتجاوز حدود اللقطة
5. مزامنة الشفاه والدمج
تُعدّل حركة الفم ويُعاد وضع الصوت على الفيديو
انحراف، وأشكال فم لا تطابق الصوت
تشغّل خدمة "الاستدعاء الواحد" المراحل الخمس جميعها خلف نقطة نهاية واحدة. وهذا سريع ولا يتطلب إعدادات كثيرة. أما إعداد لبنات البناء فيعرض كل مرحلة على حدة، ما يتيح لك وضع مترجم بشري في المرحلة الثانية، أو تبديل الصوت في المرحلة الثالثة دون إعادة تنفيذ بقية الخطوات.
الدبلجة مقابل الترجمة المكتوبة مقابل التعليق الصوتي
الشكل
الصوت الأصلي
الجهد المطلوب من المشاهد
مطابقة الشفاه
الاستخدام الأمثل
الترجمة المكتوبة
يبقى كما هو
يجب قراءتها أثناء المشاهدة
غير مطلوبة
الحوارات الكثيفة، والتشغيل التلقائي الصامت
التعليق الصوتي
يُخفَّض تحت صوت المترجم
يستمع فقط
لا يوجد
المقابلات، والوثائقيات
دبلجة الذكاء الاصطناعي
يُستنسخ أو يُستبدل
يستمع فقط
اختيارية
الدروس، والإعلانات، والدورات، ومقاطع التواصل الاجتماعي
الغرفة في الصورة أعلاه تمثل الطريق التقليدي: نص واحد، وصوت بشري واحد، وجلسة واحدة لكل لغة. ولا تزال هذه الطريقة الأفضل للحملات الرئيسية. لكن بالنسبة إلى مكتبة من 200 درس، أو سلسلة ندوات، أو عرض منتج يتغير كل ربع سنة، لا أحد يحجز 200 جلسة مضروبة في عشر لغات. هنا يسدّد خط الدبلجة الآلي تكلفته بنفسه.
💡 نصيحة: كثيرون يمررون الشاشة وصوتهم مغلق، لذلك لا تحلّ الدبلجة محل الترجمات المكتوبة. ادبلج الصوت، وأبقِ أي ترجمات مدمجة في الفيديو بنفس لغة المسار الصوتي الجديد.
اختيار مسار الدبلجة
Video Translate للمخرجات المتزامنة مع الشفاه
Video Translate هو أقرب خيار على Picasso IA إلى خدمة دبلجة بطلب واحد. ترفع ملف MP4، وتختار لغة الإخراج، فتحصل على فيديو مدبلج تُعدَّل فيه حركة الشفاه لتتوافق مع الصوت الجديد. تتجاوز قائمة اللغات 150 خيارًا، وتشمل متغيرات إقليمية مثل الإسبانية (المكسيك)، والبرتغالية (البرازيل)، والعربية (المغرب)، لذلك يصل نموذج واحد إلى معظم الأسواق التي قد يستهدفها فريق صغير.
يقدّم وضعين. Speed مصمم للإنجاز السريع، أما precision، وهو الافتراضي، فيُفضّل جودة المخرجات. استغرقت المقاطع النموذجية في صفحة النموذج 169 و183 ثانية للتوليد، لذا خطّط لبضع دقائق لكل مقطع قصير، لا لبضع ثوانٍ.
دبلجة ElevenLabs لاستنساخ الصوت
تتخذ Dubbing من ElevenLabs نهجًا مختلفًا. تدعم أكثر من 90 لغة ولهجة، وتكتشف لغة المصدر تلقائيًا، وتحافظ على صوت المتحدث الأصلي وعاطفته وتوقيته. يحدد إعداد cloning strength من 0 إلى 10 (والافتراضي 7) مدى تطابق الصوت الجديد مع الأصلي: الأعلى للمقابلات التي تكون فيها الهوية مهمة، والأدنى للحصول على أداء أكثر طبيعية باللغة الهدف.
كما تقبل عنوان URL عامًا، مثل رابط ملف مباشر أو رابط YouTube أو رابط TikTok، فتستطيع دبلجة فيديو دون تنزيله أولًا. نوع المخرجات المدرج هو الصوت، لذا تحقق مما تحصل عليه لملفك، وضع المسار الجديد على الفيديو الأصلي إذا احتجت إلى ملف MP4 جاهز.
دمج الأجزاء ضمن خط معالجتك الخاص
إذا احتجت إلى تحكم لكل لغة، فركّب السلسلة بنفسك: نموذج نسخ للمرحلة الأولى، ونموذج تحويل النص إلى كلام أو استنساخ صوت للمرحلة الثالثة، ونموذج مزامنة شفاه للمرحلة الخامسة. تسرد الأقسام اللاحقة الخيارات المتاحة. ثمن هذه المرونة هو عمل التنسيق، وهذا ما يعالجه نمط مشغّل المهام لاحقًا في هذا المقال.
المسار
المدخل
عدد اللغات
مطابقة الشفاه
الاستخدام الأمثل
Video Translate
رفع ملف MP4
150+
مدمجة
فيديوهات جاهزة لأسواق جديدة
ElevenLabs Dubbing
ملف أو رابط عام
90+
التوقيت محفوظ
البودكاست، والمقابلات، وروابط YouTube
سلسلة مخصصة
أي شيء
تعتمد على الأجزاء
أضف نموذج مزامنة شفاه
التحكم لكل لغة، والمراجعة البشرية
كيفية استخدام Video Translate
هذه أسرع طريقة لتحويل فيديو إنجليزي واحد إلى فيديو إسباني، باستخدام النسخة التي تعمل في المتصفح من Video Translate على Picasso IA.
تشغيل مقطع خطوة بخطوة
افتح صفحة النموذج وسجّل الدخول إلى حسابك في Picasso IA.
ارفع ملف MP4 في حقل الفيديو. ابدأ بمقطع من 15 إلى 30 ثانية يحتوي على كلام واضح ووجه ظاهر، لا بالندوة الكاملة التي مدتها أربعون دقيقة.
اختر لغة الإخراج. الافتراضي هو الإنجليزية. اختر الإسبانية لجمهور واسع، أو خيارًا إقليميًا مثل الإسبانية (المكسيك) عندما تستهدف الحملة بلدًا واحدًا.
اختر الوضع. أبقه على precision لأي شيء تخطط لنشره. وانتقل إلى speed عندما تتحقق فقط من أن النص والإيقاع يعملان.
شغّل النموذج وانتظر بضع دقائق.
راجع النتيجة مع متحدث أصلي قبل أن تضع اللغات التسع الأخرى في الطابور.
معلمات تستحق التغيير
النموذج
المعلمة
الخيارات
غيّرها عندما
Video Translate
mode
speed، precision (الافتراضي)
تستخدم المسودات speed والنسخ النهائية precision
Video Translate
output_language
أكثر من 150 اسمًا ومتغيرًا إقليميًا
يتحدث الجمهور لهجة إقليمية محددة
ElevenLabs Dubbing
target_language
وسوم BCP-47 مثل es-MX، pt-BR، en-GB
مطلوب دائمًا
ElevenLabs Dubbing
source_language
auto (الافتراضي) أو وسم
يختار الاكتشاف لغة خاطئة في الكلام ذي اللكنة
ElevenLabs Dubbing
cloning_strength
من 0 إلى 10، والافتراضي 7
ارفعه ليطابق المتحدث، واخفضه للحصول على أداء طبيعي
ElevenLabs Dubbing
source_url أو ملف
رابط عام أو رفع
لدبلجة فيديو مستضاف دون تنزيله
💡 نصيحة: الاختلافات الإقليمية ليست تجميلية. فالدبلجة بالإسبانية المكسيكية تختلف عن الإسبانية الإسبانية في المفردات والإيقاع، والمقطع التسويقي الذي يبدو غريبًا على جمهوره نفسه يفقد الثقة التي وُجدت الدبلجة لبنائها.
يستفيد المعلمون ومنشئو الدورات من هذا كثيرًا. فالمحاضرة المسجلة المدبلجة إلى الهندية أو التاميلية أو البرتغالية (البرازيل) تصل إلى طلاب كانوا سيعتمدون على الترجمات المكتوبة بسرعة القراءة.
بناء خط دبلجة
ما توفره واجهة API الخاصة بمنصة Picasso IA
لدى Picasso IA واجهة API للمطورين على https://api.picassoia.com/v1، وتُصادَق بواسطة رمز Bearer. وهي تتبع نمط العمل غير المتزامن الذي تعتمده معظم واجهات الذكاء الاصطناعي: تنشئ توقعًا (prediction) لنموذج، ثم تستعلم عن حالته، ثم تجلب النتيجة. تسرد صفحة API أربعة نماذج: اثنان للصور واثنان للفيديو، وهما Picasso IA Video وSeedance 2.5 Lite. ينتج زوج الفيديو مقاطع بصوت متزامن.
هناك حدّان يحكمان أي أتمتة. يمكن أن يحتوي الحساب على 5 توقعات كحدّ أقصى في قائمة الانتظار أو قيد التشغيل في الوقت نفسه، مشتركة بين رموزه واتصالات MCP الخاصة به. وفي وقت كتابة هذا المقال، تذكر الصفحة أن إنشاء التوقعات يتطلب خطة Infinite، وتذكر في الوقت نفسه أن توقعات API مجانية حاليًا ولا تستهلك نقاطًا. تحقق من الصفحة للاطلاع على الشروط الحالية قبل أن تبني عليها.
النتيجة العملية للدبلجة: لا يوجد حاليًا أي نموذج للدبلجة أو الترجمة أو مزامنة الشفاه أو تحويل النص إلى كلام متاح عبر واجهة API. تعمل هذه النماذج داخل المتصفح. التقسيم المعقول هو أن تولّد لقطات المصدر عبر واجهة API، مثلًا مقطع Picasso IA Video مدته 5 ثوانٍ، أو مقطع Seedance 2.5 Lite مدته 5 أو 10 ثوانٍ، ثم تنفّذ خطوة الدبلجة داخل المتصفح أو عبر مزوّد تكشف واجهته API خاصية الدبلجة.
نمط مشغّل المهام
أي واجهة API للدبلجة تعتمد على مهام غير متزامنة تحتاج إلى الغلاف نفسه: أرسل الطلب، واستعلم مع تأجيل متدرّج (backoff)، واحترم حد التزامن، ولا تفقد أبدًا معرّف المهمة. يستخدم المخطط أدناه مسارات نائبة (placeholder). استبدلها بالنقاط النهائية وأسماء الحقول الفعلية من المزوّد الذي تختاره.
import os
import time
import requests
from multiprocessing.pool import ThreadPool
BASE_URL = os.environ["PROVIDER_BASE_URL"] # your dubbing provider
TOKEN = os.environ["PROVIDER_TOKEN"]
HEADERS = {"Authorization": f"Bearer {TOKEN}"}
SOURCE_URL = os.environ["SOURCE_VIDEO_URL"] # public link to your MP4
LANGUAGES = ["es-MX", "pt-BR", "de", "ja", "hi"]
MAX_PARALLEL = 5 # stay under the provider cap
def submit(language):
r = requests.post(
f"{BASE_URL}/dubbing/jobs", # placeholder route
headers=HEADERS,
json={"source_url": SOURCE_URL, "target_language": language},
timeout=60,
)
r.raise_for_status()
job_id = r.json()["id"]
print(f"{language}: submitted {job_id}") # log it before waiting
return job_id
def wait(job_id, timeout=3600):
delay, deadline = 5, time.time() + timeout
while time.time() < deadline:
job = requests.get(
f"{BASE_URL}/dubbing/jobs/{job_id}", headers=HEADERS, timeout=60
).json()
if job["status"] == "succeeded":
return job["output_url"]
if job["status"] in ("failed", "canceled"):
raise RuntimeError(job.get("error", "dubbing failed"))
time.sleep(delay)
delay = min(delay * 1.5, 60) # gentle backoff
raise TimeoutError(job_id)
def dub(language):
try:
return language, wait(submit(language))
except Exception as exc: # one bad language must not stop the rest
return language, f"ERROR: {exc}"
with ThreadPool(MAX_PARALLEL) as pool:
for language, result in pool.imap(dub, LANGUAGES):
print(language, result)
تستحق ثلاث عادات في هذا الكود النسخ. سجّل معرّف المهمة فور الحصول عليه، حتى لا يضيع عمل مدفوع بسبب عطل. واستعلم مع تأخير متزايد بدلًا من إرسال طلبات متكررة إلى مسار الحالة. وعالج الأخطاء لكل لغة، حتى لا يوقف فشل الدبلجة اليابانية الدبلجة الألمانية.
مثال سريع لتقدير الحجم: إذا استغرقت كل مهمة نحو ثلاث دقائق، كما في المقاطع النموذجية أعلاه، وكان مزوّدك يشغّل 5 مهام في وقت واحد، فإن 20 لغة تحتاج إلى أربع جولات، أي نحو 12 دقيقة. اعتبر ذلك تقديرًا، لأن أوقات الانتظار في الطوابير تختلف.
مزامنة الشفاه بعد الترجمة
لماذا ينحرف التوقيت بعد الترجمة
نادرًا ما تتطابق الجمل المترجمة في طولها مع الأصل. فالإسبانية والألمانية غالبًا ما تكون أطول من الإنجليزية، مما يجبر الدبلجة على التسريع أو القص أو إعادة الكتابة. وحتى عندما يتناسب الصوت، يظل الفم يشكّل الأشكال الأصلية: حرف "p" أو "b" المنغلق الشفتين في الإنجليزية قد يقع على حركة مفتوحة في الدبلجة. ويلاحظ المشاهدون ذلك أكثر في اللقطات القريبة، لذلك يحتاج مقطع لشخص يتحدث أمام الكاميرا إلى عناية أكبر من تسجيل شاشة يُضاف إليه تعليق صوتي.
نماذج مزامنة الشفاه لربطها
عندما تعيد خطوة الدبلجة الصوت فقط، أو عندما تبني السلسلة بنفسك، يعيد نموذج مزامنة شفاه مخصص ضبط توقيت الفم على المسار الجديد. تسرد Picasso IA عدة نماذج في فئة lipsync:
الترتيب المعتاد هو: ادبلج الصوت، ثم ضعه على الفيديو الأصلي، ثم مرّر الفيديو والصوت الجديد إلى نموذج مزامنة الشفاه. تخطَّ هذه الخطوة عندما يكون المتحدث خارج الكادر، أو يظهر من الخلف، أو يكون صغيرًا في الإطار، لأن أحدًا لا يستطيع التحقق من الفم.
الأصوات والنصوص المكتوبة
انسخ المصدر أولًا
تبدأ السلسلة المخصصة بنص مكتوب دقيق. تسرد Picasso IA GPT-4o Transcribe وGPT-4o Mini Transcribe وGemini 3 Pro في فئة تحويل الكلام إلى نص. وأيًا كان اختيارك، اقرأ النص قبل الترجمة. صحّح أسماء المنتجات والاختصارات وأسماء الأشخاص مرة واحدة، فيستفيد منها كل لغة. ويمنع مسرد قصير ثابت عبر كل اللغات المستهدفة أن تُترجم علامتك التجارية بتسع طرق مختلفة.
اختر صوتًا لكل لغة
في المرحلة الثالثة، تضم فئة تحويل النص إلى كلام خيارات كثيرة:
استنسخ فقط الأصوات التي لديك إذن باستخدامها، واحتفظ بسجل مكتوب لهذا الإذن بجانب المشروع. يجب أن يبقى الصوت الخاص بعلامتك التجارية متسقًا عبر اللغات، لذا اختر أسلوبًا صوتيًا واحدًا لكل لغة، وأعد استخدامه في السلسلة كاملة.
فحوصات الجودة قبل النشر
ثلاثة أخطاء شائعة
1. تخطي المراجعة من متحدث أصلي. الدبلجة الآلية جيدة، ومع ذلك تظل خاطئة بطرق لا يلتقطها إلا أذن متحدث أصلي: مستوى رسمي حيث تكون العلامة التجارية غير رسمية، ورقم يُقرأ بترتيب خاطئ، ونكتة تتحول إلى هراء. عشر دقائق مع مراجع ثنائي اللغة أرخص من إعادة التصوير.
2. نسيان ما هو مكتوب على الشاشة. تغيّر الدبلجة الصوت، ولا تمس الشرائح ونصوص الواجهة والعناوين السفلية والترجمات المدمجة في اللقطات. خطّط لمرور ثانٍ يستبدل هذه العناصر، وإلا فسيروي الصوت الإسباني شاشة إنجليزية.
3. تجاهل المسار الصوتي. الموسيقى والتصفيق وصدى الغرفة تقع تحت الكلام الأصلي. استمع إليها في الملف المدبلج. وإذا اختفت الموسيقى أو تقطعت، فأعد مزج الخلفية الأصلية تحت الصوت الجديد.
قائمة قصيرة للفحص قبل النشر تُبقي الدفعات سليمة:
الأسماء والأرقام تُقرأ بشكل صحيح في كل لغة
الطول ضمن بضع ثوانٍ من الأصل، دون قطع أي جملة
الصوت متسق عبر كل الفيديوهات في السلسلة
النص على الشاشة مُستبدل أو متروك عمدًا بلغة المصدر
مستويات الصوت متوافقة مع الأصل، والموسيقى ما زالت موجودة
مستمع أصلي واحد وافق على كل لغة
جرّب الدبلجة على Picasso IA
لا تحتاج إلى استوديو، ولا مترجم متفرغ، ولا أسبوع من المونتاج لترى كيف يعمل هذا. افتح Video Translate، وارفع مقطعًا مدته 20 ثانية، وشغّله بلغتين. ثم شغّل المقطع نفسه عبر ElevenLabs Dubbing مع ضبط cloning strength على 3 ثم على 9، واستمع إلى الفرق جنبًا إلى جنب.
إذا أردت لقطات جديدة لدبلجتها، فولّدها أولًا: ينشئ Picasso IA صورًا ومقاطع فيديو قصيرة بصوت متزامن، ويمكنك الاطلاع على الكتالوج كاملًا في صفحة جميع النماذج. جرّب، وقارن، واحتفظ بالنسخة التي سيضغط جمهورك زر التشغيل من أجلها فعلًا.