OmniHuman 1.5 API: الأسعار ومزامنة الشفاه وفيديوهات الأفاتار

يحوّل OmniHuman 1.5 صورة شخص واحدة وملف صوتي واحدًا إلى فيديو يتحدث فيه الشخص، ويُحتسب بسعر 0.16 دولار لكل ثانية على fal.ai. يشرح هذا المقال التكلفة الفعلية لكل مقطع، وحدود الإدخال، وجودة مزامنة الشفاه، وكيفية تشغيل النموذج على PicassoIA دون كتابة أي شيفرة.

OmniHuman 1.5 API: الأسعار ومزامنة الشفاه وفيديوهات الأفاتار
Cristian Da Conceicao
مؤسس Picasso IA

يمكن أن تتحول صورة شخص واحدة وتسجيل صوتي مدته 30 ثانية إلى فيديو يتحدث فيه الشخص مقابل 4.80 دولار. هذا هو الحساب وراء OmniHuman 1.5 API، وهو نموذج أفاتار يعتمد على الصوت من ByteDance، ويحتسب fal.ai تكلفته بسعر 0.16 دولار لكل ثانية من الفيديو المُولَّد. لا حاجة إلى كاميرا أو استوديو أو ممثل. يكفي وجه وصوت وبضع دقائق من الانتظار.

يقدّم هذا المقال أرقامًا حقيقية لذلك. ستتعرف على تكلفة المقاطع بأطوال مختلفة، والحدود التي ستمنعك فعلًا (طول الصوت والدقة وصيغ الملفات)، وكيف تصمد مزامنة الشفاه على الوجوه الحقيقية، ومتى تتفوق صورة متحدثة على التصوير. كما يتضمن شرحًا خطوة بخطوة لتشغيل OmniHuman 1.5 على PicassoIA من المتصفح، مع قائمة قصيرة من البدائل لتجربتها بجانبه.

💡 الإجابة السريعة: يأخذ OmniHuman 1.5 صورة واحدة لشخص وملفًا صوتيًا، ويعيد فيديو يتحرك فيه الوجه والرأس مع الكلام. على fal.ai تبلغ تكلفته 0.16 دولار لكل ثانية، ويقبل حتى 60 ثانية من الصوت بدقة 720p أو 30 ثانية بدقة 1080p.

ماذا يفعل OmniHuman 1.5 فعليًا

OmniHuman 1.5 نموذج لتحويل الصورة إلى فيديو مبني حول الصوت. فبدلًا من اختراع مشهد من أمر نصي، ينطلق من شخص لديك بالفعل ويجعله يتحدث أو يغني أو يتفاعل مع أي صوت تمنحه إياه.

صورة واحدة وملف صوتي واحد

سير العمل بسيط إلى حد يكاد يكون مفرطًا. ارفع صورة تحتوي على شخص أو وجه أو شخصية. ثم ارفع مقطعًا صوتيًا. يحرّك النموذج الشخص بحيث تتبع الفم والتعابير وحركة الرأس الصوتَ. ويتيح أمر نصي اختياري توجيه الإيماءات أو تكوين المشهد أو حركة الكاميرا.

لقطة مقرّبة لامرأة مبتسمة تتحدث إلى الكاميرا في مطبخ مشرق

هناك ثلاثة أمور تميّزه عن أدوات الصور المتحدثة الأقدم:

  • حركة تتجاوز الشفاه. تستجيب تعابير الوجه والإيماءات وحركة الرأس لعاطفة الكلام وإيقاعه، وليس للكلمات فقط.
  • أشخاص بأشكال متنوعة. يقبل OmniHuman 1.5 على PicassoIA صور البورتريه الحقيقية ولقطات الجسم كاملًا والشخصيات المرسومة.
  • صوت متعدد اللغات. تُدرج صفحة PicassoIA التعليقات الصوتية باللغات الإنجليزية والإسبانية واليابانية والكورية والصينية والإندونيسية.

ما الذي تغيّر عن OmniHuman 1

النموذج الأصلي ما زال متاحًا، والفرق بينه وبين الإصدار الجديد صغير بما يجعل السعر جزءًا من القرار. وتضع مقارنة fal.ai نفسها الاثنين جنبًا إلى جنب:

الميزةOmniHuman (الأصلي)OmniHuman 1.5
السعر على fal.ai0.14 دولار لكل ثانية0.16 دولار لكل ثانية
الدقةثابتة، بلا خيار720p أو 1080p
حد الصوت30 ثانية60 ثانية بدقة 720p، و30 ثانية بدقة 1080p
الوضع السريع (Turbo)غير متاحمتاح
المدخلات الصعبةتحتاج أحيانًا إلى عدة محاولاتأكثر موثوقية من المحاولة الأولى

تعني "المدخلات الصعبة" الوجوه المخفية جزئيًا، والصوت المشوَّش، والإضاءة القاسية، والصور البورتريه المائلة، وهي الحالات التي كانت تُفسد اللقطة في السابق.

وعلى PicassoIA يظهر الفرق بالقدر نفسه من الوضوح. تنصح صفحة OmniHuman الأصلية بصوت مدته 15 ثانية أو أقل، لأن الجودة تبدأ بالتراجع بعد ذلك. ويقبل OmniHuman 1.5 مقاطع أقل من 35 ثانية، ويضيف أمرًا نصيًا ووضعًا سريعًا وقيمة بذرة.

شرح أسعار OmniHuman 1.5 API

التسعير هو أبسط جزء في هذا النموذج. تدفع عن كل ثانية من الفيديو المُولَّد، ويمتد الناتج بطول صوتك. التعليق الصوتي مدته 12 ثانية يعطيك فيديو مدته 12 ثانية وفاتورة قدرها 1.92 دولار.

منظر علوي لمكتب عليه دفتر مليء بالأرقام المكتوبة بالقلم الرصاص وآلة حاسبة وساعة إيقاف

التكلفة لكل ثانية من الفيديو

إليك تكلفة أطوال المقاطع الشائعة بالسعر المعتمد على fal.ai وهو 0.16 دولار لكل ثانية:

طول المقطعالتكلفةالاستخدام المعتاد
5 ثوانٍ0.80 دولارمقطع اختبار قبل التشغيل الكامل
15 ثانية2.40 دولارمنشور على وسائل التواصل أو تحية قصيرة
30 ثانية4.80 دولارعرض منتج، وأطول مقطع بدقة 1080p
60 ثانية9.60 دولارشرح تعليمي، وأطول مقطع بدقة 720p

يغيّر الحجم الصورة بسرعة. مئة مقطع مدة كل منها 30 ثانية تبلغ 480 دولارًا. وتحديث أسبوعي مدته 20 ثانية طوال عام كامل (52 مقطعًا) يكلّف 166.40 دولار. ولتوضيح الأمر، إليك ثلاث ميزانيات شهرية واقعية:

السيناريوالناتجالثوانيالتكلفة الشهرية
صانع محتوى فردي8 مقاطع مدة كل منها 20 ثانية16025.60 دولار
متجر إلكتروني صغير30 مقطعًا مدة كل منها 15 ثانية45072.00 دولار
فريق تدريب40 درسًا مدة كل منها 45 ثانية1,800288.00 دولار

يحمل الإصدار 1.5 سعرًا أعلى من الأصلي الذي يُدرجه fal.ai بسعر 0.14 دولار لكل ثانية. وفي مقطع مدته 30 ثانية يكون ذلك 4.20 دولار مقابل 4.80 دولار، أي 60 سنتًا إضافية، أو 14 في المئة. وعلى 100 مقطع من هذا النوع يصل الفارق إلى 60 دولارًا. وما إذا كانت مدة الصوت الأطول وخيار الدقة يبرران ذلك يعتمد كليًا على حجم استخدامك.

💡 تحقق من مزوّدك. الأرقام أعلاه من fal.ai. مزودو واجهات برمجة التطبيقات الآخرون يحددون أسعارهم الخاصة، لذا اقرأ سطر التسعير لدى مزودك قبل أن تضع ميزانية لحملة.

طرق تقليل الفاتورة

تدفع عن كل ثانية، لذا يأتي التوفير من تقليل الثواني المهدورة:

  1. اختبر أولًا على 5 ثوانٍ. مقطع بقيمة 0.80 دولار يخبرك إن كانت الصورة البورتريه تعمل قبل أن تنفق 9.60 دولارات على دقيقة كاملة.
  2. اقتطع الصمت. الصمت في بداية الملف الصوتي ونهايته يتحول إلى فيديو مدفوع الثمن.
  3. اصنع المسودات بسرعة وأنهِ ببطء. استخدم دقة 720p أو الوضع السريع للمسودات، ثم صيّر اللقطة المعتمدة بدقة 1080p. تحقق مما إذا كان مزودك يسعّر الوضع السريع بشكل مختلف.
  4. انتقل إلى لقطات داعمة. دع الأفاتار يتحدث 10 ثوانٍ، ثم اعرض المنتج 5 ثوانٍ. أنت تدفع فقط عن ثوانٍ الكلام.
  5. احتفظ بالبذرة. عندما تنجح لقطة ما، أعد استخدام قيمة بذرتها على PicassoIA لتستطيع إعادة إنتاجها بدلًا من دفع ثمن تخمين محظوظ مرة أخرى.

المدخلات والحدود والمعاملات

معظم عمليات التشغيل الفاشلة تأتي من الأخطاء نفسها في المدخلات. وهذه هي الحدود المهمة.

متطلبات الصورة والصوت

للمكانين اللذين يمكنك تشغيل النموذج فيهما قواعد مختلفة قليلًا:

الإدخالواجهة fal.ai البرمجيةPicassoIA
الصورةimage_url، JPEG أو PNG، ومتاحة للوصول العامارفع صورة لشخص أو وجه أو شخصية
الصوتaudio_url، MP3 أو WAV أو M4AMP3 وWAV وصيغ مشابهة
طول الصوت60 ثانية بدقة 720p، و30 ثانية بدقة 1080pأقل من 35 ثانية، والملفات الأطول تفشل
الدقة720p أو 1080p، والافتراضي 1080pغير متاحة كإعداد
المدخلات الاختياريةprompt، turbo_mode، mask_urlالأمر النصي، والوضع السريع، والبذرة

لقطة من فوق الكتف لمطوّرة تكتب شيفرة على حاسوب محمول في مكتب علوي

إذا استدعيت النموذج عبر fal.ai، فإن نقطة النهاية هي fal-ai/bytedance/omnihuman/v1.5. ثبّت @fal-ai/client، واضبط رمز fal.ai API كمتغير بيئة، وسيبدو الاستدعاء كالتالي:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
  input: {
    image_url: "https://example.com/portrait.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    resolution: "720p",
    turbo_mode: false,
    prompt: "Warm smile, small hand gestures, steady medium shot"
  },
  logs: true
});

console.log(result.data.video.url);

يعود رابط الفيديو عند data.video.url. يشير fal.ai إلى أن الرابط يبقى صالحًا لنحو 24 ساعة، لذا نزّل الملف وخزّنه في مكان دائم فورًا.

الدقة والوضع السريع والأوامر النصية

  • الدقة. الافتراضي هو 1080p ويحدّ الصوت عند 30 ثانية. انتقل إلى 720p عندما تحتاج إلى ما يصل إلى 60 ثانية أو توليدًا أسرع.
  • الوضع السريع (Turbo). ناتج أسرع مقابل بعض الجودة. مناسب تمامًا لفحص صورة بورتريه، وليس للتسليم النهائي. تسمّي PicassoIA الفكرة نفسها الوضع السريع.
  • الأمر النصي. نص اختياري للتعابير والحركة وزاوية الكاميرا. يقبل PicassoIA الأوامر النصية باللغات الصينية والإنجليزية واليابانية والكورية والإسبانية والإندونيسية.
  • القناع. على fal.ai، يعزل mask_url الشخص الذي يجب أن يتحدث عندما يشترك عدة أشخاص في الإطار.

اكتب الأوامر النصية عن السلوك، لا عن الشفاه. فعبارة "ابتسامة هادئة وإيماءة خفيفة ويدان مستريحتان على المكتب" تعمل بشكل أفضل من "يتحرك الفم مع الكلمات"، لأن الصوت يتولى الفم أصلًا.

جودة مزامنة الشفاه في الواقع

مزامنة الشفاه هي المكان الذي تفوز فيه نماذج الأفاتار أو تخسر، لذا قيّمها كما سيقيّمها المشاهدون: على الهاتف، بالسرعة الطبيعية، والصوت مفعّل.

منظر جانبي لممثل صوتي يتحدث أمام ميكروفون استوديو مع حاجب للنفخ

أين يتألق

  • تطابق عاطفي. الابتسامات وحركة الحواجب وميلان الرأس تتبع نبرة الصوت، فتبدو القراءة المتحمسة متحمسة فعلًا.
  • مدخلات غير مرتبة. يشير fal.ai إلى معالجة أفضل للوجوه المخفية جزئيًا والصوت المشوّش والإضاءة الصعبة والصور البورتريه المائلة مقارنة بالنموذج الأصلي.
  • مقاطع لمتحدث واحد. المونولوج مدته من 10 إلى 30 ثانية هو النقطة المثالية: عرض، أو إعلان، أو مقدمة درس.
  • شخصيات مرسومة. تتحرك الشخصيات التعريفية والصور البورتريه المُنمّقة أيضًا، وهذا يفيد العلامات التجارية التي لا تملك متحدثًا رسميًا.

أين ما زال يعاني

  • حدود الطول. أقل من 35 ثانية على PicassoIA، و60 ثانية كحد أقصى على fal.ai. يجب تقسيم النصوص الأطول إلى مشاهد وتركيبها معًا في المونتاج.
  • وقت الانتظار. استغرقت الأمثلة الثلاثة المنشورة على PicassoIA مع الوضع السريع 197 و280 و370 ثانية، أي نحو 3 إلى 6 دقائق لكل منها. وهذا يستبعد الدردشة المباشرة أو الاستخدام في الزمن الحقيقي.
  • إعادة التشغيل. حتى مع موثوقية أفضل، خصّص ميزانية لمحاولة ثانية من حين لآخر على الصور البورتريه الصعبة.
  • المدخلات الضعيفة. الوجه الصغير أو المموّه أو المفلتر بكثافة يعطي نتيجة ضعيفة. والتعليق الصوتي المسطح الرتيب يعطي أداءً مسطحًا.

استخدامات واقعية لفيديوهات الأفاتار

تشترك أقوى حالات الاستخدام في سمة واحدة: يحتاج شخص إلى الظهور على الشاشة، لكن تصويره بطيء أو مكلف أو مستحيل.

شروحات المنتجات والإعلانات

يستطيع صاحب متجر صغير أن يحوّل صورة واحدة لمؤسس المتجر إلى عرض منتج مدته 20 ثانية لكل صنف جديد، يُسجَّل صوته مرة واحدة ويُحدَّث كلما تغيّر النص.

امرأة ترتدي مريلة من الدنيم تصوّر كوبًا من الخزف في ورشة فخار

يناسب هذا الشكل صفحات الهبوط والإعلانات المدفوعة على وسائل التواصل وقوائم الأسواق الإلكترونية، حيث يرفع وجه بشري قصير الثقة. ادمج المقطع المتحدث مع لقطات المنتج الداعمة، وسيحتاج الأفاتار إلى الكلام فقط في الافتتاحية القوية وعرض الختام.

التدريب والتعليم

يستطيع صنّاع الدورات إنتاج مقدّم لكل درس دون تسجيل أمام الكاميرا. اكتب مقدمة الدرس، وسجّل الصوت، ودع الصورة البورتريه تقدّمه. أبقِ كل مقطع ضمن حد الطول واربط عدة مقاطع قصيرة عبر الدرس.

معلم يرتدي سترة صوفية يسجّل درسًا على مكتب في الفصل

تستخدم الفرق الداخلية الحيلة نفسها في رسائل التهيئة للموظفين وتحديثات السياسات، حيث يهم الوجه المتّسق أكثر من الصقل السينمائي.

الرسائل متعددة اللغات

يمكن لصورة بورتريه واحدة أن تحمل أصواتًا كثيرة. سجّل النص نفسه أو أنشئه بالإسبانية واليابانية والإنجليزية، ثم شغّل كل ملف على الصورة نفسها. تتبع الشفاه اللغة بدلًا من أن تقاومها.

شابة ترتدي سماعات أذن وتحمل جهازًا لوحيًا أمام خريطة العالم

إذا كان لديك لقطات مصوّرة بالفعل وتحتاج فقط إلى دبلجتها، فإن Video Translate يتولى هذه المهمة، بينما يكون OmniHuman 1.5 الخيار الأفضل عندما تملك صورة ثابتة فقط.

💡 استخدم الوجوه الحقيقية بمسؤولية. لا تحرّك صورة لشخص حقيقي إلا بإذنه، ولا تقلّد أحدًا لتضليل المشاهدين، وضع علامة على الفيديوهات الاصطناعية حيثما تطلب منصة ذلك.

كيفية استخدام OmniHuman 1.5 على PicassoIA

لا تحتاج إلى حساب API ولا إلى أي شيفرة. يعمل OmniHuman 1.5 على PicassoIA من المتصفح: رفعان، وأمر نصي اختياري، ونقرة واحدة.

يدا امرأة على حاسوب محمول عليه نافذة رفع تعرض صورة بورتريه مصغرة وملفًا صوتيًا

حضّر الصورة البورتريه

اختر صورة يظهر فيها الوجه بوضوح، ومضاءة بالتساوي، ومواجهة للكاميرا أو مائلة قليلًا. تجنّب النظارات الشمسية والفلاتر الكثيفة والوجوه الصغيرة وسط الحشود.

لا تملك صورة مناسبة؟ أنشئ واحدة باستخدام Seedream 4.5، الذي يُخرج الصور بدقة 2K أو 4K بنسبة 16:9 ونسب أخرى. صف شخصًا واقعيًا وتعبيرًا محايدًا وضوءًا ناعمًا من النافذة، ثم استخدم النتيجة كأفاتار لك.

أضف صوتك

سجّل صوتك، أو أنشئ تعليقًا صوتيًا باستخدام Speech 2.8 HD أو ElevenLabs v3. صدّره بصيغة MP3 أو WAV واجعله أقل من 35 ثانية، لأن الملفات الأطول تتسبب في فشل التوليد. أزل الموسيقى الخلفية، فالكلام النظيف يعطي أدق مزامنة.

شغّل وتحقق من النتيجة

ارفع الصورة والصوت، وأضف أمرًا نصيًا إن أردت توجيهًا، ثم ابدأ التشغيل. انتهت أمثلة الوضع السريع المنشورة على PicassoIA خلال نحو 3 إلى 6 دقائق. ثم راجع المقطع بهذا الترتيب:

  1. الثانيتان الأوليان، حيث تظهر أخطاء المزامنة أولًا.
  2. الأسنان وزوايا الفم عند الصوائت الطويلة.
  3. اليدان والكتفان، لترى إن كانت الحركة تبدو طبيعية.

إليك سلوك كل معامل:

المعاملما الذي يفعلهنصيحة
الصورةالشخص الذي يتحدثواجهة للكاميرا، وحادة، ومضاءة جيدًا
الصوتيقود الكلام والمدةأقل من 35 ثانية، بلا موسيقى
الأمر النصيالمشهد والحركة والكاميراصف السلوك، لا الشفاه
الوضع السريعيقايض التفاصيل الدقيقة بالسرعةمفعّل للمسودات، ومُعطّل للنسخ النهائية
البذرةتجعل اللقطة قابلة لإعادة الإنتاجاحفظ بذرة أي لقطة تريد الاحتفاظ بها

ثلاثة أوامر نصية تستحق النسخ نقطةَ انطلاق:

  • "مقدّم ودود، كتفان مسترخيان، إيماءات صغيرة، لقطة متوسطة ثابتة."
  • "أداء حيوي، ابتسامة واسعة، إيماءات تعبيرية باليدين، ضوء نهار ناعم."
  • "نبرة هادئة وجدية، حركة قليلة، اقتراب بطيء نحو الوجه."

نماذج أفاتار أخرى تستحق التجربة

لا يفوز نموذج واحد في كل مهمة، وكل من هذه النماذج متاح على المنصة نفسها، لذا لا تكلّف المقارنة جنبًا إلى جنب سوى دقائق.

أربعة زملاء حول طاولة يقارنون مقاطع فيديو لصور بورتريه على شاشة حائط

النموذجالاستخدام الأمثلملاحظات
OmniHuman 1.5مقاطع معبّرة تصل إلى 35 ثانيةأمر نصي، ووضع سريع، وبذرة
OmniHumanالمقاطع القصيرةأفضل جودة عند 15 ثانية أو أقل
Fabric 1.0الصور المتحدثة السريعةمخرجات بدقة 480p أو 720p
Kling Avatar v2الوجوه والرسوم الكرتونية والحيواناتوضعا Standard وPro، وأمر نصي اختياري
P Video Avatarمن النص إلى فيديو بلا صوت مسجّلأكثر من 30 صوتًا، و10 لغات، وحتى 1080p
Lipsync 2 Proإعادة مزامنة لقطات موجودةيقبل فيديو MP4 وملف صوتي بصيغة WAV

اختر حسب المدخل. إذا بدأت من صورة وتسجيل، فابدأ بنموذج OmniHuman 1.5 وقارنه بنموذج Fabric 1.0 أو Kling Avatar v2. وإذا كان لديك نص مكتوب دون صوت، يستطيع P Video Avatar أن ينطقه لك. وإذا صوّرت الفيديو بالفعل وتحتاج إلى شفاه جديدة فقط، فإن Lipsync 2 Pro يعيد كتابة حركة الفم لتتطابق مع مقطع صوتي جديد.

أنشئ أول صورة متحدثة لك اليوم

قراءة الأسعار وحدها لا تكفي. أسرع طريقة للحكم على OmniHuman 1.5 هي أن تغذّيه بصورة البورتريه الخاصة بك ومذكرة صوتية مدتها 10 ثوانٍ، ثم تشاهد النتيجة بالسرعة الطبيعية.

أنشئ وجهًا باستخدام Seedream 4.5، وسجّل جملة قصيرة أو أنشئها صوتيًا، ومرّر الاثنين عبر OmniHuman 1.5. جرّب الصورة نفسها بثلاثة أصوات مختلفة. غيّر الأمر النصي من "هادئ ومستقر" إلى "حيوي، وابتسامة واسعة"، وقارن اللقطات.

كل نموذج مذكور هنا موجود في مكان واحد على picassoia.com/en/all-models. افتحه، واختر نموذجين للأفاتار، وأنتج أول فيديو متحدث لك قبل أن ترتشف قهوتك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة