يحوّل OmniHuman 1.5 صورة شخص واحدة وملف صوتي واحدًا إلى فيديو يتحدث فيه الشخص، ويُحتسب بسعر 0.16 دولار لكل ثانية على fal.ai. يشرح هذا المقال التكلفة الفعلية لكل مقطع، وحدود الإدخال، وجودة مزامنة الشفاه، وكيفية تشغيل النموذج على PicassoIA دون كتابة أي شيفرة.
يمكن أن تتحول صورة شخص واحدة وتسجيل صوتي مدته 30 ثانية إلى فيديو يتحدث فيه الشخص مقابل 4.80 دولار. هذا هو الحساب وراء OmniHuman 1.5 API، وهو نموذج أفاتار يعتمد على الصوت من ByteDance، ويحتسب fal.ai تكلفته بسعر 0.16 دولار لكل ثانية من الفيديو المُولَّد. لا حاجة إلى كاميرا أو استوديو أو ممثل. يكفي وجه وصوت وبضع دقائق من الانتظار.
يقدّم هذا المقال أرقامًا حقيقية لذلك. ستتعرف على تكلفة المقاطع بأطوال مختلفة، والحدود التي ستمنعك فعلًا (طول الصوت والدقة وصيغ الملفات)، وكيف تصمد مزامنة الشفاه على الوجوه الحقيقية، ومتى تتفوق صورة متحدثة على التصوير. كما يتضمن شرحًا خطوة بخطوة لتشغيل OmniHuman 1.5 على PicassoIA من المتصفح، مع قائمة قصيرة من البدائل لتجربتها بجانبه.
💡 الإجابة السريعة: يأخذ OmniHuman 1.5 صورة واحدة لشخص وملفًا صوتيًا، ويعيد فيديو يتحرك فيه الوجه والرأس مع الكلام. على fal.ai تبلغ تكلفته 0.16 دولار لكل ثانية، ويقبل حتى 60 ثانية من الصوت بدقة 720p أو 30 ثانية بدقة 1080p.
ماذا يفعل OmniHuman 1.5 فعليًا
OmniHuman 1.5 نموذج لتحويل الصورة إلى فيديو مبني حول الصوت. فبدلًا من اختراع مشهد من أمر نصي، ينطلق من شخص لديك بالفعل ويجعله يتحدث أو يغني أو يتفاعل مع أي صوت تمنحه إياه.
صورة واحدة وملف صوتي واحد
سير العمل بسيط إلى حد يكاد يكون مفرطًا. ارفع صورة تحتوي على شخص أو وجه أو شخصية. ثم ارفع مقطعًا صوتيًا. يحرّك النموذج الشخص بحيث تتبع الفم والتعابير وحركة الرأس الصوتَ. ويتيح أمر نصي اختياري توجيه الإيماءات أو تكوين المشهد أو حركة الكاميرا.
هناك ثلاثة أمور تميّزه عن أدوات الصور المتحدثة الأقدم:
حركة تتجاوز الشفاه. تستجيب تعابير الوجه والإيماءات وحركة الرأس لعاطفة الكلام وإيقاعه، وليس للكلمات فقط.
أشخاص بأشكال متنوعة. يقبل OmniHuman 1.5 على PicassoIA صور البورتريه الحقيقية ولقطات الجسم كاملًا والشخصيات المرسومة.
صوت متعدد اللغات. تُدرج صفحة PicassoIA التعليقات الصوتية باللغات الإنجليزية والإسبانية واليابانية والكورية والصينية والإندونيسية.
ما الذي تغيّر عن OmniHuman 1
النموذج الأصلي ما زال متاحًا، والفرق بينه وبين الإصدار الجديد صغير بما يجعل السعر جزءًا من القرار. وتضع مقارنة fal.ai نفسها الاثنين جنبًا إلى جنب:
الميزة
OmniHuman (الأصلي)
OmniHuman 1.5
السعر على fal.ai
0.14 دولار لكل ثانية
0.16 دولار لكل ثانية
الدقة
ثابتة، بلا خيار
720p أو 1080p
حد الصوت
30 ثانية
60 ثانية بدقة 720p، و30 ثانية بدقة 1080p
الوضع السريع (Turbo)
غير متاح
متاح
المدخلات الصعبة
تحتاج أحيانًا إلى عدة محاولات
أكثر موثوقية من المحاولة الأولى
تعني "المدخلات الصعبة" الوجوه المخفية جزئيًا، والصوت المشوَّش، والإضاءة القاسية، والصور البورتريه المائلة، وهي الحالات التي كانت تُفسد اللقطة في السابق.
وعلى PicassoIA يظهر الفرق بالقدر نفسه من الوضوح. تنصح صفحة OmniHuman الأصلية بصوت مدته 15 ثانية أو أقل، لأن الجودة تبدأ بالتراجع بعد ذلك. ويقبل OmniHuman 1.5 مقاطع أقل من 35 ثانية، ويضيف أمرًا نصيًا ووضعًا سريعًا وقيمة بذرة.
شرح أسعار OmniHuman 1.5 API
التسعير هو أبسط جزء في هذا النموذج. تدفع عن كل ثانية من الفيديو المُولَّد، ويمتد الناتج بطول صوتك. التعليق الصوتي مدته 12 ثانية يعطيك فيديو مدته 12 ثانية وفاتورة قدرها 1.92 دولار.
التكلفة لكل ثانية من الفيديو
إليك تكلفة أطوال المقاطع الشائعة بالسعر المعتمد على fal.ai وهو 0.16 دولار لكل ثانية:
طول المقطع
التكلفة
الاستخدام المعتاد
5 ثوانٍ
0.80 دولار
مقطع اختبار قبل التشغيل الكامل
15 ثانية
2.40 دولار
منشور على وسائل التواصل أو تحية قصيرة
30 ثانية
4.80 دولار
عرض منتج، وأطول مقطع بدقة 1080p
60 ثانية
9.60 دولار
شرح تعليمي، وأطول مقطع بدقة 720p
يغيّر الحجم الصورة بسرعة. مئة مقطع مدة كل منها 30 ثانية تبلغ 480 دولارًا. وتحديث أسبوعي مدته 20 ثانية طوال عام كامل (52 مقطعًا) يكلّف 166.40 دولار. ولتوضيح الأمر، إليك ثلاث ميزانيات شهرية واقعية:
السيناريو
الناتج
الثواني
التكلفة الشهرية
صانع محتوى فردي
8 مقاطع مدة كل منها 20 ثانية
160
25.60 دولار
متجر إلكتروني صغير
30 مقطعًا مدة كل منها 15 ثانية
450
72.00 دولار
فريق تدريب
40 درسًا مدة كل منها 45 ثانية
1,800
288.00 دولار
يحمل الإصدار 1.5 سعرًا أعلى من الأصلي الذي يُدرجه fal.ai بسعر 0.14 دولار لكل ثانية. وفي مقطع مدته 30 ثانية يكون ذلك 4.20 دولار مقابل 4.80 دولار، أي 60 سنتًا إضافية، أو 14 في المئة. وعلى 100 مقطع من هذا النوع يصل الفارق إلى 60 دولارًا. وما إذا كانت مدة الصوت الأطول وخيار الدقة يبرران ذلك يعتمد كليًا على حجم استخدامك.
💡 تحقق من مزوّدك. الأرقام أعلاه من fal.ai. مزودو واجهات برمجة التطبيقات الآخرون يحددون أسعارهم الخاصة، لذا اقرأ سطر التسعير لدى مزودك قبل أن تضع ميزانية لحملة.
طرق تقليل الفاتورة
تدفع عن كل ثانية، لذا يأتي التوفير من تقليل الثواني المهدورة:
اختبر أولًا على 5 ثوانٍ. مقطع بقيمة 0.80 دولار يخبرك إن كانت الصورة البورتريه تعمل قبل أن تنفق 9.60 دولارات على دقيقة كاملة.
اقتطع الصمت. الصمت في بداية الملف الصوتي ونهايته يتحول إلى فيديو مدفوع الثمن.
اصنع المسودات بسرعة وأنهِ ببطء. استخدم دقة 720p أو الوضع السريع للمسودات، ثم صيّر اللقطة المعتمدة بدقة 1080p. تحقق مما إذا كان مزودك يسعّر الوضع السريع بشكل مختلف.
انتقل إلى لقطات داعمة. دع الأفاتار يتحدث 10 ثوانٍ، ثم اعرض المنتج 5 ثوانٍ. أنت تدفع فقط عن ثوانٍ الكلام.
احتفظ بالبذرة. عندما تنجح لقطة ما، أعد استخدام قيمة بذرتها على PicassoIA لتستطيع إعادة إنتاجها بدلًا من دفع ثمن تخمين محظوظ مرة أخرى.
المدخلات والحدود والمعاملات
معظم عمليات التشغيل الفاشلة تأتي من الأخطاء نفسها في المدخلات. وهذه هي الحدود المهمة.
متطلبات الصورة والصوت
للمكانين اللذين يمكنك تشغيل النموذج فيهما قواعد مختلفة قليلًا:
الإدخال
واجهة fal.ai البرمجية
PicassoIA
الصورة
image_url، JPEG أو PNG، ومتاحة للوصول العام
ارفع صورة لشخص أو وجه أو شخصية
الصوت
audio_url، MP3 أو WAV أو M4A
MP3 وWAV وصيغ مشابهة
طول الصوت
60 ثانية بدقة 720p، و30 ثانية بدقة 1080p
أقل من 35 ثانية، والملفات الأطول تفشل
الدقة
720p أو 1080p، والافتراضي 1080p
غير متاحة كإعداد
المدخلات الاختيارية
prompt، turbo_mode، mask_url
الأمر النصي، والوضع السريع، والبذرة
إذا استدعيت النموذج عبر fal.ai، فإن نقطة النهاية هي fal-ai/bytedance/omnihuman/v1.5. ثبّت @fal-ai/client، واضبط رمز fal.ai API كمتغير بيئة، وسيبدو الاستدعاء كالتالي:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
input: {
image_url: "https://example.com/portrait.jpg",
audio_url: "https://example.com/voiceover.mp3",
resolution: "720p",
turbo_mode: false,
prompt: "Warm smile, small hand gestures, steady medium shot"
},
logs: true
});
console.log(result.data.video.url);
يعود رابط الفيديو عند data.video.url. يشير fal.ai إلى أن الرابط يبقى صالحًا لنحو 24 ساعة، لذا نزّل الملف وخزّنه في مكان دائم فورًا.
الدقة والوضع السريع والأوامر النصية
الدقة. الافتراضي هو 1080p ويحدّ الصوت عند 30 ثانية. انتقل إلى 720p عندما تحتاج إلى ما يصل إلى 60 ثانية أو توليدًا أسرع.
الوضع السريع (Turbo). ناتج أسرع مقابل بعض الجودة. مناسب تمامًا لفحص صورة بورتريه، وليس للتسليم النهائي. تسمّي PicassoIA الفكرة نفسها الوضع السريع.
الأمر النصي. نص اختياري للتعابير والحركة وزاوية الكاميرا. يقبل PicassoIA الأوامر النصية باللغات الصينية والإنجليزية واليابانية والكورية والإسبانية والإندونيسية.
القناع. على fal.ai، يعزل mask_url الشخص الذي يجب أن يتحدث عندما يشترك عدة أشخاص في الإطار.
اكتب الأوامر النصية عن السلوك، لا عن الشفاه. فعبارة "ابتسامة هادئة وإيماءة خفيفة ويدان مستريحتان على المكتب" تعمل بشكل أفضل من "يتحرك الفم مع الكلمات"، لأن الصوت يتولى الفم أصلًا.
جودة مزامنة الشفاه في الواقع
مزامنة الشفاه هي المكان الذي تفوز فيه نماذج الأفاتار أو تخسر، لذا قيّمها كما سيقيّمها المشاهدون: على الهاتف، بالسرعة الطبيعية، والصوت مفعّل.
أين يتألق
تطابق عاطفي. الابتسامات وحركة الحواجب وميلان الرأس تتبع نبرة الصوت، فتبدو القراءة المتحمسة متحمسة فعلًا.
مدخلات غير مرتبة. يشير fal.ai إلى معالجة أفضل للوجوه المخفية جزئيًا والصوت المشوّش والإضاءة الصعبة والصور البورتريه المائلة مقارنة بالنموذج الأصلي.
مقاطع لمتحدث واحد. المونولوج مدته من 10 إلى 30 ثانية هو النقطة المثالية: عرض، أو إعلان، أو مقدمة درس.
شخصيات مرسومة. تتحرك الشخصيات التعريفية والصور البورتريه المُنمّقة أيضًا، وهذا يفيد العلامات التجارية التي لا تملك متحدثًا رسميًا.
أين ما زال يعاني
حدود الطول. أقل من 35 ثانية على PicassoIA، و60 ثانية كحد أقصى على fal.ai. يجب تقسيم النصوص الأطول إلى مشاهد وتركيبها معًا في المونتاج.
وقت الانتظار. استغرقت الأمثلة الثلاثة المنشورة على PicassoIA مع الوضع السريع 197 و280 و370 ثانية، أي نحو 3 إلى 6 دقائق لكل منها. وهذا يستبعد الدردشة المباشرة أو الاستخدام في الزمن الحقيقي.
إعادة التشغيل. حتى مع موثوقية أفضل، خصّص ميزانية لمحاولة ثانية من حين لآخر على الصور البورتريه الصعبة.
المدخلات الضعيفة. الوجه الصغير أو المموّه أو المفلتر بكثافة يعطي نتيجة ضعيفة. والتعليق الصوتي المسطح الرتيب يعطي أداءً مسطحًا.
استخدامات واقعية لفيديوهات الأفاتار
تشترك أقوى حالات الاستخدام في سمة واحدة: يحتاج شخص إلى الظهور على الشاشة، لكن تصويره بطيء أو مكلف أو مستحيل.
شروحات المنتجات والإعلانات
يستطيع صاحب متجر صغير أن يحوّل صورة واحدة لمؤسس المتجر إلى عرض منتج مدته 20 ثانية لكل صنف جديد، يُسجَّل صوته مرة واحدة ويُحدَّث كلما تغيّر النص.
يناسب هذا الشكل صفحات الهبوط والإعلانات المدفوعة على وسائل التواصل وقوائم الأسواق الإلكترونية، حيث يرفع وجه بشري قصير الثقة. ادمج المقطع المتحدث مع لقطات المنتج الداعمة، وسيحتاج الأفاتار إلى الكلام فقط في الافتتاحية القوية وعرض الختام.
التدريب والتعليم
يستطيع صنّاع الدورات إنتاج مقدّم لكل درس دون تسجيل أمام الكاميرا. اكتب مقدمة الدرس، وسجّل الصوت، ودع الصورة البورتريه تقدّمه. أبقِ كل مقطع ضمن حد الطول واربط عدة مقاطع قصيرة عبر الدرس.
تستخدم الفرق الداخلية الحيلة نفسها في رسائل التهيئة للموظفين وتحديثات السياسات، حيث يهم الوجه المتّسق أكثر من الصقل السينمائي.
الرسائل متعددة اللغات
يمكن لصورة بورتريه واحدة أن تحمل أصواتًا كثيرة. سجّل النص نفسه أو أنشئه بالإسبانية واليابانية والإنجليزية، ثم شغّل كل ملف على الصورة نفسها. تتبع الشفاه اللغة بدلًا من أن تقاومها.
إذا كان لديك لقطات مصوّرة بالفعل وتحتاج فقط إلى دبلجتها، فإن Video Translate يتولى هذه المهمة، بينما يكون OmniHuman 1.5 الخيار الأفضل عندما تملك صورة ثابتة فقط.
💡 استخدم الوجوه الحقيقية بمسؤولية. لا تحرّك صورة لشخص حقيقي إلا بإذنه، ولا تقلّد أحدًا لتضليل المشاهدين، وضع علامة على الفيديوهات الاصطناعية حيثما تطلب منصة ذلك.
كيفية استخدام OmniHuman 1.5 على PicassoIA
لا تحتاج إلى حساب API ولا إلى أي شيفرة. يعمل OmniHuman 1.5 على PicassoIA من المتصفح: رفعان، وأمر نصي اختياري، ونقرة واحدة.
حضّر الصورة البورتريه
اختر صورة يظهر فيها الوجه بوضوح، ومضاءة بالتساوي، ومواجهة للكاميرا أو مائلة قليلًا. تجنّب النظارات الشمسية والفلاتر الكثيفة والوجوه الصغيرة وسط الحشود.
لا تملك صورة مناسبة؟ أنشئ واحدة باستخدام Seedream 4.5، الذي يُخرج الصور بدقة 2K أو 4K بنسبة 16:9 ونسب أخرى. صف شخصًا واقعيًا وتعبيرًا محايدًا وضوءًا ناعمًا من النافذة، ثم استخدم النتيجة كأفاتار لك.
أضف صوتك
سجّل صوتك، أو أنشئ تعليقًا صوتيًا باستخدام Speech 2.8 HD أو ElevenLabs v3. صدّره بصيغة MP3 أو WAV واجعله أقل من 35 ثانية، لأن الملفات الأطول تتسبب في فشل التوليد. أزل الموسيقى الخلفية، فالكلام النظيف يعطي أدق مزامنة.
شغّل وتحقق من النتيجة
ارفع الصورة والصوت، وأضف أمرًا نصيًا إن أردت توجيهًا، ثم ابدأ التشغيل. انتهت أمثلة الوضع السريع المنشورة على PicassoIA خلال نحو 3 إلى 6 دقائق. ثم راجع المقطع بهذا الترتيب:
الثانيتان الأوليان، حيث تظهر أخطاء المزامنة أولًا.
اختر حسب المدخل. إذا بدأت من صورة وتسجيل، فابدأ بنموذج OmniHuman 1.5 وقارنه بنموذج Fabric 1.0 أو Kling Avatar v2. وإذا كان لديك نص مكتوب دون صوت، يستطيع P Video Avatar أن ينطقه لك. وإذا صوّرت الفيديو بالفعل وتحتاج إلى شفاه جديدة فقط، فإن Lipsync 2 Pro يعيد كتابة حركة الفم لتتطابق مع مقطع صوتي جديد.
أنشئ أول صورة متحدثة لك اليوم
قراءة الأسعار وحدها لا تكفي. أسرع طريقة للحكم على OmniHuman 1.5 هي أن تغذّيه بصورة البورتريه الخاصة بك ومذكرة صوتية مدتها 10 ثوانٍ، ثم تشاهد النتيجة بالسرعة الطبيعية.
أنشئ وجهًا باستخدام Seedream 4.5، وسجّل جملة قصيرة أو أنشئها صوتيًا، ومرّر الاثنين عبر OmniHuman 1.5. جرّب الصورة نفسها بثلاثة أصوات مختلفة. غيّر الأمر النصي من "هادئ ومستقر" إلى "حيوي، وابتسامة واسعة"، وقارن اللقطات.
كل نموذج مذكور هنا موجود في مكان واحد على picassoia.com/en/all-models. افتحه، واختر نموذجين للأفاتار، وأنتج أول فيديو متحدث لك قبل أن ترتشف قهوتك.