يمكنك إظهار مقدّم يتحدث على الشاشة بطريقتين: تصوير شخص حقيقي، أو كتابة نص وترك محرك يتولى التصوير. تبيع HeyGen الطريقة الثانية عبر محركين يبدوان متطابقين في جدول الأسعار، ويتصرفان بشكل مختلف لحظة الضغط على التصيير. Avatar V هو الأحدث، وقد صُمم ليتحرك كما يتحرك الإنسان الحقيقي. أما Avatar IV فهو الأقدم والأكثر مرونة، ويمكنه إحياء صورة ثابتة. يقبل الاثنان نصوصًا تصل إلى 5,000 حرف، وكلاهما متاح على Picasso IA، وعلى خطط HeyGen للويب يستهلكان الأرصدة بالمعدل نفسه.
لذلك سؤال السعر أقصر مما تتوقع. سؤال الجودة هو المكان الذي تذهب إليه أموالك فعليًا. إليك ما تُظهره المواصفات المنشورة وجداول الخطط وأمثلة التصيير، حتى تختار قبل أن تنفق رصيدًا واحدًا.

الإجابة المختصرة
إذا كنت تملك توأمًا رقميًا مدرَّبًا لشخص حقيقي، فاستخدم Avatar V. وإذا بدأت من صورة فوتوغرافية أو شخصية مُنمَّطة أو مقدّم جاهز من المكتبة، فاستخدم Avatar IV. نادرًا ما يحسم السعر الاختيار، لأن معدل الأرصدة واحد في الحالتين.
| الميزة | Avatar V | Avatar IV |
|---|
| الأنسب لـ | توائم رقمية واقعية | أفاتارات من صور، ومقدّمون مُنمَّطون وغير بشريين |
| شرط الأفاتار | الأفاتارات التي تدعم Avatar V فقط | أي أفاتار من HeyGen، بما في ذلك الصور |
| الإخراج على Picasso IA | 720p أو 1080p أو 4K | 1920x1080 افتراضيًا |
| نسبة العرض إلى الارتفاع | 16:9 أو 9:16 | تُضبط بالعرض والارتفاع |
| نبرة الصوت | غير متاحة | Excited وFriendly وSerious وSoothing وBroadcaster |
| تكلفة خطة الويب | 20 نقطة في الدقيقة | 20 نقطة في الدقيقة |
| زمن التصيير التقريبي | نحو 2.3 دقيقة لمقطع مدته 12 ثانية | نحو 4.7 دقيقة لمقطع مدته 17 ثانية |
اقرأ الجدول من الأعلى. الصفان الأولان يحسمان معظم الحالات، لأنهما يعتمدان على ما تملكه أصلًا. التوأم الرقمي يشير إلى Avatar V. والصورة أو الشخصية الرمزية أو المقدّم الجاهز يشير إلى Avatar IV. بقية الصفوف لا تهم إلا بعد حسم هذين الصفين، ومعظمها يكافئ اختبارًا سريعًا أكثر مما يكافئ نقاشًا طويلًا.
اختر Avatar V إذا...
- تحتاج إلى حركة إنسانية واقعية وإيماءات طبيعية عبر نصوص طويلة.
- تريد تصديرًا بدقة 4K أو ملفًا عموديًا بنسبة 9:16 من إعداد واحد.
- كان مقدّمك مدرَّبًا على المحرك الأحدث وتريد أن يبدو هذا الشخص متسقًا في كل فيديو.
اختر Avatar IV إذا...
- تبدأ من صورة، أو شخصية مُنمَّطة، أو مقدّم غير بشري.
- تريد اختيار نبرة الإلقاء، مثل Friendly أو Broadcaster.
- تفضّل تخطيط اللقطة المقرّبة أو التراكب الدائري بدلًا من الإطار الكامل.
💡 نصيحة: شغّل نصًا واحدًا مدته 30 ثانية عبر المحركين قبل أن تلتزم بسلسلة كاملة. عشر دقائق من الاختبار أقل تكلفة بكثير من إعادة تصيير وحدة تدريبية كاملة.
ما الذي يفعله كل محرك فعليًا
يحوّل المحركان النص المكتوب إلى مقدّم يتحدث، ويتوليان الصوت والشفاه والترجمات عنك. الفارق يكمن في كيفية بناء المقدّم وكيفية حركته.
Avatar IV يحرّك تقريبًا أي شيء
Avatar IV هو المحرك المرن. يعمل مع أي أفاتار من HeyGen، بما في ذلك الصور العشوائية، ولهذا يشير المراجعون إليه في حالة أفاتارات الصور والشخصيات المُنمَّطة والموضوعات ثنائية الأبعاد أو ثلاثية الأبعاد، والمقدّمين غير البشريين تمامًا.
على Picasso IA تحصل على مجموعة عملية من أدوات التحكم: سرعة الصوت من 0.5x إلى 1.5x، ومفتاح واحد للترجمات، وثلاثة تخطيطات (عادي، ولقطة مقرّبة، وتراكب دائري)، وخمس نبرات صوتية إضافية مع إعداد محايد. تغيّر إعدادات النبرة طريقة إلقاء الصوت للسطر، فيمكن لإعلان منتج أن يبدو Excited بينما يبدو تحديث السياسات Serious.
تفيد هذه المرونة عندما لا تملك أي لقطات مسجّلة على الإطلاق. يمكن لشخصية الماسكوت لعلامة تجارية أو صورة شخصية واضحة لعضو في الفريق أن تتحول إلى مقدّم يتحدث، ويتولى النص والصوت بقية العمل. ولأن المحرك يبتكر الحركة بدلًا من نسخها، تكون الصورة المصدر مهمة. عمليًا، تمنح الصورة الشخصية الواضحة المواجهة والمضاءة بالتساوي تقنية مزامنة الشفاه مادة أفضل للعمل من صورة مائلة أو مظللة.

Avatar V ينسخ الحركة الحقيقية
Avatar V يسلك طريقًا مختلفًا. تصف HeyGen المحرك بأنه محرك يعتمد على المراجع المتقاطعة: يعيد استخدام البصمة الحركية لشخص حقيقي، فيومئ المقدّم ويتحرك كما يفعل ذلك الشخص فعلًا. لذلك يناسب بشكل أفضل التوأم الرقمي لمؤسس أو مدرّب أو متحدث رسمي.
الثمن الذي تدفعه هنا هو محدودية الوصول. avatar_id الذي ترسله يجب أن يدعم Avatar V، ولن تؤهل صورة جاهزة من المكتبة. كما تتخلى عن قائمة نبرات الصوت، وإن كنت تحتفظ بسرعة الصوت والترجمات ونسبة العرض وثلاثة مستويات للدقة.
الإعداد يتطلب جهدًا أكبر من Avatar IV. يُدرَّب التوأم الرقمي على فيديو للشخص الحقيقي، لذا يجب تصوير شخص ما مرة واحدة، بكاميرا جيدة وإضاءة مناسبة، قبل كتابة أي نص. وبعد تلك الجلسة، يمكن للمقدّم نفسه أن يلقي عددًا من النصوص الجديدة بقدر ما تسمح به أرصدتك، دون حجز استوديو آخر. هنا يعود الاستثمار بالفائدة على الفرق التي تنشر أسبوعيًا.

التكلفة الحقيقية لكل منهما
هنا يتعادل المحركان. تحتسب خطط HeyGen الاستهلاكية Avatar V وAvatar IV بالمعدل نفسه، لذلك تنطبق الأرقام أدناه على أيهما.
الأرصدة على خطط الويب
يكلّف كل محرك 20 نقطة في الدقيقة من الفيديو المنتهي. وتُترجم مخصصات الخطط المعلنة إلى دقائق كما يلي:
| الخطة | السعر الشهري | النقاط | دقائق الأفاتار |
|---|
| Creator | 29 دولارًا | 600 | نحو 30 |
| Pro | 49 دولارًا | 1,000 | نحو 50 |
| Business | 149 دولارًا | 1,500 | نحو 75 |
وهذا يضع Creator عند نحو 97 سنتًا لكل دقيقة، وPro عند نحو 98 سنتًا لكل دقيقة. أما Business فيقترب من 2 دولار للدقيقة لأنك تدفع أيضًا مقابل الأرصدة المشتركة ومقاعد الفريق. تشير التقارير إلى أن الخطة المجانية لا تتضمن أرصدة للأفاتار، لذا تصلح فقط للتحقق من سير العمل.
💡 تنبيه: تتغير معدلات الأرصدة وأسعار الخطط بين تحديثات المنتج. تحقّق من صفحة أسعار HeyGen الحالية قبل شراء أي خطة، واعتبر كل رقم هنا لقطة من الوقت الحالي.

أسعار API لكل ثانية
يُحتسب استخدام API من محفظة بالدولار بدلًا من أرصدة الخطة، والأرقام المنشورة ليست متسقة تمامًا. يذكر أحد التفصيلات أن الصور الرمزية الفوتوغرافية Avatar IV تبلغ نحو $3 للدقيقة (720p أو 1080p) و$4 بدقة 4K، أما الصور الرمزية للتوأم الرقمي أو الاستوديو فبسعر $4 و$5. ويذكر مصدر آخر من $0.05 إلى $0.10 للثانية، أي ما يعادل من $3 إلى $6 للدقيقة. اقرأ هذه الأرقام كنطاق واحد: نحو $3 إلى $6 عن كل دقيقة تُصيّرها.
لم أجد سعر API منفصلًا للنموذج Avatar V في المصادر التي راجعتها، لذا لا تفترض أنه أرخص أو أغلى من Avatar IV حتى تنشر HeyGen سعرًا له.
تكلفة الدقيقة المنتهية
لنفترض أنك تحتاج إلى عشرة فيديوهات مدة كل منها دقيقة واحدة.
- خطة Creator: 200 نقطة، أي نحو ثلث الحصة الشهرية، أو ما يعادل تقريبًا $9.70 من قيمة الخطة.
- محفظة API بسعر $3 إلى $4 للدقيقة: $30 إلى $40 مقابل لعشر الدقائق نفسها.
الأرصدة على الخطة هي الطريق الأرخص حين تستخدمها بالكامل. لكن إعادة التصيير تغيّر الحساب بسرعة. إذا احتاجت كل دقيقة نهائية إلى ثلاثة تصييرات، فاضرب الرقمين في ثلاثة. تشير التقارير إلى أن محرك Avatar III الأقدم من HeyGen أرخص بكثير للدقيقة، لذا استخدمه لمسودات النصوص ووفّر المحركات المتميزة للتصيير النهائي.
الجودة جنبًا إلى جنب
السعر متعادل، لذا يجب أن تحسم الجودة الأمر. تظهر معظم الفروقات الحقيقية في الحركة، وفي النصوص الطويلة، وفي صيغة الإخراج.

الحركة والتعابير
Avatar V هو المحرك الأحدث، وتعد صفحته بجودة حركة أفضل وتعابير أكثر تماسكًا، خاصة في النصوص الطويلة. والمنطق هنا سليم: المحرك الذي يعيد استخدام نمط حركة شخص حقيقي يحتاج إلى ابتكار أقل، لذلك تبقى حركات الرأس وانحناءات الكتفين والرمش متسقة من الجملة الأولى حتى الأخيرة.
يعتمد Avatar IV على تحريك الصور التعبيرية. ويتفوق عندما يكون المصدر صورة ثابتة أو شخصية مُنمَّطة، حيث لا يوجد تسجيل حركي ينسخه. توقّع نتائج حيوية في المقاطع القصيرة، وقدرًا أكبر من التكرار في الإيماءات في المقاطع الطويلة.
مزامنة الشفاه والنصوص الطويلة
تعد الصفحتان بحركة شفاه تتبع كل مقطع صوتي، وكلاهما يقبل حتى 5,000 حرف في تشغيل واحد. وهذا يعادل تقريبًا من خمس إلى ست دقائق من الكلام بوتيرة عادية. لأي نص أطول، قسّمه إلى فصول وصيّرها بشكل منفصل. الجمل القصيرة وعلامات الترقيم النظيفة تساعد أي محرك على الحفاظ على دقة أشكال الفم.
الدقة والصيغة
يوفر Avatar V مستويات دقة 720p و1080p و4K، إضافة إلى مفتاح 16:9 أو 9:16. ويُضبط Avatar IV افتراضيًا على دقة 1920x1080، ويتيح لك ضبط العرض والارتفاع بنفسك. إذا كان ملف 4K للشاشات الكبيرة مهمًا لك، فإن Avatar V يملك هذا الإعداد مدمجًا.
ما يجب فحصه في اختبارك: راقب الفم عند الكلمات التي تنطبق فيها الشفتان مثل m و_b_ و_p_. انظر إلى العينين أثناء الوقفات، حيث يميل التصيير الأضعف إلى التجمد. تحقق من اليدين والكتفين حول علامة 30 ثانية، حيث تظهر الإيماءات المتكررة غالبًا. ثم شغّل المقطع بدون صوت مع تفعيل الترجمات، لترى إن كان التوقيت لا يزال يبدو طبيعيًا.

السرعة وأزمنة التصيير
لا يوجد محرك فوري. تعطي أمثلة التشغيل المنشورة لكل نموذج فكرة تقريبية:
- Avatar V: مقطع مدته 12 ثانية بدقة 1080p اكتمل خلال نحو 137 ثانية.
- Avatar IV: مقطع مدته 16.9 ثانية اكتمل خلال نحو 282 ثانية، وتشغيلان منشوران آخران استغرقا 252 و280 ثانية.
وهذا يعادل تقريبًا 11 ثانية من الانتظار لكل ثانية من الفيديو مع Avatar V، ونحو 17 مع Avatar IV. هذه أمثلة فردية وليست اختبارًا معياريًا مضبوطًا، لذا قد تغيّرها أوقات الطابور وطول النص. الدرس العملي يبقى: خطّط بالدقائق لا بالثواني، وصيّر المسودات بدقة 720p قبل أن تلتزم بدقة 4K.
💡 نصيحة: اكتب كل نصوصك أولًا، ثم شغّلها واحدًا تلو الآخر. بهذا يتداخل وقت التصيير مع مونتاجك أنت بدلًا من أن يعطّله.
من يستخدم أيهما
التدريب والتحديثات الداخلية
تحتاج مكتبة التدريب إلى أن يبدو المقدّم نفسه ويتحرك بالطريقة نفسها عبر عشرات الوحدات. هذه هي النقطة المثالية لاستخدام Avatar V مع توأم رقمي لمدرّبك الفعلي. وإذا كنت تستخدم مقدّمين جاهزين لمقاطع التعريف، فإن Avatar IV يتعامل معهم بشكل جيد، ويتيح لك ضبط نبرة Soothing أو Serious لكل وحدة.

المقاطع الاجتماعية والإعلانات
تعتمد المقاطع العمودية القصيرة على الانطباع الأول. يمنحك Avatar V نسبة 9:16 والترجمات المدمجة في تشغيل واحد. ويمنحك Avatar IV تخطيط اللقطة المقرّبة وصوت Excited، وهو مناسب لإعلانات المنتجات التشويقية. وبالنسبة لحملة تجمع بين الاثنين، أبقِ محركًا واحدًا لكل شخصية حتى لا يلاحظ المشاهدون التحول.
ورقة مرجعية سريعة لمهام شائعة:
| المهمة | الاختيار الأفضل | السبب |
|---|
| تحديث أسبوعي للفريق من المدير | Avatar V | مظهر متسق، ونصوص طويلة |
| شرح بشخصية ماسكوت علامة تجارية | Avatar IV | يعمل من شخصية ثابتة |
| دورة تضم 20 وحدة | Avatar V | المقدّم نفسه، وحركة مستقرة |
| تشويق لمنتج بنبرة حيوية | Avatar IV | إعدادات النبرة واللقطة المقرّبة |
| مقطع اجتماعي عمودي بترجمات | Avatar V | 9:16 والترجمات في تشغيل واحد |
| نسخ متعددة اللغات من نص واحد | أيهما | بدّل معرّف الصوت والنص |

كيفية استخدام Avatar V على PicassoIA
يتبع المحركان التدفق نفسه على Picasso IA، لذا تنطبق هذه الخطوات على Avatar IV مع بعض الخيارات الإضافية.
إعداد التشغيل
- افتح صفحة Avatar V.
- الصق نصك في
input_text. أبقِه أقل من 5,000 حرف.
- أضف
voice_id وavatar_id. كلاهما مطلوب، ويجب أن يدعم الأفاتار Avatar V.
- اختر
resolution: 720p للمسودات، و1080p كخيار افتراضي، و4K للملف النهائي.
- اختر
aspect_ratio 16:9 أو 9:16، وفعّل caption إذا كان المشاهدون سيشاهدون بدون صوت، ثم شغّله.
- انتظر بضع دقائق، ثم عاين المقطع وحمّله.
بالنسبة إلى Avatar IV، تتطابق الخطوات، لكنك تختار أيضًا avatar_style وvoice_emotion بدلًا من إعداد الدقة المسبق.
المعاملات التي تستحق التغيير
| المعامل | القيمة المقترحة | السبب |
|---|
voice_speed | 0.9 إلى 1.1 | إيقاع طبيعي دون أن يبدو مستعجلًا |
resolution | 720p أولًا، و4K أخيرًا | مسودات رخيصة، ونسخ نهائية حادة |
caption | مفعّل للمنصات الاجتماعية | معظم الخلاصات تُشغَّل تلقائيًا بدون صوت |
avatar_style (IV) | closeUp | يملأ الإطار على الهواتف |
voice_emotion (IV) | Friendly أو Broadcaster | يناسب معظم نصوص التسويق والأخبار |
أخطاء شائعة
- أفاتار خاطئ: إرسال أفاتار لا يدعم Avatar V يعيد خطأ بدلًا من فيديو.
- نص ضخم واحد: بعد نحو خمس دقائق، قسّم النص إلى فصول.
- الأرقام والاختصارات: اكتبها بالطريقة التي تريدها أن تُنطق بها، لأن الصوت يقرأ ما تكتبه تمامًا.
- مسودات 4K: اختبر الصياغة بدقة 720p، وأنفق وقت التصيير الإضافي مرة واحدة فقط.
أنشئ أول فيديو أفاتار لك
أسرع طريقة لحسم هذا النقاش هي تشغيل نصك الخاص. افتح Avatar V وAvatar IV على Picasso IA، والصق النص نفسه ومدته 30 ثانية في كل منهما، وقارن الوجوه والإيقاع والملف الذي تحصل عليه.
تحتاج إلى صورة مصغرة أو صورة ثابتة بعلامة تجارية لترافق المقطع؟ أنشئها باستخدام Seedream 4.5 أو Flux 2 Pro. وتريد فيديو يقوده مقدّم من أمر نصي واحد؟ جرّب Video Agent. وإذا كنت تفضّل تحريك وجه من الصوت، فإن Kling Avatar v2 خيار آخر على المنصة نفسها.

اختر نصًا، واضغط على التشغيل، واحكم على النتيجة بعينيك. أنشئ أول فيديو أفاتار لك على Picasso IA اليوم، ودع التصيير، لا جدول الأسعار، يتخذ القرار.