Stable Audio 3 مقابل 2.5: النماذج المفتوحة وواجهة API ونصائح الأوامر النصية

يقدّم Stable Audio 3 أوزانًا مفتوحة ومقاطع تصل إلى ستّ دقائق وتعديلًا موضعيًا، بينما يبقى Stable Audio 2.5 الخيار السريع الذي لا يتطلب أي إعداد. قارن المواصفات جنبًا إلى جنب، واعرف ما تسمح به رخصة المجتمع (Community License) وتكلفة واجهة API لكل مقطع، وجرّب صيغة الأمر النصي التي تنتج موسيقى أنظف من النموذجين.

Stable Audio 3 مقابل 2.5: النماذج المفتوحة وواجهة API ونصائح الأوامر النصية
Cristian Da Conceicao
مؤسس Picasso IA

أطلقت Stability AI نموذج Stable Audio 3 في 20 مايو 2026، وأول سؤال يطرحه الجميع هو هل يحل محل الإصدار 2.5. الجواب لا. أصبح النموذجان يؤديان مهمتين مختلفتين. تقدّم العائلة الجديدة أوزانًا مفتوحة يمكنك تشغيلها على جهازك، ومقاطع تتجاوز ستّ دقائق، وأدوات تحرير مثل التعديل الموضعي. يبقى Stable Audio 2.5 الطريقة الأسرع والأسهل لإنتاج مقطع موسيقي بدون كلام في أقل من دقيقة. فيما يلي المواصفات جنبًا إلى جنب، والرخصة وتكلفة API بأرقام واضحة، ونصائح للأوامر النصية تنفع مع النموذجين، وشرح لتشغيل 2.5 على PicassoIA اليوم.

منظر علوي لمكتب خشبي من البلوط عليه لابتوب وسماعات ودفتر وجهاز تحكم MIDI

Stable Audio 3 في نظرة سريعة

Stable Audio 3 ليست نموذجًا واحدًا، بل عائلة من أربعة نماذج مبنية على بنية جديدة: مشفّر ذاتي دلالي-صوتي يضغط الصوت بنحو 4096 مرة، ويتيح للنموذج توليد أي مدة حتى الثانية الواحدة. ثلاثة من النماذج الأربعة تُنشر كأوزان مفتوحة على Hugging Face. أما الأكبر فمتاح عبر API فقط.

النماذج الأربعة

الطرازعدد المعاملاتأقصى مدةالوصول
Small SFX459 مليونحوالي 2 دقيقةمفتوح الأوزان
Small (موسيقى)459 مليونحوالي 2 دقيقةمفتوح الأوزان
Medium1.4 مليار6 دقائق و20 ثانيةمفتوح الأوزان
Large2.7 مليارأكثر من 6 دقائقAPI أو استضافة للمؤسسات

تقبل النماذج الأربعة أمرًا نصيًا. وتدعم العائلة أيضًا تحويل الصوت إلى صوت، الذي يعيد تشكيل مقطع موجود مع الحفاظ على توقيته، والتعديل الموضعي، الذي يعيد توليد جزء من المقطع مع بقاء الباقي دون تغيير. يأتي التعديل الموضعي بثلاثة أشكال: مقطع واحد، أو عدة مقاطع في آن واحد، والاستمرار السببي الذي يمدّ المقطع من نقطة نهايته. يقبل Small وMedium ضبط LoRA الدقيق، وجاء دعم ComfyUI في يوم الإطلاق.

أربعة ميكروفونات مكثفة بأحجام متزايدة مصطفة على طاولة خشبية

💡 يستحق المعرفة: لا يغنّي أي من النماذج الأربعة. لا توجد أصوات ولا كلمات أغانٍ في العائلة كلها. إذا احتاج المقطع إلى صوت، فأضفه بنموذج منفصل، وتوضح الأقسام الأخيرة الطريقة.

ما الذي تغيّر منذ 2.5

يصل Stable Audio 2.5 إلى 190 ثانية كحد أقصى لكل توليد، أي نحو ثلاث دقائق. ويضاعف Stable Audio 3 Medium هذا الحد، ليصل إلى 6 دقائق و20 ثانية. كما أصبح التدريب أنظف: تفيد التقارير بأن مجموعة البيانات تضم نحو 1.28 مليون تسجيل مرخّص، منها حوالي 806000 مقطع من AudioSparx و473000 ملف بترخيص Creative Commons من Freesound. وتم استبعاد المواد المحمية بحقوق النشر، وهذا مهم إذا كنت تخطط لنشر ما تولّده.

المواصفات جنبًا إلى جنب

إليك الخلاصة في جدول واحد. تأتي الأسعار والمدد من تقارير الإطلاق العامة وصفحة النموذج على PicassoIA، لذا راجع صفحة الأسعار الرسمية قبل أن تضع ميزانية لمشروع كبير.

الميزةStable Audio 2.5Stable Audio 3
أقصى مدة190 ثانية6 دقائق و20 ثانية (Medium)
الأوزانمستضافة فقطمفتوحة لنماذج Small SFX و Small و Medium
التشغيل على جهازكلاSmall على CPU، وMedium على GPU
الأصواتالتركيز على المقاطع الآليةلا شيء
سعر API لكل تشغيلحوالي 0.20 دولار (20 نقطة)0.26 دولار (26 نقطة)
أدوات التحريرأمر نصي على PicassoIAنص، وتحويل صوت إلى صوت، وتعديل موضعي، واستمرار
الضبط الدقيقلاLoRA على Small وMedium
الإعدادلا يحتاج إلى شيء، يعمل في المتصفحتنزيل الأوزان أو استدعاء API

مكبّرا صوت استوديو أسودان يواجهان الكاميرا في غرفة معالَجة صوتيًا

أين يتفوق 2.5 حتى الآن

السرعة والبساطة. أنتجت الأمثلة المعروضة في صفحة Stable Audio 2.5 مقاطع مدتها 90 ثانية في نحو ست ثوانٍ لكل مقطع بالخطوات الافتراضية البالغة 8. تفتح الصفحة وتكتب الأمر النصي وتضغط على التوليد. لا حاجة إلى بيئة Python ولا تعريفات GPU ولا نموذج تسجيل للرخصة.

السعر لكل تشغيل. بحوالي 20 نقطة مقابل 26، يكون 2.5 أرخص في استدعاء API عندما تحتاج إلى حلقة قصيرة فقط.

تكرار متوقَّع. أعد استخدام قيمة البذرة وستحصل على الصوت نفسه، فيمكنك تغيير كلمة واحدة في الأمر النصي وسماع تأثير تلك الكلمة بالضبط.

أين يتقدم 3

المدة. مقطع Medium مدته ستّ دقائق يكفي لمشهد قصير في فيلم أو لخلفية بودكاست دون دمج مقاطع متعددة.

التحكم. يتيح التعديل الموضعي إصلاح المقطع الموسيقي رقم 40 دون إعادة توليد الأغنية كاملة. ويمدّ الاستمرار المقطع من النقطة التي يتوقف عندها. ويعيد تحويل الصوت إلى صوت تشكيل مقطع لديك بالفعل.

ملكية سير العمل. تعني الأوزان المفتوحة أنك تستطيع العمل دون اتصال، وإبقاء المواد غير المنشورة بعيدًا عن خوادم الأطراف الثالثة، والضبط الدقيق باستخدام LoRA على مكتبتك الصوتية الخاصة. على سبيل المثال، يمكن لاستوديو ألعاب أن يدرّب Small SFX على تسجيلاته الخاصة للخطوات والمؤثرات الأرضية، فتتطابق كل خطوة مع الأسلوب الخاص بالاستوديو.

فحص جودة صريح. منحت إحدى المراجعات العائلة 7.8 من 10، وذكرت نقاط قوتها: الأصوات المحيطية الممتدة، والمؤثرات الأرضية، والتأثيرات الصوتية، والحلقات الآلية، والخلفيات الجوية. ولاحظت المراجعة نفسها أن الموسيقى قد تبدو صحيحة دون أن تبدو مثيرة، وأن الأنواع الإيقاعية تميل إلى التسطّح. تعامل مع 3 بوصفه أداة قوية للخلفيات والمؤثرات، لا بديلًا عن فرقة موسيقية.

الأوزان المفتوحة: ما الذي يمكنك تشغيله

تغيّر الأوزان المفتوحة من يستطيع استخدام هذه النماذج. قبل ذلك، كانت نماذج الصوت بهذه الجودة خلف API. أما الآن فيكفي لابتوب وتنزيل واحد للنموذجين الصغيرين.

رجل يستمع بسماعات أذن إلى لابتوب في غرفة معيشة مشمسة

النماذج الصغيرة على CPU

يعمل Small SFX وSmall على CPU دون بطاقة رسومات منفصلة. تذكر تقارير الإطلاق أن أزمنة التوليد تقل عن نصف ثانية على خادم H200 GPU، والغاية من التصميم هي تأليف الموسيقى كاملةً على الجهاز، دون اتصال، ودون حدود المقاطع القصيرة التي كانت تعاني منها النماذج المفتوحة الأقدم. استخدم Small SFX للضربات والأجواء والخطوات وأصوات الحركة السريعة. واستخدم Small للحلقات والمقطوعات الآلية القصيرة حتى دقيقتين.

يقبل النموذجان الصغيران ضبط LoRA الدقيق أيضًا. وLoRA إضافة صغيرة تُدرَّب على مقاطعك الخاصة، مثل تسجيلات الطبول لفرقتك أو مكتبة المؤثرات الأرضية للعبة، فتدفع كل توليد نحو ذلك الطابع. ولأن الإضافة صغيرة، فإن العمل أخف بكثير من إعادة تدريب نموذج كامل.

Medium هو الخيار الأثقل بمعاملات تبلغ 1.4 مليار. تذكر ملاحظات الإعداد أن المسار المدعوم هو GPU من CUDA مع Flash Attention 2، وتبلغ السرعة المُبلَّغ عنها على H200 أقل من ثانيتين لكل مقطع. وقاس أحد المراجعين بضع ثوانٍ على MacBook Pro M4، لذا راجع المستودع بحثًا عن عتادك بالضبط قبل أن تخطط على أساسه.

قواعد الرخصة بلغة بسيطة

تستخدم النماذج المفتوحة رخصة مجتمع Stability AI.

  • أقل من مليون دولار في الإيرادات السنوية: مجانية للتنزيل والتشغيل والضبط الدقيق والاستخدام التجاري، بعد التسجيل في رخصة المجتمع. تملك مخرجاتك بالقدر الذي يسمح به القانون.
  • أكثر من مليون دولار: تحتاج إلى رخصة المؤسسات، التي تضيف أيضًا تعويضًا قانونيًا.
  • Large: لا يمكن تنزيله أبدًا. يمكن الوصول إليه عبر Stability API، أو عبر fal.ai، أو عبر الاستضافة الذاتية للمؤسسات.

يدان توقّعان اتفاقية مطبوعة بجوار واجهة صوتية

💡 اقرأ قبل النشر: "أنت تملك المخرجات" لا تعني "المخرجات محمية بحقوق النشر". في كثير من الدول، يحظى الصوت المُنتج آليًا بالكامل بحماية أضعف من الأعمال البشرية. إذا كان المقطع محوريًا في علامتك التجارية، فأضف أداءك أو تعديلاتك الخاصة فوقه.

استخدام API

ليس الجميع يريد تثبيت أي شيء. والمسار المستضاف هو الأقصر من الفكرة إلى الملف.

مطوّرة تكتب على مكتب بوضعية الوقوف وسماعات استوديو حول رقبتها

تكلفة كل توليد

تُسعّر Stability بالنقاط، وتعادل النقطة الواحدة سنتًا واحدًا. يكلّف توليد Stable Audio 3 26 نقطة، أي 0.26 دولار. يُذكر أن Stable Audio 2.5 يكلّف 20 نقطة، أي حوالي 0.20 دولار. وهناك تفصيل صغير: رصيد البداية المجاني البالغ 25 نقطة أقل بنقطة واحدة من تكلفة تشغيل واحد لنموذج Stable Audio 3، لذا خطط لتعبئة رصيد صغير حتى للاختبار.

الحجمبسعر 0.26 دولار لكل تشغيلبسعر 0.20 دولار لكل تشغيل
10 مقاطع2.60 دولار2.00 دولار
100 مقطع26.00 دولار20.00 دولار
1,000 مقطع260.00 دولار200.00 دولار

متى تتفوق API على التشغيل المحلي

اختر API عندما تحتاج إلى نموذج Large، لأنه الطريقة الوحيدة للوصول إليه دون عقد مع مؤسسة. واخترها أيضًا عندما لا يتوفر لديك GPU، أو عندما يكون حجم الطلب متقطعًا، أو عندما يحتاج منتج ما إلى صوت عند الطلب دون أن تدير خوادم. واختر الأوزان المحلية عندما تولّد آلاف المقاطع، أو تعمل دون اتصال، أو تحتاج إلى الضبط الدقيق.

يبدو سير العمل المستضاف المعتاد كالتالي:

  1. اكتب الأمر النصي مع النوع والآلات والمزاج والإيقاع.
  2. حدّد المدة التي تحتاجها بالثواني الكاملة.
  3. أرسل الطلب وانتظر ملف الصوت.
  4. استمع، ثم غيّر متغيرًا واحدًا وشغّل من جديد.
  5. اقطع المقطع الفائز وأضف له تلاشيًا وكرّره في محررك.

مخطط Stable Audio 2.5 المستضاف بسيط: أمر نصي، ومدة، وعدد خطوات، ومقياس CFG، وقيمة بذرة اختيارية. وهذه هي المفاتيح نفسها التي ستجدها في معظم نقاط نهاية Stable Audio، لذا ما تتدرب عليه في 2.5 ينتقل معك.

نصائح للأوامر النصية التي تنجح

تكافئ الأوامر النصية للنسختين الدقة. فطلب مبهم مثل "موسيقى هادئة" يعطيك خلفية عامة. أما الأمر الذي يسمّي النوع والآلات والمزاج والإيقاع فيعطيك ما يمكن استخدامه.

يد تكتب في دفتر بجوار مركب صوتي تناظري صغير

الصيغة من خمسة أجزاء

اكتب الأوامر النصية بهذا الترتيب، مفصولة بفواصل:

  1. النوع الموسيقي: بوم باب هيب هوب، أمبيينت هاوس، بوست روك، سينث ويف سينمائي
  2. الآلات: بيانو وقور، طبول SP-1200، كيك 808، أوتار، باس موجة جيبية
  3. المزاج: هادئ، نشوة، حزين، متوتر
  4. الإيقاع: رقم، مثل 90 BPM أو 125 BPM
  5. الملمس أو السلم: دافئ، مغبّر، واسع، سلم صغير
أمر نصي ضعيفأمر نصي قوي
موسيقى مريحةمقطع آلي من نوع بوم باب هيب هوب ذي طابع روحي، بيانو وقور، طبول SP-1200، باس موجة جيبية، هادئ، 90 BPM
مقطع رقصأمبيينت هاوس، آلة طبول 808، تصفيق، شيكر، باس سينث، نشوة، 125 BPM
موسيقى أفلام ملحميةبوست روك، غيتارات، طقم طبول، باس، أوتار، مبهج، منساب، عاطفي، 125 BPM
صوت بابضربة قوية لباب خشبي ثقيل في قاعة حجرية، ذيل صدى طويل، بدون موسيقى

للمقاطع الأطول، أضف إشارات توقيت في نهاية الأمر النصي: "وسادات ناعمة في أول 20 ثانية، تدخل الطبول بعد 20 ثانية، تلاشٍ بطيء في النهاية." تستفيد مقاطع Stable Audio 3 الطويلة من هذا أكثر من غيرها، لأن المقطع الذي يمتد ستّ دقائق يحتاج إلى قوس درامي. أما في 2.5، فأبقِ تلميحات التوقيت قصيرة، واحكم على النتيجة بالأذن.

بالنسبة إلى المؤثرات الصوتية، استبدل صيغة الموسيقى بثلاثة تفاصيل: الجسم، والسطح الذي يلامسه، والمساحة المحيطة به. فعبارة "أحذية على حصى مبلل، محجر فارغ، رياح بعيدة" تتفوق عادةً على "خطوات"، لأن النموذج يستطيع وضع الصوت في غرفة.

💡 اختصار: قد تنجح كلمتان أو ثلاث أيضًا. فقد أعطت أوامر النوع القصيرة مثل "Lo-fi Funk" أو "Cinematic Synthwave" مقاطع صالحة للاستخدام مدتها 90 ثانية في أمثلة 2.5. أضف التفاصيل فقط عندما تنحرف النتيجة الأولى.

أخطاء تهدر النقاط

  • طلب الأصوات. لا يملك Stable Audio 3 أصواتًا ولا كلمات أغانٍ، أما 2.5 فموجَّه إلى المقاطع الآلية وتصميم الصوت. استخدم نموذج أغانٍ للغناء.
  • تكديس الصفات. عشر كلمات للمزاج تلغي بعضها البعض. اختر اثنتين.
  • تجاهل الإيقاع. بدون BPM يتيه الإيقاع. الرقم يثبّته.
  • إعادة التوليد عشوائيًا. غيّر شيئًا واحدًا في كل مرة، وأبقِ قيمة البذرة ثابتة، لتعرف أي تعديل أفاد.
  • توقّع لحن كورس ناجحًا. هذه النماذج الأفضل في الخلفيات والحلقات والأجواء والمؤثرات.

إصلاح الانتقالات الضعيفة

قد تُظهر الموسيقى المولّدة انتقالات ضعيفة، وتكرارًا، وإيقاعًا غير مستقر، وضوضاء خلفية، ونهايات مفاجئة. في Stable Audio 3، أصلح الجزء الضعيف بالتعديل الموضعي بدلًا من البدء من جديد. أما في 2.5، فولّد مقطعًا أطول قليلًا مما تحتاج، واقطع النهاية الضعيفة في أي محرر صوت، وأضف تلاشيًا قصيرًا.

شغّل Stable Audio 2.5 على PicassoIA

وقت كتابة هذا المقال، يدرج كتالوج PicassoIA Stable Audio 2.5 وليس Stable Audio 3. يبقى أسرع طريقة لاختبار أسلوب أمر نصي دون تثبيت أي شيء، والعادات التي تكتسبها تنتقل معك.

لقطة من فوق الكتف لامرأة بسماعات تتابع موجة صوتية على لابتوب

خطوة بخطوة

  1. افتح صفحة Stable Audio 2.5 على PicassoIA.
  2. الصق أمرًا نصيًا مبنيًا بالصيغة ذات الأجزاء الخمسة أعلاه.
  3. حدّد المدة بالثواني. القيمة الافتراضية 190، وهي الحد الأقصى.
  4. اترك الخطوات على 8 من أجل مرور أول سريع.
  5. اترك مقياس CFG على 1، ثم ارفعه إذا تجاهلت النتيجة آلاتك.
  6. اضغط على التوليد واستمع. تنتهي معظم المقاطع التي مدتها 90 ثانية في نحو ست ثوانٍ.
  7. انسخ البذرة التي أعجبتك، وغيّر كلمة واحدة في الأمر النصي، وولّد من جديد.

الإعدادات التي تستحق التغيير

الإعدادالافتراضيما وظيفته
الأمر النصيلا يوجديصف النوع والآلات والمزاج والإيقاع
المدة190طول المقطع بالثواني
الخطوات8المزيد من الخطوات يعني سرعة أقل مقابل تفاصيل أدق
مقياس CFG1القيم الأعلى تتبع الأمر النصي بدقة أكبر
البذرةعشوائيةأعد استخدامها لإعادة إنتاج نتيجة

جرّب المدد القصيرة أولًا. الحلقة التي مدتها 30 ثانية هي الأقل تكلفة من حيث الوقت للحكم عليها، ويمكنك بعد ذلك مدّ الأمر النصي الفائز إلى الطول الكامل.

أضف الأصوات والتعليقات الصوتية والنصوص المفرّغة

بما أن أيًا من النسختين لا يغنّي، فإن المشروع المكتمل يحتاج عادةً إلى أداتين أو ثلاث. يجمعها PicassoIA في مكان واحد.

مغنٍّ بسترة جينز أمام ميكروفون مكثف داخل كابينة تسجيل صوت

أغانٍ بأصوات

عندما يتطلب الموجز كلمات ومغنيًا، بدّل النموذج. يولّد Music 2.5 أغاني كاملة بأصوات. ويُنشئ Lyria 3 Pro أغاني بطول كامل، ويؤلف Music from ElevenLabs مقاطع من أمر نصي. سير عمل شائع: أعدّ مسودة الخلفية الآلية في Stable Audio، ثم قارنها بنموذج صوتي لترى أيهما يناسب الفيديو.

التعليقات الصوتية والنصوص المفرّغة

لتعليق صوتي فوق مقطعك الآلي، يوفّر Speech 2.8 HD تعليقات صوتية بجودة الاستوديو، ويقدم Gemini 3.1 Flash TTS 30 صوتًا عبر أكثر من 70 لغة، وV3 from ElevenLabs خيار طبيعي الصوت للقراءات الطويلة.

لتحويل التسجيلات إلى نص مرة أخرى، شغّلها عبر GPT 4o Transcribe أو Gemini 3 Pro. تساعد النصوص المفرّغة في إعداد الترجمات المصاحبة للفيديو وملاحظات العرض، وفي التأكد من أن التعليق الصوتي يقول تمامًا ما في السيناريو قبل أن يُوضع تحت الموسيقى.

أنشئ أول مقطع لك اليوم

إذن، أيهما تختار؟ الجواب يتوقف على المهمة:

المهمةالخيار الأفضلالسبب
حزمة خطوات ومؤثرات وأجواءStable Audio 3 Small SFXمجاني، يعمل دون اتصال، ويشتغل على CPU
حلقة لفيديو أو ريلStable Audio 3 Small أو Stable Audio 2.5سريع ورخيص، ولا يحتاج 2.5 إلى إعداد
خلفية مدتها ستّ دقائقStable Audio 3 Mediumأطول نموذج مفتوح، ويحتاج إلى GPU
صوت عند الطلب داخل منتجStable Audio 3 Large (API)الفئة العليا، دون خوادم تحتاج إلى إدارة
اختبار سريع لفكرة أمر نصيStable Audio 2.5 على PicassoIAنتائج في ثوانٍ، دون تثبيت أي شيء

أسرع طريقة لتسمع الفرق في الأوامر النصية هي تجربتها. افتح Stable Audio 2.5 على Picasso IA، والصق أحد الأوامر من الجدول أعلاه، وولّد حلقة مدتها 30 ثانية. ثم غيّر الإيقاع، وبدّل آلة واحدة، واستمع مرة أخرى. خلال عشر دقائق ستعرف كيف تستجيب هذه العائلة، وعندما تكون مستعدًا للأصوات أو النصوص المفرّغة، فإن نماذج الكلام والتفريغ تبعد نقرة واحدة على المنصة نفسها.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة