أطلقت Stability AI نموذج Stable Audio 3 في 20 مايو 2026، وأول سؤال يطرحه الجميع هو هل يحل محل الإصدار 2.5. الجواب لا. أصبح النموذجان يؤديان مهمتين مختلفتين. تقدّم العائلة الجديدة أوزانًا مفتوحة يمكنك تشغيلها على جهازك، ومقاطع تتجاوز ستّ دقائق، وأدوات تحرير مثل التعديل الموضعي. يبقى Stable Audio 2.5 الطريقة الأسرع والأسهل لإنتاج مقطع موسيقي بدون كلام في أقل من دقيقة. فيما يلي المواصفات جنبًا إلى جنب، والرخصة وتكلفة API بأرقام واضحة، ونصائح للأوامر النصية تنفع مع النموذجين، وشرح لتشغيل 2.5 على PicassoIA اليوم.

Stable Audio 3 في نظرة سريعة
Stable Audio 3 ليست نموذجًا واحدًا، بل عائلة من أربعة نماذج مبنية على بنية جديدة: مشفّر ذاتي دلالي-صوتي يضغط الصوت بنحو 4096 مرة، ويتيح للنموذج توليد أي مدة حتى الثانية الواحدة. ثلاثة من النماذج الأربعة تُنشر كأوزان مفتوحة على Hugging Face. أما الأكبر فمتاح عبر API فقط.
النماذج الأربعة
| الطراز | عدد المعاملات | أقصى مدة | الوصول |
|---|
| Small SFX | 459 مليون | حوالي 2 دقيقة | مفتوح الأوزان |
| Small (موسيقى) | 459 مليون | حوالي 2 دقيقة | مفتوح الأوزان |
| Medium | 1.4 مليار | 6 دقائق و20 ثانية | مفتوح الأوزان |
| Large | 2.7 مليار | أكثر من 6 دقائق | API أو استضافة للمؤسسات |
تقبل النماذج الأربعة أمرًا نصيًا. وتدعم العائلة أيضًا تحويل الصوت إلى صوت، الذي يعيد تشكيل مقطع موجود مع الحفاظ على توقيته، والتعديل الموضعي، الذي يعيد توليد جزء من المقطع مع بقاء الباقي دون تغيير. يأتي التعديل الموضعي بثلاثة أشكال: مقطع واحد، أو عدة مقاطع في آن واحد، والاستمرار السببي الذي يمدّ المقطع من نقطة نهايته. يقبل Small وMedium ضبط LoRA الدقيق، وجاء دعم ComfyUI في يوم الإطلاق.

💡 يستحق المعرفة: لا يغنّي أي من النماذج الأربعة. لا توجد أصوات ولا كلمات أغانٍ في العائلة كلها. إذا احتاج المقطع إلى صوت، فأضفه بنموذج منفصل، وتوضح الأقسام الأخيرة الطريقة.
ما الذي تغيّر منذ 2.5
يصل Stable Audio 2.5 إلى 190 ثانية كحد أقصى لكل توليد، أي نحو ثلاث دقائق. ويضاعف Stable Audio 3 Medium هذا الحد، ليصل إلى 6 دقائق و20 ثانية. كما أصبح التدريب أنظف: تفيد التقارير بأن مجموعة البيانات تضم نحو 1.28 مليون تسجيل مرخّص، منها حوالي 806000 مقطع من AudioSparx و473000 ملف بترخيص Creative Commons من Freesound. وتم استبعاد المواد المحمية بحقوق النشر، وهذا مهم إذا كنت تخطط لنشر ما تولّده.
المواصفات جنبًا إلى جنب
إليك الخلاصة في جدول واحد. تأتي الأسعار والمدد من تقارير الإطلاق العامة وصفحة النموذج على PicassoIA، لذا راجع صفحة الأسعار الرسمية قبل أن تضع ميزانية لمشروع كبير.
| الميزة | Stable Audio 2.5 | Stable Audio 3 |
|---|
| أقصى مدة | 190 ثانية | 6 دقائق و20 ثانية (Medium) |
| الأوزان | مستضافة فقط | مفتوحة لنماذج Small SFX و Small و Medium |
| التشغيل على جهازك | لا | Small على CPU، وMedium على GPU |
| الأصوات | التركيز على المقاطع الآلية | لا شيء |
| سعر API لكل تشغيل | حوالي 0.20 دولار (20 نقطة) | 0.26 دولار (26 نقطة) |
| أدوات التحرير | أمر نصي على PicassoIA | نص، وتحويل صوت إلى صوت، وتعديل موضعي، واستمرار |
| الضبط الدقيق | لا | LoRA على Small وMedium |
| الإعداد | لا يحتاج إلى شيء، يعمل في المتصفح | تنزيل الأوزان أو استدعاء API |

أين يتفوق 2.5 حتى الآن
السرعة والبساطة. أنتجت الأمثلة المعروضة في صفحة Stable Audio 2.5 مقاطع مدتها 90 ثانية في نحو ست ثوانٍ لكل مقطع بالخطوات الافتراضية البالغة 8. تفتح الصفحة وتكتب الأمر النصي وتضغط على التوليد. لا حاجة إلى بيئة Python ولا تعريفات GPU ولا نموذج تسجيل للرخصة.
السعر لكل تشغيل. بحوالي 20 نقطة مقابل 26، يكون 2.5 أرخص في استدعاء API عندما تحتاج إلى حلقة قصيرة فقط.
تكرار متوقَّع. أعد استخدام قيمة البذرة وستحصل على الصوت نفسه، فيمكنك تغيير كلمة واحدة في الأمر النصي وسماع تأثير تلك الكلمة بالضبط.
أين يتقدم 3
المدة. مقطع Medium مدته ستّ دقائق يكفي لمشهد قصير في فيلم أو لخلفية بودكاست دون دمج مقاطع متعددة.
التحكم. يتيح التعديل الموضعي إصلاح المقطع الموسيقي رقم 40 دون إعادة توليد الأغنية كاملة. ويمدّ الاستمرار المقطع من النقطة التي يتوقف عندها. ويعيد تحويل الصوت إلى صوت تشكيل مقطع لديك بالفعل.
ملكية سير العمل. تعني الأوزان المفتوحة أنك تستطيع العمل دون اتصال، وإبقاء المواد غير المنشورة بعيدًا عن خوادم الأطراف الثالثة، والضبط الدقيق باستخدام LoRA على مكتبتك الصوتية الخاصة. على سبيل المثال، يمكن لاستوديو ألعاب أن يدرّب Small SFX على تسجيلاته الخاصة للخطوات والمؤثرات الأرضية، فتتطابق كل خطوة مع الأسلوب الخاص بالاستوديو.
فحص جودة صريح. منحت إحدى المراجعات العائلة 7.8 من 10، وذكرت نقاط قوتها: الأصوات المحيطية الممتدة، والمؤثرات الأرضية، والتأثيرات الصوتية، والحلقات الآلية، والخلفيات الجوية. ولاحظت المراجعة نفسها أن الموسيقى قد تبدو صحيحة دون أن تبدو مثيرة، وأن الأنواع الإيقاعية تميل إلى التسطّح. تعامل مع 3 بوصفه أداة قوية للخلفيات والمؤثرات، لا بديلًا عن فرقة موسيقية.
الأوزان المفتوحة: ما الذي يمكنك تشغيله
تغيّر الأوزان المفتوحة من يستطيع استخدام هذه النماذج. قبل ذلك، كانت نماذج الصوت بهذه الجودة خلف API. أما الآن فيكفي لابتوب وتنزيل واحد للنموذجين الصغيرين.

النماذج الصغيرة على CPU
يعمل Small SFX وSmall على CPU دون بطاقة رسومات منفصلة. تذكر تقارير الإطلاق أن أزمنة التوليد تقل عن نصف ثانية على خادم H200 GPU، والغاية من التصميم هي تأليف الموسيقى كاملةً على الجهاز، دون اتصال، ودون حدود المقاطع القصيرة التي كانت تعاني منها النماذج المفتوحة الأقدم. استخدم Small SFX للضربات والأجواء والخطوات وأصوات الحركة السريعة. واستخدم Small للحلقات والمقطوعات الآلية القصيرة حتى دقيقتين.
يقبل النموذجان الصغيران ضبط LoRA الدقيق أيضًا. وLoRA إضافة صغيرة تُدرَّب على مقاطعك الخاصة، مثل تسجيلات الطبول لفرقتك أو مكتبة المؤثرات الأرضية للعبة، فتدفع كل توليد نحو ذلك الطابع. ولأن الإضافة صغيرة، فإن العمل أخف بكثير من إعادة تدريب نموذج كامل.
Medium هو الخيار الأثقل بمعاملات تبلغ 1.4 مليار. تذكر ملاحظات الإعداد أن المسار المدعوم هو GPU من CUDA مع Flash Attention 2، وتبلغ السرعة المُبلَّغ عنها على H200 أقل من ثانيتين لكل مقطع. وقاس أحد المراجعين بضع ثوانٍ على MacBook Pro M4، لذا راجع المستودع بحثًا عن عتادك بالضبط قبل أن تخطط على أساسه.
قواعد الرخصة بلغة بسيطة
تستخدم النماذج المفتوحة رخصة مجتمع Stability AI.
- أقل من مليون دولار في الإيرادات السنوية: مجانية للتنزيل والتشغيل والضبط الدقيق والاستخدام التجاري، بعد التسجيل في رخصة المجتمع. تملك مخرجاتك بالقدر الذي يسمح به القانون.
- أكثر من مليون دولار: تحتاج إلى رخصة المؤسسات، التي تضيف أيضًا تعويضًا قانونيًا.
- Large: لا يمكن تنزيله أبدًا. يمكن الوصول إليه عبر Stability API، أو عبر fal.ai، أو عبر الاستضافة الذاتية للمؤسسات.

💡 اقرأ قبل النشر: "أنت تملك المخرجات" لا تعني "المخرجات محمية بحقوق النشر". في كثير من الدول، يحظى الصوت المُنتج آليًا بالكامل بحماية أضعف من الأعمال البشرية. إذا كان المقطع محوريًا في علامتك التجارية، فأضف أداءك أو تعديلاتك الخاصة فوقه.
استخدام API
ليس الجميع يريد تثبيت أي شيء. والمسار المستضاف هو الأقصر من الفكرة إلى الملف.

تكلفة كل توليد
تُسعّر Stability بالنقاط، وتعادل النقطة الواحدة سنتًا واحدًا. يكلّف توليد Stable Audio 3 26 نقطة، أي 0.26 دولار. يُذكر أن Stable Audio 2.5 يكلّف 20 نقطة، أي حوالي 0.20 دولار. وهناك تفصيل صغير: رصيد البداية المجاني البالغ 25 نقطة أقل بنقطة واحدة من تكلفة تشغيل واحد لنموذج Stable Audio 3، لذا خطط لتعبئة رصيد صغير حتى للاختبار.
| الحجم | بسعر 0.26 دولار لكل تشغيل | بسعر 0.20 دولار لكل تشغيل |
|---|
| 10 مقاطع | 2.60 دولار | 2.00 دولار |
| 100 مقطع | 26.00 دولار | 20.00 دولار |
| 1,000 مقطع | 260.00 دولار | 200.00 دولار |
متى تتفوق API على التشغيل المحلي
اختر API عندما تحتاج إلى نموذج Large، لأنه الطريقة الوحيدة للوصول إليه دون عقد مع مؤسسة. واخترها أيضًا عندما لا يتوفر لديك GPU، أو عندما يكون حجم الطلب متقطعًا، أو عندما يحتاج منتج ما إلى صوت عند الطلب دون أن تدير خوادم. واختر الأوزان المحلية عندما تولّد آلاف المقاطع، أو تعمل دون اتصال، أو تحتاج إلى الضبط الدقيق.
يبدو سير العمل المستضاف المعتاد كالتالي:
- اكتب الأمر النصي مع النوع والآلات والمزاج والإيقاع.
- حدّد المدة التي تحتاجها بالثواني الكاملة.
- أرسل الطلب وانتظر ملف الصوت.
- استمع، ثم غيّر متغيرًا واحدًا وشغّل من جديد.
- اقطع المقطع الفائز وأضف له تلاشيًا وكرّره في محررك.
مخطط Stable Audio 2.5 المستضاف بسيط: أمر نصي، ومدة، وعدد خطوات، ومقياس CFG، وقيمة بذرة اختيارية. وهذه هي المفاتيح نفسها التي ستجدها في معظم نقاط نهاية Stable Audio، لذا ما تتدرب عليه في 2.5 ينتقل معك.
نصائح للأوامر النصية التي تنجح
تكافئ الأوامر النصية للنسختين الدقة. فطلب مبهم مثل "موسيقى هادئة" يعطيك خلفية عامة. أما الأمر الذي يسمّي النوع والآلات والمزاج والإيقاع فيعطيك ما يمكن استخدامه.

الصيغة من خمسة أجزاء
اكتب الأوامر النصية بهذا الترتيب، مفصولة بفواصل:
- النوع الموسيقي: بوم باب هيب هوب، أمبيينت هاوس، بوست روك، سينث ويف سينمائي
- الآلات: بيانو وقور، طبول SP-1200، كيك 808، أوتار، باس موجة جيبية
- المزاج: هادئ، نشوة، حزين، متوتر
- الإيقاع: رقم، مثل 90 BPM أو 125 BPM
- الملمس أو السلم: دافئ، مغبّر، واسع، سلم صغير
| أمر نصي ضعيف | أمر نصي قوي |
|---|
| موسيقى مريحة | مقطع آلي من نوع بوم باب هيب هوب ذي طابع روحي، بيانو وقور، طبول SP-1200، باس موجة جيبية، هادئ، 90 BPM |
| مقطع رقص | أمبيينت هاوس، آلة طبول 808، تصفيق، شيكر، باس سينث، نشوة، 125 BPM |
| موسيقى أفلام ملحمية | بوست روك، غيتارات، طقم طبول، باس، أوتار، مبهج، منساب، عاطفي، 125 BPM |
| صوت باب | ضربة قوية لباب خشبي ثقيل في قاعة حجرية، ذيل صدى طويل، بدون موسيقى |
للمقاطع الأطول، أضف إشارات توقيت في نهاية الأمر النصي: "وسادات ناعمة في أول 20 ثانية، تدخل الطبول بعد 20 ثانية، تلاشٍ بطيء في النهاية." تستفيد مقاطع Stable Audio 3 الطويلة من هذا أكثر من غيرها، لأن المقطع الذي يمتد ستّ دقائق يحتاج إلى قوس درامي. أما في 2.5، فأبقِ تلميحات التوقيت قصيرة، واحكم على النتيجة بالأذن.
بالنسبة إلى المؤثرات الصوتية، استبدل صيغة الموسيقى بثلاثة تفاصيل: الجسم، والسطح الذي يلامسه، والمساحة المحيطة به. فعبارة "أحذية على حصى مبلل، محجر فارغ، رياح بعيدة" تتفوق عادةً على "خطوات"، لأن النموذج يستطيع وضع الصوت في غرفة.
💡 اختصار: قد تنجح كلمتان أو ثلاث أيضًا. فقد أعطت أوامر النوع القصيرة مثل "Lo-fi Funk" أو "Cinematic Synthwave" مقاطع صالحة للاستخدام مدتها 90 ثانية في أمثلة 2.5. أضف التفاصيل فقط عندما تنحرف النتيجة الأولى.
أخطاء تهدر النقاط
- طلب الأصوات. لا يملك Stable Audio 3 أصواتًا ولا كلمات أغانٍ، أما 2.5 فموجَّه إلى المقاطع الآلية وتصميم الصوت. استخدم نموذج أغانٍ للغناء.
- تكديس الصفات. عشر كلمات للمزاج تلغي بعضها البعض. اختر اثنتين.
- تجاهل الإيقاع. بدون BPM يتيه الإيقاع. الرقم يثبّته.
- إعادة التوليد عشوائيًا. غيّر شيئًا واحدًا في كل مرة، وأبقِ قيمة البذرة ثابتة، لتعرف أي تعديل أفاد.
- توقّع لحن كورس ناجحًا. هذه النماذج الأفضل في الخلفيات والحلقات والأجواء والمؤثرات.
إصلاح الانتقالات الضعيفة
قد تُظهر الموسيقى المولّدة انتقالات ضعيفة، وتكرارًا، وإيقاعًا غير مستقر، وضوضاء خلفية، ونهايات مفاجئة. في Stable Audio 3، أصلح الجزء الضعيف بالتعديل الموضعي بدلًا من البدء من جديد. أما في 2.5، فولّد مقطعًا أطول قليلًا مما تحتاج، واقطع النهاية الضعيفة في أي محرر صوت، وأضف تلاشيًا قصيرًا.
وقت كتابة هذا المقال، يدرج كتالوج PicassoIA Stable Audio 2.5 وليس Stable Audio 3. يبقى أسرع طريقة لاختبار أسلوب أمر نصي دون تثبيت أي شيء، والعادات التي تكتسبها تنتقل معك.

خطوة بخطوة
- افتح صفحة Stable Audio 2.5 على PicassoIA.
- الصق أمرًا نصيًا مبنيًا بالصيغة ذات الأجزاء الخمسة أعلاه.
- حدّد المدة بالثواني. القيمة الافتراضية 190، وهي الحد الأقصى.
- اترك الخطوات على 8 من أجل مرور أول سريع.
- اترك مقياس CFG على 1، ثم ارفعه إذا تجاهلت النتيجة آلاتك.
- اضغط على التوليد واستمع. تنتهي معظم المقاطع التي مدتها 90 ثانية في نحو ست ثوانٍ.
- انسخ البذرة التي أعجبتك، وغيّر كلمة واحدة في الأمر النصي، وولّد من جديد.
الإعدادات التي تستحق التغيير
| الإعداد | الافتراضي | ما وظيفته |
|---|
| الأمر النصي | لا يوجد | يصف النوع والآلات والمزاج والإيقاع |
| المدة | 190 | طول المقطع بالثواني |
| الخطوات | 8 | المزيد من الخطوات يعني سرعة أقل مقابل تفاصيل أدق |
| مقياس CFG | 1 | القيم الأعلى تتبع الأمر النصي بدقة أكبر |
| البذرة | عشوائية | أعد استخدامها لإعادة إنتاج نتيجة |
جرّب المدد القصيرة أولًا. الحلقة التي مدتها 30 ثانية هي الأقل تكلفة من حيث الوقت للحكم عليها، ويمكنك بعد ذلك مدّ الأمر النصي الفائز إلى الطول الكامل.
أضف الأصوات والتعليقات الصوتية والنصوص المفرّغة
بما أن أيًا من النسختين لا يغنّي، فإن المشروع المكتمل يحتاج عادةً إلى أداتين أو ثلاث. يجمعها PicassoIA في مكان واحد.

أغانٍ بأصوات
عندما يتطلب الموجز كلمات ومغنيًا، بدّل النموذج. يولّد Music 2.5 أغاني كاملة بأصوات. ويُنشئ Lyria 3 Pro أغاني بطول كامل، ويؤلف Music from ElevenLabs مقاطع من أمر نصي. سير عمل شائع: أعدّ مسودة الخلفية الآلية في Stable Audio، ثم قارنها بنموذج صوتي لترى أيهما يناسب الفيديو.
التعليقات الصوتية والنصوص المفرّغة
لتعليق صوتي فوق مقطعك الآلي، يوفّر Speech 2.8 HD تعليقات صوتية بجودة الاستوديو، ويقدم Gemini 3.1 Flash TTS 30 صوتًا عبر أكثر من 70 لغة، وV3 from ElevenLabs خيار طبيعي الصوت للقراءات الطويلة.
لتحويل التسجيلات إلى نص مرة أخرى، شغّلها عبر GPT 4o Transcribe أو Gemini 3 Pro. تساعد النصوص المفرّغة في إعداد الترجمات المصاحبة للفيديو وملاحظات العرض، وفي التأكد من أن التعليق الصوتي يقول تمامًا ما في السيناريو قبل أن يُوضع تحت الموسيقى.
أنشئ أول مقطع لك اليوم
إذن، أيهما تختار؟ الجواب يتوقف على المهمة:
| المهمة | الخيار الأفضل | السبب |
|---|
| حزمة خطوات ومؤثرات وأجواء | Stable Audio 3 Small SFX | مجاني، يعمل دون اتصال، ويشتغل على CPU |
| حلقة لفيديو أو ريل | Stable Audio 3 Small أو Stable Audio 2.5 | سريع ورخيص، ولا يحتاج 2.5 إلى إعداد |
| خلفية مدتها ستّ دقائق | Stable Audio 3 Medium | أطول نموذج مفتوح، ويحتاج إلى GPU |
| صوت عند الطلب داخل منتج | Stable Audio 3 Large (API) | الفئة العليا، دون خوادم تحتاج إلى إدارة |
| اختبار سريع لفكرة أمر نصي | Stable Audio 2.5 على PicassoIA | نتائج في ثوانٍ، دون تثبيت أي شيء |
أسرع طريقة لتسمع الفرق في الأوامر النصية هي تجربتها. افتح Stable Audio 2.5 على Picasso IA، والصق أحد الأوامر من الجدول أعلاه، وولّد حلقة مدتها 30 ثانية. ثم غيّر الإيقاع، وبدّل آلة واحدة، واستمع مرة أخرى. خلال عشر دقائق ستعرف كيف تستجيب هذه العائلة، وعندما تكون مستعدًا للأصوات أو النصوص المفرّغة، فإن نماذج الكلام والتفريغ تبعد نقرة واحدة على المنصة نفسها.