كيف يعمل توليد الموسيقى بالذكاء الاصطناعي: من الأمر النصي إلى أغنية كاملة

يحوّل توليد الموسيقى بالذكاء الاصطناعي الأوصاف النصية البسيطة إلى أغانٍ كاملة تضم غناءً وآلات موسيقية وبنية موسيقية. يشرح هذا المقال البنى العصبية وأساليب التدريب والنماذج الحقيقية وراء هذه التقنية، ويوضح ما يحدث بالضبط عندما تكتب أمرًا نصيًا وتضغط على توليد.

كيف يعمل توليد الموسيقى بالذكاء الاصطناعي: من الأمر النصي إلى أغنية كاملة
Cristian Da Conceicao
مؤسس Picasso IA

عندما تكتب "ثلاثي جاز حيوي على البيانو مع طبول بفرشاة، 120 BPM" وتضغط على توليد، تظهر أغنية جاهزة خلال ثوانٍ. لا وقت استوديو. لا عازفون محترفون. لا حاجة لنظرية موسيقية. هذا ليس سحرًا. إنه مجموعة معقّدة من بنى تعلّم الآلة تعمل على أمرك النصي، توكنًا تلو الآخر.

هكذا يعمل توليد الموسيقى بالذكاء الاصطناعي فعليًا.

ماذا يحدث فعليًا داخل نموذج موسيقى بالذكاء الاصطناعي

التدريب على ملايين العينات الصوتية

يبدأ كل نموذج موسيقي بالذكاء الاصطناعي من البيانات. مجموعات بيانات ضخمة من التسجيلات الصوتية وملفات MIDI والنوتات الموسيقية والبيانات الوصفية التي تغطي الأنواع والإيقاعات والمزاج والآلات الموسيقية. فنموذج Google Lyria 3 وLyria 3 Pro الشقيق، على سبيل المثال، دُرّبا على مكتبات واسعة تغطي الكلاسيكية والإلكترونية والجاز والبوب وغيرها.

أثناء التدريب، يُعرض النموذج على أزواج: عينة صوتية مع وصف نصي لما تحتويه تلك العينة. يستوعب النموذج الأنماط الإحصائية التي تربط اللغة بالصوت، لا بحفظ أغانٍ بعينها، بل باستيعاب العلاقة بين المفاهيم والبنى الصوتية. يرتبط تصاعد وترٍ أوركسترالي واسع بكلمات مثل "سينمائي" أو "عاطفي" أو "أوركسترالي". ويرتبط نمط الركلة الرباعية المنتظمة (four-on-the-floor) على طبلة الركلة بكلمات مثل "هاوس" أو "رقص" أو "نادي". وعبر مئات الملايين من الأمثلة، تصبح هذه الارتباطات دقيقة بما يكفي لتوليدها عند الطلب.

💡 التدريب لا يعلّم الذكاء الاصطناعي أغانٍ بعينها. بل يعلّمه العلاقة بين المفاهيم والبنى الصوتية.

كيف تلتقط النماذج الأنماط الموسيقية

يعالج النموذج الصوت في شكل رياضي مضغوط. فبدلًا من العمل مع الموجات الصوتية الخام (وهي ضخمة ومكلفة حسابيًا)، تحوّل معظم مولدات الموسيقى الحديثة بالذكاء الاصطناعي الصوت إلى تمثيل كامن: ترميز عددي مضغوط يلتقط الخصائص الصوتية الأساسية للإشارة الأصلية.

تعمل حلقة التدريب على النحو التالي:

  1. يُرمَّز مقطع صوتي حقيقي إلى شكله الكامن
  2. تُضاف الضوضاء تدريجيًا حتى يصبح الترميز غير قابل للتعرف
  3. يُدرَّب النموذج على عكس عملية الضوضاء تلك، خطوة بخطوة
  4. وعبر ملايين التكرارات، يصبح أفضل في إعادة بناء الموسيقى انطلاقًا من الضوضاء، موجَّهًا بالأوصاف النصية

هذا هو جوهر توليد الصوت القائم على الانتشار، وهو ما يشغّل معظم أفضل أدوات الموسيقى بالذكاء الاصطناعي المتاحة اليوم.

مفاتيح بيانو في استوديو تسجيل تحت ضوء تنغستن دافئ

البنى العصبية وراء الموسيقى بالذكاء الاصطناعي

نماذج الانتشار للصوت

تعمل نماذج الانتشار عبر إزالة الضوضاء. فهي تُدرَّب على مهمة مباشرة: إعطاؤها نسخة مشوّشة من إشارة موسيقية، والتنبؤ بالنسخة الأقل تشويشًا قليلًا. وبتكرار هذه العملية عددًا كافيًا من المرات، يمكن الانتقال من ضوضاء خالصة إلى مقطع موسيقي متماسك.

ما يجعل الانتشار قويًا في الموسيقى هو قدرته على إنتاج صوت متصل وعالي الدقة بدلًا من المخرجات الرمزية. تستخدم نماذج مثل Stable Audio 2.5 من Stability AI انتشارًا كامنًا، أي أنها تعمل في الفضاء الصوتي المضغوط بدلًا من فضاء الموجة الخام. وهذا يجعل التوليد أسرع بشكل كبير دون التضحية بالجودة. والنتيجة نظام قادر على إنتاج دقيقة كاملة من الموسيقى في بضع ثوانٍ من الحوسبة.

توليد الموسيقى القائم على المحوّلات

أحدثت المحوّلات ثورة في النماذج اللغوية، وتعيد البنية نفسها تشكيل الذكاء الاصطناعي الموسيقي. يعالج المحوّل تسلسلات. وفي اللغة، تكون هذه التسلسلات كلمات. أما في الموسيقى، فيمكن أن تكون توكنات صوتية أو أحداث MIDI أو سمات طيفية.

يستخدم MiniMax Music 2.6 وMiniMax Music 2.5 بنى قائمة على المحوّلات لتوليد أغانٍ كاملة ذات بنية متماسكة، تشمل ترتيبات المقطع والكورس والغناء بكلمات. تتيح آلية الانتباه الذاتي في المحوّل للنموذج الحفاظ على السياق الموسيقي عبر المقطوعة كاملة، فيضمن أن الجسر يتصل منطقيًا بالمقدمة، وأن القوس العاطفي للأغنية يتماسك من البداية حتى النهاية.

المشفّرات التلقائية المتغيّرة والصوت الكامن

المشفّر التلقائي المتغيّر (VAE) هو محرك الضغط الكامن في معظم نماذج توليد الصوت الحديثة. مهمته أخذ الصوت المعقّد عالي الأبعاد وضغطه في فضاء كامن أصغر بكثير يحتفظ بأكثر المعلومات أهمية.

وجانب فك الترميز في المشفّر التلقائي المتغيّر بالأهمية نفسها: فهو يأخذ متجهات الكمون المضغوطة ويعيد بناءها إلى صوت كامل. ويحدد جودة هذه الإعادة مدى نظافة الناتج النهائي وواقعيته. فالمفكك الضعيف ينتج صوتًا مشوّشًا كثير التشوهات. أما المفكك القوي، مثل ما يوجد في Google Lyria 3 Pro، فينتج صوتًا يصمد أمام التدقيق الاحترافي.

سينثيسايزر أنالوغ عتيق بكابلات توصيل ملوّنة

من الأمر النصي إلى مقطوعة جاهزة

كيف يقرأ الذكاء الاصطناعي أمرك النصي

يمرّ أمرك النصي عبر مشفّر نصي، وهو عادةً نسخة من نموذج لغوي كبير أو مشفّر على نمط CLIP، مدرَّب على محاذاة تمثيلات النص والصوت. يحوّل هذا المشفّر كلماتك إلى تمثيل عددي يقع في الفضاء الرياضي نفسه الذي تقع فيه الترميزات الصوتية المبنية أثناء التدريب.

كلما اقترب تمثيل أمرك من التمثيلات الصوتية في توزيع التدريب، استطاع النموذج توليد ما وصفته بثقة أكبر. ولهذا تتفوق الأوامر المحددة والوصفية باستمرار على الأوامر الغامضة. فالنموذج لا يخمّن ما تريده، بل يتنقل داخل فضاء رياضي تعلّمه، وكلماتك هي إحداثياته.

💡 أوامر تعمل جيدًا: "عزف هادئ على غيتار أكوستيك بأصابع، مع أصوات نسائية ناعمة، 80 BPM، أجواء إندي فولك." أوامر تعطي نتائج ضعيفة: "موسيقى جميلة".

إشارات النوع والمزاج والآلات الموسيقية

يفكك مشفّر النص أمرك إلى إشارات دلالية عبر عدة أبعاد:

عنصر الأمرما يفكّه النموذج
النوع (جاز، EDM، كلاسيكي)اللغة الهارمونية، وأنماط الإيقاع، والآلات النموذجية
الإيقاع (BPM)كثافة الإيقاع، وتوزيعات مدد النوتات
المزاج (حزين، مبتهج)تسلسلات الكوردات، والديناميكيات، والكفاف اللحني
الآلات الموسيقية (بيانو، أوتار)خصائص الطابع الصوتي، وملامح الترددات
البنية (مع غناء، كورس)منطق الترتيب، ونطاقات اللحن الغنائي

يتفوق ElevenLabs Music في اتباع الأوامر المعقدة متعددة العناصر، إذ يدمج هذه الإشارات في مقطوعات تبدو مقصودة لا عشوائية. ويجعل قوته في التعبير الغنائي منه خيارًا فعالًا بشكل خاص حين يكون المزاج والنبرة العاطفية محوريين في المطلوب.

لماذا تتفاوت جودة المخرجات

قد ينتج أمران يستخدمان النموذج نفسه نتيجتين مختلفتين لثلاثة أسباب رئيسية:

  • تحديد الأمر: الأوامر الغامضة تترك المجال للصدفة. أما الأوامر المفصّلة فتقيّد فضاء التوليد.
  • اتساع بيانات التدريب: النماذج المدرَّبة على بيانات أكبر وأكثر تنوعًا تعمّم بشكل أفضل على تركيبات الأوامر غير المعتادة.
  • معاملات أخذ العينات: تستخدم معظم النماذج أخذ عينات احتمالي. وتزيد إعدادات "الحرارة" الأعلى الإبداع إلى جانب العشوائية. أما الإعدادات الأدنى فتنتج مخرجات أكثر توقعًا وتحفظًا.

وتكرار تشغيل الأمر نفسه عدة مرات بقيم بذرة مختلفة ممارسة شائعة. فالأمر الذي يعطي نتيجة ضعيفة في المحاولة الأولى كثيرًا ما يعطي نتيجة ممتازة في الثالثة.

موجة صوتية معروضة على شاشة مرجعية احترافية

أفضل نماذج الموسيقى بالذكاء الاصطناعي حاليًا

يمتد الجيل الحالي من نماذج الموسيقى بالذكاء الاصطناعي عبر طيف واسع من القدرات. إليك مقارنة لأفضل النماذج المتاحة:

النموذجالأفضل لـالغناءمدة المخرجات
Google Lyria 3 Proمقطوعات تجارية كاملة الطولنعمأغانٍ كاملة
Google Lyria 3التأليف الأصلينعمأغانٍ كاملة
MiniMax Music 2.6أغانٍ بكلمات مخصصةنعمأغانٍ كاملة
MiniMax Music 2.5مقطوعات يتقدم فيها الغناءنعمأغانٍ كاملة
ElevenLabs Musicالتأليف المدفوع بالأوامراختياريمتغيرة
Stable Audio 2.5المشاهد الصوتية الآليةلاحتى 3 دقائق
MiniMax Music 01سير عمل من الكلمات إلى الأغنيةنعمأغانٍ كاملة
MiniMax Music 1.5مقطوعات كاملة بتكلفة معقولةنعمأغانٍ كاملة
MiniMax Music Coverإعادة تقديم أغانٍ موجودة بأنواع أخرىنعمأغانٍ كاملة
Google Lyria 2إنشاء موسيقى آليةاختياريأغانٍ كاملة

شاب بسماعات الرأس في استوديو تسجيل منزلي

Google Lyria 3 وLyria 3 Pro

يمثل Lyria 3 وLyria 3 Pro من Google أحدث ما توصّل إليه توليد الأغاني الكاملة بالذكاء الاصطناعي. يضيف الإصدار Pro تماسكًا أقوى في الغناء ونوافذ مخرجات أطول، ما يجعله مثاليًا لإنتاج الموسيقى التجارية ومحتوى YouTube والمشاريع التي تتطلب مخرجات بجودة احترافية.

ما يميّز Lyria 3 عن النماذج السابقة قدرته على الحفاظ على التماسك البنيوي عبر أغنية كاملة. فالمقاطع والكورسات والجسور والخواتيم تتصل بطبيعية بدلًا من أن تبدو كمقاطع منفصلة جرى دمجها. ويظهر إحساس الأغنية وهي تتصاعد ثم تصل إلى حلها بطريقة لم تكن النماذج السابقة قادرة على إنتاجها بثبات.

MiniMax Music 2.6

يتميز MiniMax Music 2.6 بقوة خاصة في توليد الأغاني بكلمات مخصصة. تزوده بمجموعة من الكلمات وتصف الأسلوب، فيُنتج مقطوعة كاملة بلحن غنائي وتوزيع موسيقي متطابقين. وبالنسبة لصنّاع المحتوى الذين يحتاجون إلى أغانٍ أصلية برسائل محددة، يبدو هذا السير عمل عمليًا إلى حد كبير.

وكان MiniMax Music 01 السابق قد أرسى أولًا مسار الانتقال من الكلمات إلى الأغنية. وكل إصدار لاحق حسّن الطبيعية الغنائية والتماسك اللحني. ويقع MiniMax Music 1.5 في منتصف هذه السلسلة كخيار مقتصد لتوليد الكميات الكبيرة.

ElevenLabs Music

ينتمي ElevenLabs Music إلى شركة بنت سمعتها على تركيب الصوت فائق الواقعية. ويرث نموذجها الموسيقي هذا الحمض الوراثي، فيتفوق في المقطوعات ذات الغناء الطبيعي والمعبّر. وواجهة الأوامر بسيطة وتستجيب جيدًا للأوصاف العاطفية مثل "حلو مرّ" و"منتصر" أو "شوق". وإذا كانت أصالة الصوت أولوية لديك، فهذا هو النموذج الذي يستحق التجربة أولًا.

Stability AI Stable Audio 2.5

يمثل Stable Audio 2.5 الخيار الأقوى للموسيقى الآلية والمشاهد الصوتية. يستخدمه ملحنو الأفلام ومصمّمو الصوت للألعاب ومنتجو البودكاست لتوليد الموسيقى الخلفية والنسيج الصوتي المحيط والموسيقى السينمائية المصاحبة، دون التعقيدات القانونية المرتبطة بالمقطوعات الموجودة مسبقًا. ومخرجاته تتكرر بسلاسة وتتناسب جيدًا مع الكلام أو الحوار.

مغنية تسجّل في حجرة صوت احترافية

كيف تنشئ موسيقى على PicassoIA

تستضيف PicassoIA كل النماذج المذكورة أعلاه في مكان واحد، بواجهة موحدة تجعل التنقل بينها سريعًا. إليك سير العمل الدقيق لتوليد أول مقطوعة لك بالذكاء الاصطناعي.

الخطوة 1: اختر النموذج المناسب

اختر بحسب هدفك:

الخطوة 2: اكتب أمرًا موسيقيًا قويًا

العامل الأكبر تأثيرًا في جودة المخرجات هو أمرك. بنِه بهذه العناصر:

النوع + الإيقاع/BPM + المزاج + الآلات الموسيقية + أسلوب الغناء + تفاصيل إضافية

أمثلة على أوامر تعطي نتائج قوية:

  • "موسيقى فولك إندي حزينة، 75 BPM، عزف بأصابع على الغيتار الصوتي، أصوات ذكورية ناعمة من طبقة الباريتون، أجواء ممطرة، إيقاع إضافي قليل"
  • "موسيقى رقص إلكترونية حماسية، 128 BPM، ألحان من السينثيسايزر، ركلة طبلة منتظمة بأربع ضربات في كل إيقاع، ذروة نشوة، جاهزة للمهرجانات"
  • "مقطوعة أوركسترالية سينمائية، أوتار ونحاس، توتر متصاعد، بدون غناء، مناسبة لإعلان فيلم درامي"

كلما حددت عناصر أكثر، قلّ ما يحتاج النموذج إلى استنتاجه. والاستنتاج هو المكان الذي تتسلل فيه التغييرات. فالتحديد هو التحكم.

الخطوة 3: اضبط المعاملات

تتيح معظم النماذج على PicassoIA ضوابط إضافية:

  • المدة: حدّد الطول المستهدف (من 30 ثانية إلى عدة دقائق حسب النموذج)
  • البذرة: ثبّت رقم بذرة لإعادة إنتاج نتيجة بعينها عبر عدة تشغيلات
  • حقل الكلمات: في MiniMax Music 2.6 وMiniMax Music 01، الصق كلماتك مباشرةً في الحقل المخصص، وسيضبطها النموذج على اللحن

الخطوة 4: حمّل مقطوعتك واستخدمها

بعد التوليد، حمّل ملف الصوت مباشرة. ويمكن استخدام الموسيقى المولّدة بالذكاء الاصطناعي من PicassoIA في:

  • مقاطع YouTube والمحتوى الاجتماعي
  • موسيقى المقدمة والخاتمة للبودكاست
  • موسيقى الألعاب والحلقات الصوتية المحيطة
  • الموسيقى المصاحبة لمشاريع الأفلام والفيديو
  • الاستماع الشخصي والمشاريع الإبداعية

💡 تحقق دائمًا من شروط ترخيص النموذج المحدد للاستخدام التجاري. معظم النماذج على PicassoIA تدعم التطبيقات التجارية.

طقم طبول كامل مصوَّر من زاوية منخفضة في استوديو تسجيل

ما يجيده الذكاء الاصطناعي وأين يتعثر

نقاط القوة الجديرة بالمعرفة

تجاوز توليد الموسيقى بالذكاء الاصطناعي عدة عتبات جودة مهمة خلال العامين الماضيين:

  • السرعة: أغنية كاملة في ثوانٍ بدلًا من ساعات في الاستوديو
  • التكلفة: لا رسوم جلسات، ولا تكاليف ترخيص، ولا إيجار استوديو
  • الاتساق: توليد 20 نسخة متنوعة من النمط نفسه فورًا
  • سهولة الوصول: لا حاجة إلى نظرية موسيقية أو مهارات إنتاج
  • تنوع الأنواع: من الكلاسيكية إلى الهايبربوب إلى الأجواء الهادئة إلى الميتال
  • سرعة التكرار: تحسين اتجاه ما في دقائق لا في أيام

بالنسبة لصنّاع المحتوى، والاستوديوهات الصغيرة للألعاب، وصنّاع الأفلام المستقلين، تغيّر هذه المزايا طريقة إنجاز المشاريع. وقد بلغ ElevenLabs Music وGoogle Lyria 3 على وجه الخصوص مستوى جودة يصمد في الإنتاجات الفعلية. وقد ولّت إلى حد كبير أيام كانت فيها موسيقى الذكاء الاصطناعي تبدو اصطناعية بوضوح.

القيود الحالية

التقنية مثيرة للإعجاب لكنها ليست بلا حدود:

القيدالواقع الحالي
التماسك في الأعمال الطويلةالأغاني التي تتجاوز 3-4 دقائق قد تنحرف بنيويًا
التحكم الدقيق في طبقة الصوتطلب سلّم موسيقي محدد غير موثوق
دقة كلمات الغناءمطابقة الكلمات المعقدة مع اللحن لا تزال غير كاملة
محاكاة أسلوب الفنانلا تستطيع النماذج محاكاة صوت فنان بعينه بموثوقية
إحساس الآلة الحيةيحمل الموسيقيون الحقيقيون توقيتًا دقيقًا وتعبيرًا لا يملكهما الذكاء الاصطناعي بعد

تضيق هذه الفجوات مع كل إصدار جديد من النماذج. فقد كان Google Lyria 2 خطوة إلى الأمام مقارنةً بسابقه، ثم قلّص Lyria 3 الفجوة أكثر. وتواصل المسافة بين الموسيقى المولّدة بالذكاء الاصطناعي والموسيقى المنتجة بشريًا الانكماش في السياقات التجارية.

صانعة محتوى تحرر فيديو ببرنامج موسيقى

من يستخدم توليد الموسيقى بالذكاء الاصطناعي فعليًا

صنّاع المحتوى والبودكاستر

هذه هي أكبر قاعدة مستخدمين حاليًا. يحتاج صانعو YouTube إلى موسيقى أصلية لا تُفعّل مطالبات حقوق النشر. ويحتاج البودكاستر إلى مقطوعات تقديم تبدو احترافية دون دفع رسوم ترخيص. ويتلاشى كلا التحديين مع توليد الموسيقى بالذكاء الاصطناعي.

باستخدام MiniMax Music 2.6، يمكن لصانع المحتوى توليد جينغل مقدمة مخصص يتناسب مع النبرة الدقيقة لعلامته التجارية، مع كلمات إن لزم الأمر. وباستخدام Stable Audio 2.5، يمكنه إنتاج موسيقى خلفية متكررة تتناسب مع مزاج كل جزء من الحلقة: هادئة ومتأملة للمقابلات، ومبهجة للإعلانات.

مطورو الألعاب والاستوديوهات المستقلة

تحتاج الألعاب المستقلة إلى ساعات من الموسيقى الأصلية، لكنها نادرًا ما تملك ميزانية لملحنين حيين. يتيح التوليد بالذكاء الاصطناعي لمطوّر منفرد إنتاج موسيقى تصويرية كاملة للعبة عبر أجواء متعددة: توتر القتال، واستكشاف العالم المفتوح، وأجواء القوائم، وشدة معركة الزعيم، واحتفال النصر.

يُعدّ Google Lyria 2 وStable Audio 2.5 خيارين قويين هنا، إذ يقدمان توليدًا آليًا بمدى لوني جيد ومخرجات مناسبة للتكرار تتناسب بنظافة مع مزيج اللعبة دون أن تطغى على تصميم الصوت.

صنّاع الأفلام ومحررو الفيديو

يستخدم مخرجو الأفلام القصيرة ومحررو الفيديو الموسيقى بالذكاء الاصطناعي كموسيقى مؤقتة لمشاريعهم، دون متاعب التراخيص المرتبطة بموسيقى المكتبات. وكثيرًا ما تنتهي المقطوعة المؤقتة المولّدة بالذكاء الاصطناعي في النسخة النهائية، لأنها تناسب المشهد إلى حد يجعل استبدالها أكثر كلفة من الإبقاء عليها.

يفيد Google Lyria 3 Pro بشكل خاص هنا. فقدرته على توليد مقطوعات كاملة الطول محددة عاطفيًا تناسب مرحلة ما بعد الإنتاج، حيث يحتاج المحرر إلى موسيقى تتطابق مع طول مشهد معين وتحمل قوسًا عاطفيًا محددًا من أول إطار حتى المونتاج.

منظر علوي لطاولة مزج احترافية

أنشئ أول مقطوعة لك اليوم

لم يكن الفاصل بين أن تملك فكرة وأن تسمعها أغنية كاملة أدنى مما هو عليه اليوم في أي وقت مضى. سواء احتجت إلى جينغل بودكاست مدته 30 ثانية، أو حلقة محيطة مدتها 3 دقائق للعبتك، أو أغنية بوب كاملة بكلمات مخصصة لحملة على وسائل التواصل، فإن النماذج على PicassoIA تمنحك وصولًا مباشرًا إلى أفضل تقنية متاحة الآن لتوليد الموسيقى بالذكاء الاصطناعي.

ابدأ بنموذج MiniMax Music 2.6 إن أردت غناءً وكلمات. واختر Stable Audio 2.5 للمقطوعات الآلية النظيفة. وإن أردت النموذج الأكثر قدرة لأغانٍ كاملة بجودة تجارية، فابدأ من Google Lyria 3 Pro.

اكتب أمرًا. اضغط على توليد. النموذج يتولى الباقي.

محطة DJ مع أطباق فينيل مصوّرة من الأعلى

شارك هذا المقال

اختر لغتك

مقالات ذات صلة