كيف يولّد الذكاء الاصطناعي الموسيقى من النص (ولماذا تنجح فعلًا)

تكتب بضع كلمات تصف المزاج والنوع الموسيقي والإيقاع الذي تريده. وبعد ثوانٍ قليلة، تُعزف أغنية كاملة بصوت غنائي ولحن وتناغم وإيقاع. يشرح هذا المقال بالتفصيل كيف يعمل توليد الموسيقى بالذكاء الاصطناعي على كل المستويات، من تضمينات النص إلى الانتشار الصوتي، وأي النماذج ينبغي أن تستخدمها الآن.

كيف يولّد الذكاء الاصطناعي الموسيقى من النص (ولماذا تنجح فعلًا)
Cristian Da Conceicao
مؤسس Picasso IA

تكتب "بالاد جاز حزينة بأسلوب 1950s، غناء أنثوي، إيقاع بطيء، أجواء ليلة ممطرة" وتضغط Enter. بعد ثلاثين ثانية، تحصل على أغنية كاملة. آلات حقيقية. مشاعر حقيقية. لحن حقيقي. هذا ليس خيالًا علميًا. هذا ما يفعله توليد الموسيقى بالذكاء الاصطناعي اليوم، وهو يحدث الآن.

أيدي تكتب كلمات أغنية على حاسوب محمول في استوديو منزلي

ماذا يعني "تحويل النص إلى موسيقى" فعلًا؟

تبدو العبارة بسيطة، لكن هناك قدرًا كبيرًا من الهندسة وراء هذه الكلمات الأربع. عندما يولّد الذكاء الاصطناعي موسيقى من النص، فهو لا يبحث في مكتبة عن مقطع مسجّل مسبقًا ليقدّمه لك. بل يُركّب الصوت من الصفر، قرارًا رياضيًا تلو الآخر، موجَّهًا بالكامل بما تصفه كلماتك.

إنه ليس محرك بحث

كانت أدوات "الموسيقى بالذكاء الاصطناعي" الأولى أشبه بمحركات بحث مُضخّمة. تكتب نوعًا موسيقيًا، فيعيد النظام مقطعًا من مكتبة موسومة مسبقًا. أما نماذج تحويل النص إلى موسيقى الحديثة فمختلفة جوهريًا. إنها تُنشئ صوتًا لم يوجد من قبل، نغمةً نغمةً وإيقاعًا إيقاعًا.

يهمّ هذا الفرق لأنه يغيّر ما يمكنك فعله. فمحرك البحث لا يستطيع إلا أن يعيد ما هو موجود في قاعدة بياناته. أما النموذج التوليدي فيستطيع أن ينتج مقطعًا فنكيًا من 1970s مع عزف منفرد على الثيرمين وكلمات فرنسية مهموسة، إذا طلبت ذلك. ومن المؤكد تقريبًا أن هذا المزيج المحدد لم يُسجَّل من قبل.

ثلاثة أشياء يجب أن يوصلها أمرك النصي

قبل الغوص في طريقة عمل النموذج، من المفيد أن تفكّر في المعلومات التي يحملها أمر الموسيقى فعلًا:

  1. المزاج والعاطفة (حزين، مبتهج، متوتر، هادئ)
  2. البنية والإيقاع (تصاعد بطيء، حيوي، 140 BPM، شدة متنامية)
  3. الألوان الصوتية (الآلات، النوع الموسيقي، أسلوب الغناء، حقبة الإنتاج)

كلما كنت أوضح في الأبعاد الثلاثة، استطاع النموذج أن يقدّم ما تريده بدقة أكبر.

ميكروفون مكثف احترافي داخل غرفة تسجيل صوتي

كيف يقرأ النموذج كلماتك؟

هنا تصبح الأمور مثيرة للاهتمام حقًا. النموذج لا "يقرأ" كلماتك كما تقرأها أنت. إنه يحوّلها إلى أرقام، وتحديدًا إلى صيغة تُسمّى تضمين النص (text embedding)، وهو تمثيل متجهي كثيف يلتقط المعنى الدلالي.

تضمينات النص ببساطة

فكّر في الأمر هكذا: كلمة "jazz" وعبارة "آلات نحاسية في ساعة متأخرة من الليل وأجواء دخانية" تتحولان إلى مجموعات متشابهة من الأرقام داخل الفضاء الرياضي للنموذج. ليستا متطابقتين، لكنهما جارتان قريبتان. يستخدم النموذج هذا التقارب لتوجيه توليد الصوت نحو أصوات تطابق وصفك.

لهذا السبب تنتج الأوامر الغامضة نتائج عامة. فعبارة "موسيقى جميلة" تقع في وسط منطقة واسعة جدًا وغير مركّزة. أما "غيتار أكوستيك هادئ، نمط عزف بالأصابع، تنغيم مفتوح، أجواء شروق الشمس" فهي إحداثيات دقيقة توجّه النموذج نحو هدف صوتي أكثر تحديدًا بكثير.

لماذا يغيّر التحديد كل شيء؟

أمر نصي غامضأمر نصي محددالنتيجة المرجحة
"happy song""upbeat ska with brass, 160 BPM, beach party energy"موسيقى بوب عامة مقابل مقطوعة سكا حقيقية
"sad piano""solo piano, minor key, very slow, Satie-influenced, rain outside"موسيقى حزينة عامة مقابل مقطوعة مؤثرة تثير المشاعر
"rock music""heavy guitar riffs, 90s grunge production, dropped D tuning, raw vocals"أي شيء مقابل مقطوعة تبدو كأنها من سياتل عام 1993

رجل يرتدي سماعات رأس ويستمع بعينين مغلقتين في غرفة معيشة مشمسة

المحرك وراء الصوت

بمجرد أن يحصل النموذج على نصك في صورة تضمين، عليه أن يحوّل هذا التمثيل الرياضي إلى صوت فعلي. يهيمن على هذا المجال حاليًا نهجان معماريان رئيسيان.

نماذج المحوّلات (Transformers) في الصوت

يمكن تكييف المحوّلات، وهي البنية نفسها التي تُشغّل النماذج اللغوية الكبيرة، للتنبؤ بتسلسلات موسيقية. فبدلًا من التنبؤ بالكلمة التالية في الجملة، تتنبأ هذه النماذج بالتوكن الصوتي التالي في التسلسل. يُدرَّب هذا النوع على مجموعات بيانات ضخمة من الموسيقى، ويتعلم الأنماط الإحصائية لما يبدو جميلًا معًا: تتابعات الكوردات، والأنماط الإيقاعية، وخطوط اللحن، والتوتر الهارموني وانفراجه.

الميزة: المحوّلات بارعة جدًا في الاتساق على المدى الطويل. فهي تحافظ على الثيمة الموسيقية عبر مقطع يمتد ثلاث دقائق كاملة بطريقة تبدو مقصودة لا عشوائية.

نماذج الانتشار (Diffusion) للصوت

تعمل نماذج الانتشار بشكل مختلف. فهي تبدأ من ضجيج خالص وتزيله تدريجيًا لتصل إلى إشارة صوتية متماسكة، موجَّهةً بتضمين النص في كل خطوة. تخيّلها كعملية نحت: تبدأ بكتلة رخام عشوائية (ضجيج) ثم تُزيل أجزاءها (إزالة الضجيج) وفق الشكل الذي يصفه أمرك.

الميزة: تميل نماذج الانتشار إلى إنتاج صوت عالي الأمانة وملمس طبيعي للغاية، خاصة للآلات والغناء.

يجمع كثير من أفضل النماذج الحالية بين النهجين، فيستخدم المحوّلات للبنية، والانتشار لجودة الصوت النهائية.

منظر جوي لإعداد احترافي لمحطة عمل صوتية رقمية على مكتب خشبي

ما الذي يصنع أمرًا موسيقيًا جيدًا؟

كتابة الأوامر النصية لتوليد الموسيقى بالذكاء الاصطناعي مهارة. إليك ما يفصل المقاطع التي تبدو احترافية عن المقاطع التي تبدو كحلقة عامة من مكتبة أصوات.

النوع والمزاج والإيقاع

ابدأ بالعناصر الكبرى الثلاثة. سمِّ النوع بدقة ("أوركسترا سينمائية"، وليس "كلاسيكية" فقط). صرّح بالمزاج صراحةً ("حنين"، "قلق"، "منتصر"). أعطِ معلومات عن الإيقاع، إما برقم BPM أو بعبارة وصفية ("إيقاع بطيء ثقيل"، "خطوة عسكرية"، "سرعة جنونية").

💡 نصيحة: ضع الصفات بتخطيط. "فولك إندي كئيب، غيتار أكوستيك بعزف بالأصابع، أصوات أنثوية متنفّسة، 75 BPM، عصر خريفي" يمنح النموذج خمسة قيود قوية يعمل ضمنها.

الآلات وأسلوب الغناء

كلما كنت أكثر تحديدًا في اللوحة الصوتية، كان ذلك أفضل. بدلًا من "أغنية فيها غيتار"، جرّب "طبقات من غيتارات أكوستيك مع صدى خفيف، وخط لحني منفرد بغيتار Telecaster نظيف، ومن دون تشويه". وبالنسبة للغناء، حدّد الجنس والنبرة (خشنة، لامعة، أوبرالية) وما إذا كنت تريد تناغمات صوتية.

ما الذي يجب تجنّبه في أوامرك

  • أسماء علم لفنانين أحياء: تُدرَّب النماذج على تجنب التقليد المباشر. صِف بدلًا من ذلك خصائص الأسلوب الذي تريده.
  • التناقضات: "سريع وبطيء، ثقيل وخفيف" يربك عملية التحسين لدى النموذج.
  • مفاهيم مجردة بلا ترجمة موسيقية: "أغنية عن الوحدة" دون توجيه للمزاج أو الإيقاع أو النوع تترك الكثير للصدفة.

امرأة ذات شعر مجعد تعزف على بيانو كبير في معرض موسيقي مشمس

أفضل نماذج الموسيقى بالذكاء الاصطناعي الآن

المجال يتحرك بسرعة. إليك النماذج التي تنتج حاليًا أكثر النتائج إثارةً للإعجاب.

Google Lyria 3 Pro

يُعد Google Lyria 3 Pro حاليًا من أكثر أنظمة تحويل النص إلى موسيقى قدرةً المتاحة. يولّد أغاني كاملة الطول ذات بنية متماسكة، ويتعامل بجودة مع مزج الأنواع المعقدة، وينتج غناءً طبيعيًا بشكل لافت. ويتفوق في الحفاظ على السرد الموسيقي عبر المقطع كله، بدلًا من إنتاج حلقة تتكرر.

أما Google Lyria 3 فهو الشقيق الأسهل وصولًا، ويقدّم جودة قوية بسرعات توليد أعلى. ولأغلب حالات الاستخدام الإبداعي، يحقق التوازن الأمثل بين الجودة وسرعة التكرار.

MiniMax Music 2.6

يتفوق MiniMax Music 2.6 في إنتاج موسيقى البوب والموسيقى التجارية. يتعامل مع كلمات الأغاني بذكاء، ويدمجها بسلاسة في البنى اللحنية. ينتج النموذج مقاطع تبدو مكتملة ببنية واضحة من الكوبليه والكورس، ما يجعله ذا قيمة خاصة إذا كنت تنشئ محتوى لوسائل التواصل الاجتماعي أو للعلامات التجارية أو لتأليف موسيقى الفيديو.

يظل MiniMax Music 2.5 خيارًا جيدًا لمن يريدون أغاني كاملة بغناء دون الحاجة إلى أحدث إصدار على الإطلاق.

وفي ما يخص نقل الأسلوب، يتيح لك MiniMax Music Cover أن تأخذ أغنية موجودة وتعيد صياغتها بنوع موسيقي مختلف. تخيّل أغنية البوب المفضلة لديك مؤداة كقطعة باروكية بالهارپسيكورد أو كمقطع رَيغي. هذا هو نوع المرونة الإبداعية الذي يقدمه هذا النموذج.

ElevenLabs Music

يجلب ElevenLabs Music خبرة ElevenLabs العميقة في تركيب الصوت إلى توليد الموسيقى. والنتيجة موسيقى بالذكاء الاصطناعي تتميز بوضوح الصوت وطبيعيته بشكل يتفوق على معظم المنافسين. إذا كانت جودة الأداء الصوتي أولويتك، فهذا النموذج يستحق اهتمامًا جادًا.

Stability AI Stable Audio 2.5

يتميز Stable Audio 2.5 من Stability AI بقوة خاصة في الموسيقى الآلية وتصميم الصوت. يولّد صوتًا عالي الأمانة مع تصوير ستيريو ممتاز وعمق لوني. وبالنسبة لتأليف موسيقى الأفلام، أو الموسيقى المحيطة، أو أي شيء يحتاج إلى أن يستقر بشكل نظيف داخل المزيج، فهذا من أفضل الخيارات المتاحة.

MiniMax Music 01 والإصدارات الأقدم

كان MiniMax Music 01 النموذج الذي وضع MiniMax على خريطة توليد الموسيقى. تكتب الكلمات، فيبني حولها أغنية كاملة. وقد حسّن MiniMax Music 1.5 هذا بتماسك صوتي أفضل وتوزيعات آلية أغنى.

يستحق Google Lyria 2 الذكر أيضًا بوصفه معيارًا سابقًا ما زال يؤدي أداءً جيدًا في مهام التوليد القصيرة والنماذج الأولية السريعة.

يدا دي جي على أجهزة التقليب مع حشد في تركيز ناعم خلفه

استخدام توليد الموسيقى بالذكاء الاصطناعي على PicassoIA

تستضيف PicassoIA كل هذه النماذج في منصة واحدة، ما يعني أنه يمكنك الاختبار والمقارنة والتكرار دون إدارة توكنات API أو تثبيتات محلية.

الخطوة 1: اختر النموذج المناسب

الهدفالنموذج الموصى به
أغنية كاملة بغناء وكلماتMiniMax Music 2.6 أو Lyria 3 Pro
موسيقى خلفية آليةStable Audio 2.5
أفضل جودة للغناءElevenLabs Music
إعادة صياغة نوع موسيقي لأغنية موجودةMiniMax Music Cover
تكرار سريع واختبارGoogle Lyria 3

الخطوة 2: اكتب أمرك النصي بقصد

افتح صفحة النموذج. في حقل الأمر النصي، لا تكتب "أغنية جيدة". بل ركّب مواصفاتك طبقةً فوق طبقة:

  1. النوع والنوع الفرعي: "Dark synthwave بجماليات إنتاج 80s"
  2. الإيقاع والطاقة: "إيقاع متوسط، يتصاعد من الخفيف إلى الكامل"
  3. الآلات: "خط باس بسينث أنالوغ، طبول بصدى مُقيَّد (gated reverb)، سينث لحني بنمط أربيجيو"
  4. توجيه الصوت: "أصوات ذكورية همسًا مع صدى، تُغنّى بالإنجليزية، بنبرة تأملية"
  5. القوس العاطفي: "يبدأ حزينًا، ثم يتصاعد إلى انفراج تطهيري في الثلث الأخير"

الخطوة 3: كرّر بسرعة

تولّد النماذج خلال ثوانٍ إلى دقيقة. لا تقضِ عشرين دقيقة في تحسين أمرك الأول. ولّد ثلاث أو أربع نسخ، واستمع إليها، وحدّد ما ينجح وما لا ينجح، ثم عدّل. تعامل مع التوليد الأول كمسودة، لا كمنتج نهائي.

💡 نصيحة: احتفظ بالعناصر التي تعجبك ("خط الباص مثالي") وعدّل ما تريد تغييره فقط ("اجعل الطبول أقل ازدحامًا"). التحسين التدريجي ينتج نتائج أفضل من البدء من الصفر في كل مرة.

كاتبة أغانٍ شابة تكتب كلمات في دفتر جلدي داخل مقهى

ما الذي تستطيع موسيقى الذكاء الاصطناعي فعله وما الذي لا تستطيعه؟

إن الصراحة بشأن حدود هذه التقنية تجعلك مستخدمًا أفضل لها.

نقاط القوة الحقيقية

السرعة: أغنية يستغرق تخطيطها وتسجيلها وإنتاجها من مؤلف موسيقي ثماني ساعات، يمكن توليدها في أقل من دقيقة. وهذا يغيّر اقتصاديات إنشاء الموسيقى بالكامل، خاصة لصنّاع المحتوى ومطوّري الألعاب وصنّاع الأفلام الذين يحتاجون إلى موسيقى بسرعة.

سهولة الوصول: لا تحتاج إلى معرفة العزف على آلة، أو قراءة النوتات الموسيقية، أو فهم نظرية الموسيقى لتحصل على نتيجة متماسكة موسيقيًا. فالنموذج يتولى النظرية عنك.

تنوع لا نهائي: ولّد خمسين نسخة من المقطع بمستويات طاقة مختلفة قليلًا، حتى تجد النسخة التي تناسب مشهد الفيديو الخاص بك تمامًا. لا يستطيع أي مؤلف بشري أن ينتج هذه السرعة في التكرار.

مزج الأنواع: "أفروبيت مختلط بالراجات الهندية الكلاسيكية وأصوات hi-hats من نوع trap" ليس شيئًا يمكنك أن تطلبه بسهولة من عازف جلسات. تتعامل نماذج الذكاء الاصطناعي مع دمج الأنواع بأناقة مدهشة.

القيود الصادقة

الفروق العاطفية الدقيقة: يجلب كاتب الأغاني البشري البارع تجربة عاشها إلى عمله. أما الذكاء الاصطناعي فيولّد عاطفة مقبولة إحصائيًا مستندًا إلى بيانات التدريب، وقد تبدو هذه العاطفة أحيانًا فارغة قليلًا عند الاستماع المتأني.

بنية متوقعة: تميل النماذج الحالية إلى البنى التقليدية للأغاني. والموسيقى التجريبية حقًا وغير التقليدية بنيويًا أصعب في استخراجها منها.

الاتساق في الأعمال الطويلة: المقاطع الأطول من ثلاث إلى أربع دقائق تفقد أحيانًا تماسك ثيمتها الموسيقية. فقد ينحرف النموذج عن المزاج الأولي أو يُدخل عناصر تبدو غير مرتبطة.

جودة الكلمات: رغم التحسن السريع، لا تزال الكلمات المولَّدة بالذكاء الاصطناعي تنتج أحيانًا أسطرًا سليمة نحويًا لكنها عامة عاطفيًا. وفي العمل الغنائي الجاد، تظل المراجعة والتحرير البشريان ذوي قيمة.

فرقة موسيقية متنوعة من أربعة عازفين تؤدي على مسرح حميمي بإضاءة كهرمانية دافئة

ورقة الغش لهندسة الأوامر النصية

قبل أن تبدأ التوليد، احفظ هذا المرجع:

المعاملالنسخة الضعيفةالنسخة القوية
النوع"روك""بريتبوب بريطاني من التسعينيات بغيتارات رنانة وكورس نشيدي"
الإيقاع"سريع""138 BPM، نمط ركلة four-on-the-floor يدفع الإيقاع"
المزاج"سعيد""انفراج نشوان، منتصر، احتفالي لكن غير عدواني"
الآلات"مع غيتار""صوت نظيف لغيتار Stratocaster، تأثير كورس خفيف، أرپيجيو بعزف بالأصابع"
الغناء"مع غناء""باريتون دافئ، أداء حواري، صدى خفيف، كلمات إنجليزية"
الحقبةغير محددة"مُنتَج ليبدو كأنه من عام 1983، دفء أنالوغي، دون لمعان رقمي"

💡 نصيحة: استخدم هذا الجدول كقائمة تحقق لكل أمر تكتبه. إذا بقي أي صف عند "النسخة الضعيفة"، فراجعه قبل التوليد.

لقطة ماكرو قريبة جدًا لشريط مغناطيسي يمر فوق رأس تسجيل كلاسيكي

ابدأ بإنشاء مقطعك الخاص

أفضل طريقة لاستيعاب ما قرأته هنا هي فتح أحد هذه النماذج والبدء بالتوليد. اختر Google Lyria 3 إذا كنت تريد تكرارًا سريعًا، أو MiniMax Music 2.6 إذا كان هدفك أغنية مكتملة الإنتاج بغناء.

اكتب أمرك الأول باستخدام البنية المذكورة أعلاه: النوع، والإيقاع، والآلات، وأسلوب الغناء، والقوس العاطفي. ولّده. استمع إليه. عدّل شيئًا واحدًا. ولّد مجددًا. وخلال عشر دقائق ستكون لديك فكرة أوضح عن طريقة استجابة هذه النماذج للغة، وستنتج نتائج تخصك بمعنى حقيقي.

جميع النماذج المذكورة في هذا المقال متاحة في مجموعة توليد الموسيقى بالذكاء الاصطناعي على PicassoIA. تتيح لك المنصة مقارنة المخرجات جنبًا إلى جنب، وهذه أسرع طريقة لتكوين حدس حول ما يجيده كل نموذج.

التقنية هنا بالفعل. السؤال الوحيد هو ما الذي ستصنعه بها.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة