واجهة API لتحويل النص إلى كلام مجانًا: الأسعار وPython والخيارات غير المحدودة

لكل واجهة API مجانية لتحويل النص إلى كلام قواعدها الخاصة: حصص شهرية تُعاد تعيينها، وتجارب مدتها اثنا عشر شهرًا تنتهي، ونماذج مفتوحة المصدر بلا عدّاد. اطّلع على الأسعار الفعلية، وأكواد Python تعمل، وطريقة عملية لتجربة الأصوات في المتصفح أولًا.

واجهة API لتحويل النص إلى كلام مجانًا: الأسعار وPython والخيارات غير المحدودة
Cristian Da Conceicao
مؤسس Picasso IA

اكتب "free text to speech API" في شريط البحث وستحصل على ثلاث إجابات مختلفة تمامًا: حصة شهرية من عملاق سحابي، وحزمة Python تستعير بهدوء خوادم شخص آخر، ونموذج مفتوح المصدر تشغّله على جهازك. الثلاثة مجانية، لكن واحدًا فقط غير محدود فعلًا، وليس هو الخيار الذي يتوقعه معظم الناس.

يرتب هذا المقال الخيارات بحسب ما تكلفه فعلًا، ويعرض كود Python يعمل لكل واحد منها، وينتهي بطريقة لتجربة الأصوات في متصفحك قبل أن تكتب أي كود للتكامل. الأرقام مأخوذة من صفحات الأسعار الرسمية للمزوّدين وملخصاتهم المنشورة حتى أكتوبر 2026. الأسعار تتغير، فتحقق من الأرقام قبل أن تبني عليها ميزانية.

ماذا تعني "مجانًا" فعلًا

يستخدم المزوّدون كلمة "مجاني" لثلاثة ترتيبات مختلفة، والخلط بينها هو ما يحوّل النموذج الأولي إلى فاتورة مفاجئة.

حصص شهرية متجددة

تعيد Google Cloud وMicrosoft Azure ضبط الحصة المجانية كل شهر دون تاريخ انتهاء. تمنحك Google 4 ملايين حرف من الأصوات القياسية، وتمنحك مستوى F0 في Azure 0.5 مليون حرف من الأصوات العصبية. ابقَ تحت الحد وتكون الفاتورة صفرًا إلى ما لا نهاية. أما إن تجاوزت الحد في Google فستدفع السعر الاعتيادي لكل حرف. مستوى F0 في Azure محدود، فتصطدم بسقف بدلًا من أن تتلقى فاتورة.

تجارب مدتها اثنا عشر شهرًا

تنطبق حصة Amazon Polly على الحسابات الجديدة خلال أول 12 شهرًا. تعرض AWS مليون حرف عصبي شهريًا، و500 ألف حرف من النوع طويل الشكل، و100 ألف حرف توليدي، وتشير الملخصات المنشورة إلى 5 ملايين حرف للأصوات القياسية. بعد الشهر الثاني عشر يكلّف الحجم نفسه من حركة المرور 4 دولارات لكل مليون حرف للأصوات القياسية و16 دولارًا للعصبية. نموذج أولي مجاني في يناير قد يحمل بندًا حقيقيًا في الفاتورة بحلول يناير التالي.

تقع ElevenLabs في المنتصف. تمنح خطتها المجانية نحو 10,000 حرف شهريًا، أي عشر إلى خمس عشرة دقيقة من الصوت فقط، وتشترط ذكر المصدر وتمنع الاستخدام التجاري. هذا يكفي لتجربة صوت، لكنه أصغر بكثير من أن يصلح لمنتج. وتتوفر عائلة الأصوات نفسها على PicassoIA باسم ElevenLabs v3.

مفتوح المصدر وغير المحدود

الخيار الوحيد غير المحدود فعلًا هو البرنامج الذي تشغّله بنفسك. يعمل Piper على معالج CPU عادي مع أكثر من 100 صوت بأكثر من 30 لغة. أما Kokoro فنموذج بحجم 82 مليون معامل ينتج كلامًا طبيعيًا، ويُقال إنه يعمل قرب 100 ضعف أسرع من الزمن الحقيقي على GPU. لا أحد يحسب عليك الاستخدام لأن لا أحد يستضيفك. الثمن هو جهازك، ووقت إعداده، ومهمة التحقق من ترخيص كل صوت قبل أن تبيع أي شيء أُنتج به.

فريق ناشئ يرتب خيارات الطبقات المجانية على لوح أبيض

المستويات المجانية جنبًا إلى جنب

جدول الأسعار

المزوّد والمستوىالحصة المجانيةهل تنتهي؟السعر المدفوع بعدها
Google Cloud Standard4 ملايين حرف شهريًالا4 دولارات لكل مليون
Google Cloud Neural2نحو مليون حرف شهريًالا16 دولارًا لكل مليون
Azure Neural (F0)0.5 مليون حرف شهريًالاالدفع حسب الاستخدام
Amazon Polly Standard5 ملايين حرف شهريًابعد 12 شهرًا4 دولارات لكل مليون
Amazon Polly Neuralمليون حرف شهريًابعد 12 شهرًا16 دولارًا لكل مليون
ElevenLabs Freeنحو 10 آلاف حرف شهريًالاخطط مدفوعة
Piper أو Kokoroبلا حدلاجهازك

💡 تُحسب الحصص لكل حساب، ولكل شهر، ولكل فئة صوت. الأصوات القياسية والمميزة تسحب من مجموعات منفصلة، فاختبر الصوت بالضبط الذي تنوي إطلاقه.

ماذا يشتري المليون حرف

تعطي أمثلة التسعير في AWS نحو 23 ساعة و8 دقائق من الكلام لكل مليون حرف. اعتمد عليها كتقدير تقريبي. يعادل 4 ملايين حرف القياسية في Google نحو 90 ساعة من الصوت شهريًا، ويعادل 0.5 مليون حرف في Azure نحو 11 ساعة.

تحتوي تدوينة من 1,500 كلمة على نحو 9,000 حرف. بهذا الحجم تقرأ الطبقة المجانية في Azure نحو 55 تدوينة شهريًا، وتقرأ Google أكثر من 400. زر "استمع للمقال" في مدونة متوسطة الحجم يدخل ضمن الطبقة المجانية، بشرط أن تخزّن كل ملف صوتي بدلًا من إعادة توليده في كل زيارة للصفحة.

احسب بعناية. تحتسب معظم المزوّدات كل حرف ترسله، بما فيه المسافات وعلامات الترقيم ووسوم الترميز، لذا أزل HTML قبل التوليف وأرسل نصًا عاديًا. قِس أسبوعًا من حركة المرور الفعلية قبل أن تثق بأي تقدير.

فاتورة مطبوعة وآلة حاسبة وإسبريسو على مكتب خشبي

خيارات Python بلا تكلفة

ثلاث حزم تغطي معظم السكربتات السريعة. تُثبَّت عبر pip ولا تحتاج إلى حساب فوترة وتعمل في بضعة أسطر، لكنها ليست متساوية.

gTTS في أربعة أسطر

from gtts import gTTS

tts = gTTS("Your order has shipped.", lang="en")
tts.save("order.mp3")

gTTS غلاف غير رسمي حول نقطة نهاية التحويل إلى كلام التي تعمل خلف Google Translate. لا توجد بيانات اعتماد ولا حصة منشورة، وهذه بالضبط هي المشكلة: قد تقيّد Google النقطة أو تغيّرها دون إشعار. تناسب سكربت لفصل دراسي، وهي مخاطرة بالنسبة لميزة تواجه العملاء.

مطوّر يكتب كود Python في مساحة عمل مشتركة

pyttsx3 يعمل دون اتصال

import pyttsx3

engine = pyttsx3.init()
engine.setProperty("rate", 170)
engine.save_to_file("Your order has shipped.", "order.wav")
engine.runAndWait()

يشغّل pyttsx3 الأصوات المثبّتة أصلًا في نظام التشغيل لديك: SAPI5 على Windows، وNSSpeechSynthesizer على macOS، وeSpeak على Linux. لا يوجد اتصال بالشبكة ولا حد. ومع ذلك يوجد صوت يشبه جهاز GPS من عام 2005، لذا احكم عليه بأذنيك قبل أن تلتزم به.

edge-tts من أجل أصوات أفضل

import asyncio
import edge_tts

async def main():
    speech = edge_tts.Communicate("Your order has shipped.", "en-US-AriaNeural")
    await speech.save("order.mp3")

asyncio.run(main())

يتصل edge-tts بخدمة "استمع للمقال" نفسها التي يستخدمها متصفح Edge. الأصوات بجودة عصبية والحزمة مجانية، لكنه عميل غير رسمي ولا توجد وراءه اتفاقية خدمة. عامله كما تعامل gTTS: جيد للمشاريع الشخصية، ومقامرة حين يعتمد عليه مستخدمون يدفعون.

النماذج العصبية المحلية

Piper وKokoro هما الخياران اللذان يجب تجربتهما أولًا. يأخذ Piper ملف صوت منزّلًا ويكتب الصوت مباشرة من سطر الأوامر:

echo "Your order has shipped." | piper --model en_US-lessac-medium.onnx --output_file order.wav

وهو خفيف بما يكفي لجهاز Raspberry Pi 4، ولهذا هو الخيار المعتاد للأكشاك غير المتصلة بالإنترنت والأتمتة المنزلية وأي شيء يجب أن يستمر في العمل دون إنترنت. يحتاج Kokoro إلى ذاكرة أكبر لكنه يبدو أكثر طبيعية بوضوح، ويعمل بسرعة كبيرة على GPU.

جهاز Raspberry Pi متصل بمكبر صوت صغير على طاولة عمل

استدعاء واجهة سحابية من Python

حين تحتاج إلى اتفاقية مستوى خدمة (SLA) أو وسوم SSML أو عشرات اللغات، يكون المزوّد السحابي الطريق الأمين. النمط واحد في كل مكان: التوثيق، ثم إرسال النص، ثم استقبال بايتات الصوت.

مثال على Google Cloud

from google.cloud import texttospeech

client = texttospeech.TextToSpeechClient()

response = client.synthesize_speech(
    input=texttospeech.SynthesisInput(text="Your order has shipped."),
    voice=texttospeech.VoiceSelectionParams(
        language_code="en-US", name="en-US-Standard-C"
    ),
    audio_config=texttospeech.AudioConfig(
        audio_encoding=texttospeech.AudioEncoding.MP3
    ),
)

with open("order.mp3", "wb") as f:
    f.write(response.audio_content)

يأتي التوثيق من متغير البيئة GOOGLE_APPLICATION_CREDENTIALS، وهو يشير إلى ملف حساب الخدمة، فلا يبقى أي سر داخل السكربت. استبدل en-US-Standard-C بصوت Neural2 ويبقى الاستدعاء كما هو. الذي يتغير فقط هو المجموعة التي تسحب منها، والسعر.

فني يسير في ممر مركز بيانات

خزّن قبل أن تدفع

import hashlib
import pathlib

def cached_speech(text, synthesize):
    name = hashlib.sha256(text.encode()).hexdigest() + ".mp3"
    path = pathlib.Path("audio_cache") / name
    if not path.exists():
        path.parent.mkdir(exist_ok=True)
        path.write_bytes(synthesize(text))
    return path

تجزئة النص تعني أن الجملة المكررة لا تكلّف شيئًا في المرة الثانية. في ميزة "استمع للمقال" تكفي هذه العادة وحدها عادةً لإبقاء حركة المرور داخل الطبقة المجانية. وهناك عادتان أخريان تساعدان: قسّم النص الطويل عند حدود الجمل، لأن معظم المزوّدين يحدّون الطلب الواحد عند بضعة آلاف من الأحرف، وغلّف كل استدعاء بإعادة محاولة مع تراجع أُسّي عند ردود تقييد معدل الطلبات.

الخيارات غير المحدودة ومحاذيرها

ابحث عن "unlimited" وستظهر الوعود الثلاثة نفسها. ولكل واحد منها ثمن.

الاستضافة الذاتية تكلّف وقتًا. تثبّت النماذج وتدير التبعيات وتراقب ذاكرة GPU وتحدّث كل شيء حين يكسر إصدار جديد شيئًا. لبضعة آلاف من الطلبات شهريًا تكون الطبقة السحابية المجانية أرخص من ساعات عملك. أما عند الملايين من الطلبات، فيصبح تشغيل Piper أو Kokoro على خادمك الخاص أوفر.

نقاط النهاية غير الرسمية تنكسر. يعتمد gTTS وedge-tts على خدمات لم يقطع مالكوها أي وعد للمطوّرين أصلًا. قد تتباطأ أو تغيّر صيغتها أو تختفي. إن كانت الميزة تهم عملاءك، فزوّدها بصوت احتياطي من مزوّد مدعوم.

خطط "غير المحدودة" تقيس شيئًا آخر. بعض خدمات الاشتراك تعلن كلامًا غير محدود ثم تفرض حدودًا على التزامن أو الحقوق التجارية أو جودة الصوت. اقرأ فقرة الاستخدام العادل قبل أن تلتزم بمنتج على الخطة.

الجودة تتفاوت أكثر مما يوحي به السعر. قد يبدو الصوت القياسي والصوت العصبي من المزوّد نفسه مختلفين تمامًا، لذا فإن حصة سخية على المستوى الأرخص قد لا تكون الصوت الذي أردته فعلًا.

والحجم هو سبب أهمية هذا. ميزة "استمع للمقال" التي تقرأ كل مقال للزوار، بمن فيهم الأشخاص الذين يعتمدون على الصوت لقراءة الويب، يمكن أن تستنزف الحصة الشهرية في أسبوع مزدحم واحد.

رجل يستمع إلى صوت على هاتف ذكي في شرفة مقهى

اختيار المسار المجاني المناسب

وضعكأفضل مسار مجانيانتبه إلى
سكربت أو عرض توضيحي في عطلة نهاية الأسبوعgTTS أو edge-ttsغير رسمي، وقد ينكسر
تطبيق أو جهاز دون اتصالpyttsx3 أو Piperأصوات باهتة من pyttsx3
ميزة إنتاج صغيرةGoogle Standard أو Azure F0الحصة تُعاد تعيينها شهريًا
حجم كبير، تكلفة ثابتةKokoro أو Piper مستضافان ذاتيًاوقت GPU وتراخيص الأصوات
كتاب صوتي أو تعليق صوتي لفيديوأداة متصفح دون كودلا يوجد وصول عبر API

تجمع معظم المشاريع الحقيقية صفين من هذا الجدول: صوت محلي أو سحابي مجاني للتطوير، ومزوّد مدعوم للنسخة التي يراها العملاء.

قبل الإطلاق، شغّل اختبار ثلاث جمل على الصوت الذي تختاره: جملة فيها سعر مثل $1,200.50، وجملة فيها اختصار مثل Dr. أو SQL، وجملة فيها اسم صعب النطق. هذه الأسطر الثلاثة تكشف معظم مشكلات التطبيع، وتكلّف أقل من مئة حرف من حصتك.

امرأة تسجّل تعليقًا صوتيًا بميكروفون مكثّف

استخدم Speech 2.8 HD على PicassoIA

أحيانًا لا تحتاج إلى أي تكامل، بل إلى ملف تعليق صوتي جيد فقط. يعمل Speech 2.8 HD على PicassoIA في المتصفح، فيمكنك تجربة الأصوات والإعدادات قبل أن تقرر ما الذي ستبنيه. وحتى وقت كتابة هذا المقال، تسرد واجهة المطوّرين لدى PicassoIA نماذج للصور والفيديو لا نماذج للكلام، لذا فهذا مسار عبر المتصفح، وليس بديلًا جاهزًا عن المزوّدين أعلاه.

الصق نصك

افتح صفحة النموذج والصق ما يصل إلى 10,000 حرف في حقل النص. أدخل فترات الصمت بعلامات مثل <#0.5#>، التي تضيف نصف ثانية من الصمت. قسّم السكربت الطويل إلى مشاهد وولّد كل مشهد على حدة، حتى لا تفرض سطر سيئ واحد إعادة العمل كاملة.

اضبط الصوت والانفعال

اختر صوتًا (الافتراضي هو Wise_Woman) وانفعالًا: تلقائي، سعيد، حزين، غاضب، خائف، مشمئز، مندهش، هادئ، سلس أو محايد. يدعم تلميح اللغة أكثر من 40 لغة، فيمكن أن يتحول السكربت نفسه إلى نسخة إسبانية أو يابانية بتغيير واحد في القائمة المنسدلة. ثم اضبط الأداء:

  • السرعة: من 0.5 إلى 2.0، والافتراضي 1.0
  • طبقة الصوت: من ناقص 12 إلى زائد 12 نصف نغمة
  • الحجم: من 0 إلى 10، والافتراضي 1.0

💡 في فيديوهات الشرح، جرّب السرعة 1.1 وأبقِ طبقة الصوت ضمن نصفي نغمة من الصفر. التغييرات الأكبر تبدأ في الظهور اصطناعية.

صدّر بالصيغة المناسبة

MP3 هي الصيغة الافتراضية، وتصل إلى 256 kbps، وهي مناسبة للبودكاست والفيديو. وصيغتا WAV وFLAC بلا فقدان للتحرير، وتعطي PCM صوتًا خامًا للمسارات البرمجية. فعّل بيانات الترجمة النصية حين تحتاج إلى توقيتات للجمل في التسميات التوضيحية.

امرأة تضبط إعدادات الصوت على شاشة في استوديو مشرق

نماذج أخرى تستحق التجربة على السكربت نفسه:

أنشئ أول تعليق صوتي لك

النص والصوت والموسيقى الخلفية ثلاث مهام منفصلة، ولكل منها نموذج. صُغ النص باستخدام Claude Sonnet 5 أو Gemini 3.5 Flash، ثم ولّد السرد باستخدام Speech 2.8 HD، ثم ضع خلفية موسيقية تحته بمستوى منخفض، من إنتاج Lyria 3 أو Music 2.6 أو Stable Audio 2.5.

يدا موسيقي على لوحة مزج تناظرية

تأخذك خطة بسيطة من الصفر إلى صوت يعمل في جلسة واحدة:

  1. اكتب سكربتًا من 150 كلمة وولّده بثلاثة أصوات مختلفة.
  2. اختر الأفضل، ودوّن إعدادات السرعة وطبقة الصوت والانفعال.
  3. اختر المسار المجاني من الجدول الذي يناسب حجمك الشهري.
  4. خزّن كل ملف تولّده، حتى يُدفع ثمن كل جملة مرة واحدة فقط.

افتح PicassoIA والصق فقرة واحدة من مشروعك، وجرّب ثلاثة أصوات بثلاثة انفعالات مختلفة. عشر دقائق من التجريب تخبرك بأكثر من أي صفحة أسعار، وتحسم الصوت قبل أن تكتب سطرًا واحدًا من كود التكامل. وبينما أنت هناك، ولّد صورة مصغّرة أو فيديو قصيرًا يرافق الصوت، ثم ابنِ انطلاقًا من الصوت الذي أعجبك أكثر.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة