Google Cloud Text to Speech API: الأسعار والأصوات والطبقة المجانية

أسعار Google Cloud Text to Speech API بالأرقام الواضحة: تكلفة أصوات Standard وWaveNet وNeural2 وChirp 3 HD وStudio لكل مليون حرف، وحجم الطبقة المجانية الفعلي، وكيفية تقدير الفاتورة الشهرية قبل النشر، إضافة إلى بدائل تعمل من المتصفح.

Google Cloud Text to Speech API: الأسعار والأصوات والطبقة المجانية
Cristian Da Conceicao
مؤسس Picasso IA

يبدو Google Cloud Text to Speech رخيصًا حتى تصل أول فاتورة. الرقم الأبرز هو 4 دولارات لكل مليون حرف للأصوات الأساسية، لكن الأصوات التي يريدها الناس فعلًا تكلّف بين أربع مرات وأربعين مرة أكثر، وتتقلص الحصة المجانية بسرعة كلما صعدت سلّم الجودة. يعرض هذا المقال كل فئة صوتية، وما تشمله الطبقة المجانية الشهرية فعلًا، وكيفية تقدير الفاتورة قبل كتابة سطر برمجي واحد، ومتى يكون نموذج صوت بالذكاء الاصطناعي آخر خيارًا أذكى.

تعكس الأسعار أدناه التعرفة المنشورة من Google حتى أكتوبر 2026. تعيد Google ترتيب قائمة أصواتها بشكل متكرر، لذا اعتبر الأرقام أساسًا للتخطيط، وتحقّق منها في وحدة الفوترة قبل أن تعتمد ميزانية.

ما الذي تفعله API فعليًا

تأخذ Cloud Text-to-Speech API نصًا عاديًا أو مستند SSML وتعيد ملفًا صوتيًا. تستدعيها عبر REST أو gRPC، أو عبر مكتبات العميل للغات Python وNode.js وJava وGo وC#. تتم المصادقة عبر حساب خدمة، لذا يستطيع الخادم طلب الصوت دون أي خطوة تسجيل دخول يدوية.

مطوّر مستقل يعمل على حاسوب محمول بجانب سماعات وكوب قهوة في ضوء صباحي ناعم قادم من النافذة

الصيغ وحدود الطلب

يصل كل رد بصيغة MP3 أو LINEAR16 (ملف WAV غير مضغوط) أو OGG_OPUS أو MULAW أو ALAW. تناسب MP3 التشغيل على الويب، وتناسب LINEAR16 التحرير، وتناسب MULAW وALAW أنظمة الهاتف التي تتوقع ترميزات الاتصالات. يقبل الطلب الواحد نحو 5,000 بايت من المدخلات تقريبًا، لذا يجب تقسيم النص الطويل إلى أجزاء ثم دمجها من جهتك.

💡 نصيحة: قسّم النصوص عند حدود الجمل، لا عند عدد ثابت من البايتات. القطع في منتصف الجملة يترك قفزة مسموعة في طبقة الصوت عند نقطة الوصل.

SSML وضوابط الصوت

SSML هي لغة الترميز التي تشكّل طريقة الإلقاء. باستخدامها تضيف فترات صمت عبر <break>، وتؤكد كلمة بواسطة <emphasis>، وتكتب التواريخ والأرقام والاختصارات مفصّلة عبر <say-as>. خارج SSML، يعرض الطلب سرعة الكلام (من 0.25x إلى 4x) ودرجة الصوت (من ناقص 20 إلى زائد 20 نصف نغمة) كمعاملات بسيطة. تسرد Google مئات الأصوات بأكثر من 50 لغة ولهجة، لكن ليست كل الضوابط تعمل على كل فئة صوتية.

فئات الأصوات وأسعارها

تبيع Google الكلام في فئات. يتبع السعر تقنية الصوت الكامنة تحته، لا طول الملف الصوتي، لذلك يُعدّ اختيار الفئة الخاطئة أكثر أخطاء الميزانية شيوعًا.

فئة الصوتالسعر لكل مليون حرفالمجاني شهريًاالأنسب لـ
Standard4 دولارات4 ملايين حرفالتنبيهات والنماذج الأولية والسرد البسيط
WaveNet4 دولاراتمشترك مع Standardنبرة أدفأ بالسعر نفسه
Neural216 دولارًامليون حرفالقراءة الطبيعية في معظم التطبيقات
Polyglot16 دولارًامشترك مع Neural2متحدث واحد عبر عدة لغات
Chirp 3 HD30 دولارًامليون حرفسرد حيّ ومعبّر
Instant custom voice60 دولارًالا يوجدصوت علامة تجارية مستنسَخ
Studio160 دولارًاحصة صغيرةصوت متميز للمحتوى الطويل

💡 تنبيه: تختلف صفحات الأسعار من جهات خارجية في الحصة المجانية لفئة WaveNet، إذ تذكر بعضها مليون حرف وأخرى 4 ملايين، لأن خطي Standard وWaveNet تغيّرا عبر السنين. تحقّق من الأرقام الحالية في وحدة التحكم قبل أن تعتمد على الرقم الأكبر.

قاعدة سريعة للاختيار: استخدم Standard عندما يكون الصوت قصيرًا ووظيفيًا، وNeural2 عندما سيسمعه الناس يوميًا، وChirp 3 HD عندما يكون الصوت جزءًا من تجربة المنتج، وStudio فقط بعد أن تسمع Chirp 3 HD وتجده غير كافٍ. البدء بفئة أدنى والصعود بعد ملاحظات حقيقية من المستمعين يُبقي الفواتير الأولى صغيرة.

Standard وWaveNet

أصوات Standard هي الأقدم والأرخص. تبدو اصطناعية بوضوح، بإيقاع متساوٍ وعاطفة مسطّحة. وهذا مقبول لإشعار توصيل أو قراءة حالة، والحصة المجانية البالغة 4 ملايين حرف شهريًا تستوعب قدرًا مدهشًا من هذه الحركة. أما أصوات WaveNet فتستخدم مُشفّرًا صوتيًا عصبيًا يخفف الحدة الآلية. وبالأسعار الحالية تكلّف مثل Standard، وهذا يجعل Standard صعب التبرير لأي شيء سيستمع إليه شخص لأكثر من بضع ثوانٍ.

Neural2 وPolyglot

Neural2 هي الفئة الأكثر استخدامًا. النطق نظيف، وإيقاع الجمل يبدو طبيعيًا، و16 دولارًا لكل مليون حرف نقطة منتصف معقولة. تتيح أصوات Polyglot، التي ما زالت موسومة بأنها معاينة في جدول الأسعار، لمتحدث واحد أن ينتقل بين اللغات، وهذا يفيد خط دعم يحتاج إلى قراءة اسم إسباني داخل جملة إنجليزية. تتشارك الفئتان حصة شهرية قدرها مليون حرف.

Chirp 3 HD وStudio

Chirp 3 HD هي أحدث عائلة متميزة لدى Google، وتقوم على 30 نمط صوتي بأسماء مثل Aoede وPuck وCharon وKore. بسعر 30 دولارًا لكل مليون حرف تكلّف ما يقارب ضعف Neural2، لكنها تبدو أقرب بكثير إلى قارئ بشري، مع أنفاس ونغمات مقنعة. تبلغ أسعار أصوات Studio 160 دولارًا لكل مليون حرف، أي أربعين ضعف سعر Standard. يقترب Chirp 3 HD عادةً بما يكفي، فيصعب تبرير Studio خارج مجموعة ضيقة من مهام المحتوى الطويل المتميز.

كيف تعمل الطبقة المجانية

ما الذي يُحسب كحرف

تحسب الفوترة الأحرف في النص الذي ترسله، بما فيها المسافات وعلامات الترقيم. تتكون الكلمة الإنجليزية المتوسطة من خمسة أحرف إضافة إلى مسافة، أي أن الكلمة الواحدة تكلّف نحو ستة أحرف. وبهذا الحساب، يعادل مليون حرف نحو 166,000 كلمة، أو قرابة 18.5 ساعة من الكلام بسرعة مريحة تبلغ 150 كلمة في الدقيقة.

تُجدَّد الحصص في بداية كل شهر تقويمي ولا تُرحَّل إلى الشهر التالي. الأحرف غير المستخدمة في مارس تضيع في أبريل. كما تُتابع الحصص لكل فئة على حدة، فلن تعوّض 900,000 حرف فائضة من Neural2 أي فاتورة من Chirp 3 HD.

منظر علوي لمكتب فيه آلة حاسبة وفواتير مطبوعة وحسابات مكتوبة بخط اليد لتقدير تكاليف الكلام

الفوترة يجب أن تبقى مفعّلة

الفئة المجانية ليست تجربة بلا بطاقة. يجب ربط حساب فوترة بالمشروع قبل أن تستجيب API، حتى لو لم تتجاوز الحصة المجانية أبدًا. اضبط تنبيه ميزانية عند 5 دولارات أو 10 دولارات من اليوم الأول، وفكّر في خفض حصة API من وحدة التحكم حتى لا تُنتج حلقة برمجية خارجة عن السيطرة مفاجأة بمبلغ من أربعة أرقام بين عشية وضحاها.

💡 حركة احترافية: خزّن كل ملف يُولَّد في الذاكرة المؤقتة. تحية تُشغَّل 10,000 مرة في اليوم ينبغي أن تُولَّد مرة واحدة وتُخزَّن، لا أن تُفوتَر 10,000 مرة.

ما الذي يكلّفه مليون حرف فعلًا

تبدو أسعار الحرف الواحد ضئيلة، لذلك إليك الفئات نفسها مسعّرة على أحمال عمل حقيقية. يُطبَّق في كل رقم أولًا الحصة المجانية للفئة.

ثلاثة أمثلة لفواتير شهرية

حمل العملالأحرفStandardNeural2Chirp 3 HD
200 مقالة مدونة من 1,500 كلمة1.8 مليون0 دولار12.80 دولار24.00 دولار
قائمة هاتفية، 50,000 مطالبة من 120 حرفًا6 ملايين8.00 دولار80.00 دولار150.00 دولار
رواية واحدة من 80,000 كلمة0.48 مليون0 دولار0 دولار0 دولار

تبقى الرواية ضمن الحصة المجانية على Neural2 أو Chirp 3 HD، لكن الكتاب نفسه على Studio سيكلّف 76.80 دولارًا قبل أي حصة. يوضح صف القائمة الهاتفية لماذا يهم اختيار الفئة: الحركة نفسها تكلّف 8 دولارات على Standard و150 دولارًا على Chirp 3 HD. وتزيل الذاكرة المؤقتة للمطالبات المتكررة معظم هذه الفجوة عادةً، لأن القائمة الثابتة لا تحوي سوى بضع مئات من العبارات الفريدة.

التكلفة لكل ساعة صوت

بسرعة 150 كلمة في الدقيقة وستة أحرف لكل كلمة، تبلغ ساعة الكلام نحو 54,000 حرف. مسعّرة قبل أي حصة مجانية:

الفئةالتكلفة لكل ساعة صوت
Standard وWaveNet0.22 دولار
Neural2 وPolyglot0.86 دولار
Chirp 3 HD1.62 دولار
الصوت المخصص الفوري3.24 دولار
Studio8.64 دولار
Gemini 3.1 Flash TTS (يُفوتَر بالتوكنات)حوالي 1.81 دولار، تقدير مستقل

اقرأ هذه الأسعار على أنها سعر الساعة المئة، لا الساعة الأولى. تُفوتَر نماذج الكلام من Google بطريقة مختلفة، بالتوكنات بدلًا من الأحرف: حوالي 1 دولار لكل مليون توكن نص، مضافًا إليه 20 دولارًا لكل مليون توكن صوت لنموذج Gemini 3.1 Flash TTS. عندها تتبع التكلفة طول الصوت الذي تولّده، وهذا أسهل في التنبؤ به للسرد، وأصعب مع المساعدين الثرثارين.

أين تناسب API أكثر

الكتب الصوتية والسرد

السرد الطويل هو المكان الذي يكون فيه الفوترة بالحرف أكثر قابلية للتوقع. كتاب من عشر ساعات يحوي نحو 540,000 حرف، لذا حتى دون أي حصة مجانية ستكلّف Chirp 3 HD مبلغ 16.20 دولارًا للكتاب كله. الثمن هو قلة التحكم في الإلقاء: أصوات Google تقرأ ما تعطيها إياه، مع توجيه عاطفي محدود خارج SSML، لذلك تعني الرواية التي فيها حوار عادةً تجربة عدة أصوات لعدة شخصيات.

راوٍ يقرأ من كتاب ورقي سميك داخل كابينة صوتية مبطّنة

القوائم الهاتفية والدعم

الاتصالات الهاتفية هي أفضل ما يناسب قائمة الصيغ في API. اطلب إخراج MULAW أو ALAW ليدخل الصوت مباشرة إلى شبكة الهاتف دون تحويل، وولّد العبارات الثابتة مرة واحدة وخزّن الملفات، واحتفظ بالتوليف الحي للأجزاء المتغيرة، مثل الأسماء وأرقام الطلبات. ينبغي أن تصل الشريحة الديناميكية وحدها إلى فاتورتك.

أرضية دعم عملاء مشرقة فيها موظفون يرتدون سماعات عند مكاتب بيضاء

المساعدات وإمكانية الوصول

تشترك مكبرات الصوت الذكية وتطبيقات القراءة والمساعدات داخل السيارات في نمط واحد: إجابات قصيرة وحجم كبير. تتعامل أصوات Standard وNeural2 مع هذه الحركة بتكلفة منخفضة، وغالبًا ما تعني الحصة المجانية السخية أن منتجًا صغيرًا لا يدفع شيئًا لشهور. زمن الاستجابة مهم هنا أيضًا، لذا اختبر وقت الاستجابة من منطقتك قبل أن تلتزم. الصوت الذي يبدو مثاليًا لكنه يحتاج ثانيتين ليبدأ يبدو معطوبًا في المحادثة.

مكبر صوت ذكي بلون الفحم المطفي على طاولة مطبخ بجانب ليمون وفنجان قهوة يتصاعد منه البخار

إمكانية الوصول حالة مختلفة. من يعتمد على الصوت لقراءة مقالات طويلة يسمع الصوت لساعات كل يوم، ونبرة اصطناعية مسطّحة تصبح مرهقة بسرعة. خصص ميزانية لفئتي Neural2 أو Chirp 3 HD هناك، ودع المستمع يتحكم في السرعة.

رجل بعصا بيضاء في موقف حافلات يستمع إلى هاتفه الذكي عبر سماعات الأذن

بدائل للصوت خارج Google Cloud

صُممت API للمطورين الذين يديرون مشروعًا سحابيًا وحساب خدمة ووحدة تحكم للفوترة. إذا كنت تحتاج إلى تعليق صوتي لفيديو، أو نموذج أولي سريع، أو سرد لمرة واحدة، فإن هذا الإعداد عبء إضافي. تستضيف PicassoIA 24 نموذجًا لتحويل النص إلى كلام يمكنك تجربتها مباشرة من المتصفح، دون الحاجة إلى إعداد مشروع سحابي.

بدائل تستحق التجربة

النموذجنقطة القوةالاستخدام المناسب
Gemini 3.1 Flash TTS30 صوتًا، أكثر من 70 رمز لغة، وسوم عاطفيةالسرد المعبّر والنصوص متعددة اللغات
ElevenLabs v3تعليقات صوتية طبيعية تبدو بشريةالقصص وقراءة الشخصيات
MiniMax Speech 2.8 HDمخرجات بجودة الاستوديوسرد مصقول للفيديو
Inworld Realtime TTS 2توجيه الصوت بلغة طبيعيةالوكلاء الحواريون
Qwen3 TTSاستنساخ صوت أو تصميم صوت جديدأصوات علامات تجارية مخصصة
ElevenLabs Dubbingترجمة الفيديوهات إلى أكثر من 90 لغةتوطين اللقطات الموجودة

مقدّم بودكاست يتحدث إلى ميكروفون مكثّف مع فلتر رذاذ في استوديو دافئ

إذا كان مشروعك يحتاج صوتًا مميزًا لا صوتًا جاهزًا، فإن MiniMax Voice Cloning يبني صوتًا مخصصًا من عينة قصيرة، ويتجاوز سعر 60 دولارًا لكل مليون حرف الذي تفرضه Google على الصوت المخصص الفوري.

كيفية استخدام Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS اختبار أول جيد لأن أسماء أصواته تتداخل مع عائلة Chirp 3 HD من Google. تظهر Aoede وPuck وCharon وKore في الاثنين، مما يجعل المقارنات الجنبية سهلة.

  1. افتح صفحة النموذج والصق نصك في حقل النص. الحد 4,000 بايت لكل توليد، لذا قسّم النصوص الأطول.
  2. اختر صوتًا من بين 30 خيارًا. الافتراضي هو Kore، وPuck وCharon وFenrir وAoede خيارات سريعة للتجربة أولًا.
  3. اضبط رمز اللغة. الافتراضي هو en-US، والقائمة تتجاوز 70 رمزًا، بما فيها es-MX وfr-CA وpt-BR وja-JP.
  4. اكتب أمرًا نصيًا للأسلوب بالإنجليزية البسيطة، مثل "Say this in a calm, professional tone" أو "Speak with excitement and energy".
  5. أضف وسومًا تعبيرية داخل النص: [whispering] أو [laughing] أو [shouting] أو [sigh] أو [extremely fast].
  6. ولّد واستمع ونزّل ملف الصوت. غيّر إعدادًا واحدًا في كل مرة حتى تسمع ما يفعله كل إعداد.
المعاملما الذي يتحكم فيهنقطة البداية
Voiceالشخصية والعمر والنبرةKore للسرد المحايد
Language codeاللهجة والنطقطابق منطقة جمهورك
Style promptالإيقاع والعاطفة وطريقة الإلقاءجملة قصيرة واحدة
Text tagsالتعبير على مستوى العبارةاثنان أو ثلاثة لكل فقرة

💡 نصيحة: اجعل الوسوم نادرة. النص الذي يكون فيه كل سطر [whispering] أو [shouting] يبدو مرهقًا. استخدمها للتباين، لا للزينة.

الموسيقى والتفريغ إلى جانب الكلام

نادرًا ما يُنتج الكلام وحده. يحتاج الفيديو إلى خلفية موسيقية تحت السرد، ويحتاج المحتوى المنطوق إلى نص مفرّغ للتعليقات المكتوبة والبحث وإمكانية الوصول. تبيع Google التفريغ كمنتج منفصل بعداد خاص به، لذلك قد يصل مشروع الكلام إلى سطرين من الفوترة قبل أن تضيف الموسيقى.

في جانب الموسيقى، يبني Lyria 3 Pro أغاني كاملة الطول من أمر نصي، وMiniMax Music 2.6 يضيف الأصوات الغنائية والكلمات، وStable Audio 2.5 يناسب الخلفيات الآلية التي تستقر بهدوء تحت الصوت. وجّه الموسيقى كما تُزوّد مؤلفًا موسيقيًا بالتعليمات: النوع والإيقاع والآلات والمزاج. "Warm acoustic guitar, 90 BPM, unhurried, no vocals" يعطي خلفية لن تنافس السرد.

منتج موسيقي على مكتب بين شاشات استوديو مع جهاز MIDI صغير

للتفريغ، يحوّل GPT-4o Transcribe وGemini 3 Pro التسجيلات إلى نص، وهذا مفيد لملاحظات الاجتماعات والمقابلات والتعليقات المكتوبة للسرد الذي ولّدته للتو.

منظر جوي لزملاء حول طاولة مؤتمرات زجاجية ومسجّل صوت صغير في المنتصف

خط سير بسيط يعمل جيدًا: اكتب النص، ثم ولّد الصوت، ثم أضف خلفية موسيقية، ثم فرّغ المزيج النهائي لإنتاج التعليقات المكتوبة وتدقيق نطق الأسماء الصعبة.

أنشئ أول تعليق صوتي لك اليوم

لا تخبرك جداول الأسعار إلا بقدر محدود. أسرع طريقة للمفاضلة بين واجهة API سحابية وأداة متصفح هي أن تسمع الاثنتين تقرآن الفقرة نفسها. خذ 100 كلمة من مشروعك، وشغّلها عبر وحدة تحكم Google، ثم الصقها في Gemini 3.1 Flash TTS أو MiniMax Speech 2.8 HD، وقارن الإيقاع والدفء والنطق جنبًا إلى جنب.

وبينما أنت هناك، جرّب بقية المنصة. أضف خلفية موسيقية عبر Lyria 3 Pro، وأضف تعليقات مكتوبة للنتيجة عبر GPT-4o Transcribe، وأنشئ صورًا واقعية كالصور الفوتوغرافية للصور المصغرة وصور المقالات عبر Picasso IA. جرّب بحرية، وغيّر متغيرًا واحدًا في كل مرة، واحتفظ بالمزيج الذي يبدو صحيحًا. تصفّح كل النماذج على picassoia.com/en/all-models.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة