يبدو Google Cloud Text to Speech رخيصًا حتى تصل أول فاتورة. الرقم الأبرز هو 4 دولارات لكل مليون حرف للأصوات الأساسية، لكن الأصوات التي يريدها الناس فعلًا تكلّف بين أربع مرات وأربعين مرة أكثر، وتتقلص الحصة المجانية بسرعة كلما صعدت سلّم الجودة. يعرض هذا المقال كل فئة صوتية، وما تشمله الطبقة المجانية الشهرية فعلًا، وكيفية تقدير الفاتورة قبل كتابة سطر برمجي واحد، ومتى يكون نموذج صوت بالذكاء الاصطناعي آخر خيارًا أذكى.
تعكس الأسعار أدناه التعرفة المنشورة من Google حتى أكتوبر 2026. تعيد Google ترتيب قائمة أصواتها بشكل متكرر، لذا اعتبر الأرقام أساسًا للتخطيط، وتحقّق منها في وحدة الفوترة قبل أن تعتمد ميزانية.
ما الذي تفعله API فعليًا
تأخذ Cloud Text-to-Speech API نصًا عاديًا أو مستند SSML وتعيد ملفًا صوتيًا. تستدعيها عبر REST أو gRPC، أو عبر مكتبات العميل للغات Python وNode.js وJava وGo وC#. تتم المصادقة عبر حساب خدمة، لذا يستطيع الخادم طلب الصوت دون أي خطوة تسجيل دخول يدوية.

الصيغ وحدود الطلب
يصل كل رد بصيغة MP3 أو LINEAR16 (ملف WAV غير مضغوط) أو OGG_OPUS أو MULAW أو ALAW. تناسب MP3 التشغيل على الويب، وتناسب LINEAR16 التحرير، وتناسب MULAW وALAW أنظمة الهاتف التي تتوقع ترميزات الاتصالات. يقبل الطلب الواحد نحو 5,000 بايت من المدخلات تقريبًا، لذا يجب تقسيم النص الطويل إلى أجزاء ثم دمجها من جهتك.
💡 نصيحة: قسّم النصوص عند حدود الجمل، لا عند عدد ثابت من البايتات. القطع في منتصف الجملة يترك قفزة مسموعة في طبقة الصوت عند نقطة الوصل.
SSML وضوابط الصوت
SSML هي لغة الترميز التي تشكّل طريقة الإلقاء. باستخدامها تضيف فترات صمت عبر <break>، وتؤكد كلمة بواسطة <emphasis>، وتكتب التواريخ والأرقام والاختصارات مفصّلة عبر <say-as>. خارج SSML، يعرض الطلب سرعة الكلام (من 0.25x إلى 4x) ودرجة الصوت (من ناقص 20 إلى زائد 20 نصف نغمة) كمعاملات بسيطة. تسرد Google مئات الأصوات بأكثر من 50 لغة ولهجة، لكن ليست كل الضوابط تعمل على كل فئة صوتية.
فئات الأصوات وأسعارها
تبيع Google الكلام في فئات. يتبع السعر تقنية الصوت الكامنة تحته، لا طول الملف الصوتي، لذلك يُعدّ اختيار الفئة الخاطئة أكثر أخطاء الميزانية شيوعًا.
| فئة الصوت | السعر لكل مليون حرف | المجاني شهريًا | الأنسب لـ |
|---|
| Standard | 4 دولارات | 4 ملايين حرف | التنبيهات والنماذج الأولية والسرد البسيط |
| WaveNet | 4 دولارات | مشترك مع Standard | نبرة أدفأ بالسعر نفسه |
| Neural2 | 16 دولارًا | مليون حرف | القراءة الطبيعية في معظم التطبيقات |
| Polyglot | 16 دولارًا | مشترك مع Neural2 | متحدث واحد عبر عدة لغات |
| Chirp 3 HD | 30 دولارًا | مليون حرف | سرد حيّ ومعبّر |
| Instant custom voice | 60 دولارًا | لا يوجد | صوت علامة تجارية مستنسَخ |
| Studio | 160 دولارًا | حصة صغيرة | صوت متميز للمحتوى الطويل |
💡 تنبيه: تختلف صفحات الأسعار من جهات خارجية في الحصة المجانية لفئة WaveNet، إذ تذكر بعضها مليون حرف وأخرى 4 ملايين، لأن خطي Standard وWaveNet تغيّرا عبر السنين. تحقّق من الأرقام الحالية في وحدة التحكم قبل أن تعتمد على الرقم الأكبر.
قاعدة سريعة للاختيار: استخدم Standard عندما يكون الصوت قصيرًا ووظيفيًا، وNeural2 عندما سيسمعه الناس يوميًا، وChirp 3 HD عندما يكون الصوت جزءًا من تجربة المنتج، وStudio فقط بعد أن تسمع Chirp 3 HD وتجده غير كافٍ. البدء بفئة أدنى والصعود بعد ملاحظات حقيقية من المستمعين يُبقي الفواتير الأولى صغيرة.
Standard وWaveNet
أصوات Standard هي الأقدم والأرخص. تبدو اصطناعية بوضوح، بإيقاع متساوٍ وعاطفة مسطّحة. وهذا مقبول لإشعار توصيل أو قراءة حالة، والحصة المجانية البالغة 4 ملايين حرف شهريًا تستوعب قدرًا مدهشًا من هذه الحركة. أما أصوات WaveNet فتستخدم مُشفّرًا صوتيًا عصبيًا يخفف الحدة الآلية. وبالأسعار الحالية تكلّف مثل Standard، وهذا يجعل Standard صعب التبرير لأي شيء سيستمع إليه شخص لأكثر من بضع ثوانٍ.
Neural2 وPolyglot
Neural2 هي الفئة الأكثر استخدامًا. النطق نظيف، وإيقاع الجمل يبدو طبيعيًا، و16 دولارًا لكل مليون حرف نقطة منتصف معقولة. تتيح أصوات Polyglot، التي ما زالت موسومة بأنها معاينة في جدول الأسعار، لمتحدث واحد أن ينتقل بين اللغات، وهذا يفيد خط دعم يحتاج إلى قراءة اسم إسباني داخل جملة إنجليزية. تتشارك الفئتان حصة شهرية قدرها مليون حرف.
Chirp 3 HD وStudio
Chirp 3 HD هي أحدث عائلة متميزة لدى Google، وتقوم على 30 نمط صوتي بأسماء مثل Aoede وPuck وCharon وKore. بسعر 30 دولارًا لكل مليون حرف تكلّف ما يقارب ضعف Neural2، لكنها تبدو أقرب بكثير إلى قارئ بشري، مع أنفاس ونغمات مقنعة. تبلغ أسعار أصوات Studio 160 دولارًا لكل مليون حرف، أي أربعين ضعف سعر Standard. يقترب Chirp 3 HD عادةً بما يكفي، فيصعب تبرير Studio خارج مجموعة ضيقة من مهام المحتوى الطويل المتميز.
كيف تعمل الطبقة المجانية
ما الذي يُحسب كحرف
تحسب الفوترة الأحرف في النص الذي ترسله، بما فيها المسافات وعلامات الترقيم. تتكون الكلمة الإنجليزية المتوسطة من خمسة أحرف إضافة إلى مسافة، أي أن الكلمة الواحدة تكلّف نحو ستة أحرف. وبهذا الحساب، يعادل مليون حرف نحو 166,000 كلمة، أو قرابة 18.5 ساعة من الكلام بسرعة مريحة تبلغ 150 كلمة في الدقيقة.
تُجدَّد الحصص في بداية كل شهر تقويمي ولا تُرحَّل إلى الشهر التالي. الأحرف غير المستخدمة في مارس تضيع في أبريل. كما تُتابع الحصص لكل فئة على حدة، فلن تعوّض 900,000 حرف فائضة من Neural2 أي فاتورة من Chirp 3 HD.

الفوترة يجب أن تبقى مفعّلة
الفئة المجانية ليست تجربة بلا بطاقة. يجب ربط حساب فوترة بالمشروع قبل أن تستجيب API، حتى لو لم تتجاوز الحصة المجانية أبدًا. اضبط تنبيه ميزانية عند 5 دولارات أو 10 دولارات من اليوم الأول، وفكّر في خفض حصة API من وحدة التحكم حتى لا تُنتج حلقة برمجية خارجة عن السيطرة مفاجأة بمبلغ من أربعة أرقام بين عشية وضحاها.
💡 حركة احترافية: خزّن كل ملف يُولَّد في الذاكرة المؤقتة. تحية تُشغَّل 10,000 مرة في اليوم ينبغي أن تُولَّد مرة واحدة وتُخزَّن، لا أن تُفوتَر 10,000 مرة.
ما الذي يكلّفه مليون حرف فعلًا
تبدو أسعار الحرف الواحد ضئيلة، لذلك إليك الفئات نفسها مسعّرة على أحمال عمل حقيقية. يُطبَّق في كل رقم أولًا الحصة المجانية للفئة.
ثلاثة أمثلة لفواتير شهرية
| حمل العمل | الأحرف | Standard | Neural2 | Chirp 3 HD |
|---|
| 200 مقالة مدونة من 1,500 كلمة | 1.8 مليون | 0 دولار | 12.80 دولار | 24.00 دولار |
| قائمة هاتفية، 50,000 مطالبة من 120 حرفًا | 6 ملايين | 8.00 دولار | 80.00 دولار | 150.00 دولار |
| رواية واحدة من 80,000 كلمة | 0.48 مليون | 0 دولار | 0 دولار | 0 دولار |
تبقى الرواية ضمن الحصة المجانية على Neural2 أو Chirp 3 HD، لكن الكتاب نفسه على Studio سيكلّف 76.80 دولارًا قبل أي حصة. يوضح صف القائمة الهاتفية لماذا يهم اختيار الفئة: الحركة نفسها تكلّف 8 دولارات على Standard و150 دولارًا على Chirp 3 HD. وتزيل الذاكرة المؤقتة للمطالبات المتكررة معظم هذه الفجوة عادةً، لأن القائمة الثابتة لا تحوي سوى بضع مئات من العبارات الفريدة.
التكلفة لكل ساعة صوت
بسرعة 150 كلمة في الدقيقة وستة أحرف لكل كلمة، تبلغ ساعة الكلام نحو 54,000 حرف. مسعّرة قبل أي حصة مجانية:
| الفئة | التكلفة لكل ساعة صوت |
|---|
| Standard وWaveNet | 0.22 دولار |
| Neural2 وPolyglot | 0.86 دولار |
| Chirp 3 HD | 1.62 دولار |
| الصوت المخصص الفوري | 3.24 دولار |
| Studio | 8.64 دولار |
| Gemini 3.1 Flash TTS (يُفوتَر بالتوكنات) | حوالي 1.81 دولار، تقدير مستقل |
اقرأ هذه الأسعار على أنها سعر الساعة المئة، لا الساعة الأولى. تُفوتَر نماذج الكلام من Google بطريقة مختلفة، بالتوكنات بدلًا من الأحرف: حوالي 1 دولار لكل مليون توكن نص، مضافًا إليه 20 دولارًا لكل مليون توكن صوت لنموذج Gemini 3.1 Flash TTS. عندها تتبع التكلفة طول الصوت الذي تولّده، وهذا أسهل في التنبؤ به للسرد، وأصعب مع المساعدين الثرثارين.
أين تناسب API أكثر
الكتب الصوتية والسرد
السرد الطويل هو المكان الذي يكون فيه الفوترة بالحرف أكثر قابلية للتوقع. كتاب من عشر ساعات يحوي نحو 540,000 حرف، لذا حتى دون أي حصة مجانية ستكلّف Chirp 3 HD مبلغ 16.20 دولارًا للكتاب كله. الثمن هو قلة التحكم في الإلقاء: أصوات Google تقرأ ما تعطيها إياه، مع توجيه عاطفي محدود خارج SSML، لذلك تعني الرواية التي فيها حوار عادةً تجربة عدة أصوات لعدة شخصيات.

القوائم الهاتفية والدعم
الاتصالات الهاتفية هي أفضل ما يناسب قائمة الصيغ في API. اطلب إخراج MULAW أو ALAW ليدخل الصوت مباشرة إلى شبكة الهاتف دون تحويل، وولّد العبارات الثابتة مرة واحدة وخزّن الملفات، واحتفظ بالتوليف الحي للأجزاء المتغيرة، مثل الأسماء وأرقام الطلبات. ينبغي أن تصل الشريحة الديناميكية وحدها إلى فاتورتك.

المساعدات وإمكانية الوصول
تشترك مكبرات الصوت الذكية وتطبيقات القراءة والمساعدات داخل السيارات في نمط واحد: إجابات قصيرة وحجم كبير. تتعامل أصوات Standard وNeural2 مع هذه الحركة بتكلفة منخفضة، وغالبًا ما تعني الحصة المجانية السخية أن منتجًا صغيرًا لا يدفع شيئًا لشهور. زمن الاستجابة مهم هنا أيضًا، لذا اختبر وقت الاستجابة من منطقتك قبل أن تلتزم. الصوت الذي يبدو مثاليًا لكنه يحتاج ثانيتين ليبدأ يبدو معطوبًا في المحادثة.

إمكانية الوصول حالة مختلفة. من يعتمد على الصوت لقراءة مقالات طويلة يسمع الصوت لساعات كل يوم، ونبرة اصطناعية مسطّحة تصبح مرهقة بسرعة. خصص ميزانية لفئتي Neural2 أو Chirp 3 HD هناك، ودع المستمع يتحكم في السرعة.

بدائل للصوت خارج Google Cloud
صُممت API للمطورين الذين يديرون مشروعًا سحابيًا وحساب خدمة ووحدة تحكم للفوترة. إذا كنت تحتاج إلى تعليق صوتي لفيديو، أو نموذج أولي سريع، أو سرد لمرة واحدة، فإن هذا الإعداد عبء إضافي. تستضيف PicassoIA 24 نموذجًا لتحويل النص إلى كلام يمكنك تجربتها مباشرة من المتصفح، دون الحاجة إلى إعداد مشروع سحابي.
بدائل تستحق التجربة

إذا كان مشروعك يحتاج صوتًا مميزًا لا صوتًا جاهزًا، فإن MiniMax Voice Cloning يبني صوتًا مخصصًا من عينة قصيرة، ويتجاوز سعر 60 دولارًا لكل مليون حرف الذي تفرضه Google على الصوت المخصص الفوري.
كيفية استخدام Gemini 3.1 Flash TTS
Gemini 3.1 Flash TTS اختبار أول جيد لأن أسماء أصواته تتداخل مع عائلة Chirp 3 HD من Google. تظهر Aoede وPuck وCharon وKore في الاثنين، مما يجعل المقارنات الجنبية سهلة.
- افتح صفحة النموذج والصق نصك في حقل النص. الحد 4,000 بايت لكل توليد، لذا قسّم النصوص الأطول.
- اختر صوتًا من بين 30 خيارًا. الافتراضي هو Kore، وPuck وCharon وFenrir وAoede خيارات سريعة للتجربة أولًا.
- اضبط رمز اللغة. الافتراضي هو en-US، والقائمة تتجاوز 70 رمزًا، بما فيها es-MX وfr-CA وpt-BR وja-JP.
- اكتب أمرًا نصيًا للأسلوب بالإنجليزية البسيطة، مثل "Say this in a calm, professional tone" أو "Speak with excitement and energy".
- أضف وسومًا تعبيرية داخل النص: [whispering] أو [laughing] أو [shouting] أو [sigh] أو [extremely fast].
- ولّد واستمع ونزّل ملف الصوت. غيّر إعدادًا واحدًا في كل مرة حتى تسمع ما يفعله كل إعداد.
| المعامل | ما الذي يتحكم فيه | نقطة البداية |
|---|
| Voice | الشخصية والعمر والنبرة | Kore للسرد المحايد |
| Language code | اللهجة والنطق | طابق منطقة جمهورك |
| Style prompt | الإيقاع والعاطفة وطريقة الإلقاء | جملة قصيرة واحدة |
| Text tags | التعبير على مستوى العبارة | اثنان أو ثلاثة لكل فقرة |
💡 نصيحة: اجعل الوسوم نادرة. النص الذي يكون فيه كل سطر [whispering] أو [shouting] يبدو مرهقًا. استخدمها للتباين، لا للزينة.
الموسيقى والتفريغ إلى جانب الكلام
نادرًا ما يُنتج الكلام وحده. يحتاج الفيديو إلى خلفية موسيقية تحت السرد، ويحتاج المحتوى المنطوق إلى نص مفرّغ للتعليقات المكتوبة والبحث وإمكانية الوصول. تبيع Google التفريغ كمنتج منفصل بعداد خاص به، لذلك قد يصل مشروع الكلام إلى سطرين من الفوترة قبل أن تضيف الموسيقى.
في جانب الموسيقى، يبني Lyria 3 Pro أغاني كاملة الطول من أمر نصي، وMiniMax Music 2.6 يضيف الأصوات الغنائية والكلمات، وStable Audio 2.5 يناسب الخلفيات الآلية التي تستقر بهدوء تحت الصوت. وجّه الموسيقى كما تُزوّد مؤلفًا موسيقيًا بالتعليمات: النوع والإيقاع والآلات والمزاج. "Warm acoustic guitar, 90 BPM, unhurried, no vocals" يعطي خلفية لن تنافس السرد.

للتفريغ، يحوّل GPT-4o Transcribe وGemini 3 Pro التسجيلات إلى نص، وهذا مفيد لملاحظات الاجتماعات والمقابلات والتعليقات المكتوبة للسرد الذي ولّدته للتو.

خط سير بسيط يعمل جيدًا: اكتب النص، ثم ولّد الصوت، ثم أضف خلفية موسيقية، ثم فرّغ المزيج النهائي لإنتاج التعليقات المكتوبة وتدقيق نطق الأسماء الصعبة.
أنشئ أول تعليق صوتي لك اليوم
لا تخبرك جداول الأسعار إلا بقدر محدود. أسرع طريقة للمفاضلة بين واجهة API سحابية وأداة متصفح هي أن تسمع الاثنتين تقرآن الفقرة نفسها. خذ 100 كلمة من مشروعك، وشغّلها عبر وحدة تحكم Google، ثم الصقها في Gemini 3.1 Flash TTS أو MiniMax Speech 2.8 HD، وقارن الإيقاع والدفء والنطق جنبًا إلى جنب.
وبينما أنت هناك، جرّب بقية المنصة. أضف خلفية موسيقية عبر Lyria 3 Pro، وأضف تعليقات مكتوبة للنتيجة عبر GPT-4o Transcribe، وأنشئ صورًا واقعية كالصور الفوتوغرافية للصور المصغرة وصور المقالات عبر Picasso IA. جرّب بحرية، وغيّر متغيرًا واحدًا في كل مرة، واحتفظ بالمزيج الذي يبدو صحيحًا. تصفّح كل النماذج على picassoia.com/en/all-models.