Gemini TTS: الأصوات والأسعار وواجهة API واللغات بالتفصيل

يحوّل Gemini TTS النص إلى كلام مع 30 صوتًا جاهزًا، وأكثر من 70 لغة، ووسوم تعبيرية مثل الهمس والضحك. يشرح هذا المقال كل صوت حسب نبرته، وحساب التوكنات الفعلي وراء السعر، ومثالًا عمليًا على استدعاء API بلغة Python، ومسارًا في المتصفح لا يحتاج إلى أي إعداد.

Gemini TTS: الأصوات والأسعار وواجهة API واللغات بالتفصيل
Cristian Da Conceicao
مؤسس Picasso IA

يكلّف التعليق الصوتي لدقيقة واحدة من Gemini TTS حوالي ثلاثة سنتات بالسعر القياسي. هذا الرقم وحده يفسّر سبب تكرار السؤال عنه من المطوّرين وصنّاع البودكاست ومنشئي الدورات التعليمية. تحوّل نماذج الكلام من Google النص إلى صوت، مع 30 صوتًا مُسمّى وعشرات اللغات، وطريقة بسيطة بالإنجليزية لتوجيه الأداء. أما مقاطع العرض فلا تُظهر كل ما يحدد إن كان النموذج مناسبًا لمشروعك: أي صوت يناسب أي مهمة، وكيف تتراكم فاتورة التوكنات، وكيف يبدو استدعاء API، وأين تقع الحدود. فيما يلي كل ذلك بأرقام حقيقية، مع مثال عملي بلغة Python ومسار بلا كود يمكنك تجربته في المتصفح خلال أقل من دقيقة.

ماذا يفعل Gemini TTS فعليًا

Gemini TTS هو جزء إخراج الكلام في نماذج Gemini من Google. ترسل النص مع تعليمة اختيارية، فيعيد النموذج صوتًا بدلًا من نص آخر. تطبّق محركات تحويل النص إلى كلام التقليدية الأسلوب الأدائي نفسه على كل جملة. أما نموذج Gemini TTS فيقرأ التعليمة والنص معًا، لذلك فإن عبارة "اقرأ هذا كممرضة متعبة في نوبة ليلية" تغيّر الإيقاع والتنفّس والنبرة، لا الطبقة الصوتية فقط.

مقدّم بودكاست يرتدي هودي رمادي ويتحدث إلى ميكروفون على ذراع متحرك في استوديو منزلي دافئ الإضاءة

من النص إلى صوت منطوق

لكل طلب ثلاثة عناصر أساسية: نص، وصوت، وتعليمة أسلوب. تعرض صفحة Gemini 3.1 Flash TTS على Picasso IA هذه العناصر في أربعة حقول: text وvoice وprompt وlanguage_code. القيم الافتراضية هي الصوت Kore، واللغة en-US، والأمر "Say the following." اضغط على التوليد فيصل ملف صوتي جاهز خلال ثوانٍ. استغرق المثالان المنشوران في صفحة النموذج نحو 6.5 ثانية و4.0 ثانية. دورة بهذا القصر تغيّر طريقة عملك: أعد كتابة سطر، وأعد توليده، وقارن النسخ كما تفعل مع معلّق بشري، دون رسوم حجز ولا ساعات استوديو.

إصدارات النموذج المستخدمة

تطلق Google أكثر من نموذج تحويل نص إلى كلام، واختيارك يغيّر فاتورتك:

  • Gemini 3.1 Flash TTS (نسخة تجريبية): بسعر 1.00 دولار لكل مليون توكن إدخال نصي، و20.00 دولار لكل مليون توكن إخراج صوتي.
  • Gemini 2.5 Flash Preview TTS: نصف سعر 3.1 Flash تمامًا على الجانبين.
  • Gemini 2.5 Pro Preview TTS: بالأسعار نفسها لنموذج 3.1 Flash، ولا يتضمن مستوى مجانيًا.

أي واحد تختار؟ اختر 3.1 Flash إذا أردت أحدث تحكم في الأداء. اختر 2.5 Flash عندما تحوّل إلى صوت آلاف الجمل القصيرة، مثل إشعارات التطبيقات، حيث يتراكم توفير النصف بسرعة. اختر 2.5 Pro فقط إذا كنت تفضّل مخرجاته، لأنه يكلّف مثل 3.1 Flash ولا يتضمن مستوى مجانيًا.

توثيق الكلام لدى Google يسرد أيضًا نماذج Flash وFlash Lite الأحدث لتحويل النص إلى كلام. لم تكن أسعارها في جدول التسعير وقت كتابة هذا المقال، لذا تحقق من الجدول قبل أن تبني ميزانيتك عليها.

الأصوات الثلاثون مرتبةً حسب النبرة

يأتي Gemini TTS بـ30 صوتًا جاهزًا تحمل أسماء مأخوذة من علم الفلك والأساطير. تربط Google بكل صوت وصفًا من كلمة واحدة، مثل "Bright" أو "Firm"، وهذه الأوصاف أسرع اختصار للاختيار. اعتبرها نقطة بداية، لأن تعليمة الأسلوب قادرة على جعل أي صوت أدفأ أو أسرع أو أكثر رتابة.

لقطة مقرّبة من الأعلى لأيدي مهندس صوت على لوحة مزج بمفاتيح تمرير من الألومنيوم المصقول

مشرق وحيوي

سبعة أصوات تميل إلى الحيوية: Zephyr (Bright)، وPuck (Upbeat)، وAutonoe (Bright)، وLaomedeia (Upbeat)، وSadachbia (Lively)، وFenrir (Excitable)، وLeda (Youthful). استخدمها في الإعلانات ومقاطع التواصل الاجتماعي وجولات التعريف بالمنتجات ومحتوى الأطفال، في أي موقع يجب أن يشعر فيه المستمع بالزخم منذ الثانية الأولى.

دافئ وهادئ

ستة أصوات تميل إلى النعومة: Sulafat (Warm)، وAchird (Friendly)، وVindemiatrix (Gentle)، وAchernar (Soft)، وEnceladus (Breathy)، وAoede (Breezy). تناسب نصوص التأمل وقصص النوم وتطبيقات العافية ورسائل خدمة العملاء.

حازم وواضح

عشرة أصوات تنقل الإحساس بالسلطة: Kore (Firm)، وOrus (Firm)، وAlnilam (Firm)، وIapetus (Clear)، وErinome (Clear)، وCharon (Informative)، وRasalgethi (Informative)، وSadaltager (Knowledgeable)، وSchedar (Even)، وPulcherrima (Forward). Kore هو الصوت الافتراضي لسبب وجيه: يعمل جيدًا في الدروس التعليمية والشروحات وعروض المنتجات دون أن يبدو جامدًا.

تملأ الأصوات السبعة المتبقية الفراغات. Algieba وDespina وCallirrhoe وUmbriel وZubenelgenubi ناعمة أو مريحة أو غير رسمية، ما يناسب الحوار. أما Algenib (Gravelly) وGacrux (Mature) فيضيفان ملمسًا للشخصيات والسرد القصصي.

المهمةالأصوات التي تستمع إليها أولًا
عرض منتجKore وCharon وSadaltager
مقدمة بودكاستPuck وFenrir وAlgenib
تأملVindemiatrix وAchernar وEnceladus
إعلان على التواصل الاجتماعيZephyr وSadachbia وLeda
سرد كتب صوتيةGacrux وSchedar وSulafat

💡 استمع قبل أن تلتزم. الصق فقرة من 30 كلمة، وولّدها بثلاثة أصوات، واستمع عبر السماعات التي سيستخدمها جمهورك. الأوصاف وصف من Google، والحكم النهائي لأذنيك.

أكثر من 70 لغة ولهجة

يقبل حقل اللغة أكثر من 70 لغة، وتأتي كثير منها بلهجات إقليمية. هذا أهم مما يبدو: فالإسبانية المكسيكية والقشتالية تختلفان في المفردات والإيقاع، والمستمعون يلاحظون ذلك خلال جملة واحدة.

خمسة زملاء حول طاولة من خشب البلوط في مكتب ترجمة مضيء يقارنون نصوصًا بلغات مختلفة

اللغةالرموز المتاحة
الإنجليزيةen-US وen-GB وen-AU وen-IN
الإسبانيةes-ES وes-MX وes-419
الفرنسيةfr-FR وfr-CA
البرتغاليةpt-BR وpt-PT
الصينيةcmn-CN وcmn-tw
العربيةar-001 وar-EG

سير العمل بسيط. اكتب النص باللغة المستهدفة، واضبط الرمز المطابق، واحتفظ بالصوت نفسه. في أغلب الحالات يستطيع صوت واحد قراءة كل لغة في القائمة، فتحافظ على هوية صوتية واحدة للعلامة التجارية في الأسواق كلها. ومن الرموز الشائعة الأخرى de-DE وit-IT وja-JP وko-KR وhi-IN وtr-TR وpl-PL وnl-NL وsv-SE وvi-VN.

لغات أقل شيوعًا في القائمة

إلى جانب الأسواق الكبرى، تصل القائمة إلى السيبوانية (ceb-PH)، والكريولية الهايتية (ht-HT)، والجاوية (jv-JV)، والمالاغاشية (mg-MG)، والميثيلية (mai-IN)، والكونكانية (kok-IN)، والسندية (sd-IN)، والباسكية (eu-ES)، والغاليسية (gl-ES)، وحتى اللاتينية (la-VA). لن تكون الجودة متطابقة في كل هذه اللغات، لذا اطلب من متحدث أصلي مراجعة أي محتوى موجّه للعملاء. قبل أن تعرّب دورة كاملة، ولّد عينة مدتها 20 ثانية باللغة المستهدفة بصوتين، وأرسلها إلى متحدث أصلي مع ثلاثة أسئلة: هل تُنطق الأسماء بشكل صحيح؟ هل يبدو الإيقاع طبيعيًا؟ وهل تتطابق اللهجة مع المنطقة التي تستهدفها؟ إذا أربكت الاختصارات النموذج، فاكتبها صوتيًا كاملة داخل النص. وإذا كان مصدرك فيديو جاهزًا لا نصًا، فإن ElevenLabs Dubbing يترجم الفيديو إلى أكثر من 90 لغة على المنصة نفسها.

الوسوم وتعليمات الأسلوب

يشكّل أمران الأداء. تعمل الوسوم على عبارات مفردة، أما تعليمة الأسلوب فتحدد المزاج للتسجيل كله.

لقطة مقرّبة لممثل يهمس أمام فلتر البوب (pop filter) داخل كابينة تسجيل صوتي، وبيده نص عليه ملاحظات

وسوم داخل السطر للجمل المفردة

توضع الوسوم بين أقواس مربعة داخل النص. تسرد صفحة النموذج [sigh] و**[laughing]** و**[whispering]** و**[shouting]** و**[extremely fast]**، وتُظهر العينات المنشورة أن الوسوم الوصفية تعمل أيضًا. يبدأ أحد الأمثلة بـ[like dracula] على صوت Algenib. ويعرض مثال آخر [laughs] I did NOT expect that. [sigh] Can you believe it! على Callirrhoe.

الوسمما يمكن توقعه
[whispering]همس خافت وقريب من الميكروفون
[laughing]ضحكة مسموعة قبل الجملة أو داخلها
[shouting]ارتفاع في الصوت وإلحاح
[sigh]زفرة متعبة أو مرتاحة
[extremely fast]إيقاع سريع ومضغوط

تعليمات الأسلوب للتسجيل كاملًا

يقبل حقل prompt لغة بسيطة حتى 4,000 بايت. تغيّر التعليمات القصيرة مثل "Say this in a calm, professional tone" أو "Speak with excitement and energy" النتيجة فعلًا. أما التعليمات الأطول فتبني مشهدًا: "You are having a casual conversation with a friend. Say the following in a friendly and amused way." وهذه الصيغة الثانية هي ما يستخدمه مثال Callirrhoe المنشور.

إليك كيف يتفاعل الأمران في إعلان عن منتج، يُقرأ بصوت Puck. تقول التعليمة "Speak like a friendly presenter on a morning show, upbeat but not rushed." ويقول النص Big news today. [whispering] We're launching the new dashboard tomorrow. [shouting] And it's free for every team! تحدد التعليمة سقف الطاقة، ويخلق الهمس لحظة حميمية، ويكون الصراخ أقوى لأنه يأتي بعد سطر هادئ. التباين هو ما يجعل الوسوم مسموعة.

💡 انفعال واحد لكل جملة. وضع ثلاثة وسوم في سطر واحد يُنتج خلطًا مربكًا. ضع وسمًا واحدًا، واستمع، ثم قرر إن كان السطر يحتاج إلى آخر.

ما التكلفة الحقيقية لـ Gemini TTS

يُحتسب الصوت بالتوكنات، وتوضح صفحة تسعير Google التحويل: 25 توكن صوتي في الثانية. كل ما عدا ذلك يُبنى على هذا الرقم الواحد.

صانع محتوى مستقل يحسب ميزانيته في دفتر بجانب حاسوب محمول وآلة حاسبة شمسية

النموذجتوكنات الإدخال النصي لكل مليونتوكنات الإخراج الصوتي لكل مليونمستوى مجاني
Gemini 3.1 Flash TTS نسخة تجريبية1.00 دولار20.00 دولارنعم
Gemini 2.5 Flash Preview TTS0.50 دولار10.00 دولارنعم
Gemini 2.5 Pro Preview TTS1.00 دولار20.00 دولارلا

حساب التوكنات بأرقام بسيطة

دقيقة كلام واحدة هي 60 ثانية مضروبة في 25 توكنًا، أي 1,500 توكن إخراج. وبسعر 20.00 دولار لكل مليون، يصبح ذلك 1,500 مضروبًا في 20 مقسومًا على 1,000,000، أي 0.03 دولار لكل دقيقة. أما النص الذي ترسله فهامشه ضئيل: 150 كلمة منطوقة تعادل تقريبًا 200 توكن إدخال، أي حوالي 0.0002 دولار.

مدة الصوت3.1 Flash القياسي3.1 Flash الدفعي2.5 Flash القياسي
دقيقة واحدة0.03 دولار0.015 دولار0.015 دولار
10 دقائق0.30 دولار0.15 دولار0.15 دولار
ساعة واحدة1.80 دولار0.90 دولار0.90 دولار
10 ساعات18.00 دولار9.00 دولار9.00 دولار

المستوى المجاني وخصومات المعالجة الدفعية

تسرد Google مستوى مجانيًا لنموذجي Flash، بينما يُدفع مقابل Pro فقط. تتغير حدود الاستخدام في المستويات المجانية، لذا أكّدها في صفحة التسعير قبل أن تبني خطة إطلاق عليها. والوضع الدفعي، أي المهام غير المتزامنة التي تكتمل لاحقًا، يخفّض السعرين إلى النصف. وهذا ما يجعله الخيار الأوضح للكتب الصوتية ومكتبات الدورات أو أي أرشيف تستطيع معالجته طوال الليل.

مثال عملي يوضح الفكرة. لنفترض أنك تسجّل صوت دورة من 20 درسًا مدة كل منها 8 دقائق. هذا يعني 160 دقيقة من الصوت، تكلّف 160 مضروبًا في 0.03 دولار، أي 4.80 دولار، بالسعر القياسي لـ3.1 Flash، و2.40 دولار في الوضع الدفعي. ولو رفعت العدد إلى 100 درس، تصل إلى 24.00 دولار بالسعر القياسي أو 12.00 دولار دفعيًا. وإعادة تسجيل درس واحد بعد تعديل النص تكلّف حوالي 24 سنتًا، وهذه هي الميزة الحقيقية: تعديل الصوت يتوقف عن كونه مشكلة في الجدولة.

💡 قاعدة تقريبية للميزانية. اضرب عدد دقائق الصوت النهائي في 0.03 دولار للسعر القياسي لـ3.1 Flash، ونصف هذا المبلغ للوضع الدفعي. هذه الأسعار مأخوذة من نماذج تجريبية، لذا أعد التحقق منها عند التوسّع.

استدعاء API الخاص بـ Gemini TTS

مع Python SDK، يكون طلب تحويل النص إلى كلام استدعاءً عاديًا لـgenerate_content مع تغييرين: استجابة صوتية، وإعداد للكلام يسمّي الصوت.

لقطة من فوق الكتف لمطوّر يكتب بجانب شاشة عليها محرر أكواد داكن

مثال Python بسيط

from google import genai
from google.genai import types
import wave

client = genai.Client()  # reads your credentials from the environment

response = client.models.generate_content(
    model="gemini-3.1-flash-tts-preview",
    contents="Say warmly: Welcome back. Today we compare three voices.",
    config=types.GenerateContentConfig(
        response_modalities=["AUDIO"],
        speech_config=types.SpeechConfig(
            voice_config=types.VoiceConfig(
                prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Kore")
            )
        ),
    ),
)

pcm = response.candidates[0].content.parts[0].inline_data.data

with wave.open("welcome.wav", "wb") as f:
    f.setnchannels(1)
    f.setsampwidth(2)
    f.setframerate(24000)
    f.writeframes(pcm)

بعض التفاصيل توفّر وقت تصحيح الأخطاء:

  • تبقى بيانات الاعتماد خارج الملف. يقرأ العميل القيم من متغير بيئة، فلا يوجد شيء سرّي في مستودعك.
  • تعليمة الأسلوب جزء من نص الأمر. عبارة "Say warmly:" قبل النص تؤدي الوظيفة نفسها التي يؤديها حقل prompt في Picasso IA.
  • المخرج هو PCM خام. يصل بصيغة صوت 24 kHz، أحادي القناة، 16 بت. وتحوّله وحدة wave إلى ملف WAV قابل للتشغيل، ويحوّل ffmpeg الملف إلى MP3 إذا احتجت ملفات أصغر.
  • أسماء الحقول تتغير في النماذج التجريبية. تحقق من المرجع الحالي لدى Google إذا فشل استدعاء بعد تحديث SDK.

متحدثان في استدعاء واحد

يقبل API حتى متحدثين في طلب واحد. ضع تسميات للأسطر في نصك، مثل "Host:" و"Guest:"، ثم اربط كل تسمية بصوت في إعداد الكلام. هذا طريق سريع إلى حوار على طريقة البودكاست أو أسئلة شائعة بصوتين. اقرن صوتًا حازمًا بآخر حيوي حتى يميّز المستمعون تبادل الأدوار دون صور. أما لثلاثة متحدثين أو أكثر، فولّد أسطر كل متحدث على حدة، ثم ادمجها في محرر صوتي.

للنصوص الطويلة، قسّمها حسب الفقرة، وأرسل الأجزاء واحدًا تلو الآخر، واحفظ كل نتيجة في الذاكرة المؤقتة. بهذا يكلّفك الطلب الفاشل فقرة واحدة، لا الفصل كله. وغالبًا ما تحمل النماذج التجريبية حدود استخدام أضيق من النماذج المستقرة، لذا غلّف الاستدعاءات بإعادة محاولة مع تأخير أُسّي متزايد. وسجّل الصوت ورمز اللغة وقيمة تجزئة للنص بجانب كل ملف، وستتمكن من إعادة توليد أي مقطع لاحقًا بالإعدادات نفسها.

جرّب Gemini TTS في متصفحك

إذا كنت تحتاج إلى عدد قليل من المقاطع فقط، فتجاوز الكود. تقدّم صفحة النموذج على Picasso IA Gemini 3.1 Flash TTS بوصفه متاحًا للتجربة مجانًا عبر الإنترنت دون أي إعداد، وكل حقل يطابق خيارات API المذكورة أعلاه.

صانع محتوى يكتب نصًا على حاسوب محمول في مساحة عمل مضيئة وسماعات حول رقبته

خطوة بخطوة في المتصفح

  1. افتح صفحة Gemini 3.1 Flash TTS على Picasso IA.
  2. الصق نصك في حقل Text. الحد الأقصى 4,000 بايت، وهذا يكفي لشرح قصير. الحد يُحسب بالبايت لا بالحروف، لذا تتسع النصوص اليابانية أو العربية أحرفًا أقل مقارنةً بالإنجليزية.
  3. اختر Voice. ابدأ بالصوت Kore، ثم جرّب صوتين آخرين.
  4. اضبط Language code الذي يطابق لغة نصك، مثل es-MX للإسبانية المكسيكية.
  5. اكتب Prompt يصف النبرة والإيقاع، أو اترك الافتراضي "Say the following." لقراءة محايدة.
  6. أضف وسومًا مثل [whispering] حيث تريد انفعالًا، ثم اضغط على التوليد ونزّل الصوت.
  7. للمقاطع الأطول، قسّم النص حسب القسم، ثم ادمج الملفات لاحقًا.

إعدادات تستحق التغيير

الحقلالافتراضينصيحة
Textلا شيءحتى 4,000 بايت. استخدم الوسوم باعتدال
VoiceKore30 خيارًا. جرّب ثلاثة قبل الاختيار
PromptSay the following.حتى 4,000 بايت. حدد النبرة والإيقاع واللهجة
Language codeen-USطابق اللغة التي كُتب بها النص

💡 القراءة المسطحة غالبًا تعني تعليمة قصيرة. طوّل التعليمة لا النص. حدد من يتكلم، ومع من، ولماذا، وسيأتي الإيقاع والتشديد غالبًا تبعًا لذلك.

اقرنه بالموسيقى والنصوص المكتوبة

الكلام نادرًا ما يكون المشروع كله. لخلفية موسيقية، جرّب Lyria 3 أو Music 2.6 وامزجها بهدوء تحت السرد. ولإنشاء التسميات التوضيحية، شغّل الصوت عبر Gemini 3 Pro أو GPT 4o Transcribe.

صحفي بنظارة دائرية ينسخ مقابلة على طاولة مقهى بجانب حاسوب محمول وجهاز تسجيل

النسخ النصي يعمل أيضًا كفحص للجودة. انسخ السرد الذي ولّدته، وقارنه بالنص الأصلي. تظهر أسماء المنتجات المنطوقة بشكل خاطئ والكلمات المتروكة كاختلافات نصية قبل أن يشكو المستمع بوقت طويل.

أنشئ أول تعليق صوتي لك

يستحق Gemini TTS مكانه في عدد من المهام: سرد عروض المنتجات، ومقدمات البودكاست وقراءات الإعلانات، والنسخ الصوتية للمقالات والنشرات الإخبارية، وفيديوهات التدريب ذات النبرة المتسقة، والمسارات متعددة اللغات المبنية من نص واحد. إذا احتاج مشروعك إلى صوت مختلف، فثلاثة نماذج أخرى في الفئة نفسها تستحق التجربة: MiniMax Speech 2.8 HD للتعليقات الصوتية بجودة الاستوديو، وElevenLabs V3 للسرد الطبيعي، وInworld Realtime TTS 2 عندما تكون سرعة الاستجابة هي الأهم. وقيد آخر يستحق المعرفة: يعمل كل من API وصفحة Picasso IA مع الأصوات الثلاثين الجاهزة فقط. وإذا احتجت إلى صوت يشبهك أو يشبه علامتك التجارية، فجرّب MiniMax Voice Cloning أو Qwen3 TTS بدلًا من ذلك.

امرأة ترتدي كارديغان خردلي تستمع إلى كتاب صوتي في ركن قراءة بجوار نافذة تهطل عليها الأمطار

أسرع طريقة لحسم مسألة الصوت هي سماعه. خذ فقرة واحدة من مشروعك، وافتح Gemini 3.1 Flash TTS على Picasso IA، وولّدها بثلاثة أصوات. أضف وسمًا واحدًا من [whispering]، وغيّر رمز اللغة لترى كيف يبدو نصك في سوق ثانية، وقارن المقاطع جنبًا إلى جنب. خلال عشر دقائق ستعرف أي الأصوات يناسبك، ويمكنك تجربة سير العمل نفسه مع نماذج الموسيقى والنسخ النصي على Picasso IA كلما كبر المشروع.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة