مقارنة واجهات API للصوت الفوري: أسعار OpenAI وGemini وGrok

تُحتسب واجهات API للصوت الفوري بالتوكنات أو بالدقيقة، والفرق بينهما كبير. يقارن هذا التحليل أسعار OpenAI gpt-realtime-2.1 وGoogle Gemini 3.8 Live وxAI Grok Voice جنبًا إلى جنب، مع مثال لدقيقة واحدة وميزانيات 10,000 و100,000 دقيقة، والتكاليف الخفية التي ترفع الفواتير.

مقارنة واجهات API للصوت الفوري: أسعار OpenAI وGemini وGrok
Cristian Da Conceicao
مؤسس Picasso IA

يقدّم ثلاثة مزوّدين الآن نماذج تحويل الكلام إلى كلام عبر اتصال مباشر، وهم يحتسبون الكلفة بثلاث طرق مختلفة. تحتسب OpenAI توكنات الصوت. وتحتسب Google توكنات الصوت أيضًا، لكنها تنشر معادلًا بالدقيقة. أما xAI فتتجاوز التوكنات، وتفرض سعرًا ثابتًا عن كل دقيقة يبقى فيها الاتصال مفتوحًا. هذا الفرق وحده يجعل مقارنة الأسعار المعلنة مضللة. قد يكلّف مساعد صوتي سنتًا واحدًا للدقيقة في جدول بيانات عشرة أضعاف ذلك، عندما تدخل المحادثات الفعلية والسياق المتنامي واستدعاءات الأدوات إلى الصورة.

يضع هذا التفصيل ثلاث واجهات API للصوت الفوري على قدم المساواة. ستحصل على الأسعار المنشورة كما تم التحقق منها في 8 أكتوبر 2026، ومثال محسوب لدقيقة واحدة، وميزانية شهرية لـ 10,000 و100,000 دقيقة، والتكاليف الخفية التي تغيّر الفاتورة بعد الإطلاق. وفي الختام طريقة رخيصة لتجربة الأصوات والموسيقى والنصوص المفرّغة على PicassoIA قبل أن تلتزم بأي من الثلاثة.

يد مطوّر بجانب آلة حاسبة وإيصال مطبوع على مكتب خشبي

أسعار OpenAI Realtime

أُطلقت التشكيلة الحالية من OpenAI في 6 يوليو 2026، وتضم gpt-realtime-2.1 وgpt-realtime-2.1-mini. يضيف كلاهما جهد استدلال قابلًا للضبط فوق تحويل الكلام إلى كلام، إضافةً إلى معالجة أفضل للسلاسل الأبجدية الرقمية والصمت والضوضاء الخلفية والمقاطعات. وأعلنت OpenAI أيضًا انخفاض زمن الاستجابة عند المئين 95 (p95) بنسبة 25% على الأقل عبر نماذج Realtime الخاصة بها، بفضل تحسين التخزين المؤقت.

أسعار gpt-realtime-2.1

جميع الأسعار لكل مليون توكن.

نوع التوكنالإدخالالإدخال المخزّن مؤقتًاالإخراج
نص$4.00$0.40$24.00
صوت$32.00$0.40$64.00

يُحتسب إدخال الصور بسعر $5.00 لكل مليون توكن. يحمل gpt-realtime-2 السابق أسعارًا مطابقة، بينما يحتفظ gpt-realtime-1.5 وgpt-realtime الأصلي بالأسعار نفسها للصوت، لكنهما يفرضان $16.00 لكل مليون توكن إخراج نصي. جاء الارتفاع إلى $24.00 مع خط 2.x القادر على التفكير.

البديل الأصغر

gpt-realtime-2.1-mini يكلّف نحو ثلث سعر النموذج الرائد في الصوت.

نوع التوكنالإدخالالإدخال المخزّن مؤقتًاالإخراج
نص$0.60$0.06$2.40
صوت$10.00$0.30$20.00

يُخفَّض سعر إدخال الصور إلى $0.80 لكل مليون توكن. وجد قياس منشور لنحو 4,000 جلسة حقيقية على النموذج الأصغر أن المساعد النموذجي يقع عادةً بين $0.05 و$0.08 لكل دقيقة، بينما وصلت المكالمات الكثيفة للأسئلة والأجوبة إلى ما بين $0.12 و$0.15.

خصم الصوت المخزّن مؤقتًا

أرخص بند في قائمة أسعار OpenAI هو إدخال الصوت المخزّن مؤقتًا: $0.40 بدلًا من $32.00 في النموذج الرائد، أي خفض بنحو 99%. يكافئ التخزين المؤقت البادئة الثابتة، أي أمر النظام والأدوار السابقة في المحادثة. أي شيء يغيّر بداية السياق يكسر الخصم. وجد القياس نفسه أن حقن نتائج استرجاع جديدة في منتصف المكالمة يعيد ضبط الذاكرة المؤقتة، ويكلّف كل حدث نحو $0.007 إلى $0.009.

وكيل دعم عملاء في مركز اتصال يتحدث إلى متصل عبر سماعة رأس

أسعار Gemini Live

تبيع Google نماذج الصوت الفوري عبر Live API، وقائمة أسعارها هي الأسهل قراءةً لأنها تنشر معدل التوكنات ورقمًا بالدقيقة معًا.

أسعار Gemini 3.8 Live

يتشارك gemini-3.8-live وgemini-3.8-live-extended-thinking قائمة أسعار واحدة في الباقة المدفوعة.

النوعلكل مليون توكنلكل دقيقة
إدخال نص$0.75غير متاح
إدخال الصوت$3.00$0.005
إدخال الصور أو الفيديو$1.00$0.002
إخراج النص$4.50غير متاح
إخراج الصوت$12.00$0.018

يتطابق العمودان عند 25 توكنًا صوتيًا في الثانية، لذا يمكنك تقدير الميزانية حسب الزمن أو حسب التوكنات والوصول إلى الرقم نفسه. دقيقة من حديث المساعد تكلّف $0.018، ودقيقة من حديث المتصل تكلّف نصف سنت.

💡 نصيحة: Google هي الوحيدة من بين الثلاثة التي تنشر معادلًا بالدقيقة لاحتساب التوكنات. إذا أراد فريق المالية سعرًا لكل دقيقة مكالمة، فإن Gemini يقدّمه لك دون أي تحويل.

شخصان من الزملاء يتشاركان حاسوبًا محمولًا وهاتفًا على طاولة عمل مشرقة

الطبقة المجانية ونماذج الترجمة

توجد طبقة مجانية لنماذج Live، ما يجعل Gemini المكان الطبيعي لتجربة النموذج دون تكلفة قبل الانتقال إلى الباقة المدفوعة. هناك نموذجان آخران في الصفحة نفسها يستحقان المعرفة:

  • Gemini 3.5 Live Translate (نسخة معاينة): ترجمة من كلام إلى كلام عبر أكثر من 70 لغة، بسعر $3.50 لكل مليون توكن إدخال ($0.0053 لكل دقيقة) و$21.00 لكل مليون توكن إخراج ($0.0315 لكل دقيقة).
  • Gemini 3.5 Transcribe Live: تحويل مستمر للكلام إلى نص، بسعر $3.50 لكل مليون توكن إدخال ($0.005 لكل دقيقة) و$21.00 لكل مليون توكن إخراج نصي ($0.004 لكل دقيقة).

ما زال نموذج المعاينة الأقدم Gemini 2.5 Flash Native Audio مدرجًا، بسعر $3.00 لكل مليون توكن إدخال صوتي و$12.00 لكل مليون توكن إخراج صوتي.

أسعار Grok Voice

اتخذت xAI النهج المعاكس. لا توجد توكنات صوتية تُعدّ، بل دقائق فقط.

سعر ثابت للدقيقة

تشغّل Voice Agent API النموذج grok-voice-think-fast-2.0، ويمكن الوصول إليه أيضًا عبر الاسم المستعار grok-voice-latest. تدرج صفحة أسعار xAI سعره عند $0.08 لكل دقيقة، أو $4.80 لكل ساعة. ذكرت تقارير الإطلاق المبكرة سعر $0.05 لكل دقيقة، لذا تحقق من الصفحة المباشرة قبل أن تبني توقعاتك على أي من الرقمين.

تُحتسب الفوترة وفق زمن الاتصال. دقيقة من الصمت تكلّف مثل دقيقة من الكلام، ولا يوجد سياق يُعاد احتسابه في كل دور. بالنسبة إلى فريق يخشى الفواتير المفاجئة، فإن هذا القدر من التوقع هو الميزة الأساسية. بنود ذات صلة من الصفحة نفسها:

  • تحويل الكلام إلى نص: $0.10 لكل ساعة عبر REST، و$0.20 لكل ساعة للبث المباشر.
  • تحويل النص إلى كلام: $15.00 لكل مليون حرف.

الأصوات واللغات وتوجيه المكالمات

تدعم API أكثر من 20 لغة بلهجات بجودة الناطقين الأصليين، ويشترك منتجا تحويل الكلام إلى كلام وتحويل النص إلى كلام في قائمة الأصوات نفسها. ويمكنك أيضًا إنشاء أصوات مخصصة من مقطع صوتي مرجعي. ويشمل دعم الأدوات استدعاء الدوال، والبحث في الملفات، والبحث على الويب، والبحث على X، وخوادم MCP البعيدة.

أما الاتصالات الهاتفية، فتوثّق xAI تكامل SIP مع دعم G.711 الأصلي، موجّهًا إلى حركة PSTN ومراكز الاتصال وPBX. وتضيف مقالات من جهات خارجية بعض الأرقام التي لم تؤكدها صفحة الأسعار عند تحققي منها: جلسات محدودة بمدة 30 دقيقة، و100 جلسة متزامنة لكل فريق، ورسوم قدرها $5 لكل 1,000 مكالمة بحث على الويب وX، ورسوم إضافية بقيمة $0.01 لكل دقيقة لرقم هاتف مخصص. تعامل مع هذه الأرقام على أنها مُبلَّغ عنها، لا مضمونة.

امرأة ترتدي سترة مطر وهي تتحدث إلى هاتفها الذكي أثناء سيرها في شارع مدينة

جدول التكلفة جنبًا إلى جنب

تحتاج وحدات الفوترة المختلفة إلى سيناريو مشترك واحد. السيناريو أدناه بسيط عن قصد.

دقيقة واحدة من الحديث

الافتراضات: في نافذة مدتها 60 ثانية يتحدث المتصل لمدة 25 ثانية، ويتحدث المساعد لمدة 25 ثانية. يُحتسب صوت OpenAI بنحو 100 توكن في الثانية، وهو المعدل الذي رُصد في قياس الجلسات الحقيقية المذكور سابقًا. ويُحتسب صوت Gemini بمعدله المنشور البالغ 25 توكنًا في الثانية. تُحتسب Grok وفق زمن الاتصال. لا يشمل الحساب النص والأدوات والسياق المتنامي، وذلك عن قصد.

API والنموذجوحدة الفوترةالتكلفة لكل دقيقة
OpenAI gpt-realtime-2.1توكنات الصوتحوالي $0.240
OpenAI gpt-realtime-2.1-miniتوكنات الصوتحوالي $0.075
Gemini 3.8 Liveتوكنات الصوتحوالي $0.010
Grok grok-voice-think-fast-2.0زمن الاتصال$0.080

الحساب للنموذج الرائد هو 2,500 توكن إدخال بسعر $32.00 لكل مليون ($0.080)، زائد 2,500 توكن إخراج بسعر $64.00 لكل مليون ($0.160). النموذج الأصغر هو المجموع نفسه بسعري $10.00 و$20.00. أما Gemini فيعادل 0.4167 من الدقيقة من صوت المتصل بسعر $0.005، زائد 0.4167 من الدقيقة من صوت المساعد بسعر $0.018.

على الصوت وحده، يكون Gemini أرخص بنحو 25 مرة من gpt-realtime-2.1، وأرخص بنحو 8 مرات من كل من النموذج الأصغر وGrok.

💡 اقرأ هذا الجدول كحدّ أدنى. يسعّر الجدول الصوت فقط. تضيف الجلسات الفعلية توكنات النص والاستدلال واستدعاءات الأدوات وسجل المحادثة، وهذا ما يفصّله القسم التالي.

10,000 دقيقة شهريًا

عند توسيع ذلك الحد الأدنى إلى حجم عمل حقيقي، يظهر الموضع الذي يتغيّر فيه نقاش الميزانية.

API والنموذج10,000 دقيقة100,000 دقيقة
OpenAI gpt-realtime-2.1$2,400$24,000
OpenAI gpt-realtime-2.1-mini$750$7,500
Gemini 3.8 Liveحوالي $96حوالي $960
Grok grok-voice-think-fast-2.0$800$8,000

عند 10,000 دقيقة يتجاوز الفرق بين أرخص خيار وأغلاه أكثر من $2,300 شهريًا، وعند 100,000 دقيقة يتجاوز $23,000. عند حجم أقل، سيختار معظم الفرق على أساس الجودة والميزات بدلًا من السعر.

ثلاثة أكواب خزفية بيضاء بجانب أكوام من العملات بارتفاعات مختلفة على منضدة مطبخ

التكاليف الخفية التي ترفع الفواتير

تنتهي الأخبار الجيدة عند الحد الأدنى في الجدول. هناك أربعة أمور تدفع الفواتير الحقيقية فوقه.

السياق يتراكم

مع احتساب التوكنات، قد يعيد كل دور إرسال المحادثة حتى تلك اللحظة. عند الدور العشرين تدفع مجددًا ثمن 19 تبادلًا سابقًا، إلا إذا امتص التخزين المؤقت أو تقليم السجل هذه التكلفة. في قياس 4,000 جلسة، نمت مكالمة واحدة بلا تقليم إلى 480,000 توكن، وكلّفت $2.05 لجلسة واحدة. ويهيمن إخراج الصوت أيضًا على الفاتورة، بنحو 80% من الإنفاق على النموذج الأصغر.

ثلاث عادات تُبقي هذا تحت السيطرة:

  1. حدّد طول الرد. الإجابات الأقصر تخفض الإنفاق بنسبة 20% إلى 40%.
  2. قلّم السجل. لخّص الأدوار القديمة بدلًا من إعادة تشغيلها.
  3. حافظ على ثبات البادئة. في OpenAI هذا هو الفرق بين $32.00 و$0.40 لكل مليون توكن إدخال صوتي.

يتجنب السعر الثابت في Grok الخيارين الأولين تمامًا، وهذه أقوى حجة له في المكالمات الطويلة.

توكنات الأدوات والاستدلال

تتيح لك نماذج 2.1 من OpenAI ضبط جهد الاستدلال. يحسّن الجهد الأعلى أدوار استخدام الأدوات الصعبة، لكنه يضيف توكنات إخراج وزمن استجابة، ويكلّف إخراج النص الآن $24.00 لكل مليون. استخدم الجهد المنخفض للمكالمات الشبيهة بالأسئلة الشائعة، ولا تنفق على الاستدلال إلا حيث يكلّف الجواب الخاطئ أكثر من بضعة سنتات.

تضيف استدعاءات الأدوات بنودها الخاصة. يمكن للاسترجاع المحقون في منتصف المكالمة أن يعيد ضبط التخزين المؤقت، وتُحتسب استدعاءات البحث بشكل منفصل على Grok، وتضيف أرقام الهواتف رسومًا لكل دقيقة في إعدادات الاتصالات الهاتفية. إذا عرضت على عميل سعرًا لوكيل صوتي، فيشير القياس أعلاه إلى $0.15 إلى $0.20 لكل دقيقة للنموذج الأصغر، لكي يصمد أمام أسوأ الجلسات.

يد تمسك إيصالًا ورقيًا طويلًا ينثني عند حافة منضدة خشبية

أي API يناسب منتجك

السعر عامل واحد من بين عدة عوامل. يعتمد الخيار الصحيح على مدة المكالمات وعددها وما الذي تكلّفه الغلطة.

وكلاء الهاتف

حركة مراكز الاتصال تعني مكالمات طويلة وتوجيه SIP وفريقًا ماليًا يكره التقلب. تجعل فوترة زمن الاتصال في Grok ودعم SIP الموثّق الفاتورة سهلة التوقع. إذا كانت المكالمات تحتاج استدلالًا مكثفًا واستخدامًا للأدوات، مثل إعادة الحجز أو تغيير الطلبات أو فحص الحسابات، فإن gpt-realtime-2.1 هو الخيار المبني حول الاستدلال القابل للضبط، ودقيقة بسعر $0.24 قد تظل أفضل من مكالمة فاشلة.

المساعدات داخل التطبيقات

بالنسبة إلى التطبيقات الاستهلاكية ذات الحجم الهائل والأدوار القصيرة، يتفوّق Gemini 3.8 Live في الكلفة بفارق كبير، وتزيل طبقته المجانية العوائق في مرحلة النموذج الأولي. أما gpt-realtime-2.1-mini فيقع في المنتصف: أرخص بثلاث مرات من النموذج الرائد، مع هيكل API نفسه.

الموقفالأنسبالسبب
ملايين الأدوار الصوتية القصيرةGemini 3.8 Liveأدنى أسعار الصوت، ومعدلات الدقيقة منشورة
مكالمات دعم طويلة عبر SIPGrok Voice Agentسعر ثابت $0.08 لكل دقيقة، دون إعادة احتساب السياق
مكالمات معقدة كثيفة الأدواتgpt-realtime-2.1جهد استدلال قابل للضبط
توازن بين التكلفة والجودةgpt-realtime-2.1-miniثلث سعر صوت النموذج الرائد
نموذج أولي بميزانية صفريةالطبقة المجانية في Geminiلا رسوم أثناء الاختبار

صاحب مخبز يرد على هاتف أرضي بينما يعبّئ المعجنات على منضدة المتجر

جرّب الأصوات قبل أن تدفع

تبدأ الفوترة في واجهة API الفورية من أول ثانية صوت، لذا اضبط الصوت والنص والنبرة في مكان أرخص أولًا. يعرض PicassoIA 24 نموذجًا لتحويل النص إلى كلام، بينها أصوات من المزوّدين أنفسهم الذين تقارنهم: Gemini 3.1 Flash TTS وGrok Text To Speech. وللاختبارات التي تركّز على زمن الاستجابة، هناك أيضًا Inworld Realtime TTS 2، وRealtime TTS 1.5 Mini بزمن تركيب 120ms، وRealtime TTS 1.5 Max بزمن إخراج دون 200ms.

كيفية استخدام Gemini 3.1 Flash TTS

Gemini 3.1 Flash TTS يوفّر 30 صوتًا عبر أكثر من 70 لغة، وهو نطاق كافٍ لتجربة صوت علامة تجارية في بضع دقائق.

  1. افتح صفحة النموذج وسجّل الدخول إلى PicassoIA.
  2. الصق النص. اكتب كما يتكلم الناس: جمل قصيرة، وصيغ مختصرة، وفكرة واحدة في كل سطر.
  3. اختر صوتًا من القائمة المكوّنة من 30 صوتًا، واضبط لغة النص.
  4. ولّد واستمع. تحقق من الأرقام والأسماء وعناوين البريد الإلكتروني، فهي السلاسل نفسها التي تربك الوكلاء الحيين.
  5. كرّر النص نفسه في Grok Text To Speech وقارن النبرة جنبًا إلى جنب.
  6. حمّل الصوت الذي تفضّله وشاركه مع فريقك قبل كتابة أي شيفرة.

💡 نصيحة: احتفظ بنص اختبار ثابت من 5 إلى 6 أسطر يتضمن رقم هاتف وسعرًا واسم علم. استخدام الأسطر نفسها في كل مرة يجعل مقارنات الأصوات عادلة.

بودكاستر يرتدي سماعات استوديو وهو جالس إلى مكتب مع ميكروفون مكثف

الموسيقى والنصوص المفرّغة تكمّل الصورة

نادرًا ما يحتاج منتج صوتي إلى الكلام وحده. لموسيقى الانتظار أو مقدمة الجينغل أو خلفية صوتية للعلامة التجارية، ينشئ Lyria 3 وMusic 2.6 مقطوعات أصلية من أمر نصي. وفي الاتجاه المعاكس، تحوّل GPT 4o Transcribe وGPT 4o Mini Transcribe وGemini 3 Pro تسجيلات المكالمات التجريبية إلى نص، فتقرأ ما قاله الوكيل فعلًا بدلًا من إعادة تشغيل التسجيل.

موسيقي شاب يعزف على وحدة تحكم موسيقية مدمجة في استوديو منزلي صغير

ابنِ عرض الصوت الخاص بك

ستتغير الأرقام أعلاه، لذا أعد حساب دقيقة واحدة بمدة مكالماتك ونسبة حديثك أنت قبل أن توافق على أي مزوّد. ابدأ العمل من الجانب الإبداعي اليوم: اكتب نصًا، وولّد صوتًا، وأضف خلفية موسيقية، ثم فرّغ النتيجة واقرأها. كل ذلك يعمل على PicassoIA دون كتابة سطر واحد من كود التكامل.

اختر نموذج صوت، والصق نصًا، واستمع إلى كيفية صوت كل خيار قبل أن تصل أول فاتورة. وعندما تكون مستعدًا لمزيد، تصفّح كل النماذج على PicassoIA، وواصل التجربة مع الأصوات والموسيقى والنصوص المفرّغة والصور حتى يبدو العرض كما تريد أن يبدو منتجك.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة