تسعير واجهة Speech to Text API: مقارنة أرخص واجهات API للتفريغ النصي للكلام

مقارنة جنبًا إلى جنب لأسعار Speech to Text API، مع تحويل كل سعر إلى تكلفة بالساعة، من $0.04 إلى $1.44. اطّلع على الفواتير الشهرية عند 100 و1,000 ساعة صوت، ورسوم الإضافات التي تضخّم الفواتير، وكيف تختبر الدقة على تسجيلاتك الخاصة أولًا.

تسعير واجهة Speech to Text API: مقارنة أرخص واجهات API للتفريغ النصي للكلام
Cristian Da Conceicao
مؤسس Picasso IA

يمكن أن تكلّف ساعة واحدة من الصوت $0.04 لتفريغها نصيًا على إحدى واجهات Speech to Text API، و**$1.44** على واجهة أخرى. التسجيل نفسه، والكلمات نفسها، وفجوة في الفاتورة بمقدار 36 ضعفًا. هذا التفاوت هو سبب أن أسعار Speech to Text API تستحق مقارنة جنبًا إلى جنب قبل أن تدمج أي شيء في بيئة الإنتاج. يحوّل هذا المقال كل سعر إلى الوحدة نفسها، ويرتّب أرخص واجهات التفريغ النصي، ويعرض تكلفة كل منها عند 100 ساعة صوت و1,000 ساعة شهريًا. ستطّلع أيضًا على الرسوم الإضافية التي تضاعف الفاتورة بهدوء، وعلى النماذج منخفضة السعر التي تفقد الدقة، وكيف تختبر ثلاثة نماذج تفريغ على PicassoIA دون كتابة سطر برمجي واحد.

💡 كل سعر وارد أدناه هو سعر معلن للدفع حسب الاستخدام من المزوّد، وليس سعرًا من PicassoIA. تُعدّل المزوّدات أسعارها كثيرًا، لذا تحقّق من الرقم الحالي في صفحة الأسعار لدى المزوّد قبل الالتزام.

التكلفة الفعلية للتفريغ النصي

تقريبًا كل مزوّد يفرض رسومه على مدة الصوت، لا على عدد الكلمات أو حجم الملف. يبدو هذا بسيطًا حتى تقارن العروض. بعض المزوّدات تنشر الأسعار بالدولار للدقيقة، وأخرى بالدولار للساعة، وقلة منها تخفي الرقم المفيد وراء قاعدة فوترة. المهمة الأولى هي وضع كل شيء في وحدة واحدة.

الأسعار بالدقيقة مقابل الأسعار بالساعة

ساعة إيقاف من الفولاذ المصقول بجانب سماعات استوديو على مكتب من خشب البلوط الداكن

التحويل عملية حسابية بسيطة: اضرب السعر بالدقيقة في 60 للحصول على التكلفة بالساعة. سعر قدره $0.003 للدقيقة يساوي $0.18 للساعة، وسعر قدره $0.024 للدقيقة يساوي $1.44 للساعة. يختار المزوّدون الوحدة التي تجعل الرقم يبدو أصغر، لذا أجرِ التحويل بنفسك قبل أي مقارنة.

عند الحجم تبدأ الكسور العشرية في إيلام الميزانية. سعر يبدو $0.0025 للدقيقة لا يعني شيئًا حتى تلاحظ أن أرشيفًا من 500 ساعة يساوي 30,000 دقيقة، وأن الأرشيف نفسه يكلّف $75 لدى مزوّد و$720 لدى آخر.

الفرق بين الدفعات والبث المباشر

تفريغ ملف مكتمل، وهو ما يُسمّى الدفعات (batch) أو المسجّل مسبقًا (pre-recorded)، هو الطريق الأرخص. أما التفريغ المباشر (streaming) فيكلّف أكثر لأن المزوّد يجب أن يُبقي سعة GPU مفتوحة أثناء حديثك. والفرق ليس صغيرًا:

  • AssemblyAI تفرض $0.15 للساعة على الدفعات باستخدام Universal-2، و$0.45 للساعة على نموذج Universal-3.5 Pro للتفريغ المباشر.
  • Deepgram تسعّر Nova-3 بنحو $0.0043 للدقيقة للصوت المسجّل مسبقًا، وبنحو $0.0077 للدقيقة للبث المباشر، مع عرض ترويجي مؤقت للبث المباشر قرب $0.0048.
  • Google Cloud ينخفض إلى نحو $0.003 إلى $0.004 للدقيقة في وضع الدفعات الديناميكي المخفّض، مقابل $0.016 للدقيقة لطلبات الوقت الفعلي القياسية.

إذا كنت تفرّغ تسجيلات بعد وقوعها، فلا تدفع أبدًا أسعار البث المباشر. ارفع الملف وانتظر بضع ثوانٍ. احتفظ بالبث المباشر للتسميات النصية الحية، ووكلاء الصوت، وأي حالة ينتظر فيها شخص الكلمات في الوقت الفعلي.

جدول أسعار Speech to Text API

إليك كل خيار رئيسي محوّلًا إلى الوحدتين نفسيهما ومرتّبًا من الأرخص إلى الأغلى. الأسعار للشريحة الأولى من الاستخدام، باللغة الإنجليزية، دون إضافات.

المزوّد والنموذجفي الساعةفي الدقيقةالأنسب لـ
Groq Whisper Large v3 Turbo$0.04~$0.0007الأعمال المتراكمة الضخمة، السرعة الخام
AssemblyAI Universal-2$0.15$0.0025معالجة دفعية منخفضة التكلفة مع ميزات إضافية
GPT-4o Mini Transcribe$0.18$0.003الاستخدام العام، الميزانيات المحدودة
AssemblyAI Universal-3.5 Pro$0.21$0.0035الصوت الصعب بتكلفة منخفضة
Deepgram Nova-3 (للتسجيلات المسبقة)~$0.26~$0.0043أدوات المطورين، الأحجام الكبيرة
GPT-4o Transcribe$0.36$0.006اللهجات والصوت غير الواضح
Google Cloud Speech-to-Text V2$0.96$0.016الجهات التي تعتمد على Google Cloud
Azure Speech (القياسي)$1.00~$0.0167منظومة Microsoft
AWS Transcribe (الشريحة 1)$1.44$0.024مسارات العمل المبنية على AWS

💡 يبلغ سعر Whisper large v3 في واجهة OpenAI البرمجية الخاصة بها $0.006 للدقيقة، وهو السعر نفسه الذي تتقاضاه GPT-4o Transcribe. عندما يكون السعر متطابقًا، يكون النموذج الأحدث هو الاختيار الأكثر أمانًا للهجات والضوضاء في الخلفية.

أرخص الخيارات تحت $0.25 للساعة

طالب جامعي بسماعات أذن يدرس على طاولة في المكتبة

أربعة خيارات تقع دون ربع دولار للساعة من الصوت. Groq هو الاستثناء: نموذج Whisper Large v3 Turbo المستضاف بسعر $0.04 للساعة يعمل أسرع من الزمن الفعلي بمئات المرات، فتنتهي ساعة الصوت في أقل بكثير من دقيقة. المقابل هو مجموعة ميزات أخف، بميزات مدمجة أقل من المزوّدين المتخصصين.

AssemblyAI Universal-2 بسعر $0.15 للساعة هو أرخص خيار يأتي مع مجموعة كاملة من الميزات الاختيارية، ويضيف نموذج Universal-3.5 Pro دقة أعلى مقابل $0.06 إضافية للساعة. يبلغ سعر GPT-4o Mini Transcribe $0.18 للساعة، وهو الخيار الأمثل للطلاب وصنّاع المحتوى الفرديين والفرق الصغيرة الذين يريدون دقة قوية دون إدارة عدد كبير من حسابات المزوّدين.

السحابات الكبرى أغلى

ممر طويل في مركز بيانات تصطف على جانبيه رفوف خوادم سوداء

تفرض Google Cloud و Azure و AWS ما بين $0.96 و$1.44 للساعة مقابل التفريغ القياسي. وهذا يعادل من 6 إلى 36 ضعفًا من سعر الشريحة الاقتصادية. أنت لا تدفع مقابل كلمات أفضل. أنت تدفع مقابل شهادات الامتثال، وإقامة البيانات في منطقة محددة، وتسجيل الدخول الموحّد، وراحة فاتورة واحدة موجودة أصلًا في نظامك المالي.

إذا كانت شركتك تعمل أصلًا على إحدى هذه السحابات، وكان القانون يشترط بقاء الصوت داخلها، فالعلاوة مبرّرة. وإن لم يكن كذلك، فالعلاوة ضريبة على العادة. الاستثناء هو وضع الدفعات المخفّض لدى Google، فهو يعيد التكلفة قرب الشريحة المتوسطة عند نحو $0.18 إلى $0.24 للساعة.

التكلفة الشهرية عند الحجم الفعلي

أسعار الدقيقة تصبح ذات معنى فقط عندما تضربها في حجم عملك. يستخدم هذا الجدول 100 و1,000 ساعة صوت شهريًا، بالأسعار الأساسية فقط.

الخيار100 ساعة شهريًا1,000 ساعة شهريًا
Groq Whisper Large v3 Turbo$4$40
AssemblyAI Universal-2$15$150
GPT-4o Mini Transcribe$18$180
AssemblyAI Universal-3.5 Pro$21$210
Deepgram Nova-3 (للتسجيلات المسبقة)~$26~$258
GPT-4o Transcribe$36$360
Google Cloud V2$96$960
Azure Speech$100$1,000
AWS Transcribe$144$1,440

منتج بودكاست عند 100 ساعة

تخيّل شبكة تنشر 50 حلقة مدة كل منها ساعتان شهريًا. هذا يعني 100 ساعة من الصوت. أرخص خيار يكلّف $4 وأغلاها $144، أي فرق قدره $140 شهريًا. عند هذا الحجم لا تكون الفاتورة هي المشكلة. ساعة واحدة تُقضى في إصلاح نص مفرّغ سيئ تكلّف أكثر من الفاتورة الشهرية كاملة في معظم هذه الخيارات، لذا اختر حسب الدقة وسير العمل أولًا، واستخدم السعر فيصلًا عند التعادل.

أرشيف مكالمات عند 1,000 ساعة

والآن لنكبّر الحجم إلى فريق دعم يسجّل 1,000 ساعة مكالمات شهريًا. تصبح الفجوة بين أرخص خيار وأغلاه 1,400 دولار شهريًا، أو 16,800 دولار سنويًا. الخيارات المتوسطة بين $150 و$360 شهريًا لها الآن أثر حقيقي، وهذا هو النطاق الذي يسدّد فيه اختبار مزوّدين أو ثلاثة على صوتك الخاص ثمنه بنفسه خلال بعد ظهر واحد.

الرسوم المخفية التي تضخّم الفواتير

السعر المعلن هو تفريغ النص الأساسي فقط، ولا شيء غيره. الفواتير الحقيقية تُبنى من السعر الأساسي زائد كل ما تفعّله.

الميزات الإضافية تتراكم

أيدي محاسب تراجع فاتورة مطبوعة بجانب آلة حاسبة

تفرض عادةً رسومًا منفصلة على تسميات المتحدثين، وتصفية الألفاظ النابية، وحجب البيانات الشخصية، واكتشاف اللغة، ووسوم المشاعر، والملخصات. الرسوم النموذجية تبدو كالتالي:

  • تسميات المتحدثين (diarization): نحو $0.02 للساعة في AssemblyAI، وتصل إلى نحو $0.12 للساعة في أماكن أخرى.
  • الحجب: نحو $0.12 للساعة في الأمثلة المنشورة من Deepgram.
  • رسوم الميزات لكل ميزة في Azure: $0.30 للساعة عن كل ميزة من تحديد اللغة، وفصل المتحدثين، وتقييم النطق.

فعّل ثلاثًا أو أربعًا من هذه الميزات، وقد يتضاعف سعر أساسي قدره $0.15 مرة أو أكثر. سعّر دائمًا مجموعة الميزات الدقيقة التي يحتاجها منتجك، لا الرقم المعروض في الواجهة.

💡 الشرائح المجانية تساعدك على الاختبار قبل الدفع. تمنح Deepgram رصيدًا ابتدائيًا بقيمة $200، وتتيح AssemblyAI مخصصات رصيد مجاني، وتتضمن Google 60 دقيقة مجانية شهريًا، وتتضمن AWS 60 دقيقة مجانية شهريًا لمدة السنة الأولى.

قواعد الفوترة لا تقل أهمية عن الإضافات. تحاسب AWS Transcribe بحد أدنى 15 ثانية لكل طلب، لذا فإن تطبيق أوامر صوتية يرسل مقاطع مدتها 3 ثوانٍ يدفع ثمن خمسة أضعاف الصوت الذي يرسله فعليًا. وحدود الرفع مهمة أيضًا: تقبل نقاط النهاية الخاصة بالتفريغ لدى OpenAI ملفات حتى نحو 25 MB، لذا تحتاج التسجيلات الطويلة إلى التقسيم إلى أجزاء، والأجزاء المتداخلة تعني أنك تدفع مرتين عن الثواني المتداخلة.

وقت الهندسة يُحسب أيضًا

مطوّر يعمل على الكود عند مكتب واقف في شقة علوية بجدران من الطوب

توفير $30 شهريًا في التفريغ النصي صفقة سيئة إذا كان المزوّد الأرخص سيكلّف مطوّرك أربع ساعات إضافية. تحقّق من توفر SDK بلغتك، ومن webhooks للمهام المكتملة، وحدود معقولة للمعدل، ورسائل خطأ يمكن التنبؤ بها قبل أن تلتزم. عند تكلفة هندسية بالساعة قدرها $75، تعادل أربع ساعات من معاناة التكامل عشرة أشهر من توفير $30.

الرخيص مقابل الدقيق

السعر بالساعة لا يخبرك بعدد الكلمات الخاطئة التي ستخرج. قد يترك مزوّدان بالسعر نفسه كمية مختلفة جدًا من التنظيف، والتنظيف يُدفع من وقت الإنسان.

أين تتعثر النماذج الرخيصة

صحفي إذاعي يمسك مسجّلًا يدويًا باتجاه حرفي في ورشة

تميل النماذج منخفضة التكلفة إلى التعثر في المواضع نفسها: اللهجات الثقيلة، وشخصان يتحدثان في الوقت نفسه، والتسجيلات الميدانية مع الرياح أو الآلات، وأسماء المنتجات، والاختصارات، والأرقام المنطوقة. كل تعثّر يتحوّل إلى تعديل.

أجرِ الحساب على التعديل. بمعدل $30 للساعة، يكلّف المحرر $0.50 للدقيقة. كل 10 دقائق إضافية من التنظيف لكل ساعة صوت تضيف $5، وهذا أكثر من فاتورة AWS Transcribe كاملة لتلك الساعة. نص يكلّف $0.18 ويحتاج إلى 20 دقيقة من التصحيح أغلى من نص يكلّف $0.36 ويحتاج إلى 5 دقائق.

الاختبار الموثوق الوحيد هو صوتك الخاص. اختر ثلاثة ملفات تمثّل عملك، وشغّل كل منها على ثلاثة نماذج، وعدّ التعديلات التي تجريها. افعل ذلك قبل أن تقرر أي شيء بناءً على مخطط مقارنة الأداء.

الاجتماعات وتسميات المتحدثين

أربعة زملاء حول طاولة اجتماعات مع هاتف مكبّر الصوت

الاجتماعات هي الحالة اليومية الأصعب، لأن النص المفرّغ يكون بلا فائدة دون معرفة من قال ماذا. بعض النماذج تضمّن تسميات المتحدثين في السعر الأساسي، مثل نسخة فصل المتحدثين (diarization) من نموذج التفريغ لدى OpenAI، بينما تفرض أخرى رسومًا عليها كإضافة. عند مقارنة عمل يركّز على الاجتماعات، أضف رسوم فصل المتحدثين إلى كل خيار في القائمة المختصرة، ثم قارن الإجماليات. كثيرًا ما يتوقف أرخص سعر أساسي عن أن يكون أرخص إجمالي.

كيف تستخدم GPT-4o Mini Transcribe

منظر علوي لمكتب استوديو منزلي مرتّب مع حاسوب محمول وسماعات وميكروفون

يستضيف PicassoIA ثلاثة نماذج لتحويل الكلام إلى نص يمكنك تجربتها مباشرة من المتصفح: GPT-4o Mini Transcribe، و GPT-4o Transcribe، و Gemini 3 Pro. وهذا يجعله طريقة سريعة لتنفيذ اختبار الملفات الثلاثة من القسم السابق قبل أن تفتح أي حساب لدى مزوّد.

الإعداد خطوة بخطوة

  1. افتح صفحة GPT-4o Mini Transcribe على PicassoIA.
  2. ارفع ملف صوت قصيرًا، ويفضّل أن يكون مقطعًا مدته من 3 إلى 5 دقائق يتضمن أصعب مادتك: الأسماء والأرقام والأصوات المتداخلة.
  3. إذا كان النموذج يعرض حقل اللغة، فاضبطه بدلًا من ترك النموذج يخمّن.
  4. أضف أمرًا نصيًا قصيرًا يتضمن الأسماء غير المألوفة أو المصطلحات المتخصصة إذا كان حقل الأمر النصي متاحًا.
  5. شغّل التفريغ واقرأ الناتج مقابل الصوت.
  6. كرّر العملية باستخدام GPT-4o Transcribe و Gemini 3 Pro على المقطع نفسه.
  7. عدّ الأسطر التي تحتاج إلى تعديل في كل ناتج. الرقم الأقل يفوز بمكانه في القائمة المختصرة.

نصائح الإعدادات التي توفّر المال

  • قُصّ الصمت أولًا. الفوترة تتبع المدة، لذا فإن حذف مقدمة صامتة مدتها 10 دقائق من تسجيل يوفّر 10 دقائق من التكلفة لدى كل مزوّد.
  • حدّد اللغة. قد يكون اكتشاف اللغة رسمًا إضافيًا لدى بعض الواجهات، ومصدرًا للأخطاء في المقاطع القصيرة.
  • استخدم أمرًا نصيًا للمفردات. سطر واحد يسرد أسماء العلامات التجارية والمصطلحات التقنية يصلح أخطاء أكثر من الانتقال إلى نموذج أغلى.
  • اختبر على مقاطع متطابقة. قارن النماذج على الملف نفسه، وإلا فإن اختلافات جودة الصوت ستُحسب كاختلافات في جودة النموذج.

حوّل النصوص المفرّغة إلى كلام وموسيقى

التفريغ النصي غالبًا ما يكون الخطوة الأولى في سلسلة أطول. بعد أن تحصل على نص نظيف، يمكنك إعادة استخدامه: تسجيل سرد بصوت جديد، أو ترجمته وإعادة تسجيله، أو بناء مقطع صوتي حوله. يجمع PicassoIA هذه الخطوات في مكان واحد.

إعادة تسجيل النصوص المفرّغة بكلام طبيعي

ممثل صوتي يسجّل في كابينة مبطّنة، وخلف الزجاج غيتار وسينثيسايزر

أرسل نصًا مفرّغًا مصحّحًا إلى نموذج تحويل النص إلى كلام، فتحصل على مسار سرد نظيف دون حجز استوديو. يستهدف Speech 2.8 HD التعليقات الصوتية بجودة الاستوديو، ويركّز ElevenLabs v3 على الأداء المعبّر، ويوفّر Gemini 3.1 Flash TTS 30 صوتًا بأكثر من 70 لغة، وصُمّم Realtime TTS 2 للاستخدام ذي زمن الاستجابة المنخفض. هذه هي الحلقة العملية لمنتجي البودكاست الذين يريدون نسخة بلغة ثانية لكل حلقة.

أضف خلفية موسيقية للنتيجة

يبدو السرد مكتملًا بعد أن يكون تحته مسار موسيقي هادئ. يولّد Music 2.6 أغانٍ كاملة من أمر نصي، ويبني Lyria 3 Pro مقطوعات موسيقية آلية أطول، ويناسب Stable Audio 2.5 الحلقات القصيرة والخلفيات المحيطة. صِف الحالة المزاجية في جملة واحدة، واجعل المقطع بدون غناء، واخفضه بمقدار 15 إلى 20 ديسيبل عن الصوت.

اختر أرخص إعداد لك

إليك النسخة المختصرة من كل ما سبق:

  • أرشيف تسجيلات قديمة والسعر هو الأهم: Groq Whisper Large v3 Turbo بسعر $0.04 للساعة.
  • فريق صغير بجودة وتكلفة متوازنة: GPT-4o Mini Transcribe بسعر $0.18 للساعة.
  • اللهجات والضوضاء والصوت الصعب: GPT-4o Transcribe بسعر $0.36 للساعة، أو AssemblyAI Universal-3.5 Pro بسعر $0.21.
  • الاجتماعات مع تسميات المتحدثين: سعّر إضافة فصل المتحدثين (diarization) أولًا، ثم قارن الإجماليات.
  • مقيّد بسحابة واحدة بحكم السياسة: Google أو Azure أو AWS، واطلب وضع الدفعات المخفّض.

مهما اخترت، تعامل مع الشهر الأول كاختبار. سجّل الفاتورة الفعلية، واقسمها على الساعات المفرّغة، وقارنها بالجدول أعلاه. الأسعار تتغير، وكذلك احتياجاتك. قد يفوز مزوّد اليوم من حيث التكلفة، ويخسر الربع القادم من حيث الدقة أو الحدود، لذا اجعل تكاملك خفيفًا بما يكفي لتبديل المزوّد بتغيير سطر واحد، واحتفظ بمقطع اختبار مدته 5 دقائق لإعادة تشغيله كلما تغيّر السعر.

هل أنت مستعد لتطبيق ذلك؟ افتح PicassoIA، وارفع أحد تسجيلاتك إلى GPT-4o Mini Transcribe، ثم جرّب المقطع نفسه على نماذج التفريغ الأخرى. عندما يبدو النص صحيحًا، سجّل له سردًا بصوت تحويل النص إلى كلام، وأضف خلفية موسيقية، وانظر إلى المدى الذي يمكن أن يصل إليه تسجيل واحد. تصفّح الكتالوج الكامل على picassoia.com/en/all-models وابدأ التجربة اليوم.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة