يمكن أن تكلّف ساعة واحدة من الصوت $0.04 لتفريغها نصيًا على إحدى واجهات Speech to Text API، و**$1.44** على واجهة أخرى. التسجيل نفسه، والكلمات نفسها، وفجوة في الفاتورة بمقدار 36 ضعفًا. هذا التفاوت هو سبب أن أسعار Speech to Text API تستحق مقارنة جنبًا إلى جنب قبل أن تدمج أي شيء في بيئة الإنتاج. يحوّل هذا المقال كل سعر إلى الوحدة نفسها، ويرتّب أرخص واجهات التفريغ النصي، ويعرض تكلفة كل منها عند 100 ساعة صوت و1,000 ساعة شهريًا. ستطّلع أيضًا على الرسوم الإضافية التي تضاعف الفاتورة بهدوء، وعلى النماذج منخفضة السعر التي تفقد الدقة، وكيف تختبر ثلاثة نماذج تفريغ على PicassoIA دون كتابة سطر برمجي واحد.
💡 كل سعر وارد أدناه هو سعر معلن للدفع حسب الاستخدام من المزوّد، وليس سعرًا من PicassoIA. تُعدّل المزوّدات أسعارها كثيرًا، لذا تحقّق من الرقم الحالي في صفحة الأسعار لدى المزوّد قبل الالتزام.
التكلفة الفعلية للتفريغ النصي
تقريبًا كل مزوّد يفرض رسومه على مدة الصوت، لا على عدد الكلمات أو حجم الملف. يبدو هذا بسيطًا حتى تقارن العروض. بعض المزوّدات تنشر الأسعار بالدولار للدقيقة، وأخرى بالدولار للساعة، وقلة منها تخفي الرقم المفيد وراء قاعدة فوترة. المهمة الأولى هي وضع كل شيء في وحدة واحدة.
الأسعار بالدقيقة مقابل الأسعار بالساعة

التحويل عملية حسابية بسيطة: اضرب السعر بالدقيقة في 60 للحصول على التكلفة بالساعة. سعر قدره $0.003 للدقيقة يساوي $0.18 للساعة، وسعر قدره $0.024 للدقيقة يساوي $1.44 للساعة. يختار المزوّدون الوحدة التي تجعل الرقم يبدو أصغر، لذا أجرِ التحويل بنفسك قبل أي مقارنة.
عند الحجم تبدأ الكسور العشرية في إيلام الميزانية. سعر يبدو $0.0025 للدقيقة لا يعني شيئًا حتى تلاحظ أن أرشيفًا من 500 ساعة يساوي 30,000 دقيقة، وأن الأرشيف نفسه يكلّف $75 لدى مزوّد و$720 لدى آخر.
الفرق بين الدفعات والبث المباشر
تفريغ ملف مكتمل، وهو ما يُسمّى الدفعات (batch) أو المسجّل مسبقًا (pre-recorded)، هو الطريق الأرخص. أما التفريغ المباشر (streaming) فيكلّف أكثر لأن المزوّد يجب أن يُبقي سعة GPU مفتوحة أثناء حديثك. والفرق ليس صغيرًا:
- AssemblyAI تفرض $0.15 للساعة على الدفعات باستخدام Universal-2، و$0.45 للساعة على نموذج Universal-3.5 Pro للتفريغ المباشر.
- Deepgram تسعّر Nova-3 بنحو $0.0043 للدقيقة للصوت المسجّل مسبقًا، وبنحو $0.0077 للدقيقة للبث المباشر، مع عرض ترويجي مؤقت للبث المباشر قرب $0.0048.
- Google Cloud ينخفض إلى نحو $0.003 إلى $0.004 للدقيقة في وضع الدفعات الديناميكي المخفّض، مقابل $0.016 للدقيقة لطلبات الوقت الفعلي القياسية.
إذا كنت تفرّغ تسجيلات بعد وقوعها، فلا تدفع أبدًا أسعار البث المباشر. ارفع الملف وانتظر بضع ثوانٍ. احتفظ بالبث المباشر للتسميات النصية الحية، ووكلاء الصوت، وأي حالة ينتظر فيها شخص الكلمات في الوقت الفعلي.
جدول أسعار Speech to Text API
إليك كل خيار رئيسي محوّلًا إلى الوحدتين نفسيهما ومرتّبًا من الأرخص إلى الأغلى. الأسعار للشريحة الأولى من الاستخدام، باللغة الإنجليزية، دون إضافات.
| المزوّد والنموذج | في الساعة | في الدقيقة | الأنسب لـ |
|---|
| Groq Whisper Large v3 Turbo | $0.04 | ~$0.0007 | الأعمال المتراكمة الضخمة، السرعة الخام |
| AssemblyAI Universal-2 | $0.15 | $0.0025 | معالجة دفعية منخفضة التكلفة مع ميزات إضافية |
| GPT-4o Mini Transcribe | $0.18 | $0.003 | الاستخدام العام، الميزانيات المحدودة |
| AssemblyAI Universal-3.5 Pro | $0.21 | $0.0035 | الصوت الصعب بتكلفة منخفضة |
| Deepgram Nova-3 (للتسجيلات المسبقة) | ~$0.26 | ~$0.0043 | أدوات المطورين، الأحجام الكبيرة |
| GPT-4o Transcribe | $0.36 | $0.006 | اللهجات والصوت غير الواضح |
| Google Cloud Speech-to-Text V2 | $0.96 | $0.016 | الجهات التي تعتمد على Google Cloud |
| Azure Speech (القياسي) | $1.00 | ~$0.0167 | منظومة Microsoft |
| AWS Transcribe (الشريحة 1) | $1.44 | $0.024 | مسارات العمل المبنية على AWS |
💡 يبلغ سعر Whisper large v3 في واجهة OpenAI البرمجية الخاصة بها $0.006 للدقيقة، وهو السعر نفسه الذي تتقاضاه GPT-4o Transcribe. عندما يكون السعر متطابقًا، يكون النموذج الأحدث هو الاختيار الأكثر أمانًا للهجات والضوضاء في الخلفية.
أرخص الخيارات تحت $0.25 للساعة

أربعة خيارات تقع دون ربع دولار للساعة من الصوت. Groq هو الاستثناء: نموذج Whisper Large v3 Turbo المستضاف بسعر $0.04 للساعة يعمل أسرع من الزمن الفعلي بمئات المرات، فتنتهي ساعة الصوت في أقل بكثير من دقيقة. المقابل هو مجموعة ميزات أخف، بميزات مدمجة أقل من المزوّدين المتخصصين.
AssemblyAI Universal-2 بسعر $0.15 للساعة هو أرخص خيار يأتي مع مجموعة كاملة من الميزات الاختيارية، ويضيف نموذج Universal-3.5 Pro دقة أعلى مقابل $0.06 إضافية للساعة. يبلغ سعر GPT-4o Mini Transcribe $0.18 للساعة، وهو الخيار الأمثل للطلاب وصنّاع المحتوى الفرديين والفرق الصغيرة الذين يريدون دقة قوية دون إدارة عدد كبير من حسابات المزوّدين.
السحابات الكبرى أغلى

تفرض Google Cloud و Azure و AWS ما بين $0.96 و$1.44 للساعة مقابل التفريغ القياسي. وهذا يعادل من 6 إلى 36 ضعفًا من سعر الشريحة الاقتصادية. أنت لا تدفع مقابل كلمات أفضل. أنت تدفع مقابل شهادات الامتثال، وإقامة البيانات في منطقة محددة، وتسجيل الدخول الموحّد، وراحة فاتورة واحدة موجودة أصلًا في نظامك المالي.
إذا كانت شركتك تعمل أصلًا على إحدى هذه السحابات، وكان القانون يشترط بقاء الصوت داخلها، فالعلاوة مبرّرة. وإن لم يكن كذلك، فالعلاوة ضريبة على العادة. الاستثناء هو وضع الدفعات المخفّض لدى Google، فهو يعيد التكلفة قرب الشريحة المتوسطة عند نحو $0.18 إلى $0.24 للساعة.
التكلفة الشهرية عند الحجم الفعلي
أسعار الدقيقة تصبح ذات معنى فقط عندما تضربها في حجم عملك. يستخدم هذا الجدول 100 و1,000 ساعة صوت شهريًا، بالأسعار الأساسية فقط.
| الخيار | 100 ساعة شهريًا | 1,000 ساعة شهريًا |
|---|
| Groq Whisper Large v3 Turbo | $4 | $40 |
| AssemblyAI Universal-2 | $15 | $150 |
| GPT-4o Mini Transcribe | $18 | $180 |
| AssemblyAI Universal-3.5 Pro | $21 | $210 |
| Deepgram Nova-3 (للتسجيلات المسبقة) | ~$26 | ~$258 |
| GPT-4o Transcribe | $36 | $360 |
| Google Cloud V2 | $96 | $960 |
| Azure Speech | $100 | $1,000 |
| AWS Transcribe | $144 | $1,440 |
منتج بودكاست عند 100 ساعة
تخيّل شبكة تنشر 50 حلقة مدة كل منها ساعتان شهريًا. هذا يعني 100 ساعة من الصوت. أرخص خيار يكلّف $4 وأغلاها $144، أي فرق قدره $140 شهريًا. عند هذا الحجم لا تكون الفاتورة هي المشكلة. ساعة واحدة تُقضى في إصلاح نص مفرّغ سيئ تكلّف أكثر من الفاتورة الشهرية كاملة في معظم هذه الخيارات، لذا اختر حسب الدقة وسير العمل أولًا، واستخدم السعر فيصلًا عند التعادل.
أرشيف مكالمات عند 1,000 ساعة
والآن لنكبّر الحجم إلى فريق دعم يسجّل 1,000 ساعة مكالمات شهريًا. تصبح الفجوة بين أرخص خيار وأغلاه 1,400 دولار شهريًا، أو 16,800 دولار سنويًا. الخيارات المتوسطة بين $150 و$360 شهريًا لها الآن أثر حقيقي، وهذا هو النطاق الذي يسدّد فيه اختبار مزوّدين أو ثلاثة على صوتك الخاص ثمنه بنفسه خلال بعد ظهر واحد.
الرسوم المخفية التي تضخّم الفواتير
السعر المعلن هو تفريغ النص الأساسي فقط، ولا شيء غيره. الفواتير الحقيقية تُبنى من السعر الأساسي زائد كل ما تفعّله.
الميزات الإضافية تتراكم

تفرض عادةً رسومًا منفصلة على تسميات المتحدثين، وتصفية الألفاظ النابية، وحجب البيانات الشخصية، واكتشاف اللغة، ووسوم المشاعر، والملخصات. الرسوم النموذجية تبدو كالتالي:
- تسميات المتحدثين (diarization): نحو $0.02 للساعة في AssemblyAI، وتصل إلى نحو $0.12 للساعة في أماكن أخرى.
- الحجب: نحو $0.12 للساعة في الأمثلة المنشورة من Deepgram.
- رسوم الميزات لكل ميزة في Azure: $0.30 للساعة عن كل ميزة من تحديد اللغة، وفصل المتحدثين، وتقييم النطق.
فعّل ثلاثًا أو أربعًا من هذه الميزات، وقد يتضاعف سعر أساسي قدره $0.15 مرة أو أكثر. سعّر دائمًا مجموعة الميزات الدقيقة التي يحتاجها منتجك، لا الرقم المعروض في الواجهة.
💡 الشرائح المجانية تساعدك على الاختبار قبل الدفع. تمنح Deepgram رصيدًا ابتدائيًا بقيمة $200، وتتيح AssemblyAI مخصصات رصيد مجاني، وتتضمن Google 60 دقيقة مجانية شهريًا، وتتضمن AWS 60 دقيقة مجانية شهريًا لمدة السنة الأولى.
قواعد الفوترة لا تقل أهمية عن الإضافات. تحاسب AWS Transcribe بحد أدنى 15 ثانية لكل طلب، لذا فإن تطبيق أوامر صوتية يرسل مقاطع مدتها 3 ثوانٍ يدفع ثمن خمسة أضعاف الصوت الذي يرسله فعليًا. وحدود الرفع مهمة أيضًا: تقبل نقاط النهاية الخاصة بالتفريغ لدى OpenAI ملفات حتى نحو 25 MB، لذا تحتاج التسجيلات الطويلة إلى التقسيم إلى أجزاء، والأجزاء المتداخلة تعني أنك تدفع مرتين عن الثواني المتداخلة.
وقت الهندسة يُحسب أيضًا

توفير $30 شهريًا في التفريغ النصي صفقة سيئة إذا كان المزوّد الأرخص سيكلّف مطوّرك أربع ساعات إضافية. تحقّق من توفر SDK بلغتك، ومن webhooks للمهام المكتملة، وحدود معقولة للمعدل، ورسائل خطأ يمكن التنبؤ بها قبل أن تلتزم. عند تكلفة هندسية بالساعة قدرها $75، تعادل أربع ساعات من معاناة التكامل عشرة أشهر من توفير $30.
الرخيص مقابل الدقيق
السعر بالساعة لا يخبرك بعدد الكلمات الخاطئة التي ستخرج. قد يترك مزوّدان بالسعر نفسه كمية مختلفة جدًا من التنظيف، والتنظيف يُدفع من وقت الإنسان.
أين تتعثر النماذج الرخيصة

تميل النماذج منخفضة التكلفة إلى التعثر في المواضع نفسها: اللهجات الثقيلة، وشخصان يتحدثان في الوقت نفسه، والتسجيلات الميدانية مع الرياح أو الآلات، وأسماء المنتجات، والاختصارات، والأرقام المنطوقة. كل تعثّر يتحوّل إلى تعديل.
أجرِ الحساب على التعديل. بمعدل $30 للساعة، يكلّف المحرر $0.50 للدقيقة. كل 10 دقائق إضافية من التنظيف لكل ساعة صوت تضيف $5، وهذا أكثر من فاتورة AWS Transcribe كاملة لتلك الساعة. نص يكلّف $0.18 ويحتاج إلى 20 دقيقة من التصحيح أغلى من نص يكلّف $0.36 ويحتاج إلى 5 دقائق.
الاختبار الموثوق الوحيد هو صوتك الخاص. اختر ثلاثة ملفات تمثّل عملك، وشغّل كل منها على ثلاثة نماذج، وعدّ التعديلات التي تجريها. افعل ذلك قبل أن تقرر أي شيء بناءً على مخطط مقارنة الأداء.
الاجتماعات وتسميات المتحدثين

الاجتماعات هي الحالة اليومية الأصعب، لأن النص المفرّغ يكون بلا فائدة دون معرفة من قال ماذا. بعض النماذج تضمّن تسميات المتحدثين في السعر الأساسي، مثل نسخة فصل المتحدثين (diarization) من نموذج التفريغ لدى OpenAI، بينما تفرض أخرى رسومًا عليها كإضافة. عند مقارنة عمل يركّز على الاجتماعات، أضف رسوم فصل المتحدثين إلى كل خيار في القائمة المختصرة، ثم قارن الإجماليات. كثيرًا ما يتوقف أرخص سعر أساسي عن أن يكون أرخص إجمالي.
كيف تستخدم GPT-4o Mini Transcribe

يستضيف PicassoIA ثلاثة نماذج لتحويل الكلام إلى نص يمكنك تجربتها مباشرة من المتصفح: GPT-4o Mini Transcribe، و GPT-4o Transcribe، و Gemini 3 Pro. وهذا يجعله طريقة سريعة لتنفيذ اختبار الملفات الثلاثة من القسم السابق قبل أن تفتح أي حساب لدى مزوّد.
الإعداد خطوة بخطوة
- افتح صفحة GPT-4o Mini Transcribe على PicassoIA.
- ارفع ملف صوت قصيرًا، ويفضّل أن يكون مقطعًا مدته من 3 إلى 5 دقائق يتضمن أصعب مادتك: الأسماء والأرقام والأصوات المتداخلة.
- إذا كان النموذج يعرض حقل اللغة، فاضبطه بدلًا من ترك النموذج يخمّن.
- أضف أمرًا نصيًا قصيرًا يتضمن الأسماء غير المألوفة أو المصطلحات المتخصصة إذا كان حقل الأمر النصي متاحًا.
- شغّل التفريغ واقرأ الناتج مقابل الصوت.
- كرّر العملية باستخدام GPT-4o Transcribe و Gemini 3 Pro على المقطع نفسه.
- عدّ الأسطر التي تحتاج إلى تعديل في كل ناتج. الرقم الأقل يفوز بمكانه في القائمة المختصرة.
نصائح الإعدادات التي توفّر المال
- قُصّ الصمت أولًا. الفوترة تتبع المدة، لذا فإن حذف مقدمة صامتة مدتها 10 دقائق من تسجيل يوفّر 10 دقائق من التكلفة لدى كل مزوّد.
- حدّد اللغة. قد يكون اكتشاف اللغة رسمًا إضافيًا لدى بعض الواجهات، ومصدرًا للأخطاء في المقاطع القصيرة.
- استخدم أمرًا نصيًا للمفردات. سطر واحد يسرد أسماء العلامات التجارية والمصطلحات التقنية يصلح أخطاء أكثر من الانتقال إلى نموذج أغلى.
- اختبر على مقاطع متطابقة. قارن النماذج على الملف نفسه، وإلا فإن اختلافات جودة الصوت ستُحسب كاختلافات في جودة النموذج.
حوّل النصوص المفرّغة إلى كلام وموسيقى
التفريغ النصي غالبًا ما يكون الخطوة الأولى في سلسلة أطول. بعد أن تحصل على نص نظيف، يمكنك إعادة استخدامه: تسجيل سرد بصوت جديد، أو ترجمته وإعادة تسجيله، أو بناء مقطع صوتي حوله. يجمع PicassoIA هذه الخطوات في مكان واحد.
إعادة تسجيل النصوص المفرّغة بكلام طبيعي

أرسل نصًا مفرّغًا مصحّحًا إلى نموذج تحويل النص إلى كلام، فتحصل على مسار سرد نظيف دون حجز استوديو. يستهدف Speech 2.8 HD التعليقات الصوتية بجودة الاستوديو، ويركّز ElevenLabs v3 على الأداء المعبّر، ويوفّر Gemini 3.1 Flash TTS 30 صوتًا بأكثر من 70 لغة، وصُمّم Realtime TTS 2 للاستخدام ذي زمن الاستجابة المنخفض. هذه هي الحلقة العملية لمنتجي البودكاست الذين يريدون نسخة بلغة ثانية لكل حلقة.
أضف خلفية موسيقية للنتيجة
يبدو السرد مكتملًا بعد أن يكون تحته مسار موسيقي هادئ. يولّد Music 2.6 أغانٍ كاملة من أمر نصي، ويبني Lyria 3 Pro مقطوعات موسيقية آلية أطول، ويناسب Stable Audio 2.5 الحلقات القصيرة والخلفيات المحيطة. صِف الحالة المزاجية في جملة واحدة، واجعل المقطع بدون غناء، واخفضه بمقدار 15 إلى 20 ديسيبل عن الصوت.
اختر أرخص إعداد لك
إليك النسخة المختصرة من كل ما سبق:
- أرشيف تسجيلات قديمة والسعر هو الأهم: Groq Whisper Large v3 Turbo بسعر $0.04 للساعة.
- فريق صغير بجودة وتكلفة متوازنة: GPT-4o Mini Transcribe بسعر $0.18 للساعة.
- اللهجات والضوضاء والصوت الصعب: GPT-4o Transcribe بسعر $0.36 للساعة، أو AssemblyAI Universal-3.5 Pro بسعر $0.21.
- الاجتماعات مع تسميات المتحدثين: سعّر إضافة فصل المتحدثين (diarization) أولًا، ثم قارن الإجماليات.
- مقيّد بسحابة واحدة بحكم السياسة: Google أو Azure أو AWS، واطلب وضع الدفعات المخفّض.
مهما اخترت، تعامل مع الشهر الأول كاختبار. سجّل الفاتورة الفعلية، واقسمها على الساعات المفرّغة، وقارنها بالجدول أعلاه. الأسعار تتغير، وكذلك احتياجاتك. قد يفوز مزوّد اليوم من حيث التكلفة، ويخسر الربع القادم من حيث الدقة أو الحدود، لذا اجعل تكاملك خفيفًا بما يكفي لتبديل المزوّد بتغيير سطر واحد، واحتفظ بمقطع اختبار مدته 5 دقائق لإعادة تشغيله كلما تغيّر السعر.
هل أنت مستعد لتطبيق ذلك؟ افتح PicassoIA، وارفع أحد تسجيلاتك إلى GPT-4o Mini Transcribe، ثم جرّب المقطع نفسه على نماذج التفريغ الأخرى. عندما يبدو النص صحيحًا، سجّل له سردًا بصوت تحويل النص إلى كلام، وأضف خلفية موسيقية، وانظر إلى المدى الذي يمكن أن يصل إليه تسجيل واحد. تصفّح الكتالوج الكامل على picassoia.com/en/all-models وابدأ التجربة اليوم.