السرد الصوتي للكتب بالذكاء الاصطناعي مجانًا: مولّدات وأصوات طبيعية

ما الذي يمنحك إياه السرد الصوتي المجاني للكتب بالذكاء الاصطناعي فعلًا؟ يقارن هذا المقال مولّدات تحويل النص إلى كلام ذات الأصوات الأكثر طبيعية، ثم يشرح كيف تقسّم مخطوطة كاملة وتسجّلها بصوت اصطناعي وتصقلها بإيقاع واقعي وعاطفة وفترات صمت، مع الحدود الصادقة التي يجب التحقق منها قبل النشر.

السرد الصوتي للكتب بالذكاء الاصطناعي مجانًا: مولّدات وأصوات طبيعية
Cristian Da Conceicao
مؤسس Picasso IA

هناك من يستمع الآن إلى رواية في قطار الصباح، والصوت الذي يقرؤها ربما لم يأخذ نفسًا قط. كان البحث عن السرد الصوتي للكتب بالذكاء الاصطناعي مجانًا يقودك في السابق إلى أصوات آلية تقرأ الجملة كما يقرأ جهاز GPS الاتجاهات. وقد تغيّر ذلك. يمكنك الآن أن تلصق فصلًا في مربع نص، وتختار صوتًا، وتحصل على تسجيل يتباطأ عند جملة حزينة، ويتوقف قبل كشف مفاجئ، وينطق معظم الأسماء بشكل صحيح من المحاولة الأولى.

يعرض هذا المقال المولّدات التي تستحق وقتك، وما الذي يمنحك إياه مجانًا فعلًا، وكيف تحوّل مخطوطة مكتملة إلى صوت قابل للاستماع دون حجز استوديو. كل نموذج صوتي مذكور هنا متاح على Picasso IA، لذا يمكنك اختباره جنبًا إلى جنب مع الفقرة نفسها، والاعتماد على أذنيك بدلًا من صفحات التسويق.

رجل مسن ذو لحية بيضاء يستمع إلى قصة عبر سماعات الرأس في كرسي بذراعين في يوم ممطر

ماذا يعني السرد المجاني فعلًا

كلمة "مجاني" يُبالغ في توسيع معناها في هذا الركن من الإنترنت. بعض الأدوات تمنحك عشر دقائق مع علامة مائية. وأخرى تسلّمك ملف الصوت كاملًا لكنها تحدّ كل طلب بعدد قليل من آلاف الأحرف. ومعرفة الفرق توفّر عليك جهد أمسية كاملة، لذا ابدأ من هنا.

ما الذي يمنحك إياه الصفر دولار

يمنحك إعداد مجاني متين لتحويل النص إلى كلام أربعة أشياء:

  • خيار حقيقي من الأصوات. ليس راويًا افتراضيًا واحدًا، بل مجموعة من الأعمار والنبرات واللهجات يمكنك تجربتها على الفقرة نفسها.
  • تحكّم في طريقة الأداء. السرعة وطبقة الصوت والحجم والعاطفة إعدادات يمكنك تغييرها، لا أمور غامضة عليك قبولها.
  • ملفات قابلة للاستخدام فعلًا. MP3 للرفع، وWAV أو FLAC إذا كنت تخطط لتحرير الصوت لاحقًا.
  • لغات كثيرة. يمكن لنص واحد أن يصبح صوتًا بالإنجليزية والإسبانية واليابانية بتغيير خيار واحد.

يصف Picasso IA كلًا من Speech 2.8 HD وGemini 3.1 Flash TTS بأنهما مجانيان للاستخدام عبر الإنترنت، وتضم مجموعة تحويل النص إلى كلام لديه 24 نموذجًا في المجموع. وهذا عدد كبير يكفي للعثور على صوت يناسب أي كتاب تقريبًا.

أين تنتهي الخطط المجانية

الشرط الحاسم هو الحجم. يقبل Speech 2.8 HD ما يصل إلى 10,000 حرف لكل طلب، ويقبل Gemini 3.1 Flash TTS ما يصل إلى 4,000 بايت. الفصل المكوّن من 4,000 كلمة يعادل تقريبًا 24,000 حرف، لذا سترسله على أجزاء. ورواية من 80,000 كلمة تعني نحو 50 طلبًا حتى مع الحد الأكبر.

هناك حدّان آخران يستحقان التحقق قبل أن تبدأ. الأول هو صيغة الإخراج: إذا كنت تخطط للتحرير، فاختر نموذجًا يصدّر WAV أو FLAC، لأن ملف MP3 مضغوطًا بشدة يفقد جزءًا من التفاصيل في كل مرة تعيد حفظه. الثاني هو اللغة: قد يبدو الصوت الدافئ بالإنجليزية رتيبًا بالألمانية، لذا اختبر باللغة التي سيسمعها مستمعوك فعلًا.

💡 خطّط للوقت لا للمال. التكلفة الحقيقية للكتاب الصوتي المجاني هي الساعة التي تقضيها في التقسيم والتوليد والاستماع إلى النتيجة. خصّص أمسية لكل فصل في المرة الأولى، ثم راقب هذا الرقم يتقلص بعد أن تضبط إعداداتك.

منظر علوي لمكتب خشبي عليه هاتف وسماعات أذن ورواية ورقية وملاحظات مكتوبة بخط اليد

من يستمع إلى الرواة بالذكاء الاصطناعي

السرد الاصطناعي ليس لعبة لعشّاق التقنية. إنه يحل ثلاث مشكلات عادية جدًا، ولكل منها نوع مختلف من الأشخاص وراءه.

المؤلفون المستقلون

يبقى توظيف راوٍ بشري واستئجار استوديو تسجيل خارج متناول كثير من المؤلفين الجدد، فتبقى كتبهم نصية فقط. يسد السرد بالذكاء الاصطناعي هذه الفجوة. يستطيع المؤلف أن ينتج نسخة صوتية نظيفة ومتسقة من مخطوطة مكتملة خلال أيام قليلة، ويكتشف إن كان القراء يريدونها فعلًا، ثم يدفع لأداء بشري لاحقًا إن استحق الكتاب ذلك.

مؤلفة تبتسم في ممر مكتبة وهي تحمل كتابها الورقي المطبوع حديثًا

المسافرون اليوميون والعدّاؤون

الصوت يناسب الأماكن التي لا تسمح بالقراءة. رحلة قطار مدتها أربعون دقيقة، أو جري طويل، أو قيادة عبر المدينة، أو حوض مليء بالأطباق. من يعيشون أصلًا على البودكاست سيقبلون بسعادة المقالات والنشرات الإخبارية وملاحظات الدراسة على هيئة صوت، وهنا تتألق الأصوات الاصطناعية: أي نص تملكه يمكن أن يصبح شيئًا تستمع إليه. تقرير طويل تؤجل قراءته باستمرار، أو مسودتك الناقصة وقد أُعيد قراءتها لك لتسمع الجمل المتعثرة، أو قصة قصيرة لصديق، أو ملاحظات محاضرة في ليلة الامتحان. إذا استطعت لصق النص، فيمكنك أن تسمعه.

مسافر يرتدي سماعات أذن في قطار إقليمي وينظر إلى أشجار الخريف عبر النافذة

امرأة تركض على مسار في حديقة عند الساعة الذهبية وهي ترتدي سماعات أذن لاسلكية

المستمعون الذين يحتاجون إلى الصوت

بالنسبة للقراء ضعاف البصر أو من يعانون عُسر القراءة أو الإرهاق البصري، يكون السرد وسيلة وصول لا رفاهية. صوت هادئ ومستقر يقرأ مقالًا طويلًا بالسرعة التي تختارها يزيل حاجزًا حقيقيًا. كبار السن الذين ما زالوا يحبون القصص لكنهم يجدون صعوبة مع الخط الصغير يحصلون على الفائدة نفسها، ويمكنهم إعادة تشغيل فقرة بقدر ما يشاؤون دون طلب المساعدة من أحد.

امرأة مسنة تستمع إلى قصة من مكبر صوت ذكي على طاولة مطبخ مشمسة

مولّدات تستحق التجربة

يجمع Picasso IA 24 نموذجًا لتحويل النص إلى كلام في مجموعة واحدة، لذا يمكنك تشغيل الفقرة نفسها عبر عدة محركات دون فتح حساب في كل موقع. إليك القائمة المختصرة التي أبدأ بها.

النموذجالاستخدام الأمثلالميزة البارزة
Speech 2.8 HDالسرد الطويل والمستقرعشرة إعدادات للعاطفة، وفترات صمت موقوتة، وتصدير MP3 وWAV وFLAC
Gemini 3.1 Flash TTSالقراءات المعبّرة التي تقودها الشخصيات30 صوتًا، وأكثر من 70 رمز لغة، وعلامات مثل [whispering]
ElevenLabs V3التعليق الصوتي الطبيعينكهة صوتية مختلفة للمقارنة مع الآخرين
ElevenLabs v2 Multilingualالكتب بلغات أخرىتعليق صوتي بأكثر من 30 لغة
Inworld TTS 1.5 Maxالمسودات السريعةتعليقات صوتية تشمل 15 لغة
Qwen3 TTSراوٍ مخصصاستنساخ صوت أو تصميم صوتك الخاص
Chatterboxالأداء العاطفياستنساخ الصوت مع التحكم في العاطفة

جودة استوديو للسرد الطويل

Speech 2.8 HD هو خياري الافتراضي للسرد المباشر. ينتج صوتًا نظيفًا عالي الدقة، يصل إلى MP3 بمعدل 256 كيلوبت في الثانية أو WAV وFLAC بلا فقد، ويمنحك عشرة أساليب أداء تشمل الهادئ والحزين والمندهش والمحايد. تتراوح السرعة من النصف إلى الضعف، وتتغير طبقة الصوت حتى 12 نصف نغمة في أي اتجاه، وتُدرج علامة بسيطة فترات صمت موقوتة. ويمكنه أيضًا إرجاع طوابع زمنية على مستوى الجملة، وهذا مفيد إذا أردت لاحقًا ترجمات لنسخة فيديو من كتابك.

المكان الذي يناسبه أكثر:

  • الكتب غير الروائية والمقالات التي تحتاج إلى نبرة ثابتة وموثوقة.
  • الأدب الروائي برّاوٍ واحد وعدد قليل من الشخصيات.
  • المشاريع الطويلة التي تكون فيها الإعدادات المتسقة أهم من الأسلوب المبهر.

أداء معبّر للشخصيات

يميل Gemini 3.1 Flash TTS نحو الأداء. تختار واحدًا من 30 صوتًا، ثم تكتب أمرًا نصيًا لأسلوب الأداء بلغة بسيطة، مثل "اقرأ ببطء، كأنها حكاية قبل النوم لطفل متعب." وتُشكّل العلامات المضمّنة مثل [whispering] و[laughing] و[sigh] أسطرًا بعينها، فتستطيع الشخصية أن تخفض صوتها تمامًا حيث يطلب النص ذلك. ومع أكثر من 70 رمز لغة، يمكن أن يتحول النص نفسه إلى طبعة إسبانية أو هندية بتغيير واحد في القائمة المنسدلة.

أصوات أخرى تستحق التجربة

تتصرف الأصوات بشكل مختلف على نصوص مختلفة، لذا جرّب أكثر من صوت قبل أن تلتزم بكتاب كامل.

  • خيارات الاستنساخ. يمكن لنماذج Qwen3 TTS وChatterbox وMiniMax Voice Cloning إنشاء صوت راوٍ مخصص. استنسخ صوتك أنت فقط، أو صوتًا حصلت على إذن كتابي لاستخدامه.
  • لغات أخرى. يتعامل ElevenLabs v2 Multilingual مع أكثر من 30 لغة، ويترجم ElevenLabs Dubbing الفيديوهات إلى أكثر من 90 لغة إذا أردت لاحقًا إعلانًا مصورًا لكتابك.
  • الحوار. صُمّم Play Dialog للصوت الحواري الطبيعي، وهو مناسب للمشاهد التي فيها متحدثان.
  • السرعة. يمثل Inworld TTS 1.5 Max طريقة سريعة لسماع مسودة أولية قبل أن تُحسّن النسخة الحقيقية.

يمكنك تصفح كل النماذج المتاحة على picassoia.com/en/all-models.

إجراء اختبار عادل

لا تحكم على صوت من خلال مقطعه التجريبي. أعدّ مقطعك الخاص من نحو 150 كلمة يتضمن الأجزاء الصعبة: سطرًا من الحوار، ورقمًا أو تاريخًا، واسمًا غير مألوف، وجملة عاطفية هادئة. ثم شغّل هذا المقطع بالضبط عبر ثلاثة نماذج بالسرعة وطبقة الصوت نفسيهما، وقيّم كل تسجيل من 1 إلى 5 وفق ثلاثة معايير:

  • الإيقاع. هل يتنفس حيث يتنفس الإنسان، أم يسرع عند الفواصل؟
  • النطق. هل خرج الاسم والرقم والتاريخ بشكل صحيح؟
  • الدفء. هل ستستمر في الاستماع بعد ساعتين، أم ستمد يدك إلى زر الإيقاف المؤقت؟

احتفظ بالملاحظات. عندما يبدو فصل غريبًا بعد ثلاثة أسابيع، ستخبرك بطاقة التقييم أي إعداد يجب أن تلومه.

ما الذي يجعل الصوت يبدو طبيعيًا

هنا الجزء المفاجئ: الصوت الذي تختاره أقل أهمية مما تظن. يتسامح المستمعون مع نبرة اصطناعية خفيفة خلال دقائق. لكنهم لا يغفرون أبدًا الإيقاع السيئ، أو راويًا يسرع في مشهد جنائزي، أو يتوقف في منتصف اسم.

يد تدير مقبض الكسب على واجهة صوت USB بجانب ميكروفون مكثف

الإيقاع أهم من اختيار الصوت

الراوي المستعجل يبدو متوترًا، والراوي المتثاقل يبدو ناعسًا. ابدأ بالسرعة العادية (1.0) للقصص، وانزل إلى 0.9 للمحتوى غير الروائي الكثيف، حيث يحتاج المستمعون إلى لحظة لاستيعاب كل نقطة. قاوم الرغبة في تسريع الصوت لتقليص مدة التشغيل. يستطيع المستمعون دائمًا تسريع التشغيل في تطبيقهم، لكن لا أحد يستطيع إبطاء صوت أُنتج بسرعة زائدة.

أيدٍ تمسك كتابًا قديمًا مغلّفًا بالقماش وسماعات الرأس مستقرة على صفحاته

العاطفة والفترات الصامتة

الصمت هو ما يحمل معظم العبء. في Speech 2.8 HD، تُدرج علامة مثل <#0.8#> فترة صمت مدتها 0.8 ثانية، وهي تعمل جيدًا قبل كشف مفاجئ أو بعد عنوان فصل. يحصل Gemini 3.1 Flash TTS على تأثير مشابه من أمر نصي للأسلوب. هذه نقاط بداية تناسب معظم الكتب:

المشهدالعاطفةالسرعة
وصف هادئcalm0.95
مطاردة متوترةauto1.1
حزن أو فقدsad0.9
شرح فكرةfluent1.0
مقطع خفيف ومضحكhappy1.05

تعامل مع الأرقام كمسودة أولى، ثم ثق بأذنيك. ثلاثة فخاخ صغيرة تُوقع الجميع تقريبًا:

  • الأرقام والتواريخ. فعّل التطبيع الإنجليزي في Speech 2.8 HD ليُقرأ الرقم كما يقوله الإنسان.
  • الأسماء المختلقة. اكتبها كما تُنطق في النص نفسه، مثل "Sil-vane" لاسم خيالي، ثم تحقق من التسجيل.
  • الاختصارات. قرّر إن كنت تريد نطق "NASA" كلمةً واحدة أم تهجئة "FBI" حرفًا حرفًا، واكتبها بالشكل الذي تريده.

سجّل فصلًا في خمس خطوات

يستخدم هذا الشرح Speech 2.8 HD لأن عناصر تحكمه تتطابق بدقة مع عمل الكتب الصوتية. ينطبق التسلسل نفسه على النماذج الأخرى في المجموعة.

  1. افتح صفحة Speech 2.8 HD على Picasso IA.
  2. الصق قسمًا واحدًا من فصلك في حقل النص، بحد أقصى 10,000 حرف.
  3. اختر صوتًا وعاطفة وسرعة.
  4. وَلِّد التسجيل، ثم استمع إليه كاملًا بسماعات الرأس.
  5. نزّل الملف وسمّه بالفصل والقسم، مثل ch03-part2.wav.

تحضير النص

شاب يكتب مخطوطة على مكتب بجانب صفحات مطبوعة وسماعات استوديو

يكشف السرد كل ما في الصفحة. قبل اللصق، نظّف النص: أزل أرقام الصفحات وعلامات الحواشي والتنسيق الزائد. اكتب كاملةً أي كلمة تقولها بشكل مختلف عمّا تكتبه، مثل "Dr." أو "St."، وقسّم الجمل الطويلة جدًا، لأن الصوت الذي ينفد نفسه يبدو أسوأ من جملة قصيرة قليلًا. اقرأ الصفحة الأولى بصوت عالٍ بنفسك. أينما تعثرت، سيتعثر النموذج أيضًا.

ضبط عناصر التحكم في الصوت

الإعدادالقيمة الابتدائيةلماذا يهم
الصوتWise_Woman (الافتراضي)جرّب عدة أصوات على الفقرة نفسها
العاطفةauto، أو calm للقصصيترك auto للنموذج اختيار الأسلوب، ويمنح calm سردًا أكثر ثباتًا
السرعة1.0عدّل بخطوات صغيرة قدرها 0.05
طبقة الصوت0حرّكها نصف نغمة أو نغمتين كحد أقصى
صيغة الصوتWAV أو FLAC للتحرير، وMP3 للرفعالملفات بلا فقد تترك مجالًا للتعديل
التطبيع الإنجليزيمُفعّلقراءة أفضل للأرقام والتواريخ، مع تأخير بسيط
تعزيز اللغةEnglish أو Automaticيساعد مع الأسماء من لغات أخرى

💡 غيّر إعدادًا واحدًا في كل مرة. إذا غيّرت الصوت والسرعة والعاطفة معًا، فلن تعرف أبدًا أي تغيير أصلح التسجيل.

التعامل مع كتاب كامل الطول

الفصل الواحد سهل. الكتاب كله مشكلة لوجستية، والحل ممل لكنه موثوق: قطع صغيرة وملاحظات صارمة.

تقسيم الفصول إلى أجزاء

اقطع عند فواصل الفقرات، لا في منتصف الجملة أبدًا. استهدف ما بين 6,000 و8,000 حرف لكل جزء مع Speech 2.8 HD، وابق دون 4,000 بايت مع Gemini 3.1 Flash TTS، وأقل قليلًا إذا كان نصك مليئًا بالحروف المعلّمة. رقّم الملفات حتى تترتب بترتيب القراءة، واحتفظ بجدول بسيط يوضح الأجزاء المنجزة والأجزاء التي تحتاج إلى إعادة.

الحفاظ على صوت واحد طوال الكتاب

بعد أول تسجيل جيد، دوّن كل الإعدادات: الصوت والعاطفة والسرعة وطبقة الصوت والصيغة. أعد استخدامها لكل جزء. ثم استمع إلى كل وصلة بين الأجزاء. إذا تغيّر مستوى الطاقة فجأة، فأعد توليد الجزء الثاني مع تضمين الجملة الأخيرة من الجزء الأول كمقدمة، ثم احذفها لاحقًا. يستطيع أي محرر صوت مجاني أن يضيف نصف ثانية من الصمت بين الأجزاء ويوازن مستوى الصوت عبر الكتاب كله.

الحدود الصادقة للسرد بالذكاء الاصطناعي

السرد بالذكاء الاصطناعي جيد، لكنه ليس سحرًا. اعرف مواضع ضعفه قبل أن تعد أي شخص بكتاب صوتي مكتمل.

  • الروايات الكثيفة بالحوارات صعبة. قد تختلط الأصوات حين يؤدي صوت واحد ست شخصيات. تساعد الأوامر النصية الخاصة بالأسلوب في Gemini 3.1 Flash TTS، ويناسب Play Dialog المشاهد القائمة على متحدثين اثنين.
  • أخبر مستمعيك. اذكر في وصف كتابك أن السرد الصوتي مولَّد بالذكاء الاصطناعي، وراجع قواعد كل متجر بيع بخصوص السرد الاصطناعي قبل أن ترفع أي شيء.
  • لا تستنسخ الأصوات إلا بموافقة صاحبها. لا مشكلة في استنساخ صوتك أنت. أما صوت أي شخص آخر فيحتاج إلى إذن مكتوب.
  • استمع إلى كل شيء. ما زالت النماذج تخطئ في الأسماء النادرة وفي كلمات مثل "lead" أو "read"، حيث يعتمد النطق الصحيح على السياق.

لا تُعد أيٌّ من هذه الحدود عائقًا حاسمًا. إنها قائمة تحقق. المؤلفون الذين يعاملون السرد بالذكاء الاصطناعي كمسودة أولى للنسخة الصوتية، ويقضون ساعة في إصلاح النقاط الضعيفة، ينتهون إلى شيء يُكمل المستمعون سماعه. أما من يلصق مخطوطة كاملة ويرفع الناتج دون أن يستمع إليه، فسينتهي به الأمر إلى مراجعات بنجمة واحدة عن بطل قصته الذي نُطق اسمه بشكل خاطئ.

جرّب سردك الخاص اليوم

اختر الصفحة التي أعدت قراءتها أكثر من غيرها في كتابك. افتح Picasso IA، والصقها في Speech 2.8 HD أو Gemini 3.1 Flash TTS، واضغط على التوليد. بعد عشر دقائق ستعرف إن كان هذا يناسب قصتك، وستكون لديك أول ملف صوتي تُسمعه لصديق.

بينما يُصيَّر الصوت، ابنِ الغلاف أيضًا. يستطيع نموذج صور مثل Seedream 4.5، أو FLUX 2 Pro، أو P-Image أن ينتج مشهدًا واقعيًا كالصور الفوتوغرافية لصفحة كتابك الصوتي في الوقت الذي يستغرقه تحضير كوب شاي. تصفح الكتالوج الكامل على picassoia.com/en/all-models، وجرّب أصواتًا مختلفة على الفقرة نفسها، واحتفظ بالأصوات التي تجعلك تنسى أن آلة هي من تتحدث.

قصتك تنتظر صوتًا منذ زمن. اذهب وامنحها واحدًا.

شارك هذا المقال

اختر لغتك

مقالات ذات صلة