هناك من يستمع الآن إلى رواية في قطار الصباح، والصوت الذي يقرؤها ربما لم يأخذ نفسًا قط. كان البحث عن السرد الصوتي للكتب بالذكاء الاصطناعي مجانًا يقودك في السابق إلى أصوات آلية تقرأ الجملة كما يقرأ جهاز GPS الاتجاهات. وقد تغيّر ذلك. يمكنك الآن أن تلصق فصلًا في مربع نص، وتختار صوتًا، وتحصل على تسجيل يتباطأ عند جملة حزينة، ويتوقف قبل كشف مفاجئ، وينطق معظم الأسماء بشكل صحيح من المحاولة الأولى.
يعرض هذا المقال المولّدات التي تستحق وقتك، وما الذي يمنحك إياه مجانًا فعلًا، وكيف تحوّل مخطوطة مكتملة إلى صوت قابل للاستماع دون حجز استوديو. كل نموذج صوتي مذكور هنا متاح على Picasso IA، لذا يمكنك اختباره جنبًا إلى جنب مع الفقرة نفسها، والاعتماد على أذنيك بدلًا من صفحات التسويق.

ماذا يعني السرد المجاني فعلًا
كلمة "مجاني" يُبالغ في توسيع معناها في هذا الركن من الإنترنت. بعض الأدوات تمنحك عشر دقائق مع علامة مائية. وأخرى تسلّمك ملف الصوت كاملًا لكنها تحدّ كل طلب بعدد قليل من آلاف الأحرف. ومعرفة الفرق توفّر عليك جهد أمسية كاملة، لذا ابدأ من هنا.
ما الذي يمنحك إياه الصفر دولار
يمنحك إعداد مجاني متين لتحويل النص إلى كلام أربعة أشياء:
- خيار حقيقي من الأصوات. ليس راويًا افتراضيًا واحدًا، بل مجموعة من الأعمار والنبرات واللهجات يمكنك تجربتها على الفقرة نفسها.
- تحكّم في طريقة الأداء. السرعة وطبقة الصوت والحجم والعاطفة إعدادات يمكنك تغييرها، لا أمور غامضة عليك قبولها.
- ملفات قابلة للاستخدام فعلًا. MP3 للرفع، وWAV أو FLAC إذا كنت تخطط لتحرير الصوت لاحقًا.
- لغات كثيرة. يمكن لنص واحد أن يصبح صوتًا بالإنجليزية والإسبانية واليابانية بتغيير خيار واحد.
يصف Picasso IA كلًا من Speech 2.8 HD وGemini 3.1 Flash TTS بأنهما مجانيان للاستخدام عبر الإنترنت، وتضم مجموعة تحويل النص إلى كلام لديه 24 نموذجًا في المجموع. وهذا عدد كبير يكفي للعثور على صوت يناسب أي كتاب تقريبًا.
أين تنتهي الخطط المجانية
الشرط الحاسم هو الحجم. يقبل Speech 2.8 HD ما يصل إلى 10,000 حرف لكل طلب، ويقبل Gemini 3.1 Flash TTS ما يصل إلى 4,000 بايت. الفصل المكوّن من 4,000 كلمة يعادل تقريبًا 24,000 حرف، لذا سترسله على أجزاء. ورواية من 80,000 كلمة تعني نحو 50 طلبًا حتى مع الحد الأكبر.
هناك حدّان آخران يستحقان التحقق قبل أن تبدأ. الأول هو صيغة الإخراج: إذا كنت تخطط للتحرير، فاختر نموذجًا يصدّر WAV أو FLAC، لأن ملف MP3 مضغوطًا بشدة يفقد جزءًا من التفاصيل في كل مرة تعيد حفظه. الثاني هو اللغة: قد يبدو الصوت الدافئ بالإنجليزية رتيبًا بالألمانية، لذا اختبر باللغة التي سيسمعها مستمعوك فعلًا.
💡 خطّط للوقت لا للمال. التكلفة الحقيقية للكتاب الصوتي المجاني هي الساعة التي تقضيها في التقسيم والتوليد والاستماع إلى النتيجة. خصّص أمسية لكل فصل في المرة الأولى، ثم راقب هذا الرقم يتقلص بعد أن تضبط إعداداتك.

من يستمع إلى الرواة بالذكاء الاصطناعي
السرد الاصطناعي ليس لعبة لعشّاق التقنية. إنه يحل ثلاث مشكلات عادية جدًا، ولكل منها نوع مختلف من الأشخاص وراءه.
المؤلفون المستقلون
يبقى توظيف راوٍ بشري واستئجار استوديو تسجيل خارج متناول كثير من المؤلفين الجدد، فتبقى كتبهم نصية فقط. يسد السرد بالذكاء الاصطناعي هذه الفجوة. يستطيع المؤلف أن ينتج نسخة صوتية نظيفة ومتسقة من مخطوطة مكتملة خلال أيام قليلة، ويكتشف إن كان القراء يريدونها فعلًا، ثم يدفع لأداء بشري لاحقًا إن استحق الكتاب ذلك.

المسافرون اليوميون والعدّاؤون
الصوت يناسب الأماكن التي لا تسمح بالقراءة. رحلة قطار مدتها أربعون دقيقة، أو جري طويل، أو قيادة عبر المدينة، أو حوض مليء بالأطباق. من يعيشون أصلًا على البودكاست سيقبلون بسعادة المقالات والنشرات الإخبارية وملاحظات الدراسة على هيئة صوت، وهنا تتألق الأصوات الاصطناعية: أي نص تملكه يمكن أن يصبح شيئًا تستمع إليه. تقرير طويل تؤجل قراءته باستمرار، أو مسودتك الناقصة وقد أُعيد قراءتها لك لتسمع الجمل المتعثرة، أو قصة قصيرة لصديق، أو ملاحظات محاضرة في ليلة الامتحان. إذا استطعت لصق النص، فيمكنك أن تسمعه.


المستمعون الذين يحتاجون إلى الصوت
بالنسبة للقراء ضعاف البصر أو من يعانون عُسر القراءة أو الإرهاق البصري، يكون السرد وسيلة وصول لا رفاهية. صوت هادئ ومستقر يقرأ مقالًا طويلًا بالسرعة التي تختارها يزيل حاجزًا حقيقيًا. كبار السن الذين ما زالوا يحبون القصص لكنهم يجدون صعوبة مع الخط الصغير يحصلون على الفائدة نفسها، ويمكنهم إعادة تشغيل فقرة بقدر ما يشاؤون دون طلب المساعدة من أحد.

مولّدات تستحق التجربة
يجمع Picasso IA 24 نموذجًا لتحويل النص إلى كلام في مجموعة واحدة، لذا يمكنك تشغيل الفقرة نفسها عبر عدة محركات دون فتح حساب في كل موقع. إليك القائمة المختصرة التي أبدأ بها.
| النموذج | الاستخدام الأمثل | الميزة البارزة |
|---|
| Speech 2.8 HD | السرد الطويل والمستقر | عشرة إعدادات للعاطفة، وفترات صمت موقوتة، وتصدير MP3 وWAV وFLAC |
| Gemini 3.1 Flash TTS | القراءات المعبّرة التي تقودها الشخصيات | 30 صوتًا، وأكثر من 70 رمز لغة، وعلامات مثل [whispering] |
| ElevenLabs V3 | التعليق الصوتي الطبيعي | نكهة صوتية مختلفة للمقارنة مع الآخرين |
| ElevenLabs v2 Multilingual | الكتب بلغات أخرى | تعليق صوتي بأكثر من 30 لغة |
| Inworld TTS 1.5 Max | المسودات السريعة | تعليقات صوتية تشمل 15 لغة |
| Qwen3 TTS | راوٍ مخصص | استنساخ صوت أو تصميم صوتك الخاص |
| Chatterbox | الأداء العاطفي | استنساخ الصوت مع التحكم في العاطفة |
جودة استوديو للسرد الطويل
Speech 2.8 HD هو خياري الافتراضي للسرد المباشر. ينتج صوتًا نظيفًا عالي الدقة، يصل إلى MP3 بمعدل 256 كيلوبت في الثانية أو WAV وFLAC بلا فقد، ويمنحك عشرة أساليب أداء تشمل الهادئ والحزين والمندهش والمحايد. تتراوح السرعة من النصف إلى الضعف، وتتغير طبقة الصوت حتى 12 نصف نغمة في أي اتجاه، وتُدرج علامة بسيطة فترات صمت موقوتة. ويمكنه أيضًا إرجاع طوابع زمنية على مستوى الجملة، وهذا مفيد إذا أردت لاحقًا ترجمات لنسخة فيديو من كتابك.
المكان الذي يناسبه أكثر:
- الكتب غير الروائية والمقالات التي تحتاج إلى نبرة ثابتة وموثوقة.
- الأدب الروائي برّاوٍ واحد وعدد قليل من الشخصيات.
- المشاريع الطويلة التي تكون فيها الإعدادات المتسقة أهم من الأسلوب المبهر.
أداء معبّر للشخصيات
يميل Gemini 3.1 Flash TTS نحو الأداء. تختار واحدًا من 30 صوتًا، ثم تكتب أمرًا نصيًا لأسلوب الأداء بلغة بسيطة، مثل "اقرأ ببطء، كأنها حكاية قبل النوم لطفل متعب." وتُشكّل العلامات المضمّنة مثل [whispering] و[laughing] و[sigh] أسطرًا بعينها، فتستطيع الشخصية أن تخفض صوتها تمامًا حيث يطلب النص ذلك. ومع أكثر من 70 رمز لغة، يمكن أن يتحول النص نفسه إلى طبعة إسبانية أو هندية بتغيير واحد في القائمة المنسدلة.
أصوات أخرى تستحق التجربة
تتصرف الأصوات بشكل مختلف على نصوص مختلفة، لذا جرّب أكثر من صوت قبل أن تلتزم بكتاب كامل.
يمكنك تصفح كل النماذج المتاحة على picassoia.com/en/all-models.
إجراء اختبار عادل
لا تحكم على صوت من خلال مقطعه التجريبي. أعدّ مقطعك الخاص من نحو 150 كلمة يتضمن الأجزاء الصعبة: سطرًا من الحوار، ورقمًا أو تاريخًا، واسمًا غير مألوف، وجملة عاطفية هادئة. ثم شغّل هذا المقطع بالضبط عبر ثلاثة نماذج بالسرعة وطبقة الصوت نفسيهما، وقيّم كل تسجيل من 1 إلى 5 وفق ثلاثة معايير:
- الإيقاع. هل يتنفس حيث يتنفس الإنسان، أم يسرع عند الفواصل؟
- النطق. هل خرج الاسم والرقم والتاريخ بشكل صحيح؟
- الدفء. هل ستستمر في الاستماع بعد ساعتين، أم ستمد يدك إلى زر الإيقاف المؤقت؟
احتفظ بالملاحظات. عندما يبدو فصل غريبًا بعد ثلاثة أسابيع، ستخبرك بطاقة التقييم أي إعداد يجب أن تلومه.
ما الذي يجعل الصوت يبدو طبيعيًا
هنا الجزء المفاجئ: الصوت الذي تختاره أقل أهمية مما تظن. يتسامح المستمعون مع نبرة اصطناعية خفيفة خلال دقائق. لكنهم لا يغفرون أبدًا الإيقاع السيئ، أو راويًا يسرع في مشهد جنائزي، أو يتوقف في منتصف اسم.

الإيقاع أهم من اختيار الصوت
الراوي المستعجل يبدو متوترًا، والراوي المتثاقل يبدو ناعسًا. ابدأ بالسرعة العادية (1.0) للقصص، وانزل إلى 0.9 للمحتوى غير الروائي الكثيف، حيث يحتاج المستمعون إلى لحظة لاستيعاب كل نقطة. قاوم الرغبة في تسريع الصوت لتقليص مدة التشغيل. يستطيع المستمعون دائمًا تسريع التشغيل في تطبيقهم، لكن لا أحد يستطيع إبطاء صوت أُنتج بسرعة زائدة.

العاطفة والفترات الصامتة
الصمت هو ما يحمل معظم العبء. في Speech 2.8 HD، تُدرج علامة مثل <#0.8#> فترة صمت مدتها 0.8 ثانية، وهي تعمل جيدًا قبل كشف مفاجئ أو بعد عنوان فصل. يحصل Gemini 3.1 Flash TTS على تأثير مشابه من أمر نصي للأسلوب. هذه نقاط بداية تناسب معظم الكتب:
| المشهد | العاطفة | السرعة |
|---|
| وصف هادئ | calm | 0.95 |
| مطاردة متوترة | auto | 1.1 |
| حزن أو فقد | sad | 0.9 |
| شرح فكرة | fluent | 1.0 |
| مقطع خفيف ومضحك | happy | 1.05 |
تعامل مع الأرقام كمسودة أولى، ثم ثق بأذنيك. ثلاثة فخاخ صغيرة تُوقع الجميع تقريبًا:
- الأرقام والتواريخ. فعّل التطبيع الإنجليزي في Speech 2.8 HD ليُقرأ الرقم كما يقوله الإنسان.
- الأسماء المختلقة. اكتبها كما تُنطق في النص نفسه، مثل "Sil-vane" لاسم خيالي، ثم تحقق من التسجيل.
- الاختصارات. قرّر إن كنت تريد نطق "NASA" كلمةً واحدة أم تهجئة "FBI" حرفًا حرفًا، واكتبها بالشكل الذي تريده.
سجّل فصلًا في خمس خطوات
يستخدم هذا الشرح Speech 2.8 HD لأن عناصر تحكمه تتطابق بدقة مع عمل الكتب الصوتية. ينطبق التسلسل نفسه على النماذج الأخرى في المجموعة.
- افتح صفحة Speech 2.8 HD على Picasso IA.
- الصق قسمًا واحدًا من فصلك في حقل النص، بحد أقصى 10,000 حرف.
- اختر صوتًا وعاطفة وسرعة.
- وَلِّد التسجيل، ثم استمع إليه كاملًا بسماعات الرأس.
- نزّل الملف وسمّه بالفصل والقسم، مثل
ch03-part2.wav.
تحضير النص

يكشف السرد كل ما في الصفحة. قبل اللصق، نظّف النص: أزل أرقام الصفحات وعلامات الحواشي والتنسيق الزائد. اكتب كاملةً أي كلمة تقولها بشكل مختلف عمّا تكتبه، مثل "Dr." أو "St."، وقسّم الجمل الطويلة جدًا، لأن الصوت الذي ينفد نفسه يبدو أسوأ من جملة قصيرة قليلًا. اقرأ الصفحة الأولى بصوت عالٍ بنفسك. أينما تعثرت، سيتعثر النموذج أيضًا.
ضبط عناصر التحكم في الصوت
| الإعداد | القيمة الابتدائية | لماذا يهم |
|---|
| الصوت | Wise_Woman (الافتراضي) | جرّب عدة أصوات على الفقرة نفسها |
| العاطفة | auto، أو calm للقصص | يترك auto للنموذج اختيار الأسلوب، ويمنح calm سردًا أكثر ثباتًا |
| السرعة | 1.0 | عدّل بخطوات صغيرة قدرها 0.05 |
| طبقة الصوت | 0 | حرّكها نصف نغمة أو نغمتين كحد أقصى |
| صيغة الصوت | WAV أو FLAC للتحرير، وMP3 للرفع | الملفات بلا فقد تترك مجالًا للتعديل |
| التطبيع الإنجليزي | مُفعّل | قراءة أفضل للأرقام والتواريخ، مع تأخير بسيط |
| تعزيز اللغة | English أو Automatic | يساعد مع الأسماء من لغات أخرى |
💡 غيّر إعدادًا واحدًا في كل مرة. إذا غيّرت الصوت والسرعة والعاطفة معًا، فلن تعرف أبدًا أي تغيير أصلح التسجيل.
التعامل مع كتاب كامل الطول
الفصل الواحد سهل. الكتاب كله مشكلة لوجستية، والحل ممل لكنه موثوق: قطع صغيرة وملاحظات صارمة.
تقسيم الفصول إلى أجزاء
اقطع عند فواصل الفقرات، لا في منتصف الجملة أبدًا. استهدف ما بين 6,000 و8,000 حرف لكل جزء مع Speech 2.8 HD، وابق دون 4,000 بايت مع Gemini 3.1 Flash TTS، وأقل قليلًا إذا كان نصك مليئًا بالحروف المعلّمة. رقّم الملفات حتى تترتب بترتيب القراءة، واحتفظ بجدول بسيط يوضح الأجزاء المنجزة والأجزاء التي تحتاج إلى إعادة.
الحفاظ على صوت واحد طوال الكتاب
بعد أول تسجيل جيد، دوّن كل الإعدادات: الصوت والعاطفة والسرعة وطبقة الصوت والصيغة. أعد استخدامها لكل جزء. ثم استمع إلى كل وصلة بين الأجزاء. إذا تغيّر مستوى الطاقة فجأة، فأعد توليد الجزء الثاني مع تضمين الجملة الأخيرة من الجزء الأول كمقدمة، ثم احذفها لاحقًا. يستطيع أي محرر صوت مجاني أن يضيف نصف ثانية من الصمت بين الأجزاء ويوازن مستوى الصوت عبر الكتاب كله.
الحدود الصادقة للسرد بالذكاء الاصطناعي
السرد بالذكاء الاصطناعي جيد، لكنه ليس سحرًا. اعرف مواضع ضعفه قبل أن تعد أي شخص بكتاب صوتي مكتمل.
- الروايات الكثيفة بالحوارات صعبة. قد تختلط الأصوات حين يؤدي صوت واحد ست شخصيات. تساعد الأوامر النصية الخاصة بالأسلوب في Gemini 3.1 Flash TTS، ويناسب Play Dialog المشاهد القائمة على متحدثين اثنين.
- أخبر مستمعيك. اذكر في وصف كتابك أن السرد الصوتي مولَّد بالذكاء الاصطناعي، وراجع قواعد كل متجر بيع بخصوص السرد الاصطناعي قبل أن ترفع أي شيء.
- لا تستنسخ الأصوات إلا بموافقة صاحبها. لا مشكلة في استنساخ صوتك أنت. أما صوت أي شخص آخر فيحتاج إلى إذن مكتوب.
- استمع إلى كل شيء. ما زالت النماذج تخطئ في الأسماء النادرة وفي كلمات مثل "lead" أو "read"، حيث يعتمد النطق الصحيح على السياق.
لا تُعد أيٌّ من هذه الحدود عائقًا حاسمًا. إنها قائمة تحقق. المؤلفون الذين يعاملون السرد بالذكاء الاصطناعي كمسودة أولى للنسخة الصوتية، ويقضون ساعة في إصلاح النقاط الضعيفة، ينتهون إلى شيء يُكمل المستمعون سماعه. أما من يلصق مخطوطة كاملة ويرفع الناتج دون أن يستمع إليه، فسينتهي به الأمر إلى مراجعات بنجمة واحدة عن بطل قصته الذي نُطق اسمه بشكل خاطئ.
جرّب سردك الخاص اليوم
اختر الصفحة التي أعدت قراءتها أكثر من غيرها في كتابك. افتح Picasso IA، والصقها في Speech 2.8 HD أو Gemini 3.1 Flash TTS، واضغط على التوليد. بعد عشر دقائق ستعرف إن كان هذا يناسب قصتك، وستكون لديك أول ملف صوتي تُسمعه لصديق.
بينما يُصيَّر الصوت، ابنِ الغلاف أيضًا. يستطيع نموذج صور مثل Seedream 4.5، أو FLUX 2 Pro، أو P-Image أن ينتج مشهدًا واقعيًا كالصور الفوتوغرافية لصفحة كتابك الصوتي في الوقت الذي يستغرقه تحضير كوب شاي. تصفح الكتالوج الكامل على picassoia.com/en/all-models، وجرّب أصواتًا مختلفة على الفقرة نفسها، واحتفظ بالأصوات التي تجعلك تنسى أن آلة هي من تتحدث.
قصتك تنتظر صوتًا منذ زمن. اذهب وامنحها واحدًا.