API de Fish Audio: precios de TTS y clonación de voz, línea por línea

Fish Audio cobra por la conversión de texto a voz $15 por millón de bytes UTF-8, la transcripción a $0.36 por hora de audio y el diseño de voz a un centavo por solicitud. Este desglose convierte esas tarifas en presupuestos reales para tus proyectos, compara los planes web con la API y muestra dónde encaja la clonación de voz.

API de Fish Audio: precios de TTS y clonación de voz, línea por línea
Cristian Da Conceicao
Fundador de Picasso IA

Fish Audio vende la voz por bytes, y ese detalle explica casi todas las sorpresas en la factura. La API de Fish Audio cobra $15 por millón de bytes UTF-8 de texto para la conversión de texto a voz, $0.36 por hora de audio para la transcripción y $0.01 por solicitud para el diseño de voz. La clonación de voz no tiene una línea propia en esa tabla de tarifas, lo que hace que presupuestarla sea más sencillo de lo que parece al principio.

Este desglose convierte esas tarifas en presupuestos reales de proyecto: una entrada de blog, un audiolibro, un bot de soporte, un mes de intros para un podcast. También verás cómo se comparan los planes web con la API, dónde aprietan los límites de velocidad y cómo se sitúa el precio frente a otros motores de voz. Las cifras provienen de los precios publicados por Fish Audio y de su documentación para desarrolladores, pueden cambiar, así que revísalas antes de comprometer dinero.

💡 Respuesta rápida: una hora de habla en inglés cuesta unos $1.25 a través de la API. Un artículo de 1,000 palabras, narrado de principio a fin, cuesta unos 8 centavos.

Lo que cobra Fish Audio por byte

Micrófono de condensador con filtro antipop en una sala de grabación revestida de madera

La tabla de tarifas

Todos los precios del lado de desarrollador caben en una sola tabla.

ServicioModelo o funciónPrecio
Texto a vozs2.1-pro$15.00 por millón de bytes UTF-8
Texto a vozs2-pro$15.00 por millón de bytes UTF-8
Texto a vozs1$15.00 por millón de bytes UTF-8
Texto a vozs2.1-pro-free$0.00 por millón de bytes UTF-8
Transcripciónambos modelos disponibles$0.36 por hora de audio
Diseño de vozcada solicitud exitosa$0.01

La documentación recomienda s2.1-pro para proyectos nuevos, y los tres modelos de pago comparten precio, así que elegir entre ellos es una decisión de calidad, no de dinero. La versión gratuita de s2.1-pro aparece con costo cero, lo que resulta práctico para prototipar mientras pruebas un guion.

La referencia propia de Fish Audio: un millón de bytes equivale a unas 180,000 palabras en inglés, o unas 12 horas de habla. Divide $15 entre 12 y obtendrás la cifra que vale la pena memorizar: $1.25 por hora de audio terminado.

Por qué bytes y no caracteres

Un byte es lo que ocupa tu texto una vez codificado en UTF-8. En inglés sencillo, un carácter equivale a un byte, así que $15 por millón de bytes también son $15 por millón de caracteres. Otros alfabetos rompen esa equivalencia:

  • Las letras latinas con acento y el cirílico ocupan unos 2 bytes cada una.
  • Los caracteres chinos, japoneses y coreanos ocupan unos 3 bytes cada uno.
  • Los emoji ocupan 4 bytes.
  • Los espacios y los signos de puntuación también son bytes, así que un guion cargado de acotaciones cuesta más que el mismo guion recortado.

Vista cenital de un escritorio con una libreta de cálculos de costos escritos a mano y páginas impresas de un manuscrito

💡 Mide antes de enviar: en Python, len(text.encode("utf-8")) devuelve el número exacto de bytes de un guion. Multiplícalo por 0.000015 y tendrás el precio en dólares.

Costos reales para proyectos reales

Las cifras de una tabla de tarifas parecen abstractas hasta que las asocias a un trabajo concreto. Estos ejemplos usan la proporción propia de Fish Audio de 180,000 palabras por millón de bytes.

TrabajoDuración del audioBytes enviadosCosto
Un artículo de 1,000 palabrasunos 4 minutosunos 5,600unos $0.08
30 resúmenes diarios de cinco minutos2.5 horasunos 208,000unos $3.13
Un audiolibro de 80,000 palabrasunas 5.3 horasunos 444,000unos $6.67
10,000 respuestas de soporte de 300 caracteresunas 36 horas3,000,000$45.00
Un millón de caracteres japonesesvaríaunos 3,000,000unos $45.00

Narración y audiolibros

Un audiolibro entero por menos de lo que cuesta un sándwich es el titular aquí. Incluso una producción generosa, con cinco renders completos de un título de 80,000 palabras, se queda cerca de $33. La factura sigue al texto que envías, no a los segundos que devuelve, así que ralentizar la voz con el control de velocidad (la documentación permite de 0.5 a 2.0) no sube el precio.

Mujer con un suéter gris leyendo en voz alta un manuscrito impreso frente a un micrófono de estudio

Bots y alto volumen

Los mensajes cortos suman sin que te des cuenta. Un bot de soporte que responde 10,000 preguntas con respuestas de 300 caracteres consume tres millones de bytes, es decir, $45. Guarda en caché cualquier respuesta que se repita. Un saludo que se reproduce 50,000 veces debería generarse una sola vez y almacenarse.

Alfabetos no latinos

Presupuesta en bytes, no en caracteres, siempre que el texto no esté en inglés. Un millón de caracteres japoneses o chinos cuesta unos $45, tres veces la cifra del inglés, y el cirílico se queda cerca de $30. El audio no es más largo, pero el contador mide el tamaño codificado.

Cuatro formas de reducir la factura

Los pequeños hábitos importan cuando crece el volumen:

  1. Prototipa con la versión gratuita. Ajusta el ritmo y la puntuación en s2.1-pro-free, revisa sus límites en la documentación y luego genera las versiones finales con un modelo de pago.
  2. Quita lo superfluo. Elimina las acotaciones, los espacios en blanco repetidos y el marcado sobrante antes de enviar el texto.
  3. Guarda en caché las frases que se repiten. Los saludos, los mensajes de menú y los avisos legales deben generarse una vez y almacenarse.
  4. Renderiza por párrafos. Así, una errata te cuesta un párrafo y no un capítulo entero.

Clonación de voz y lo que cuesta

La tabla de tarifas no incluye ningún cargo por clonación. Según la página de precios, generar habla con una voz clonada se factura como conversión de texto a voz normal, por byte. Lo que cambia es el flujo de trabajo.

Clonación instantánea frente a voces guardadas

La documentación describe dos vías:

  • Clonación instantánea: envías el audio de referencia directamente con la solicitud de voz. No se guarda nada, lo que encaja con trabajos puntuales.
  • Voces persistentes: creas una voz una sola vez, recibes un ID de voz reutilizable y lo usas en cualquier solicitud posterior. El modo de entrenamiento rápido predeterminado hace que la voz esté lista casi de inmediato.

Las voces guardadas son privadas por defecto. Puedes cambiar una a no listada, lo que genera un enlace para compartir, o a pública, lo que la coloca en la Biblioteca de voces de la comunidad.

Manos de un ingeniero de sonido apoyadas sobre los faders de una consola de mezcla analógica

Una solicitud al endpoint de TTS tiene este aspecto:

POST /v1/tts
Authorization: Bearer <your token>
model: s2.1-pro

{
  "text": "Your script goes here.",
  "reference_id": "<voice id>",
  "format": "mp3",
  "latency": "balanced"
}

El campo latency acepta balanced, que Fish Audio describe como unos 300 ms hasta el primer audio, o normal, que favorece la estabilidad. Los formatos de salida son mp3, wav, opus y pcm. El material de Fish Audio también menciona etiquetas de emoción en línea para controlar el tono, así que consulta la referencia de la API para ver la sintaxis exacta antes de depender de ellas.

Muestras, consentimiento y derechos

Una buena clonación empieza con una buena grabación. La documentación pide audio limpio, mono y de un solo hablante, de al menos 10 segundos por fragmento, y señala que un minuto o dos de habla clara mejoran la fidelidad. Acepta archivos wav, mp3, m4a y opus, y la eliminación de ruido de fondo está activada por defecto. Las páginas de marketing citan una muestra de 15 segundos en 30 o más idiomas, así que considera de 10 a 15 segundos como el mínimo, no como el objetivo.

Manos sosteniendo un teléfono para grabar una muestra de voz en un salón tranquilo

Los derechos importan más que el precio. Los suscriptores de pago pueden usar voces verificadas que son suyas para trabajos comerciales, mientras que la salida del plan gratuito se limita a proyectos personales y no comerciales. Revisa los términos de licencia de tu plan antes de publicar nada comercial, y si clonas la voz de un cliente o de un colaborador, pide primero un permiso por escrito.

💡 Regla general: clona tu propia voz, una voz que hayas contratado para ese fin o una voz con una autorización firmada. Nada más.

Planes web frente a la API

Fish Audio también vende planes mensuales para quienes trabajan en el estudio web en lugar de escribir código.

PlanPrecio mensualCréditosTiempo de generación indicadoExtras
Free$08,000unos 7 minutos500 caracteres por generación, 3 espacios de voz pública
Plus$11250,000hasta 200 minutos15,000 caracteres por generación, 10 voces privadas, 1 voz profesional
Pro$752,000,000hasta 1,620 minutos30,000 caracteres por generación, 5 voces profesionales, 3 puestos de equipo
Max$74925,000,000hasta 6,250 minutos15 voces profesionales, 10 puestos de equipo
EnterpriseA medida, facturación anualA medidaA medidaCero retención de datos, despliegue local, SOC2

La facturación anual reduce la tarifa mensual: Plus cuesta $132 al año, Pro $900 y Max $8,988.

Tres colegas comparando hojas de precios impresas alrededor de una mesa de madera

Dónde gana la API

Convierte los minutos indicados de cada plan en gasto de API a $1.25 por hora y la diferencia es grande.

PlanMinutos indicadosMismo audio con la APIPrecio del plan
Plus200unos $4.17$11
Pro1,620unos $33.75$75
Max6,250unos $130.21$749

Esas cifras de minutos son las que indica la propia página de planes, así que la comparación es aproximada. Aun así, el patrón es claro: un plan compra el estudio web, los espacios de voz y los puestos de equipo, mientras que el audio en bruto sale más barato por byte. Los desarrolladores, los trabajos por lotes y los flujos automatizados encajan mejor en la API. Los editores y los responsables de marketing que nunca abren una terminal pueden pagar con gusto por la interfaz.

Veamos un mes concreto para un pequeño equipo de podcast. Genera 40 horas de habla ($50.00), transcribe 40 horas de cinta de invitados en bruto ($14.40) y prueba 20 diseños de voz nuevos ($0.20). El total es $64.60. Eso es menos que el plan Pro de $75, que indica solo 27 horas de generación, y el equipo conserva el control total sobre la automatización y el almacenamiento.

Transcripción, diseño de voz y límites

Transcripción a $0.36 la hora

El reconocimiento de voz de Fish Audio cuesta $0.36 por hora de audio, facturado según la duración procesada redondeada al segundo más cercano. Diez horas de entrevistas cuestan $3.60, y cien horas cuestan $36. Combínala con TTS y podrás crear un ciclo que transcribe una grabación, edita el texto y devuelve el resultado hablado con una voz clonada.

Auriculares de estudio sobre una pila de páginas de transcripción marcadas con resaltador

Diseño de voz a un centavo

El diseño de voz crea voces nuevas a partir de una descripción escrita en lugar de una grabación, y una solicitud puede devolver varios candidatos. El cargo es de $0.01 por cada solicitud POST exitosa, y se aplica una sola vez sin importar cuántas voces candidatas se devuelvan. Cien intentos de diseño cuestan un dólar, así que experimenta sin miedo.

Niveles de concurrencia

Los límites de velocidad dependen de cuánto hayas pagado por adelantado:

NivelGasto prepagadoSolicitudes simultáneas
Startermenos de $1005
Elevated$100 o más15
High Volume$1,000 o más50
EnterpriseA medidaA medida

Un nivel se activa en cuanto alcanzas su umbral de prepago, y no hace falta gastar antes el saldo. Si planeas narrar unas 80 horas al mes ($100 de habla), una recarga de $100 compra tanto el audio como tres veces el paralelismo.

Pasillo estrecho entre racks de servidores negros en un centro de datos

Cómo se compara el precio

Los precios siguientes son los que indica la comparativa para desarrolladores de Fish Audio y una revisión de precios de un tercero. Tómalos como punto de partida y confírmalos en la página de cada proveedor.

MotorPrecio indicado por millón de caracteres
Fish Audio$15 (por millón de bytes)
Google Cloud TTS, voces estándar$4
Amazon Polly, estándar / neural$4 / $16
Azure TTS, voces neuronales$15
ElevenLabs Flash v2.5unos $60
ElevenLabs v2 Multilingualunos $120 a $165

Lo que oculta la tabla

El precio no equivale a calidad. Las revisiones de precios de terceros indican que S2 Pro de Fish Audio obtiene buenas puntuaciones en pruebas de escucha a ciegas, mientras que ElevenLabs ofrece el conjunto de funciones más completo. Un motor barato que necesita tres renders por párrafo ya no es barato. Los alfabetos no latinos también alteran las cuentas, porque los bytes triplican el costo del japonés y del chino.

La solución es una prueba comparativa: ejecuta el mismo guion de 200 palabras en varios motores y juzga con el oído. En Picasso IA puedes hacerlo en un solo lugar con ElevenLabs v3, MiniMax Speech 2.8 HD, Qwen3 TTS, Chatterbox y Gemini 3.1 Flash TTS.

Ejecuta la clonación de voz en PicassoIA

Si quieres escuchar un clon antes de escribir código de integración, MiniMax Voice Cloning convierte una grabación corta en un perfil de voz reutilizable. PicassoIA lo ofrece para probar en línea sin costo, sin necesidad de programar.

Elige el modelo y la muestra

  1. Abre la página de MiniMax Voice Cloning y sube tu archivo de voz: MP3, M4A o WAV, de 10 segundos a 5 minutos, de menos de 20 MB.
  2. Activa la reducción de ruido si la grabación tiene siseo o ambiente de la habitación, y la normalización de volumen si el nivel fluctúa.
  3. Deja la precisión en el valor predeterminado de 0.7 al principio. Define el umbral de validación del texto entre 0 y 1.
  4. Elige el nivel de voz con el que entrenar. El predeterminado es Speech 2.6 HD, y Speech 2.6 Turbo es la opción más rápida.

Genera voz con el clon

Ejecuta el modelo y obtendrás un perfil de voz que puedes reutilizar en tantas conversiones de texto a voz como necesite el proyecto. Pasa tu guion por el nivel de voz con el que entrenaste y luego compara el resultado con lo que oyes en la API de Fish Audio.

Podcaster con auriculares mirando un equipo portátil en un estudio casero acogedor

💡 Mejor muestra, mejor clon: graba 30 segundos a tu ritmo natural en una habitación con alfombra y cortinas, sin música de fondo.

El mismo espacio de trabajo cubre el resto del flujo de audio. Añade una base musical con Stable Audio 2.5, MiniMax Music 2.6 o ElevenLabs Music, y después revisa la narración volviéndola a pasar por GPT-4o Transcribe o Gemini 3 Pro.

Crea tu flujo de voz en Picasso IA

Las tablas de precios responden cuánto cuesta una voz. Solo tus propios oídos responden si vale la pena. Abre Picasso IA, sube una muestra corta a MiniMax Voice Cloning, lee el mismo párrafo con dos o tres modelos de voz y anota cuál confiarías para tu marca.

Después añade música y una comprobación de la transcripción, y tendrás un borrador de un flujo de audio completo antes de gastar un centavo en un contrato de API. Un plan de prueba sencillo funciona bien:

  • Clona una muestra de 30 segundos de tu propia voz.
  • Narra las mismas 200 palabras con tres modelos de voz distintos.
  • Transcribe cada resultado y cuenta las palabras que el motor ha transcrito mal.
  • Calcula el precio del ganador con la aritmética por bytes de arriba.

Empieza hoy con un guion corto, compara los resultados lado a lado y deja que los clips que de verdad disfrutas decidan qué motor recibe tu presupuesto.

Compartir este artículo

Elige tu idioma