API de Fish Audio: precios de TTS y clonación de voz, línea por línea
Fish Audio cobra por la conversión de texto a voz $15 por millón de bytes UTF-8, la transcripción a $0.36 por hora de audio y el diseño de voz a un centavo por solicitud. Este desglose convierte esas tarifas en presupuestos reales para tus proyectos, compara los planes web con la API y muestra dónde encaja la clonación de voz.
Fish Audio vende la voz por bytes, y ese detalle explica casi todas las sorpresas en la factura. La API de Fish Audio cobra $15 por millón de bytes UTF-8 de texto para la conversión de texto a voz, $0.36 por hora de audio para la transcripción y $0.01 por solicitud para el diseño de voz. La clonación de voz no tiene una línea propia en esa tabla de tarifas, lo que hace que presupuestarla sea más sencillo de lo que parece al principio.
Este desglose convierte esas tarifas en presupuestos reales de proyecto: una entrada de blog, un audiolibro, un bot de soporte, un mes de intros para un podcast. También verás cómo se comparan los planes web con la API, dónde aprietan los límites de velocidad y cómo se sitúa el precio frente a otros motores de voz. Las cifras provienen de los precios publicados por Fish Audio y de su documentación para desarrolladores, pueden cambiar, así que revísalas antes de comprometer dinero.
💡 Respuesta rápida: una hora de habla en inglés cuesta unos $1.25 a través de la API. Un artículo de 1,000 palabras, narrado de principio a fin, cuesta unos 8 centavos.
Lo que cobra Fish Audio por byte
La tabla de tarifas
Todos los precios del lado de desarrollador caben en una sola tabla.
Servicio
Modelo o función
Precio
Texto a voz
s2.1-pro
$15.00 por millón de bytes UTF-8
Texto a voz
s2-pro
$15.00 por millón de bytes UTF-8
Texto a voz
s1
$15.00 por millón de bytes UTF-8
Texto a voz
s2.1-pro-free
$0.00 por millón de bytes UTF-8
Transcripción
ambos modelos disponibles
$0.36 por hora de audio
Diseño de voz
cada solicitud exitosa
$0.01
La documentación recomienda s2.1-pro para proyectos nuevos, y los tres modelos de pago comparten precio, así que elegir entre ellos es una decisión de calidad, no de dinero. La versión gratuita de s2.1-pro aparece con costo cero, lo que resulta práctico para prototipar mientras pruebas un guion.
La referencia propia de Fish Audio: un millón de bytes equivale a unas 180,000 palabras en inglés, o unas 12 horas de habla. Divide $15 entre 12 y obtendrás la cifra que vale la pena memorizar: $1.25 por hora de audio terminado.
Por qué bytes y no caracteres
Un byte es lo que ocupa tu texto una vez codificado en UTF-8. En inglés sencillo, un carácter equivale a un byte, así que $15 por millón de bytes también son $15 por millón de caracteres. Otros alfabetos rompen esa equivalencia:
Las letras latinas con acento y el cirílico ocupan unos 2 bytes cada una.
Los caracteres chinos, japoneses y coreanos ocupan unos 3 bytes cada uno.
Los emoji ocupan 4 bytes.
Los espacios y los signos de puntuación también son bytes, así que un guion cargado de acotaciones cuesta más que el mismo guion recortado.
💡 Mide antes de enviar: en Python, len(text.encode("utf-8")) devuelve el número exacto de bytes de un guion. Multiplícalo por 0.000015 y tendrás el precio en dólares.
Costos reales para proyectos reales
Las cifras de una tabla de tarifas parecen abstractas hasta que las asocias a un trabajo concreto. Estos ejemplos usan la proporción propia de Fish Audio de 180,000 palabras por millón de bytes.
Trabajo
Duración del audio
Bytes enviados
Costo
Un artículo de 1,000 palabras
unos 4 minutos
unos 5,600
unos $0.08
30 resúmenes diarios de cinco minutos
2.5 horas
unos 208,000
unos $3.13
Un audiolibro de 80,000 palabras
unas 5.3 horas
unos 444,000
unos $6.67
10,000 respuestas de soporte de 300 caracteres
unas 36 horas
3,000,000
$45.00
Un millón de caracteres japoneses
varía
unos 3,000,000
unos $45.00
Narración y audiolibros
Un audiolibro entero por menos de lo que cuesta un sándwich es el titular aquí. Incluso una producción generosa, con cinco renders completos de un título de 80,000 palabras, se queda cerca de $33. La factura sigue al texto que envías, no a los segundos que devuelve, así que ralentizar la voz con el control de velocidad (la documentación permite de 0.5 a 2.0) no sube el precio.
Bots y alto volumen
Los mensajes cortos suman sin que te des cuenta. Un bot de soporte que responde 10,000 preguntas con respuestas de 300 caracteres consume tres millones de bytes, es decir, $45. Guarda en caché cualquier respuesta que se repita. Un saludo que se reproduce 50,000 veces debería generarse una sola vez y almacenarse.
Alfabetos no latinos
Presupuesta en bytes, no en caracteres, siempre que el texto no esté en inglés. Un millón de caracteres japoneses o chinos cuesta unos $45, tres veces la cifra del inglés, y el cirílico se queda cerca de $30. El audio no es más largo, pero el contador mide el tamaño codificado.
Cuatro formas de reducir la factura
Los pequeños hábitos importan cuando crece el volumen:
Prototipa con la versión gratuita. Ajusta el ritmo y la puntuación en s2.1-pro-free, revisa sus límites en la documentación y luego genera las versiones finales con un modelo de pago.
Quita lo superfluo. Elimina las acotaciones, los espacios en blanco repetidos y el marcado sobrante antes de enviar el texto.
Guarda en caché las frases que se repiten. Los saludos, los mensajes de menú y los avisos legales deben generarse una vez y almacenarse.
Renderiza por párrafos. Así, una errata te cuesta un párrafo y no un capítulo entero.
Clonación de voz y lo que cuesta
La tabla de tarifas no incluye ningún cargo por clonación. Según la página de precios, generar habla con una voz clonada se factura como conversión de texto a voz normal, por byte. Lo que cambia es el flujo de trabajo.
Clonación instantánea frente a voces guardadas
La documentación describe dos vías:
Clonación instantánea: envías el audio de referencia directamente con la solicitud de voz. No se guarda nada, lo que encaja con trabajos puntuales.
Voces persistentes: creas una voz una sola vez, recibes un ID de voz reutilizable y lo usas en cualquier solicitud posterior. El modo de entrenamiento rápido predeterminado hace que la voz esté lista casi de inmediato.
Las voces guardadas son privadas por defecto. Puedes cambiar una a no listada, lo que genera un enlace para compartir, o a pública, lo que la coloca en la Biblioteca de voces de la comunidad.
Una solicitud al endpoint de TTS tiene este aspecto:
El campo latency acepta balanced, que Fish Audio describe como unos 300 ms hasta el primer audio, o normal, que favorece la estabilidad. Los formatos de salida son mp3, wav, opus y pcm. El material de Fish Audio también menciona etiquetas de emoción en línea para controlar el tono, así que consulta la referencia de la API para ver la sintaxis exacta antes de depender de ellas.
Muestras, consentimiento y derechos
Una buena clonación empieza con una buena grabación. La documentación pide audio limpio, mono y de un solo hablante, de al menos 10 segundos por fragmento, y señala que un minuto o dos de habla clara mejoran la fidelidad. Acepta archivos wav, mp3, m4a y opus, y la eliminación de ruido de fondo está activada por defecto. Las páginas de marketing citan una muestra de 15 segundos en 30 o más idiomas, así que considera de 10 a 15 segundos como el mínimo, no como el objetivo.
Los derechos importan más que el precio. Los suscriptores de pago pueden usar voces verificadas que son suyas para trabajos comerciales, mientras que la salida del plan gratuito se limita a proyectos personales y no comerciales. Revisa los términos de licencia de tu plan antes de publicar nada comercial, y si clonas la voz de un cliente o de un colaborador, pide primero un permiso por escrito.
💡 Regla general: clona tu propia voz, una voz que hayas contratado para ese fin o una voz con una autorización firmada. Nada más.
Planes web frente a la API
Fish Audio también vende planes mensuales para quienes trabajan en el estudio web en lugar de escribir código.
Plan
Precio mensual
Créditos
Tiempo de generación indicado
Extras
Free
$0
8,000
unos 7 minutos
500 caracteres por generación, 3 espacios de voz pública
Plus
$11
250,000
hasta 200 minutos
15,000 caracteres por generación, 10 voces privadas, 1 voz profesional
Pro
$75
2,000,000
hasta 1,620 minutos
30,000 caracteres por generación, 5 voces profesionales, 3 puestos de equipo
Max
$749
25,000,000
hasta 6,250 minutos
15 voces profesionales, 10 puestos de equipo
Enterprise
A medida, facturación anual
A medida
A medida
Cero retención de datos, despliegue local, SOC2
La facturación anual reduce la tarifa mensual: Plus cuesta $132 al año, Pro $900 y Max $8,988.
Dónde gana la API
Convierte los minutos indicados de cada plan en gasto de API a $1.25 por hora y la diferencia es grande.
Plan
Minutos indicados
Mismo audio con la API
Precio del plan
Plus
200
unos $4.17
$11
Pro
1,620
unos $33.75
$75
Max
6,250
unos $130.21
$749
Esas cifras de minutos son las que indica la propia página de planes, así que la comparación es aproximada. Aun así, el patrón es claro: un plan compra el estudio web, los espacios de voz y los puestos de equipo, mientras que el audio en bruto sale más barato por byte. Los desarrolladores, los trabajos por lotes y los flujos automatizados encajan mejor en la API. Los editores y los responsables de marketing que nunca abren una terminal pueden pagar con gusto por la interfaz.
Veamos un mes concreto para un pequeño equipo de podcast. Genera 40 horas de habla ($50.00), transcribe 40 horas de cinta de invitados en bruto ($14.40) y prueba 20 diseños de voz nuevos ($0.20). El total es $64.60. Eso es menos que el plan Pro de $75, que indica solo 27 horas de generación, y el equipo conserva el control total sobre la automatización y el almacenamiento.
Transcripción, diseño de voz y límites
Transcripción a $0.36 la hora
El reconocimiento de voz de Fish Audio cuesta $0.36 por hora de audio, facturado según la duración procesada redondeada al segundo más cercano. Diez horas de entrevistas cuestan $3.60, y cien horas cuestan $36. Combínala con TTS y podrás crear un ciclo que transcribe una grabación, edita el texto y devuelve el resultado hablado con una voz clonada.
Diseño de voz a un centavo
El diseño de voz crea voces nuevas a partir de una descripción escrita en lugar de una grabación, y una solicitud puede devolver varios candidatos. El cargo es de $0.01 por cada solicitud POST exitosa, y se aplica una sola vez sin importar cuántas voces candidatas se devuelvan. Cien intentos de diseño cuestan un dólar, así que experimenta sin miedo.
Niveles de concurrencia
Los límites de velocidad dependen de cuánto hayas pagado por adelantado:
Nivel
Gasto prepagado
Solicitudes simultáneas
Starter
menos de $100
5
Elevated
$100 o más
15
High Volume
$1,000 o más
50
Enterprise
A medida
A medida
Un nivel se activa en cuanto alcanzas su umbral de prepago, y no hace falta gastar antes el saldo. Si planeas narrar unas 80 horas al mes ($100 de habla), una recarga de $100 compra tanto el audio como tres veces el paralelismo.
Cómo se compara el precio
Los precios siguientes son los que indica la comparativa para desarrolladores de Fish Audio y una revisión de precios de un tercero. Tómalos como punto de partida y confírmalos en la página de cada proveedor.
El precio no equivale a calidad. Las revisiones de precios de terceros indican que S2 Pro de Fish Audio obtiene buenas puntuaciones en pruebas de escucha a ciegas, mientras que ElevenLabs ofrece el conjunto de funciones más completo. Un motor barato que necesita tres renders por párrafo ya no es barato. Los alfabetos no latinos también alteran las cuentas, porque los bytes triplican el costo del japonés y del chino.
Si quieres escuchar un clon antes de escribir código de integración, MiniMax Voice Cloning convierte una grabación corta en un perfil de voz reutilizable. PicassoIA lo ofrece para probar en línea sin costo, sin necesidad de programar.
Elige el modelo y la muestra
Abre la página de MiniMax Voice Cloning y sube tu archivo de voz: MP3, M4A o WAV, de 10 segundos a 5 minutos, de menos de 20 MB.
Activa la reducción de ruido si la grabación tiene siseo o ambiente de la habitación, y la normalización de volumen si el nivel fluctúa.
Deja la precisión en el valor predeterminado de 0.7 al principio. Define el umbral de validación del texto entre 0 y 1.
Elige el nivel de voz con el que entrenar. El predeterminado es Speech 2.6 HD, y Speech 2.6 Turbo es la opción más rápida.
Genera voz con el clon
Ejecuta el modelo y obtendrás un perfil de voz que puedes reutilizar en tantas conversiones de texto a voz como necesite el proyecto. Pasa tu guion por el nivel de voz con el que entrenaste y luego compara el resultado con lo que oyes en la API de Fish Audio.
💡 Mejor muestra, mejor clon: graba 30 segundos a tu ritmo natural en una habitación con alfombra y cortinas, sin música de fondo.
Las tablas de precios responden cuánto cuesta una voz. Solo tus propios oídos responden si vale la pena. Abre Picasso IA, sube una muestra corta a MiniMax Voice Cloning, lee el mismo párrafo con dos o tres modelos de voz y anota cuál confiarías para tu marca.
Después añade música y una comprobación de la transcripción, y tendrás un borrador de un flujo de audio completo antes de gastar un centavo en un contrato de API. Un plan de prueba sencillo funciona bien:
Clona una muestra de 30 segundos de tu propia voz.
Narra las mismas 200 palabras con tres modelos de voz distintos.
Transcribe cada resultado y cuenta las palabras que el motor ha transcrito mal.
Calcula el precio del ganador con la aritmética por bytes de arriba.
Empieza hoy con un guion corto, compara los resultados lado a lado y deja que los clips que de verdad disfrutas decidan qué motor recibe tu presupuesto.