Comparativa de precios de API de IA 2027: imágenes, video, voz y LLM

Precios reales de lista de los tokens de LLM, las generaciones de imágenes, los segundos de video y los caracteres de voz, uno al lado del otro. Mira cuánto cuestan un bot de soporte, 1.000 imágenes, 100 clips de video y una narración de diez minutos, además de los cargos ocultos, los reintentos y los descuentos que cambian el total.

Comparativa de precios de API de IA 2027: imágenes, video, voz y LLM
Cristian Da Conceicao
Fundador de Picasso IA

Elegir una API de IA por su precio anunciado es la manera más común de que los presupuestos se disparen. Una tarifa baja por token significa poco cuando tu carga de trabajo consume diez veces más tokens, y un precio barato por segundo de video cambia rápido en cuanto añades 1080p, audio y algunos reintentos. Esta comparativa de precios de API de IA pone en paralelo los precios reales de lista de los modelos de lenguaje, los generadores de imágenes, los modelos de video y el texto a voz, y los convierte en facturas mensuales que puedes contrastar con tu propia carga de trabajo.

En resumen: los precios de los LLM abarcan un rango de 100x desde el nivel más barato hasta el más caro, un modelo de imágenes oscila 35x entre sus ajustes de calidad baja y alta, el video va de $0,02 a $0,60 por segundo, y la voz va de medio centavo a diez centavos por cada 1.000 caracteres. Las tarifas siguientes se revisaron en octubre de 2026 frente a las tarifas oficiales de los proveedores y a rastreadores públicos de precios. Trata cada cifra como una foto del momento y confírmala en la página del proveedor antes de comprometer un presupuesto.

Manos de un desarrollador escribiendo en un escritorio ordenado junto a una lámpara cálida de latón

Cómo funciona realmente la facturación de las API

Cuatro modalidades, cuatro contadores distintos. Confundirlos es la razón más común por la que una API «barata» acaba saliendo cara.

Cuatro unidades, cuatro sorpresas

  • Los LLM se facturan por millón de tokens. Los tokens de salida cuestan aproximadamente 5 a 6 veces más que los de entrada, así que las respuestas largas encarecen la factura, no los prompts largos.
  • Las imágenes se facturan por imagen, por megapíxel o por token. Los ajustes de calidad y resolución pueden multiplicar el precio por 35x en el mismo modelo.
  • El video se factura por segundo de salida. Los niveles de resolución y el audio cambian la tarifa, y algunos modelos facturan por token, así que cualquier cifra por segundo es solo una estimación.
  • La voz se factura por cada 1.000 caracteres o por segundo de audio generado. Es la categoría más barata, pero el nivel del modelo sigue haciendo que el costo varíe 20x.

Descuentos que de verdad existen

Cuatro palancas aparecen en casi todos los proveedores:

  1. El procesamiento por lotes reduce los precios de los tokens un 50% para los trabajos que pueden esperar. Anthropic lo documenta con claridad, y OpenAI ofrece la misma reducción a la mitad.
  2. La caché de prompts factura el contexto repetido a alrededor del 10% del precio normal de entrada. En Claude Opus 5.5 y Claude Sonnet 5.5, una lectura de caché baja al 5%, y en Claude Fable 5.1 al 2,5%.
  3. Las ventanas promocionales son reales pero temporales. GPT 5.6 Sol cuesta $4 de entrada y $20 de salida hasta al menos el 21 de noviembre de 2026, y ElevenLabs v4 tiene un descuento del 72% que termina el 12 de octubre. Presupuesta al precio regular.
  4. La residencia de datos funciona al revés. Fijar la inferencia de Claude a EE. UU. añade un multiplicador de 1,1x en cada categoría de tokens.

Vista cenital de una calculadora, un recibo y una libreta con sumas escritas a mano sobre un escritorio de nogal

Precios de API de LLM, lado a lado

Los modelos de lenguaje tienen la mayor dispersión de precios de todas las categorías aquí, y el tramo medio del mercado se ha ido igualando sin hacer ruido.

La tabla de tarifas

Los precios están en USD por millón de tokens, a tarifas estándar sin lotes.

ModeloEntradaSalidaNotas
Claude Haiku 5.5$0,10$0,50Prompts de hasta 100k tokens
GPT 5.6 Luna$0,20$1,20Nivel rápido
Gemini 3.5 Flash$1,50$9,00Nivel rápido
Claude Sonnet 5$2,00$10,00Sonnet 5.5 cuesta lo mismo
GPT 5.6 Terra$2,00$12,00Nivel medio
Gemini 3.1 Pro$2,00$12,00$4 / $18 por encima de prompts de más de 200k tokens
GPT 5.6 Sol$4,00$20,00Tarifa promocional hasta el 21 de noviembre
Claude Opus 5.5$4,00$20,00Nivel de razonamiento más alto
Claude Fable 5$10,00$50,00El más caro de esta lista

Las cifras de Anthropic y Google proceden de sus propias páginas de precios. Las de OpenAI proceden de rastreadores públicos, porque la página de OpenAI no era legible cuando lo comprobé, así que verifícalas antes de hacer una previsión.

💡 Compara primero los precios de salida. Tres modelos de nivel medio comparten la misma tarifa de entrada de $2, así que la diferencia real está en la salida: $10 para Sonnet 5, $12 para Terra y Gemini 3.1 Pro. En cargas de trabajo con mucho chat, esa diferencia del 20% pesa más que la tarifa de entrada.

Cuánto cuesta un bot de soporte

Tomemos un asistente de soporte pequeño que envía 10 millones de tokens de entrada y recibe 2 millones de tokens de salida al mes.

ModeloCosto mensual
Claude Haiku 5.5$2,00
GPT 5.6 Luna$4,40
Gemini 3.5 Flash$33,00
Claude Sonnet 5.5$40,00
GPT 5.6 Terra$44,00
Gemini 3.1 Pro$44,00
GPT 5.6 Sol$80,00
Claude Opus 5.5$80,00
Claude Fable 5.1$200,00

Las opciones más baratas y más caras difieren exactamente 100x con el mismo tráfico. La mayoría de las preguntas de soporte no necesitan un modelo de frontera, así que envía los tickets rutinarios a un nivel pequeño y reserva los difíciles para los niveles superiores.

La caché cambia el panorama de nuevo. Si el 80% de esos tokens de entrada son instrucciones repetidas servidas desde la caché a la tarifa de lectura de $0,10 por millón de Sonnet 5.5, el gasto de entrada baja de $20 a unos $4,80 y el total de $40 a unos $25, antes de los costos únicos de escritura en caché. El procesamiento por lotes se suma encima, así que un trabajo que puede esperar hasta la noche queda cerca de $12.

Cuatro compañeros reunidos frente a una pizarra llena de notas adhesivas en una oficina luminosa

Costos de generación de imágenes por imagen

Las API de imágenes parecen baratas hasta que te das cuenta de cuántos ajustes de calidad hay detrás de un solo nombre de modelo.

Tabla de precios por imagen

ModeloPrecio por imagenNotas
GPT Image 2$0,006 baja, $0,053 media, $0,211 altaPrecios de lista a 1024x1024
Nano Banana 2$0,0336 a 1K, $0,0504 a 2K, $0,113 a 4KGoogle publica la actualización 2.1 a estas tarifas
Seedream 5 ProAlrededor de $0,035Estimación de un rastreador
FLUX.2 proAlrededor de $0,03 por megapíxelEstimación de un rastreador
Nano Banana 2 LiteAlrededor de $0,01Estimación de un rastreador

La trampa del nivel de calidad

Genera 1.000 imágenes al mes y el mismo modelo de OpenAI cuesta $6 en calidad baja, $53 en media y $211 en alta. Nano Banana 2 a 2K se queda cerca de $50, Seedream 5 Pro cerca de $35 y Nano Banana 2 Lite cerca de $10. El ajuste que dejas por defecto decide la factura más que el modelo que elijas.

Los revendedores añaden otra capa. Una pasarela listaba GPT Image 2 exactamente al doble de la tarifa de OpenAI en cada nivel, lo que convierte un trabajo de $211 en uno de $422 sin ningún cambio en el resultado.

💡 Borrador en baja, acabado en alta. Genera los conceptos en el nivel más barato, elige los ganadores y vuelve a renderizar solo esos a calidad completa. Un 10% de finalistas en calidad alta sigue costando mucho menos que renderizarlo todo en alta.

Primer plano del objetivo de una cámara sin espejo con fotografías impresas desenfocadas detrás

Precios de API de video por segundo

El video es donde una suposición equivocada cuesta dinero de verdad, porque cada segundo se factura y cada reintento repite el precio completo.

Tabla de tarifas con audio

ModeloPrecio por segundoNotas
P Video$0,02 a 720p, $0,04 a 1080pAudio incluido
Veo 3.1 Lite$0,05 a 720p, $0,08 a 1080pAudio incluido
Grok Imagine Video 1.5$0,08Hasta 1080p
Veo 3.1 Fast$0,10 a 720p, $0,12 a 1080p, $0,30 a 4KAudio incluido
Kling v3 VideoAlrededor de $0,11Nivel Turbo oficial, 720p
HappyHorse 1.1Alrededor de $0,125 a 720p, $0,22 a 1080pAudio y video conjuntos
LTX 2.3 Fast$0,06 a $0,24De 1080p hasta 4K
Veo 3.1$0,40 a 720p y 1080p, $0,60 a 4KNivel de calidad máximo

Las tarifas de Veo, Grok y P Video las publican sus creadores. Las cifras de Kling y HappyHorse se convierten desde yuanes, así que se aplica el redondeo de moneda.

Cuánto cuestan 100 clips

Supongamos 100 clips de 8 segundos a 720p, es decir, 800 segundos de material.

  • P Video: $16
  • Veo 3.1 Lite: $40
  • Grok Imagine Video 1.5: $64
  • Veo 3.1 Fast: $80
  • Kling 3.0 Turbo: $88
  • HappyHorse: $100
  • Veo 3.1: $320

Esos totales suponen que cada clip es utilizable. Con una tasa de aprovechamiento del 30%, necesitas unas 333 generaciones para quedarte con 100 clips buenos, así que la línea de Veo 3.1 Fast pasa de $80 a unos $267.

Tres trampas se esconden detrás de estas cifras. Seedance 2.0 y su variante Fast facturan por token, así que los precios por segundo son estimaciones, y los revendedores cotizan desde unos $0,09 hasta $0,25. Subir a 4K multiplica el costo por 1,5x a 3x. Y los revendedores suelen cobrar entre 2x y 3x por encima de las tarifas oficiales.

💡 Comprueba la disponibilidad antes de presupuestar. La API de Sora 2 de OpenAI estaba programada para cerrar el 24 de septiembre de 2026. Sora 2 sigue apareciendo en los catálogos de modelos, así que confirma dónde funciona antes de construir un pipeline sobre él.

Vista desde abajo de una cámara de cine sobre un trípode en un pequeño estudio junto a una softbox

Precios de voz y habla

El habla es la modalidad más barata, así que la calidad y el soporte de idiomas suelen importar más que el precio.

Comparativa por cada 1.000 caracteres

ModeloPrecioNotas
Inworld TTS (línea anterior)$0,005 estándar, $0,01 MaxPor millón: $5 y $10
Gemini Flash TTSAlrededor de $0,00225 por 10 segundosNivel Flash más reciente de Google, facturado por tokens de audio
ElevenLabs Flash and Turbo$0,04Nivel de baja latencia
MiniMax Speech 2.8 Turbo$0,06Por millón: $60
ElevenLabs v3$0,08Nivel expresivo
ElevenLabs v2 Multilingual$0,08Más de 30 idiomas
MiniMax Speech 2.8 HD$0,10Por millón: $100

Una narración de diez minutos ronda los 9.000 caracteres. Eso cuesta unos $0,09 en el nivel Max de Inworld, $0,14 en Gemini Flash TTS, $0,36 en ElevenLabs Flash, $0,54 en MiniMax Turbo, $0,72 en ElevenLabs v3 y $0,90 en MiniMax HD. Cien de esas narraciones en la opción más cara suman $90. La facturación por tokens de audio y la facturación por carácter no se convierten de forma perfecta, así que prueba con la longitud real de tu guion.

ElevenLabs v4 figura a $0,08 por 1.000 caracteres y v4 Turbo a $0,04, con un descuento de lanzamiento del 72% que termina el 12 de octubre. Las cifras de Inworld proceden de su línea anterior TTS-1, así que revisa los modelos 1.5 antes de fiarte de ellas.

Perfil lateral de una mujer hablando frente a un micrófono de condensador de estudio con auriculares puestos

Costos ocultos que rompen presupuestos

Los precios de lista son el suelo, no la previsión.

Reintentos, límites y salidas largas

  • Salidas descartadas. Si el 20% de las generaciones se descarta, tu precio efectivo sube un 25%, porque pagas cinco ejecuciones para quedarte con cuatro.
  • Longitud de la salida. Los tokens de salida cuestan de 5 a 6 veces más que los de entrada, y los tokens de razonamiento cuentan como salida. Un modelo de razonamiento puede inflar la factura sin una respuesta visible más larga.
  • Límites de concurrencia. La API de PicassoIA permite 5 predicciones en curso a la vez por cuenta, y muchos proveedores suben los límites según el nivel de gasto. Esperar en una cola cuesta tiempo de ingeniería.
  • Recargos de revendedores. Las pasarelas pueden cobrar entre 2x y 3x las tarifas oficiales a cambio de una sola factura y una sola integración.

Manos tachando elementos de una lista de verificación escrita a mano junto a un cronómetro plateado

Dónde están los ahorros

  1. Enruta según la dificultad. Envía las peticiones fáciles al nivel más barato y escala solo cuando falle.
  2. Procesa por lotes todo lo que pueda esperar. La mitad de precio en tokens es el mayor descuento individual disponible.
  3. Pon en caché el contexto estático. Los prompts de sistema, las guías de estilo de marca y los documentos de referencia son ideales.
  4. Baja la resolución mientras iteras. El video a 720p y las imágenes de calidad baja bastan para los borradores.
  5. Limita la longitud de la salida. Un límite máximo de tokens evita generaciones desbocadas.

Estas palancas se acumulan. Un equipo que enruta la mayoría de los tickets a un modelo pequeño, pone en caché sus instrucciones y procesa por lotes sus informes nocturnos puede pagar una fracción del precio de lista por el mismo resultado, mientras que un equipo que deja todo por defecto paga la tarifa completa por todo.

Vista aérea de un almacén de distribución ordenado con filas de palés envueltos

Prueba precios en PicassoIA

Leer una tabla de tarifas te dice cuánto cuesta un modelo. Ejecutarlo te dice si el resultado vale ese costo. PicassoIA aloja más de 120 modelos de video, 75 modelos de lenguaje y 24 modelos de voz, además de un amplio catálogo de imágenes, así que puedes comparar niveles en paralelo antes de elegir uno para producción.

Ejecuta el mismo prompt dos veces

  1. Elige dos modelos de la misma categoría, como Seedream 5 Pro y FLUX.2 pro.
  2. Abre la página de cada modelo y pega un prompt idéntico de tu carga de trabajo real.
  3. Iguala los ajustes: relación de aspecto, resolución y calidad.
  4. Compara los resultados a tamaño completo y anota cuál publicarías de verdad.
  5. Divide el precio por unidad del proveedor entre tu tasa de aprovechamiento. El modelo que gana en costo por resultado aprovechable es tu verdadera elección.

Automatiza con la API

PicassoIA también ofrece una API para desarrolladores en https://api.picassoia.com/v1, autenticada con un token Bearer que empieza por pia_sk_. Los trabajos son asíncronos: creas una predicción, consultas su estado y obtienes el resultado.

EndpointFunción
POST /v1/models/{owner}/{name}/predictionsCrear una predicción
GET /v1/predictions/{id}Consultar el estado y obtener la salida
POST /v1/predictions/{id}/cancelCancelar un trabajo en curso
GET /v1/predictionsListar predicciones recientes

Cuatro modelos están disponibles a través de la API: PicassoIA Image, PicassoIA Image Editor Pro, PicassoIA Video y Seedance 2.5 Lite. La documentación indica actualmente que las predicciones de la API son gratuitas y no usan créditos, y que se requiere un plan Infinite. Confirma ambas cosas en la página de la API antes de planificar en torno a ellas, ya que las condiciones del plan pueden cambiar.

Haz tu propia prueba de precios

La mejor API de IA es la que da resultados publicables a un precio que tu volumen puede soportar, y solo tus propios prompts pueden decirte cuál es. Toma una tarea real de cada categoría, ejecútala en un nivel barato y en uno premium, y anota el costo por resultado aprovechable. Cinco minutos de prueba valen más que una tarde leyendo tablas de tarifas.

Picasso IA reúne esos modelos en un solo lugar, para que puedas generar imágenes, video, voz y texto sin abrir una cuenta aparte con cada proveedor. Empieza con un prompt de tu propio proyecto, prueba GPT Image 2 junto a PicassoIA Image y mira qué resultado enviarías de verdad. Cuando quieras comparar más, explora todas las opciones en la página de todos los modelos.

Profesional creativo en un estudio tipo loft iluminado por el sol revisando fotografías terminadas en un monitor grande

Compartir este artículo

Elige tu idioma