API de texto a imagen: opciones gratuitas, Hugging Face y de pago

Una API de texto a imagen envía una solicitud y devuelve una imagen terminada, pero la elección del proveedor decide tu costo y tus límites. Descubre qué ofrecen de verdad los niveles gratuitos y los créditos de Hugging Face, cuánto cobran las APIs de pago y cómo probar Flux 2 Pro de PicassoIA antes de escribir una sola línea de código.

API de texto a imagen: opciones gratuitas, Hugging Face y de pago
Cristian Da Conceicao
Fundador de Picasso IA

Una API de texto a imagen convierte una solicitud HTTP en una imagen terminada. Obtener un resultado ya no es lo difícil. Lo difícil es elegir a dónde enviar la solicitud. Algunos servicios regalan unas cuantas generaciones gratuitas al mes, Hugging Face envía tus llamadas a proveedores asociados con una pequeña asignación mensual de créditos, y las plataformas de pago cobran por imagen o por segundo de tiempo de GPU. Si eliges mal, topas con un límite de uso el día del lanzamiento o pagas varias veces más de lo que el trabajo necesitaba.

Este artículo compara las tres rutas con cifras públicas cuando existen, código Python que funciona, una tabla comparativa y una lista breve para asociar un modelo a cada trabajo. Tanto si estás creando un prototipo de fin de semana como un proyecto para un cliente o un producto con miles de usuarios, encontrarás más abajo un punto de partida sensato.

💡 Respuesta corta: Prueba con créditos mensuales gratuitos o con un modelo local. Cuando clientes reales empiecen a usar la función, pasa a una API de pago por imagen con una licencia clara y un límite de uso publicado.

Qué hace una API de texto a imagen

Una API de texto a imagen es un endpoint web. Envías un prompt con algunos ajustes, como el tamaño, la relación de aspecto y la semilla, y recibes de vuelta un archivo de imagen o un enlace a uno. El trabajo pesado se ejecuta en la GPU de otro, así que tu aplicación no necesita tarjeta gráfica ni pesos del modelo.

La mayoría de los endpoints aceptan los mismos campos básicos. El prompt describe la imagen. La relación de aspecto o el tamaño en píxeles define el lienzo. La semilla hace que un resultado sea repetible, de modo que el mismo prompt y la misma semilla devuelven la misma imagen. Algunos modelos añaden pasos, un valor de guidance scale o un prompt negativo, mientras que los más nuevos prescinden de ellos y confían solo en el prompt. Lee la lista de parámetros de un modelo antes de copiar ajustes de otro, porque un valor que ayuda a un modelo puede perjudicar a otro.

El ciclo de solicitud y respuesta

Todos los proveedores siguen el mismo ciclo básico, aunque cambien los nombres de los campos:

  1. Autentica la solicitud con un token bearer en el encabezado Authorization.
  2. Envía el prompt y los ajustes en formato JSON.
  3. Recibe la imagen como bytes sin procesar, una cadena base64 o un enlace de descarga.
  4. Guarda el archivo en tu propio almacenamiento.

El paso cuatro da problemas a más personas que cualquier otro. Muchos proveedores eliminan los resultados después de un plazo corto, así que un enlace que funciona en las pruebas puede morir en silencio al día siguiente. Un blog lleno de imágenes rotas es una lección cara. Sube cada resultado a almacenamiento de objetos en cuanto llegue y guarda el prompt, la semilla y el nombre del modelo junto al archivo. Ese hábito sencillo te permite regenerar una imagen perdida más tarde, o reproducir un estilo que te gustó, sin buscar entre registros antiguos.

Cuaderno con flechas de solicitud y respuesta dibujadas a mano sobre un escritorio de nogal

Síncrono, asíncrono y webhooks

Los modelos rápidos responden dentro de la misma llamada HTTP. Los modelos más lentos o pesados funcionan como una cola: creas un trabajo, recibes un ID y consultas un endpoint de estado hasta que el trabajo aparece como succeeded o failed. Algunos proveedores también ofrecen un webhook que avisa a tu servidor cuando la imagen está lista, lo que elimina el bucle de consultas.

Piensa en el riel de tickets de la cocina de un restaurante. Entregas un pedido, los cocineros van avanzando por su lista y recoges el plato cuando te llaman. Las APIs de imagen asíncronas funcionan igual, así que tu código tiene que tolerar la espera, reintentar cuando falle y limitar cuántos trabajos envía a la vez.

Chef emplatando un plato en la barra de la cocina, con tickets de pedido de papel colgados

Opciones gratuitas que de verdad funcionan

"Gratis" significa tres cosas distintas en este mercado, y confundirlas lleva a planes malos.

Créditos mensuales de plataformas alojadas

Hugging Face da a cada cuenta créditos mensuales para Inference Providers: $0.10 para usuarios gratuitos y $2.00 para usuarios PRO, según su documentación de precios. La cifra gratuita aparece marcada como "sujeta a cambios", y Hugging Face traslada las tarifas de los proveedores sin ningún recargo.

Aquí está la trampa. A un centavo por imagen, de forma ilustrativa, $0.10 compran diez imágenes. Eso basta para probar un prompt y está muy lejos de lo que hace falta para sostener una función. Trata los créditos gratuitos como una prueba, no como un presupuesto.

Modelos locales con Diffusers

Modelos de pesos abiertos como Flux Dev, Flux Schnell y Stable Diffusion 3.5 Large pueden ejecutarse en tu propio equipo mediante la biblioteca Diffusers. No pagas una tarifa por imagen, no tienes límite de uso y no envías tus prompts a un tercero.

El precio son el hardware y la paciencia. Los modelos de imagen necesitan una GPU reciente con bastante memoria de video, y la primera configuración lleva una tarde. Las licencias también difieren: Flux Schnell se publica bajo Apache 2.0, mientras que Flux Dev usa una licencia no comercial, así que revísalo antes de entregar nada por lo que tus clientes paguen.

Técnico colocando una tarjeta gráfica en un equipo de escritorio abierto

Niveles gratuitos y créditos de prueba

Varias plataformas de imágenes ofrecen créditos de prueba o una pequeña cuota diaria. Trátalos como una demo. Los límites cambian sin previo aviso, los usuarios gratuitos esperan más tiempo en la cola y los resultados pueden llevar marcas de agua o condiciones no comerciales. Construye tu integración de forma que cambiar de proveedor signifique editar un solo valor de configuración, no reescribir un módulo.

PicassoIA ofrece un enfoque pensado para el navegador: su colección de texto a imagen reúne más de 200 modelos que puedes probar sin escribir código, lo que la convierte en una forma económica de comparar resultados antes de comprometerte con una API. Explóralos en la página de todos los modelos.

La API de Hugging Face en la práctica

Hugging Face funciona como un hub de modelos con un único cliente unificado. En lugar de configurar un SDK distinto para cada proveedor, llamas a un solo cliente y nombras el modelo que quieres.

El flujo empieza en el Hub. Filtra la lista de modelos por la tarea de texto a imagen, abre la página de un modelo y revisa tres cosas: la licencia, si algún proveedor alojado lo sirve y los prompts de ejemplo que comparten sus autores. Después crea un token de acceso de usuario en los ajustes de tu cuenta, con permiso para llamar a Inference Providers. Guarda ese token en una variable de entorno, nunca en un repositorio, y rótalo si alguna vez aparece en un registro.

Dos desarrolladores compartiendo una mesa de pino en un loft de coworking luminoso

Llamar a un modelo con Python

Instala huggingface_hub, guarda un token de acceso de usuario en la variable de entorno HF_TOKEN y ejecuta:

import os
from huggingface_hub import InferenceClient

client = InferenceClient(token=os.environ["HF_TOKEN"])

image = client.text_to_image(
    "A ceramic mug on a walnut desk, soft morning window light",
    model="black-forest-labs/FLUX.1-dev",
)
image.save("mug.png")

La llamada devuelve un objeto de imagen PIL, así que puedes redimensionarla, recortarla o guardarla de inmediato. Por defecto, el cliente elige un proveedor disponible para el modelo; pasa el argumento provider si quieres fijar uno.

La facturación depende de ese proveedor. El ejemplo del propio Hugging Face calcula una solicitud de FLUX.1-dev de 10 segundos en una GPU que cuesta $0.00012 por segundo en $0.0012. Los prompts más largos, los tamaños mayores y el hardware más lento hacen subir esa cifra.

Mujer joven escribiendo un script en un equipo portátil en un apartamento lluvioso por la noche

Límites de uso y arranques en frío

Los endpoints compartidos tienen dos peculiaridades. Un modelo que nadie ha llamado hace poco puede responder lento en la primera solicitud, y las cuentas gratuitas se limitan una vez agotados los créditos. Prepárate para ambas cosas con un timeout generoso y un bucle de reintentos:

import time

def generate(prompt, tries=4):
    for attempt in range(tries):
        try:
            return client.text_to_image(prompt, model="black-forest-labs/FLUX.1-dev")
        except Exception:
            time.sleep(2 ** attempt)
    raise RuntimeError("Image generation failed after retries")

💡 Consejo: Limita las solicitudes concurrentes a un número pequeño y súbelo solo después de ver cómo se comporta tu proveedor bajo carga. Una respuesta HTTP 429 es más barata de evitar que de corregir.

Opciones de pago comparadas

Las APIs de pago cobran de tres formas, y la forma importa tanto como el precio.

Forma de cobroCómo pagasIdeal paraOjo con
Por imagenPrecio fijo por generación, a menudo escalonado según tamaño o calidadAplicaciones con volumen constante y predecibleEl precio sube con más resolución
Por segundo de GPUSegundos de cómputo multiplicados por la tarifa del hardwareModelos abiertos con ajustes personalizadosLos prompts lentos cuestan más
Créditos o suscripciónPlan mensual con una cuotaEquipos y creadores independientesLos créditos no usados pueden caducar

Precios por imagen

La facturación por imagen es la más fácil de prever: diez mil imágenes a un precio conocido te dan una cifra que puedes poner en una hoja de cálculo. Varios modelos potentes se venden así, entre ellos GPT Image 2, Imagen 4, Ideogram v4 Balanced y Seedream 5 Lite. Los precios cambian a menudo, así que lee la página de precios del proveedor el día en que decidas y no la que quedó guardada en una comparativa de hace tres meses.

Dos detalles cambian la factura real. El tamaño de salida suele escalonarse, así que una imagen de 2048 píxeles cuesta más que una de 1024. Además, las generaciones fallidas o filtradas se cobran de forma distinta según el proveedor, así que prueba unos cuantos prompts bloqueados y revisa la factura.

Calcula tu costo mensual antes de comprometerte. Multiplica las imágenes diarias por treinta y añade una reserva para reintentos, porque los usuarios regeneran más de lo que esperas. Como mero ejemplo, 500 imágenes al día son 15.000 al mes, y si cada usuario se queda con una de cada tres que genera, pagas por 45.000. A dos centavos por imagen, hipotéticamente, son $900, no los $300 que sugería la primera cifra. Haz esta cuenta con tus propios volúmenes y el precio actual del proveedor.

Pequeño empresario revisando facturas impresas con una calculadora

Planes de suscripción y créditos

Los planes convienen a los equipos que generan a diario y quieren una sola factura. El riesgo está en la cuota: los créditos que caducan a fin de mes premian a los usuarios intensivos y penalizan a todos los demás.

PicassoIA también ofrece una API para desarrolladores en https://api.picassoia.com/v1, con endpoints al estilo de Replicate: creas una predicción, la consultas y luego obtienes el resultado. Según su página de la API, las predicciones de API no consumen créditos por ahora, el acceso requiere un plan Infinite y una cuenta puede tener hasta 5 predicciones en cola o en ejecución a la vez. Confirma las condiciones vigentes en esa página antes de construir sobre ellas.

Cómo elegir la adecuada

Asocia el modelo al trabajo

El mejor modelo depende de lo que la imagen tenga que hacer:

La calidad del prompt influye más en los resultados que la elección del modelo, y un modelo de lenguaje puede convertir una idea de una línea en un prompt detallado. Claude Sonnet 5, Gemini 3.5 Flash y GPT 5.4 sirven para esto, y los tres aparecen en la lista de modelos de lenguaje de PicassoIA. Después de la generación, el escalado, la eliminación de fondo y los modelos de efectos pueden terminar el trabajo, y PicassoIA los mantiene en el mismo catálogo.

Manos colocando fotografías impresas en filas sobre una mesa de estudio

Revisa las condiciones de la licencia antes de lanzar

Antes de que una imagen llegue a un cliente, responde por escrito a estas preguntas:

  • Uso comercial: ¿Está permitido para este modelo, en este plan?
  • Propiedad del resultado: ¿Quién tiene los derechos sobre los archivos generados?
  • Conservación de datos: ¿El proveedor almacena tus prompts o los usa para entrenar?
  • Filtros de contenido: ¿Qué se bloquea y cómo informa tu aplicación al usuario?
  • Límites de uso: ¿Qué pasa cuando diez usuarios pulsan generar a la vez?

Una prueba de quince minutos con diez de tus prompts reales revela más problemas que una semana leyendo páginas de funciones. Escribe los prompts, ejecuta cada uno en dos o tres modelos con la misma semilla cuando el modelo lo permita y puntúa los resultados por nitidez, fidelidad al prompt, render de texto y velocidad. Guarda la hoja, porque la volverás a necesitar cuando un proveedor cambie sus precios.

Usa Flux 2 Pro en PicassoIA

Flux 2 Pro genera imágenes solo a partir de un prompt de texto, o a partir de hasta ocho fotos de referencia, con salida de hasta 4 MP. Funciona en el navegador, así que puedes probar prompts antes de escribir código de API.

  1. Abre la página de Flux 2 Pro.
  2. Escribe tu descripción en el campo obligatorio Prompt.
  3. Elige una relación de aspecto. Usa 16:9 para las cabeceras del blog y 9:16 para historias verticales.
  4. Deja la resolución en 1 MP para los borradores y súbela para los archivos finales.
  5. Añade hasta ocho imágenes de entrada si quieres orientar el estilo, el sujeto o la composición.
  6. Fija una semilla si necesitas reproducir un resultado.
  7. Pulsa generar, espera a que termine el trabajo y descarga la imagen.

Mujer en un escritorio de estudio luminoso con un monitor grande que muestra un paisaje

Ajustes que conviene cambiar primero

AjusteValor por defectoQué hace
Relación de aspecto1:1Define la forma del lienzo; hay ancho y alto personalizados
Resolución1 MPHasta 4 MP, aunque se recomienda 2 MP o menos
Imágenes de entradaNingunaHasta 8 referencias para trabajo de imagen a imagen
Formato de salidaWebPTambién JPEG y PNG
Calidad de salida80De 0 a 100; se ignora en PNG
SemillaAleatoriaReutilízala para recrear la misma imagen
Tolerancia de seguridad21 es la más estricta, 5 la más permisiva

Prompts que dan resultados limpios

Construye cada prompt con cinco partes: sujeto, escenario, luz, lente y textura. Aquí tienes uno que puedes pegar:

Un panadero espolvoreando harina sobre una mesa de madera, pequeña panadería de pueblo al amanecer, luz suave de la ventana por la izquierda, lente de 50 mm a f/2, polvo de harina visible y veta de la madera, color natural

Cambia un elemento a la vez y mantén fija la semilla. Así sabrás qué cambio causó cada diferencia, y tus pruebas seguirán siendo comparables entre modelos.

Crea tus propias imágenes hoy

Los créditos gratuitos te enseñan el flujo de trabajo, los modelos locales te dan control y las APIs de pago te dan fiabilidad. La mayoría de los proyectos reales acaban usando dos de las tres: una ruta gratuita para experimentar y una de pago para producción.

La forma más rápida de ver la diferencia es ejecutar el mismo prompt en varios modelos. Abre PicassoIA, pega el prompt del panadero de arriba en Flux 2 Pro, luego prueba Flux Schnell e Imagen 4 con el mismo texto y compara los resultados lado a lado. Explora el catálogo completo en la página de todos los modelos, elige el modelo que encaje con tu proyecto y genera tu primera imagen en unos pocos clics.

Director creativo con una tableta en un estudio tipo loft de ladrillo, con fotografías impresas en la pared

Compartir este artículo

Elige tu idioma