Precios de la API de GPT Image 2: costo por imagen, parámetros y PNG transparentes

Un repaso precio por precio de la API de GPT Image 2: cuánto cuesta una imagen con calidad baja, media y alta, cómo las llamadas por lote reducen la factura a la mitad, qué parámetros cambian el total y cómo pedir PNG transparentes reales sin pagar extra, con presupuestos para proyectos reales.

Precios de la API de GPT Image 2: costo por imagen, parámetros y PNG transparentes
Cristian Da Conceicao
Fundador de Picasso IA

Un render de 1024x1024 de GPT Image 2 cuesta $0,006 con calidad baja, $0,053 con calidad media y $0,211 con alta. Es una diferencia de 35 veces para el mismo prompt, y el parámetro quality por sí solo decide en qué extremo caes. Si sumas el tamaño del lienzo, el número de imágenes de referencia que envías y si llamas al endpoint Batch, un trabajo de 1.000 imágenes puede costar entre $3 y $211.

Este artículo reúne todas las cifras en un solo lugar: la tabla de precios por imagen, las tarifas de tokens que hay detrás, los parámetros que mueven la factura y el ajuste (background: "transparent") que devuelve un PNG real con canal alfa sin cargo extra. Los precios se revisaron en la página de precios de OpenAI y en calculadoras de terceros en septiembre y octubre de 2026, así que confírmalos antes de aprobar un presupuesto.

Lo que realmente cuesta una imagen

OpenAI cobra los modelos de imagen por token, pero la mayoría de los equipos presupuesta por imagen, así que las calculadoras convierten una cosa en la otra. La tabla siguiente muestra el precio estándar (no por lote) de salida en los tres tamaños que la API lista por defecto.

Precio por imagen según la calidad

TamañoBajaMediaAlta
1024x1024 (cuadrado)$0,006$0,053$0,211
1024x1536 (vertical)$0,005$0,041$0,165
1536x1024 (horizontal)$0,005$0,041$0,165

Lee la tabla en proporciones, no solo en dólares. La calidad media cuesta unas 9 veces la baja. La alta cuesta unas 4 veces la media y 35 veces la baja. Si un borrador te parece bien con calidad baja, lo estás pagando a menos de un céntimo, y cada escalón hacia arriba multiplica la factura.

💡 Regla de presupuesto: haz los borradores con low, aprueba la composición y luego renderiza la versión final con medium. Reserva high para textos densos, diagramas y trabajos de impresión, donde el detalle extra se nota.

Calculadora de latón y pilas de monedas sobre una mesa de roble con luz de mañana

Las llamadas por lote cuestan la mitad

El modelo admite el endpoint Batch, y OpenAI aplica un descuento del 50 % a todos los tipos de token en ese caso. Estas son las tarifas de token estándar y por lote por millón de tokens:

Tipo de tokenEstándarPor lote
Entrada de texto$5,00$2,50
Entrada de texto en caché$1,25$0,625
Entrada de imagen$8,00$4,00
Entrada de imagen en caché$2,00$1,00
Salida de imagen$30,00$15,00

A 1024x1024, el precio por lote equivale a unos $0,003 por imagen baja, $0,027 por imagen media y $0,105 por imagen alta. La contrapartida es el tiempo: los resultados por lote llegan más tarde en vez de en segundos, así que encajan en catálogos y trabajos nocturnos, no en un usuario que espera a que se pulse un botón.

El cálculo de tokens detrás del precio

Cada cifra por imagen es simplemente los tokens de salida multiplicados por $30 por millón. Si divides el precio entre esa tarifa, obtienes el número de tokens implícito: unos 1.770 tokens para un cuadrado medio, unos 7.030 para un cuadrado alto, y unos 1.370 y 5.500 para horizontal medio y alto. Estos valores se calculan a la inversa a partir de precios publicados, no son cifras que OpenAI imprima, así que tómalos como estimaciones.

Por qué el formato horizontal es más barato

Aquí está la parte curiosa. Un lienzo de 1536x1024 tiene 1.572.864 píxeles, un 50 % más que los 1.048.576 píxeles de un cuadrado, y aun así cuesta unos 22 % menos en media y alta. El costo no crece en línea recta con el número de píxeles. La lección práctica: si tu composición lo permite, elige horizontal o vertical en vez de cuadrado. Obtienes una imagen más grande por menos dinero.

Lo que añaden las imágenes de referencia

Las ediciones y los flujos de trabajo con imágenes de referencia añaden tokens de entrada a $8 por millón. Una medición publicada muestra que una llamada de 1024x1024 con calidad baja y solo texto cuesta unos $0,0063 con 24 tokens de entrada. La misma llamada con dos imágenes de referencia costó unos $0,025 con 2.365 tokens de entrada en total. Es decir, dos referencias cuadruplicaron el precio de un render bajo, y los tokens de salida no cambiaron.

💡 Consejo: la API devuelve un objeto usage con cada respuesta. Regístralo en tus primeras cien llamadas. Es la única forma fiable de calcular el precio de tamaños no estándar, porque OpenAI no publica una tabla para ellos.

Mano escribiendo columnas de cifras en una libreta junto a una calculadora de latón

Los parámetros que mueven tu factura

La instantánea del modelo es gpt-image-2-2026-04-21, accesible mediante /v1/images/generations, /v1/images/edits y el endpoint Batch. Estos son todos los parámetros que importan y lo que hacen en el costo.

ParámetroValoresEfecto en el costo
size1024x1024, 1536x1024, 1024x1536, auto o personalizadoLos lienzos más grandes facturan más tokens de salida
qualitylow, medium, high, autoEl factor más importante, unas 9 veces de baja a media
backgroundtransparent, opaque, autoNinguno, mismos tokens con el mismo tamaño y calidad
output_formatpng, jpeg, webpNinguno
output_compression0 a 100 (jpeg y webp)Ninguno, solo archivos más pequeños
moderationauto, lowNinguno
nImágenes por solicitudLineal, 4 imágenes cuestan 4 veces más
partial_images0 a 3 (streaming)No aparece en las tablas que encontré, compara con usage

Tamaño y relación de aspecto

Más allá de los tres preajustes, los tamaños personalizados siguen reglas estrictas de la documentación de imágenes de OpenAI: ambos lados deben ser múltiplos de 16, la proporción no puede superar 3:1, ningún lado puede pasar de 3.840 píxeles y el total debe estar entre 655.360 y 8.294.400 píxeles. Todo lo que supere 2560x1440 se marca como experimental. Las opciones más populares son 2048x2048, 2048x1152 y 3840x2160.

Tres paisajes impresos en formatos cuadrado, panorámico y alto, sujetos con un cordel de lino

Niveles de calidad

auto deja que el modelo elija, lo cual es cómodo y también impredecible en una factura. En producción, fija el nivel de forma explícita. La documentación actual de imágenes de OpenAI también enumera xhigh y max para GPT Image 2.5, y no encontré precios publicados por imagen para esos dos, así que pruébalos con usage antes de prometer un costo a nadie.

Formato y compresión

PNG es el valor por defecto y el más seguro para la transparencia. WebP también incluye canal alfa y genera archivos más pequeños. JPEG se codifica más rápido pero no tiene canal alfa. Define output_compression entre 0 y 100 para JPEG y WebP cuando quieras archivos más ligeros para la web.

Lupa de fotógrafo sobre una copia de contacto en una mesa de luz blanca

Moderación y número de imágenes

moderation acepta auto (filtrado estándar) o low (menos restrictivo). Ninguno cambia el precio. El parámetro n genera varias imágenes en una sola solicitud y cobra cada una, así que un lote de 10 equivale a diez renders individuales. Una solicitud que devuelve diez borradores casi idénticos con calidad media cuesta unos $0,53 en tamaño cuadrado.

PNG transparentes con un solo parámetro

Hasta este verano, un recorte significaba generar sobre un fondo blanco y pasar después un eliminador de fondo. A finales de agosto de 2026, OpenAI documentó en su cookbook la transparencia nativa para GPT Image 2, como función de vista previa. Ahora una sola solicitud devuelve un PNG con un canal alfa real.

Los dos campos obligatorios

Necesitas dos ajustes juntos: background="transparent" y output_format="png" (WebP también funciona). Pedir JPEG devuelve un error 400, porque JPEG no puede almacenar transparencia. La transparencia no añade costo: con la misma calidad y tamaño, transparent y opaque consumen los mismos tokens de imagen.

import base64
from openai import OpenAI

client = OpenAI()

result = client.images.generate(
    model="gpt-image-2",
    prompt="A ceramic mug, isolated object, no backdrop, no cast shadow",
    size="1024x1024",
    quality="medium",
    background="transparent",
    output_format="png",
)

with open("mug.png", "wb") as f:
    f.write(base64.b64decode(result.data[0].b64_json))

print(result.usage)

El mismo parámetro funciona en el endpoint de edición y en la herramienta de imágenes de Responses, aunque las ediciones vuelven a dibujar el sujeto en lugar de calcar su contorno original, así que los detalles finos cambiarán.

Frasco de vidrio facetado transparente sobre acrílico esmerilado en un estudio blanco

Dónde falla la transparencia

Tres problemas aparecen una y otra vez:

  • El prompt pesa más que el parámetro. Si tu prompt describe una habitación, una estantería, un pedestal o una sombra proyectada, el modelo puede dibujarlos en lugar de dejar los píxeles vacíos. Escribe "objeto aislado sobre alfa totalmente transparente, sin fondo, sin rectángulo, sin sombra."
  • Materiales delicados. Los bordes de vidrio esmerilado, las cintas transparentes, la cera y las fibras finas como cabellos siguen variando de una ejecución a otra, aunque el alfa nativo los maneja mejor que un eliminador posterior.
  • Carencias de los proveedores. Algunos hosts y revendedores no transmiten background. El listado alojado de Cloudflare, cuando lo revisé, decía que los fondos transparentes no eran compatibles con el modelo y recomendaba GPT Image 1.5 en su lugar.

Para bordes con precisión de píxel, genera sobre un fondo liso y termina con una herramienta de recorte especializada como Bria Remove Background.

Cinta crema translúcida retroiluminada sobre una palma abierta

Cómo comprobar el canal alfa

Nunca confíes en un archivo solo porque termine en .png. Una caja blanca opaca puede pasar por un recorte hasta que alguien la pone sobre una diapositiva oscura. Decodifica el archivo y pruébalo:

from PIL import Image

img = Image.open("mug.png")
print(img.mode)                    # RGBA means an alpha channel exists
print(img.getchannel("A").getextrema())  # (0, 255) means real transparency

Un resultado de (255, 255) significa que todos los píxeles son totalmente opacos, y deberías repetir la solicitud con un prompt más limpio. Ejecuta esta comprobación automáticamente antes de cualquier campaña grande, ya que la función sigue en vista previa.

Presupuestos para proyectos reales

Las cifras se vuelven útiles cuando las asocias a un trabajo. Estas estimaciones usan los precios estándar por imagen de arriba e ignoran el texto del prompt, que suma unos $0,50 por cada mil llamadas con un prompt de 100 tokens.

ProyectoConfiguraciónEstándarPor lote
Catálogo de productos, 1.000 tomasHorizontal, media$41unos $20,50
Paquete de adhesivos, 500 PNG transparentesCuadrado, media$26,50unos $13,25
Paquete de adhesivos, 500 PNG transparentesCuadrado, alta$105,50unos $52,75
App con 2.000 imágenes al díaCuadrado, baja$12 al día, unos $360 al mesno adecuado
App con 2.000 imágenes al díaCuadrado, media$106 al día, unos $3.180 al mesno adecuado

Las dos últimas filas son la advertencia. Una función para el público general que parece barata por imagen se convierte en una línea mensual de cuatro cifras en cuanto sube la calidad.

Tazas de cerámica sobre la mesa de embalaje de una pequeña tienda, junto a una cámara en un trípode

Costo por imagen aprovechada

Los paquetes de adhesivos y las fotos de producto rara vez salen bien a la primera. Lo que realmente pagas es el precio dividido entre tu tasa de aprovechamiento. Si descartas un render de cada cinco, un cuadrado medio pasa de $0,053 a unos $0,066 por imagen que de verdad usas. Registra la tasa de aprovechamiento de cada plantilla de prompt y corrige la peor plantilla antes de tocar el ajuste de calidad.

Límites de velocidad por nivel

Los límites de velocidad importan tanto como el precio cuando el trabajo es grande. OpenAI mide el modelo en tokens por minuto (TPM) e imágenes por minuto (IPM):

NivelTokens por minutoImágenes por minuto
Nivel 1100.0005
Nivel 2250.00020
Nivel 3800.00050
Nivel 43.000.000150
Nivel 58.000.000250

En el nivel 1, un catálogo de 1.000 imágenes necesita unos 200 minutos de llamadas continuas. En el nivel 2, el mismo trabajo tarda 50 minutos. Los prompts complejos también pueden tardar hasta dos minutos cada uno, así que crea reintentos y una cola en lugar de un bucle ajustado.

Cinco tazas de café expreso llenándose en fila sobre una barra de acero de cafetería

Alternativas más baratas que vale la pena probar

GPT Image 2 no es el único punto de precio, y rara vez es el más barato que cumple la tarea.

ModeloRango por imagenPara qué sirve
GPT Image 2$0,005 a $0,211Texto denso, trabajo de producto, transparencia
GPT Image 2.5Mismas tarifas de token que GPT Image 2Niveles más nuevos, ver los enlaces abajo
GPT Image 1.5$0,009 a $0,20Generación anterior, PNG transparentes en hosts sin soporte de GPT Image 2
GPT Image 1 Mini$0,005 a $0,052Borradores masivos, entre un 80 y un 90 % menos que la calidad alta del modelo insignia

La página de precios de OpenAI enumera GPT Image 2.5 con las mismas tarifas de token estándar y por lote que GPT Image 2. GPT Image 2.5 tiene dos variantes en PicassoIA, GPT Image 2.5 Flare y GPT Image 2.5 Sunburst, así que puedes compararlas con GPT Image 2 lado a lado con el mismo prompt.

PicassoIA también ofrece su propia API para desarrolladores en https://api.picassoia.com/v1, con predicciones al estilo Replicate (crear, consultar, obtener) y 5 trabajos simultáneos por cuenta. La lista que vi el 5 de octubre de 2026 tenía cuatro modelos, entre ellos PicassoIA Image y PicassoIA Image Editor Pro. GPT Image 2 en sí se usa desde la aplicación web. Revisa las condiciones actuales del plan en la página de precios, porque la redacción sobre los costos de la API era contradictoria cuando la consulté.

Cómo usar GPT Image 2 en PicassoIA

Si quieres probar prompts y ajustes antes de escribir una línea de código, la página de GPT Image 2 en PicassoIA expone los mismos controles que la API. Los ajustes del modelo también incluyen una credencial opcional de OpenAI. Déjala vacía y PicassoIA hace de proxy con la solicitud.

  1. Abre la página del modelo GPT Image 2 y escribe tu prompt. Nombra el sujeto, el material y la iluminación, y añade "objeto aislado, sin fondo" para los recortes.
  2. Elige una aspect_ratio: 1:1, 3:2, 2:3, 16:9, 9:16, o un tamaño exacto como 2048x2048 o 3840x2160.
  3. Pon quality en low para los borradores y medium o high para las versiones finales.
  4. Cambia background a transparent y elige png como output_format. La página usa WebP por defecto, que también conserva el alfa, pero PNG es la opción más segura para herramientas de diseño.
  5. Define number_of_images entre 1 y 10, luego ejecuta la generación y descarga los archivos.

Diseñador trabajando en un equipo portátil en un loft luminoso de coworking

Ajustes para recortes limpios

Mantén output_compression en su valor predeterminado de 90, salvo que el tamaño del archivo importe, deja moderation en auto y ejecuta un borrador con calidad baja antes de gastar en la versión final. Si los bordes se ven irregulares, sube el resultado a PicassoIA Image Editor Pro para retocarlo, o recorta el sujeto con Bria Remove Background.

Crea tus propias imágenes hoy

El precio de una imagen es pequeño. El precio de los ajustes equivocados, repetido diez mil veces, no lo es. Elige un prompt real de tu proyecto, renderízalo en baja, media y alta, y luego compara el costo con lo que realmente se ve en el archivo. Haz lo mismo con background="transparent" y comprueba el canal alfa antes de fiarte.

¿Preparado para probarlo? Abre GPT Image 2 en Picasso IA, ejecuta tu primer prompt con calidad baja y guarda los resultados que merecen una segunda pasada. Después envía el mismo prompt por los modelos 2.5 y mira cuál da la mejor imagen por céntimo.

Compartir este artículo

Elige tu idioma