MCP de generación de imágenes de OpenAI para Cursor y Codex: configuración, costos y soluciones

Añade un MCP de generación de imágenes de OpenAI a Cursor y Codex y deja que tu agente de programación cree banners principales, iconos y ediciones dentro de tu proyecto. Incluye configuración lista para copiar en ambos editores, ajustes de GPT Image 2, costo real por render, soluciones para los tiempos de espera y una vía desde el navegador que prescinde del servidor.

MCP de generación de imágenes de OpenAI para Cursor y Codex: configuración, costos y soluciones
Cristian Da Conceicao
Fundador de Picasso IA

Vas por la mitad de una landing page en Cursor, la sección principal necesita una foto y el agente solo ofrece un recuadro gris de marcador de posición. Un MCP de generación de imágenes de OpenAI para Cursor y Codex lo resuelve en un paso: el agente llama a una herramienta de imagen, el archivo aparece en la carpeta de tu proyecto y el diseño recibe una imagen real antes de que abras una sola pestaña del navegador.

Este artículo muestra la configuración exacta para ambos editores, los ajustes del modelo que importan, cuánto cuesta un render y los errores que hacen perder una tarde. También incluye una ruta sin servidor para quien prefiera hacer clic antes que configurar.

Desarrollador con un suéter gris trabajando en un equipo portátil sobre un escritorio de roble claro con luz suave de la mañana

Por qué generar imágenes desde el editor

La rutina habitual es lenta. Sales del editor, abres un sitio de imágenes, escribes un prompt de memoria, descargas un archivo, lo renombras, lo arrastras a /public y corriges la ruta en tu código. Cada paso es pequeño. Juntos rompen tu concentración una docena de veces al día.

Una herramienta de imagen con MCP acorta ese circuito. El agente ya sabe de qué trata la página porque acaba de escribir el marcado, así que puede escribir el prompt a partir del contexto, guardar el archivo y referenciarlo en el mismo turno.

Vista cenital de un escritorio de madera con una foto impresa de una panadería, un cuaderno con bocetos de diseño de página y una taza de té

Lo que hace el agente por ti

  • Escribe el prompt a partir del código que lo rodea, así una página de precios y un blog de recetas reciben imágenes distintas
  • Llama a la herramienta y elige el tamaño, la calidad y el fondo
  • Guarda el archivo y actualiza la etiqueta <img> o el CSS
  • Vuelve a ejecutarse con tus comentarios, como "luz más cálida, menos foto de catálogo"

Dale al agente una receta de prompt

Los agentes escriben mejores prompts cuando les das una receta en lugar de una página en blanco. Guarda esta en las reglas de tu proyecto y las imágenes mantendrán coherencia de una página a otra:

  1. Sujeto y acción: qué aparece en el encuadre y qué está haciendo
  2. Escenario: la habitación, calle o paisaje que lo rodea
  3. Luz: dirección y hora del día, como luz suave de ventana desde la izquierda
  4. Cámara: longitud de lente, ángulo y distancia, como un lente de 35 mm a la altura de los ojos
  5. Formato: la relación de aspecto y si la imagen necesita espacio vacío para un titular

Añade una frase de estilo fija a cada prompt, por ejemplo "luz natural, grano de película fino, texturas realistas", y tu banner principal, las miniaturas del blog y los estados vacíos parecerán un mismo conjunto. Pide al agente que escriba el texto alternativo en el mismo turno, ya que sabe qué muestra la imagen.

Cuándo basta con una herramienta integrada

Según artículos de la comunidad sobre Codex CLI, esta versión incluye generación de imágenes integrada y una habilidad $imagegen cuando OpenAI lanzó gpt-image-2 el 21 de abril de 2026, y funciona con tu inicio de sesión de ChatGPT en lugar de una credencial de API aparte. Si eso coincide con tu instalación y solo necesitas una imagen a la semana, quizá no necesites MCP.

Un servidor MCP se justifica cuando:

  1. Quieres la misma herramienta en Cursor y en Codex, con los mismos ajustes.
  2. Necesitas control sobre la calidad, el fondo y el tamaño en lugar de los valores predeterminados.
  3. Quieres ediciones con máscara sobre capturas o fotos existentes.
  4. Piensas cambiar de proveedor más adelante sin modificar tu flujo de trabajo.

💡 Compruébalo primero: ejecuta codex --version y lee las secciones de MCP e imagen de la documentación actual de Codex antes de añadir un servidor. Una herramienta integrada que olvidaste es la opción más barata que tienes.

Qué expone el servidor

La mayoría de los servidores de imagen de OpenAI en npm son envoltorios ligeros de los endpoints de generación y edición de la API de Images. El paquete imagegen-mcp, muy popular, expone dos herramientas, y su README indica gpt-image-1, dall-e-2 y dall-e-3 como modelos compatibles. Los resultados se guardan en archivos temporales, y la herramienta devuelve la ruta del archivo junto con datos en base64.

Manos colocando fotografías impresas originales y editadas en dos filas ordenadas sobre una mesa

Dos herramientas, dos funciones

HerramientaTú envíasIdeal para
text-to-imagePrompt, tamaño, calidad, cantidadBanners principales, arte de estados vacíos, iconos, marcadores de posición
image-to-imageImagen de origen, prompt, máscara opcionalCorregir una zona de una captura, cambiar el estilo de una foto, quitar un objeto

Una edición típica: envías una foto de tu producto, enmascaras el fondo y pides un escenario más tranquilo. La zona enmascarada cambia mientras el resto de la imagen se mantiene, lo que conserva el producto intacto entre versiones.

Qué modelo elegir

ModeloPosiciónTen en cuenta
GPT Image 2 (gpt-image-2)Modelo de imagen actual de OpenAI, instantánea gpt-image-2-2026-04-21, disponible para generación, ediciones y lotesTu servidor debe listarlo
gpt-image-1Generación anterior, y la que nombra el READMEMás antiguo, así que es probable que tengas que actualizarlo más adelante
dall-e-3Modelo anteriorUna imagen por solicitud (n=1)
dall-e-2El más antiguo de los cuatroReservado solo para flujos de trabajo heredados

Si la versión que instalas todavía no lista gpt-image-2, actualiza el paquete o elige otro servidor que sí lo haga. La API en sí acepta gpt-image-2 como un identificador de modelo sencillo, y la documentación de OpenAI indica los endpoints v1/images/generations, v1/images/edits y v1/batch para él.

Configúralo en Cursor

Cursor lee los servidores MCP desde un archivo mcp.json. Necesitas una credencial de OpenAI, Node.js en tu PATH y unos dos minutos.

Desarrollador escribiendo en un equipo portátil junto a un monitor externo en un espacio de coworking luminoso

Elige el alcance global o de proyecto

  • Global: ~/.cursor/mcp.json hace que la herramienta esté disponible en todos los proyectos.
  • Proyecto: .cursor/mcp.json la mantiene dentro de un repositorio, así que los compañeros que abran la carpeta obtienen la misma herramienta.

Usa el archivo del proyecto cuando la herramienta de imagen pertenezca a un solo producto, y el global cuando la quieras en todas partes. En cualquier caso, mantén el secreto fuera del archivo y deja que Cursor lo lea desde tu entorno.

Pega la configuración

{
  "mcpServers": {
    "openai-image": {
      "type": "stdio",
      "command": "npx",
      "args": ["-y", "imagegen-mcp", "--models", "gpt-image-1"],
      "env": {
        "OPENAI_API_KEY": "${env:OPENAI_API_KEY}"
      }
    }
  }
}

Exporta OPENAI_API_KEY en tu perfil de shell y luego reinicia Cursor para que el proceso del editor herede la variable. Abre los ajustes de MCP y el servidor openai-image debería aparecer como conectado, con dos herramientas listadas. Cursor también puede activar o desactivar un servidor desde la barra lateral Customize sin borrarlo.

💡 Mantén las aprobaciones activas. Cursor pide confirmación antes de ejecutar herramientas MCP de forma predeterminada. En una herramienta que cobra por render, esa confirmación es una ventaja, no una molestia. Incluye la herramienta de imagen en la lista de permitidos solo después de haber observado una semana de uso.

Configúralo en Codex

Codex guarda sus ajustes de MCP en config.toml. Puedes añadir un servidor con un solo comando o editar el archivo tú mismo.

Persona de pie en un escritorio elevado con un equipo portátil y un cuaderno con luz de última hora de la tarde

Un solo comando basta

codex mcp add openai-image --env OPENAI_API_KEY=your-openai-secret -- npx -y imagegen-mcp --models gpt-image-1
codex mcp list

El -- separa las opciones propias de Codex del comando del servidor. Esto escribe el valor directamente en tu archivo de configuración, así que usa la siguiente opción en un equipo compartido.

Edita config.toml directamente

[mcp_servers.openai-image]
command = "npx"
args = ["-y", "imagegen-mcp", "--models", "gpt-image-1"]
env_vars = ["OPENAI_API_KEY"]
startup_timeout_sec = 30
tool_timeout_sec = 180

env_vars reenvía la variable desde tu shell, así que ningún secreto llega al archivo. El archivo está en ~/.codex/config.toml, y un proyecto de confianza puede tener su propio .codex/config.toml.

Los dos tiempos de espera importan más de lo que parece. Por defecto, Codex espera 10 segundos a que un servidor arranque y 60 segundos a una llamada de herramienta. La primera ejecución de npx descarga el paquete, y un render de alta calidad puede tardar, así que ambos valores predeterminados se quedan cortos. Los valores de arriba son mi sugerencia, no un requisito.

Codex también tiene un ajuste de aprobación por servidor, default_tools_approval_mode, con valores como prompt y approve. Si lo pones en prompt, obtienes el mismo hábito de confirmar antes de gastar que en Cursor. Consulta la documentación actual de MCP de Codex para ver las opciones exactas de tu versión.

Cuánto cuesta GPT Image 2

El servidor MCP es software gratuito. Pagas a OpenAI por cada render. A 1024 por 1024, las listas de precios de terceros sitúan GPT Image 2 aproximadamente en estas cifras:

CalidadUso típicoCosto aproximado por render
BajaBorradores de diseño, miniaturas, pruebas de promptalrededor de $0.006
MediaImágenes de blog, maquetas de productoalrededor de $0.053
AltaArte final para la sección principal, gráficos con mucho textoalrededor de $0.211

💡 Esas cifras provienen de listas de precios de revendedores, no de la página de OpenAI. OpenAI cobra por tokens, así que los tamaños más grandes, las ediciones con imágenes de entrada y los prompts largos modifican el total. Confírmalo en la página de precios de OpenAI antes de hacer un presupuesto.

Hucha de cerámica junto a una pila de monedas y tres pequeñas fotografías instantáneas sobre un escritorio de nogal

Borrador en baja calidad, acabado en alta

Haz 40 renders de borrador en calidad baja, unos $0.24, para fijar la composición y el texto. Después gasta en 5 acabados de alta calidad, unos $1.06. La sesión completa queda en torno a $1.30. Diez intentos a ciegas en alta calidad para conseguir una imagen válida costarían unos $2.11 por sí solos.

Pon un techo al gasto

  • Define un límite de gasto mensual en el panel de OpenAI.
  • Crea una credencial de proyecto aparte para el editor, para poder revocarla por separado.
  • Mantén las aprobaciones de herramientas activas hasta que el hábito se asiente.
  • Pide una imagen por llamada, salvo que estés comparando opciones.

Soluciones a errores comunes

Manos de un técnico con un destornillador pequeño sobre un equipo portátil abierto en un banco de trabajo ordenado

La mayoría de los fallos encajan en cinco patrones. Revisa esta tabla antes de cambiar cualquier otra cosa.

SíntomaCausa probableSolución
El servidor sigue en rojo o nunca se conectaLa primera descarga de npx es lenta, o npx no está en el PATHEjecuta el comando una vez en una terminal y luego sube startup_timeout_sec en Codex
Error 401 en cada llamadaLa credencial no está en el entorno del editorExporta OPENAI_API_KEY y reinicia el editor por completo
La llamada a la herramienta caduca en un render grandeCodex espera 60 segundos por defectoSube tool_timeout_sec o baja la calidad a media
"Model not found" o 403Tu cuenta o la lista de modelos del servidor no incluyen el modeloRevisa el acceso al modelo en el panel de OpenAI y actualiza el servidor
La ruta de la imagen apunta a un archivo que no existeEl servidor escribió en una carpeta temporalPide al agente que copie los archivos a tu carpeta de recursos

Cuando el servidor nunca se conecta

Ejecuta primero el command y los args exactos en una terminal. Si npx descarga el paquete allí, el siguiente inicio del editor será más rápido. En Windows, algunas configuraciones solo arrancan npx a través del shell, así que prueba cmd como comando y ["/c", "npx", "-y", "imagegen-mcp", "--models", "gpt-image-1"] como argumentos. En Codex, sube startup_timeout_sec antes de sospechar de cualquier otra cosa.

¿Dónde está mi imagen?

El servidor escribe cada resultado en una carpeta temporal, así que el archivo puede desaparecer en la siguiente limpieza. Añade una instrucción permanente a las reglas de tu proyecto: .cursor/rules para Cursor, o AGENTS.md para Codex.

💡 Una regla que funciona: "Después de generar una imagen, cópiala en public/images/, dale un nombre de archivo descriptivo y escribe un texto alternativo que describa la imagen."

Ejecuta GPT Image 2 en PicassoIA

No todo el mundo quiere una factura de API y un proceso de Node. PicassoIA aloja GPT Image 2 junto a GPT Image 2.5 Flare y GPT Image 2.5 Sunburst, así que puedes generar en el navegador y pasar los archivos a tu repositorio.

Mesa de estudio de fotógrafo con un equipo portátil que muestra una foto de un lago de montaña, junto a una cámara y una taza de café

Pasos en el navegador

  1. Abre la página de GPT Image 2.
  2. Pega un prompt largo y específico. El modelo sigue instrucciones de varias partes y dibuja texto legible dentro de la imagen.
  3. Elige la relación de aspecto y la calidad de la tabla siguiente.
  4. Elige un fondo y luego define cuántas imágenes quieres (de 1 a 10).
  5. Genera, descarga el archivo y muévelo a tu carpeta de recursos.
AjusteOpcionesElígelo cuando
qualitylow, medium, high, autoBaja para borradores, alta para acabados
aspect_ratio1:1, 3:2, 2:3, 16:9, 9:16, además de tamaños fijos de hasta 3840x216016:9 para banners principales
backgroundauto, transparent, opaqueTransparent para iconos y recortes
output_formatpng, jpeg, webpPNG o WebP cuando necesites transparencia
number_of_images1 a 10Varias opciones de un mismo concepto
input_imagesUna o más imágenes de referenciaEdiciones y orientación de estilo

El formulario también tiene un campo opcional para tu propia credencial de OpenAI. Si lo dejas vacío, la solicitud pasa por el proxy de PicassoIA.

💡 Atajo para el prompt: pide a un modelo de lenguaje como GPT 5.6 Sol o Claude Sonnet 5 que convierta una idea de una línea en un prompt detallado, y luego pega el resultado en el formulario de imagen.

La API y el conector MCP de PicassoIA

PicassoIA también ofrece una API para desarrolladores y un conector MCP. La URL base es https://api.picassoia.com/v1, las solicitudes usan una credencial Bearer que empieza por pia_sk_, y los endpoints siguen el estilo de Replicate: creas una predicción y luego la consultas. Hay cuatro modelos disponibles a través de ella: PicassoIA Image, PicassoIA Image Editor Pro y dos modelos de video.

curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
  -H "Authorization: Bearer $PICASSOIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input": {"prompt": "wooden desk with a laptop, soft morning light", "aspect_ratio": "16:9"}}'

Después llama a GET /v1/predictions/{id} hasta que status muestre succeeded, y lee las URL de las imágenes en output. Límites a tener en cuenta al planificar: 5 predicciones simultáneas por cuenta, prompts de hasta 4000 caracteres y un cuerpo de solicitud de 10 MB.

GPT Image 2 no es uno de esos cuatro modelos de API. Así que la división es sencilla: usa el servidor de OpenAI de arriba cuando quieras el modelo de OpenAI dentro de Cursor o Codex, y usa la API de PicassoIA cuando quieras los propios modelos de imagen de PicassoIA desde código. La página de la API indica actualmente que las predicciones son gratuitas, pero los requisitos de plan se formulan de otra manera en otras partes del sitio, así que confirma las condiciones en la página de precios antes de confiar en ello.

Crea tus primeras imágenes hoy

Empieza poco a poco. Abre GPT Image 2 en PicassoIA, pega el prompt que le darías a tu agente y genera tres variaciones en calidad baja. Compáralas, elige una ganadora y repite esa en alta calidad. Diez minutos de esto te dicen más sobre tus prompts que una hora ajustando la configuración.

Mujer joven sonriente sosteniendo una foto impresa de una calle de ciudad frente a la luz en un loft soleado

Tres prompts que vale la pena probar primero:

  • Banner principal: una escena amplia en 16:9 que encaje con el ambiente de tu producto, con espacio a la izquierda para un titular
  • Estado vacío: una escena tranquila y sencilla, de estilo fotográfico, para la pantalla que ven los usuarios antes de añadir datos
  • Vista previa para redes: una imagen llamativa en 3:2 con un texto de dos palabras dentro

Cuando las imágenes te parezcan bien, configura los mismos ajustes en Cursor o Codex y deja que el agente se encargue de guardarlas. Si quieres explorar más opciones antes, la lista completa de modelos está en picassoia.com/en/all-models. Elige un modelo, prueba tu primer prompt en PicassoIA y mira qué aparece en la carpeta de tu proyecto antes de la hora de comer.

Compartir este artículo

Elige tu idioma