MCP de generación de imágenes de OpenAI para Cursor y Codex: configuración, costos y soluciones
Añade un MCP de generación de imágenes de OpenAI a Cursor y Codex y deja que tu agente de programación cree banners principales, iconos y ediciones dentro de tu proyecto. Incluye configuración lista para copiar en ambos editores, ajustes de GPT Image 2, costo real por render, soluciones para los tiempos de espera y una vía desde el navegador que prescinde del servidor.
Vas por la mitad de una landing page en Cursor, la sección principal necesita una foto y el agente solo ofrece un recuadro gris de marcador de posición. Un MCP de generación de imágenes de OpenAI para Cursor y Codex lo resuelve en un paso: el agente llama a una herramienta de imagen, el archivo aparece en la carpeta de tu proyecto y el diseño recibe una imagen real antes de que abras una sola pestaña del navegador.
Este artículo muestra la configuración exacta para ambos editores, los ajustes del modelo que importan, cuánto cuesta un render y los errores que hacen perder una tarde. También incluye una ruta sin servidor para quien prefiera hacer clic antes que configurar.
Por qué generar imágenes desde el editor
La rutina habitual es lenta. Sales del editor, abres un sitio de imágenes, escribes un prompt de memoria, descargas un archivo, lo renombras, lo arrastras a /public y corriges la ruta en tu código. Cada paso es pequeño. Juntos rompen tu concentración una docena de veces al día.
Una herramienta de imagen con MCP acorta ese circuito. El agente ya sabe de qué trata la página porque acaba de escribir el marcado, así que puede escribir el prompt a partir del contexto, guardar el archivo y referenciarlo en el mismo turno.
Lo que hace el agente por ti
Escribe el prompt a partir del código que lo rodea, así una página de precios y un blog de recetas reciben imágenes distintas
Llama a la herramienta y elige el tamaño, la calidad y el fondo
Guarda el archivo y actualiza la etiqueta <img> o el CSS
Vuelve a ejecutarse con tus comentarios, como "luz más cálida, menos foto de catálogo"
Dale al agente una receta de prompt
Los agentes escriben mejores prompts cuando les das una receta en lugar de una página en blanco. Guarda esta en las reglas de tu proyecto y las imágenes mantendrán coherencia de una página a otra:
Sujeto y acción: qué aparece en el encuadre y qué está haciendo
Escenario: la habitación, calle o paisaje que lo rodea
Luz: dirección y hora del día, como luz suave de ventana desde la izquierda
Cámara: longitud de lente, ángulo y distancia, como un lente de 35 mm a la altura de los ojos
Formato: la relación de aspecto y si la imagen necesita espacio vacío para un titular
Añade una frase de estilo fija a cada prompt, por ejemplo "luz natural, grano de película fino, texturas realistas", y tu banner principal, las miniaturas del blog y los estados vacíos parecerán un mismo conjunto. Pide al agente que escriba el texto alternativo en el mismo turno, ya que sabe qué muestra la imagen.
Cuándo basta con una herramienta integrada
Según artículos de la comunidad sobre Codex CLI, esta versión incluye generación de imágenes integrada y una habilidad $imagegen cuando OpenAI lanzó gpt-image-2 el 21 de abril de 2026, y funciona con tu inicio de sesión de ChatGPT en lugar de una credencial de API aparte. Si eso coincide con tu instalación y solo necesitas una imagen a la semana, quizá no necesites MCP.
Un servidor MCP se justifica cuando:
Quieres la misma herramienta en Cursor y en Codex, con los mismos ajustes.
Necesitas control sobre la calidad, el fondo y el tamaño en lugar de los valores predeterminados.
Quieres ediciones con máscara sobre capturas o fotos existentes.
Piensas cambiar de proveedor más adelante sin modificar tu flujo de trabajo.
💡 Compruébalo primero: ejecuta codex --version y lee las secciones de MCP e imagen de la documentación actual de Codex antes de añadir un servidor. Una herramienta integrada que olvidaste es la opción más barata que tienes.
Qué expone el servidor
La mayoría de los servidores de imagen de OpenAI en npm son envoltorios ligeros de los endpoints de generación y edición de la API de Images. El paquete imagegen-mcp, muy popular, expone dos herramientas, y su README indica gpt-image-1, dall-e-2 y dall-e-3 como modelos compatibles. Los resultados se guardan en archivos temporales, y la herramienta devuelve la ruta del archivo junto con datos en base64.
Dos herramientas, dos funciones
Herramienta
Tú envías
Ideal para
text-to-image
Prompt, tamaño, calidad, cantidad
Banners principales, arte de estados vacíos, iconos, marcadores de posición
image-to-image
Imagen de origen, prompt, máscara opcional
Corregir una zona de una captura, cambiar el estilo de una foto, quitar un objeto
Una edición típica: envías una foto de tu producto, enmascaras el fondo y pides un escenario más tranquilo. La zona enmascarada cambia mientras el resto de la imagen se mantiene, lo que conserva el producto intacto entre versiones.
Modelo de imagen actual de OpenAI, instantánea gpt-image-2-2026-04-21, disponible para generación, ediciones y lotes
Tu servidor debe listarlo
gpt-image-1
Generación anterior, y la que nombra el README
Más antiguo, así que es probable que tengas que actualizarlo más adelante
dall-e-3
Modelo anterior
Una imagen por solicitud (n=1)
dall-e-2
El más antiguo de los cuatro
Reservado solo para flujos de trabajo heredados
Si la versión que instalas todavía no lista gpt-image-2, actualiza el paquete o elige otro servidor que sí lo haga. La API en sí acepta gpt-image-2 como un identificador de modelo sencillo, y la documentación de OpenAI indica los endpoints v1/images/generations, v1/images/edits y v1/batch para él.
Configúralo en Cursor
Cursor lee los servidores MCP desde un archivo mcp.json. Necesitas una credencial de OpenAI, Node.js en tu PATH y unos dos minutos.
Elige el alcance global o de proyecto
Global:~/.cursor/mcp.json hace que la herramienta esté disponible en todos los proyectos.
Proyecto:.cursor/mcp.json la mantiene dentro de un repositorio, así que los compañeros que abran la carpeta obtienen la misma herramienta.
Usa el archivo del proyecto cuando la herramienta de imagen pertenezca a un solo producto, y el global cuando la quieras en todas partes. En cualquier caso, mantén el secreto fuera del archivo y deja que Cursor lo lea desde tu entorno.
Exporta OPENAI_API_KEY en tu perfil de shell y luego reinicia Cursor para que el proceso del editor herede la variable. Abre los ajustes de MCP y el servidor openai-image debería aparecer como conectado, con dos herramientas listadas. Cursor también puede activar o desactivar un servidor desde la barra lateral Customize sin borrarlo.
💡 Mantén las aprobaciones activas. Cursor pide confirmación antes de ejecutar herramientas MCP de forma predeterminada. En una herramienta que cobra por render, esa confirmación es una ventaja, no una molestia. Incluye la herramienta de imagen en la lista de permitidos solo después de haber observado una semana de uso.
Configúralo en Codex
Codex guarda sus ajustes de MCP en config.toml. Puedes añadir un servidor con un solo comando o editar el archivo tú mismo.
El -- separa las opciones propias de Codex del comando del servidor. Esto escribe el valor directamente en tu archivo de configuración, así que usa la siguiente opción en un equipo compartido.
env_vars reenvía la variable desde tu shell, así que ningún secreto llega al archivo. El archivo está en ~/.codex/config.toml, y un proyecto de confianza puede tener su propio .codex/config.toml.
Los dos tiempos de espera importan más de lo que parece. Por defecto, Codex espera 10 segundos a que un servidor arranque y 60 segundos a una llamada de herramienta. La primera ejecución de npx descarga el paquete, y un render de alta calidad puede tardar, así que ambos valores predeterminados se quedan cortos. Los valores de arriba son mi sugerencia, no un requisito.
Codex también tiene un ajuste de aprobación por servidor, default_tools_approval_mode, con valores como prompt y approve. Si lo pones en prompt, obtienes el mismo hábito de confirmar antes de gastar que en Cursor. Consulta la documentación actual de MCP de Codex para ver las opciones exactas de tu versión.
Cuánto cuesta GPT Image 2
El servidor MCP es software gratuito. Pagas a OpenAI por cada render. A 1024 por 1024, las listas de precios de terceros sitúan GPT Image 2 aproximadamente en estas cifras:
Calidad
Uso típico
Costo aproximado por render
Baja
Borradores de diseño, miniaturas, pruebas de prompt
alrededor de $0.006
Media
Imágenes de blog, maquetas de producto
alrededor de $0.053
Alta
Arte final para la sección principal, gráficos con mucho texto
alrededor de $0.211
💡 Esas cifras provienen de listas de precios de revendedores, no de la página de OpenAI. OpenAI cobra por tokens, así que los tamaños más grandes, las ediciones con imágenes de entrada y los prompts largos modifican el total. Confírmalo en la página de precios de OpenAI antes de hacer un presupuesto.
Borrador en baja calidad, acabado en alta
Haz 40 renders de borrador en calidad baja, unos $0.24, para fijar la composición y el texto. Después gasta en 5 acabados de alta calidad, unos $1.06. La sesión completa queda en torno a $1.30. Diez intentos a ciegas en alta calidad para conseguir una imagen válida costarían unos $2.11 por sí solos.
Pon un techo al gasto
Define un límite de gasto mensual en el panel de OpenAI.
Crea una credencial de proyecto aparte para el editor, para poder revocarla por separado.
Mantén las aprobaciones de herramientas activas hasta que el hábito se asiente.
Pide una imagen por llamada, salvo que estés comparando opciones.
Soluciones a errores comunes
La mayoría de los fallos encajan en cinco patrones. Revisa esta tabla antes de cambiar cualquier otra cosa.
Síntoma
Causa probable
Solución
El servidor sigue en rojo o nunca se conecta
La primera descarga de npx es lenta, o npx no está en el PATH
Ejecuta el comando una vez en una terminal y luego sube startup_timeout_sec en Codex
Error 401 en cada llamada
La credencial no está en el entorno del editor
Exporta OPENAI_API_KEY y reinicia el editor por completo
La llamada a la herramienta caduca en un render grande
Codex espera 60 segundos por defecto
Sube tool_timeout_sec o baja la calidad a media
"Model not found" o 403
Tu cuenta o la lista de modelos del servidor no incluyen el modelo
Revisa el acceso al modelo en el panel de OpenAI y actualiza el servidor
La ruta de la imagen apunta a un archivo que no existe
El servidor escribió en una carpeta temporal
Pide al agente que copie los archivos a tu carpeta de recursos
Cuando el servidor nunca se conecta
Ejecuta primero el command y los args exactos en una terminal. Si npx descarga el paquete allí, el siguiente inicio del editor será más rápido. En Windows, algunas configuraciones solo arrancan npx a través del shell, así que prueba cmd como comando y ["/c", "npx", "-y", "imagegen-mcp", "--models", "gpt-image-1"] como argumentos. En Codex, sube startup_timeout_sec antes de sospechar de cualquier otra cosa.
¿Dónde está mi imagen?
El servidor escribe cada resultado en una carpeta temporal, así que el archivo puede desaparecer en la siguiente limpieza. Añade una instrucción permanente a las reglas de tu proyecto: .cursor/rules para Cursor, o AGENTS.md para Codex.
💡 Una regla que funciona: "Después de generar una imagen, cópiala en public/images/, dale un nombre de archivo descriptivo y escribe un texto alternativo que describa la imagen."
Ejecuta GPT Image 2 en PicassoIA
No todo el mundo quiere una factura de API y un proceso de Node. PicassoIA aloja GPT Image 2 junto a GPT Image 2.5 Flare y GPT Image 2.5 Sunburst, así que puedes generar en el navegador y pasar los archivos a tu repositorio.
Pega un prompt largo y específico. El modelo sigue instrucciones de varias partes y dibuja texto legible dentro de la imagen.
Elige la relación de aspecto y la calidad de la tabla siguiente.
Elige un fondo y luego define cuántas imágenes quieres (de 1 a 10).
Genera, descarga el archivo y muévelo a tu carpeta de recursos.
Ajuste
Opciones
Elígelo cuando
quality
low, medium, high, auto
Baja para borradores, alta para acabados
aspect_ratio
1:1, 3:2, 2:3, 16:9, 9:16, además de tamaños fijos de hasta 3840x2160
16:9 para banners principales
background
auto, transparent, opaque
Transparent para iconos y recortes
output_format
png, jpeg, webp
PNG o WebP cuando necesites transparencia
number_of_images
1 a 10
Varias opciones de un mismo concepto
input_images
Una o más imágenes de referencia
Ediciones y orientación de estilo
El formulario también tiene un campo opcional para tu propia credencial de OpenAI. Si lo dejas vacío, la solicitud pasa por el proxy de PicassoIA.
💡 Atajo para el prompt: pide a un modelo de lenguaje como GPT 5.6 Sol o Claude Sonnet 5 que convierta una idea de una línea en un prompt detallado, y luego pega el resultado en el formulario de imagen.
La API y el conector MCP de PicassoIA
PicassoIA también ofrece una API para desarrolladores y un conector MCP. La URL base es https://api.picassoia.com/v1, las solicitudes usan una credencial Bearer que empieza por pia_sk_, y los endpoints siguen el estilo de Replicate: creas una predicción y luego la consultas. Hay cuatro modelos disponibles a través de ella: PicassoIA Image, PicassoIA Image Editor Pro y dos modelos de video.
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
-H "Authorization: Bearer $PICASSOIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"input": {"prompt": "wooden desk with a laptop, soft morning light", "aspect_ratio": "16:9"}}'
Después llama a GET /v1/predictions/{id} hasta que status muestre succeeded, y lee las URL de las imágenes en output. Límites a tener en cuenta al planificar: 5 predicciones simultáneas por cuenta, prompts de hasta 4000 caracteres y un cuerpo de solicitud de 10 MB.
GPT Image 2 no es uno de esos cuatro modelos de API. Así que la división es sencilla: usa el servidor de OpenAI de arriba cuando quieras el modelo de OpenAI dentro de Cursor o Codex, y usa la API de PicassoIA cuando quieras los propios modelos de imagen de PicassoIA desde código. La página de la API indica actualmente que las predicciones son gratuitas, pero los requisitos de plan se formulan de otra manera en otras partes del sitio, así que confirma las condiciones en la página de precios antes de confiar en ello.
Crea tus primeras imágenes hoy
Empieza poco a poco. Abre GPT Image 2 en PicassoIA, pega el prompt que le darías a tu agente y genera tres variaciones en calidad baja. Compáralas, elige una ganadora y repite esa en alta calidad. Diez minutos de esto te dicen más sobre tus prompts que una hora ajustando la configuración.
Tres prompts que vale la pena probar primero:
Banner principal: una escena amplia en 16:9 que encaje con el ambiente de tu producto, con espacio a la izquierda para un titular
Estado vacío: una escena tranquila y sencilla, de estilo fotográfico, para la pantalla que ven los usuarios antes de añadir datos
Vista previa para redes: una imagen llamativa en 3:2 con un texto de dos palabras dentro
Cuando las imágenes te parezcan bien, configura los mismos ajustes en Cursor o Codex y deja que el agente se encargue de guardarlas. Si quieres explorar más opciones antes, la lista completa de modelos está en picassoia.com/en/all-models. Elige un modelo, prueba tu primer prompt en PicassoIA y mira qué aparece en la carpeta de tu proyecto antes de la hora de comer.