Servidor MCP de geração de imagens da OpenAI para Cursor e Codex: configuração, custos e correções
Adicione um servidor MCP de geração de imagens da OpenAI ao Cursor e ao Codex e deixe seu agente de programação criar banners de destaque, ícones e edições dentro do seu projeto. Configuração pronta para copiar nos dois editores, ajustes do GPT Image 2, custo real por renderização, correções para timeouts e uma rota pelo navegador que dispensa servidor.
Você está no meio de uma landing page no Cursor, a seção de destaque precisa de uma foto, e o agente não tem nada a oferecer além de uma caixa cinza de espaço reservado. Um servidor MCP de geração de imagens da OpenAI para Cursor e Codex resolve isso num passo só: o agente chama uma ferramenta de imagem, o arquivo cai na pasta do seu projeto, e o layout ganha uma imagem de verdade antes de você abrir qualquer aba do navegador.
Este artigo mostra a configuração exata para os dois editores, os ajustes de modelo que realmente importam, quanto custa uma renderização e os erros que consomem uma tarde inteira. Também inclui uma rota sem servidor para quem prefere clicar a configurar.
Por que colocar a geração de imagens no editor
A rotina de sempre é lenta. Você sai do editor, abre um site de imagens, escreve um prompt de cabeça, baixa o arquivo, renomeia, arrasta para dentro de /public e corrige o caminho no código. Cada passo é pequeno. Juntos, eles quebram seu foco uma dúzia de vezes por dia.
Uma ferramenta de imagem via MCP encurta esse ciclo. O agente já sabe do que se trata a página, porque acabou de escrever a marcação, então pode escrever o prompt a partir do contexto, salvar o arquivo e referenciá-lo no mesmo turno.
O que o agente faz por você
Escreve o prompt a partir do código ao redor, então uma página de preços e um blog de receitas recebem imagens diferentes
Chama a ferramenta e escolhe tamanho, qualidade e fundo
Salva o arquivo e atualiza a tag <img> ou o CSS
Roda de novo com base no seu feedback, como "luz mais quente, menos cara de banco de imagens"
Dê ao agente uma receita de prompt
Agentes escrevem prompts melhores quando você entrega uma receita em vez de uma página em branco. Guarde esta nas regras do seu projeto e as imagens ficarão consistentes de uma página para outra:
Sujeito e ação: o que está no quadro e o que ele está fazendo
Cenário: o ambiente, rua ou paisagem ao redor
Luz: direção e hora do dia, como luz suave de janela vinda da esquerda
Câmera: distância focal, ângulo e distância, como uma lente de 35 mm na altura dos olhos
Formato: a proporção, e se a imagem precisa de espaço vazio para um título
Acrescente uma frase fixa de estilo a cada prompt, por exemplo "luz natural, granulação fina de filme, texturas realistas", e seu banner de destaque, miniaturas do blog e estados vazios vão parecer um conjunto só. Peça ao agente para escrever o texto alternativo no mesmo turno, já que ele sabe o que a imagem mostra.
Quando uma ferramenta embutida basta
Relatos da comunidade sobre o Codex CLI dizem que ele veio com geração de imagens embutida e uma skill $imagegen quando a OpenAI lançou o gpt-image-2 em 21 de abril de 2026, e que ele funciona com o seu login do ChatGPT em vez de uma credencial de API separada. Se isso corresponde à sua instalação e você precisa de uma imagem por semana, talvez nem precise de MCP.
Um servidor MCP se justifica quando:
Você quer a mesma ferramenta no Cursor e no Codex, com as mesmas configurações.
Você precisa de controle sobre qualidade, fundo e tamanho em vez dos padrões.
Você quer edições baseadas em máscara em capturas de tela ou fotos existentes.
Você planeja trocar de provedor depois sem mudar seu fluxo de trabalho.
💡 Verifique antes: execute codex --version e leia as seções de MCP e de imagem na documentação atual do Codex antes de adicionar um servidor. Uma ferramenta embutida que você esqueceu é a opção mais barata que você tem.
O que o servidor expõe
A maioria dos servidores de imagem da OpenAI no npm são wrappers simples dos endpoints da Images API para geração e edição. O pacote imagegen-mcp, muito usado, expõe duas ferramentas, e o README dele lista gpt-image-1, dall-e-2 e dall-e-3 como modelos compatíveis. Os resultados são salvos em arquivos temporários, e a ferramenta devolve o caminho do arquivo junto com os dados em base64.
Duas ferramentas, dois trabalhos
Ferramenta
Você envia
Ideal para
text-to-image
Prompt, tamanho, qualidade, quantidade
Banners de destaque, arte de estados vazios, ícones, placeholders
image-to-image
Imagem de origem, prompt, máscara opcional
Corrigir uma área de uma captura de tela, redesenhar o estilo de uma foto, remover um objeto
Uma edição típica: envie a foto do seu produto, aplique uma máscara no fundo e peça um cenário mais discreto. A área mascarada muda enquanto o resto da imagem permanece, o que mantém o próprio produto intacto entre as versões.
Modelo de imagem atual da OpenAI, snapshot gpt-image-2-2026-04-21, disponível para geração, edições e lote
Seu servidor precisa listá-lo
gpt-image-1
Geração anterior, e a que o README menciona
Mais antigo, então espere atualizar depois
dall-e-3
Modelo mais antigo
Uma imagem por requisição (n=1)
dall-e-2
O mais antigo dos quatro
Mantenha apenas para fluxos legados
Se a versão que você instalou ainda não lista gpt-image-2, atualize o pacote ou escolha outro servidor que liste. A própria API aceita gpt-image-2 como um id de modelo simples, e a documentação da OpenAI lista os endpoints v1/images/generations, v1/images/edits e v1/batch para ele.
Configure no Cursor
O Cursor lê os servidores MCP a partir de um arquivo mcp.json. Você precisa de uma credencial da OpenAI, do Node.js no PATH e de uns dois minutos.
Escolha o escopo global ou do projeto
Global:~/.cursor/mcp.json deixa a ferramenta disponível em todos os projetos.
Projeto:.cursor/mcp.json mantém a ferramenta dentro de um repositório, para que colegas que abrirem a pasta recebam a mesma ferramenta.
Use o arquivo do projeto quando a ferramenta de imagem pertencer a um só produto, e o arquivo global quando você quiser usá-la em todo lugar. Em qualquer caso, mantenha o segredo fora do arquivo e deixe o Cursor lê-lo do seu ambiente.
Exporte OPENAI_API_KEY no seu perfil de shell e depois reinicie o Cursor para que o processo do editor herde a variável. Abra as configurações de MCP, e o servidor openai-image deve aparecer como conectado, com duas ferramentas listadas. O Cursor também pode ligar e desligar um servidor pela barra lateral Customize sem apagá-lo.
💡 Mantenha as aprovações ativas. Por padrão, o Cursor pede confirmação antes de executar ferramentas MCP. Numa ferramenta cobrada por renderização, essa confirmação é um recurso, não um incômodo. Só libere a ferramenta de imagem na lista de permitidas depois de acompanhar uma semana de uso.
Configure no Codex
O Codex guarda as configurações de MCP em config.toml. Você pode adicionar um servidor com um único comando ou editar o arquivo manualmente.
O -- separa as flags do próprio Codex do comando do servidor. Isso grava o valor diretamente no arquivo de configuração, então use a opção seguinte em uma máquina compartilhada.
env_vars repassa a variável do seu shell, então nenhum segredo vai parar no arquivo. O arquivo fica em ~/.codex/config.toml, e um projeto confiável pode trazer o seu próprio .codex/config.toml.
Os dois timeouts importam mais do que parecem. Por padrão, o Codex espera 10 segundos para um servidor iniciar e 60 segundos para uma chamada de ferramenta. A primeira execução de npx baixa o pacote, e uma renderização de alta qualidade pode demorar, então os dois padrões são curtos demais. Os valores acima são uma sugestão minha, não uma exigência.
O Codex também tem uma configuração de aprovação por servidor, default_tools_approval_mode, com valores como prompt e approve. Defini-la como prompt dá o mesmo hábito de confirmar antes de gastar que no Cursor. Consulte a documentação atual de MCP do Codex para ver as opções exatas da sua versão.
Quanto custa o GPT Image 2
O servidor MCP é um software gratuito. Você paga à OpenAI por cada renderização. Em 1024 por 1024, listas de preços de revendedores colocam o GPT Image 2 aproximadamente nestes valores:
Qualidade
Uso típico
Custo aproximado por renderização
Baixa
Rascunhos de layout, miniaturas, testes de prompt
cerca de US$ 0,006
Média
Imagens de blog, mockups de produto
cerca de US$ 0,053
Alta
Arte final de destaque, gráficos com muito texto
cerca de US$ 0,211
💡 Esses números vêm de listas de preços de revendedores, não da página da própria OpenAI. A OpenAI cobra por tokens, então tamanhos maiores, edições com imagens de entrada e prompts longos alteram o total. Confirme na página de preços da OpenAI antes de definir seu orçamento.
Rascunhe em baixa, finalize em alta
Faça 40 renderizações de rascunho em baixa qualidade, cerca de US$ 0,24, para definir composição e texto. Depois invista em 5 finais de alta qualidade, cerca de US$ 1,06. A sessão inteira fica em torno de US$ 1,30. Dez tentativas cegas em alta qualidade para obter uma imagem aproveitável custariam cerca de US$ 2,11 só nelas.
Coloque um teto nos gastos
Defina um limite mensal de gastos no painel da OpenAI.
Crie uma credencial de projeto separada para o editor, para poder revogá-la sozinha.
Mantenha as aprovações de ferramentas ativas até o hábito se firmar.
Peça uma imagem por chamada, a menos que esteja comparando opções.
Correções para erros comuns
A maioria das falhas se encaixa em cinco padrões. Consulte esta tabela antes de mudar qualquer outra coisa.
Sintoma
Causa provável
Correção
Servidor fica vermelho ou nunca conecta
O primeiro download de npx está lento, ou npx não está no PATH
Execute o comando em um terminal uma vez e depois aumente startup_timeout_sec no Codex
Erro 401 em todas as chamadas
A credencial não está no ambiente do editor
Exporte OPENAI_API_KEY e depois reinicie o editor por completo
Chamada de ferramenta expira em uma renderização grande
O Codex espera 60 segundos por padrão
Aumente tool_timeout_sec ou reduza a qualidade para média
"Model not found" ou 403
Sua conta ou a lista de modelos do servidor não tem o modelo
Verifique o acesso ao modelo no painel da OpenAI e atualize o servidor
Caminho da imagem aponta para um arquivo inexistente
O servidor gravou em uma pasta temporária
Peça ao agente para copiar os arquivos para a sua pasta de assets
Quando o servidor nunca conecta
Primeiro execute o command e o args exatos em um terminal. Se npx baixar o pacote ali, o próximo início do editor será mais rápido. No Windows, algumas configurações só iniciam npx pelo shell, então tente cmd como comando e ["/c", "npx", "-y", "imagegen-mcp", "--models", "gpt-image-1"] como argumentos. No Codex, aumente startup_timeout_sec antes de suspeitar de qualquer outra coisa.
Onde foi parar minha imagem
O servidor grava cada resultado em uma pasta temporária, então o arquivo pode desaparecer na próxima limpeza. Adicione uma instrução permanente às regras do seu projeto: .cursor/rules para o Cursor, ou AGENTS.md para o Codex.
💡 Uma regra que funciona: "Depois de gerar uma imagem, copie-a para public/images/, dê a ela um nome de arquivo descritivo e escreva um texto alternativo que descreva a imagem."
Rode o GPT Image 2 no PicassoIA
Nem todo mundo quer uma fatura de API e um processo Node. O PicassoIA hospeda o GPT Image 2 ao lado do GPT Image 2.5 Flare e do GPT Image 2.5 Sunburst, então você pode gerar no navegador e soltar os arquivos no seu repositório.
Cole um prompt longo e específico. O modelo segue instruções em várias partes e renderiza texto legível dentro da imagem.
Escolha a proporção e a qualidade na tabela abaixo.
Escolha um fundo e depois defina quantas imagens quer (de 1 a 10).
Gere, baixe o arquivo e mova-o para a sua pasta de assets.
Configuração
Opções
Escolha quando
quality
low, medium, high, auto
Low para rascunhos, high para finais
aspect_ratio
1:1, 3:2, 2:3, 16:9, 9:16, além de tamanhos fixos até 3840x2160
16:9 para banners de destaque
background
auto, transparent, opaque
Transparent para ícones e recortes
output_format
png, jpeg, webp
PNG ou WebP quando você precisar de transparência
number_of_images
1 a 10
Várias opções de um mesmo conceito
input_images
Uma ou mais imagens de referência
Edições e orientação de estilo
O formulário também tem um campo opcional para a sua própria credencial da OpenAI. Deixe-o vazio e a requisição passa pelo proxy do PicassoIA.
💡 Atalho para o prompt: peça a um modelo de linguagem como o GPT 5.6 Sol ou o Claude Sonnet 5 para transformar uma ideia de uma linha em um prompt detalhado, depois cole o resultado no formulário de imagem.
A API do PicassoIA e o conector MCP
O PicassoIA também oferece uma API para desenvolvedores e um conector MCP. A URL base é https://api.picassoia.com/v1, as requisições usam uma credencial Bearer que começa com pia_sk_, e os endpoints seguem o estilo do Replicate: crie uma previsão e depois consulte o status dela. Quatro modelos estão disponíveis por ela: PicassoIA Image, PicassoIA Image Editor Pro e dois modelos de vídeo.
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
-H "Authorization: Bearer $PICASSOIA_API_KEY" \
-H "Content-Type: application/json" \
-d '{"input": {"prompt": "wooden desk with a laptop, soft morning light", "aspect_ratio": "16:9"}}'
Depois, chame GET /v1/predictions/{id} até que status mostre succeeded, e leia as URLs das imagens em output. Limites para planejar: 5 previsões simultâneas por conta, prompts de até 4.000 caracteres e um corpo de requisição de 10 MB.
O GPT Image 2 não é um dos quatro modelos da API. Então a divisão é simples: use o servidor da OpenAI acima quando quiser o modelo da OpenAI dentro do Cursor ou do Codex, e use a API do PicassoIA quando quiser os modelos de imagem próprios do PicassoIA a partir de código. A página da API atualmente lista as previsões como gratuitas, mas os requisitos de plano são descritos de outra forma em outras partes do site, então confirme os termos na página de preços antes de contar com isso.
Faça suas primeiras imagens hoje
Comece pequeno. Abra o GPT Image 2 no PicassoIA, cole o prompt que você entregaria ao seu agente e gere três variações em baixa qualidade. Compare, escolha uma vencedora e rode essa de novo em alta qualidade. Dez minutos disso revelam mais sobre os seus prompts do que uma hora ajustando configurações.
Três prompts que vale testar primeiro:
Banner de destaque: uma cena larga em 16:9 que combine com o clima do seu produto, com espaço à esquerda para um título
Estado vazio: uma cena calma e simples, em estilo fotográfico, para a tela que o usuário vê antes de adicionar dados
Prévia para redes sociais: uma imagem marcante em 3:2 com uma legenda de duas palavras renderizada dentro dela
Quando as imagens estiverem certas, conecte as mesmas configurações ao Cursor ou ao Codex e deixe o agente cuidar do salvamento. Se quiser explorar mais opções antes, a lista completa de modelos está em picassoia.com/en/all-models. Escolha um modelo, rode seu primeiro prompt no PicassoIA e veja o que aparece na pasta do seu projeto até a hora do almoço.