Servidor MCP de geração de imagens da OpenAI para Cursor e Codex: configuração, custos e correções

Adicione um servidor MCP de geração de imagens da OpenAI ao Cursor e ao Codex e deixe seu agente de programação criar banners de destaque, ícones e edições dentro do seu projeto. Configuração pronta para copiar nos dois editores, ajustes do GPT Image 2, custo real por renderização, correções para timeouts e uma rota pelo navegador que dispensa servidor.

Servidor MCP de geração de imagens da OpenAI para Cursor e Codex: configuração, custos e correções
Cristian Da Conceicao
Fundador do Picasso IA

Você está no meio de uma landing page no Cursor, a seção de destaque precisa de uma foto, e o agente não tem nada a oferecer além de uma caixa cinza de espaço reservado. Um servidor MCP de geração de imagens da OpenAI para Cursor e Codex resolve isso num passo só: o agente chama uma ferramenta de imagem, o arquivo cai na pasta do seu projeto, e o layout ganha uma imagem de verdade antes de você abrir qualquer aba do navegador.

Este artigo mostra a configuração exata para os dois editores, os ajustes de modelo que realmente importam, quanto custa uma renderização e os erros que consomem uma tarde inteira. Também inclui uma rota sem servidor para quem prefere clicar a configurar.

Desenvolvedor de suéter cinza trabalhando num notebook sobre uma mesa de carvalho claro, sob luz suave da manhã

Por que colocar a geração de imagens no editor

A rotina de sempre é lenta. Você sai do editor, abre um site de imagens, escreve um prompt de cabeça, baixa o arquivo, renomeia, arrasta para dentro de /public e corrige o caminho no código. Cada passo é pequeno. Juntos, eles quebram seu foco uma dúzia de vezes por dia.

Uma ferramenta de imagem via MCP encurta esse ciclo. O agente já sabe do que se trata a página, porque acabou de escrever a marcação, então pode escrever o prompt a partir do contexto, salvar o arquivo e referenciá-lo no mesmo turno.

Vista de cima de uma mesa de madeira com uma foto impressa de padaria, um caderno de esboços de layout e uma xícara de chá

O que o agente faz por você

  • Escreve o prompt a partir do código ao redor, então uma página de preços e um blog de receitas recebem imagens diferentes
  • Chama a ferramenta e escolhe tamanho, qualidade e fundo
  • Salva o arquivo e atualiza a tag <img> ou o CSS
  • Roda de novo com base no seu feedback, como "luz mais quente, menos cara de banco de imagens"

Dê ao agente uma receita de prompt

Agentes escrevem prompts melhores quando você entrega uma receita em vez de uma página em branco. Guarde esta nas regras do seu projeto e as imagens ficarão consistentes de uma página para outra:

  1. Sujeito e ação: o que está no quadro e o que ele está fazendo
  2. Cenário: o ambiente, rua ou paisagem ao redor
  3. Luz: direção e hora do dia, como luz suave de janela vinda da esquerda
  4. Câmera: distância focal, ângulo e distância, como uma lente de 35 mm na altura dos olhos
  5. Formato: a proporção, e se a imagem precisa de espaço vazio para um título

Acrescente uma frase fixa de estilo a cada prompt, por exemplo "luz natural, granulação fina de filme, texturas realistas", e seu banner de destaque, miniaturas do blog e estados vazios vão parecer um conjunto só. Peça ao agente para escrever o texto alternativo no mesmo turno, já que ele sabe o que a imagem mostra.

Quando uma ferramenta embutida basta

Relatos da comunidade sobre o Codex CLI dizem que ele veio com geração de imagens embutida e uma skill $imagegen quando a OpenAI lançou o gpt-image-2 em 21 de abril de 2026, e que ele funciona com o seu login do ChatGPT em vez de uma credencial de API separada. Se isso corresponde à sua instalação e você precisa de uma imagem por semana, talvez nem precise de MCP.

Um servidor MCP se justifica quando:

  1. Você quer a mesma ferramenta no Cursor e no Codex, com as mesmas configurações.
  2. Você precisa de controle sobre qualidade, fundo e tamanho em vez dos padrões.
  3. Você quer edições baseadas em máscara em capturas de tela ou fotos existentes.
  4. Você planeja trocar de provedor depois sem mudar seu fluxo de trabalho.

💡 Verifique antes: execute codex --version e leia as seções de MCP e de imagem na documentação atual do Codex antes de adicionar um servidor. Uma ferramenta embutida que você esqueceu é a opção mais barata que você tem.

O que o servidor expõe

A maioria dos servidores de imagem da OpenAI no npm são wrappers simples dos endpoints da Images API para geração e edição. O pacote imagegen-mcp, muito usado, expõe duas ferramentas, e o README dele lista gpt-image-1, dall-e-2 e dall-e-3 como modelos compatíveis. Os resultados são salvos em arquivos temporários, e a ferramenta devolve o caminho do arquivo junto com os dados em base64.

Mãos organizando fotos impressas, originais e editadas, em duas fileiras arrumadas sobre uma mesa

Duas ferramentas, dois trabalhos

FerramentaVocê enviaIdeal para
text-to-imagePrompt, tamanho, qualidade, quantidadeBanners de destaque, arte de estados vazios, ícones, placeholders
image-to-imageImagem de origem, prompt, máscara opcionalCorrigir uma área de uma captura de tela, redesenhar o estilo de uma foto, remover um objeto

Uma edição típica: envie a foto do seu produto, aplique uma máscara no fundo e peça um cenário mais discreto. A área mascarada muda enquanto o resto da imagem permanece, o que mantém o próprio produto intacto entre as versões.

Qual modelo escolher

ModeloPosição atualCuidado com
GPT Image 2 (gpt-image-2)Modelo de imagem atual da OpenAI, snapshot gpt-image-2-2026-04-21, disponível para geração, edições e loteSeu servidor precisa listá-lo
gpt-image-1Geração anterior, e a que o README mencionaMais antigo, então espere atualizar depois
dall-e-3Modelo mais antigoUma imagem por requisição (n=1)
dall-e-2O mais antigo dos quatroMantenha apenas para fluxos legados

Se a versão que você instalou ainda não lista gpt-image-2, atualize o pacote ou escolha outro servidor que liste. A própria API aceita gpt-image-2 como um id de modelo simples, e a documentação da OpenAI lista os endpoints v1/images/generations, v1/images/edits e v1/batch para ele.

Configure no Cursor

O Cursor lê os servidores MCP a partir de um arquivo mcp.json. Você precisa de uma credencial da OpenAI, do Node.js no PATH e de uns dois minutos.

Desenvolvedor digitando num notebook ao lado de um monitor externo, em um espaço de coworking iluminado

Escolha o escopo global ou do projeto

  • Global: ~/.cursor/mcp.json deixa a ferramenta disponível em todos os projetos.
  • Projeto: .cursor/mcp.json mantém a ferramenta dentro de um repositório, para que colegas que abrirem a pasta recebam a mesma ferramenta.

Use o arquivo do projeto quando a ferramenta de imagem pertencer a um só produto, e o arquivo global quando você quiser usá-la em todo lugar. Em qualquer caso, mantenha o segredo fora do arquivo e deixe o Cursor lê-lo do seu ambiente.

Cole a configuração

{
  "mcpServers": {
    "openai-image": {
      "type": "stdio",
      "command": "npx",
      "args": ["-y", "imagegen-mcp", "--models", "gpt-image-1"],
      "env": {
        "OPENAI_API_KEY": "${env:OPENAI_API_KEY}"
      }
    }
  }
}

Exporte OPENAI_API_KEY no seu perfil de shell e depois reinicie o Cursor para que o processo do editor herde a variável. Abra as configurações de MCP, e o servidor openai-image deve aparecer como conectado, com duas ferramentas listadas. O Cursor também pode ligar e desligar um servidor pela barra lateral Customize sem apagá-lo.

💡 Mantenha as aprovações ativas. Por padrão, o Cursor pede confirmação antes de executar ferramentas MCP. Numa ferramenta cobrada por renderização, essa confirmação é um recurso, não um incômodo. Só libere a ferramenta de imagem na lista de permitidas depois de acompanhar uma semana de uso.

Configure no Codex

O Codex guarda as configurações de MCP em config.toml. Você pode adicionar um servidor com um único comando ou editar o arquivo manualmente.

Pessoa em uma mesa de pé com notebook e caderno, sob luz do fim da tarde

Um comando faz tudo

codex mcp add openai-image --env OPENAI_API_KEY=your-openai-secret -- npx -y imagegen-mcp --models gpt-image-1
codex mcp list

O -- separa as flags do próprio Codex do comando do servidor. Isso grava o valor diretamente no arquivo de configuração, então use a opção seguinte em uma máquina compartilhada.

Edite o config.toml diretamente

[mcp_servers.openai-image]
command = "npx"
args = ["-y", "imagegen-mcp", "--models", "gpt-image-1"]
env_vars = ["OPENAI_API_KEY"]
startup_timeout_sec = 30
tool_timeout_sec = 180

env_vars repassa a variável do seu shell, então nenhum segredo vai parar no arquivo. O arquivo fica em ~/.codex/config.toml, e um projeto confiável pode trazer o seu próprio .codex/config.toml.

Os dois timeouts importam mais do que parecem. Por padrão, o Codex espera 10 segundos para um servidor iniciar e 60 segundos para uma chamada de ferramenta. A primeira execução de npx baixa o pacote, e uma renderização de alta qualidade pode demorar, então os dois padrões são curtos demais. Os valores acima são uma sugestão minha, não uma exigência.

O Codex também tem uma configuração de aprovação por servidor, default_tools_approval_mode, com valores como prompt e approve. Defini-la como prompt dá o mesmo hábito de confirmar antes de gastar que no Cursor. Consulte a documentação atual de MCP do Codex para ver as opções exatas da sua versão.

Quanto custa o GPT Image 2

O servidor MCP é um software gratuito. Você paga à OpenAI por cada renderização. Em 1024 por 1024, listas de preços de revendedores colocam o GPT Image 2 aproximadamente nestes valores:

QualidadeUso típicoCusto aproximado por renderização
BaixaRascunhos de layout, miniaturas, testes de promptcerca de US$ 0,006
MédiaImagens de blog, mockups de produtocerca de US$ 0,053
AltaArte final de destaque, gráficos com muito textocerca de US$ 0,211

💡 Esses números vêm de listas de preços de revendedores, não da página da própria OpenAI. A OpenAI cobra por tokens, então tamanhos maiores, edições com imagens de entrada e prompts longos alteram o total. Confirme na página de preços da OpenAI antes de definir seu orçamento.

Cofrinho de cerâmica ao lado de uma pilha de moedas e três pequenas fotos instantâneas sobre uma mesa de nogueira

Rascunhe em baixa, finalize em alta

Faça 40 renderizações de rascunho em baixa qualidade, cerca de US$ 0,24, para definir composição e texto. Depois invista em 5 finais de alta qualidade, cerca de US$ 1,06. A sessão inteira fica em torno de US$ 1,30. Dez tentativas cegas em alta qualidade para obter uma imagem aproveitável custariam cerca de US$ 2,11 só nelas.

Coloque um teto nos gastos

  • Defina um limite mensal de gastos no painel da OpenAI.
  • Crie uma credencial de projeto separada para o editor, para poder revogá-la sozinha.
  • Mantenha as aprovações de ferramentas ativas até o hábito se firmar.
  • Peça uma imagem por chamada, a menos que esteja comparando opções.

Correções para erros comuns

Mãos de um técnico com uma pequena chave de fenda sobre um notebook aberto, em uma bancada organizada

A maioria das falhas se encaixa em cinco padrões. Consulte esta tabela antes de mudar qualquer outra coisa.

SintomaCausa provávelCorreção
Servidor fica vermelho ou nunca conectaO primeiro download de npx está lento, ou npx não está no PATHExecute o comando em um terminal uma vez e depois aumente startup_timeout_sec no Codex
Erro 401 em todas as chamadasA credencial não está no ambiente do editorExporte OPENAI_API_KEY e depois reinicie o editor por completo
Chamada de ferramenta expira em uma renderização grandeO Codex espera 60 segundos por padrãoAumente tool_timeout_sec ou reduza a qualidade para média
"Model not found" ou 403Sua conta ou a lista de modelos do servidor não tem o modeloVerifique o acesso ao modelo no painel da OpenAI e atualize o servidor
Caminho da imagem aponta para um arquivo inexistenteO servidor gravou em uma pasta temporáriaPeça ao agente para copiar os arquivos para a sua pasta de assets

Quando o servidor nunca conecta

Primeiro execute o command e o args exatos em um terminal. Se npx baixar o pacote ali, o próximo início do editor será mais rápido. No Windows, algumas configurações só iniciam npx pelo shell, então tente cmd como comando e ["/c", "npx", "-y", "imagegen-mcp", "--models", "gpt-image-1"] como argumentos. No Codex, aumente startup_timeout_sec antes de suspeitar de qualquer outra coisa.

Onde foi parar minha imagem

O servidor grava cada resultado em uma pasta temporária, então o arquivo pode desaparecer na próxima limpeza. Adicione uma instrução permanente às regras do seu projeto: .cursor/rules para o Cursor, ou AGENTS.md para o Codex.

💡 Uma regra que funciona: "Depois de gerar uma imagem, copie-a para public/images/, dê a ela um nome de arquivo descritivo e escreva um texto alternativo que descreva a imagem."

Rode o GPT Image 2 no PicassoIA

Nem todo mundo quer uma fatura de API e um processo Node. O PicassoIA hospeda o GPT Image 2 ao lado do GPT Image 2.5 Flare e do GPT Image 2.5 Sunburst, então você pode gerar no navegador e soltar os arquivos no seu repositório.

Mesa de estúdio de fotógrafo com um notebook exibindo a foto de um lago de montanha, ao lado de uma câmera e de uma xícara de café

Passos no navegador

  1. Abra a página do GPT Image 2.
  2. Cole um prompt longo e específico. O modelo segue instruções em várias partes e renderiza texto legível dentro da imagem.
  3. Escolha a proporção e a qualidade na tabela abaixo.
  4. Escolha um fundo e depois defina quantas imagens quer (de 1 a 10).
  5. Gere, baixe o arquivo e mova-o para a sua pasta de assets.
ConfiguraçãoOpçõesEscolha quando
qualitylow, medium, high, autoLow para rascunhos, high para finais
aspect_ratio1:1, 3:2, 2:3, 16:9, 9:16, além de tamanhos fixos até 3840x216016:9 para banners de destaque
backgroundauto, transparent, opaqueTransparent para ícones e recortes
output_formatpng, jpeg, webpPNG ou WebP quando você precisar de transparência
number_of_images1 a 10Várias opções de um mesmo conceito
input_imagesUma ou mais imagens de referênciaEdições e orientação de estilo

O formulário também tem um campo opcional para a sua própria credencial da OpenAI. Deixe-o vazio e a requisição passa pelo proxy do PicassoIA.

💡 Atalho para o prompt: peça a um modelo de linguagem como o GPT 5.6 Sol ou o Claude Sonnet 5 para transformar uma ideia de uma linha em um prompt detalhado, depois cole o resultado no formulário de imagem.

A API do PicassoIA e o conector MCP

O PicassoIA também oferece uma API para desenvolvedores e um conector MCP. A URL base é https://api.picassoia.com/v1, as requisições usam uma credencial Bearer que começa com pia_sk_, e os endpoints seguem o estilo do Replicate: crie uma previsão e depois consulte o status dela. Quatro modelos estão disponíveis por ela: PicassoIA Image, PicassoIA Image Editor Pro e dois modelos de vídeo.

curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
  -H "Authorization: Bearer $PICASSOIA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input": {"prompt": "wooden desk with a laptop, soft morning light", "aspect_ratio": "16:9"}}'

Depois, chame GET /v1/predictions/{id} até que status mostre succeeded, e leia as URLs das imagens em output. Limites para planejar: 5 previsões simultâneas por conta, prompts de até 4.000 caracteres e um corpo de requisição de 10 MB.

O GPT Image 2 não é um dos quatro modelos da API. Então a divisão é simples: use o servidor da OpenAI acima quando quiser o modelo da OpenAI dentro do Cursor ou do Codex, e use a API do PicassoIA quando quiser os modelos de imagem próprios do PicassoIA a partir de código. A página da API atualmente lista as previsões como gratuitas, mas os requisitos de plano são descritos de outra forma em outras partes do site, então confirme os termos na página de preços antes de contar com isso.

Faça suas primeiras imagens hoje

Comece pequeno. Abra o GPT Image 2 no PicassoIA, cole o prompt que você entregaria ao seu agente e gere três variações em baixa qualidade. Compare, escolha uma vencedora e rode essa de novo em alta qualidade. Dez minutos disso revelam mais sobre os seus prompts do que uma hora ajustando configurações.

Mulher jovem e sorridente segurando uma foto impressa de uma rua da cidade contra a luz, num loft ensolarado

Três prompts que vale testar primeiro:

  • Banner de destaque: uma cena larga em 16:9 que combine com o clima do seu produto, com espaço à esquerda para um título
  • Estado vazio: uma cena calma e simples, em estilo fotográfico, para a tela que o usuário vê antes de adicionar dados
  • Prévia para redes sociais: uma imagem marcante em 3:2 com uma legenda de duas palavras renderizada dentro dela

Quando as imagens estiverem certas, conecte as mesmas configurações ao Cursor ou ao Codex e deixe o agente cuidar do salvamento. Se quiser explorar mais opções antes, a lista completa de modelos está em picassoia.com/en/all-models. Escolha um modelo, rode seu primeiro prompt no PicassoIA e veja o que aparece na pasta do seu projeto até a hora do almoço.

Compartilhe este artigo

Escolha seu idioma