API de edição de imagem: opções gratuitas, OpenAI, Gemini e Qwen comparadas
Escolher uma API de edição de imagem depende do custo por edição, da velocidade, do suporte a máscara e de quanto controle você precisa. Este artigo coloca lado a lado uma rota gratuita, OpenAI, Gemini e Qwen, com formatos de requisição, sinais de preço e uma tabela de decisão curta para cada caso de uso.
A maioria das buscas por uma API de edição de imagem termina do mesmo jeito: três abas abertas no navegador, uma da OpenAI, uma do Gemini e um repositório do Qwen, e nenhuma ideia clara de qual merece um fim de semana de trabalho de integração. As três se comportam de forma bem diferente quando você envia uma foto real. Uma quer uma máscara, outra quer uma conversa, a terceira quer uma GPU. E algumas rotas mais baratas ficam fora das três.
Este artigo compara as opções que importam na prática: uma rota gratuita, o endpoint de edições da OpenAI, o modelo de imagem do Gemini e a família de edição Qwen. Você recebe o formato de requisição de cada uma, os sinais de preço que vale a pena confiar, os modos de falha que vai encontrar e uma tabela que associa cada opção a uma tarefa. Cada modelo citado aqui também roda na PicassoIA, então você pode testar o mesmo prompt em todos antes de escrever uma linha de código de integração.
💡 Resposta rápida: Para protótipos rápidos e testes ilimitados, comece com um editor hospedado gratuito. Para seguir instruções com rigor e controlar máscaras, escolha a OpenAI. Para edições conversacionais, com várias etapas, escolha o Gemini. Para pesos abertos e edições com muito texto, escolha o Qwen.
O que uma API de edição de imagem faz
Uma API de edição de imagem recebe uma imagem existente mais uma instrução e devolve uma imagem alterada. Isso parece geração de imagem, mas a diferença decide tudo. Uma chamada de geração inventa pixels a partir do nada. Uma chamada de edição precisa preservar a maior parte do original, os rostos, a iluminação, o rótulo do produto, e mudar apenas o que você pediu.
Chamadas de edição ou de geração
Os dois tipos de chamada parecem parecidos na comunicação com a API, mas falham de jeitos diferentes.
Entrada: uma chamada de geração recebe texto. Uma chamada de edição recebe uma ou mais imagens mais texto, e às vezes uma máscara.
Saída: uma chamada de geração não tem referência para comparar. Uma chamada de edição é avaliada contra o original, então um rosto levemente deslocado ou um logotipo alterado conta como erro.
Modo de falha: a geração falha por parecer estranha. A edição falha por deriva, ou seja, as partes que você nunca mencionou mudam sem aviso.
Custo: chamadas de edição costumam cobrar os tokens da imagem de entrada além da imagem de saída, então a mesma foto pode custar mais para editar do que para criar.
Máscaras, referências e instruções
Cada provedor escolhe um de três estilos de controle, e o estilo molda toda a sua integração.
Baseado em máscara: você envia uma segunda imagem em que a área a ser alterada está marcada. Você tem controle cirúrgico, mas precisa criar ou gerar a máscara por conta própria.
Somente instrução: você descreve a mudança em linguagem simples e o modelo decide onde aplicá-la. A integração é trivial, mas a precisão depende da redação.
Baseado em referência: você envia duas ou três imagens e as menciona pelo número, como em "coloque a jaqueta da imagem 2 na pessoa da imagem 1."
Inpainting, o ato de repintar uma região selecionada, é o uso clássico de máscara. Outpainting, que expande a tela além das bordas originais, costuma funcionar com a mesma ideia de máscara, só que invertida.
Opções gratuitas que realmente funcionam
Gratuito é a palavra mais mal usada neste nicho, então vale separar três sentidos: gratuito para baixar, gratuito para um teste limitado e gratuito para chamar em volume.
Pesos abertos que você hospeda por conta própria
O download gratuito mais forte é a família de edição Qwen, descrita na própria seção mais abaixo. O modelo base Qwen Image é uma versão de cerca de 20 bilhões de parâmetros sob licença Apache 2.0, que permite uso comercial. A pegadinha é o hardware: você precisa de uma GPU séria com bastante VRAM, ou de uma versão quantizada e paciência. Seu custo deixa de ser taxa por imagem e passa a ser servidores e tempo de engenharia.
FLUX Kontext Dev é outro editor de pesos abertos. Leia a licença antes de publicar qualquer coisa, porque algumas versões para desenvolvedores restringem o uso comercial.
Camadas gratuitas e demos hospedadas
Os grandes provedores oferecem camadas gratuitas para suas APIs de desenvolvedor, mas os limites, os modelos elegíveis e as cotas de requisição mudam com frequência, e a saída de imagem costuma ser mais restrita do que a de texto. Trate qualquer camada gratuita como um lugar para prototipar e confira a página de preços atual antes de planejar um lançamento em cima dela. Páginas de demonstração públicas em sites de hospedagem da comunidade servem para julgar a qualidade e só. Elas entram em fila, ficam inativas e desaparecem.
Onde a PicassoIA se encaixa
O PicassoIA Image Editor Pro é o editor nativo da plataforma, e sua página de produto o descreve como ilimitado: sem limite por edição e sem cota diária. Ele aceita até três imagens de referência e recebe um prompt em linguagem simples.
Para desenvolvedores, a PicassoIA expõe uma API REST em https://api.picassoia.com/v1, com endpoints no estilo Replicate: você cria uma previsão, consulta o status e depois busca o resultado. Os limites a considerar são 5 previsões simultâneas por conta, um corpo de requisição de 10 MB e prompts de até 4.000 caracteres. A documentação descreve as previsões da API como gratuitas no momento, mas também menciona um requisito de plano, então confirme os termos exatos na página de preços antes de construir um negócio em cima disso.
API de edição de imagem da OpenAI
A família GPT Image da OpenAI é a referência em seguimento de instruções. Ela lê prompts longos e específicos com bom desempenho, renderiza texto legível dentro das imagens e segue de perto as instruções de layout. Na PicassoIA você pode testar GPT Image 2, GPT Image 1.5 e GPT Image 1 lado a lado.
Formato da requisição
O endpoint de edições recebe um formulário multipart: uma ou mais imagens, uma máscara opcional e um prompt. Onde a máscara é transparente, o modelo pode alterar os pixels.
curl https://api.openai.com/v1/images/edits \
-H "Authorization: Bearer $OPENAI_TOKEN" \
-F "model=gpt-image-1" \
-F "image=@room.png" \
-F "mask=@mask.png" \
-F "prompt=Replace the sofa with a green velvet sofa, keep the lighting"
Troque o nome do modelo pelo modelo GPT Image mais recente listado na sua conta. Qualidade e tamanho são parâmetros separados, e eles pesam mais na conta do que qualquer outra coisa.
💡 Dica: Diga o que deve permanecer igual, e não apenas o que deve mudar. "Mantenha o rosto, a camisa e o fundo idênticos" reduz bastante a deriva.
Sinais de preço
A OpenAI cobra por tokens, e o preço efetivo por imagem depende do tamanho e do nível de qualidade que você pede. Um sinal mais claro vem da Replicate, onde o GPT Image 2 é cobrado por imagem de saída: cerca de US$ 0,012 na qualidade baixa, US$ 0,047 na média e US$ 0,128 na alta. A qualidade alta custa aproximadamente dez vezes mais que a baixa, então um pipeline que usa a alta por padrão vai surpreender você no fim do mês.
O Gemini edita pela mesma chamada generateContent que você usa para texto. Você envia um corpo JSON para o endpoint do modelo gemini-2.5-flash-image, com suas credenciais no cabeçalho da requisição, e a imagem viaja como dados base64 junto da instrução. A resposta devolve uma imagem na mesma estrutura.
Não é preciso máscara. Você também pode manter uma conversa, pedindo uma segunda mudança sobre a primeira, o que é a forma mais rápida de iterar sobre um visual. Várias imagens de referência em uma única requisição tornam o modelo adequado para combinar uma pessoa, um produto e uma cena.
Onde ele tem dificuldade
O Gemini é generoso com a criatividade e menos rígido com a preservação. Detalhes finos fora da área editada podem mudar, e não vale confiar na restauração exata, pixel por pixel, da região intocada. Filtros de segurança podem recusar pedidos que outros modelos aceitam, e as saídas trazem uma marca d’água invisível de procedência. Para um pipeline em que a parte não editada da imagem precisa permanecer idêntica, combine o Gemini com uma etapa de verificação ou escolha um modelo baseado em máscara.
Modelos de edição Qwen Image
A equipe Qwen da Alibaba lançou um modelo de edição que se destaca em duas áreas: alterar texto dentro de uma imagem e aplicar mudanças locais e precisas de aparência. Na PicassoIA você pode usar Qwen Image Edit, Qwen Image Edit Plus e Qwen Image Edit 2511.
Edições de texto e layout
Se o seu trabalho envolve cartazes, embalagens, cardápios ou capturas de tela, vale testar o Qwen antes de qualquer outra coisa. Ele consegue trocar as palavras de uma placa mantendo o estilo da fonte e a superfície em que o texto está. Também lida com edições semânticas, como girar um objeto ou mudar uma pose, e com edições de aparência, como remover um elemento solto de uma cena. A variante Plus é a que você deve testar quando precisar de várias imagens de entrada, e as revisões mais novas, como a 2511, são as primeiras a testar para consistência.
Hospedado ou auto-hospedado
Você tem três rotas. Use uma API hospedada da Alibaba Cloud ou de um marketplace de modelos para a comodidade de pagar por chamada. Use uma plataforma como a PicassoIA para pular a configuração de conta. Ou rode os pesos abertos por conta própria com a biblioteca diffusers, quando o volume for alto o bastante para justificar uma GPU.
Modelos de visão e linguagem ajudam em pontos secundários. Qwen3.7-Plus e Gemini 3.5 Flash conseguem ler imagens, então você pode pedir que um deles escreva o prompt de edição a partir de um briefing curto, ou que compare as imagens antes e depois e sinalize qualquer mudança que você não pediu.
Custo, velocidade e adequação
O preço por chamada é só uma variável. Latência, taxa de novas tentativas e a quantidade de ajustes após cada edição definem o custo real.
P Image Edit merece uma menção só pela velocidade: ele é descrito como capaz de editar em cerca de um segundo, o que importa quando um usuário está esperando do outro lado de um botão.
Leia a tabela como ponto de partida, não como veredito. As novas tentativas inflam todos os números dela. Se um modelo precisa de três tentativas para entregar um resultado limpo e outro precisa de uma, o preço de etiqueta menor perde. Acompanhe a taxa de edições aceitas de cada modelo nas suas próprias fotos e divida o gasto pelas edições aceitas. Esse número único, custo por edição aceita, é o que deve ser comparado.
Fotos de produtos para e-commerce
Catálogos recompensam consistência mais do que criatividade. Escolha um modelo, um template de prompt e uma seed fixa onde a API oferecer uma, e então rode o lote inteiro do mesmo jeito. Trocas de fundo, limpeza de sombras e variações de cor são todas edições por instrução, então o Gemini e o Qwen as lidam sem máscaras.
Três erros aparecem sempre em pipelines de lote:
Trocar de modelo no meio do lote. Dois modelos renderizam o mesmo prompt com dominantes de cor diferentes, e o catálogo fica desigual.
Pular a verificação da área não alterada. A deriva fica invisível até que um cliente note um rótulo deformado.
Ignorar os limites de concorrência. Disparar centenas de chamadas de uma vez aciona limitação de taxa, então enfileire os trabalhos e respeite o teto do provedor, como as 5 previsões simultâneas da PicassoIA.
Reserve uma etapa de verificação. Rode um modelo de visão sobre uma amostra das saídas e sinalize as que tenham logotipo deformado ou rótulo alterado. Pegar uma imagem ruim em cinquenta custa menos do que devolver o dinheiro de um pedido.
Imóveis e interiores
Remoção virtual de objetos, troca de cor de parede e substituição de céu são os pedidos mais comuns. Máscaras compensam aqui, porque piso, janelas e a geometria do cômodo não podem se mover. O endpoint de edições da OpenAI, com uma máscara só sobre o objeto a remover, dá o controle mais preciso.
💡 Dica: As regras de anúncios sobre fotos editadas variam por região e por marketplace. Divulgue a edição quando as regras exigirem e nunca altere a estrutura, como o tamanho de um cômodo.
Como usar o Image Editor Pro
Existe um modelo na PicassoIA exatamente para essa tarefa, então aqui está o caminho mais curto da foto até o resultado.
Adicione suas imagens. Envie até três imagens de referência. A primeira é a imagem principal, que será editada.
Escreva o prompt. Descreva a mudança em linguagem simples e mencione os envios como "imagem 1", "imagem 2" e "imagem 3".
Defina as opções. Deixe a proporção em match_input_image para manter as dimensões originais, escolha WebP, JPG ou PNG e fixe uma seed se quiser reproduzir o resultado.
Gere e compare. Peça dois resultados por chamada para ver variações e salve o que mantém intactas as áreas que não deviam mudar.
Parâmetro
O que faz
Padrão
images
Até 3 imagens de referência, a primeira é a principal
Obrigatório
prompt
A edição, com referências como "imagem 1"
Obrigatório
num_outputs
1 ou 2 resultados por chamada
1
aspect_ratio
Formato de saída, ou igual ao da entrada
match_input_image
output_format
WebP, JPG ou PNG
webp
output_quality
0 a 100 para JPG e WebP
95
seed
Resultados reproduzíveis
Aleatório
Para código, o mesmo modelo está acessível pela API da PicassoIA. A requisição segue as convenções da Replicate, então confira os exemplos oficiais para os nomes exatos dos campos antes de publicar.
curl -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image-editor-pro/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input":{"images":["https://example.com/room.jpg"],"prompt":"Replace the sofa with a green velvet sofa, keep the lighting"}}'
💡 Dica: Rode o mesmo prompt pelo Nano Banana 2, pelo GPT Image 2 e pelo Qwen Image Edit 2511 antes de escolher um provedor. Dez minutos de testes lado a lado valem mais do que uma tarde lendo páginas de preços.
Teste suas próprias edições hoje
Agora você tem a visão geral prática: OpenAI para controle rigoroso, Gemini para mudanças conversacionais rápidas, Qwen para texto e pesos abertos, e um editor hospedado gratuito para testes em volume. A forma mais rápida de encontrar o seu encaixe é passar uma foto real do seu projeto por todos eles.
Abra o PicassoIA Image Editor Pro, envie uma foto de produto, um retrato ou um cômodo, e escreva a edição que você pagaria a um retocador para fazer. Compare com o Seedream 4.5 e o FLUX Kontext Pro também, e depois finalize o melhor resultado com super resolução para uma exportação nítida em 2x ou 4x. Quando quiser comparar mais opções, explore todos os modelos em picassoia.com/en/all-models e comece a criar suas próprias imagens hoje.