A fatura do Replicate parece inofensiva na primeira semana. No terceiro mês, alguns milhares de gerações de imagem e um punhado de testes de vídeo já a transformaram em um item que você abre de olho semicerrado. Se você procura uma alternativa gratuita ao Replicate para começar, ou pelo menos uma forma mais barata de rodar os mesmos tipos de modelo, o mercado se dividiu em faixas claras: cobrança por saída, hosts de taxa baixa para modelos abertos e plataformas que rodam os próprios modelos em suas GPUs e não cobram nada por imagem em um plano pago. Este artigo mostra como o Replicate cobra, como fica a conta para imagens e vídeo e qual opção custa menos para cada tipo de trabalho. Nada de exagero, só números e um plano de migração realista.
Por que as pessoas deixam o Replicate
O Replicate construiu sua reputação com mérito. O catálogo é enorme, com dezenas de milhares de modelos da comunidade empacotados em um único padrão de API, e você consegue testar um modelo de pesquisa obscuro em poucos minutos. O atrito aparece depois, quando um protótipo vira produto e a fatura deixa de ser um detalhe.
Três grupos sentem isso primeiro: desenvolvedores independentes que lançam um recurso com tráfego imprevisível, agências que produzem lotes de imagens para clientes e criadores de conteúdo que geram dezenas de variações por postagem. Os três têm uma característica em comum: refazem muito as gerações, e a cobrança por uso cobra por cada nova tentativa.
A surpresa da cobrança por segundo
Nos modelos públicos da comunidade, você paga pelos segundos que a GPU gasta no seu trabalho. Preparação e tempo ocioso são gratuitos, o que parece generoso, mas os segundos ativos ainda dependem do modelo, do nível de hardware, do tamanho da saída e do número de passos. Dois prompts que parecem idênticos para você podem custar valores diferentes, então o orçamento vira um chute até você ter semanas de registros para calcular a média.
O crédito gratuito acaba rápido
Contas novas recebem um pequeno crédito de teste, e depois vem o pagamento conforme o uso. Não existe um plano gratuito permanente. Para um projeto pessoal ou a demonstração de um cliente, isso significa um cartão cadastrado quase de imediato, e uma tarde de testes de vídeo pode esgotar o crédito antes que você tenha um único clipe utilizável.

💡 Verificação rápida: exporte o uso dos últimos 30 dias e ordene por modelo. Na maioria das contas, dois ou três modelos concentram a maior parte do gasto. São esses que valem a pena migrar primeiro.
Como o Replicate cobra hoje
Há dois modos de cobrança, e confundi-los é o erro de orçamento mais comum.
Modelos da comunidade cobram por tempo de GPU
Taxas de hardware publicadas no momento em que este texto foi escrito:
| Hardware | Preço por segundo | Preço por hora |
|---|
| Nvidia T4 | $0.000225 | $0.81 |
| Nvidia L40S | $0.000975 | $3.51 |
| Nvidia A100 80GB | $0.001400 | $5.04 |
| Nvidia H100 | $0.001525 | $5.49 |
Um trabalho de texto para imagem que roda 10 segundos em uma L40S custa cerca de $0.01, então 1.000 imagens ficam perto de $10. Um trabalho de vídeo que precisa de 90 segundos em uma H100 custa cerca de $0.14 por clipe, então 500 clipes somam aproximadamente $69. Modelos lentos, resoluções grandes e números altos de passos aumentam esses segundos, e a fatura acompanha.
Modelos oficiais cobram por saída
Os modelos que o próprio Replicate mantém ignoram o relógio e cobram por resultado. O FLUX 1.1 Pro está listado a $0.04 por imagem, e o Wan 2.1 I2V 480p a $0.09 por segundo de vídeo gerado. Um clipe de cinco segundos custa, portanto, $0.45, e 500 clipes custam $225. Previsível, sim. Barato, não necessariamente.

💡 Os preços mudam com frequência. Trate cada valor deste artigo como um retrato do momento e confirme na página de preços atualizada de cada provedor antes de fechar um orçamento.
"Mais barato" pode significar três coisas diferentes: uma taxa menor para o mesmo modelo, um plano gratuito ou um modelo menor que termina em um terço do tempo. Ordene suas opções pelo que você realmente precisa entre as três.
Hosts por saída e de taxa baixa
A fal.ai cobra por saída, com o vídeo precificado por segundo de material, e lista uma imagem do Flux Dev por volta de $0.025. A Runware publica comparações lado a lado que colocam o mesmo modelo perto de $0,0013 por imagem, o que o tornaria uma das taxas mais baixas para trabalho de alto volume com modelos abertos. A WaveSpeed cobra por geração e aposta em modelos de laboratórios chineses, como o Seedream 4.5 e o Wan 2.6 T2V. A Together AI se concentra em modelos de linguagem de código aberto, com preço serverless por token e GPUs dedicadas cobradas por hora.
Planos gratuitos e faixas ilimitadas
A única forma de vencer uma taxa baixa por saída é tirar o medidor. O PicassoIA roda os próprios modelos de imagem e vídeo em suas próprias GPUs, e eles são gratuitos nos planos Infinite e Wonder. A 1.000ª imagem custa o mesmo que a primeira: nada a mais. Isso importa sobretudo para quem itera muito, porque as novas tentativas são justamente onde as contas por saída se multiplicam sem que você perceba.
| Plataforma | Como cobra | Mais forte em |
|---|
| Replicate | Segundos de GPU, ou por saída em modelos oficiais | A maior variedade de modelos da comunidade |
| fal.ai | Por saída e por segundo de vídeo | Endpoints de imagem e vídeo para produção |
| Runware | Por imagem, com taxas listadas muito baixas | Imagens em alto volume de modelos abertos |
| WaveSpeed | Por geração | Famílias de modelos Seedream e Wan |
| Together AI | Por token, ou GPUs dedicadas por hora | Modelos de linguagem de código aberto |
| PicassoIA | Gratuito nos planos Infinite e Wonder para os próprios modelos | Imagens, vídeo e modelos de linguagem em um único login, mais uma API no estilo Replicate |
Como escolher:
- Muito volume de imagem, só modelos abertos: um host de taxa baixa por saída.
- Trabalho misto de imagem, vídeo e texto: uma plataforma que ofereça os três.
- Picos imprevisíveis: cobrança por saída, já que você nunca paga por segundos que não esperava.
- Orçamento zero: um plano gratuito com os modelos próprios de GPU da plataforma.
Custos escondidos atrás da tabela de preços
A taxa anunciada é só parte da fatura. Partidas a frio não custam dinheiro nos modelos públicos do Replicate, mas custam latência, e um usuário olhando para uma tela de carregamento por 40 segundos paga um preço próprio. As versões dos modelos são atualizadas, então um prompt que funcionou bem no mês passado pode se comportar de outra forma hoje. Armazenamento de saídas, novas tentativas e as horas que sua equipe gasta com código de cola entram na conta em algum lugar, mesmo quando nunca chegam à fatura.
Antes de escolher um vencedor só pelo preço, rode vinte dos seus prompts reais em cada candidato e registre o custo, o tempo de espera e quantas saídas você de fato aproveitou. Depois divida o custo por execução pela sua taxa de aproveitamento para obter o custo por imagem utilizável: $0.01 com 30 por cento de aproveitamento dá cerca de $0.033 por imagem aproveitada, enquanto $0.02 com 80 por cento de aproveitamento dá $0.025.

Opções gratuitas de geração de imagem
É em imagens que a economia aparece primeiro, porque modelos destilados e rápidos são bons o bastante para a maioria dos rascunhos.
Modelos rápidos para rascunhos
O PicassoIA Image é o modelo de texto para imagem próprio da plataforma e um dos quatro modelos expostos pela API, o que o torna o ponto de partida natural. Para alternativas com foco em velocidade, o P-Image, o FLUX Schnell e o Z-Image Turbo devolvem resultados em poucos segundos, então cada iteração de prompt custa muito pouco em tempo. Use-os para encontrar a composição e depois gere de novo o vencedor em um modelo mais pesado.
Modelos de qualidade para a versão final
Quando a imagem vai para uma landing page ou para impressão, suba o nível. O Seedream 4.5 e o FLUX 2 Pro são escolhas fortes em detalhe. O Stable Diffusion 3.5 Large continua sendo uma opção confiável de pesos abertos, e o Qwen Image vale um teste quando você precisa de texto legível dentro da imagem. Para ajustes como trocar um fundo ou remover um objeto, o PicassoIA Image Editor Pro edita a imagem existente, então você não paga para regenerar a cena inteira.
Dois hábitos esticam qualquer orçamento. Primeiro, gere já na proporção final: uma imagem principal 16:9 recortada de um quadrado desperdiça pixels e muitas vezes perde o assunto. Segundo, reutilize seeds. Quando um rascunho está próximo, mantenha a seed e mude uma frase do prompt, e você direciona o resultado em vez de jogar os dados de novo. Os dois hábitos funcionam em qualquer plataforma, gratuita ou por uso, mas economizam mais onde cada execução tem um preço.


Opções gratuitas de geração de vídeo
É no vídeo que a cobrança por segundo mais pesa, porque cada segundo gerado conta e raramente o clipe sai certo na primeira tentativa.
Faixas gratuitas para vídeo
O Picasso IA Video é um gerador de vídeo gratuito e ilimitado que funciona a partir de texto ou de uma imagem estática. O Seedance 2.5 Lite produz clipes de até 10 segundos com áudio. Os dois estão disponíveis tanto pela API quanto pela interface web, então um script pode enfileirar clipes durante a noite.
Modelos de vídeo econômicos e premium
O Wan 2.2 5B Fast e o LTX 2.3 Fast são feitos para velocidade, e em qualquer plataforma cobrada por tempo, velocidade se traduz diretamente em custo menor. O Wan 2.2 I2V Fast anima uma foto, que costuma ser a forma mais barata de obter movimento, porque a imagem faz a maior parte do trabalho. Reserve o Kling v3 Video, o Veo 3.1 Fast e o Seedance 2.0 Fast para as tomadas principais, em que o acabamento extra justifica uma taxa maior.
Planeje os clipes como planos curtos, e não como tomadas longas. Uma tomada de cinco segundos que faz uma coisa bem, como uma aproximação lenta sobre um produto ou um único gesto de mão, dá certo muito mais vezes do que uma tomada de dez segundos que tenta contar uma história. Una os planos em um editor e o público os lê como uma única sequência. As gerações com falha são o verdadeiro fator de custo no vídeo, então cada plano que você simplifica é uma nova tentativa que você não paga.
Como usar o Picasso IA Video
- Abra a página do Picasso IA Video e faça login.
- Escolha texto para vídeo ou envie uma imagem estática para usar como primeiro quadro.
- Escreva uma frase de movimento com três partes: o assunto, o que ele faz e como a câmera se move. Exemplo: "Uma mulher levanta uma caneca de café em uma mesa iluminada pelo sol, aproximação lenta, luz suave da manhã."
- Gere o clipe, revise e baixe o resultado.
- Precisa de até 10 segundos com áudio? Rode a mesma ideia no Seedance 2.5 Lite.
💡 Dica: comece com uma boa imagem estática. Animar uma foto bem feita é melhor do que pedir que só o texto invente o assunto, o cenário e o movimento de uma vez.

Como migrar um fluxo de trabalho
A troca consiste sobretudo em mudar uma URL base, um nome de modelo e um token.
A API se encaixa com facilidade
A API do PicassoIA segue o mesmo padrão de criar, consultar e buscar que os usuários do Replicate já conhecem. A URL base é https://api.picassoia.com/v1, e as requisições levam um token Bearer que começa com pia_sk_. Você cria tokens na página da API do PicassoIA, até dois por conta.
| Ação | Endpoint |
|---|
| Criar uma predição | POST /v1/models/{owner}/{name}/predictions |
| Verificar status | GET /v1/predictions/{id} |
| Cancelar uma predição | POST /v1/predictions/{id}/cancel |
| Listar predições | GET /v1/predictions |
Quatro modelos estão disponíveis pela API: PicassoIA Image, PicassoIA Image Editor Pro, Picasso IA Video e Seedance 2.5 Lite. Limites para planejar: 5 predições simultâneas por conta (compartilhadas entre tokens e conexões MCP), um corpo de requisição de 10 MB, prompts de 4.000 caracteres e um tempo limite de 3 horas. A página da API descreve as predições como atualmente gratuitas e sem créditos, mas o acesso depende do seu plano, então confira qual plano inclui o recurso antes de construir algo em cima dele.
💡 Com um teto de cinco predições simultâneas, um pool de cinco workers é o ponto ideal. Um sexto worker não acrescenta nada, a não ser confusão nos seus logs.
Uma lista de verificação para migrar com segurança:
- Liste cada modelo que seu app chama no Replicate e a parcela do gasto que cada um representa.
- Associe cada um a um equivalente no PicassoIA, começando pelo que mais gasta.
- Rode 20 prompts reais nos dois e compare qualidade, tempo de espera e custo.
- Direcione 10 por cento do tráfego para o novo endpoint e acompanhe a taxa de erro.
- Aumente a parcela em etapas e mantenha a rota antiga como fallback por uma semana.

Deixe um LLM escrever seus prompts
A qualidade do prompt decide quantas novas tentativas você paga. Um modelo de linguagem rascunha e expande prompts com rapidez: o GPT OSS 20B, o Llama 4 Maverick Instruct e o Gemini 3.5 Flash são todos rápidos o bastante para escrever vinte variantes de prompt em segundos. Forneça uma descrição de produto, peça três descrições de plano que nomeiem a lente, a iluminação e o movimento, e envie a melhor para o seu modelo de imagem ou vídeo.
Faça as contas reais
Considere um criador que faz 1.000 imagens e 100 clipes de cinco segundos por mês. As linhas abaixo usam a conta de exemplo de antes: 10 segundos por imagem em uma L40S, 90 segundos por clipe em uma H100 e as taxas oficiais listadas do Replicate.
| Cenário | 1.000 imagens | 100 clipes | Total mensal |
|---|
| Modelos da comunidade, segundos de GPU | $9.75 | $13.73 | $23.48 |
| Modelos oficiais, por saída | $40.00 | $45.00 | $85.00 |
| Modelos próprios em um plano gratuito | Sem cobrança por saída | Sem cobrança por saída | Somente o preço do plano |
As duas linhas do Replicate usam modelos diferentes, então mostram como a cobrança se comporta, e não qual modelo parece melhor. O ponto é que a mesma carga de trabalho mensal pode ficar em qualquer lugar entre algumas dezenas de dólares e várias vezes isso, dependendo de um modo de cobrança que você talvez não tenha escolhido de propósito.
Se você faz só imagens, a diferença diminui: 1.000 rascunhos em um modelo comunitário rápido custam cerca de $10 por mês na cobrança por GPU. A economia cresce com o volume, e o vídeo cresce mais rápido, porque cada clipe custa mais de dez vezes o preço de uma imagem nos dois modos de cobrança do Replicate.
Quatro erros que inflam a fatura
- Usar um modelo de qualidade final para rascunhos. Itere em um modelo rápido e renderize uma vez.
- Gerar a imagem inteira de novo para um ajuste pequeno. Use um modelo editor.
- Refazer às cegas. Registre prompts e seeds para que cada nova tentativa mude algo de propósito.
- Loops de nova tentativa sem limite. Limite as tentativas por trabalho, ou um prompt ruim pode consumir um dia inteiro de orçamento.

Teste no seu próximo lote
Escolha a carga de trabalho que domina sua fatura e rode-a de novo no PicassoIA esta semana. Gere dez imagens com o PicassoIA Image, anime as suas três melhores com o Picasso IA Video e compare tempo e custo com os seus registros do Replicate. Se os números se confirmarem, migre a próxima carga de trabalho. Se não, você perdeu uma tarde, não um contrato.
Abra o Picasso IA, escreva seu primeiro prompt e veja até onde um plano gratuito vai antes de o medidor começar a rodar. Seu próximo lote de imagens e clipes pode custar bem menos que o anterior.
