Pagar por geração de imagens e vídeos com IA parece simples até a fatura chegar. Tanto o fal.ai quanto o Replicate anunciam preços baixos por execução, mas cobram em unidades diferentes, e essa diferença decide qual deles é mais barato para a sua carga de trabalho. Verifiquei as duas páginas oficiais de preços no início de outubro e comparei os números modelo por modelo e GPU por GPU.
Resumo: para o mesmo modelo FLUX em um megapixel, as duas plataformas cobram o mesmo preço. Para o preço por hora de GPU, o fal.ai lista uma H100 a US$ 4,50 por hora, contra os US$ 5,49 do Replicate, o que deixa o fal.ai cerca de 18% mais barato pelo preço de tabela. Além disso, o vencedor muda conforme você roda modelos públicos, implantações privadas, imagens ou vídeos.

A resposta curta
Nenhuma das plataformas é mais barata em todos os casos. Veja como os preços publicados se comparam nas tarefas mais comuns:
| Tarefa | Opção mais barata | Motivo |
|---|
| Tempo de H100 alugada | fal.ai | US$ 4,50/h de tabela contra US$ 5,49/h, e o fal.ai mostra taxas a partir de US$ 2,49/h |
| FLUX Dev em 1 MP | Empate | US$ 0,025 por imagem nas duas |
| FLUX Schnell em 1 MP | Empate | US$ 0,003 por imagem nas duas |
| Modelo privado ocioso | Depende | O Replicate cobra configuração e tempo ocioso em modelos privados |
| Execuções ocasionais de modelos públicos | Replicate | Modelos públicos cobram apenas o tempo de processamento ativo |
| Clipes curtos de vídeo | Depende do modelo | Cada plataforma precifica modelos de vídeo diferentes de forma diferente |
💡 Dica: Os preços mudam com frequência. Trate cada número deste artigo como um retrato do momento e confira a página de preços atualizada antes de definir um orçamento.
O que eu verifiquei: a página de preços do fal.ai, a página de preços do Replicate e as páginas de modelo do fal.ai para FLUX Dev e Kling 2.5 Turbo Pro. Quando não consegui confirmar um preço em uma página oficial, eu informo isso no texto em vez de chutar. Por isso, algumas células das tabelas dizem "Não listado" ou "Verificar página atualizada".
Se você tem só 30 segundos, guarde três regras. Primeiro, compare o custo por resultado utilizável, não o custo por execução. Segundo, nunca compare uma GPU sempre ligada com um modelo de pagamento por resultado sem fazer a conta do ponto de equilíbrio. Terceiro, calcule o preço do tamanho exato de imagem ou da duração exata do clipe que você pretende entregar, porque as duas plataformas escalam o custo conforme o tamanho ou a duração.
fal.ai: pague por resultado
O fal.ai usa dois estilos de cobrança. Os modelos hospedados cobram pelo resultado: por imagem, por megapixel ou por segundo de vídeo. Se você implanta seu próprio app na frota serverless dele, paga pelo tempo de GPU.
A página de preços traz alguns exemplos claros. O FLUX Schnell custa US$ 0,003 por megapixel. O Nano Banana custa US$ 0,0398 por imagem. O Kling Video v3 Pro custa US$ 0,14 por segundo de vídeo. O Seedance 2 é cobrado por tokens, a US$ 0,014 por 1.000 tokens.
Um detalhe importa no trabalho com imagens: o fal.ai arredonda as imagens para cima, até o megapixel inteiro mais próximo. Uma saída um pouco acima de um megapixel pode ser cobrada como dois.
Para ver por que isso importa, conte os pixels. Uma imagem de 1024 por 1024 tem cerca de 1,05 milhão de pixels. Um quadro de 1920 por 1080 tem cerca de 2,07 milhões. Uma imagem widescreen de 1344 por 768 tem cerca de 1,03 milhão. Confirme na página do modelo exatamente como o arredondamento trata o seu tamanho, porque uma pequena mudança em largura ou altura pode levar você para a faixa de cobrança seguinte.
Replicate: pague por segundo
A maioria dos modelos no Replicate é cobrada pelo tempo em que ficam em execução, multiplicado pela taxa por segundo do hardware. Um subconjunto de modelos oficiais dispensa o cronômetro e cobra por resultado, como por imagem, por token ou por segundo de vídeo gerado.
O Replicate publica estas taxas de hardware:
- T4: US$ 0,000225 por segundo (US$ 0,81 por hora)
- L40S: US$ 0,000975 por segundo (US$ 3,51 por hora)
- A100 (80GB): US$ 0,001400 por segundo (US$ 5,04 por hora)
- H100: US$ 0,001525 por segundo (US$ 5,49 por hora)
- 8x H100: US$ 0,012200 por segundo (US$ 43,92 por hora)

Os modelos de linguagem seguem a mesma divisão. No Replicate, um modelo como o DeepSeek R1 é precificado por token: US$ 3,75 por milhão de tokens de entrada e US$ 0,01 por mil tokens de saída.
Taxas horárias de GPU comparadas
Se você aluga GPUs diretamente, esta é a tabela que importa. O fal.ai mostra um preço de tabela e um preço mais baixo com a indicação "a partir de". O Replicate mostra uma taxa pública única.
| GPU | fal.ai, tabela | fal.ai, menor valor exibido | Replicate |
|---|
| H100 (80GB) | US$ 4,50/h | US$ 2,49/h | US$ 5,49/h |
| H200 (141GB) | US$ 6,00/h | US$ 2,99/h | Verificar página atualizada |
| B200 (192GB) | US$ 7,99/h | US$ 5,49/h | Não listado |
| A100 (80GB) | Não está na página de preços | Não está na página de preços | US$ 5,04/h |
| L40S | Não está na página de preços | Não está na página de preços | US$ 3,51/h |
| T4 | Não está na página de preços | Não está na página de preços | US$ 0,81/h |
No preço de tabela, a diferença na H100 é de US$ 0,99 por hora. As taxas mais baixas do fal.ai são o melhor cenário, e a página encaminha compradores de maior porte para o time comercial para obtê-las. Alguns resumos de terceiros ainda citam uma H100 a cerca de US$ 1,89 por hora no fal.ai, o que não bate com a página de preços atual, então ignore números antigos.

Exemplo prático: 100 horas de H100 custam US$ 450 no fal.ai pelo preço de tabela, US$ 549 no Replicate e US$ 249 na menor taxa exibida pelo fal.ai. Isso dá uma diferença de US$ 99 no preço de tabela e de US$ 300 na melhor taxa.
Custos de imagem e vídeo
Modelos FLUX empatam em um megapixel
A comparação mais limpa é o mesmo modelo nas duas plataformas. A família FLUX é hospedada em ambas, e as taxas publicadas coincidem.
| Modelo | fal.ai | Replicate |
|---|
| FLUX Dev | US$ 0,025 por megapixel | US$ 0,025 por imagem |
| FLUX Schnell | US$ 0,003 por megapixel | US$ 0,003 por imagem (US$ 3,00 por 1.000) |
Em um megapixel, 10.000 imagens custam US$ 250 com o FLUX Dev e US$ 30 com o FLUX Schnell, em qualquer uma das plataformas.
A unidade de cobrança é onde elas se separam. O fal.ai escala com os pixels e arredonda para cima, então uma saída maior custa mais. O Replicate lista um preço fixo por imagem, então verifique quais tamanhos de saída o modelo permite antes de presumir que uma imagem maior é grátis. O Replicate também lista o FLUX 1.1 Pro a US$ 0,04 por imagem, o que é uma referência útil quando você precifica níveis de qualidade.

Preços de vídeo são mais difíceis de comparar
No vídeo, a comparação lado a lado deixa de ser limpa, porque as plataformas hospedam modelos diferentes em versões diferentes. Estas são as taxas publicadas que consegui verificar:
- fal.ai, Kling v2.5 Turbo Pro de imagem para vídeo: US$ 0,35 por um clipe de 5 segundos, mais US$ 0,07 por cada segundo extra.
- fal.ai, Kling v3 Video Pro: US$ 0,14 por segundo.
- Replicate, Wan 2.1 em 480p: US$ 0,09 por segundo.
- Replicate, Wan 2.1 em 720p: US$ 0,25 por segundo.
Transformando isso em um clipe de 5 segundos, você chega a cerca de US$ 0,35 para o Kling 2.5 Turbo Pro, US$ 0,70 para o Kling v3 Pro, US$ 0,45 para o Wan 2.1 em 480p e US$ 1,25 para o Wan 2.1 em 720p. Um clipe de 10 segundos do Kling 2.5 Turbo Pro custa US$ 0,70, porque os cinco segundos extras somam 5 × US$ 0,07 = US$ 0,35.
O preço por token é o mais difícil de ler. O Seedance 2.0 no fal.ai é cobrado a US$ 0,014 por 1.000 tokens, e a página de preços não diz quantos tokens um segundo de vídeo usa. Gere um clipe de amostra, leia o consumo na sua fatura e faça a multiplicação a partir daí, em vez de chutar.
💡 Dica: Não compare esses números como se os modelos fossem iguais. Um clipe mais barato que você rejeita custa mais do que um clipe mais caro que você aproveita. Julgue o preço por clipe utilizável.

Por que as refações inflam a conta de vídeo
Ninguém aproveita a primeira renderização todas as vezes. Se você precisa de três tentativas por clipe utilizável, multiplique o preço do clipe por três. Um clipe de 5 segundos do Kling v2.5 Turbo Pro a US$ 0,35 passa a custar cerca de US$ 1,05 por clipe aproveitado. Um clipe de 5 segundos do Wan 2.1 720p a US$ 1,25 passa a custar US$ 3,75.
Os modelos de imagem são muito mais tolerantes. Com US$ 0,003 a US$ 0,025 por imagem, até dez tentativas mal aparecem na conta. Por isso muitas equipes testam prompts em modelos de imagem baratos e só gastam com vídeo depois que o quadro estático parece certo.
Inicializações a frio e tempo ocioso
Modelos públicos: o tempo ocioso é grátis
No Replicate, modelos públicos cobram apenas pelo tempo de processamento ativo. A configuração e o tempo ocioso são gratuitos, então uma inicialização a frio custa latência, não dinheiro. Isso torna o Replicate uma boa opção para tráfego irregular, em que um modelo fica sem uso na maior parte do dia.
Comparações de terceiros relatam que o fal.ai pré-aquece modelos populares, com inicializações a frio abaixo de cerca de dois segundos, enquanto o Replicate pode levar de 10 a 60 segundos para modelos menos populares. Esses números vêm de posts de blog escritos pelos próprios fornecedores, então trate-os como uma estimativa e teste o seu próprio modelo antes de construir algo em cima deles.
Uma forma simples de testar: envie uma requisição a cada 10 minutos durante algumas horas e registre o tempo até o primeiro resultado. A primeira requisição após cada pausa é a sua inicialização a frio. Se um usuário espera diante da tela, uma inicialização a frio de 40 segundos incomoda mais do que uma diferença de alguns centavos no preço.

Modelos privados: o tempo ocioso custa dinheiro
Modelos privados e implantações no Replicate rodam em hardware dedicado, então você paga por configuração, tempo ocioso e tempo ativo. Os fine-tunes de inicialização rápida são a exceção e cobram apenas pelo processamento ativo.
Faça a conta antes de implantar. Uma H100 dedicada ligada o mês inteiro custa cerca de US$ 5,49 × 720 horas = US$ 3.953, atenda ela uma requisição ou um milhão. Pelo preço de tabela de US$ 4,50 do fal.ai, o mesmo mês sai por US$ 3.240. Se o seu tráfego é leve, um modelo de pagamento por resultado quase sempre é mais barato do que qualquer GPU sempre ligada.

Conta do ponto de equilíbrio para GPUs dedicadas
A pergunta é quantas imagens por hora uma GPU dedicada precisa produzir para superar o preço por resultado. Divida o preço horário da GPU pelo preço de uma imagem:
| Preço do modelo | GPU a US$ 5,49/h | GPU a US$ 4,50/h |
|---|
| FLUX Dev a US$ 0,025 | 220 imagens por hora | 180 imagens por hora |
| FLUX Schnell a US$ 0,003 | 1.830 imagens por hora | 1.500 imagens por hora |
Abaixo desses volumes, você paga menos comprando resultados. Acima deles, uma GPU dedicada ocupada começa a compensar, mas só se ficar ocupada o tempo todo. Com 180 imagens por hora, você precisa de uma imagem a cada 20 segundos, sem parar, sem pausas à noite ou nos fins de semana. A maioria dos produtos pequenos nunca chega a esse volume, e é por isso que o pagamento por resultado é o padrão mais seguro.
Cenários mensais reais
Criador solo com 2.000 imagens
Você gera 2.000 imagens de um megapixel por mês para trabalhos de clientes.
- FLUX Dev: 2.000 × US$ 0,025 = US$ 50 em qualquer uma das plataformas.
- FLUX Schnell: 2.000 × US$ 0,003 = US$ 6 em qualquer uma das plataformas.
Nesse volume, a plataforma quase não importa. Escolha aquela cuja interface e cujos modelos você mais gosta, e dedique sua atenção aos prompts.
Startup que adiciona vídeo
Seu app produz 3.000 clipes de cinco segundos por mês. Usando apenas as taxas publicadas acima:
Some a sua taxa de refação. Se duas em cada três renderizações forem rejeitadas, triplique cada valor mensal.

Equipe que roda modelos personalizados
Sua equipe usa 300 horas de H100 por mês para inferência personalizada.
- fal.ai no preço de tabela: 300 × US$ 4,50 = US$ 1.350
- Replicate: 300 × US$ 5,49 = US$ 1.647
- fal.ai na menor taxa exibida: 300 × US$ 2,49 = US$ 747
A diferença no preço de tabela é de US$ 297 por mês. A diferença na melhor taxa é de US$ 900 por mês, mas só se a equipe comercial der essa taxa a você. Peça um orçamento antes de planejar em cima dela.
Antes de decidir, evite os três erros que causam a maioria das faturas surpresa:
- Comparar modelos diferentes. Um clipe barato de um modelo e um clipe caro de outro não são o mesmo produto.
- Ignorar as refações. Inclua no orçamento as renderizações que você descarta, não só as que você mantém.
- Deixar um modelo privado ligado. Horas ociosas em hardware dedicado são cobradas da mesma forma que horas de uso.
Escolha o fal.ai quando
- Você aluga GPUs da classe H100 por longos períodos e quer o preço de tabela mais baixo.
- Você roda modelos hospedados de imagem ou vídeo em volume e pode negociar taxas.
- Inicializações rápidas em modelos populares importam mais do que a variedade de modelos.
Escolha o Replicate quando
- Seu tráfego é irregular e os modelos públicos cobram apenas o tempo ativo.
- Você quer uma grande biblioteca da comunidade para testar antes de se comprometer.
- Você precisa de GPUs mais antigas, como A100, L40S ou T4, que o fal.ai não lista na página de preços.
Onde o PicassoIA se encaixa
Se você só precisa testar prompts ou produzir imagens finalizadas, uma fatura de API pode ser a ferramenta errada. O PicassoIA hospeda as mesmas famílias de modelos no navegador, incluindo FLUX Dev, FLUX Schnell, Nano Banana e Seedance 2.0. As páginas dos modelos descrevem o Seedance 2.5 Lite e o PicassoIA Video como geradores de vídeo gratuitos e ilimitados. O Picasso IA também oferece uma API no estilo do Replicate, em que você cria uma predição, consulta o status e busca o resultado, então o código que você escreve para uma plataforma se adapta com pequenas edições. Confira a documentação da API para os limites atuais do plano antes de depender dela.

Como rodar o Flux Dev no PicassoIA
Esta é uma forma rápida de testar um prompt antes de gastar créditos de API em outro lugar.
- Abra a página do modelo FLUX Dev no PicassoIA.
- Escreva seu prompt com um assunto, uma iluminação e uma lente claros, por exemplo "retrato junto a uma janela, luz suave da manhã, lente de 85mm".
- Escolha a proporção que você pretende usar em produção, para que sua estimativa de custo corresponda aos tamanhos reais de saída.
- Gere e compare o resultado com o FLUX Schnell para velocidade e com o FLUX 1.1 Pro para qualidade.
- Guarde as configurações que funcionam e depois precifique exatamente essa configuração no fal.ai ou no Replicate.
💡 Dica: Mantenha os padrões do modelo na sua primeira execução. Mude uma configuração por vez, assim você sabe o que alterou a qualidade.
Crie suas próprias imagens hoje
Tabelas de preços só dizem quanto custa uma renderização. Elas não dizem se a renderização vale a pena ser mantida. A forma mais rápida de descobrir é gerar algumas imagens você mesmo.
Abra o PicassoIA, escolha um modelo como o FLUX Dev ou o Nano Banana e rode o mesmo prompt em dois ou três deles. Depois, leve o vencedor de volta ao fal.ai ou ao Replicate e calcule quanto custarão mil dessas imagens. Comece com um prompt, um modelo e uma avaliação honesta do resultado.
Se um teste rápido no navegador mostrar que um modelo barato como o FLUX Schnell atende ao seu uso, você acaba de reduzir a conta da API em cerca de 88%, de US$ 0,025 para US$ 0,003 por imagem. Se não atender, você descobriu isso antes que a fatura descobrisse. Vá lá e crie sua primeira imagem no PicassoIA hoje, e deixe as tabelas de preços acima abertas em outra aba.