Preços do fal.ai: custos de API, créditos gratuitos e MCP
O fal.ai cobra por saída: centavos por imagem, dólares por hora de GPU e até US$ 0,40 por segundo de vídeo, tudo pago com créditos pré-pagos. Este artigo reúne as tarifas atuais, explica a validade dos créditos e o limite de 2 requisições simultâneas, mostra quanto custa o servidor MCP e compara as contas com um plano de valor fixo.
A maioria das páginas de preços mostra quanto custa uma execução. As perguntas que definem seu orçamento vêm logo depois: quantas execuções cabem em um mês, o que acontece com os créditos gratuitos que você nunca usa e se o servidor MCP cobra uma taxa extra além do modelo. Este artigo reúne os preços publicados do fal.ai, conferidos entre 23 de setembro e 8 de outubro de 2026, e faz as contas para que você possa precificar um projeto real antes de gastar qualquer centavo.
Resumo rápido: o fal.ai é pré-pago e cobra por saída. Imagens vão de US$ 0,003 por megapixel até US$ 0,15 por imagem, vídeo de alguns centavos até US$ 0,40 por segundo, GPUs são alugadas por hora, e o próprio servidor MCP é gratuito. Você paga apenas pelas execuções que ele dispara, com as mesmas tarifas de uma chamada direta à API.
💡 Os preços mudam. Trate cada valor aqui como um retrato do momento. Uma página do modelo, ou a ferramenta get_pricing dentro do servidor MCP, mostra o número atualizado antes que você defina um orçamento.
Como o fal.ai cobra você
Créditos pré-pagos, cobrados por saída
O fal funciona com um modelo de créditos pré-pagos. Os termos dizem que você compra créditos com antecedência, e cada execução, seja pela interface web ou por uma chamada de API, debita o custo do seu saldo. O valor cobrado depende do que o modelo gera:
Saída
Unidade de cobrança
Exemplo da página de preços
Imagens
Por imagem ou por megapixel
US$ 0,0398 por imagem (Nano Banana)
Vídeo
Por segundo, ou por vídeo
US$ 0,14 por segundo (Kling Video v3)
Modelos de linguagem e outros
Por requisição ou por segundo de computação
Varia por modelo
Computação bruta
Por hora de GPU
US$ 2,49 a US$ 4,50 por uma H100
Pense nele como um medidor de consumo de utilidade pública, não como uma assinatura. Se nada roda, nada é cobrado. O próprio fal diz que você só paga pela potência de computação que consome, e a documentação acrescenta que você paga por saídas bem-sucedidas, nunca pelo tempo de espera na fila.
Concorrência e execuções com falha
Duas regras moldam o custo real mais do que a tarifa anunciada.
A concorrência começa em 2. Uma conta nova pode ter 2 requisições em andamento ao mesmo tempo. O limite sobe automaticamente conforme você compra créditos, até 40. Acima disso, é preciso falar com o comercial.
Os erros são, em sua maioria, gratuitos. Erros de servidor (HTTP 500 ou superior) nunca são cobrados. Um erro do cliente (HTTP 422) pode ser cobrado se a GPU já tiver começado o trabalho antes de o problema ser detectado. O tempo de inicialização a frio nas APIs de modelos não é cobrado, então você paga apenas pelo tempo de inferência.
Mais uma regra causa problemas em produção. Quando seu saldo cai abaixo do limite de bloqueio da conta, ela é bloqueada e as requisições da API são recusadas até você adicionar créditos. Se um app atende clientes, programe um lembrete de recarga bem acima dessa linha.
Preços de imagem por execução
Modelos econômicos, precificados por megapixel
Os modelos de imagem mais baratos cobram pela resolução. Uma imagem de 1024 por 1024 tem cerca de 1,05 megapixel (MP), e um quadro de 1920 por 1080 tem cerca de 2,07 MP.
As duas primeiras linhas vêm da página de preços do fal. As duas últimas vêm de uma comparação de preços datada de 23 de setembro de 2026. A US$ 0,003 por MP, 1.000 imagens quadradas custam cerca de US$ 3.
Modelos premium, precificados por imagem
Os modelos de ponta dispensam a conta por megapixel e cobram um valor fixo por imagem. Alguns acrescentam um nível de qualidade por cima.
💡 Só o GPT Image 2 varia cerca de 35 vezes entre a configuração baixa e a alta. Escolha o nível por tarefa: rascunhos na baixa, versões finais na alta.
Preços de vídeo por segundo
Tarifas por segundo comparadas
Vídeo é onde a conta cresce, porque você paga por cada segundo de cada tentativa, inclusive as que descarta. Estas são as tarifas de 720p da comparação de 23 de setembro, com e sem áudio gerado:
A própria página de preços do fal lista o Kling Video v3 a US$ 0,14 por segundo e o Kling v2.5 a US$ 0,07, o que cai na mesma faixa dos níveis Standard e Pro acima. O Seedance 2.0 é cobrado por tokens (US$ 0,014 por 1.000 tokens), então todo valor por segundo dele é uma estimativa que muda com a resolução e a duração.
💡 Áudio não é de graça. Ele dobra a tarifa do Veo 3.1, de US$ 0,20 para US$ 0,40 por segundo, e aumenta o Veo 3.1 Lite em dois terços. Se a trilha vem de outro lugar, renderize sem áudio.
Três orçamentos mensais
Veja o que as tarifas acima significam em cargas de trabalho reais:
100 clipes de 5 segundos no Kling v3. A US$ 0,14 por segundo, cada clipe custa US$ 0,70, então o mês custa US$ 70.
Um clipe de 8 segundos com áudio. No Veo 3.1 são 8 x US$ 0,40 = US$ 3,20. No Veo 3.1 Lite são 8 x US$ 0,05 = US$ 0,40, oito vezes mais barato.
1.000 clipes de 5 segundos com áudio no Veo 3.1 Fast. Cada clipe custa US$ 0,75, então o mês custa US$ 750.
As novas tentativas são o multiplicador escondido. Se um clipe em cada três não puder ser usado, seu custo real por clipe aproveitável fica 50% acima do que a tabela mostra.
Tarifas horárias de GPU
Quando nenhum modelo hospedado serve, o fal aluga GPUs por hora. A página de preços mostra uma faixa para cada placa:
GPU
Memória
Tarifa por hora
RTX PRO 6000
96 GB
US$ 1,99 a US$ 4,00
H100
80 GB
US$ 2,49 a US$ 4,50
H200
141 GB
US$ 2,99 a US$ 6,00
B200
192 GB
US$ 5,49 a US$ 7,99
GB200
192 GB
US$ 5,89 a US$ 9,99
B300
288 GB
US$ 5,99 a US$ 12,99
Um trabalho de 8 horas em uma H100 custa entre US$ 19,92 e US$ 36. Deixe essa mesma placa ligada o tempo todo durante um mês de 730 horas e a conta fica em US$ 1.817,70 na faixa baixa e US$ 3.285 na faixa alta.
Compare com a cobrança por execução. Só pelo preço, uma H100 sempre ligada a US$ 2,49 por hora só supera o FLUX.1 schnell a US$ 0,003 por imagem depois de passar de cerca de 600.000 imagens de 1 megapixel por mês. Abaixo disso, a cobrança por execução vence, e não exige que alguém vigie uma máquina ociosa.
Créditos gratuitos e validade
O que uma conta nova recebe
O fal dá créditos iniciais às contas novas para testes, mas a página de preços e a documentação não publicam nenhum valor. Páginas de terceiros o descrevem como um número limitado de gerações antes de você adicionar um meio de pagamento, e o valor muda com as promoções. Conte com uma oferta pequena.
Para ver até onde um dólar vai pelas tarifas acima:
Cerca de 333 imagens de 1 megapixel no FLUX.1 schnell
💡 Gaste os créditos de teste no modelo que você realmente vai usar, e não no mais barato. Um teste em um modelo econômico não diz nada sobre o custo de um modelo premium.
Quando os créditos expiram
As regras de validade variam por tipo de crédito, e as duas páginas oficiais não concordam sobre os créditos promocionais.
Tipo de crédito
Validade
Reembolsável
Comprado
365 dias a partir da compra
Não, segundo os termos
Gratuito ou promocional
90 dias segundo os termos, de 1 semana a 1 ano segundo as perguntas frequentes
Não se aplica
As perguntas frequentes dizem que créditos gratuitos e cupons têm validade variável, dependendo da concessão específica. Os termos dizem que os créditos promocionais expiram em 90 dias. Confira a data da sua própria concessão no painel de faturamento e não compre um saldo grande que você não consiga gastar dentro de um ano, já que os créditos comprados são apenas para consumo e não reembolsáveis.
Quanto custa o servidor MCP do fal
Conectando
Nada. O fal afirma com clareza: o servidor MCP é gratuito, e você paga apenas pelas execuções de modelo que disparar, pela tarifa padrão do fal. Valem os mesmos limites de concorrência das chamadas diretas à API, e o servidor é sem estado, então não guarda nada entre as requisições.
Há duas formas documentadas de entrar. O endpoint https://mcp.fal.ai/mcp aceita um token bearer no cabeçalho Authorization. O endpoint https://mcp.fal.ai/mcp-relay usa login no navegador, então não é preciso token. Uma configuração típica de cliente fica assim:
Ele funciona com Claude Code, Claude Desktop, Cursor, Windsurf, ChatGPT e Codex CLI. O assistente por trás pode ser um modelo como o Claude Sonnet 5 ou o Gemini 3.5 Flash. O modelo com que você conversa é cobrado à parte das execuções do fal que ele dispara.
Ferramentas que limitam seus gastos
O servidor expõe cerca de nove ferramentas. Quatro delas importam para o controle de custos:
Ferramenta
O que faz pelo seu orçamento
get_pricing
Mostra o preço de um modelo antes de gerar
recommend_model
Sugere um modelo para a tarefa que você descreve
run_model
Executa um modelo e espera até 45 segundos pelo resultado
submit_job e check_job
Colocam trabalhos longos na fila e consultam o status sem bloquear
Um agente pode encadear uma dúzia de execuções a partir de uma frase, e cada uma é cobrada. Dois hábitos mantêm isso seguro. Peça ao assistente para chamar get_pricing primeiro e perguntar antes de qualquer execução acima de um limite que você definir. E mantenha um saldo pré-pago modesto, porque uma conta pré-paga é um teto de gastos rígido: quando o dinheiro acaba, a conta é bloqueada.
Uma alternativa de valor fixo
A cobrança por execução premia o uso leve e pune a experimentação. O modelo oposto é um plano com gerações generosas ou ilimitadas em certos modelos, e é assim que o Picasso IA faz. A página de preços deles lista gerações ilimitadas do PicassoIA Image em todos os planos pagos, PicassoIA Video ilimitado nos planos Elite e Infinite, e uso ilimitado promocional do Seedance 2.5 Lite nesses mesmos dois.
Modelos e limites
O PicassoIA também tem uma API para desenvolvedores e um conector MCP para Claude e ChatGPT. Quatro modelos estão disponíveis pelos dois:
Uma conta pode ter 5 previsões em fila ou em execução ao mesmo tempo, compartilhadas entre seus tokens de API e conexões MCP. O corpo das requisições é limitado a 10 MB, e os prompts a 4.000 caracteres. A referência da API diz que as previsões da API são atualmente gratuitas e não usam créditos, mas também que criar previsões exige um plano Infinite, enquanto a página de preços lista Acesso à API e Conexões MCP no Elite também. Confira a tabela de planos antes de construir sobre isso.
Chamando a API
O fluxo é criar, consultar e buscar. Substitua o token pelo seu próprio valor pia_sk_:
curl -s -X POST https://api.picassoia.com/v1/models/picassoia/picassoia-image/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input": {"prompt": "a lighthouse at sunset, oil painting", "aspect_ratio": "16:9"}}'
A resposta devolve um id que começa com api_, um status de starting e um eta com uma espera recomendada. Depois, consulte GET /v1/predictions/{id} até o status mostrar succeeded, failed ou canceled. Em caso de sucesso, output traz as URLs das imagens. Entradas opcionais incluem num_outputs (1 ou 2), output_format (webp, jpg ou png) e seed para resultados repetíveis.
Teste sem um medidor
A forma mais rápida de comparar é executar o mesmo prompt duas vezes. Pegue o prompt que você ia enviar a uma API medida, cole no PicassoIA Image e veja se o resultado é bom o bastante para dispensar a conta por imagem. Depois, envie o vencedor pelo PicassoIA Image Editor Pro para os ajustes, e anime-o com o Seedance 2.5 Lite se precisar de movimento com som.
Abra o Picasso IA, escolha um modelo e crie suas próprias imagens hoje. Se seu projeto precisar de uma API ou de uma conexão MCP depois, os mesmos modelos estarão esperando por trás dela.