RunPod vs Vast.ai vs Modal: as GPUs mais baratas para geração com IA

RunPod, Vast.ai e Modal cobram pelas GPUs de três formas diferentes, e a menor taxa por hora nem sempre dá a imagem mais barata. Este artigo converte as taxas publicadas em custo por 1.000 imagens e por clipe de vídeo, e mostra onde o tempo ocioso, o armazenamento e as horas de configuração mudam o vencedor.

RunPod vs Vast.ai vs Modal: as GPUs mais baratas para geração com IA
Cristian Da Conceicao
Fundador do Picasso IA

Alugar uma GPU para gerar imagens e vídeos com IA parece simples até a fatura chegar. Uma plataforma anuncia US$ 0,34 por hora, outra cobra por segundo, e uma terceira aluga máquinas ociosas que podem desaparecer no meio de uma renderização. O preço de etiqueta diz quase nada sobre quanto custa de fato uma imagem pronta ou um clipe de cinco segundos.

Esta comparação coloca RunPod, Vast.ai e Modal lado a lado, converte as taxas deles em custo por 1.000 imagens e custo por clipe de vídeo, e mostra onde cada um consome dinheiro sem fazer barulho. Todos os números abaixo são calculados a partir de taxas publicadas, com as premissas escritas ao lado para você refazer a conta com os seus próprios números.

💡 Veredito rápido: o Vast.ai é o mais barato por hora de GPU, o RunPod é o melhor equilíbrio no geral, e o Modal é a opção mais tranquila quando seu tráfego é irregular e você não se importa em escrever Python.

A resposta curta

O ranking depende de uma pergunta: sua GPU fica ocupada ou fica esperando? Uma GPU ocupada favorece aluguéis por hora mais baratos. Uma GPU quase sempre ociosa favorece a cobrança por segundo do Serverless. Todos os números deste artigo nascem dessa tensão, e isso explica por que a plataforma "mais barata" muda conforme quem pergunta.

Vista em ângulo baixo de um longo corredor de racks de servidores em um data center

Preço por hora de relance

Aqui estão as taxas principais das GPUs que as pessoas realmente usam para modelos de difusão e de vídeo. Os valores do RunPod e do Modal vêm das listas de preços públicas do início de outubro. O Vast.ai é um marketplace em que cada host define o preço, então a coluna dele mostra uma faixa típica, e não uma taxa fixa.

GPURunPod CommunityRunPod SecureModalVast.ai (típico)
RTX 4090 24GBUS$ 0,34US$ 0,74Não oferecidaUS$ 0,25 a US$ 0,80
L40S 48GBUS$ 0,79US$ 1,09US$ 1,95Varia por host
A100 80GBUS$ 1,19 a US$ 1,39US$ 1,59US$ 2,50US$ 1,10 a US$ 2,00
H100 80GBUS$ 1,99 a US$ 2,69US$ 2,89 a US$ 3,49US$ 3,95Cerca de US$ 1,50 a US$ 3,00

As instâncias interrompíveis do Vast.ai ficam ainda mais baratas. O próprio Vast.ai anuncia preços 50% ou mais abaixo do sob demanda, e já foram relatadas ofertas spot de RTX 4090 perto de US$ 0,15 por hora.

💡 Trate estes valores como um ranking, não como uma cotação. Os preços de GPU mudam toda semana. Confira o painel ao vivo antes de comprometer um orçamento.

Quem vence em cada tarefa

  • Geração de imagens em lote: Vast.ai ou RunPod Community. A taxa por hora é baixa e a GPU fica ocupada.
  • Geração de vídeo: RunPod H100 ou Vast.ai. Tarefas longas se beneficiam de muita memória e de uma taxa por hora baixa.
  • Tráfego de API em picos: Modal ou RunPod Serverless. Você paga só enquanto uma requisição está rodando.
  • Produção com promessas de disponibilidade: RunPod Secure Cloud ou Modal. Menos surpresas do que em um marketplace.
  • Primeiros experimentos: Modal, porque o crédito gratuito mensal cobre milhares de imagens.

Como cada plataforma cobra você

Três plataformas, três modelos mentais. Escolha a errada e você paga por horas em que sua GPU não faz nada.

RunPod: Pods e Serverless

O RunPod vende dois produtos. Pods são máquinas alugadas cobradas por segundo a uma taxa por hora. O Community Cloud é o nível mais barato, e o Secure Cloud roda em data centers avaliados, com promessas de confiabilidade mais fortes. Serverless executa seu contêiner sob demanda, com workers flexíveis que escalam até zero.

O serverless custa bem mais por hora do que a mesma placa como pod. Uma RTX 4090 custa US$ 1,10 por hora no serverless contra US$ 0,34 como pod Community. Essa diferença é o preço de não gerenciar nada, e ela dá uma regra clara: um pod só compensa se ficar ocupado mais de cerca de 31% do tempo (US$ 0,34 dividido por US$ 1,10).

Vast.ai: um marketplace de GPUs ao vivo

O Vast.ai não é dono do hardware. Hosts listam máquinas, definem os próprios preços, e você aluga o que corresponder aos seus filtros. A cobrança é por segundo, sem mínimo, e existem três tipos: sob demanda (garantido, sem interrupções), interrompível (50% ou mais barato, pode ser recuperado) e reservado (contratos de 1, 3 ou 6 meses, com até 50% de desconto).

Rig de várias GPUs em armação aberta montado em uma garagem residencial

A vantagem são os menores preços entre os três. A contrapartida é a variação. Um host numa garagem e um host num data center profissional aparecem nos mesmos resultados de busca, e os preços de banda e armazenamento são definidos por host, então leia o anúncio antes de alugar. Para lotes de imagens que salvam cada resultado conforme avançam, uma interrupção custa quase nada. Para uma renderização de vídeo de dez minutos, perder a instância no minuto nove dói.

Modal: código primeiro, cobrança por segundo

O Modal não entrega uma máquina. Você escreve funções em Python, marca cada uma com um tipo de GPU, e o Modal as executa em contêineres que iniciam sob demanda. A cobrança é por segundo: uma L40S custa US$ 0,000542 por segundo (US$ 1,95 por hora), uma H100 custa US$ 0,001097 (US$ 3,95 por hora), e o plano Starter inclui US$ 30 de crédito gratuito por mês.

Cronômetro analógico apoiado ao lado de uma placa de vídeo

A cobrança com escala até zero significa que você nunca paga por ociosidade. Também significa que você nunca vê as taxas horárias baratas, porque o equivalente por hora do Modal é o mais alto dos três. Você paga um prêmio pela conveniência, e esse prêmio só faz sentido quando sua GPU ficaria ociosa a maior parte do dia.

Custo real por imagem

Preços por hora são abstratos. O que importa é o custo de uma imagem pronta.

A matemática por trás dos números

Mesa com uma planilha impressa, uma calculadora e uma caneta vermelha

A fórmula é simples: custo por imagem = (taxa por hora ÷ 3.600) × segundos por imagem. Os segundos são a parte que varia. As premissas de trabalho aqui são uma imagem de 1024 por 1024 do FLUX Dev com 28 passos: cerca de 12 segundos em uma RTX 4090, 9 segundos em uma L40S, 4 segundos em uma H100 e 4,5 segundos na H100 PCIe, mais lenta. Seus tempos vão variar conforme a quantização, a resolução e o conjunto de software, então trate a tabela abaixo como um modelo que você pode refazer.

Ela também supõe que a GPU já está carregada e ocupada. Tempo ocioso e carregamento do modelo têm sua própria seção mais adiante.

Como combinar VRAM com o seu modelo

Velocidade é só metade da história, porque uma placa que não cabe o modelo não consegue rodá-lo de forma alguma. Em termos gerais, uma placa de 24GB como a RTX 4090 lida bem com modelos de imagem da classe SDXL e FLUX, especialmente com pesos de 8 bits. Uma placa de 48GB como a L40S permite manter o modelo de imagem, um ControlNet e um upscaler carregados juntos, sem trocar nada. Uma A100 ou H100 de 80GB é o que os grandes modelos de vídeo pedem, já que eles mantêm sequências longas de quadros na memória ao mesmo tempo.

A memória afeta o preço de duas formas. Comprar mais VRAM do que você precisa queima dinheiro: rodar um modelo que precisa de 20GB em uma H100 paga por 60GB que ficam vazios. Comprar pouca consome tempo, porque o software passa os pesos para a RAM do sistema e cada passo fica mais lento. Um bom hábito é alugar a menor placa que cabe o modelo com alguns gigabytes de folga, testar dez imagens e só então escalar.

💡 Teste rápido: gere dez imagens em uma placa barata primeiro. Se o tempo por imagem ficar dentro de 30% do que você supôs, a tabela de custos abaixo vai valer.

Custo por 1.000 imagens

ConfiguraçãoTaxa por horaSegundos por imagemCusto por 1.000 imagens
Vast.ai 4090, interrompívelcerca de US$ 0,1512US$ 0,50
RunPod 4090, pod CommunityUS$ 0,3412US$ 1,13
Vast.ai 4090, sob demandacerca de US$ 0,4012US$ 1,33
RunPod H100 PCIe, pod CommunityUS$ 1,994,5US$ 2,49
RunPod 4090, ServerlessUS$ 1,1012US$ 3,67
Modal H100US$ 3,954US$ 4,39
Modal L40SUS$ 1,959US$ 4,88

Com uma GPU perfeitamente ocupada, um Vast.ai 4090 interrompível é quase 10 vezes mais barato que uma Modal L40S. Essa é a manchete, e ela também engana. A utilização vira a tabela. Uma 4090 Community que trabalha só 10% do dia custa, na prática, US$ 11,33 por 1.000 imagens, mais que o dobro dos US$ 4,88 do Modal, porque você paga também pelos outros 90%.

O crédito gratuito do Modal torna o lado pequeno fácil: US$ 30 compram cerca de 15 horas de L40S, o que dá aproximadamente 6.000 imagens de 9 segundos cada, todo mês, sem custo.

Custo real por clipe de vídeo

Por que o vídeo muda a conta

Modelos de vídeo são mais pesados. Um clipe de cinco segundos em 720p de um modelo como o Wan 2.7 texto para vídeo leva minutos em vez de segundos e precisa de mais VRAM, o que empurra você de placas de 24GB para placas de 48GB ou 80GB. As premissas aqui são 6 minutos por clipe em uma placa da classe 4090 ou L40S com pesos quantizados, e 3 minutos em uma H100.

Editor de vídeo revisando um clipe cinematográfico pausado em um monitor grande

Renderizações longas mudam a equação. Um carregamento de modelo de 40 segundos quase não importa quando a tarefa leva 6 minutos, então o início a frio deixa de ser o inimigo. Quem vira inimigo são as interrupções, porque uma instância perdida desperdiça minutos de trabalho em vez de segundos. Isso desloca o equilíbrio para pods confiáveis e para longe das listagens interrompíveis mais baratas.

Tabela de custo por clipe

ConfiguraçãoMinutos por clipeCusto por clipeCusto por 100 clipes
RunPod 4090, pod Community6US$ 0,03US$ 3,40
Vast.ai 4090, sob demanda6US$ 0,04US$ 4,00
RunPod H100 PCIe, pod Community3US$ 0,10US$ 9,95
RunPod 4090, Serverless6US$ 0,11US$ 11,00
Modal L40S6US$ 0,20US$ 19,51
Modal H1003US$ 0,20US$ 19,75

Até a linha mais cara fica em cerca de vinte centavos por clipe. Para vídeo, a decisão não é sobre centavos por clipe. É sobre saber se as horas de configuração, o acompanhamento constante e as renderizações que falham custam mais do que a diferença entre as linhas.

Custos ocultos que consomem seu orçamento

Tempo ocioso e inícios a frio

A forma mais comum de uma GPU barata virar uma GPU cara é esquecer de desligá-la. Uma 4090 Community deixada ligada o mês inteiro custa cerca de US$ 248 (US$ 0,34 vezes 730 horas). Um pod de H100 PCIe ligado custa aproximadamente US$ 1.453. Nenhum dos dois gerou uma única imagem enquanto você dormia.

Close de ventoinhas de resfriamento de servidor e aletas de dissipador

O serverless tem o problema oposto. Um contêiner novo precisa carregar vários gigabytes de pesos na VRAM antes que a primeira requisição rode. Modelos de imagem carregam em segundos a dezenas de segundos, e modelos de vídeo grandes levam mais. O tempo gasto carregando pesos dentro da sua função é cobrado como qualquer outro tempo de computação, então mantenha os contêineres aquecidos nas horas de pico e armazene os pesos em um volume, em vez de baixá-los a cada início.

Armazenamento, saída de dados e horas de configuração

💡 Regra prática: uma hora do seu próprio tempo custa mais do que uma hora de qualquer GPU desta lista.

Os pesos dos modelos se acumulam rápido. Um modelo de imagem, um modelo de vídeo e uma meia dúzia de LoRAs chegam facilmente a 100 GB. O armazenamento de rede do RunPod custa de US$ 0,05 a US$ 0,14 por GB por mês, então 100 GB custam de US$ 5 a US$ 14 por mês, cobrados esteja ou não um pod rodando. Os hosts do Vast.ai definem as próprias taxas de armazenamento e banda, então compare-as por listagem.

Depois vêm as horas de configuração. Instalar o ComfyUI, combinar versões de CUDA e depurar um host do marketplace com disco lento pode consumir uma tarde inteira. A US$ 50 por hora, duas horas de solução de problemas custam US$ 100, que é o preço de computação de cerca de 88.000 imagens em uma 4090 Community. Taxas por hora baratas só compensam se a máquina funcionar na primeira vez.

Qual plataforma serve para cada carga de trabalho

Criadores solo e hobbistas

Placa de vídeo deitada sobre uma bancada de carvalho

Se você gera algumas centenas de imagens por semana, comece com o crédito gratuito do Modal e escreva um script. Se preferir um fluxo de trabalho visual como o ComfyUI, alugue uma 4090 Community do RunPod para uma sessão à noite e desligue quando terminar. O Vast.ai recompensa paciência e familiaridade com o console: ordene por preço, confira a nota de confiabilidade do host e use as taxas interrompíveis para lotes que salvam enquanto rodam.

Equipes e APIs de produção

Mãos com luvas segurando uma placa aceleradora de GPU para servidor

Um produto que atende milhares de requisições com tráfego irregular se encaixa no Modal ou no RunPod Serverless, em que você paga por segundo de trabalho real. Uma carga constante e previsível se encaixa nos pods Secure do RunPod ou nos termos reservados do Vast.ai, em que a taxa por hora é a menor por hora de uso efetivo. Para vídeo em volume, uma H100 costuma ganhar em vazão por dólar, mesmo quando a taxa por hora parece pesada.

Se o seu pipeline também chama um modelo de linguagem para escrever prompts, as mesmas plataformas podem servi-lo, mas um modelo de tamanho completo como o DeepSeek R1 precisa de um nó com várias GPUs e pode dobrar a conta de hardware. Modelos pequenos cabem em uma única placa de 24GB.

Quando alugar uma GPU não faz sentido

Alugar compensa quando você precisa de algo sob medida: treinamento de LoRA privado, um grafo de ComfyUI incomum ou um modelo que ninguém hospeda. Para todo o resto, a conta por hora, o risco de ociosidade e o tempo de configuração muitas vezes tornam um serviço hospedado mais barato na prática.

Três freelancers comparando números em uma mesa em um loft iluminado

O PicassoIA roda as próprias GPUs, com 91 modelos de texto para imagem e 87 modelos de texto para vídeo disponíveis, e a geração nos modelos próprios é gratuita nos planos Infinite e Wonder. Não há cronômetro rodando enquanto você pensa em um prompt, nenhum pod para esquecer ligado e nenhum erro de CUDA à meia-noite.

Como usar o Flux no PicassoIA

  1. Abra a página do modelo. Comece com o FLUX Dev para qualidade equilibrada, ou com o FLUX Schnell quando quiser rascunhos rápidos.
  2. Escreva um prompt específico. Diga o assunto, a direção da luz e a lente, por exemplo "85mm f/1.8, luz suave de janela pela esquerda".
  3. Escolha a proporção. Use 16:9 para cabeçalhos de blog e 1:1 para posts em redes sociais.
  4. Defina os passos e a orientação, se aparecerem. Cerca de 28 passos e um valor de orientação perto de 3,5 são um ponto de partida sensato para o FLUX Dev.
  5. Gere e compare. Rode o mesmo prompt no FLUX.2 Pro quando precisar de um acabamento extra.
  6. Aprimore o melhor resultado. Envie-o pelo Clarity Pro Upscaler para uma versão limpa em alta resolução.
  7. Anime-a. Transforme o melhor quadro em um clipe curto com o Wan 2.7 imagem para vídeo ou o LTX 2 Fast.

💡 Dica: mantenha um único modelo de prompt para todas as imagens de uma série. Uma redação coerente de iluminação e lente gera um conjunto uniforme, sem nenhuma configuração de GPU.

Experimente você mesmo no Picasso IA

Agora você tem os números: Vast.ai para a menor taxa por hora, RunPod para equilíbrio, Modal para rajadas cobradas por segundo. Se preferir pular pods, contêineres e faturas, abra o Picasso IA e rode seu próximo lote por lá. Gere algumas imagens com o FLUX Dev, teste um clipe cinematográfico com o Seedance 2.0 e compare os resultados com o que você estava prestes a alugar uma GPU para fazer.

Experimente um prompt em três modelos diferentes, escolha o visual de que gostar e guarde o custo de um pod ocioso para algo mais divertido. Sua primeira imagem está a poucos cliques de distância.

Compartilhe este artigo

Escolha seu idioma