Escolher uma API de IA pelo preço anunciado é assim que os orçamentos acabam estourando. Uma taxa baixa por token significa pouco quando sua carga de trabalho consome dez vezes mais tokens, e um preço barato por segundo de vídeo muda rápido quando você soma 1080p, áudio e algumas novas tentativas. Esta comparação de preços de API de IA coloca lado a lado os preços de tabela reais de modelos de linguagem, geradores de imagem, modelos de vídeo e texto para fala e, em seguida, os transforma em contas mensais que você pode conferir com a sua própria carga de trabalho.
Em resumo: os preços de LLM têm uma faixa de 100x entre a opção mais barata e a mais cara, um mesmo modelo de imagem varia 35x entre as configurações de qualidade mais baixa e mais alta, o vídeo vai de US$ 0,02 a US$ 0,60 por segundo, e a voz vai de meio centavo a dez centavos por 1.000 caracteres. As taxas abaixo foram conferidas em outubro de 2026 com as tabelas de preços dos provedores e rastreadores públicos de preços. Trate cada número como um retrato do momento e confirme na página do próprio provedor antes de comprometer um orçamento.

Como o faturamento de API funciona de fato
Quatro modalidades, quatro medidores diferentes. Confundi-los é a razão mais comum para uma API "barata" ficar cara.
Quatro unidades, quatro surpresas
- LLMs são cobrados por milhão de tokens. Os tokens de saída custam cerca de 5 a 6 vezes mais que os tokens de entrada, então respostas longas aumentam a conta, e não prompts longos.
- Imagens são cobradas por imagem, por megapixel ou por token. As configurações de qualidade e resolução podem multiplicar o preço por 35x no mesmo modelo.
- Vídeo é cobrado por segundo de saída. Faixas de resolução e áudio mudam a taxa, e alguns modelos cobram por token, então qualquer valor por segundo é apenas uma estimativa.
- Voz é cobrada por 1.000 caracteres ou por segundo de áudio gerado. É a categoria mais barata, mas a faixa do modelo ainda faz o custo variar 20x.
Descontos que realmente existem
Quatro mecanismos aparecem em quase todos os provedores:
- Processamento em lote reduz os preços dos tokens em 50% para trabalhos que podem esperar. A Anthropic documenta isso de forma clara, e a OpenAI oferece a mesma redução pela metade.
- Cache de prompts cobra o contexto repetido por cerca de 10% do preço normal de entrada. No Claude Opus 5.5 e no Claude Sonnet 5.5, uma leitura do cache cai para 5%, e no Claude Fable 5.1, para 2,5%.
- Janelas promocionais são reais, mas temporárias. O GPT 5.6 Sol custa US$ 4 de entrada e US$ 20 de saída até pelo menos 21 de novembro de 2026, e o ElevenLabs v4 tem um desconto de 72% que termina em 12 de outubro. Faça o orçamento com o preço regular.
- Residência de dados vai no sentido oposto. Fixar a inferência do Claude nos EUA adiciona um multiplicador de 1,1x em cada categoria de token.

Preços de API de LLM lado a lado
Os modelos de linguagem têm a maior variação de preço entre todas as categorias aqui, e o meio do mercado convergiu discretamente.
A tabela de preços
Os preços são em USD por milhão de tokens, nas taxas padrão sem lote.
| Modelo | Entrada | Saída | Observações |
|---|
| Claude Haiku 5.5 | US$ 0,10 | US$ 0,50 | Prompts de até 100 mil tokens |
| GPT 5.6 Luna | US$ 0,20 | US$ 1,20 | Faixa rápida |
| Gemini 3.5 Flash | US$ 1,50 | US$ 9,00 | Faixa rápida |
| Claude Sonnet 5 | US$ 2,00 | US$ 10,00 | O Sonnet 5.5 custa o mesmo |
| GPT 5.6 Terra | US$ 2,00 | US$ 12,00 | Faixa intermediária |
| Gemini 3.1 Pro | US$ 2,00 | US$ 12,00 | US$ 4 / US$ 18 acima de prompts de 200 mil tokens |
| GPT 5.6 Sol | US$ 4,00 | US$ 20,00 | Taxa promocional até 21/11 |
| Claude Opus 5.5 | US$ 4,00 | US$ 20,00 | Faixa de raciocínio de ponta |
| Claude Fable 5 | US$ 10,00 | US$ 50,00 | O mais caro aqui |
Os valores da Anthropic e do Google vêm das próprias páginas de preços. Os valores da OpenAI vêm de rastreadores públicos, porque a página da OpenAI não estava legível quando verifiquei, então confira-os antes de montar uma previsão.
💡 Compare primeiro os preços de saída. Três modelos da faixa intermediária têm a mesma taxa de entrada de US$ 2, então a diferença real está na saída: US$ 10 para o Sonnet 5, US$ 12 para o Terra e para o Gemini 3.1 Pro. Em cargas de trabalho com muito chat, essa diferença de 20% importa mais que a taxa de entrada.
Quanto custa um bot de suporte
Considere um pequeno assistente de suporte que envia 10 milhões de tokens de entrada e recebe 2 milhões de tokens de saída por mês.
| Modelo | Custo mensal |
|---|
| Claude Haiku 5.5 | US$ 2,00 |
| GPT 5.6 Luna | US$ 4,40 |
| Gemini 3.5 Flash | US$ 33,00 |
| Claude Sonnet 5.5 | US$ 40,00 |
| GPT 5.6 Terra | US$ 44,00 |
| Gemini 3.1 Pro | US$ 44,00 |
| GPT 5.6 Sol | US$ 80,00 |
| Claude Opus 5.5 | US$ 80,00 |
| Claude Fable 5.1 | US$ 200,00 |
As opções mais baratas e mais caras diferem exatamente por 100x com o mesmo tráfego. A maioria das perguntas de suporte não precisa de um modelo de fronteira, então direcione os chamados rotineiros para uma faixa pequena e envie apenas os difíceis para uma faixa superior.
O cache muda o cenário de novo. Se 80% desses tokens de entrada forem instruções repetidas servidas pelo cache, à taxa de leitura de US$ 0,10 por milhão do Sonnet 5.5, o gasto com entrada cai de US$ 20 para cerca de US$ 4,80, e o total de US$ 40 para cerca de US$ 25, antes dos custos pontuais de escrita no cache. O preço em lote se soma a isso, então um trabalho que pode esperar até a noite fica perto de US$ 12.

Custo de gerar cada imagem
As APIs de imagem parecem baratas até você perceber quantas configurações de qualidade ficam por trás de um único nome de modelo.
Tabela de preço por imagem
| Modelo | Preço por imagem | Observações |
|---|
| GPT Image 2 | US$ 0,006 na baixa, US$ 0,053 na média, US$ 0,211 na alta | Preços de tabela em 1024x1024 |
| Nano Banana 2 | US$ 0,0336 em 1K, US$ 0,0504 em 2K, US$ 0,113 em 4K | O Google lista a atualização 2.1 nestas taxas |
| Seedream 5 Pro | Cerca de US$ 0,035 | Estimativa de rastreador |
| FLUX.2 pro | Cerca de US$ 0,03 por megapixel | Estimativa de rastreador |
| Nano Banana 2 Lite | Cerca de US$ 0,01 | Estimativa de rastreador |
A armadilha da faixa de qualidade
Gere 1.000 imagens por mês e o mesmo modelo da OpenAI custa US$ 6 na qualidade baixa, US$ 53 na média e US$ 211 na alta. O Nano Banana 2 em 2K fica perto de US$ 50, o Seedream 5 Pro perto de US$ 35, e o Nano Banana 2 Lite perto de US$ 10. A configuração que você deixa no padrão decide a conta mais do que o modelo que você escolhe.
Os revendedores acrescentam mais uma camada. Um gateway listou o GPT Image 2 com exatamente o dobro da taxa da OpenAI em todas as faixas, o que transforma um trabalho de US$ 211 em um trabalho de US$ 422 sem nenhuma mudança no resultado.
💡 Rascunhe em qualidade baixa e finalize em qualidade alta. Gere os conceitos na faixa mais barata, escolha os melhores e refaça a renderização apenas deles na qualidade máxima. Uma taxa de 10% de finalistas em alta qualidade ainda custa muito menos do que renderizar tudo em alta.

Preços de API de vídeo por segundo
O vídeo é onde um palpite errado custa dinheiro de verdade, porque cada segundo é cobrado e cada nova tentativa repete o preço integral.
Tabela de preços com áudio
| Modelo | Preço por segundo | Observações |
|---|
| P Video | US$ 0,02 em 720p, US$ 0,04 em 1080p | Áudio incluído |
| Veo 3.1 Lite | US$ 0,05 em 720p, US$ 0,08 em 1080p | Áudio incluído |
| Grok Imagine Video 1.5 | US$ 0,08 | Até 1080p |
| Veo 3.1 Fast | US$ 0,10 em 720p, US$ 0,12 em 1080p, US$ 0,30 em 4K | Áudio incluído |
| Kling v3 Video | Cerca de US$ 0,11 | Faixa Turbo oficial, 720p |
| HappyHorse 1.1 | Cerca de US$ 0,125 em 720p, US$ 0,22 em 1080p | Áudio e vídeo gerados juntos |
| LTX 2.3 Fast | US$ 0,06 a US$ 0,24 | De 1080p até 4K |
| Veo 3.1 | US$ 0,40 em 720p e 1080p, US$ 0,60 em 4K | Faixa de qualidade de ponta |
As taxas do Veo, do Grok e do P Video são publicadas pelos próprios criadores. Os valores do Kling e do HappyHorse são convertidos a partir do yuan, então há arredondamento de câmbio.
Quanto custam 100 clipes
Considere 100 clipes de 8 segundos em 720p, ou 800 segundos de material.
- P Video: US$ 16
- Veo 3.1 Lite: US$ 40
- Grok Imagine Video 1.5: US$ 64
- Veo 3.1 Fast: US$ 80
- Kling 3.0 Turbo: US$ 88
- HappyHorse: US$ 100
- Veo 3.1: US$ 320
Esses totais supõem que cada clipe seja utilizável. Com uma taxa de aproveitamento de 30%, você precisa de cerca de 333 gerações para terminar com 100 clipes bons, então a linha do Veo 3.1 Fast sobe de US$ 80 para cerca de US$ 267.
Três armadilhas se escondem por trás desses números. O Seedance 2.0 e a sua versão Fast cobram por token, então os preços por segundo são estimativas, e os revendedores cotam entre cerca de US$ 0,09 e US$ 0,25. Passar para 4K multiplica o custo por 1,5x a 3x. E os revendedores costumam cobrar de 2x a 3x acima das taxas oficiais.
💡 Verifique a disponibilidade antes de orçar. A API Sora 2 da OpenAI estava programada para ser desligada em 24 de setembro de 2026. O Sora 2 ainda aparece nos catálogos de modelos, então confirme onde ele roda antes de construir um pipeline sobre ele.

Preços de voz e fala
A fala é a modalidade mais barata, então qualidade e suporte a idiomas geralmente pesam mais que o preço.
Comparação por 1.000 caracteres
| Modelo | Preço | Observações |
|---|
| Inworld TTS (linha anterior) | US$ 0,005 padrão, US$ 0,01 Max | Por milhão: US$ 5 e US$ 10 |
| Gemini Flash TTS | Cerca de US$ 0,00225 por 10 segundos | A faixa Flash mais nova do Google, cobrada por tokens de áudio |
| ElevenLabs Flash and Turbo | US$ 0,04 | Faixa de baixa latência |
| MiniMax Speech 2.8 Turbo | US$ 0,06 | Por milhão: US$ 60 |
| ElevenLabs v3 | US$ 0,08 | Faixa expressiva |
| ElevenLabs v2 Multilingual | US$ 0,08 | Mais de 30 idiomas |
| MiniMax Speech 2.8 HD | US$ 0,10 | Por milhão: US$ 100 |
Uma narração de dez minutos tem cerca de 9.000 caracteres. Isso custa cerca de US$ 0,09 na faixa Max da Inworld, US$ 0,14 no Gemini Flash TTS, US$ 0,36 no ElevenLabs Flash, US$ 0,54 no MiniMax Turbo, US$ 0,72 no ElevenLabs v3 e US$ 0,90 no MiniMax HD. Cem dessas narrações na opção mais cara somam US$ 90. A cobrança por tokens de áudio e a cobrança por caractere não se convertem perfeitamente, então teste com a extensão do seu próprio roteiro.
O ElevenLabs v4 é listado a US$ 0,08 por 1.000 caracteres, e o v4 Turbo a US$ 0,04, com um desconto de lançamento de 72% que termina em 12 de outubro. Os valores da Inworld vêm da linha anterior de TTS-1, então verifique os modelos 1.5 antes de depender deles.

Custos ocultos que estouram o orçamento
Os preços de tabela são o piso, não a previsão.
Novas tentativas, limites e saídas longas
- Saídas rejeitadas. Se 20% das gerações forem descartadas, seu preço efetivo sobe 25%, porque você paga por cinco execuções para manter quatro.
- Tamanho da saída. Os tokens de saída custam de 5 a 6 vezes mais que os de entrada, e os tokens de raciocínio contam como saída. Um modelo de "pensamento" pode inflar a conta sem uma resposta visível mais longa.
- Limites de concorrência. A API da PicassoIA permite 5 predições em andamento ao mesmo tempo por conta, e muitos provedores aumentam os limites conforme o nível de gasto. Esperar na fila custa tempo de engenharia.
- Markups de revendedores. Gateways podem cobrar de 2x a 3x as taxas oficiais em troca de uma única fatura e uma única integração.

Onde está a economia
- Roteie por dificuldade. Envie pedidos fáceis para a faixa mais barata e escale apenas em caso de falha.
- Coloque em lote tudo o que puder esperar. Metade do preço nos tokens é o maior desconto único disponível.
- Coloque em cache o contexto estático. Prompts de sistema, guias de estilo da marca e documentos de referência são ideais.
- Reduza a resolução ao iterar. Vídeo em 720p e imagens de baixa qualidade bastam para rascunhos.
- Limite o tamanho da saída. Um limite máximo de tokens evita gerações descontroladas.
Esses ganhos se acumulam. Uma equipe que direciona a maioria dos chamados para um modelo pequeno, faz cache de suas instruções e coloca em lote seus relatórios noturnos pode pagar uma fração do preço de tabela pelo mesmo resultado, enquanto uma equipe que deixa todos os padrões ligados paga a taxa integral em tudo.

Teste preços na PicassoIA
Ler uma tabela de preços diz quanto um modelo custa. Executá-lo diz se o resultado vale esse custo. A PicassoIA hospeda mais de 120 modelos de vídeo, 75 modelos de linguagem e 24 modelos de fala, além de um amplo catálogo de imagens, então você pode comparar as faixas lado a lado antes de escolher uma para produção.
Execute o mesmo prompt duas vezes
- Escolha dois modelos da mesma categoria, como o Seedream 5 Pro e o FLUX.2 pro.
- Abra a página de cada modelo e cole um prompt idêntico da sua carga de trabalho real.
- Iguale as configurações: proporção, resolução e qualidade.
- Compare os resultados em tamanho completo e anote qual deles você publicaria de fato.
- Divida o preço por unidade do provedor pela sua taxa de aproveitamento. O modelo que vence em custo por peça aproveitada é a sua escolha real.
Automatize com a API
A PicassoIA também disponibiliza uma API para desenvolvedores em https://api.picassoia.com/v1, autenticada com um token Bearer que começa com pia_sk_. Os trabalhos são assíncronos: você cria uma predição, consulta seu status e busca o resultado.
| Endpoint | Finalidade |
|---|
POST /v1/models/{owner}/{name}/predictions | Criar uma predição |
GET /v1/predictions/{id} | Verificar status e buscar a saída |
POST /v1/predictions/{id}/cancel | Cancelar um trabalho em execução |
GET /v1/predictions | Listar predições recentes |
Quatro modelos estão disponíveis pela API: PicassoIA Image, PicassoIA Image Editor Pro, PicassoIA Video e Seedance 2.5 Lite. A documentação afirma atualmente que as predições da API são gratuitas e não usam créditos, e que é necessário o plano Infinite. Confirme os dois pontos na página da API antes de planejar com base neles, já que os termos dos planos podem mudar.
Faça seu próprio teste de preço
A melhor API de IA é a que entrega resultados publicáveis a um preço que o seu volume suporta, e só os seus próprios prompts podem dizer qual é essa. Escolha uma tarefa real de cada categoria, rode-a em uma faixa barata e em uma faixa premium e anote o custo por peça aproveitada. Cinco minutos de teste valem mais que uma tarde lendo tabelas de preços.
A Picasso IA reúne esses modelos em um só lugar, para que você gere imagens, vídeo, voz e texto sem abrir uma conta separada para cada provedor. Comece com um prompt do seu próprio projeto, teste o GPT Image 2 ao lado do PicassoIA Image e veja qual resultado você realmente entregaria. Quando estiver pronto para comparar mais, navegue por todas as opções na página de todos os modelos.
