Como o DeepSeek V4 Pro mudou os preços da IA para sempre

O DeepSeek V4 Pro chegou e, de imediato, reduziu o custo de inferência de IA em mais de 95%, desencadeando uma onda de reprecificação que obrigou todos os grandes provedores a reagir. OpenAI, Anthropic e Google reduziram seus preços. Este texto detalha o que aconteceu, por que a arquitetura tornou isso possível e o que essa mudança significa para desenvolvedores e empresas que pagam por IA hoje.

Como o DeepSeek V4 Pro mudou os preços da IA para sempre
Cristian Da Conceicao
Fundador do Picasso IA

No momento em que o DeepSeek V4 Pro entrou no ar, as planilhas no Vale do Silício deixaram de fazer sentido. Desenvolvedores que revisavam suas faturas mensais de API notaram algo impossível: o custo de rodar um modelo de IA de nível de fronteira tinha caído mais de 95% em relação ao que pagavam apenas alguns meses antes. Sem anúncio, sem coletiva de imprensa. Apenas uma nova página de preços, uma versão no GitHub e uma onda de descrença que se espalhou pelo setor de tecnologia em questão de horas.

Não foi um desconto pequeno. Foi um colapso estrutural no custo da inteligência.

Os números que quebraram o mercado

Quanto o DeepSeek V4 Pro realmente custa

Antes do DeepSeek V4 Pro, um desenvolvedor que criava um produto para processar um milhão de tokens de entrada em um modelo de ponta pagava entre US$ 15 e US$ 30, dependendo do provedor. Os tokens de saída custavam ainda mais. Para qualquer aplicação em grande escala, isso se acumulava rápido.

O DeepSeek V4 Pro mudou essa conta por completo. No lançamento, seu preço de API ficou em cerca de US$ 0,27 por milhão de tokens de entrada e US$ 1,10 por milhão de tokens de saída. Não eram valores de um modelo barato. Era um modelo que igualava ou superava o desempenho da classe GPT-4 em quase todos os benchmarks padrão: MMLU, HumanEval, MATH e tarefas de raciocínio que antes exigiam os modelos mais caros disponíveis.

Rack de servidores GPU moderno em data center profissional com cabos de fibra óptica e hardware

A relação entre preço e desempenho era tão extrema que muitos desenvolvedores, a princípio, presumiram que havia uma pegadinha. Um limite de requisições que seria ativado. Uma queda de qualidade que apareceria em produção. Um custo oculto guardado nas letras miúdas. Nada disso se confirmou. O modelo era genuinamente barato e genuinamente capaz.

💡 Para contextualizar: US$ 0,27 por milhão de tokens significa que você pode processar cerca de 750.000 palavras por menos de um dólar. É o texto inteiro de Guerra e Paz duas vezes, por uma única nota de um dólar.

Lado a lado com GPT-5 e Claude

O estrago competitivo ficou mais claro quando apresentado em uma tabela:

ModeloEntrada (por 1M de tokens)Saída (por 1M de tokens)Nível de desempenho
DeepSeek V4 Pro~US$ 0,27~US$ 1,10Fronteira
GPT-5~US$ 10,00~US$ 30,00Fronteira
Claude Opus 4.7~US$ 15,00~US$ 75,00Fronteira
Gemini 3 Pro~US$ 7,00~US$ 21,00Fronteira

A diferença não era incremental. Era de outra geração. O DeepSeek V4 Pro entregou raciocínio de nível de fronteira a preços que antes só se aplicavam a modelos pequenos, rápidos e limitados. Cada número daquela tabela representava um modelo de negócio, uma linha de receita, uma estratégia de preço construída com cuidado ao longo de anos. Tudo isso precisou ser refeito do zero.

Mesa de desenvolvedor com monitor exibindo dados comparativos de preços e teclado mecânico

Por que a arquitetura torna tudo barato

Mixture of Experts, sem mágica

A eficiência de custo da DeepSeek não é um milagre. É o resultado de uma escolha arquitetural específica: o Mixture of Experts (MoE). Em vez de ativar todos os parâmetros do modelo a cada chamada de inferência, os modelos MoE ativam apenas uma pequena fração do total de parâmetros para cada token. No caso do DeepSeek V4 Pro, apenas cerca de 37 bilhões de parâmetros são acionados em cada passagem direta, apesar de o modelo ter centenas de bilhões no total.

Isso pesa muito no custo de inferência. O cálculo necessário por token é bem menor do que em um modelo denso de capacidade equivalente. Na prática, você obtém o conhecimento armazenado em um modelo enorme, mas paga apenas por uma fração do processamento em tempo de execução.

💡 Pense em um hospital com 500 especialistas. Cada consulta não exige que todos os 500 estejam na sala. O especialista certo é acionado quando necessário. Os demais continuam disponíveis, mas ociosos.

OpenAI e Anthropic têm suas próprias versões dessa arquitetura, mas a DeepSeek levou a eficiência de custo além do que qualquer outra empresa tinha demonstrado publicamente nessa escala e nesse nível de qualidade.

Treinamento com um orçamento menor

A outra metade da história é o custo de treinamento. A DeepSeek publicou números sugerindo que o V4 Pro foi treinado com uma fração do orçamento de processamento de modelos de fronteira comparáveis, usando abordagens de destilação e otimizações no pipeline de dados que extraíram o máximo de sinal de cada token de treinamento.

Equipe em escritório de startup moderno analisando preços de IA em mesa compartilhada em pé

Isso importa porque quebra uma suposição antiga do setor: a de que a IA de fronteira exige capital de fronteira. O argumento da OpenAI, do Google e da Anthropic sempre foi que a qualidade cresce com o processamento e que o processamento custa bilhões. As execuções de treinamento publicadas pela DeepSeek sugeriram que é possível chegar a uma capacidade quase de fronteira por dezenas de milhões, e não bilhões, se a arquitetura e o pipeline de dados forem bem ajustados.

Se essa suposição estiver errada, o impacto não se limita aos preços. Afeta as vantagens competitivas, a estratégia de concorrência e a defensibilidade de longo prazo de todo modelo de negócio fechado em IA.

O efeito cascata nas grandes empresas de tecnologia

A resposta da OpenAI

A OpenAI se moveu mais rápido em preços do que jamais tinha se movido antes. Poucas semanas após o lançamento do DeepSeek V4 Pro, o preço do GPT-5 caiu de forma significativa, e a empresa lançou novos planos voltados a desenvolvedores que antes ficavam de fora por causa do custo. A lógica era direta: se não reagisse, todo desenvolvedor sensível a custo migraria.

Campus de tecnologia moderno visto do alto na hora dourada, com prédios de vidro e jardins

Os cortes foram reais, mas não fecharam a diferença por completo. A OpenAI apoiou-se nas vantagens do seu ecossistema: integração profunda com o Microsoft Azure, confiabilidade em chamadas de função, reconhecimento de marca entre compradores corporativos e amplitude de ferramentas. São vantagens genuínas. Mas já não bastavam para justificar um prêmio de preço de 40 vezes sobre a inferência bruta.

Anthropic e Google seguem o movimento

O Claude Opus 4.7 e o Gemini 3 Pro tiveram reduções de preço nos meses seguintes ao lançamento do DeepSeek V4 Pro. A Anthropic cortou agressivamente os preços do Haiku, tornando o Claude 4.5 Haiku um dos modelos capazes mais baratos disponíveis. O Google reduziu o preço do Gemini 2.5 Flash quase a zero para aplicações abaixo de certos limites de uso.

💡 Resumindo: o que começou como um evento de preços da DeepSeek virou uma reconfiguração de todo o setor. Em menos de seis meses, o custo médio de rodar um modelo de IA de fronteira caiu cerca de 80% entre todos os provedores. Essa mudança não tem precedente histórico na indústria de software.

Close macro de uma etiqueta de preço que representa o colapso dramático do custo da IA

Os beneficiados não foram as empresas que fizeram os cortes. Foram os desenvolvedores e as empresas que tinham sido excluídos do mercado.

O que os desenvolvedores ganharam da noite para o dia

APIs que estavam fora de alcance

Veja o que US$ 1.000 por mês costumavam comprar para um desenvolvedor. Com os preços de 2023, esse valor cobria cerca de 33 milhões de tokens de entrada do GPT-4. Dava para uma aplicação modesta, mas não para rodar algo em escala relevante. Cargas de produção que processam documentos, respondem perguntas de clientes, fazem revisões de código ou resumem pesquisas em volume simplesmente não podiam ser executadas com lucro nesses valores.

Depois da reprecificação causada pela DeepSeek, US$ 1.000 por mês cobrem bem mais de 3 bilhões de tokens com vários modelos capazes. Isso não é um detalhe. É a diferença entre uma ideia que fica em um caderno e um produto que chega a usuários reais.

Profissionais de negócios em sala de reuniões de vidro analisando dados de mercado de IA na tela

As categorias que mais se beneficiam dessa mudança:

  • Processamento de documentos: equipes jurídicas, de compliance e financeiras que precisam que a IA leia milhares de páginas
  • Automação de atendimento ao cliente: geração de respostas em alto volume, em que o custo por resposta define o ROI
  • Revisão de código em escala: equipes de engenharia que rodam revisão com IA em cada pull request, e não apenas nos de maior risco
  • Resumo de pesquisas: equipes acadêmicas e de pesquisa de mercado que processam grandes volumes de dados que antes tinham custo proibitivo

Startups em pé de igualdade

A mudança estrutural mais significativa está no nível das startups. Antes de o DeepSeek V4 Pro chegar, uma startup em estágio inicial que tentasse criar um produto nativo de IA enfrentava um dilema doloroso: usar modelos baratos, mas limitados, no desenvolvimento, e depois encarar um aumento súbito e muitas vezes fatal de custo ao passar para a inferência de nível de produção. Muitos produtos morreram nessa travessia.

Essa restrição praticamente desapareceu. Uma startup agora pode prototipar, testar e lançar com a mesma faixa de modelo que as grandes empresas usam, sem o salto de custo. A vantagem que as empresas maiores tinham por poderem pagar pela inferência de fronteira foi bastante reduzida.

O Llama 4 Maverick Instruct e modelos de código aberto como o Kimi K2 Instruct também fazem parte dessa mudança, oferecendo mais opções na faixa mais barata da curva de custo para equipes que querem rodar sua própria infraestrutura de inferência.

Modelos DeepSeek no PicassoIA

O PicassoIA hospeda três modelos da DeepSeek que permitem colocar essa revolução de custo em prática imediatamente, sem precisar gerenciar suas próprias chaves de API ou infraestrutura.

Usando o DeepSeek R1 agora

O DeepSeek R1 é o modelo da DeepSeek voltado para raciocínio, projetado para tarefas em que você precisa que o modelo pense em um problema passo a passo antes de responder. Ele se destaca em:

  • Resolução de problemas matemáticos e demonstrações formais
  • Quebra-cabeças lógicos e cadeias de raciocínio estruturadas
  • Depuração de código em que a causa raiz exige rastrear várias camadas
  • Síntese de pesquisas em que as conclusões dependem de pesar evidências conflitantes

Como usar no PicassoIA:

  1. Abra o DeepSeek R1 diretamente no catálogo do PicassoIA
  2. Digite sua pergunta ou cole seu prompt na interface
  3. Para obter os melhores resultados em tarefas de raciocínio, estruture seu prompt como um enunciado de problema com objetivos explícitos
  4. Revise o raciocínio em cadeia que ele produz antes da resposta final; as etapas intermediárias costumam revelar suposições que valem a pena verificar

Desenvolvedor trabalhando em home office com assistente de programação com IA em monitor ultrawide

DeepSeek V3.1 para o dia a dia

O DeepSeek V3.1 é a versão de uso geral, bem indicada para escrita, resumos, assistência em programação e tarefas conversacionais. Ele oferece um bom equilíbrio entre velocidade e capacidade, sem a sobrecarga de raciocínio extra do R1.

O DeepSeek V3 continua disponível como uma base sólida para tarefas mais simples, em que você quer geração de texto rápida e precisa sem exigir o nível completo do V3.1.

Os dois modelos ficam ao lado do catálogo mais amplo de LLMs do PicassoIA, que inclui o GPT-5, o Claude Opus 4.7, o Gemini 3 Pro e o Grok 4, oferecendo uma comparação direta sem trocar de plataforma.

A guerra de preços não acabou

Código aberto ou pisos de custo fechados

A tensão mais profunda que o DeepSeek V4 Pro expôs não é apenas sobre preços. É sobre o piso de custo estrutural da inferência de IA. Modelos proprietários fechados têm um piso definido pelo custo de sua infraestrutura, pelos pipelines de testes de segurança, pelas equipes de suporte e pela necessidade de gerar retorno sobre o investimento em treinamento.

Modelos de código aberto e semiabertos, como a série DeepSeek, operam com um piso totalmente diferente. Quando os pesos são públicos, o custo marginal de rodar mais uma inferência passa a ser apenas processamento. Sem licenciamento, sem margens embutidas no preço da API. Provedores de nuvem que competem para hospedar modelos de pesos abertos empurram esse piso ainda mais para baixo.

Apresentação em conferência de setor de IA para um grande público em auditório

Isso cria uma pressão estrutural sobre todo provedor fechado. Ou eles encontram vantagens de qualidade e capacidade significativas o bastante para justificar um prêmio, ou correm em direção ao piso de custo do código aberto. O setor está fazendo as duas coisas ao mesmo tempo, e o ponto de equilíbrio ainda é desconhecido.

O que observar a seguir

Vários sinais vão determinar como os preços da IA evoluirão no próximo ano:

  • Regulação: qualquer restrição significativa sobre onde a inferência de IA pode ser executada, especialmente voltada a modelos de origem chinesa, reconfiguraria instantaneamente a dinâmica competitiva
  • Custos multimodais: a queda de preços atual se concentra em texto. Inferência de imagem, áudio e vídeo continua bem mais cara, e ainda não surgiu um equivalente da DeepSeek nessas categorias
  • Mudanças de hardware: novas arquiteturas de GPU da NVIDIA, da AMD e silício personalizado do Google e da Amazon vão afetar o piso de custo de todos os provedores
  • Custos de fine-tuning e RAG: o preço da inferência é só um componente. O custo de personalizar e fundamentar esses modelos para aplicações específicas continua sendo uma despesa à parte e ainda elevada

💡 Se você está criando com IA agora, a decisão mais importante não é qual modelo usar. É escolher uma plataforma que lhe dê flexibilidade de modelos para que você possa acompanhar as mudanças do mercado.

Experimente os modelos que mudaram tudo

A mudança de preços desencadeada pelo DeepSeek V4 Pro não é só uma boa notícia para planilhas de custo. É um sinal de que a limitação sobre o que você pode construir com IA mudou de forma profunda. Aplicações que exigiam uma equipe bem financiada e um orçamento de API substancial seis meses atrás cabem agora confortavelmente no projeto de fim de semana de um desenvolvedor solo.

Mesa com smartphone exibindo interface de chat de IA, caderno, xícara de café e óculos

O PicassoIA dá acesso ao DeepSeek R1, ao DeepSeek V3.1, ao DeepSeek V3, ao GPT-5, ao Claude Opus 4.7, ao Gemini 3 Pro, ao Grok 4 e a dezenas de outros modelos em um só lugar. Compare resultados, teste prompts entre famílias de modelos e troque de modelo sem atrito.

Sem planilhas. Sem compromissos. Apenas um prompt e um modelo que, de repente, ficou muito acessível.

Acesse picassoia.com/en/all-models e comece a criar quando o custo deixar de ser o obstáculo.

Compartilhe este artigo

Escolha seu idioma