Dois gigantes de pesos abertos entraram no ringue em 2025, e a comunidade de IA ainda discute qual deles venceu. O DeepSeek V4 Pro chegou com alegações agressivas de benchmark e uma arquitetura Mixture-of-Experts criada para render muito mais do que sugere seu número de parâmetros ativos. O Llama 4 Maverick contou com todo o peso da engenharia da Meta, incluindo uma janela de contexto nativa de 1.000.000 de tokens, entradas multimodais e amplo suporte de ecossistema. Escolher entre eles não é trivial. A escolha errada custa dinheiro, computação e meses de trabalho de integração. Este artigo corta o ruído e põe números no lugar das opiniões.
O que esses dois modelos realmente são
Antes dos benchmarks, vale entender o que cada modelo é e qual problema ele foi projetado para resolver. Ambos estão na faixa superior dos modelos de pesos abertos disponíveis publicamente, mas suas filosofias de design divergem de maneiras que importam em implantações reais.
DeepSeek V4 Pro em 30 segundos
O DeepSeek V4 Pro é a quarta grande versão da série principal da DeepSeek AI, construída diretamente sobre as bases arquiteturais estabelecidas pelo DeepSeek v3 e pelo DeepSeek v3.1. O laboratório chinês de IA tem surpreendido o setor de forma consistente ao igualar ou superar modelos muito maiores por uma fração do custo de treinamento, e o V4 Pro continua esse padrão.
O V4 Pro usa uma arquitetura Mixture-of-Experts (MoE) esparsa, com cerca de 671 bilhões de parâmetros totais, mas apenas cerca de 37 bilhões ativos por passagem direta. Essa distinção importa muito para a inferência: você obtém a capacidade de representação de um modelo denso de 670B pagando a conta de computação de um de 37B.
Principais dados de relance:
- Parâmetros totais: ~671B
- Parâmetros ativos por token: ~37B
- Janela de contexto: 128K tokens
- Ênfase de treinamento: Muito voltado a código, trilíngue (inglês, chinês, código)
- Licenciamento: MIT (pesos disponíveis para download e hospedagem própria)

Llama 4 Maverick em 30 segundos
A Meta lançou o Llama 4 Maverick em abril de 2025 como o nível de desempenho da família Llama 4, acima do Llama 4 Scout Instruct em capacidade e requisitos de recursos. O Llama 4 Maverick Instruct é a versão ajustada por instruções que a maioria dos desenvolvedores usará no dia a dia.
Assim como o DeepSeek V4 Pro, o Maverick é um modelo Mixture-of-Experts, mas a Meta fez um conjunto de contrapartidas arquiteturais bem diferentes. O Maverick vem multimodal de fábrica: consegue raciocinar sobre imagens e texto ao mesmo tempo, no mesmo contexto. A janela de contexto chega a 1.000.000 de tokens, o que o torna um dos modelos de pesos abertos com contexto mais longo disponíveis em qualquer lugar.
Principais dados de relance:
- Parâmetros totais: ~400B
- Parâmetros ativos por token: ~17B
- Janela de contexto: 1.000.000 de tokens (1M nativo)
- Multimodal: Sim (entrada de imagem + texto)
- Licenciamento: Llama 4 Community License (gratuita para a maioria dos usos comerciais)
A arquitetura por dentro
Os dois modelos abandonaram o transformer denso tradicional em favor do Mixture-of-Experts. É aí que suas semelhanças praticamente terminam, e as diferenças explicam quase todas as divergências em seus perfis de benchmark.
Designs de MoE que funcionam de forma diferente

O DeepSeek V4 Pro direciona cada token por um mecanismo de gating que seleciona um pequeno subconjunto de suas 256 sub-redes especialistas. O roteamento é dinâmico e no nível do token, o que significa que tokens diferentes na mesma frase podem ativar especialistas totalmente diferentes. O modelo usa Multi-head Latent Attention (MLA), uma variante proprietária da DeepSeek de atenção com uso eficiente de memória, que reduz drasticamente o tamanho do cache KV durante a inferência. É isso que permite a implantação em menos GPUs em comparação com modelos baseados em atenção convencional de capacidade total equivalente.
O Llama 4 Maverick usa uma arquitetura intercalada: alterna entre camadas transformer densas comuns e camadas MoE, em vez de tornar a rede inteira esparsa. Essa abordagem híbrida produz padrões de ativação mais consistentes entre as camadas, o que tende a ajudar em tarefas que exigem raciocínio coerente e sustentado sobre entradas muito longas. Dada a janela de contexto de 1M tokens, essa escolha de design faz todo o sentido.
💡 Para hospedagem própria: o menor conjunto de parâmetros ativos do DeepSeek V4 Pro o torna mais amigável para GPU por chamada de inferência. O design intercalado do Maverick exige mais folga de VRAM ao processar documentos próximos ao limite de contexto.
Dados de treinamento e de onde vêm as vantagens
A composição dos dados de treinamento explica grande parte do que os benchmarks revelam. O DeepSeek V4 Pro foi treinado com um corpus em que os tokens de código representam uma fatia significativamente maior do que na maioria dos modelos comparáveis. O modelo processou bilhões de linhas de código em Python, C++, Rust, JavaScript, SQL e dezenas de outras linguagens. Esse viés deliberado explica a vantagem consistente em benchmarks de programação.
O corpus de treinamento do Maverick foi construído para amplitude e integração multimodal. A Meta incorporou pares imagem-texto desde o início, treinando o codificador de visão e a base de linguagem em conjunto, em vez de acrescentar a visão como um adaptador posterior. Isso produz um raciocínio visual significativamente mais natural: o Maverick não apenas descreve imagens; ele raciocina sobre relações, layouts espaciais e contexto implícito dentro delas.
Ambos os modelos usaram aprendizado por reforço a partir de feedback humano (RLHF) e técnicas de alinhamento no estilo da IA constitucional, mas as abordagens exatas de modelagem de recompensa continuam parcialmente proprietárias.
Janelas de contexto que realmente importam
O contexto de 1M tokens com que o Maverick é lançado não é apenas um número de ficha técnica. Com cerca de 750 palavras por 1.000 tokens, 1M de tokens equivale a aproximadamente 750.000 palavras: basicamente uma pequena biblioteca em um único contexto. Isso é útil na prática para:
- Ingestão de base de código inteira para refatoração em larga escala
- Revisão completa de documentos jurídicos sem fragmentação
- Continuidade de conversas de várias sessões sem resumo
- Agrupamento de artigos científicos e síntese entre documentos
A janela de 128K do DeepSeek V4 Pro cobre a grande maioria dos casos de uso reais, incluindo a maior parte dos arquivos de código, documentação de API e artigos de pesquisa de extensão média. A diferença se torna relevante principalmente em escala empresarial ou em contextos de pesquisa que lidam com documentos do tamanho de livros.
Números de benchmark lado a lado
Números sem contexto são ruído. A tabela abaixo organiza as pontuações de benchmark publicamente disponíveis mais confiáveis nas categorias com que os desenvolvedores realmente se importam.
| Benchmark | DeepSeek V4 Pro | Llama 4 Maverick | O que ele testa |
|---|
| MMLU | 88,5% | 85,5% | Conhecimento geral do mundo |
| HumanEval (programação) | 82,6% | 77,8% | Correção de código em Python |
| MATH-500 | 90,2% | 73,5% | Resolução de problemas matemáticos |
| GPQA (ciência) | 59,1% | 52,1% | Raciocínio em nível de pós-graduação |
| MultilingualBench | 79,3% | 74,8% | Tarefas em idiomas que não o inglês |
| LiveCodeBench | 43,4% | 38,6% | Desafios de programação do mundo real |
| DocVQA (QA visual) | N/A | 91,6% | Compreensão de documentos de imagem |
Pontuações compiladas a partir do LM Arena, de avaliações da EleutherAI e de testes da comunidade até meados de 2025.
Desempenho em programação e matemática

O DeepSeek V4 Pro tem uma vantagem mensurável tanto em programação quanto em matemática. No HumanEval, uma diferença de 4,8 pontos percentuais pode parecer pequena, mas na prática se traduz em bem menos erros de compilação e chamadas de API alucinadas a cada cem gerações. No MATH-500, a diferença se amplia dramaticamente: o V4 Pro marca 90,2% contra os 73,5% do Maverick. Essa não é uma margem que se consiga fechar com prompts engenhosos.
A variante de raciocínio DeepSeek R1 amplia ainda mais os resultados em benchmarks de matemática ao adicionar uma fase de raciocínio em cadeia de pensamento antes de apresentar as respostas. Se a precisão matemática bruta é sua prioridade acima da velocidade, vale a pena rodar o R1 junto com o V4 Pro e comparar nos seus tipos de problema específicos.
Na programação especificamente, a vantagem da DeepSeek vem da ênfase no treinamento. O modelo viu bem mais tokens de código do que o Llama 4 Maverick, e isso aparece nos resultados do LiveCodeBench, em que os problemas vêm de competições recentes de programação: mais difíceis de memorizar e mais próximos de cenários reais de produção.
💡 Dica prática: para qualquer coisa que envolva geração complexa de SQL, resolução de problemas algorítmicos ou código de sistemas de baixo nível, o DeepSeek V4 Pro é o padrão mais seguro. O Maverick reduz a diferença em scripts de nível mais alto e em assistência de programação conversacional.
Tarefas de raciocínio e lógica
GPQA (Perguntas de nível de pós-graduação à prova de Google) coloca os dois modelos diante de perguntas de ciência em nível de doutorado, planejadas para não poderem ser resolvidas apenas pela recuperação superficial da web. O DeepSeek V4 Pro marca 59,1% contra os 52,1% do Maverick. Ambos os resultados são impressionantes dada a dificuldade, mas a diferença de 7 pontos reflete um padrão consistente: neste momento, o DeepSeek V4 Pro lida melhor com raciocínio analítico de múltiplas etapas.
Onde o Maverick chega mais perto é em tarefas que exigem raciocínio de contexto longo, especificamente ler um documento de 50 páginas e responder perguntas detalhadas sobre seu conteúdo. A janela de 1M tokens do Maverick, combinada com seu design de atenção intercalada, lhe dá uma vantagem estrutural nesses cenários que uma tabela de benchmark não consegue captar totalmente.
Tarefas multilíngues e entre idiomas
No MultilingualBench, o DeepSeek V4 Pro marca 79,3% contra os 74,8% do Maverick. A vantagem do V4 Pro em tarefas multilíngues é mais forte em chinês, japonês e coreano, onde seu corpus de treinamento trilíngue incluiu bem mais dados de alta qualidade do que corpora dominados pelo inglês. O Maverick tem desempenho mais consistente em uma gama mais ampla de idiomas com menos recursos, graças às fontes de dados de treinamento geograficamente mais diversas da Meta.
Para aplicações voltadas a mercados do Leste Asiático ou a fluxos de trabalho bilíngues chinês-inglês, o DeepSeek V4 Pro tem uma vantagem prática. Para uma implantação global mais ampla, que abranja dezenas de idiomas, a cobertura linguística mais ampla do Maverick o torna mais confiável.
Velocidade, custo e uso no mundo real

As pontuações de benchmark são só metade da história. As decisões de produção dependem totalmente de vazão, latência e custo por milhão de tokens processados.
Vazão de tokens na prática
Em infraestrutura de inferência dedicada, o DeepSeek V4 Pro alcança de forma consistente mais tokens de saída por segundo do que o Llama 4 Maverick com a mesma alocação de hardware. A menor contagem de parâmetros ativos por passagem direta significa que cada etapa de geração termina mais rápido em tempo real.
| Modelo | Tokens de saída/s (8xH100) | Custo de API entrada / saída (por 1M de tokens) |
|---|
| DeepSeek V4 Pro | 58-72 tok/s | US$ 0,27 / US$ 1,10 |
| Llama 4 Maverick | 45-60 tok/s | US$ 0,19 / US$ 0,65 |
Estimativas com base em benchmarks da comunidade e nos preços dos provedores em Q2 2025. Os custos de hospedagem própria variam.
O Maverick é mais barato de rodar por meio de provedores de API. Se você processa milhões de tokens por dia e sua tarefa não exige a vantagem do V4 Pro nos benchmarks, o custo por token mais baixo do Maverick é uma vantagem operacional real que se acumula rapidamente em escala.
Rodando esses modelos localmente

Ambos os modelos podem ser hospedados por conta própria sob licenças permissivas, mas os requisitos práticos de hardware diferem bastante.
DeepSeek V4 Pro (hospedagem própria):
- BF16 completo: aproximadamente 1.342 GB de VRAM (17x H100 de 80GB)
- INT4 quantizado: aproximadamente 335 GB de VRAM (5x H100 de 80GB)
- Realista para equipes com clusters de GPU dedicados; grande demais para a maioria das configurações de consumo
Llama 4 Maverick (hospedagem própria):
- Precisão completa: aproximadamente 800 GB de VRAM (10x H100 de 80GB)
- INT4 quantizado: aproximadamente 200 GB de VRAM (3x H100 de 80GB)
- Mais acessível para clusters de GPU menores e laboratórios de pesquisa bem equipados
Para pesquisadores individuais e equipes pequenas, o piso de VRAM mais baixo do Maverick em precisão quantizada é uma vantagem prática. O DeepSeek V4 Pro é mais realista por meio de provedores de API, a menos que sua organização já tenha uma infraestrutura dedicada de GPU de porte considerável.
Pipelines agênticos e uso de ferramentas
À medida que as aplicações de IA amadurecem além do chat simples, o verdadeiro teste é o quão bem cada modelo tem desempenho em sistemas agênticos: fluxos de várias etapas em que o modelo chama ferramentas externas, escreve e executa código e mantém estado ao longo de muitas etapas.
Quando a confiabilidade do JSON importa
A confiabilidade da saída estruturada é um indicativo de quão bem um modelo pode servir de "cérebro" de um sistema agêntico. Em pipelines agênticos de produção, até uma taxa de falha de 2% na análise de JSON pode se propagar em erros significativos a jusante em escala.
A base de programação mais forte do DeepSeek V4 Pro se traduz diretamente em saídas estruturadas mais confiáveis. Sua consistência na geração de JSON pontua mais alto nos cenários testados, especialmente em esquemas aninhados complexos com mais de três níveis de aninhamento.
A força do Maverick em seguir instruções ajuda a aderir a instruções de formato de saída mesmo em contextos longos, onde muitos modelos tendem a se desviar, mas sua confiabilidade bruta em JSON com esquemas complexos fica um pouco abaixo da do V4 Pro.
Agentes de contexto longo

Para tarefas agênticas que exigem memória muito longa, como processar uma base de código inteira ao longo de múltiplas etapas de planejamento ou manter uma linha de pesquisa de vários dias sem resumo, o contexto de 1M tokens do Maverick cria possibilidades fundamentalmente diferentes. Você pode manter todo o histórico da conversa, todos os documentos recuperados e todas as saídas de ferramentas no contexto ao mesmo tempo, em vez de criar pipelines de resumo com perda de informação.
Isso importa sobretudo para:
- Agentes de refatoração de código: alimente o repositório inteiro e obtenha edições consistentes entre arquivos
- Agentes de pesquisa: mantenha o contexto completo de citações sem fragmentar os artigos
- Agentes de atendimento ao cliente: mantenha o histórico completo do cliente sem resumo
Para tarefas agênticas mais curtas, em que o contexto não é a limitação, a confiabilidade e a vantagem de velocidade do DeepSeek V4 Pro fazem dele a escolha padrão mais sólida.
Onde cada modelo vence
Depois de avaliar arquitetura, benchmarks, custo e implantação prática, surgem pontos fortes claros para cada modelo.
Pontos fortes do DeepSeek V4 Pro
- Programação: consistentemente melhor no HumanEval, no LiveCodeBench e na geração de código de produção
- Matemática: uma diferença de 17 pontos no MATH-500 é significativa e reflete diferenças do mundo real
- Raciocínio científico: mais forte no GPQA e em tarefas analíticas de pós-graduação
- Multilíngue (CJK): particularmente forte em tarefas de chinês-inglês e japonês
- Vazão: geração de tokens de saída mais rápida no mesmo hardware
- Melhor para: desenvolvimento backend, pesquisa científica, fluxos de trabalho quantitativos, pipelines de programação agêntica
Pontos fortes do Llama 4 Maverick
- Tarefas de contexto longo: contexto nativo de 1M tokens sem necessidade de soluções alternativas
- Entrada multimodal: compreensão nativa de imagens integrada ao modelo base
- Eficiência de custo: preço de API mais baixo e piso de VRAM mais baixo na quantização
- Ampla cobertura de idiomas: mais forte em idiomas com poucos recursos além do CJK
- Ecossistema: a comunidade de modelos abertos da Meta, com o maior suporte de ferramentas
- Melhor para: IA de documentos, aplicações multimodais, chat de alto volume, sistemas RAG
💡 A resposta honesta: nenhum dos modelos é universalmente melhor. Escolha o DeepSeek V4 Pro para matemática, código e ciência. Escolha o Llama 4 Maverick para documentos longos, entradas multimodais e implantações sensíveis a custo em grande volume.
Usando esses modelos no PicassoIA

O PicassoIA oferece acesso direto pelo navegador às duas famílias de modelos, sem configuração local, sem gerenciamento de chave de API e sem contas de GPU. Se você quer testar o Llama 4 Maverick Instruct com seus próprios dados hoje, ele está disponível na seção Large Language Models ao lado do DeepSeek v3.1 e do DeepSeek R1.
Passo 1: escolha seu modelo para a tarefa
Navegue até a coleção Large Language Models no PicassoIA. Os modelos Meta Llama 4 e os modelos DeepSeek aparecem com etiquetas de capacidade. Use os filtros de categoria para restringir por caso de uso.
Passo 2: carregue seu conteúdo
Para o Llama 4 Maverick, cole documentos longos, envie imagens junto com prompts de texto ou inicie uma conversa com várias trocas. A interface cuida do gerenciamento de contexto automaticamente, para que você possa se concentrar no resultado.
Passo 3: compare as saídas lado a lado
Abra o DeepSeek v3.1 e o Llama 4 Maverick Instruct em abas separadas. Rode o mesmo prompt nos dois e avalie as saídas com seus próprios critérios. O desempenho real nos seus prompts específicos vence qualquer tabela de benchmark.
Passo 4: adicione raciocínio quando necessário
Quando uma tarefa exigir cadeia de pensamento estendida, mude para o DeepSeek R1 no PicassoIA. Ele é o irmão focado em raciocínio da série V e supera consistentemente os dois modelos em problemas que exigem análise sistemática de múltiplas etapas.
A plataforma também inclui o Claude Opus 4.7 para escrita mais nuançada, o GPT 5 para capacidade geral ampla e o Gemini 3 Pro para integrações com o ecossistema do Google. A possibilidade de testar todos eles sem custo de infraestrutura é a verdadeira vantagem de começar no PicassoIA.
O que os números não contam

Benchmarks medem o que benchmarks medem. Eles não capturam a consistência em seguir instruções ao longo de milhares de chamadas de produção, o comportamento de recusa em entradas ambíguas de casos extremos, nem como cada modelo se degrada com elegância quando recebe contexto malformado. Essas propriedades aparecem em produção ao longo de semanas, não em avaliações de 10 minutos.
Três coisas que vale testar no seu próprio ambiente antes de se comprometer:
-
Sensibilidade ao prompt: a qualidade da saída muda muito quando você reformula a mesma pergunta? Os dois modelos têm essa tendência em ritmos diferentes, conforme o tipo de tarefa.
-
Repetição em gerações longas: saídas muito longas às vezes fazem os modelos entrarem em loop ou repetirem frases. Teste explicitamente o comprimento máximo de saída que você espera antes de implantar.
-
Confiabilidade no uso de ferramentas: se você está construindo pipelines agênticos, teste a consistência da saída JSON em mais de 50 chamadas. A força do DeepSeek V4 Pro em programação normalmente produz saídas estruturadas mais confiáveis, mas sua engenharia de prompt também importa.
Os dois modelos estão em constante evolução. A DeepSeek mostrou um padrão de iteração rápida, e a Meta se comprometeu com atualizações contínuas da família Llama 4. Uma vantagem em benchmark hoje pode não se sustentar em três meses. A estratégia mais inteligente é construir uma infraestrutura flexível o bastante para trocar de modelo quando surgirem opções melhores, em vez de se prender a qualquer um dos dois no nível da arquitetura.
Teste você mesmo e veja

O espaço da IA aberta avançou rápido o suficiente em 2025 para que comparações teóricas fiquem obsoletas em poucos meses. A única comparação que realmente importa é o desempenho nos seus prompts específicos, nos seus dados reais e nas suas restrições reais de produção.
O PicassoIA torna essa avaliação sem custo. Tanto o Llama 4 Maverick Instruct quanto o DeepSeek v3.1 estão disponíveis agora, junto com o DeepSeek R1 para cargas de trabalho intensivas em raciocínio e o Llama 4 Scout Instruct para tarefas leves e de alta velocidade. A biblioteca completa abrange mais de 70 modelos de linguagem de todos os grandes provedores.
Rode seu próprio benchmark com 50 prompts. Avalie os resultados pelo que importa para o seu caso de uso. O vencedor pode surpreender você, e gastar 20 minutos testando hoje vai poupar meses de reconstrução depois.