O DeepSeek V4 Pro está rodando em hardware fabricado pelos concorrentes da Nvidia, e não está tendo dificuldades. Essa é a história que vale a pena acompanhar.
Por anos, o pressuposto básico no desenvolvimento de IA era simples: modelos sérios exigem H100 ou A100 da Nvidia. O CUDA é o padrão de computação, e todo o resto é uma alternativa improvisada que custa desempenho. O DeepSeek V4 Pro quebrou essa premissa ao lançar um modelo de linguagem (LLM) de classe de ponta, treinado e implantado principalmente em hardware AMD Radeon Instinct e Huawei Ascend. Isso não é apenas uma história de cadeia de suprimentos ou uma nota de rodapé geopolítica. É uma conquista profundamente arquitetural.
Entender como o DeepSeek V4 Pro faz isso exige olhar para três decisões centrais de design: sua topologia de Mixture of Experts (MoE), seu mecanismo de Multi-Head Latent Attention (MLA) e sua estratégia de treinamento de precisão mista FP8. Juntas, essas decisões arquiteturais eliminaram a dependência rígida do conjunto de ferramentas de software proprietário CUDA da Nvidia e, ao mesmo tempo, reduziram drasticamente a largura de banda de memória e o orçamento de computação necessários tanto para o treinamento quanto para a inferência.
O problema de hardware que o DeepSeek se propôs a resolver
Os controles de exportação do governo dos EUA sobre semicondutores avançados, especialmente as GPUs H100 e A100 da Nvidia, colocaram as instituições chinesas de pesquisa em IA sob restrições significativas de hardware. As respostas óbvias seriam esperar, pressionar por exceções ou obter chips por canais de terceiros. A resposta do DeepSeek foi arquitetural: projetar um modelo que não precisa desses chips para ter desempenho competitivo.
Executar essa estratégia exigiu repensar premissas em cada camada da pilha. O CUDA, controlado pela Nvidia, é a camada de computação padrão de fato para praticamente todo treinamento de LLM de grande porte fora da China. Afastar-se do CUDA significa escrever e otimizar kernels de treinamento para a pilha ROCm da AMD ou para o framework CANN (Compute Architecture for Neural Networks) da Huawei. Ambos os frameworks são capazes, mas nenhum tem a maturidade de ecossistema que o CUDA acumulou em 15 anos de investimento da comunidade e de empresas.
O desafio de engenharia não foi apenas portar código para outra API. Foi provar que o modelo resultante, treinado com ferramentas menos ideais e em chips com especificações de pico mais baixas no papel, poderia ser competitivo com modelos treinados no melhor hardware disponível. O DeepSeek V4 Pro superou esse desafio e, ao fazê-lo, demonstrou que a relação entre qualidade de hardware e qualidade de modelo é menos determinística do que a indústria havia presumido.

Visão geral da arquitetura do DeepSeek V4 Pro
O DeepSeek V4 Pro é um modelo Mixture of Experts (MoE) com aproximadamente 671 bilhões de parâmetros totais, mas apenas cerca de 37 bilhões ativados por passagem direta. Essa diferença entre parâmetros totais e ativos é o número mais importante dessa arquitetura.
| Especificação | Valor |
|---|
| Parâmetros totais | ~671 bilhões |
| Parâmetros ativos por token | ~37 bilhões |
| Tipo de arquitetura | MoE esparso |
| Precisão de treinamento | FP8 |
| Mecanismo de atenção | Multi-Head Latent Attention (MLA) |
| Janela de contexto | 128.000 tokens |
A enorme diferença entre parâmetros totais e ativos é o que permite que o DeepSeek V4 Pro rode em hardware que não aguentaria um modelo denso de 671B. Cada passagem direta ativa apenas um subconjunto cuidadosamente selecionado da capacidade do modelo, reduzindo drasticamente os requisitos de largura de banda de memória e a intensidade de computação por token gerado.
💡 Vale notar: A largura de banda de memória, e não o FLOPS bruto, é o principal gargalo da inferência de LLMs em escala. Ao ativar apenas 5,5% de seus parâmetros por token, o DeepSeek V4 Pro torna qualquer plataforma de hardware mais viável para hospedá-lo.
Por que o Mixture of Experts muda a equação do hardware
O que o MoE realmente faz
Em um transformer denso padrão, cada parâmetro participa de cada previsão de token. Um modelo denso de 70B processa cada token por todos os 70B parâmetros, toda vez. Em um modelo MoE, a rede é dividida em muitas sub-redes "especialistas" especializadas, e um roteador aprendido seleciona quais especialistas tratam cada token com base no conteúdo e no contexto desse token.
O DeepSeek V4 Pro usa um design MoE de granularidade fina, com especialistas compartilhados e roteados. Os especialistas compartilhados estão sempre ativos, independentemente do conteúdo do token, cuidando do conhecimento geral e de padrões linguísticos comuns. Os especialistas roteados competem pela ativação por meio de uma rede roteadora leve, que adiciona uma sobrecarga de computação insignificante a cada passagem direta. Apenas os especialistas vencedores processam de fato cada token.

Por que isso importa para hardware que não é da Nvidia
A H100 da Nvidia domina o treinamento de IA em parte porque treinar modelos grandes e densos exige largura de banda de comunicação extremamente alta entre as GPUs durante a passagem para trás, e o NVLink (a interconexão proprietária de GPUs da Nvidia) supera interconexões alternativas por uma margem significativa. Modelos MoE reduzem substancialmente esse volume de comunicação durante o treinamento: apenas os especialistas ativados recebem atualizações de gradiente, e somente os parâmetros dos especialistas ativados precisam trafegar pela interconexão a cada etapa.
Isso torna o treinamento sobre InfiniBand, que é independente de hardware, muito mais competitivo em relação ao NVLink. Os clusters MI300X da AMD e os clusters Ascend 910B da Huawei usam InfiniBand ou interconexões equivalentes, e ambos lidam adequadamente com o padrão de comunicação do MoE, sem pagar a penalidade da ausência de NVLink que modelos densos sofrem.
Durante a inferência, modelos MoE distribuem fragmentos de especialistas entre as GPUs. Cada GPU hospeda um subconjunto da rede de especialistas e recebe apenas os tokens roteados para seus especialistas. Esse é um padrão de paralelismo naturalmente independente de hardware, que se encaixa bem em hardware AMD e Ascend sem nenhuma desvantagem fundamental.
O problema do gargalo da atenção
A atenção multi-cabeça padrão (MHA) armazena um cache de chave-valor (KV) que cresce proporcionalmente ao comprimento da sequência. Para uma janela de contexto de 128.000 tokens, esse cache fica enorme, consumindo memória que limita diretamente quantas requisições simultâneas podem ser atendidas em um dado conjunto de GPUs.
A vantagem da Nvidia na inferência de contexto longo é em parte a capacidade bruta de HBM, com as H100 trazendo 80GB de HBM3. Muitas configurações AMD e Ascend nas gerações mais recentes têm capacidade por módulo comparável ou maior, mas o crescimento do cache KV em contextos de 128K pode levar qualquer hardware ao limite ao executar MHA padrão em escala.

Como o MLA resolve isso
Multi-Head Latent Attention (MLA) comprime o cache KV projetando chaves e valores em um espaço latente de baixa dimensão antes de armazená-los em cache, e depois descomprime as representações latentes em tempo real durante o cálculo da atenção. As matrizes completas de chave e valor nunca são armazenadas em repouso na memória, apenas os vetores latentes comprimidos.
O resultado é um cache KV de 5 a 13 vezes menor do que o do MHA padrão em comprimentos de contexto equivalentes. Isso não é uma otimização pequena. É a diferença entre atender requisições de contexto de 128K em hardware com 64GB de HBM e precisar de configurações de 320GB ou mais para a mesma carga de trabalho.
💡 Impacto prático: Um modelo que atende janelas de contexto de 128K com MLA usa aproximadamente a mesma memória de cache KV que um modelo padrão atendendo contextos de 10.000 a 25.000 tokens. AMD e Ascend conseguem atender requisições de contexto longo que, de outra forma, exigiriam orçamentos de VRAM da classe H100.
A implementação de MLA do DeepSeek mantém a qualidade da saída por meio de um design cuidadoso das matrizes de projeção. A compressão é aprendida durante o treinamento, em vez de aplicada depois, de modo que as representações do modelo se adaptam para funcionar bem dentro do espaço latente comprimido desde o início.
O que significa precisão de ponto flutuante
O treinamento de modelos grandes tradicionalmente usou FP32 (ponto flutuante de 32 bits) ou FP16 (16 bits). Precisão menor reduz o uso de memória e aumenta a taxa de processamento, porque mais números cabem na mesma memória, e as operações são concluídas mais rápido em unidades de hardware dedicadas de baixa precisão. O FP8 (8 bits) vai além, usando apenas 8 bits por número.
O desafio da precisão menor é a estabilidade numérica. Durante o treinamento, gradientes muito pequenos podem zerar por subfluxo, e ativações muito grandes podem chegar ao infinito por transbordamento. Ambos os problemas corrompem o treinamento. Tornar o FP8 estável em centenas de bilhões de parâmetros é um problema de engenharia genuinamente difícil, que a maioria das equipes de pesquisa evitou por anos.

Como o DeepSeek estabilizou o FP8
A estratégia de treinamento em FP8 do DeepSeek usa um esquema de precisão mista em que operações sensíveis, especificamente o acúmulo de gradientes e o armazenamento dos pesos mestres, permanecem em precisão mais alta (BF16 ou FP32), enquanto as multiplicações de matrizes, que dominam a computação, rodam em FP8. A equipe desenvolveu estratégias personalizadas de escalonamento dinâmico que se adaptam às estatísticas de gradiente observadas durante todo o treinamento, prevenindo as instabilidades numéricas que afetaram as tentativas anteriores de FP8 em larga escala.
Isso é significativo para a independência de hardware por três razões distintas:
- O FP8 não é proprietário da Nvidia: Diferentemente do formato TF32 da Nvidia, o FP8 é um padrão aberto com suporte nativo na AMD MI300X e cada vez mais em hardware Ascend, o que significa que os ganhos de taxa de processamento estão acessíveis fora do ecossistema CUDA.
- A pressão sobre a memória cai bruscamente: O treinamento em FP8 exige cerca de metade da memória do FP16 para o mesmo tamanho de modelo, o que torna viável encaixar mais camadas do modelo em cada GPU em hardware com memória limitada.
- A taxa de processamento quase dobra em silício compatível: Em hardware com núcleos tensoriais FP8 nativos, incluindo a AMD MI300X, a taxa de processamento por chip se aproxima do dobro da taxa de FP16 para operações de multiplicação de matrizes limitadas por computação.
O efeito cumulativo das três inovações é o que importa: a ativação esparsa do MoE reduz a computação por token em 18 vezes, o MLA comprime a memória ocupada em contextos longos de 5 a 13 vezes, e o treinamento em FP8 reduz pela metade o custo de memória e de computação de cada etapa de treinamento. Juntas, elas deslocam o ponto de operação eficiente do modelo para hardware que, de outra forma, seria totalmente inadequado para um modelo de fronteira de 671B parâmetros.
Por que as GPUs AMD e Huawei Ascend funcionam aqui
Detalhes da AMD Radeon Instinct MI300X
A AMD Radeon Instinct MI300X não é um chip de segunda linha. Ela vem com 192GB de HBM3 por módulo, mais que o dobro dos 80GB da H100. Para cargas de inferência em que a memória do cache KV é o principal fator limitante, a capacidade de memória da MI300X é uma vantagem sobre a H100 em configurações específicas.
O que falta à AMD é o CUDA. O ROCm, pilha de computação da AMD, é maduro o suficiente para inferência e cada vez mais capaz para treinamento, mas historicamente exigiu esforço de engenharia adicional para igualar a experiência de desenvolvimento turnkey da Nvidia. A equipe do DeepSeek investiu diretamente nesse trabalho, construindo kernels de treinamento e operadores de atenção otimizados especificamente para o modelo de programação do ROCm.

Detalhes da Huawei Ascend 910B
A Huawei Ascend 910B entrega aproximadamente 256 TFLOPS em FP16, bem abaixo dos 989 TFLOPS da H100 no papel. Ela roda no framework CANN da Huawei, e não no CUDA ou no ROCm, o que significa que a cadeia de ferramentas exige trabalho de otimização separado. O DeepSeek treinou partes substanciais de versões anteriores e da linhagem do V4 Pro em clusters Ascend 910B.
A pilha MoE mais MLA mais FP8 atenua diretamente as limitações de hardware do Ascend. Um chip com menor largura de banda de memória e FLOPS de pico se torna muito mais competitivo quando o modelo que ele executa ativa apenas 5,5% de seus parâmetros por token e comprime seu cache de atenção de 5 a 13 vezes. A diferença de hardware no papel é muito maior do que a diferença de desempenho na prática.
| Hardware | VRAM | TFLOPS de pico em FP16 | Pilha de computação |
|---|
| Nvidia H100 | 80GB HBM3 | 989 | CUDA (maduro) |
| AMD MI300X | 192GB HBM3 | 1.307 | ROCm (em desenvolvimento) |
| Huawei Ascend 910B | 64GB HBM2e | 256 | CANN (proprietário) |
O que isso significa para o acesso à IA
A equação de custo muda
Clusters de H100 são alugados por US$ 2,00 a US$ 4,50 por hora de GPU, dependendo do provedor e da região. Clusters AMD MI300X costumam sair de 20 a 40 por cento mais baratos em configurações equivalentes. A computação em nuvem baseada em Ascend na China é ainda mais barata. Quando execuções de treinamento acontecem de forma competitiva nessas plataformas, o custo por token de treinamento cai de forma significativa.
O DeepSeek informou ter treinado o modelo predecessor V3 por aproximadamente US$ 5,6 milhões em custos de computação, uma fração do que modelos densos comparáveis de laboratórios ocidentais custam na mesma faixa de capacidade. As escolhas arquiteturais descritas acima são a principal explicação.

Pesos abertos e o que eles mudam
O DeepSeek disponibiliza publicamente os pesos do seu modelo. Isso significa que qualquer organização com acesso a hardware AMD ou Ascend, ou mesmo clusters de GPUs de consumo rodando versões quantizadas, pode se beneficiar de uma capacidade de modelo de classe de ponta sem depender de alocação da Nvidia, de licenças de exportação ou de cotas caras de nuvem proprietária.
O efeito combinado da eficiência arquitetural e da liberação aberta é uma mudança significativa em quem pode acessar e implantar IA competitiva. Organizações que antes não conseguiam pagar pelo acesso à H100 estão rodando modelos DeepSeek em hardware que já possuem, com uma qualidade de inferência que simplesmente não estava acessível a elas um ano antes.
O sinal mais amplo
A estratégia de controle de exportação em torno dos chips da Nvidia presumia que cortar o acesso a semicondutores avançados funcionaria como um teto rígido para o desenvolvimento de IA fora dos países-alvo. O DeepSeek V4 Pro é uma evidência concreta de que a inovação arquitetural pode compensar parcialmente as restrições de hardware, de maneiras que alteram substancialmente o teto efetivo. O modelo não é idêntico ao que um acesso irrestrito às H100 produziria, mas é competitivo o bastante para fazer diferença em uma ampla gama de cargas de trabalho reais.
Isso muda o cálculo para a política de chips, para a estratégia de competição em IA e para o que "acesso à IA de fronteira" significa, na prática, para organizações sem orçamentos enormes de nuvem ou relações privilegiadas com fornecedores da Nvidia.

Use o DeepSeek no PicassoIA agora mesmo
O PicassoIA hospeda vários modelos DeepSeek na sua coleção de Large Language Models, dando a você acesso imediato sem gerenciar infraestrutura nem provisionar hardware:
- DeepSeek R1: Modelo focado em raciocínio por cadeia de pensamento, com decomposição de problemas passo a passo. Ideal para análises técnicas, matemática e tarefas com muita lógica, em que mostrar o processo de raciocínio importa.
- DeepSeek V3: O modelo eficiente de ponta para geração de texto geral e código. Desempenho sólido em geral e baixa latência.
- DeepSeek V3.1: Versão atualizada, com seguimento de instruções mais preciso e melhor desempenho em benchmarks de programação.
O PicassoIA também oferece acesso ao Qwen3 235B A22B Instruct, ao Llama 4 Maverick Instruct, ao Claude Opus 4.7, ao GPT 5 e ao Kimi K2 Instruct na mesma interface, permitindo comparar resultados de ponta sem gerenciar várias contas ou chaves de API.
A história arquitetural por trás do DeepSeek V4 Pro é que um design eficiente pode substituir o investimento de força bruta em hardware. Esse mesmo princípio se aplica à forma como você trabalha com IA: nem sempre você precisa do maior modelo no hardware mais caro. Você precisa do modelo certo, aplicado ao problema certo, com o prompt certo.

Abra o DeepSeek R1 ou o DeepSeek V3.1 no PicassoIA, dê a ele uma tarefa que seja relevante para o seu trabalho e veja o que a IA de fronteira independente de hardware realmente entrega. A arquitetura que tornou isso possível sem GPUs da Nvidia é, neste caso, também o que a torna amplamente acessível para você.
