Comment fonctionne DeepSeek V4 Pro sans GPU Nvidia

DeepSeek V4 Pro atteint des performances de pointe sans matériel Nvidia en combinant l’activation parcimonieuse du Mixture of Experts, la compression du cache KV de la Multi-Head Latent Attention et l’entraînement en précision mixte FP8 sur des puces AMD Radeon Instinct et Huawei Ascend.

Comment fonctionne DeepSeek V4 Pro sans GPU Nvidia
Cristian Da Conceicao
Fondateur de Picasso IA

DeepSeek V4 Pro tourne sur du matériel fabriqué par les concurrents de Nvidia, et il ne peine pas. C’est là que se trouve l’histoire qui mérite attention.

Pendant des années, l’hypothèse de travail du développement de l’IA était simple : les modèles sérieux exigent des H100 ou A100 de Nvidia. CUDA est le standard de calcul, et tout le reste est un contournement qui coûte en performance. DeepSeek V4 Pro a fait voler cette hypothèse en éclats en livrant un grand modèle de langage de classe frontière, entraîné et déployé principalement sur du matériel AMD Radeon Instinct et Huawei Ascend. Ce n’est pas seulement une histoire de chaîne d’approvisionnement ou une note géopolitique en bas de page. C’est une réussite profondément architecturale.

Comprendre comment DeepSeek V4 Pro y parvient suppose d’examiner trois choix de conception essentiels : sa topologie Mixture of Experts (MoE), son mécanisme Multi-Head Latent Attention (MLA) et sa stratégie d’entraînement en précision mixte FP8. Ensemble, ces décisions architecturales ont supprimé la dépendance stricte à l’ensemble d’outils logiciels propriétaire CUDA de Nvidia, tout en réduisant fortement la bande passante mémoire et le budget de calcul nécessaires à l’entraînement comme à l’inférence.

Le problème matériel que DeepSeek voulait résoudre

Les contrôles d’exportation du gouvernement américain sur les semi-conducteurs avancés, en particulier les GPU H100 et A100 de Nvidia, ont imposé de fortes contraintes matérielles aux institutions de recherche en IA chinoises. Les réponses évidentes auraient été d’attendre, de faire pression pour obtenir des exceptions ou de se procurer des puces par des canaux tiers. La réponse de DeepSeek a été architecturale : concevoir un modèle qui n’a pas besoin de ces puces pour atteindre un niveau compétitif.

Mettre cette stratégie en œuvre a exigé de repenser les hypothèses à chaque couche de l’ensemble d’outils. La boîte à outils CUDA, contrôlée par Nvidia, est la couche de calcul de facto pour pratiquement tous les grands entraînements de LLM hors de Chine. S’éloigner de CUDA signifie écrire et optimiser les noyaux d’entraînement pour la pile ROCm d’AMD ou pour le framework CANN (Compute Architecture for Neural Networks) de Huawei. Les deux sont capables, mais aucun n’a atteint la maturité d’écosystème que CUDA a accumulée pendant 15 ans d’investissements communautaires et commerciaux.

Le défi d’ingénierie n’était pas seulement de porter du code vers une autre API. Il fallait prouver que le modèle obtenu, entraîné avec des outils moins idéaux et sur des puces aux caractéristiques de pointe plus faibles sur le papier, pouvait rivaliser avec des modèles entraînés sur le meilleur matériel disponible. DeepSeek V4 Pro a franchi cette barre et, ce faisant, a montré que le lien entre qualité du matériel et qualité du modèle est moins déterministe que ne le supposait l’industrie.

Gros plan macro d’un accélérateur GPU AMD Radeon Instinct MI300X

DeepSeek V4 Pro en un coup d’œil

DeepSeek V4 Pro est un modèle Mixture of Experts (MoE) d’environ 671 milliards de paramètres au total, mais seulement d’environ 37 milliards activés à chaque passage avant. Cet écart entre paramètres totaux et paramètres actifs est le chiffre le plus important de cette architecture.

SpécificationValeur
Paramètres totaux~671 milliards
Paramètres actifs par token~37 milliards
Type d’architectureMoE parcimonieux
Précision d’entraînementFP8
Mécanisme d’attentionMulti-Head Latent Attention (MLA)
Fenêtre de contexte128 000 tokens

L’écart considérable entre paramètres totaux et paramètres actifs permet à DeepSeek V4 Pro de tourner sur un matériel qui plierait sous un modèle dense de 671 B. Chaque passage avant ne mobilise qu’un sous-ensemble soigneusement sélectionné de la capacité du modèle, ce qui réduit fortement la bande passante mémoire et l’intensité de calcul par token généré.

💡 À noter : La bande passante mémoire, et non la puissance de calcul brute en FLOPS, est le principal goulot d’étranglement de l’inférence des LLM à grande échelle. En n’activant que 5,5 % de ses paramètres par token, DeepSeek V4 Pro rend toutes les plateformes matérielles plus viables comme hôtes.

Pourquoi le Mixture of Experts change la donne matérielle

Ce que fait réellement le MoE

Dans un transformer dense classique, chaque paramètre participe à chaque prédiction de token. Un modèle dense de 70 B traite chaque token à travers les 70 B paramètres, à chaque fois. Dans un modèle MoE, le réseau est divisé en nombreux sous-réseaux « experts » spécialisés, et un routeur appris sélectionne les experts qui traitent chaque token en fonction du contenu et du contexte de ce token.

DeepSeek V4 Pro utilise une conception MoE à grain fin, avec à la fois des experts partagés et des experts routés. Les experts partagés s’activent toujours, quel que soit le contenu du token, et gèrent les connaissances générales et les schémas linguistiques courants. Les experts routés se disputent l’activation grâce à un réseau de routage léger qui ajoute un surcoût de calcul négligeable à chaque passage avant. Seuls les experts gagnants traitent réellement chaque token.

Vue aérienne de dessus d’un cluster de circuits imprimés interconnectés représentant un calcul MoE distribué

Pourquoi cela compte pour le matériel non Nvidia

La H100 de Nvidia domine l’entraînement de l’IA en partie parce que l’entraînement de grands modèles denses exige une bande passante de communication extrêmement serrée entre les GPU pendant la rétropropagation, et que NVLink (l’interconnexion GPU propriétaire de Nvidia) surpasse nettement les autres interconnexions. Les modèles MoE réduisent fortement ce volume de communication pendant l’entraînement : seuls les experts activés reçoivent des mises à jour de gradient, et seuls les paramètres de ces experts activés doivent transiter par l’interconnexion à chaque étape.

Cela rend l’entraînement sur InfiniBand, qui est indépendant du matériel, nettement plus compétitif face à NVLink. Les clusters MI300X d’AMD et les clusters Ascend 910B de Huawei utilisent tous deux InfiniBand ou une interconnexion équivalente, et gèrent correctement le schéma de communication MoE sans subir la pénalité d’absence de NVLink que subissent les modèles denses.

Pendant l’inférence, les modèles MoE répartissent des fragments d’experts entre les GPU. Chaque GPU héberge un sous-ensemble du réseau d’experts et ne reçoit que les tokens qui lui sont routés. Il s’agit d’un schéma de parallélisme naturellement indépendant du matériel, qui s’adapte bien aux plateformes AMD et Ascend sans désavantage fondamental.

La Multi-Head Latent Attention expliquée simplement

Le problème du goulot d’étranglement de l’attention

L’attention multi-têtes standard (MHA) stocke un cache clé-valeur (KV) qui croît proportionnellement à la longueur de la séquence. Pour une fenêtre de contexte de 128 000 tokens, ce cache devient énorme et consomme une mémoire qui limite directement le nombre de requêtes simultanées pouvant être servies sur un ensemble donné de GPU.

L’avantage de Nvidia en matière d’inférence sur long contexte tient en partie à la capacité brute de HBM, les H100 étant livrées avec 80 Go de HBM3. De nombreuses configurations AMD et Ascend offrent, dans les dernières générations, une capacité par module comparable ou supérieure, mais la croissance du cache KV à des contextes de 128 K peut repousser les limites de n’importe quel matériel lorsqu’on exécute une MHA standard à grande échelle.

Chercheurs en IA étudiant des schémas d’architecture de réseaux de neurones devant un tableau blanc

Comment la MLA résout le problème

La Multi-Head Latent Attention (MLA) compresse le cache KV en projetant les clés et les valeurs dans un espace latent de faible dimension avant de les mettre en cache, puis en décompressant les représentations latentes à la volée pendant le calcul de l’attention. Les matrices complètes de clés et de valeurs ne sont jamais stockées au repos en mémoire, seuls les vecteurs latents compressés le sont.

Le résultat est un cache KV de 5 à 13 fois plus petit que celui de la MHA standard, à longueur de contexte équivalente. Ce n’est pas une optimisation mineure. C’est la différence entre servir des requêtes à contexte de 128 K sur du matériel doté de 64 Go de HBM et exiger des configurations de plus de 320 Go pour la même charge de travail.

💡 Impact pratique : Un modèle servant des fenêtres de contexte de 128 K avec la MLA utilise à peu près la même mémoire de cache KV qu’un modèle standard servant des contextes de 10 000 à 25 000 tokens. Les plateformes AMD et Ascend peuvent servir des requêtes à long contexte qui exigeraient autrement des budgets de VRAM de classe H100.

La mise en œuvre de la MLA par DeepSeek préserve la qualité des résultats grâce à une conception soignée des matrices de projection. La compression est apprise pendant l’entraînement plutôt qu’appliquée après coup, de sorte que les représentations du modèle s’adaptent dès le départ pour fonctionner efficacement dans l’espace latent compressé.

Entraînement FP8 : faire plus avec moins

Ce que signifie la précision en virgule flottante

L’entraînement de grands modèles utilise traditionnellement le FP32 (virgule flottante sur 32 bits) ou le FP16 (16 bits). Une précision moindre réduit l’empreinte mémoire et augmente le débit, car davantage de nombres tiennent dans la même mémoire et les opérations s’exécutent plus vite sur des unités matérielles dédiées à la basse précision. Le FP8 (8 bits) va plus loin, en n’utilisant que 8 bits par nombre.

Le défi de la basse précision est la stabilité numérique. Pendant l’entraînement, de très petits gradients peuvent tomber à zéro par sous-dépassement, et de très grandes activations peuvent dépasser la limite et devenir infinies par dépassement de capacité. Ces deux anomalies corrompent l’entraînement. Rendre le FP8 stable sur des centaines de milliards de paramètres est un problème d’ingénierie réellement difficile, que la plupart des équipes de recherche ont évité pendant des années.

Ingénieur surveillant des métriques de précision d’entraînement FP8 sur une station de travail à trois écrans

Comment DeepSeek a stabilisé le FP8

La stratégie d’entraînement FP8 de DeepSeek repose sur un schéma de précision mixte dans lequel les opérations sensibles, en particulier l’accumulation des gradients et le stockage des poids maîtres, restent en précision plus élevée (BF16 ou FP32), tandis que les multiplications de matrices, dominantes en calcul, s’exécutent en FP8. L’équipe a développé des stratégies de mise à l’échelle dynamique sur mesure, qui s’adaptent aux statistiques des gradients observées tout au long de l’entraînement, ce qui prévient les instabilités numériques qui ont affecté les premières tentatives de FP8 à grande échelle.

C’est important pour l’indépendance matérielle, pour trois raisons distinctes :

  • Le FP8 n’est pas propriétaire de Nvidia : contrairement au format TF32 de Nvidia, le FP8 est un standard ouvert pris en charge nativement sur les MI300X d’AMD et de plus en plus sur le matériel Ascend, ce qui signifie que les gains de débit sont accessibles en dehors de l’écosystème CUDA.
  • La pression sur la mémoire chute nettement : l’entraînement en FP8 demande environ deux fois moins de mémoire qu’en FP16 pour une même taille de modèle, ce qui permet de faire tenir davantage de couches du modèle par GPU sur un matériel contraint en mémoire.
  • Le débit double presque sur les puces compatibles : sur du matériel doté de cœurs tensoriels FP8 natifs, dont l’AMD MI300X, le débit par puce approche le double du débit FP16 pour les multiplications de matrices limitées par le calcul.

Ce qui compte, c’est l’effet cumulé des trois innovations : l’activation parcimonieuse du MoE réduit le calcul par token de 18 fois, la MLA compresse l’empreinte mémoire des longs contextes de 5 à 13 fois, et l’entraînement FP8 réduit de moitié le coût en mémoire et en calcul de chaque étape d’entraînement. Ensemble, ils déplacent le point de fonctionnement efficace du modèle vers un matériel qui serait autrement tout à fait inadapté à un modèle frontière de 671 B paramètres.

Pourquoi les GPU AMD et Huawei Ascend fonctionnent ici

Les spécificités de l’AMD Radeon Instinct MI300X

L’AMD Radeon Instinct MI300X n’est pas une puce de second rang. Elle est livrée avec 192 Go de HBM3 par module, soit plus du double des 80 Go de la H100. Pour les charges d’inférence où la mémoire du cache KV est le principal facteur limitant, la capacité mémoire du MI300X constitue un avantage sur la H100 dans certaines configurations précises.

Ce qui manque à AMD, c’est CUDA. ROCm, la pile de calcul d’AMD, est assez mûre pour l’inférence et de plus en plus capable pour l’entraînement, mais il a historiquement fallu un effort d’ingénierie supplémentaire pour égaler l’expérience développeur clé en main de Nvidia. L’équipe de DeepSeek a investi directement dans ce travail, en construisant des noyaux d’entraînement et des opérateurs d’attention optimisés spécifiquement pour le modèle de programmation de ROCm.

Accélérateur IA Huawei Ascend 910B monté dans un châssis de serveur ouvert

Les spécificités de l’Huawei Ascend 910B

L’Huawei Ascend 910B délivre environ 256 TFLOPS en FP16, nettement en dessous des 989 TFLOPS de la H100 sur le papier. Il fonctionne avec le framework CANN de Huawei plutôt qu’avec CUDA ou ROCm, ce qui signifie que la chaîne d’outils demande un travail d’optimisation distinct. DeepSeek a entraîné une part substantielle des versions antérieures, et la lignée de V4 Pro, sur des clusters Ascend 910B.

La pile MoE, MLA et FP8 atténue directement les limites matérielles de l’Ascend. Une puce dotée d’une bande passante mémoire et d’une puissance de calcul de pointe plus faibles devient bien plus compétitive lorsque le modèle qu’elle exécute n’active que 5,5 % de ses paramètres par token et compresse son cache d’attention de 5 à 13 fois. L’écart matériel sur le papier est bien plus grand que l’écart de performance en pratique.

MatérielVRAMTFLOPS FP16 de pointePile de calcul
Nvidia H10080 Go HBM3989CUDA (mature)
AMD MI300X192 Go HBM31 307ROCm (en développement)
Huawei Ascend 910B64 Go HBM2e256CANN (propriétaire)

Ce que cela change pour l’accès à l’IA

L’équation des coûts évolue

Les clusters H100 se louent entre 2,00 $ et 4,50 $ par heure de GPU, selon le fournisseur et la région. Les clusters AMD MI300X coûtent généralement de 20 à 40 % de moins dans des configurations équivalentes. Le calcul cloud basé sur Ascend en Chine est encore moins cher. Lorsque les entraînements s’exécutent de manière compétitive sur ces plateformes, le coût par token d’entraînement baisse de manière notable.

DeepSeek a indiqué avoir entraîné son prédécesseur V3 pour environ 5,6 millions de dollars de coûts de calcul, une fraction de ce que coûtent des modèles denses comparables chez les laboratoires occidentaux au même niveau de capacité. Les choix architecturaux décrits plus haut en sont la principale explication.

Installation logistique de semi-conducteurs avec techniciens en salle blanche manipulant des plaquettes de silicium

Les poids ouverts et ce qu’ils changent

DeepSeek publie publiquement les poids de ses modèles. Cela signifie que toute organisation ayant accès à du matériel AMD ou Ascend, ou même à des clusters de GPU grand public exécutant des versions quantifiées, peut bénéficier d’une capacité de modèle de classe frontière sans allocation Nvidia, sans licence d’exportation ni quotas coûteux de cloud propriétaire.

L’effet combiné de l’efficacité architecturale et de la publication ouverte constitue un changement notable quant à qui peut accéder à une IA compétitive et la déployer. Des organisations qui ne pouvaient pas se payer l’accès à une H100 font tourner aujourd’hui des modèles DeepSeek sur du matériel qu’elles possèdent déjà, avec une qualité d’inférence qui leur était tout simplement inaccessible un an plus tôt.

Le signal plus large

La stratégie de contrôle des exportations visant les puces Nvidia partait du principe que couper l’accès aux semi-conducteurs avancés agirait comme un plafond infranchissable pour le développement de l’IA hors des pays visés. DeepSeek V4 Pro est une preuve concrète que l’innovation architecturale peut compenser en partie les contraintes matérielles, d’une façon qui modifie sensiblement le plafond effectif. Le modèle n’est pas identique à ce que produirait un accès illimité aux H100, mais il est suffisamment compétitif pour compter dans un large éventail de charges de travail réelles.

Cela change la donne en matière de politique des puces, de stratégie de concurrence dans l’IA, et ce que « l’accès à l’IA de pointe » signifie concrètement pour les organisations qui ne disposent pas de budgets cloud massifs ni de relations privilégiées avec Nvidia.

Colonne de baie serveur avec des câbles en fibre optique bien rangés photographiée depuis le bas

Utiliser DeepSeek sur PicassoIA dès maintenant

PicassoIA héberge plusieurs modèles DeepSeek dans sa collection de Large Language Models, ce qui vous donne un accès immédiat sans gérer d’infrastructure ni provisionner de matériel :

  • DeepSeek R1 : modèle de chaîne de pensée orienté raisonnement, avec décomposition des problèmes étape par étape. Idéal pour l’analyse technique, les mathématiques et les tâches très logiques où il est important de montrer le raisonnement.
  • DeepSeek V3 : le modèle frontière efficace pour la génération de texte général et le code. De solides performances globales avec une faible latence.
  • DeepSeek V3.1 : version mise à jour, avec un suivi des instructions plus précis et de meilleures performances aux benchmarks de programmation.

PicassoIA donne aussi accès à Qwen3 235B A22B Instruct, Llama 4 Maverick Instruct, Claude Opus 4.7, GPT 5 et Kimi K2 Instruct dans la même interface, ce qui vous permet de comparer les résultats parmi les modèles de pointe sans gérer plusieurs comptes ni plusieurs clés API.

L’histoire architecturale derrière DeepSeek V4 Pro montre qu’une conception efficace peut se substituer à un investissement matériel de force brute. Ce même principe s’applique à votre façon de travailler avec l’IA : vous n’avez pas toujours besoin du plus grand modèle sur le matériel le plus coûteux. Il vous faut le bon modèle, appliqué au bon problème, avec le bon prompt.

Équipe de recherche en IA diversifiée examinant les résultats de modèles autour d’une table de conférence

Ouvrez DeepSeek R1 ou DeepSeek V3.1 sur PicassoIA, confiez-lui une tâche qui compte pour votre travail, et observez ce que l’IA de pointe indépendante du matériel apporte concrètement. L’architecture qui a rendu cela possible sans GPU Nvidia est, dans ce cas, aussi ce qui la rend largement accessible pour vous.

Personne utilisant une interface de chat IA sur un ordinateur portable dans un café lumineux

Partager cet article

Choisissez votre langue