Cómo funciona DeepSeek V4 Pro sin GPU de Nvidia

DeepSeek V4 Pro alcanza un rendimiento de vanguardia competitivo sin hardware de Nvidia al combinar la activación dispersa de Mixture of Experts, la compresión de la caché KV con Multi-Head Latent Attention y el entrenamiento de precisión mixta FP8 en chips AMD Radeon Instinct y Huawei Ascend.

Cómo funciona DeepSeek V4 Pro sin GPU de Nvidia
Cristian Da Conceicao
Fundador de Picasso IA

DeepSeek V4 Pro funciona en hardware que fabrican los competidores de Nvidia, y no le va nada mal. Ahí está la historia que vale la pena seguir.

Durante años, la suposición de partida en el desarrollo de IA era sencilla: los modelos serios necesitan H100 o A100 de Nvidia. CUDA es el estándar de cómputo, y todo lo demás es un parche que cuesta rendimiento. DeepSeek V4 Pro rompió esa suposición al lanzar un modelo de lenguaje (LLM) de clase vanguardia, entrenado y desplegado principalmente en hardware AMD Radeon Instinct y Huawei Ascend. Esto no es solo una historia de cadena de suministro ni una nota geopolítica al pie. Es un logro arquitectónico profundo.

Entender cómo lo consigue DeepSeek V4 Pro requiere fijarse en tres decisiones de diseño clave: su topología Mixture of Experts (MoE), su mecanismo Multi-Head Latent Attention (MLA) y su estrategia de entrenamiento de precisión mixta FP8. Juntas, estas decisiones arquitectónicas eliminaron la dependencia rígida del conjunto de software CUDA, propiedad de Nvidia y, al mismo tiempo, redujeron drásticamente el ancho de banda de memoria y el presupuesto de cómputo necesarios tanto para el entrenamiento como para la inferencia.

El problema de hardware que DeepSeek quiso resolver

Los controles de exportación del gobierno de EE. UU. sobre semiconductores avanzados, en especial las GPU H100 y A100 de Nvidia, pusieron a las instituciones chinas de investigación en IA bajo serias limitaciones de hardware. Las respuestas obvias habrían sido esperar, presionar para obtener excepciones o conseguir chips por canales de terceros. La respuesta de DeepSeek fue arquitectónica: diseñar un modelo que no necesite esos chips para rendir a un nivel competitivo.

Ejecutar esa estrategia exigió replantear supuestos en cada capa de la pila. El kit de herramientas CUDA, que controla Nvidia, es la capa de cómputo estándar de facto para prácticamente todos los grandes entrenamientos de LLM fuera de China. Alejarse de CUDA significa escribir y optimizar kernels de entrenamiento para la pila ROCm de AMD o para el marco CANN (Compute Architecture for Neural Networks) de Huawei. Ambos marcos son capaces, pero ninguno tiene la madurez del ecosistema que CUDA ha acumulado durante 15 años de inversión comunitaria y comercial.

El reto de ingeniería no fue solo portar código a otra API. Fue demostrar que el modelo resultante, entrenado con herramientas menos ideales y en chips con especificaciones máximas inferiores sobre el papel, podía competir con modelos entrenados en el mejor hardware disponible. DeepSeek V4 Pro superó ese listón y, al hacerlo, demostró que la relación entre la calidad del hardware y la calidad del modelo es menos determinista de lo que la industria suponía.

Primer plano macro de un acelerador de chip GPU AMD Radeon Instinct MI300X

La arquitectura de DeepSeek V4 Pro de un vistazo

DeepSeek V4 Pro es un modelo Mixture of Experts (MoE) con unos 671 000 millones de parámetros totales, pero solo unos 37 000 millones activos en cada paso hacia delante. Esa diferencia entre parámetros totales y activos es el dato más importante de esta arquitectura.

EspecificaciónValor
Parámetros totales~671 000 millones
Parámetros activos por token~37 000 millones
Tipo de arquitecturaMoE disperso
Precisión de entrenamientoFP8
Mecanismo de atenciónMulti-Head Latent Attention (MLA)
Ventana de contexto128 000 tokens

La enorme diferencia entre parámetros totales y activos es lo que permite que DeepSeek V4 Pro funcione en hardware que no aguantaría un modelo denso de 671B. Cada pase hacia delante solo activa un subconjunto cuidadosamente seleccionado de la capacidad del modelo, lo que reduce drásticamente los requisitos de ancho de banda de memoria y la intensidad de cómputo por token generado.

💡 Vale la pena señalar: El ancho de banda de memoria, y no los FLOPS brutos, es el principal cuello de botella de la inferencia de LLM a escala. Al activar solo el 5,5 % de sus parámetros por token, DeepSeek V4 Pro hace que cualquier plataforma de hardware sea un anfitrión más viable.

Por qué Mixture of Experts cambia la ecuación del hardware

Qué hace realmente MoE

En un transformador denso estándar, cada parámetro participa en la predicción de cada token. Un modelo denso de 70B procesa cada token a través de los 70B parámetros, siempre. En un modelo MoE, la red se divide en muchas subredes "expertas" especializadas, y un router aprendido selecciona qué expertos procesan cada token según su contenido y contexto.

DeepSeek V4 Pro usa un diseño MoE de grano fino con expertos compartidos y expertos enrutados. Los expertos compartidos se activan siempre, sea cual sea el contenido del token, y se encargan del conocimiento general y de los patrones lingüísticos comunes. Los expertos enrutados compiten por activarse mediante una red de router ligera que añade una carga de cómputo insignificante a cada pase hacia delante. Solo los expertos ganadores procesan realmente cada token.

Vista aérea cenital de un clúster interconectado de PCB que representa el cómputo MoE distribuido

Por qué esto importa para hardware que no es de Nvidia

La H100 de Nvidia domina el entrenamiento de IA en parte porque entrenar modelos grandes densos exige un ancho de banda de comunicación muy ajustado entre las GPU durante el pase hacia atrás, y NVLink (la interconexión propietaria de GPU de Nvidia) supera con holgura a las interconexiones alternativas. Los modelos MoE reducen sustancialmente este volumen de comunicación durante el entrenamiento: solo los expertos activados reciben actualizaciones de gradiente, y solo sus parámetros tienen que viajar por la interconexión en cada paso.

Esto hace que entrenar sobre InfiniBand, que es independiente del hardware, sea mucho más competitivo frente a NVLink. Los clústeres MI300X de AMD y los clústeres Ascend 910B de Huawei usan InfiniBand o interconexiones equivalentes, y ambos manejan el patrón de comunicación de MoE de forma adecuada, sin sufrir la penalización por ausencia de NVLink que sí arrastran los modelos densos.

Durante la inferencia, los modelos MoE distribuyen fragmentos de expertos entre GPU. Cada GPU aloja un subconjunto de la red de expertos y recibe solo los tokens enrutados a sus expertos. Es un patrón de paralelismo de forma natural independiente del hardware, que encaja limpiamente con el hardware de AMD y Ascend sin desventajas fundamentales.

Multi-Head Latent Attention explicado de forma sencilla

El problema del cuello de botella de la atención

La atención multi-cabeza estándar (MHA) almacena una caché de clave-valor (KV) que crece en proporción a la longitud de la secuencia. Para una ventana de contexto de 128 000 tokens, esta caché se vuelve enorme y consume memoria que limita directamente cuántas solicitudes simultáneas se pueden atender con un conjunto dado de GPU.

La ventaja de Nvidia en inferencia de contexto largo se debe en parte a la capacidad bruta de HBM, ya que las H100 incorporan 80 GB de HBM3. Muchas configuraciones de AMD y Ascend tienen una capacidad por módulo comparable o mayor en las generaciones más recientes, pero el crecimiento de la caché KV con contextos de 128K puede llevar al límite a cualquier hardware cuando se ejecuta MHA estándar a escala.

Investigadores de IA estudiando diagramas de arquitectura neuronal en una pizarra

Cómo MLA lo resuelve

Multi-Head Latent Attention (MLA) comprime la caché KV proyectando las claves y los valores en un espacio latente de baja dimensión antes de guardarlos, y luego descomprime las representaciones latentes sobre la marcha durante el cálculo de la atención. Las matrices completas de claves y valores nunca se almacenan en memoria en reposo, solo los vectores latentes comprimidos.

El resultado es una caché KV de 5 a 13 veces más pequeña que la del MHA estándar con longitudes de contexto equivalentes. No es una optimización menor. Es la diferencia entre atender solicitudes de contexto de 128K en hardware con 64GB de HBM y necesitar configuraciones de más de 320GB para la misma carga de trabajo.

💡 Impacto práctico: Un modelo que sirve ventanas de contexto de 128K con MLA usa aproximadamente la misma memoria de caché KV que un modelo estándar que sirve contextos de entre 10 000 y 25 000 tokens. Los chips AMD y Ascend pueden atender solicitudes de contexto largo que, de otro modo, exigirían presupuestos de VRAM de clase H100.

La implementación de MLA de DeepSeek mantiene la calidad de salida gracias a un diseño cuidadoso de las matrices de proyección. La compresión se aprende durante el entrenamiento en lugar de aplicarse a posteriori, así que las representaciones del modelo se adaptan para funcionar bien dentro del espacio latente comprimido desde cero.

Entrenamiento en FP8: hacer más con menos

Qué significa la precisión en coma flotante

El entrenamiento de modelos grandes ha usado tradicionalmente FP32 (coma flotante de 32 bits) o FP16 (16 bits). Una precisión menor reduce la huella de memoria y aumenta el rendimiento, porque caben más números en la misma memoria y las operaciones se completan más rápido en unidades de baja precisión dedicadas. FP8 (8 bits) lleva esto más lejos, usando solo 8 bits por número.

El reto de la menor precisión es la estabilidad numérica. Durante el entrenamiento, los gradientes muy pequeños pueden redondearse a cero, y las activaciones muy grandes pueden desbordarse hasta el infinito. Ambas patologías corrompen el entrenamiento. Conseguir que FP8 sea estable en cientos de miles de millones de parámetros es un problema de ingeniería realmente difícil, que la mayoría de los equipos de investigación evitó durante años.

Ingeniero monitorizando métricas de precisión del entrenamiento FP8 en una estación de trabajo con tres monitores

Cómo DeepSeek estabilizó FP8

La estrategia de entrenamiento FP8 de DeepSeek usa un esquema de precisión mixta en el que las operaciones sensibles, en concreto la acumulación de gradientes y el almacenamiento de los pesos maestros, se mantienen en mayor precisión (BF16 o FP32), mientras que las multiplicaciones de matrices, que dominan el cómputo, se ejecutan en FP8. El equipo desarrolló estrategias de escalado dinámico personalizadas que se adaptan según las estadísticas de gradiente observadas durante todo el entrenamiento, lo que evita las inestabilidades numéricas que afectaron a los primeros intentos de FP8 a gran escala.

Esto es importante para la independencia del hardware por tres razones distintas:

  • FP8 no es propiedad de Nvidia: a diferencia del formato TF32 de Nvidia, FP8 es un estándar abierto compatible de forma nativa con el AMD MI300X y, cada vez más, con el hardware Ascend, lo que significa que las ganancias de rendimiento están al alcance fuera del ecosistema CUDA.
  • La presión sobre la memoria baja mucho: el entrenamiento en FP8 necesita aproximadamente la mitad de memoria que FP16 para el mismo tamaño de modelo, lo que hace viable meter más capas del modelo en cada GPU con hardware limitado en memoria.
  • El rendimiento casi se duplica en silicio compatible: en hardware con núcleos tensoriales FP8 nativos, incluido el AMD MI300X, el rendimiento por chip se acerca al doble del ritmo de FP16 en las multiplicaciones de matrices limitadas por cómputo.

El efecto acumulado de las tres innovaciones es lo que importa: la activación dispersa de MoE reduce el cómputo por token 18 veces, MLA comprime la huella de memoria en contextos largos entre 5 y 13 veces, y el entrenamiento en FP8 reduce a la mitad la memoria y el costo de cómputo de cada paso de entrenamiento. En conjunto, desplazan el punto de operación eficiente del modelo hacia hardware que, de otro modo, sería totalmente insuficiente para un modelo de vanguardia de 671.000 millones de parámetros.

Por qué las GPU AMD y Huawei Ascend funcionan aquí

Detalles de la AMD Radeon Instinct MI300X

La AMD Radeon Instinct MI300X no es un chip de segunda categoría. Incorpora 192 GB de HBM3 por módulo, más del doble de los 80 GB de la H100. En cargas de inferencia donde la memoria de la caché KV es el factor limitante principal, la capacidad de memoria de la MI300X supone una ventaja frente a la H100 en configuraciones concretas.

Lo que le falta a AMD es CUDA. ROCm, la pila de cómputo de AMD, ya es lo bastante madura para la inferencia y cada vez más capaz para el entrenamiento, pero históricamente ha requerido un esfuerzo de ingeniería adicional para igualar la experiencia de desarrollo lista para usar de Nvidia. El equipo de DeepSeek invirtió directamente en ese trabajo, construyendo kernels de entrenamiento y operadores de atención optimizados específicamente para el modelo de programación de ROCm.

Acelerador de IA Huawei Ascend 910B montado en un chasis de servidor abierto

Detalles de la Huawei Ascend 910B

La Huawei Ascend 910B ofrece unos 256 TFLOPS en FP16, muy por debajo de los 989 TFLOPS de la H100 sobre el papel. Funciona con el marco CANN de Huawei en lugar de CUDA o ROCm, lo que significa que la cadena de herramientas requiere un trabajo de optimización por separado. DeepSeek entrenó partes sustanciales de versiones anteriores, y del linaje de V4 Pro, en clústeres de Ascend 910B.

El conjunto MoE + MLA + FP8 contrarresta directamente las limitaciones del Ascend. Un chip con menor ancho de banda de memoria y menos FLOPS máximos se vuelve mucho más competitivo cuando el modelo que ejecuta solo activa el 5,5 % de sus parámetros por token y comprime su caché de atención entre 5 y 13 veces. La diferencia de hardware sobre el papel es mucho mayor que la diferencia de rendimiento en la práctica.

HardwareVRAMTFLOPS máximos en FP16Pila de cómputo
Nvidia H10080 GB HBM3989CUDA (madura)
AMD MI300X192 GB HBM31307ROCm (en desarrollo)
Huawei Ascend 910B64 GB HBM2e256CANN (propietaria)

Qué significa esto para el acceso a la IA

La ecuación de costos cambia

Los clústeres de H100 se alquilan a entre 2,00 y 4,50 dólares por hora de GPU, según el proveedor y la región. Los clústeres de AMD MI300X suelen salir entre un 20 y un 40 por ciento más baratos en configuraciones equivalentes. El cómputo en la nube basado en Ascend en China es todavía más barato. Cuando los entrenamientos se ejecutan de forma competitiva en estas plataformas, el costo por token de entrenamiento baja de forma notable.

DeepSeek informó de que entrenar su predecesor V3 costó unos 5,6 millones de dólares en cómputo, una fracción de lo que cuestan modelos densos comparables de laboratorios occidentales en el mismo nivel de capacidad. Las decisiones arquitectónicas descritas arriba son la principal explicación.

Instalación logística de semiconductores con técnicos de sala limpia manipulando obleas de silicio

Pesos abiertos y lo que cambian

DeepSeek publica los pesos de sus modelos. Esto significa que cualquier organización con acceso a hardware AMD o Ascend, o incluso clústeres de GPU de consumo que ejecuten versiones cuantizadas, puede beneficiarse de una capacidad de modelo de clase vanguardia sin depender de asignaciones de Nvidia, licencias de exportación ni cuotas caras de nube propietaria.

El efecto combinado de la eficiencia arquitectónica y la publicación abierta supone un cambio importante en quién puede acceder y desplegar IA competitiva. Organizaciones que antes no podían permitirse el acceso a H100 ejecutan hoy modelos de DeepSeek en hardware que ya poseen, con una calidad de inferencia que no les era accesible hace un año.

La señal más amplia

La estrategia de controles de exportación sobre los chips de Nvidia asumía que cortar el acceso a semiconductores avanzados funcionaría como un techo rígido para el desarrollo de IA fuera de los países objetivo. DeepSeek V4 Pro es una prueba concreta de que la innovación arquitectónica puede compensar en parte las limitaciones de hardware, de formas que alteran sustancialmente ese techo efectivo. El modelo no es idéntico a lo que produciría un acceso sin límites a la H100, pero es lo bastante competitivo como para resultar útil en una amplia gama de cargas de trabajo reales.

Esto cambia el cálculo para la política de chips, para la estrategia de competencia en IA y para lo que significa "acceso a la IA de vanguardia" en la práctica para organizaciones sin grandes presupuestos de nube ni relaciones preferentes con proveedores de Nvidia.

Columna de rack de servidores con tendidos de cable de fibra óptica organizados, fotografiada desde abajo

Usa DeepSeek en PicassoIA ahora mismo

PicassoIA aloja varios modelos de DeepSeek en su colección de Large Language Models, lo que te da acceso inmediato sin gestionar infraestructura ni aprovisionar hardware:

  • DeepSeek R1: modelo de cadena de pensamiento centrado en el razonamiento, con descomposición paso a paso de los problemas. Ideal para análisis técnico, matemáticas y tareas con mucha lógica donde mostrar el proceso de razonamiento importa.
  • DeepSeek V3: el modelo eficiente de vanguardia para generación de texto general y programación. Rendimiento sólido en todos los frentes y con baja latencia.
  • DeepSeek V3.1: versión actualizada con un seguimiento de instrucciones más preciso y mejor rendimiento en benchmarks de programación.

PicassoIA también ofrece acceso a Qwen3 235B A22B Instruct, Llama 4 Maverick Instruct, Claude Opus 4.7, GPT 5 y Kimi K2 Instruct en la misma interfaz, lo que te permite comparar resultados entre los modelos de vanguardia sin gestionar varias cuentas ni claves de API.

La historia arquitectónica detrás de DeepSeek V4 Pro demuestra que un diseño eficiente puede sustituir la inversión de fuerza bruta en hardware. Ese mismo principio se aplica a cómo trabajas con IA: no siempre necesitas el modelo más grande en el hardware más caro. Necesitas el modelo adecuado, aplicado al problema adecuado, con el prompt adecuado.

Equipo diverso de investigadores de IA revisando resultados de modelos en una mesa de conferencias

Abre DeepSeek R1 o DeepSeek V3.1 en PicassoIA, dale una tarea que importe en tu trabajo y comprueba lo que realmente aporta una IA de vanguardia independiente del hardware. La arquitectura que la hizo posible sin GPU de Nvidia es, en este caso, también lo que la hace accesible para ti.

Persona usando una interfaz de chat de IA en un equipo portátil en una cafetería luminosa

Compartir este artículo

Elige tu idioma