CogVideoX explicado: el modelo de video IA de código abierto que vale la pena seguir

CogVideoX es el modelo de difusión de video de pesos abiertos de THUDM que genera clips coherentes y estables a lo largo del tiempo a partir de prompts de texto. Este artículo analiza su arquitectura de transformador, cómo se compara con competidores propietarios, qué puedes crear realmente con él y cómo empezar a generar videos hoy mismo sin configurar ninguna infraestructura.

CogVideoX explicado: el modelo de video IA de código abierto que vale la pena seguir
Cristian Da Conceicao
Fundador de Picasso IA

El ámbito de la generación de video con IA de código abierto avanzó con rapidez en 2024, y CogVideoX está en el centro de ese cambio. Lanzado por THUDM, el laboratorio de investigación detrás de CogVLM y otros modelos destacados, CogVideoX es un modelo de texto a video basado en difusión que produce clips de video sorprendentemente fluidos y coherentes a partir de prompts de texto sencillos. No requiere suscripción, no está detrás de una API propietaria y no oculta sus pesos. Esa combinación lo sitúa en una categoría realmente distinta a la de la mayoría de las herramientas de video con IA que copan los titulares.

Qué es realmente CogVideoX

CogVideoX es un modelo de generación de video de pesos abiertos construido sobre una arquitectura de transformador de difusión de video. La versión insignia, CogVideoX-5B, tiene 5.000 millones de parámetros y puede generar clips de video de 6 segundos a 720x480 de resolución y 8 fotogramas por segundo (fps). Existe una variante más pequeña de 2B para entornos con menos recursos, y ambas se publican con licencias permisivas que permiten el uso comercial.

El modelo se entrenó con un amplio corpus de pares texto-video, lo que le permite unir descripciones en lenguaje natural con movimiento visual coherente. Escribes una descripción, el modelo parte de ruido gaussiano y lo elimina en varios pasos y el resultado es un clip corto en el que los objetos se mueven, la iluminación cambia y las escenas hacen transiciones con una coherencia temporal razonable.

Flujo de trabajo de editor de video con línea de tiempo de generación con IA

El laboratorio de investigación THUDM detrás del modelo

THUDM (Departamento de Aprendizaje Automático de la Universidad de Tsinghua) tiene un historial de modelos multimodales de código abierto muy capaces. Antes de CogVideoX, el laboratorio publicó CogVLM para la comprensión visual y lingüística, y GLM-4 para la generación de lenguaje. CogVideoX sigue la misma filosofía: publicar pesos potentes, compartir informes técnicos detallados y dejar que la comunidad construya sobre ellos.

Ese respaldo académico da al modelo una credibilidad de la que suelen carecer las versiones "abiertas" puramente comerciales. Las decisiones de arquitectura están documentadas, se describe el enfoque de entrenamiento y las limitaciones se exponen con honestidad, en lugar de esconderse en la letra pequeña.

Por qué importa aquí el código abierto

Los generadores de video propietarios como Sora o las API comerciales no te dan control sobre lo que ocurre con tus datos, tus prompts o los resultados. Pueden cambiar los precios, restringir los casos de uso o simplemente cerrar. Un modelo de pesos abiertos como CogVideoX te permite alojarlo tú mismo, ajustarlo con tu propio conjunto de datos y crear flujos de producción sin depender de un tercero.

Para los creadores, esto se traduce en un costo a largo plazo menor. Para los desarrolladores, supone una flexibilidad real. Para los investigadores, significa que cualquiera con el hardware y el interés necesarios puede inspeccionar la arquitectura y mejorarla.

Cómo funciona la arquitectura

Tira de película con escenas cinematográficas generadas con IA

CogVideoX no usa una base UNet estándar. En su lugar, se apoya en un transformador de atención causal 3D, a veces llamado Expert Transformer, que procesa el espacio y el tiempo de forma conjunta. Esta decisión arquitectónica es clave para que el modelo produzca movimiento con coherencia temporal en todos los fotogramas de un clip.

La base de difusión

Como la mayoría de los modelos generativos actuales, CogVideoX usa el modelado probabilístico de difusión con eliminación de ruido como mecanismo central. El modelo aprende a revertir un proceso de ruido: dado un latente de video con ruido, predice y elimina el ruido paso a paso hasta que queda un latente de video limpio.

Lo que separa a CogVideoX de los primeros modelos de difusión de video es cómo maneja la dimensión temporal. La mayoría de los modelos tempranos procesaban los fotogramas de forma bastante independiente, lo que provocaba parpadeos y movimientos irregulares. CogVideoX aplica atención 3D sobre las dimensiones espacial y temporal a la vez, lo que le permite razonar sobre cómo deben cambiar los píxeles con el tiempo y no solo dónde deben aparecer en cada fotograma.

Diseño del Expert Transformer

El backbone de transformador de CogVideoX usa una estrategia de normalización de capas adaptativa por expertos. En lugar de un único conjunto de parámetros de normalización para todo el contenido, el modelo condiciona sus estadísticas de normalización según el texto de entrada. Esto significa que el comportamiento de procesamiento del transformador cambia según lo que describas, y el modelo responde mejor a las diferencias semánticas entre prompts.

Este diseño ayuda a CogVideoX a mantener la identidad del sujeto a lo largo de los fotogramas. Una persona descrita en el prompt se mantiene visualmente coherente de un fotograma a otro, en lugar de desviar su apariencia como hacían algunos modelos anteriores.

Codificador de texto y VAE de video

CogVideoX usa T5-XXL como codificador de texto, el mismo modelo de lenguaje de 11.000 millones de parámetros que usan Stable Diffusion 3 y otros generadores de alto rendimiento. T5-XXL produce representaciones semánticas ricas a partir de prompts largos y detallados, lo que da al modelo de video más material con el que trabajar que los codificadores más simples basados en CLIP.

En cuanto al video, el modelo usa un Autoencoder Variacional 3D para comprimir los fotogramas en un espacio latente compacto donde ocurre la difusión y, después, los decodifica de nuevo al espacio de píxeles. El VAE 3D se entrena para codificar tanto la estructura espacial como la dinámica temporal, de modo que la representación latente ya contiene información de movimiento antes de que empiece el proceso de difusión.

CogVideoX frente a la competencia cerrada

Desarrollador comparando resultados de modelos en dos monitores

La comparación honesta entre CogVideoX y los modelos propietarios de primer nivel tiene matices. No supera a Sora 2 en calidad visual bruta, y no iguala el resultado cinematográfico de Kling v2.6 con sus mejores ajustes. Pero esa comparación pasa por alto lo esencial.

Comparación de la calidad de salida

Para la generación de clips cortos de uso general a partir de texto, CogVideoX-5B produce resultados que la mayoría de los espectadores describiría como impresionantes. Los objetos se mueven con verosimilitud física, el movimiento de cámara sigue el prompt de forma razonable y las escenas se sostienen durante los 6 segundos de duración. La resolución nativa de 720x480 es modesta para los estándares de 2027, pero basta para la mayoría de los casos de uso en web y redes sociales.

Donde CogVideoX se queda claramente por detrás de los modelos propietarios es en el detalle fino y en las secuencias de movimiento complejas. Las manos, el texto dentro de las escenas y los objetos en movimiento rápido a veces muestran los conocidos artefactos de la generación con IA. Son limitaciones conocidas, documentadas abiertamente por el equipo de THUDM en lugar de silenciarse.

La ventaja de los pesos abiertos

Los modelos cerrados te dan un resultado pulido sin ningún control sobre el proceso subyacente. CogVideoX te da los pesos, lo que significa que puedes:

  • Ajustar el modelo con tu propio conjunto de datos de video para especializarlo en un ámbito
  • Ejecutarlo en local en una sola A100 o en dos GPU de consumo de 24GB
  • Inspeccionar y modificar la arquitectura con fines de investigación
  • Crear flujos de producción sin una tarifa por segundo de API que crezca de forma impredecible

Para los equipos de producto que construyen herramientas de video con IA, el costo total de propiedad a lo largo del tiempo suele favorecer a los modelos abiertos, aunque el costo por inferencia de las API propietarias parezca más barato al principio.

Los benchmarks que importan

En benchmarks estándar de generación de video como EvalCrafter y VBench, CogVideoX-5B obtiene resultados competitivos frente a modelos que estaban a la vanguardia a mediados de 2024. Destaca especialmente en coherencia semántica (¿el video coincide con el prompt?) y suavidad del movimiento (¿se mueve sin cortes bruscos?).

MétricaCogVideoX-5BAPI cerrada típica
Alineación semánticaAltaMuy alta
Suavidad del movimientoAltaAlta
Resolución nativa720x480720p a 1080p
Pesos abiertosSíNo
Ajustable con ajuste finoSíNo
Costo de alojamiento propio~$0,01 a $0,05$0,05 a $0,50+

Qué puedes crear con CogVideoX

Investigadora trabajando frente a un monitor con expresión concentrada

La naturaleza abierta de CogVideoX lo convierte en una pieza base, no solo en un producto de consumo. Desarrolladores y creadores lo han usado en una amplia variedad de aplicaciones desde su lanzamiento, muchas de las cuales serían imposibles o prohibitivamente caras con API cerradas.

Texto a video en la práctica

El uso más directo es exactamente el que sugiere el nombre: describes una escena y generas un clip de video. CogVideoX admite una gran variedad de estilos de prompt, desde descripciones cinematográficas ("un golden retriever corriendo entre hojas de otoño, cámara lenta, luz cálida de la tarde") hasta animaciones de conceptos abstractos ("un timelapse de una ciudad que crece sobre un terreno vacío a lo largo de décadas").

Los prompts que funcionan bien suelen ser específicos en el sujeto, la acción, el escenario y la iluminación. Los prompts vagos producen resultados irregulares. Los prompts detallados que respetan la distribución de entrenamiento del modelo, es decir, escenas del mundo real descritas en lenguaje natural, siempre producen los resultados más sólidos.

Ajuste fino para casos de uso personalizados

Aquí es donde CogVideoX se separa de cualquier competidor cerrado. Con acceso a los pesos y a un framework de entrenamiento como Diffusers, los equipos pueden ajustar el modelo con:

  • Un actor o personaje concreto, para lograr un aspecto coherente en varios clips
  • Un estilo visual, como una gradación de color específica o una estética cinematográfica particular
  • Un producto o una marca, para generar video comercial a escala
  • Un ámbito especializado con pocos datos públicos, como la visualización médica o la simulación industrial

El ajuste fino requiere recursos de GPU considerables, normalmente varias A100 para tiempos de procesamiento prácticos, pero la posibilidad de hacerlo es algo que ningún modelo propietario ofrece hoy a usuarios externos.

Ejecutarlo en local

CogVideoX-5B puede ejecutarse en una sola GPU A100 de 40GB o en dos GPU de consumo de 24GB usando descarga de modelo (model offloading). La biblioteca Hugging Face Diffusers ofrece integración directa, así que la configuración son unas pocas líneas de Python y no semanas de trabajo de infraestructura.

Consejo: para una inferencia más rápida sin sacrificar mucha calidad, usa las versiones cuantizadas de CogVideoX disponibles en Hugging Face. Reducen de forma notable los requisitos de VRAM y mantienen una calidad de salida cercana a la del modelo en precisión completa.

Cómo usar CogVideoX 5B en PicassoIA

Mujer joven viendo un video generado con IA en un equipo portátil con curiosidad

Si quieres probar CogVideoX sin montar tu propia infraestructura de GPU, CogVideoX 5B está disponible directamente en PicassoIA. Obtienes el mismo modelo de código abierto ejecutándose en la nube, sin gestionar dependencias, versiones de CUDA ni compra de hardware.

Instrucciones paso a paso

  1. Abre CogVideoX 5B en PicassoIA en tu navegador.
  2. Escribe la descripción del video en el campo de prompt. Sé específico: incluye el sujeto, la acción, el entorno y la iluminación.
  3. Ajusta el número de pasos de inferencia si está disponible. Con más pasos (50 o más) el resultado es más suave, a costa de más tiempo de generación.
  4. Haz clic en generar y espera a que se renderice el clip, normalmente entre 60 y 120 segundos en modo nube.
  5. Descarga o comparte tu video generado directamente desde la interfaz.

Consejos para mejorar tus prompts

  • Empieza por el sujeto: "Una mujer con abrigo rojo caminando por un bosque nevado" funciona mejor que "bosque nevado con una mujer dentro"
  • Describe el movimiento de forma explícita: "la cámara se mueve lentamente a la izquierda" o "el sujeto se gira para mirar a cámara" da al modelo una dirección clara
  • Incluye información sobre la iluminación: "luz difusa de cielo nublado", "contraluz de hora dorada" o "luz cálida interior de lámpara" cambian de forma notable el ambiente del resultado
  • Evita las negaciones en el prompt: decir lo que NO quieres es mucho menos eficaz que describir con precisión lo que SÍ quieres

Sacarle el máximo partido a los parámetros

Cuando los pasos de inferencia son configurables, entre 30 y 50 pasos es el punto ideal entre velocidad y calidad. Pasar de 75 pasos rara vez mejora el resultado de forma significativa. La guidance scale (CFG), cuando aparece en la interfaz, controla cuánto se ajusta el modelo al prompt frente a generar con más libertad creativa. Los valores entre 6 y 9 funcionan bien para la mayoría de los prompts descriptivos de escenas del mundo real.

Las limitaciones reales que conviene conocer

Desarrollador programando IA de código abierto en un equipo portátil por la noche

Ninguna reseña de un modelo es útil si no aborda lo que no funciona. CogVideoX tiene restricciones concretas que afectan a lo que realmente puedes producir con él, y conocerlas de antemano ahorra mucha frustración.

Limitaciones de resolución y duración

La salida estándar es de 720x480 a 8fps durante unos 6 segundos. Para redes sociales, es aceptable. Para emisión, plataformas de streaming o producción premium, se queda por debajo de las expectativas actuales. Modelos como LTX 2 Pro generan en 4K, y Wan 2.7 T2V alcanza 1080p con clips más largos. Si la resolución o la duración son tu requisito principal, esas son opciones más sólidas para tu flujo de trabajo.

Aplicar un escalado (upscaler) de video con IA puede dar a la salida de CogVideoX una apariencia de 1080p, pero esto añade un paso de procesamiento y no recupera detalle que nunca se generó.

Requisitos de hardware

Alojar CogVideoX por cuenta propia requiere hardware considerable. El modelo 5B en precisión completa necesita una GPU de 40GB. El modelo 2B es más ligero, pero produce resultados notablemente más suaves y con menos fidelidad semántica. Para la mayoría de los creadores individuales y los equipos pequeños, esto significa usar un servicio en la nube en lugar de inferencia local, lo que compensa en parte las ventajas de costo de los pesos abiertos.

Lo que todavía falla

  • Las manos y las caras en movimiento suelen mostrar artefactos, sobre todo en interacciones complejas o rápidas
  • El texto dentro de las escenas rara vez es legible o coherente, una limitación compartida por la mayoría de los modelos de generación de video
  • Los movimientos de cámara complejos, como los travellings largos entre multitudes, pierden coherencia a lo largo de su duración
  • Los clips de más de 6 segundos requieren unir varias generaciones, lo que introduce problemas de coherencia en los empalmes

Estas son áreas de investigación activas, y las variantes ajustadas por la comunidad han mejorado varios de estos puntos desde el lanzamiento del modelo base a mediados de 2024.

El panorama más amplio del video de código abierto

Equipo diverso colaborando en un proyecto de video con IA en una oficina abierta

CogVideoX no surgió aislado. El panorama de la generación de video de código abierto en 2024-2025 tiene varios competidores sólidos, cada uno con fortalezas y casos de uso distintos.

Otros modelos que vale la pena seguir

Hunyuan Video de Tencent produce clips más largos, con mejor dinámica de movimiento y mayor resolución. Requiere más cómputo y representa el techo actual de calidad de video de código abierto a principios de 2025.

LTX Video de Lightricks prioriza la velocidad de generación y produce clips casi en tiempo real en hardware de consumo. Su techo de calidad es menor, pero la velocidad de iteración es mucho más alta en flujos de trabajo que necesitan prototipos rápidos.

Wan 2.7 T2V de Wan-Video ofrece varios niveles de resolución y sólidas capacidades de imagen a video junto con texto a video, lo que lo hace más versátil para flujos de trabajo que combinan animar imágenes existentes con generar nuevas.

Dónde encaja CogVideoX

CogVideoX ocupa una posición concreta en este panorama: un modelo bien documentado, usable comercialmente, ajustable con ajuste fino, con buena alineación semántica y requisitos de hardware razonables. No es la opción de mayor resolución, ni la más rápida, ni la más completa en funciones. Pero es el modelo con la documentación más clara, la licencia más limpia y uno de los ecosistemas de desarrollo comunitario más activos.

Para los desarrolladores que construyen sobre la generación de video, esa combinación de propiedades pesa más que las puntuaciones brutas de benchmark en muchos escenarios reales.

Genera tu primer video con IA hoy mismo

GPU que impulsa la generación de video con IA de código abierto

Leer sobre CogVideoX solo llega hasta cierto punto. La arquitectura es interesante, la historia del código abierto es convincente y los benchmarks son informativos. Pero lo que de verdad importa es si produce clips de video que puedas usar para tu objetivo creativo o técnico concreto.

CogVideoX 5B en PicassoIA te permite generar un clip en pocos minutos, sin configuración, sin hardware y sin ajustes. Escribe una descripción específica, pulsa generar y mira qué hace el modelo con tu prompt.

Además de CogVideoX, PicassoIA ejecuta más de 87 modelos de texto a video, entre ellos Kling v2.6, Wan 2.7 T2V y Sora 2, todos accesibles sin gestionar infraestructura ni manejar claves de API. Si CogVideoX no encaja con tu caso de uso, estás a un clic de probar un modelo completamente distinto con otras fortalezas.

La mejor forma de formarte una opinión real sobre cualquier modelo de generación de video es generar video con él. Empieza con una escena que conozcas bien, descríbela con precisión y compara lo que sale. Esa experiencia práctica te dirá más que cualquier tabla de benchmarks o explicación técnica. Empieza con CogVideoX 5B y mira hasta dónde te lleva.

Compartir este artículo

Elige tu idioma