Tencent lanzó algo importante a finales de 2024, y no lo mantuvo en silencio. Hunyuan Video llegó como un modelo de texto a video totalmente de código abierto, con 13 mil millones de parámetros, capaz de producir clips de video cinematográficos y con mucho movimiento que podían competir con lo que la mayoría de las API comerciales cerradas cobraban a precio premium. Para el campo de la generación de video con IA, fue una declaración clara: el listón había subido y ahora estaba al alcance de todos.
Qué es realmente Hunyuan Video

Hunyuan Video es un modelo de generación de video a gran escala desarrollado por la división de investigación en IA de Tencent. Con 13 mil millones de parámetros, se sitúa con firmeza en el nivel más alto de los modelos de video de código abierto por escala bruta. El modelo acepta un prompt de texto como entrada y produce clips de video que no solo son visualmente coherentes, sino también físicamente plausibles, con movimiento realista, iluminación constante y un comportamiento preciso de los objetos entre fotogramas.
Lo que lo diferencia de muchas alternativas de código abierto anteriores es el techo de calidad. Antes de Hunyuan Video, la distancia entre la generación de video de código abierto y las ofertas comerciales como Sora o Runway era visible y considerable. Hunyuan redujo esa distancia de forma notable.
El lanzamiento que pilló por sorpresa a todos
La mayoría de los grandes lanzamientos de video con IA de 2024 vinieron de startups o laboratorios de investigación con mucha visibilidad pública. El de Tencent fue distinto. La compañía publicó a la vez los pesos del modelo, el artículo técnico y el código de inferencia, dando a los desarrolladores acceso inmediato y directo. Sin listas de espera ni claves de API necesarias para probarlo.
El momento no fue casual. El equipo de IA de Tencent llevaba más de dos años avanzando hacia esto, perfeccionando su infraestructura de generación de imágenes antes de extender la arquitectura al video. El resultado fue un modelo que parecía pulido en lugar de experimental.
Código abierto en un mundo cerrado

El lanzamiento de código abierto de Hunyuan Video tiene un peso práctico real. Los investigadores pueden estudiar la arquitectura sin restricciones. Los desarrolladores pueden ejecutarlo en local con hardware suficiente. Los proveedores de plataformas pueden integrarlo directamente. Esta apertura ya ha dado lugar a una ola de versiones con ajuste fino orientadas a estilos visuales concretos, tipos de movimiento específicos y dominios especializados como la animación de productos y el video de retratos.
Para el ecosistema en general, indica que Tencent pretende competir en calidad y accesibilidad a la vez, y no solo tras un muro de pago.
Cómo funciona la arquitectura

El diseño técnico de Hunyuan Video refleja decisiones deliberadas que explican gran parte de su ventaja en calidad. Entender los componentes principales aclara por qué ciertos tipos de prompts funcionan mejor y cómo sacar el máximo partido al modelo.
El transformador de difusión en su núcleo
Hunyuan Video usa una arquitectura Diffusion Transformer (DiT) en lugar del diseño basado en UNet que dominó los primeros modelos de generación de video. Los modelos DiT tratan la generación de video como un problema de modelado de secuencias, aplicando mecanismos de atención de transformador a las dimensiones espaciales y temporales al mismo tiempo.
Esto importa en la práctica. Las arquitecturas UNet procesan bien la información espacial, pero les cuesta mantener relaciones temporales coherentes en clips más largos. El enfoque DiT basado en atención permite que el modelo considere toda la secuencia de fotogramas a la vez durante el proceso de eliminación de ruido, lo que produce un movimiento mucho más coherente a lo largo de toda la duración del clip.
💡 El backbone de transformador procesa parches del video de forma conjunta en el espacio y el tiempo, en lugar de tratar cada fotograma por separado. Esta única decisión arquitectónica explica la mayor parte de la ventaja de calidad de movimiento de Hunyuan Video frente a modelos anteriores de código abierto.
Flow matching en lugar de programación de ruido

En lugar de la programación de ruido DDPM estándar que usan la mayoría de los modelos de difusión, Hunyuan Video usa rectified flow matching como objetivo de entrenamiento. El efecto práctico son trayectorias de eliminación de ruido más limpias durante la inferencia. La generación tiende a ser más eficiente, con menos pasos necesarios para una calidad comparable, y los resultados muestran detalles finos más nítidos en todo el video.
El flow matching se ha convertido en el enfoque de entrenamiento dominante en los modelos de video de nueva generación. Es la misma elección de base que se hizo en modelos más recientes como Wan 2.7 T2V y LTX 2 Pro. Cuando Tencent eligió flow matching para Hunyuan Video, se alineó con la dirección que estaba tomando el campo.
Un VAE 3D que entiende el tiempo
El modelo usa un Variational Autoencoder (VAE) 3D causal para codificar y decodificar el video. Los VAE de imagen estándar comprimen información espacial 2D. Un VAE 3D causal amplía esto para comprimir también la información temporal, lo que significa que la representación latente captura el movimiento y el cambio a lo largo del tiempo, no solo la apariencia estática.
La propiedad "causal" garantiza que la codificación de cada fotograma solo use información de los fotogramas actuales y anteriores, nunca de los futuros. Esto mantiene la coherencia temporal al respetar la dirección natural del tiempo en el espacio latente aprendido, y abre posibilidades para aplicaciones de streaming en las que los fotogramas futuros aún no están disponibles en el momento de la codificación.
Qué puede hacer realmente

Las especificaciones importan menos que los resultados reales, pero marcan bien las expectativas. Esto es lo que produce Hunyuan Video con los ajustes estándar:
Especificaciones de resolución y duración
| Parámetro | Valor |
|---|
| Resolución por defecto | 720p (1280x720) |
| Máximo admitido | 1080p con optimización |
| Duración del clip | 5 segundos (por defecto) |
| Relaciones de aspecto | 16:9, 9:16, 1:1 |
| Fotogramas por segundo | 24 fps |
| Número de parámetros | 13 mil millones |
El valor por defecto de 720p es un equilibrio práctico. Ejecutar 13 mil millones de parámetros a 1080p exige mucha VRAM. En una sola A100 de 80 GB, generar 720p de 5 segundos tarda unos 4 a 8 minutos, según los pasos de inferencia y la configuración del hardware.
Calidad de movimiento y coherencia temporal

Aquí es donde Hunyuan Video se separa de verdad del resto. La coherencia temporal se refiere a lo bien que los objetos, la iluminación y las relaciones espaciales se mantienen constantes en todos los fotogramas de un clip. Muchos modelos de código abierto anteriores generan clips en los que los sujetos cambian sutilmente de aspecto entre fotogramas, la iluminación salta de forma poco natural o los fondos se desplazan de un fotograma a otro.
Hunyuan Video gestiona estos fallos de forma notablemente mejor que la mayoría de sus contemporáneos de código abierto. Los rostros se mantienen constantes. El movimiento de cámara, cuando lo sugiere el prompt, se percibe como deliberado y suave. Los movimientos complejos, como el agua, la tela y el pelo, se comportan según reglas físicamente plausibles en lugar de parpadear entre estados.
💡 Para obtener la mejor coherencia temporal, describe el movimiento de cámara de forma explícita en tu prompt. Expresiones como "empuje lento de dolly", "plano general fijo" o "seguimiento suave a mano alzada" dan al modelo fuertes priores de movimiento sobre los que anclar la generación.
Cómo se compara con la competencia

El panorama de la generación de video con IA en 2027 está saturado. Hunyuan Video compite con Sora, Kling, Runway, Wan Video y decenas de otras opciones. Esta es una comparación honesta de su posición:
Hunyuan Video frente a otros modelos de texto a video
La principal contrapartida de Hunyuan Video es el acceso frente a la calidad. Como lanzamiento de pesos abiertos, ejecutarlo en local exige un hardware serio. Pero a través de plataformas que lo han integrado, la ventaja en calidad está al alcance sin esos requisitos de hardware.
Donde Hunyuan Video destaca es en el realismo físico y la fidelidad al prompt. Tiende a interpretar los prompts complejos y matizados de forma más literal que los modelos más ligeros. Si escribes una descripción detallada de una escena con condiciones de iluminación, ángulos de cámara y comportamientos concretos de los sujetos, Hunyuan Video es más probable que intente cumplirlos todos, en lugar de tirar hacia una interpretación genérica.
Donde se queda por detrás de las opciones solo comerciales es en la velocidad de generación y la resolución máxima. Modelos como Kling v3 o Veo 3.1 generan resultados más rápido y admiten clips más largos de forma nativa.
En resumen: si el acceso de código abierto, el potencial de ajuste fino y el realismo físico son prioridades, Hunyuan Video es la opción más sólida de su categoría. Si importan más la velocidad y la facilidad de uso, las alternativas comerciales son realmente competitivas.
Cómo usar Hunyuan Video en PicassoIA

La forma más accesible de generar videos con Hunyuan Video sin configurar hardware local es a través de la plataforma PicassoIA. El modelo está integrado directamente, lo que elimina la configuración de GPU y la gestión de dependencias que exige ejecutar los pesos en local.
Paso a paso en la plataforma
Paso 1. Abre la página del modelo Hunyuan Video en PicassoIA.
Paso 2. Escribe tu prompt de texto. Sé específico con el sujeto, el entorno, la iluminación y el movimiento. Los prompts vagos producen resultados genéricos.
Paso 3. Elige tu relación de aspecto. Usa 16:9 para escenas horizontales, 9:16 para contenido vertical o para redes sociales, 1:1 para formatos cuadrados.
Paso 4. Define el número de pasos de inferencia. Más pasos (40 a 50) dan más calidad a costa del tiempo de generación. Menos pasos (20 a 25) son más rápidos, pero pierden detalle fino.
Paso 5. Envía la solicitud y espera a que se renderice tu clip. El tiempo de generación varía según la carga de la cola y los ajustes que hayas elegido.
Paso 6. Revisa el resultado. Si el movimiento parece rígido, añade a tu prompt un lenguaje de movimiento más específico. Si el sujeto se desplaza, añade "fotorrealista, con coherencia temporal" al final del prompt.
Consejos de prompts que funcionan
💡 Una estructura de prompt fiable: [Sujeto] [Acción] en [Entorno], [Descripción de la iluminación], [Ángulo y movimiento de cámara], cinematográfico, fotorrealista, 8K.
Hay algunos patrones concretos que mejoran con regularidad los resultados de Hunyuan Video:
- Describe la dirección de la luz de forma explícita: "luz de la mañana desde la izquierda", "sol dorado cenital", "luz nublada suave y difusa"
- Nombra el comportamiento de la cámara: "empuje lento", "plano general fijo", "seguimiento suave a mano alzada"
- Ancla al sujeto: incluye la posición y la orientación del sujeto para reducir la deriva temporal entre fotogramas
- Usa frases descriptivas: Hunyuan Video gestiona mejor las descripciones completas de escenas que las listas de palabras clave sueltas
- Especifica el comportamiento de los materiales: indica si las telas deben ondear, si el agua debe rizarse o si el pelo debe moverse con el viento
Estos detalles no cuestan nada añadirlos a un prompt y elevan de forma notable el nivel mínimo de calidad que produce Hunyuan Video.
Qué casos de uso encajan mejor

Hunyuan Video no es igual de adecuado para todas las tareas de generación de video. Algunos casos de uso aprovechan directamente sus puntos fuertes.
Creadores de contenido y cineastas
Para los creadores que necesitan metraje físicamente realista, Hunyuan Video es actualmente una de las mejores opciones de código abierto disponibles. El contenido de estilo de vida, las escenas naturales, la visualización arquitectónica y las tomas de contexto de producto se benefician de su sólida simulación física de la luz, el movimiento y el comportamiento de los materiales.
Funciona especialmente bien en escenas que requieren presencia constante del sujeto. Una toma de producto en la que el sujeto y su entorno se mantienen estables durante toda la duración del clip es justo donde la ventaja de coherencia temporal de Hunyuan se nota con más claridad.
Para los creadores de contenido en redes sociales, el soporte de la relación de aspecto 9:16 lo hace directamente utilizable para video vertical de formato corto sin recortes ni reencuadres, un flujo de trabajo al que plataformas como Seedance 2.0 y Pixverse v5.6 también han dado prioridad.
Investigadores y desarrolladores
Los pesos abiertos hacen que Hunyuan Video sea especialmente valioso para el ajuste fino y la adaptación a dominios. La comunidad investigadora ya ha producido versiones con ajuste fino orientadas a estéticas visuales concretas, estilos de animación y dominios de contenido especializados. Ejecutar el modelo base en local permite a los investigadores construir sobre él de formas que las API cerradas no pueden soportar de raíz.
Los desarrolladores que integran video con IA en sus aplicaciones se benefician de la posibilidad de alojarlo ellos mismos, evitando costos por generación en la API a gran escala y manteniendo el control total del entorno de inferencia. Es una ventaja práctica real para cargas de trabajo en producción.
Flujos de trabajo de mejora de video
Hunyuan Video también encaja de forma natural en flujos de producción de video más amplios. Combínalo con un modelo de superresolución después de la generación para escalar la salida de 720p a 1080p o más. Úsalo junto con herramientas de mejora de video con IA para estabilización o reducción de ruido. La arquitectura abierta facilita la integración en el flujo de trabajo de formas que los modelos cerrados no pueden igualar.
Pruébalo tú mismo
La forma más rápida de ver lo que Hunyuan Video produce realmente es ejecutar un prompt directamente en PicassoIA. Escribe una escena detallada, especifica la iluminación y el ángulo de cámara, y compara el resultado con lo que obtienes con Kling v3, Wan 2.7 T2V o Veo 3.1. Ejecutar el mismo prompt en varios modelos es la forma más directa de entender qué hace distinto cada uno y de encontrar la herramienta adecuada para el tipo de contenido que creas.
Más allá del video, PicassoIA te da acceso a más de 90 modelos de texto a imagen, upscalers de superresolución, herramientas de eliminación de fondo y capacidades de sincronización labial, lo que lo convierte en un espacio de trabajo completo para la generación de contenido visual a cualquier escala.
Empieza con Hunyuan Video y descubre lo que pueden hacer 13 mil millones de parámetros de código abierto con tu idea.