La generación de video con IA de código abierto ha llegado a un punto en el que los resultados de los modelos gratuitos pueden sorprenderte de verdad. Wan 2.5, lanzado por el equipo Wan-Video de Alibaba, es uno de los modelos de video de código abierto más capaces que hay ahora mismo, y puedes ejecutarlo sin costo alguno si tienes el hardware necesario. Esta reseña cubre lo que ofrece Wan 2.5, dónde se queda corto, qué necesitas realmente para ejecutarlo y por qué usarlo a través de una plataforma es mucho más práctico que instalarlo en local.
Qué es realmente Wan 2.5
Wan 2.5 es una familia de modelos de difusión para video de código abierto, de texto a video e imagen a video. Alibaba publicó los pesos con una licencia permisiva, lo que significa que cualquiera puede descargarlos y ejecutarlos sin pagar por clip ni aceptar restricciones de salida más allá de las condiciones de uso básicas.

El "2.5" hace referencia a su lugar dentro de la línea de modelos Wan. Después de que Wan 2.1 sentara la base de código abierto y Wan 2.2 añadiera variantes rápidas y herramientas especializadas, Wan 2.5 llevó la resolución de salida y la coherencia temporal bastante más lejos. Los videos tienen un movimiento más fluido, menos parpadeo entre fotogramas y una mejor adherencia a los detalles del prompt que las generaciones anteriores.
La arquitectura es un modelo de difusión de video basado en transformers, parecido en espíritu a lo que sustenta los modelos comerciales. La diferencia es que los pesos están disponibles para alojarlos uno mismo. Los investigadores, desarrolladores y creadores que necesitan control total sobre su flujo de trabajo, o que no pueden enviar contenido a APIs de terceros, pueden ejecutar Wan 2.5 en sus propios equipos.
💡 Vale la pena saber: Wan 2.5 no es un único modelo. Es un conjunto que incluye variantes de texto a video e imagen a video, cada una con versiones estándar y rápidas para distintos presupuestos de hardware.
La línea que llevó hasta aquí
La serie Wan empezó como una de las pocas familias de modelos de video de código abierto que realmente seguían mejorando con cada versión en lugar de estancarse. Wan 2.1 ya destacaba por sus pesos gratuitos y una calidad aceptable. Wan 2.2 introdujo Wan 2.2 T2V Fast para flujos de trabajo en los que prima la velocidad. Wan 2.5 elevó de forma notable el techo de calidad, sobre todo en la suavidad del movimiento y la coherencia de la escena, y el más reciente Wan 2.7 T2V continúa esa evolución con soporte para 1080p.
Los modelos dentro de Wan 2.5
La familia Wan 2.5 cubre dos casos de uso principales: generar video a partir de un prompt de texto y animar una imagen fija para convertirla en un clip de video.

Texto a video (T2V)
Wan 2.5 T2V es la variante insignia de texto a video. Dale un prompt descriptivo y producirá clips con un movimiento coherente y una composición de escena sólida. Maneja una gran variedad de temas, desde paisajes hasta primeros planos, con un movimiento realista.
Wan 2.5 T2V Fast sacrifica una pequeña parte de la calidad visual a cambio de un tiempo de generación mucho menor. Para iterar y hacer prototipos rápidos, esta es la variante que conviene usar primero.
Imagen a video (I2V)
Wan 2.5 I2V toma una imagen fija y la anima. El movimiento que produce es fluido y, por lo general, respeta bien el contenido de la imagen original, lo que lo hace ideal para dar vida a fotos de producto o retratos.
Wan 2.5 I2V Fast es la versión acelerada, útil cuando necesitas vistas previas rápidas antes de lanzar un render a calidad completa.
Calidad real de la salida
Lo más importante que hay que entender sobre Wan 2.5 es que supera con mucho lo que cabría esperar de un modelo gratuito.

Lo que hace bien
La coherencia de movimiento es uno de sus puntos más fuertes. Los personajes y los objetos se mueven de forma constante a lo largo de los fotogramas, sin las deformaciones ni los artefactos de derretimiento que lastraban a los primeros modelos de video de código abierto. Una persona que camina mantiene sus proporciones. Una cascada fluye en una sola dirección sin invertirse a mitad del clip.
La fidelidad al prompt es sólida en escenas sencillas o moderadamente complejas. Describe a una mujer caminando por una calle lluviosa de noche y, en líneas generales, eso es lo que obtienes, incluida la lluvia, la luz reflejada en el pavimento mojado y el entorno urbano.
La calidad de textura aguanta bastante bien en los planos de detalle. Telas, piel y superficies naturales se renderizan con un detalle fino plausible, en lugar del borrón difuminado que se ve en los modelos de código abierto de gama baja.
La variedad de escenas es mayor de lo que cabría esperar. Wan 2.5 maneja tanto prompts fotorrealistas como estilizados, escenas de naturaleza, interiores y movimiento abstracto, sin necesidad de ajustes finos separados.
Donde flaquea
- Escenas complejas con varios personajes: Dos o más personas interactuando tienden a producir incoherencias anatómicas, sobre todo en las manos
- Clips largos: La coherencia se degrada después de unos pocos segundos, en especial con movimientos rápidos o complejos
- Texto en el encuadre: Como la mayoría de los modelos de video, Wan 2.5 no puede renderizar de forma fiable texto legible dentro de una escena
- Control preciso de la cámara: Aunque el modelo sigue indicaciones generales de escena, los movimientos de cámara específicos como dolly, rack focus o grúa son irregulares
- Escenas con poca luz: Los entornos oscuros tienden a producir resultados más ruidosos y menos estables
💡 Consejo profesional: Para obtener los mejores resultados con Wan 2.5, centra tu prompt en un único sujeto y una sola acción. Los prompts largos y complejos suelen producir un movimiento confuso en lugar de una complejidad por capas.
Qué hardware necesitas
Aquí es donde muchos se topan con un límite al alojar Wan 2.5 en local. El modelo es gratuito en cuanto a licencia, pero exige hardware de GPU serio.

Requisitos de VRAM
| Configuración | VRAM mínima | VRAM práctica | Notas |
|---|
| Wan 2.5 T2V (1.3B) | 8 GB | 12 GB | Resolución reducida |
| Wan 2.5 T2V (14B) | 16 GB | 24 GB | Salida a calidad completa |
| Wan 2.5 I2V | 16 GB | 24 GB | La imagen de entrada añade carga de VRAM |
| Variantes rápidas (cuantizadas) | 8 GB | 16 GB | Contrapartida de calidad con 8 GB |
El modelo de 14B parámetros, que produce los mejores resultados, está básicamente fuera del alcance de las GPU de consumo con menos de 20 GB de VRAM. Una RTX 4090 con 24 GB puede ejecutarlo, pero los tiempos de generación siguen siendo considerables, a menudo de varios minutos por clip corto.
Inferencia en CPU
La inferencia en CPU es técnicamente posible, pero no es práctica. Espera tiempos de generación de 30 minutos o más por clip, lo que la hace inservible para cualquier flujo de trabajo real.
La alternativa en la nube
Este límite de hardware es la razón por la que el enfoque basado en plataforma resulta tan atractivo. Servicios como PicassoIA ejecutan estos modelos en infraestructura de GPU profesional y los ofrecen a través de una interfaz en el navegador. Obtienes la calidad de salida de Wan 2.5 sin tener ni alquilar el hardware tú mismo.
Wan 2.5 frente a competidores de pago
Wan 2.5 aguanta sorprendentemente bien frente a algunos modelos que cuestan dinero real por cada generación.

Los modelos comerciales ganan en resolución, generación de audio y pulido general de los resultados. Pero para clips cortos, escenas de naturaleza, movimiento abstracto y videos de un solo sujeto, Wan 2.5 produce resultados realmente competitivos. El hecho de que sea de costo cero lo convierte en el punto de partida correcto para muchos flujos de trabajo, sobre todo cuando el entregable final no requiere 1080p ni audio nativo.
Cuándo quedarte con Wan 2.5
Wan 2.5 tiene sentido cuando:
- Necesitas generar mucho volumen sin costos por clip
- Tu proyecto exige privacidad de datos y no puedes enviar contenido a APIs comerciales
- Estás haciendo prototipos y quieres iterar rápido antes de comprometerte con generaciones de pago
- El resultado se usará en tamaños pequeños donde 720p es suficiente
Cuándo pasar a un modelo de pago
Cambia a un modelo de pago como Kling v2.6 o Veo 3 cuando:
- Necesitas 1080p o más para emisión o uso premium
- Tu escena requiere un movimiento de cámara preciso o interacción entre varios personajes
- La sincronización de audio nativa forma parte del entregable
Cómo usar Wan 2.5 en PicassoIA
Como Wan 2.5 está disponible directamente en PicassoIA, puedes saltarte todo el proceso de instalación en local. Sin entorno de Python, sin drivers de CUDA, sin esperar a una larga instalación de dependencias.

Paso 1: elige tu variante
Ve a la página del modelo Wan 2.5 T2V para la generación de texto a video. Para animar una imagen existente, usa Wan 2.5 I2V. Si quieres resultados rápidos mientras ajustas tu prompt, empieza con Wan 2.5 T2V Fast o Wan 2.5 I2V Fast.
Paso 2: escribe un prompt concreto
El modelo responde mejor a prompts específicos y orientados a la escena. Estructura el tuyo en torno a:
[Sujeto] + [Acción] + [Entorno] + [Iluminación o cámara]
Ejemplo: "Una mujer con un abrigo rojo caminando por un bosque de otoño, hojas cayendo a su alrededor, luz cálida de última hora de la tarde desde la derecha, movimiento de cámara lento y constante."
Evita acumular demasiados eventos simultáneos. Una acción clara en un escenario claro produce un movimiento más coherente que un prompt que describe cinco cosas ocurriendo a la vez.
Paso 3: ajusta tus parámetros
- Duración: de 4 a 5 segundos es el punto ideal para la calidad y la coherencia de Wan 2.5
- Semilla: fija la semilla si quieres repetir la generación con ligeras variaciones del prompt y comparar los resultados lado a lado
- Relación de aspecto: 16:9 para contenido horizontal, 9:16 para formatos verticales de redes sociales
Paso 4: revisa e itera
Ejecuta primero la variante rápida. Si la composición y la dirección del movimiento son correctas, cambia al modelo estándar para el render final. Este enfoque ahorra bastante tiempo frente a ir directamente a la calidad completa en cada iteración.
💡 Consejo: Para imagen a video con Wan 2.5 I2V, usa imágenes de origen de alta calidad y bien iluminadas. Las entradas borrosas o de bajo contraste producen un movimiento inestable en el clip de salida.
Los límites que conviene conocer
Wan 2.5 es impresionante para un modelo de código abierto, pero hay restricciones reales que afectan a si encaja con los requisitos de tu proyecto.

Límite de duración
Los clips de Wan 2.5 llegan como mucho a unos 5 segundos de forma nativa. Para contenido más largo, tienes que generar varios segmentos y unirlos en postproducción, lo que introduce problemas de continuidad en los puntos de corte, salvo que planifiques cada segmento con cuidado.
Sin audio nativo
A diferencia de Veo 3 o Seedance 1 Pro, Wan 2.5 genera video sin sonido. Necesitarás generación de audio aparte y sincronización en postproducción si tu proyecto requiere diseño de sonido o música.
Techo de resolución
La familia base de Wan 2.5 funciona a 720p. Los modelos comerciales ofrecen habitualmente 1080p, y algunos, como LTX 2 Pro, ya ofrecen salida en 4K. Para contenido de redes sociales que se ve en teléfonos, 720p suele ser suficiente. Para emisión o usos premium, puede no alcanzar el nivel exigido. Los más recientes Wan 2.7 T2V y Wan 2.7 I2V lo abordan con soporte para 1080p.
Coherencia entre varios clips
Si necesitas que un personaje aparezca de forma coherente en varias generaciones, Wan 2.5 no tiene ningún bloqueo integrado de identidad o estilo. Cada generación es independiente. Los modelos comerciales con funciones de referencia de sujeto gestionan la coherencia de personajes entre varios clips de forma mucho más fiable.
Qué probar en PicassoIA ahora mismo
La forma más sencilla de trabajar con Wan 2.5 es a través de PicassoIA, donde puedes acceder a Wan 2.5 T2V y Wan 2.5 I2V directamente en tu navegador, junto con el resto de los principales modelos de video en un solo lugar.

La ventaja de trabajar así es que no estás atado a un único modelo. Si Wan 2.5 no termina de dar lo que necesitas para una escena concreta, puedes cambiar al instante a Wan 2.7 T2V para una mejor resolución, Kling v2.6 para un movimiento cinematográfico o Hailuo 02 para un perfil de calidad distinto, todo desde la misma interfaz y sin cambiar de plataforma.
Para los flujos de trabajo que parten de imágenes fijas, la combinación de los modelos de texto a imagen de PicassoIA y Wan 2.5 I2V Fast crea una cadena completa de imagen fija a movimiento. Genera un fotograma fotorrealista y después anímalo en un clip. Todo el proceso lleva minutos en el navegador.

Wan 2.5 no es la última palabra en calidad de video con IA, pero es la opción gratuita más capaz que hay ahora mismo. Produce resultados reales, maneja una amplia variedad de temas y funciona sin suscripción. Empieza con la variante rápida para hacer el prototipo de tu escena, pasa al modelo estándar para los renders finales y usa la página de Wan 2.5 T2V en PicassoIA para generar tu primer clip en minutos sin tocar ni un solo archivo de configuración.