Algo cambió en la comunidad de video con IA cuando el equipo de investigación Wan de Alibaba lanzó la versión 2.7 de su suite de generación de video. No por un único dato llamativo, sino porque el lanzamiento supone un trío: texto a video, imagen a video y un modo completamente nuevo de referencia a video, todo ello en un paquete de pesos abiertos que compite con modelos disponibles solo a través de APIs de pago. El revuelo en torno a Wan 2.7 está justificado.
Qué es realmente Wan 2.7
Tres modelos, no uno
El "2.7" no es un único modelo. Son tres capacidades distintas lanzadas juntas bajo el mismo número de versión:
- Wan 2.7 T2V: genera video en 1080p directamente a partir de un prompt de texto, sin necesidad de imagen de origen.
- Wan 2.7 I2V: toma una imagen fija y la anima para convertirla en un clip de video coherente.
- Wan 2.7 R2V: anima un sujeto concreto aislado de una foto de referencia, lo que da a los creadores un control preciso sobre qué se mueve y cómo.
Cada modo se orienta a un flujo de trabajo distinto. T2V sirve para crear solo a partir de prompts. I2V sirve para animar material visual que ya existe. R2V es la gran novedad, y es la pieza que más atención está captando entre cineastas y equipos de producto.
La base de 1080p importa
Antes de Wan 2.7, obtener una salida en 1080p desde un modelo de video de pesos abiertos exigía un postprocesado importante o pipelines de escalado sobre la generación original. Wan 2.7 T2V genera directamente en 1080p. Esto importa porque la resolución nativa conserva la coherencia temporal entre fotogramas de una forma que el escalado posterior no puede replicar. El desenfoque por movimiento, la nitidez de los bordes y el detalle fino de la textura se degradan cuando los fotogramas se escalan después de la síntesis. Cuando el modelo genera a resolución completa desde el primer fotograma, esos detalles se mantienen coherentes a lo largo de todo el clip.

Qué cambió de la 2.6 a la 2.7
La calidad del movimiento dio un paso adelante real
Wan 2.6 T2V y Wan 2.6 I2V ya eran modelos muy competentes, sobre todo en movimientos de cámara suaves y en revelaciones de escenas estáticas. Wan 2.7 cierra la brecha en el movimiento de los sujetos, que era el punto débil de la 2.6. Los personajes y objetos de los clips de Wan 2.7 mantienen sus proporciones de forma más constante a lo largo de los fotogramas, y los elementos que se mueven rápido muestran un parpadeo temporal notablemente menor que la versión anterior.
Wan 2.5 T2V requería una ingeniería de prompts cuidadosa para evitar el característico derretimiento de bordes que aparecía durante el movimiento complejo de los sujetos. La versión 2.7 resuelve esto con bastante menos intervención manual por parte del usuario.
R2V es una categoría diferente
La mayoría de los modelos de video con IA te ofrecen dos caminos: describir algo con texto o partir de una imagen. Wan 2.7 R2V añade un tercero: extraer un sujeto concreto de una foto de referencia y animarlo en una escena nueva. Tú aportas una imagen de una persona o de un producto, el modelo aísla ese sujeto y genera movimiento manteniendo su aspecto visual a lo largo de todo el clip.
Preservar la identidad, la textura y las proporciones en los fotogramas sintetizados exige que el modelo mantenga una representación interna detallada del sujeto de referencia. Wan 2.7 lo hace de forma fiable con sujetos estáticos y con sujetos de movimiento sencillo.
💡 R2V es especialmente útil para equipos de producto. Una sola foto de producto se convierte en un clip de presentación giratorio, sin sesión física en estudio ni plato giratorio.

Velocidad y eficiencia en 1080p
Una resolución más alta no siempre implica una generación proporcionalmente más lenta. La arquitectura de Wan 2.7 incorpora mejoras en el backbone de transformador de difusión que reducen el costo computacional por paso a 1080p en comparación con ejecutar un escalado ingenuo sobre una generación base de 720p. Esto mantiene los tiempos de generación en un rango práctico para flujos de trabajo iterativos, donde los creadores generan decenas de variaciones antes de quedarse con un clip final.
Cómo se compara Wan 2.7 con la competencia
El mercado del video con IA nunca había tenido tantas opciones. Esta es una valoración honesta de dónde gana Wan 2.7 y de dónde todavía le queda terreno por cubrir.
Wan 2.7 frente a Veo 3
Veo 3 y Veo 3.1 de Google generan audio sincronizado nativo junto con el video, algo que Wan 2.7 no hace. La calidad cinematográfica de Veo 3 es realmente excepcional, sobre todo en escenas exteriores con iluminación natural compleja. Pero Veo 3 es una API cerrada con costos por generación que se disparan con el volumen. Wan 2.7 tiene pesos abiertos, se puede usar en local o a través de plataformas como PicassoIA a un costo por clip considerablemente menor. Para los creadores que ejecutan cientos de iteraciones por proyecto, esa diferencia de costo suele ser decisiva.
Wan 2.7 frente a Sora 2
Sora 2 destaca en videos de mayor duración y en narrativas complejas con varias escenas. La fortaleza de Wan 2.7 son los clips cortos y precisos con control específico del sujeto. Si necesitas un video de 30 segundos con varias transiciones de escena y habla sincronizada, Sora 2 es la herramienta más sólida. Si necesitas un clip de 5 a 10 segundos de un producto o personaje concreto con movimiento controlable, Wan 2.7 es más práctico y bastante más asequible.
Wan 2.7 frente a Kling v2.6
Kling v2.6 de Kwai es posiblemente el competidor comercial más fuerte en el mismo nivel de calidad de movimiento. La coherencia de personajes de Kling va ligeramente por delante de Wan 2.7 en sujetos humanos con expresiones faciales complejas. Donde Wan 2.7 gana terreno es en la flexibilidad de código abierto y en el modo R2V, que Kling no ofrece en una forma equivalente. Kling v3, con sus funciones de control de movimiento, es excepcional, pero sigue siendo un producto solo de pago.

Wan 2.7 en la línea de tiempo de IA de Alibaba
De I2VGen a Wan
Alibaba lleva más tiempo en el espacio de la generación de video del que mucha gente cree. I2VGen-XL, publicado por el equipo de investigación ali-vilab, fue uno de los primeros intentos serios y de código abierto en la generación de imagen a video con coherencia estructural. La serie Wan retomó donde lo dejó I2VGen, adoptando una arquitectura de transformador de difusión que escala la resolución sin un aumento proporcional del cómputo.
Wan 2.1 1.3B introdujo el marco básico. Wan 2.2 I2V Fast añadió variantes optimizadas para la velocidad y el modo sincronizado con sonido Wan 2.2 S2V. Wan 2.5 T2V mejoró notablemente la coherencia temporal. Wan 2.6 T2V elevó el techo de resolución. La versión 2.7 convierte ahora R2V en una capacidad de primer nivel, lista para producción, junto con mejoras de calidad en todos los aspectos.

Happyhorse frente a Wan: objetivos distintos
Alibaba también mantiene la línea Happyhorse 1.1, que genera video de hasta 1080p a partir de texto o de imágenes. Mientras Happyhorse prioriza la suavidad cinematográfica del movimiento y la coherencia estilística en clips más largos, Wan prioriza la fidelidad del sujeto y el control preciso. No compiten dentro del ecosistema de Alibaba. Happyhorse es la herramienta de nivel de estudio para resultados cinematográficos suaves. Wan es la herramienta de control preciso para animación específica de sujetos. Happyhorse 1.0 sigue disponible para una generación más rápida con objetivos de resolución más bajos.
Cómo usar Wan 2.7 en PicassoIA
PicassoIA aloja directamente los tres modelos de Wan 2.7. No necesitas GPU local, ni gestionar claves de API, ni configuración alguna. Así funciona cada modo en la práctica.
Wan 2.7 T2V: de texto a 1080p
- Abre Wan 2.7 T2V en PicassoIA.
- Escribe un prompt detallado que describa la escena, el sujeto, la iluminación y el movimiento de cámara.
- Fija la duración del clip que quieras. De cinco a diez segundos ofrece la mejor coherencia temporal.
- Envía y recibe la salida en 1080p.
💡 Incluye indicaciones de cámara en tu prompt. "Dolly lento desde plano medio hasta primer plano" produce un movimiento bastante mejor que un prompt que solo describe el contenido estático de la escena.
Wan 2.7 I2V: anima cualquier foto
- Abre Wan 2.7 I2V en PicassoIA.
- Sube tu imagen de origen.
- Describe el movimiento: qué se mueve, en qué dirección y a qué velocidad.
- El modelo genera un clip que parte de tu imagen y crea un movimiento coherente a partir de ella.
Mejores entradas para I2V: fotos de alto contraste con un sujeto claro sobre un fondo bien definido. Las imágenes con bordes ambiguos necesitan prompts de movimiento más detallados para evitar artefactos temporales cerca de los límites del sujeto.

Wan 2.7 R2V: animación de sujetos específicos
- Abre Wan 2.7 R2V en PicassoIA.
- Sube una imagen de referencia del sujeto que quieres animar.
- Describe en detalle el movimiento deseado y el contexto de la escena.
- El modelo aísla el sujeto, conserva su aspecto y sintetiza el movimiento a su alrededor.
Lo que funciona bien en R2V: productos, personajes individuales, vehículos y animales con siluetas bien definidas. Lo que requiere escribir el prompt con cuidado: grupos de sujetos superpuestos o fondos muy texturizados que compitan visualmente con el sujeto principal por la atención del modelo.
Usos reales que sí funcionan
Clips para redes sociales a partir de fotos fijas
El uso más inmediato de Wan 2.7 I2V es convertir la biblioteca de fotos existente de una marca en contenido de video corto. Una foto de comida se convierte en una revelación cinematográfica lenta. Una foto de moda gana una animación sutil del movimiento de la tela. Una foto de viaje recibe una deriva de paralaje suave que se ve como video nativo en cualquier feed social. La barrera para el contenido de video de formato corto baja de forma notable cuando las imágenes fijas ya están disponibles.

Prototipado de cine y publicidad
Los directores usan Wan 2.7 T2V para la preproducción visual. Un movimiento de cámara complejo que llevaría medio día preparar en una localización puede probarse como un clip de 5 segundos en menos de un minuto. Si el encuadre funciona, el rodaje físico es más eficiente. Si no funciona, no se ha desperdiciado nada salvo un minuto de tiempo de cómputo. El modelo Wan 2.2 S2V también gestiona la animación guiada por sonido para previsualizaciones aproximadas de sincronización de audio.

Visualización de producto sin estudio
Los equipos de comercio electrónico ya usan Wan 2.7 R2V para generar vistas de producto giratorias a partir de una sola fotografía de estudio. Un reloj, una zapatilla, un frasco de crema: sube la referencia, describe la rotación y el modelo produce un clip de movimiento que, de otro modo, requeriría un plato giratorio dedicado y un videógrafo. El ahorro de costo y tiempo a escala no es marginal.

Por qué el enfoque de código abierto es central
El argumento del costo y del control
Las APIs de video cerradas cobran por segundo de contenido generado. A cualquier volumen de producción relevante, ese costo se acumula rápido. Un modelo de pesos abiertos como Wan 2.7 puede ejecutarse en una instancia de nube con GPU a un costo mensual fijo, o a través de plataformas como PicassoIA, que reparten el gasto de infraestructura entre muchos usuarios. Para estudios que generan cientos de clips por semana, la cuenta es sencilla: el acceso con pesos abiertos suele salir a un costo por clip un orden de magnitud más bajo que las alternativas de API cerrada.
Más allá del costo, los pesos abiertos permiten que la comunidad más amplia haga ajuste fino, extienda y adapte el modelo a casos de uso específicos. Los modelos cerrados solo mejoran cuando sus desarrolladores deciden invertir en un ciclo de actualización. Los modelos abiertos mejoran de forma continua porque los grupos de investigación, los desarrolladores independientes y los equipos comerciales aportan sus mejoras a la base compartida.

Ajuste fino para la coherencia de marca
Como los pesos de Wan 2.7 son públicos, el ajuste fino sobre estilos visuales concretos es viable para cualquier equipo con recursos de GPU modestos. Una productora podría entrenar un adaptador LoRA con su estilo propio y obtener clips visualmente coherentes en todos los activos generados con IA de su flujo de trabajo. Ese nivel de control de marca no es posible con ningún modelo de video cerrado disponible actualmente, sea cual sea el presupuesto.
💡 Los pesos abiertos también permiten la inferencia en local. Los estudios con requisitos estrictos de confidencialidad de la propiedad intelectual pueden ejecutar Wan 2.7 en local sin que ningún contenido salga de su red. Es un requisito indispensable en las categorías de contenido legal, médico y financiero, donde el uso de APIs en la nube está restringido.
La serie Wan de un vistazo
Para contextualizar la evolución de la serie, estas son las versiones clave de Wan disponibles en PicassoIA:
Prueba Wan 2.7 ahora mismo
El debate en torno a Wan 2.7 se debe a que la generación de video en 1080p con pesos abiertos y un modo dedicado de referencia a video es hoy una capacidad real y práctica. No es una vista previa de investigación. No hay lista de espera. Los modelos están disponibles, los resultados son reproducibles y puedes empezar a generar clips sin salir del navegador.
PicassoIA te da acceso directo a los tres modos:
- Wan 2.7 T2V: escribe un prompt y obtén un clip de 1080p.
- Wan 2.7 I2V: sube una foto, describe el movimiento y mira cómo cobra vida.
- Wan 2.7 R2V: usa una imagen de referencia para animar un sujeto concreto con su aspecto e identidad conservados.
Si quieres ir más allá de la generación de video, PicassoIA también aloja un conjunto completo de modelos de texto a imagen, escalado de superresolución, mejora de video con IA, sincronización labial y herramientas de generación de audio. Todo está disponible desde una sola plataforma en picassoia.com/en/all-models. La única pregunta es qué proyecto quieres hacer realidad primero.