Wan 2.7: el último modelo de video de IA de Alibaba que necesitas conocer

Wan 2.7 es el último modelo de video de IA de pesos abiertos de Alibaba, y reúne en una sola versión las capacidades de texto a video, imagen a video y referencia a video. Este artículo explica qué lo diferencia, cómo se compara con los rivales comerciales y cómo usar los tres modos en flujos de trabajo creativos reales.

Wan 2.7: el último modelo de video de IA de Alibaba que necesitas conocer
Cristian Da Conceicao
Fundador de Picasso IA

Wan 2.7 no llegó con una gira de presentación. Se lanzó como un modelo del equipo de investigación de Alibaba con tres capacidades distintas integradas en una sola versión, y en cuestión de horas empezaron a llegar los benchmarks de investigadores que ya habían descargado los pesos y estaban haciendo pruebas. Esa acogida dice algo importante sobre la serie Wan: se ha ganado una atención seria en la comunidad de video de IA de código abierto.

La serie Wan es la familia de modelos de generación de video más destacada de Alibaba, desarrollada en su división de investigación en IA. Mientras que muchas empresas tecnológicas chinas se han centrado en herramientas de video cerradas y solo accesibles por API, Alibaba tomó un camino distinto con Wan: publicó los pesos del modelo de forma abierta y dejó que la comunidad investigadora construyera sobre ellos. Wan 2.7 continúa esa tradición y da un salto importante en resolución, calidad de movimiento y versatilidad.

Editor de video profesional trabajando en un montaje de producción cinematográfica

Qué cambió en la 2.7

La generación anterior, Wan 2.6 T2V, ya era capaz de generar texto a video en 720p y de animar imágenes. Wan 2.7 eleva el listón en tres aspectos concretos:

  • Salida nativa en 1080p en los tres modos de generación
  • Mejor coherencia temporal, lo que significa menos temblores y deriva en clips más largos
  • Referencia a video como función de primer nivel, no como un añadido posterior

💡 La coherencia temporal es lo que separa el video de IA de calidad profesional de los clips parpadeantes e irregulares que hicieron que las primeras herramientas de texto a video parecieran un simple truco de fiesta. Wan 2.7 se la toma muy en serio.

Las mejoras de arquitectura se centran en la base de difusión de video, que ahora gestiona secuencias de tokens más largas con más eficiencia. En la práctica, el resultado son transiciones de movimiento más suaves, mejor coherencia del sujeto entre fotogramas y más detalle en texturas complejas como el cabello, la tela y las superficies de agua.

El linaje de Wan

Conviene entender en qué punto de la progresión encaja la 2.7. La serie ha avanzado deprisa:

VersiónResoluciónCaracterística principal
Wan 2.1480p / 720pBase sólida de código abierto
Wan 2.2720pVariantes rápidas, soporte de sincronización de audio
Wan 2.5720p-1080pMejor movimiento, mejoras en I2V
Wan 2.61080pCalidad refinada, variante flash
Wan 2.71080pT2V + I2V + R2V, versión completa

Cada iteración ha construido sobre la anterior en lugar de reemplazarla. La variante Wan 2.2 I2V Fast sigue teniendo un uso muy válido cuando necesitas velocidad por encima de la máxima calidad. Wan 2.7 es el nivel premium.

Centro de datos de gran escala que da soporte a la infraestructura de generación de video con IA

Tres modos en una sola versión

La mayoría de los modelos de generación de video se especializan. Hacen texto a video o animan imágenes, pero rara vez ambas cosas a un buen nivel. Wan 2.7 incluye tres modos distintos que cubren los flujos de trabajo de generación de video más habituales sin que tengas que cambiar de herramienta.

Texto a video (T2V)

Wan 2.7 T2V toma un prompt de texto y devuelve un clip de video completo en 1080p. El modelo gestiona el movimiento de cámara, el movimiento del sujeto y la composición de la escena solo a partir del prompt. Los resultados son notablemente más nítidos que los de las versiones anteriores de Wan, con mejor manejo de elementos complejos del prompt como las escenas con multitudes, los efectos meteorológicos y los entornos arquitectónicos.

En prompts que implican movimiento físico, como agua que fluye, fuego o tela movida por el viento, la 2.7 muestra la mejora más clara respecto a sus predecesores. El movimiento cercano a la física resulta más creíble.

Imagen a video (I2V)

Wan 2.7 I2V anima una imagen fija que tú proporcionas. Es el modo que más se usa en flujos de trabajo reales, porque te da un control preciso sobre el fotograma inicial. No estás adivinando cómo es la escena. La traes tú.

La versión 2.7 maneja casos límite que hacían tropezar a los modelos anteriores: rostros con iluminación poco habitual, escenas con varios sujetos superpuestos y tomas arquitectónicas con patrones geométricos repetitivos. Todo ello ha sido históricamente difícil en la animación de imágenes, porque el modelo necesita inferir la profundidad y el movimiento sin ver el fotograma anterior ni el posterior.

💡 Para obtener mejores resultados con I2V, usa imágenes de origen de alta resolución con sujetos principales claros. Wan 2.7 interpreta la profundidad implícita de la imagen y la usa para generar un movimiento de paralaje realista.

Referencia a video (R2V)

Wan 2.7 R2V es el modo que más debate está generando. Tú proporcionas una imagen de referencia de un personaje u objeto, y el modelo genera un video con ese sujeto en una nueva escena o contexto de movimiento. No es animación de imágenes. Es extracción del sujeto combinada con generación de escena.

Esto tiene aplicaciones evidentes en publicidad, en narrativas centradas en personajes y en cualquier caso en el que necesites una identidad visual coherente a lo largo de varios clips de video.

Director creativo revisando la reproducción de un video en un monitor de producción

Por qué importa la salida en 1080p

El salto a la salida nativa en 1080p suena a un punto más de una ficha técnica. En la práctica, cambia lo que realmente puedes hacer con el video generado por IA.

Resolución frente a calidad

Hay una distinción que merece la pena hacer: la resolución y la calidad perceptual no son lo mismo. Los primeros modelos de video de IA en 1080p escalaban internamente y entregaban resultados nítidos pero visualmente irregulares. Wan 2.7 renderiza de forma nativa en 1080p, lo que significa que los detalles finos están realmente ahí y no son interpolados. Los mechones de pelo, el texto de fondo, los patrones del tejido: todo aguanta a tamaño completo.

En 720p, el video de IA funciona bien para miniaturas web, vistas previas en redes sociales y previsualizaciones aproximadas. Con la calidad mínima de Wan 2.7 en 1080p, la salida pasa a ser viable para material de relleno de emisión, contenido de YouTube, videos de presentación y trabajos comerciales de formato corto.

Coherencia del movimiento entre fotogramas

Lo otro que 1080p obliga al modelo a resolver bien es la coherencia del movimiento. En resoluciones más bajas, las pequeñas incoherencias entre fotogramas se ven menos. En 1080p, que el cabello de un sujeto cambie de longitud entre fotogramas, o que una mano parpadee y se salga de proporción, se nota de inmediato.

Las puntuaciones de coherencia del movimiento de Wan 2.7 en los benchmarks estándar están entre las más altas de cualquier modelo de video de pesos abiertos publicado hasta la fecha. Eso se aprecia en la estabilidad de las salidas de un fotograma a otro, y no solo en una cifra de benchmark anunciada.

Objetivo de cámara de cine profesional que muestra precisión óptica

Cómo se compara con los rivales

El espacio del video con IA se ha vuelto realmente competitivo. Para comparar Wan 2.7 de forma honesta hay que fijarse en lo que cada modelo hace realmente bien.

Wan 2.7 frente a modelos comerciales cerrados

Kling v3 de Kuaishou y Veo 3 de Google son los referentes actuales en generación de video comercial cerrada. Ambos producen resultados excelentes. Sora 2 de OpenAI maneja mejor que la mayoría de competidores el video narrativo de larga duración en este momento.

Esto es lo que diferencia a Wan 2.7:

FactorWan 2.7Modelos comerciales
Pesos del modelo disponiblesSí (abiertos)No
Ajuste fino personalizado posibleSíNo
Referencia coherente del sujetoSólida (R2V)Varía
Costo por generaciónBajo (autoalojado)Pago por uso
Salida nativa en 1080pSíSí (la mayoría)
Generación de audio nativaNoAlgunos (Veo 3, Sora 2)

El audio es la carencia más clara de Wan 2.7 frente a los modelos cerrados. Veo 3 y Hailuo 02 generan audio sincronizado de forma nativa. Wan 2.7 no lo hace. Para flujos de trabajo en los que importan la música o el sonido ambiental, necesitarás un pipeline de audio aparte o un modelo distinto.

El código abierto como ventaja real

La naturaleza de pesos abiertos de Wan 2.7 merece tomarse en serio como una función, no solo como una cuestión de costo. Hacer ajuste fino del modelo con estilos visuales propios, integrarlo en pipelines personalizados, desplegarlo en entornos sin conexión o aplicar adaptaciones LoRA para sujetos concretos: nada de esto es posible con modelos cerrados. Wan 2.7 es realmente extensible de formas en las que no lo son Seedance 2.0 ni sus contemporáneos cerrados.

Espacio de trabajo de un creador de contenido optimizado para la producción de video

Casos de uso que sí funcionan

Creadores de contenido y video para redes sociales

El video de formato corto es el encaje más evidente. Wan 2.7 T2V genera clips de 5 a 10 segundos muy atractivos a partir de prompts de texto, que es justo la duración que necesitan las portadas para redes sociales, las secuencias de introducción y los insertos de material de relleno. La salida en 1080p significa que no hay artefactos de escalado al publicar en plataformas que ya admiten 1080p60 de forma nativa.

Para creadores de contenido, el flujo de trabajo más útil de inmediato es I2V: toma una gráfica estática o un recurso fotográfico que ya tengas, anímalo con Wan 2.7 y ten una versión en movimiento en cuestión de minutos.

Previsualización en la producción de cine

La previsualización, es decir, esbozar los planos antes del rodaje principal, ha requerido tradicionalmente, o bien un artista 3D experimentado, o bien un estudio externo caro. Wan 2.7 no sustituye por completo a ninguno de los dos. Pero para comunicar rápidamente el ángulo de cámara, el movimiento del sujeto y el bloqueo aproximado de la escena a un director o a un director de fotografía, la previsualización con video de IA se ha vuelto realmente útil con el nivel de calidad de la 2.7.

El modo R2V resulta especialmente relevante aquí: puedes tomar una imagen de referencia de un actor o de una localización y generar ideas de escena con esa identidad visual concreta intacta.

Video de producto y marketing

Las demostraciones de producto, las imágenes de estilo de vida de marcas y el material de relleno para marketing son áreas en las que la relación calidad-costo de Wan 2.7 resulta muy atractiva. Una toma de producto con movimiento básico, una escena de estilo de vida con el producto integrado o un plano de establecimiento de una localización: todo ello se logra a partir de prompts o imágenes de referencia en 1080p, sin un presupuesto completo de producción de video.

Hardware de GPU de alto rendimiento que hace posible la generación de video con IA

Cómo usar Wan 2.7 en PicassoIA

PicassoIA aloja las tres variantes de Wan 2.7, así que puedes usarlas sin necesidad de montar una infraestructura de GPU local. Así se usa cada una de forma eficaz.

Usar Wan 2.7 T2V

  1. Ve a Wan 2.7 T2V en PicassoIA
  2. Escribe un prompt de texto detallado que describa tu escena, incluyendo el sujeto, el entorno, la iluminación y la dirección del movimiento
  3. Fija la duración (5 o 10 segundos) según tu caso de uso
  4. Selecciona la salida en 1080p para obtener la máxima calidad
  5. Envía la solicitud y espera unos 60-90 segundos a que se genere

Consejo para el prompt: Wan 2.7 T2V responde bien a los términos de dirección de cámara. Frases como "paneo lento a la izquierda", "retroceso aéreo" o "plano medio estático" influyen de forma notable en el movimiento de cámara del resultado.

Usar Wan 2.7 I2V

  1. Ve a Wan 2.7 I2V en PicassoIA
  2. Sube tu imagen de origen (idealmente en 1080p o en una resolución superior)
  3. Añade un prompt de guía de movimiento que describa qué debe moverse y cómo
  4. Mantén el prompt de movimiento corto y concreto, por ejemplo: "la cámara avanza lentamente, las hojas se mueven suavemente"
  5. Genera y revisa el clip a resolución completa antes de descargarlo

Consejo de parámetros: si tu imagen tiene una línea de horizonte marcada, el modelo la interpreta de forma natural como una oportunidad para un travelling o un acercamiento. Evita cargar el prompt de movimiento con indicaciones contradictorias.

Usar Wan 2.7 R2V

  1. Ve a Wan 2.7 R2V en PicassoIA
  2. Sube tu imagen de referencia del sujeto (funciona mejor con un fondo limpio o un sujeto bien aislado)
  3. Escribe un prompt de escena que describa dónde y cómo quieres que aparezca el sujeto
  4. Sé específico con el movimiento: "el sujeto camina hacia delante por una calle empedrada, con luz de tarde desde la izquierda"
  5. Revisa la coherencia entre la referencia y el personaje generado a lo largo de todo el clip

💡 R2V funciona mejor cuando tu imagen de referencia tiene una definición del sujeto clara y marcada. Una fotografía de alto contraste con un fondo sencillo le da al modelo la señal más limpia con la que trabajar.

Dos profesionales colaborando sobre una interfaz de producción de video

Los límites reales de Wan 2.7

Una evaluación honesta importa más que el bombo publicitario.

Con lo que tiene dificultades

Los clips largos con continuidad narrativa siguen siendo difíciles. Wan 2.7 genera clips de entre 5 y 10 segundos con eficacia. Un video de 60 segundos con personajes coherentes que se mueven por una trama coherente no es para lo que está pensado este modelo. Ese sigue siendo un problema sin resolver en la mayoría de los modelos de video de pesos abiertos de esta generación.

El renderizado de texto dentro del video es deficiente. Cualquier flujo de trabajo que requiera texto legible en pantalla debería usar composición posterior, en lugar de confiar en que el modelo lo genere.

El movimiento extremo, incluidos los deportes rápidos, los cortes de cámara bruscos y la acción con muchos fotogramas por segundo (fps), produce más artefactos que el trabajo de cámara más lento y reflexivo, que es donde Wan 2.7 brilla de verdad. Trabaja con las fortalezas del modelo en lugar de en su contra.

Cuándo usar alternativas

Para una generación rápida con exigencias de calidad más bajas, Wan 2.2 T2V Fast sigue mereciendo la pena. Es notablemente más rápido a costa de algo de calidad. Para generación de audio nativo, Veo 3 o Hailuo 02 son las opciones adecuadas. Para la animación impulsada por audio en concreto, Wan 2.2 S2V maneja bien la generación de video sincronizado con sonido.

Pantalla de monitor mostrando una salida de video de IA vívida y cinematográfica

Empieza a crear video con IA ahora

Wan 2.7 es el modelo de video de pesos abiertos más potente que hay ahora mismo, con una combinación de resolución, versatilidad y coherencia que hasta ahora no existía en este rango de precio. El lanzamiento en tres modos cubre la gran mayoría de los flujos de trabajo creativos reales sin necesidad de una herramienta distinta para cada tarea.

La forma más rápida de ver lo que hace es probarlo. PicassoIA te da acceso directo a las tres variantes de Wan 2.7 sin necesidad de ninguna configuración local: sin GPU, sin pesos de modelo que descargar, sin archivos de configuración. Escribes un prompt o subes una imagen, y recibes video de IA en 1080p en menos de dos minutos.

Prueba Wan 2.7 T2V para generar video a partir de un prompt de texto, Wan 2.7 I2V para animar una imagen fija que ya tengas, o Wan 2.7 R2V para colocar un sujeto concreto en una escena completamente nueva. El nivel mínimo de calidad para la generación de video de código abierto ha subido de forma notable con este lanzamiento. Nunca ha habido un momento mejor para ponerlo a trabajar.

Equipo de una agencia creativa trabajando al atardecer con el skyline de la ciudad de fondo

Compartir este artículo

Elige tu idioma