Referencia a video en Wan 2.7: cómo funciona realmente

Wan 2.7 es el modelo de generación de video de código abierto más capaz de 2027 y ofrece tres modos distintos: texto a video, imagen a video y referencia a video. Este artículo explica cómo funciona cada modo por dentro, qué hace que la coherencia temporal se mantenga entre fotogramas y cómo usar las tres versiones en PicassoIA para producir video cinematográfico en 1080p a partir de cualquier punto de partida.

Referencia a video en Wan 2.7: cómo funciona realmente
Cristian Da Conceicao
Fundador de Picasso IA

Wan 2.7 no es solo otra actualización incremental de un modelo existente. Representa un cambio arquitectónico real en la forma en que la generación de video de código abierto maneja, a la vez, el movimiento, la fidelidad del sujeto y la coherencia temporal. Tanto si partes de un prompt de texto, de una imagen fija o de un sujeto de referencia, los resultados están en otra liga respecto a lo que producían las series 2.1 y 2.5. Este artículo desglosa cómo funciona realmente cada uno de los tres modos de Wan 2.7, para que sepas exactamente qué darle al modelo y por qué.

Qué es Wan 2.7 realmente

Un ingeniero de software estudiando diagramas de redes neuronales y secuencias de fotogramas de video en una pantalla transparente de pared en un laboratorio moderno

Wan 2.7 es un modelo de generación de video basado en difusión, desarrollado por Wan Video. Pertenece a la misma familia que Wan 2.1, 2.2, 2.5 y 2.6, pero introduce un enfoque sustancialmente revisado de la atención entre fotogramas y el modelado del movimiento. El resultado es una coherencia de sujetos muy superior, un movimiento de cámara más natural y una resolución 1080p más nítida que cualquier versión anterior.

Lo que lo diferencia es que las tres variantes comparten una base común, pero se especializan en la capa de condicionamiento. Esa única decisión de arquitectura explica por qué T2V, I2V y R2V resultan coherentes entre sí en lugar de parecer tres herramientas desconectadas.

Tres modos, una arquitectura

La familia Wan 2.7 incluye tres variantes distintas:

  • Wan 2.7 T2V: Genera video solo a partir de un prompt de texto, con una salida objetivo de 1080p.
  • Wan 2.7 I2V: Toma una imagen fija como primer fotograma y la anima hacia adelante en el tiempo.
  • Wan 2.7 R2V: Acepta una imagen de referencia de un sujeto específico y anima ese sujeto dentro de una escena nueva descrita por un prompt de texto.

Cada modo responde a un flujo de trabajo creativo distinto. T2V sirve para crear conceptos desde cero. I2V da vida a fotos existentes. R2V resuelve el problema más difícil: mantener coherente a un personaje o un objeto concreto mientras se coloca en un contexto completamente nuevo.

Qué cambió respecto a las versiones anteriores

La serie Wan 2.5 (T2V, I2V) ya producía video creíble en 720p. La generación 2.6 (T2V, I2V) dio el salto a calidad HD. Wan 2.7 añade tres cosas que ninguna de las versiones previas tenía en combinación: una vía de condicionamiento R2V dedicada, ventanas de atención temporal mejoradas que reducen el parpadeo en secuencias largas y un prior de movimiento de mayor fidelidad, entrenado con metraje cinematográfico y no solo con video de la web.

Cómo funciona el modo T2V

Primer plano desde arriba de unas manos escribiendo un prompt detallado para generar video en un teclado mecánico, con fotos de referencia sobre el escritorio

Texto a video es el punto de entrada más intuitivo. Describes lo que quieres ver y el modelo produce una secuencia de fotogramas que lo refleja. Pero el mecanismo que hay debajo es más interesante de lo que sugiere ese resumen.

Del texto a los fotogramas en movimiento

Wan 2.7 T2V funciona como un modelo de difusión latente con una columna vertebral de eliminación de ruido basada en transformadores. Cuando envías un prompt, primero pasa por un codificador de texto basado en un modelo de lenguaje grande, que convierte tus palabras en una representación vectorial densa. Esa representación condiciona todo el proceso de eliminación de ruido.

El modelo no genera los fotogramas uno a uno. Genera todos los fotogramas a la vez en un espacio latente comprimido y, al final, decodifica ese bloque latente en píxeles. Este enfoque de secuencia completa es la razón por la que maneja el movimiento de forma mucho más natural que los modelos de video autorregresivos: puede atender a la información del fotograma 12 mientras decide cómo debe verse el fotograma 3, en lugar de estar atado a una secuencia estricta de izquierda a derecha.

💡 Consejo práctico: Wan 2.7 T2V responde bien a las descripciones de movimiento de cámara. Frases como "traveling lento hacia adelante", "panorámica suave a la derecha con cámara en mano" o "plano general estático" influyen de forma notable en el resultado, no solo las descripciones del sujeto.

De dónde viene la coherencia temporal

Una tira de película sobre una caja de luz que muestra seis fotogramas secuenciales de un valle de montaña con iluminación y posición del personaje coherentes

La coherencia temporal es lo más difícil de lograr en la generación de video, y es donde Wan 2.7 supera con más claridad a Wan 2.2 T2V Fast y a variantes anteriores como Wan 2.1.

El modelo usa un mecanismo de atención 3D que opera a la vez sobre las dimensiones espaciales y la dimensión temporal. Cada "parche" del video presta atención a los parches vecinos del fotograma y a la misma ubicación espacial en los fotogramas adyacentes. Esto es costoso desde el punto de vista computacional, pero obliga al modelo a mantener texturas, iluminación e identidad del sujeto coherentes a lo largo de todo el clip, en lugar de optimizar cada fotograma por separado.

El resultado práctico: los rostros no parpadean, el pelo no cambia de color al azar entre fotogramas y los elementos del fondo permanecen anclados. Las versiones anteriores necesitaban prompts negativos específicos para combatir estos artefactos. Con Wan 2.7, son raros en lugar de ser lo habitual.

Cómo funciona el modo I2V

Manos de un fotógrafo sosteniendo una fotografía impresa de un lago al atardecer, junto a un monitor que muestra la misma escena animada con ondas en el agua

La generación de imagen a video plantea una pregunta distinta a la de T2V: dado este punto de partida visual exacto, ¿cuál es una continuación plausible? Wan 2.7 I2V está diseñado específicamente para esto, y su arquitectura de condicionamiento difiere de forma notable de la de T2V.

Tu imagen como primer fotograma

Cuando aportas una imagen de origen, Wan 2.7 I2V la codifica a través de un codificador visual independiente, no del codificador de texto, para extraer representaciones profundas de características, y luego concatena esas características con el latente con ruido en cada paso de eliminación. No es simplemente "empieza el video desde esta imagen" en un sentido ingenuo. El modelo consulta continuamente el mapa de características de tu imagen durante toda la generación, por eso, incluso en escenas con movimiento complejo, la apariencia original del sujeto se mantiene en gran medida intacta.

El prompt de texto que añades sobre la imagen actúa como controlador de movimiento y dirección. Le indica al modelo qué debe ocurrir en la escena, mientras que la imagen le indica cómo debe verse la escena.

Cómo se sintetiza el movimiento

El modelo se ha entrenado con datos emparejados: clips de video reales en los que se usaron fotogramas concretos como entradas de condicionamiento. Este régimen de entrenamiento le enseña la física natural del movimiento. El agua debe rizarse hacia afuera, el pelo debe moverse en una dirección coherente y las expresiones faciales deben cambiar con suavidad. El prior de movimiento integrado en el modelo actúa como regularizador que mantiene el movimiento generado con aspecto natural, incluso cuando tu prompt es abstracto.

💡 Consejo práctico: En I2V, las descripciones de movimiento cortas funcionan mejor que las largas. "El pelo se mueve suavemente hacia la izquierda, sonrisa leve, cámara estática" supera a un prompt de varias cláusulas que describe acciones simultáneas y en competencia. Las instrucciones de movimiento más simples dan más margen al prior de movimiento aprendido por el modelo.

El modo R2V es la verdadera novedad

Joven creador de contenido sosteniendo una foto de referencia mientras la pantalla de detrás muestra al mismo sujeto animado en un parque

Si T2V es cómodo e I2V es potente, Wan 2.7 R2V es el modo que resuelve un problema que los otros dos no podían resolver. La referencia a video toma una foto de una persona, animal u objeto concreto y anima ese sujeto dentro de una escena nueva que describes con un prompt de texto. La identidad visual del sujeto se conserva, aunque el fondo, la iluminación y el movimiento se generen por completo.

Por qué importa conservar al sujeto

Antes de que existieran los modelos con capacidad R2V, mantener un personaje coherente en un video generado con IA exigía flujos de trabajo muy elaborados, como ControlNet, ajuste fino con LoRA y apilado de IP-Adapter, o aceptar que el personaje cambiara de aspecto. Ninguna de las dos opciones era viable para uso profesional.

R2V cambia eso al añadir una vía de condicionamiento dedicada al sujeto. La imagen de referencia pasa por un codificador de identidad que extrae características de apariencia, separadas del condicionamiento de escena que proviene del texto. El modelo aprende a respetar las características de identidad en todos los fotogramas, tratándolas como restricciones estrictas y no como sugerencias orientativas.

Cómo funciona el condicionamiento por referencia

Tu imagen de referencia se codifica dos veces. Una vez a través del codificador visual principal, para capturar las características a nivel de escena, y otra vez a través de un codificador de identidad entrenado específicamente para capturar los atributos de apariencia a nivel de persona u objeto. Ambos conjuntos de características condicionan el eliminador de ruido a distintas escalas, y las características de identidad se inyectan en las capas de nivel superior, donde está representada la información semántica.

El prompt de texto controla después solo el contexto de la escena y el movimiento, porque la pregunta de "cómo es el sujeto" ya la ha respondido la imagen de referencia. Esta separación de responsabilidades es lo que hace que los resultados de R2V parezcan más controlados que aplicar condicionamiento IP-Adapter sobre un modelo T2V estándar.

Cómo usar Wan 2.7 en PicassoIA

Mujer de pie frente a un escritorio en un estudio creativo luminoso, mirando una interfaz de creación de video con IA en un monitor

Las tres variantes de Wan 2.7 están disponibles en PicassoIA. Así se usa cada una de forma eficaz.

Empezar con T2V

Abre Wan 2.7 T2V en PicassoIA. El campo de prompt acepta texto libre, pero los prompts estructurados producen resultados siempre mejores. Sigue este orden:

  1. Sujeto: quién o qué aparece en la escena, con detalles de apariencia.
  2. Acción: qué ocurre y cómo se mueve.
  3. Entorno: dónde transcurre la escena, incluida la hora del día.
  4. Cámara: qué hace la cámara (estática, panorámica, seguimiento, etc.).
  5. Estilo: fotorrealista, cinematográfico, iluminación natural, etc.

El modelo genera en 1080p por defecto, que es una de las resoluciones nativas más altas de cualquier modelo de video de código abierto. El tiempo de generación es mayor que el de la variante Wan 2.2 T2V Fast, pero la diferencia de calidad es lo bastante significativa como para justificarlo en cualquier cosa que vaya más allá de la creación rápida de prototipos.

Animar fotos con I2V

Sube tu imagen de origen a Wan 2.7 I2V. La imagen debe estar limpia, bien iluminada y contener el sujeto que quieres animar. Las imágenes borrosas o con bajo contraste reducen de forma notable la calidad del resultado, porque el modelo tiene menos información visual en la que anclarse.

Escribe un prompt centrado en el movimiento. Describe el movimiento y el entorno en lugar de repetir la apariencia del sujeto (el modelo ya la tiene a partir de la imagen). "Olas rompiendo suavemente contra la orilla, luz de hora dorada, plano general estático" es mejor que una descripción compuesta y larga que intenta especificarlo todo a la vez.

R2V: animar sujetos concretos

Wan 2.7 R2V requiere dos entradas: una imagen de referencia de tu sujeto y un prompt de texto que describa la escena nueva. Para la imagen de referencia, funcionan mejor las fotos de estilo retrato, con un sujeto claro sobre un fondo relativamente sencillo. El codificador de identidad rinde mejor cuando el sujeto no está muy ocluido ni rodeado de elementos visualmente parecidos.

Para el prompt de texto, describe la escena nueva como si el sujeto de referencia ya estuviera en ella. "Caminando por un sendero de bosque iluminado por el sol en otoño, hojas cayendo, brisa suave, plano de seguimiento lento." El modelo coloca automáticamente tu sujeto de referencia en ese contexto.

Escribir prompts que de verdad funcionan

Primer plano de dos tarjetas de prompt sobre un escritorio de madera: una desordenada y mínima a la izquierda, otra estructurada y detallada a la derecha, con un bolígrafo entre ambas

La calidad de los resultados de Wan 2.7 depende de forma desproporcionada de la calidad del prompt. Un prompt mal escrito desperdicia una generación. Uno bien estructurado produce con regularidad un video utilizable a la primera.

La estructura que da resultados

Usa esta plantilla para los prompts de T2V e I2V:

[Subject + appearance] [action] in [environment], [time of day / lighting], [camera motion], photorealistic, [quality modifiers]

Prompt débil:

"Una mujer caminando por una ciudad de noche"

Prompt sólido:

"Una mujer de unos 20 y tantos años con un abrigo oscuro de lana camina por una calle empedrada mojada por la lluvia, las luces cálidas de los escaparates se reflejan en el pavimento húmedo, un plano de seguimiento suave a la altura de la calle, fotorrealista, 8K"

La versión estructurada aporta al modelo la identidad del sujeto, los detalles del movimiento, el entorno, la iluminación, el comportamiento de la cámara y las indicaciones de calidad. Cada una de esas dimensiones da forma a un aspecto distinto del resultado.

4 errores que desperdician generaciones

  1. Demasiadas acciones simultáneas. Wan 2.7 maneja bien una acción principal por clip. Varias acciones en competencia producen un movimiento irregular.
  2. Omitir la dirección de la cámara. Si no especificas el movimiento de cámara, el modelo toma una decisión que puede no coincidir con tu intención. Nómbralo siempre.
  3. Sujetos demasiado abstractos. "Una sensación de soledad" no se genera bien. "Una persona sentada sola en un banco del parque, palomas picoteando cerca, luz nublada" sí.
  4. Ignorar la relación de aspecto. El modelo usa 16:9 por defecto. Si tu imagen de origen para I2V está en orientación vertical, los resultados mejoran cuando la recortas o le añades bordes hasta 16:9 antes de subirla.

Wan 2.7 frente a la competencia

Pared de monitores de estudio en casa mostrando cuatro fotogramas de video generados con IA, uno al lado del otro, con escenas de paisaje, retrato, costa y ciudad

Wan 2.7 no existe en el vacío. Así se sitúa frente a otros modelos líderes de texto a video disponibles en PicassoIA:

ModeloResolución máximaModosIdeal para
Wan 2.7 T2V1080pT2VTecho de calidad de código abierto
Wan 2.7 I2V1080pI2VAnimar fotos fijas
Wan 2.7 R2V1080pR2VVideo con sujeto coherente
Seedance 2.51080pT2V, I2VClips de 30 segundos con audio nativo
Kling v2.61080pT2V, I2VCalidad de movimiento cinematográfico
Veo 3.11080pT2VAudio nativo, fotorrealismo
LTX 2.3 Pro4KT2V, I2VSalida de resolución ultra alta
Ray 3.2HDRT2V, I2VHDR y gradación de color cinematográfica

La principal ventaja de Wan 2.7 es el modo R2V, que ninguno de los competidores enumerados ofrece de forma nativa. En calidad pura de T2V, Veo 3.1 y Seedance 2.5 compiten de cerca, y Seedance gana en duración de clip con salidas de 30 segundos. Para la máxima resolución, LTX 2.3 Pro en 4K es el techo actual. Para la combinación de fidelidad de sujeto, calidad de movimiento y accesibilidad de código abierto a 1080p, Wan 2.7 se sitúa en lo más alto de ese conjunto concreto de herramientas.

💡 Cuándo usar cada modo: Si partes de cero, usa T2V. Si tienes una fotografía que quieres animar, usa I2V. Si necesitas que un personaje coherente aparezca en escenas distintas, R2V es el único modo diseñado específicamente para eso.

Empieza a crear tu primer video

Vista aérea de un equipo portátil sobre un escritorio de mármol blanco que muestra una línea de tiempo de edición de video, con un cuaderno abierto, un lápiz y una taza de café al lado

Wan 2.7 está disponible ahora mismo en los tres modos en PicassoIA, y obtener tu primer clip es más sencillo de lo que sugiere la profundidad técnica del modelo. Empieza con Wan 2.7 T2V si tienes un concepto creativo y quieres producirlo a partir de una descripción de texto. Pasa a Wan 2.7 I2V cuando tengas una imagen fija que quieras dar vida. Usa Wan 2.7 R2V cuando necesites que una persona o un sujeto concreto aparezca de forma coherente en varios videos generados, sin entrenamiento adicional.

La colección de texto a video de PicassoIA también te da acceso a más de 87 modelos con distintos equilibrios de velocidad, resolución y estilo. Picassoia Video ofrece generación gratuita ilimitada si quieres crear prototipos rápido antes de comprometer una generación de mayor calidad con Wan 2.7. Ray 3.2 merece la pena probarlo si el color cinematográfico HDR es prioritario para tu resultado.

Lo que separa un buen video con IA de uno excelente, hoy en día, no es solo la elección del modelo. Es la precisión del prompt y una intención clara. Elige tu modo, escribe un prompt que especifique sujeto, acción, entorno, cámara y estilo, y deja que Wan 2.7 haga lo que fue diseñado para hacer. Los resultados en 1080p de un modelo de código abierto en este nivel de calidad no eran posibles hace dieciocho meses. Hoy están disponibles para cualquiera en PicassoIA.

Compartir este artículo

Elige tu idioma