Cómo usar Wan 2.6 paso a paso: crea videos de IA impresionantes en casa

Wan 2.6 es el modelo de generación de video de código abierto más capaz hasta la fecha, con movimiento más nítido, mejor adherencia al prompt y resultados cinematográficos tanto en texto a video como en imagen a video. Este artículo te guía en cada paso, desde escribir tu primer prompt hasta ajustar la resolución, los fotogramas por segundo y la intensidad del movimiento, para que obtengas resultados de calidad profesional desde el primer día.

Cómo usar Wan 2.6 paso a paso: crea videos de IA impresionantes en casa
Cristian Da Conceicao
Fundador de Picasso IA

Wan 2.6 es un salto real en la generación de video de código abierto. Si llevas tiempo siguiendo el sector, ya sabes que la serie Wan, del equipo de investigación, viene publicando resultados competitivos. La versión 2.6 va más allá, con una coherencia de movimiento más firme, mejor detalle facial y una adherencia al prompt notablemente mejorada. Tanto si haces clips cinematográficos para redes sociales, si animas fotografía de producto o si montas un flujo de trabajo de video completo, este es el modelo que conviene conocer ahora mismo.

Qué hace realmente Wan 2.6

Wan 2.6 es un modelo de generación de video de código abierto basado en difusión. Recibe como entrada una descripción de texto o una imagen fija y genera un clip corto, normalmente de 4 a 8 segundos, con resoluciones de hasta 1080p. El modelo funciona como un proceso de difusión sobre latentes de video, lo que significa que refina de forma iterativa fotogramas ruidosos hasta convertirlos en movimiento coherente.

Lo que lo distingue de los modelos de código abierto anteriores es la escala de entrenamiento y los cambios de arquitectura que le permiten mantener la coherencia temporal entre fotogramas, conservando el mismo personaje, la misma iluminación y el mismo entorno sin parpadeos ni deriva.

Fotógrafo revisando una imagen animada con IA en la pantalla de una DSLR a la hora dorada

Los dos modos explicados

Wan 2.6 se presenta en dos variantes principales:

ModoEntradaIdeal para
T2V (texto a video)Solo prompt de textoCrear escenas desde cero
I2V (imagen a video)Imagen fija + prompt de textoAnimar fotos, imágenes de producto, retratos

Ambas variantes están disponibles en PicassoIA. La versión de texto a video es Wan 2.6 T2V y la de imagen a video es Wan 2.6 I2V. También existe Wan 2.6 I2V Flash, optimizada para la velocidad cuando necesitas previsualizaciones rápidas.

En qué se diferencia de las versiones anteriores

Wan 2.5 T2V ya era capaz, pero la 2.6 corrige sus principales debilidades:

  • Mejor coherencia facial: Los rostros se mantienen coherentes de un fotograma a otro
  • Mayor fidelidad al prompt: Las descripciones de escenas complejas se siguen más al pie de la letra
  • Realismo de movimiento mejorado: El movimiento basado en física de telas, cabello y agua resulta notablemente más creíble

Nota: para una generación más rápida a costa de algo de calidad, Wan 2.2 T2V Fast sigue siendo una opción excelente para borradores rápidos.

Antes de escribir el primer prompt

La mayoría de los malos resultados de Wan 2.6 vienen de prompts malos. Antes de tocar cualquier ajuste, necesitas saber cómo interpreta el modelo lo que le das.

Joven escribiendo en un escritorio minimalista con un guion en la pantalla del equipo portátil

La anatomía de un buen prompt para Wan 2.6

Un prompt sólido para Wan 2.6 sigue esta estructura:

[Sujeto] + [Acción/Movimiento] + [Entorno] + [Iluminación] + [Comportamiento de cámara] + [Estilo/Ambiente]

Por ejemplo:

"Una mujer con un vestido rojo caminando despacio por un campo de trigo bañado por el sol, luz de hora dorada desde atrás, cámara avanzando lentamente a un ángulo bajo, cinematográfico, 8K, fotorrealista"

Cada elemento aporta. El sujeto está claro. El movimiento está definido. El entorno es concreto. La iluminación tiene dirección. La cámara tiene instrucciones.

Lo que Wan 2.6 responde mejor

  • Verbos de movimiento: "caminando despacio", "girándose", "fluyendo con suavidad", "subiendo de forma constante"
  • Lenguaje de cámara: "dolly hacia delante", "paneo a la izquierda", "plano orbital", "ligero balanceo de cámara en mano"
  • Detalles de iluminación: "luz lateral cálida", "luz suave difusa de cielo nublado", "sol de mediodía directo y duro"
  • Palabras de atmósfera: "con niebla", "brumoso", "ventoso", "lluvioso", "polvoriento"

Consejo: describe lo que hace la cámara, no solo el sujeto. Wan 2.6 responde bien a un lenguaje de dirección de cámara cinematográfico.

Usar Wan 2.6 de texto a video paso a paso

Este es el flujo de trabajo principal para crear un clip desde cero con Wan 2.6 T2V.

Vista aérea de un escritorio de desarrollador con ajustes y parámetros de video visibles en los monitores

Paso 1: escribe la descripción de la escena

Empieza con una sola frase que cubra sujeto, acción y entorno. Después, amplía cada elemento:

  1. Abre un editor de texto sin formato
  2. Escribe tu escena principal en una línea
  3. Añade la iluminación en la línea 2
  4. Añade el movimiento de cámara en la línea 3
  5. Añade etiquetas de calidad y estilo al final

Estructura de ejemplo:

A man in a dark coat standing at a rain-soaked city intersection at night,
neon reflections on wet pavement, slow zoom out from close face to wide street,
cinematic, photorealistic, 8K, film grain

Paso 2: configura los parámetros

Cuando tu prompt esté listo, define estos valores antes de generar:

ParámetroValor recomendadoPor qué
Resolución1280x720 o 1920x1080Equilibra calidad y velocidad
Fotogramas81 fotogramas (aprox. 5 s a 16 fps)Duración estándar, buen arco de movimiento
Guidance scale5.0 a 7.0Más alto = seguimiento más literal del prompt
Pasos30 a 50Más pasos = más nitidez pero más lentitud
SemillaFija (p. ej. 42)Bloquéala cuando encuentres una buena variación

Paso 3: genera e itera

Haz la primera generación como borrador. No juzgues el resultado de forma aislada:

  • Anota lo que funcionó: composición, iluminación, dirección general del movimiento
  • Anota lo que falló: rostros, artefactos de movimiento, objetos incorrectos
  • Ajusta una variable cada vez: cambiar el prompt y el guidance a la vez hace imposible saber qué mejoró tu resultado

Usar Wan 2.6 de imagen a video paso a paso

El flujo de trabajo I2V empieza con una imagen fija. El modelo analiza la composición, la profundidad y el contenido de la imagen, y luego la anima según tu prompt de movimiento.

MacBook mostrando la interfaz de una plataforma de generación de video con IA bajo luz natural de ventana

Elegir la imagen de origen adecuada

No todas las imágenes se animan igual de bien. Wan 2.6 I2V funciona mejor cuando:

  • Hay un sujeto claro separado del fondo: retratos, imágenes de producto con un solo sujeto, objetos aislados
  • La imagen tiene iluminación natural: la luz de estudio plana o las fotos muy sobreexpuestas producen animaciones planas
  • La composición tiene profundidad: un sujeto delante de un fondo desenfocado da al modelo pistas espaciales más fuertes

Evita: fotos muy procesadas, imágenes generadas por IA con artefactos visibles o imágenes con varios sujetos complejos superpuestos.

Guiar la animación con prompts

Para Wan 2.6 I2V, tu prompt de texto es una directriz de movimiento, no una descripción de escena. Le estás diciendo al modelo cómo moverse con lo que ya hay en la imagen:

  • Bien: "Paneo lento de cámara a la derecha, brisa suave en el pelo, bokeh que respira suavemente"
  • Bien: "El sujeto gira ligeramente la cabeza a la derecha, parpadeando de forma natural"
  • Mal: "Una mujer de pie en un bosque" (demasiado descriptivo, sin suficiente dirección de movimiento)

Consejo: para previsualizaciones más rápidas antes de lanzar una generación completa, Wan 2.6 I2V Flash reduce mucho el tiempo de generación con una pérdida mínima de calidad en la fase de borrador.

Cómo usar Wan 2.6 en PicassoIA

PicassoIA tiene Wan 2.6 T2V y Wan 2.6 I2V disponibles directamente en su colección. Este es el flujo exacto.

Tira de película con fotogramas de video que pasan de borrosos a una calidad cinematográfica nítida

Paso 1: abre el modelo

Ve a la página de Wan 2.6 T2V en PicassoIA. Verás el panel de entrada a la izquierda y el área de previsualización de salida a la derecha. Si trabajas desde una imagen fija, abre Wan 2.6 I2V en su lugar.

Paso 2: rellena la configuración

Para texto a video:

  1. Pega tu prompt en el campo de entrada principal
  2. Añade tu prompt negativo (consulta la sección de más abajo)
  3. Define la resolución: 1280x720 para resultados más rápidos, 1920x1080 para la calidad final
  4. Define el número de fotogramas: 81 o 97 fotogramas funcionan bien para una duración natural del clip
  5. Define el guidance scale: empieza en 6.0
  6. Define los pasos de inferencia: 40 es un valor predeterminado sólido

Para imagen a video:

  1. Sube tu imagen de origen en el campo de entrada de imagen
  2. Escribe tu prompt de movimiento describiendo cómo debe moverse la escena
  3. Define la misma resolución y los mismos parámetros de fotogramas que antes

Paso 3: genera y descarga

Haz clic en generar. PicassoIA pone tu trabajo en cola y empieza a procesarlo. El tiempo de generación varía según la resolución y el número de fotogramas, normalmente de 2 a 5 minutos para un clip de 720p.

Cuando termine, el video aparece en el panel de salida. Previsualízalo en la propia página y descarga el MP4 directamente desde la interfaz.

Consejo: si tu primer resultado tiene artefactos visibles en rostros o manos, prueba a bajar el guidance scale entre 0,5 y 1,0 puntos y vuelve a generar con la misma semilla. Un guidance más bajo suele suavizar los artefactos causados por un exceso de nitidez.

Los ajustes que de verdad importan

La mayoría de quienes empiezan se fijan en la estética y pasan por alto los parámetros que controlan la calidad del resultado.

Persona concentrada mirando monitores de edición de video con luz dorada de la tarde

Resolución y número de fotogramas

Esta es una referencia práctica para elegir la configuración de salida:

ResoluciónNúmero de fotogramasDuración aprox.Caso de uso
832x48049 fotogramas~3 sPruebas de borrador
1280x72081 fotogramas~5 sCalidad estándar
1920x108081 fotogramas~5 sSalida final
1920x1080121 fotogramas~7,5 sClips largos

Para la mayoría de los usos en redes sociales, 1280x720 a 81 fotogramas es el punto ideal entre calidad y costo de generación.

Intensidad de movimiento y guidance scale

El guidance scale (también llamado escala CFG) es uno de los parámetros con más impacto:

  • Por debajo de 4,0: interpretación libre, máxima libertad creativa, puede ignorar tu prompt
  • De 4,0 a 6,0: equilibrado, normalmente ideal para escenas complejas
  • De 6,0 a 8,0: adherencia estricta, puede introducir sobrenitidez o artefactos
  • Por encima de 8,0: suele provocar resultados quemados y poco naturales

Algunas implementaciones también ofrecen un control deslizante de intensidad de movimiento o motion bucket. Los valores bajos producen movimiento sutil y realista. Los valores altos crean movimiento dramático y exagerado.

Prompts negativos que funcionan

Usa esto como prompt negativo base para obtener resultados más limpios:

blurry, low quality, artifacts, distorted faces, extra limbs,
flickering, watermark, text overlay, unrealistic motion, choppy frames

Añade términos específicos según aquello en lo que fallen tus generaciones. Si los rostros se deforman, añade "rostro deformado, anatomía incorrecta". Si el video es demasiado estático, añade "sin movimiento, estático, congelado".

5 errores que arruinan los resultados de Wan 2.6

Gotas de agua suspendidas en plena caída, en macro extremo con detalle cristalino sobre fondo blanco

Estos son los errores más comunes que hacen tropezar a quienes usan Wan 2.6 por primera vez:

  1. Prompts que describen una imagen estática, no un movimiento: "Una mujer de pie en un campo" produce casi ningún movimiento. Añade verbos de movimiento e instrucciones de cámara.

  2. Cambiar demasiadas variables a la vez: si cambias el prompt, el guidance, la resolución y la semilla simultáneamente, nunca sabrás qué mejoró tu resultado.

  3. Usar un guidance scale alto en escenas complejas con varios sujetos: varios sujetos con un CFG alto suelen dar lugar a artefactos. Baja entre 4,5 y 5,5 para multitudes o tomas con varias personas.

  4. Ignorar por completo los prompts negativos: incluso un prompt negativo básico reduce de forma notable la frecuencia de artefactos.

  5. Generar en la resolución máxima en el primer borrador: 1080p tarda bastante más en procesarse. Prueba tu prompt en 720p y luego haz la versión final aprobada en resolución completa.

Qué hacer con tus videos después

Dos manos sosteniendo una claqueta en el set de un rodaje profesional, con luz de tungsteno cálida

Un clip generado es un punto de partida. Así puedes llevarlo más allá:

  • Escálalo: pásalo por un modelo de escalado de video con IA para llevar la salida de 720p a una nitidez equivalente a 4K.
  • Añade audio: acompaña tu clip con música generada con un modelo de generación de música con IA o añade narración con texto a voz.
  • Edita y secuencia: une varios clips de Wan 2.6 en un editor de video para crear secuencias más largas.
  • Haz un bucle: los clips cortos, de 2 a 3 segundos, pueden editarse como bucles sin cortes para contenido en redes sociales.
  • Añade sincronización labial: anima un rostro con Wan 2.6 y aplica un modelo de sincronización labial para añadir movimiento de boca realista a cualquier pista de voz.

Empieza a crear ahora mismo

Mujer feliz viendo la reproducción de un video en una tableta en un espacio de coworking moderno y luminoso

La barrera para hacer video de IA de calidad profesional nunca ha sido tan baja. Con Wan 2.6 accesible directamente a través de PicassoIA, no necesitas hardware de GPU local ni una configuración compleja. Escribe un prompt, ajusta unos cuantos parámetros y obtén un clip cinematográfico en minutos.

La mejor forma de ganar intuición con este modelo es probarlo mucho. Haz 10 generaciones. Compara lo que funcionó. Lleva un registro sencillo de los prompts que dieron buenos resultados. Tu tasa de aciertos mejorará rápido.

Abre Wan 2.6 T2V en PicassoIA y lanza tu primera generación ahora mismo. Si trabajas desde una foto fija, ve directamente a Wan 2.6 I2V. En cualquier caso, tendrás un clip de video listo para compartir en menos de cinco minutos.

Compartir este artículo

Elige tu idioma