Cómo usar Wan 2.6 paso a paso: crea videos de IA impresionantes en casa
Wan 2.6 es el modelo de generación de video de código abierto más capaz hasta la fecha, con movimiento más nítido, mejor adherencia al prompt y resultados cinematográficos tanto en texto a video como en imagen a video. Este artículo te guía en cada paso, desde escribir tu primer prompt hasta ajustar la resolución, los fotogramas por segundo y la intensidad del movimiento, para que obtengas resultados de calidad profesional desde el primer día.
Wan 2.6 es un salto real en la generación de video de código abierto. Si llevas tiempo siguiendo el sector, ya sabes que la serie Wan, del equipo de investigación, viene publicando resultados competitivos. La versión 2.6 va más allá, con una coherencia de movimiento más firme, mejor detalle facial y una adherencia al prompt notablemente mejorada. Tanto si haces clips cinematográficos para redes sociales, si animas fotografía de producto o si montas un flujo de trabajo de video completo, este es el modelo que conviene conocer ahora mismo.
Qué hace realmente Wan 2.6
Wan 2.6 es un modelo de generación de video de código abierto basado en difusión. Recibe como entrada una descripción de texto o una imagen fija y genera un clip corto, normalmente de 4 a 8 segundos, con resoluciones de hasta 1080p. El modelo funciona como un proceso de difusión sobre latentes de video, lo que significa que refina de forma iterativa fotogramas ruidosos hasta convertirlos en movimiento coherente.
Lo que lo distingue de los modelos de código abierto anteriores es la escala de entrenamiento y los cambios de arquitectura que le permiten mantener la coherencia temporal entre fotogramas, conservando el mismo personaje, la misma iluminación y el mismo entorno sin parpadeos ni deriva.
Los dos modos explicados
Wan 2.6 se presenta en dos variantes principales:
Modo
Entrada
Ideal para
T2V (texto a video)
Solo prompt de texto
Crear escenas desde cero
I2V (imagen a video)
Imagen fija + prompt de texto
Animar fotos, imágenes de producto, retratos
Ambas variantes están disponibles en PicassoIA. La versión de texto a video es Wan 2.6 T2V y la de imagen a video es Wan 2.6 I2V. También existe Wan 2.6 I2V Flash, optimizada para la velocidad cuando necesitas previsualizaciones rápidas.
En qué se diferencia de las versiones anteriores
Wan 2.5 T2V ya era capaz, pero la 2.6 corrige sus principales debilidades:
Mejor coherencia facial: Los rostros se mantienen coherentes de un fotograma a otro
Mayor fidelidad al prompt: Las descripciones de escenas complejas se siguen más al pie de la letra
Realismo de movimiento mejorado: El movimiento basado en física de telas, cabello y agua resulta notablemente más creíble
Nota: para una generación más rápida a costa de algo de calidad, Wan 2.2 T2V Fast sigue siendo una opción excelente para borradores rápidos.
Antes de escribir el primer prompt
La mayoría de los malos resultados de Wan 2.6 vienen de prompts malos. Antes de tocar cualquier ajuste, necesitas saber cómo interpreta el modelo lo que le das.
La anatomía de un buen prompt para Wan 2.6
Un prompt sólido para Wan 2.6 sigue esta estructura:
"Una mujer con un vestido rojo caminando despacio por un campo de trigo bañado por el sol, luz de hora dorada desde atrás, cámara avanzando lentamente a un ángulo bajo, cinematográfico, 8K, fotorrealista"
Cada elemento aporta. El sujeto está claro. El movimiento está definido. El entorno es concreto. La iluminación tiene dirección. La cámara tiene instrucciones.
Lo que Wan 2.6 responde mejor
Verbos de movimiento: "caminando despacio", "girándose", "fluyendo con suavidad", "subiendo de forma constante"
Lenguaje de cámara: "dolly hacia delante", "paneo a la izquierda", "plano orbital", "ligero balanceo de cámara en mano"
Detalles de iluminación: "luz lateral cálida", "luz suave difusa de cielo nublado", "sol de mediodía directo y duro"
Palabras de atmósfera: "con niebla", "brumoso", "ventoso", "lluvioso", "polvoriento"
Consejo: describe lo que hace la cámara, no solo el sujeto. Wan 2.6 responde bien a un lenguaje de dirección de cámara cinematográfico.
Usar Wan 2.6 de texto a video paso a paso
Este es el flujo de trabajo principal para crear un clip desde cero con Wan 2.6 T2V.
Paso 1: escribe la descripción de la escena
Empieza con una sola frase que cubra sujeto, acción y entorno. Después, amplía cada elemento:
Abre un editor de texto sin formato
Escribe tu escena principal en una línea
Añade la iluminación en la línea 2
Añade el movimiento de cámara en la línea 3
Añade etiquetas de calidad y estilo al final
Estructura de ejemplo:
A man in a dark coat standing at a rain-soaked city intersection at night,
neon reflections on wet pavement, slow zoom out from close face to wide street,
cinematic, photorealistic, 8K, film grain
Paso 2: configura los parámetros
Cuando tu prompt esté listo, define estos valores antes de generar:
Parámetro
Valor recomendado
Por qué
Resolución
1280x720 o 1920x1080
Equilibra calidad y velocidad
Fotogramas
81 fotogramas (aprox. 5 s a 16 fps)
Duración estándar, buen arco de movimiento
Guidance scale
5.0 a 7.0
Más alto = seguimiento más literal del prompt
Pasos
30 a 50
Más pasos = más nitidez pero más lentitud
Semilla
Fija (p. ej. 42)
Bloquéala cuando encuentres una buena variación
Paso 3: genera e itera
Haz la primera generación como borrador. No juzgues el resultado de forma aislada:
Anota lo que funcionó: composición, iluminación, dirección general del movimiento
Anota lo que falló: rostros, artefactos de movimiento, objetos incorrectos
Ajusta una variable cada vez: cambiar el prompt y el guidance a la vez hace imposible saber qué mejoró tu resultado
Usar Wan 2.6 de imagen a video paso a paso
El flujo de trabajo I2V empieza con una imagen fija. El modelo analiza la composición, la profundidad y el contenido de la imagen, y luego la anima según tu prompt de movimiento.
Elegir la imagen de origen adecuada
No todas las imágenes se animan igual de bien. Wan 2.6 I2V funciona mejor cuando:
Hay un sujeto claro separado del fondo: retratos, imágenes de producto con un solo sujeto, objetos aislados
La imagen tiene iluminación natural: la luz de estudio plana o las fotos muy sobreexpuestas producen animaciones planas
La composición tiene profundidad: un sujeto delante de un fondo desenfocado da al modelo pistas espaciales más fuertes
Evita: fotos muy procesadas, imágenes generadas por IA con artefactos visibles o imágenes con varios sujetos complejos superpuestos.
Guiar la animación con prompts
Para Wan 2.6 I2V, tu prompt de texto es una directriz de movimiento, no una descripción de escena. Le estás diciendo al modelo cómo moverse con lo que ya hay en la imagen:
Bien: "Paneo lento de cámara a la derecha, brisa suave en el pelo, bokeh que respira suavemente"
Bien: "El sujeto gira ligeramente la cabeza a la derecha, parpadeando de forma natural"
Mal: "Una mujer de pie en un bosque" (demasiado descriptivo, sin suficiente dirección de movimiento)
Consejo: para previsualizaciones más rápidas antes de lanzar una generación completa, Wan 2.6 I2V Flash reduce mucho el tiempo de generación con una pérdida mínima de calidad en la fase de borrador.
Cómo usar Wan 2.6 en PicassoIA
PicassoIA tiene Wan 2.6 T2V y Wan 2.6 I2V disponibles directamente en su colección. Este es el flujo exacto.
Paso 1: abre el modelo
Ve a la página de Wan 2.6 T2V en PicassoIA. Verás el panel de entrada a la izquierda y el área de previsualización de salida a la derecha. Si trabajas desde una imagen fija, abre Wan 2.6 I2V en su lugar.
Paso 2: rellena la configuración
Para texto a video:
Pega tu prompt en el campo de entrada principal
Añade tu prompt negativo (consulta la sección de más abajo)
Define la resolución: 1280x720 para resultados más rápidos, 1920x1080 para la calidad final
Define el número de fotogramas: 81 o 97 fotogramas funcionan bien para una duración natural del clip
Define el guidance scale: empieza en 6.0
Define los pasos de inferencia: 40 es un valor predeterminado sólido
Para imagen a video:
Sube tu imagen de origen en el campo de entrada de imagen
Escribe tu prompt de movimiento describiendo cómo debe moverse la escena
Define la misma resolución y los mismos parámetros de fotogramas que antes
Paso 3: genera y descarga
Haz clic en generar. PicassoIA pone tu trabajo en cola y empieza a procesarlo. El tiempo de generación varía según la resolución y el número de fotogramas, normalmente de 2 a 5 minutos para un clip de 720p.
Cuando termine, el video aparece en el panel de salida. Previsualízalo en la propia página y descarga el MP4 directamente desde la interfaz.
Consejo: si tu primer resultado tiene artefactos visibles en rostros o manos, prueba a bajar el guidance scale entre 0,5 y 1,0 puntos y vuelve a generar con la misma semilla. Un guidance más bajo suele suavizar los artefactos causados por un exceso de nitidez.
Los ajustes que de verdad importan
La mayoría de quienes empiezan se fijan en la estética y pasan por alto los parámetros que controlan la calidad del resultado.
Resolución y número de fotogramas
Esta es una referencia práctica para elegir la configuración de salida:
Resolución
Número de fotogramas
Duración aprox.
Caso de uso
832x480
49 fotogramas
~3 s
Pruebas de borrador
1280x720
81 fotogramas
~5 s
Calidad estándar
1920x1080
81 fotogramas
~5 s
Salida final
1920x1080
121 fotogramas
~7,5 s
Clips largos
Para la mayoría de los usos en redes sociales, 1280x720 a 81 fotogramas es el punto ideal entre calidad y costo de generación.
Intensidad de movimiento y guidance scale
El guidance scale (también llamado escala CFG) es uno de los parámetros con más impacto:
Por debajo de 4,0: interpretación libre, máxima libertad creativa, puede ignorar tu prompt
De 4,0 a 6,0: equilibrado, normalmente ideal para escenas complejas
De 6,0 a 8,0: adherencia estricta, puede introducir sobrenitidez o artefactos
Por encima de 8,0: suele provocar resultados quemados y poco naturales
Algunas implementaciones también ofrecen un control deslizante de intensidad de movimiento o motion bucket. Los valores bajos producen movimiento sutil y realista. Los valores altos crean movimiento dramático y exagerado.
Prompts negativos que funcionan
Usa esto como prompt negativo base para obtener resultados más limpios:
blurry, low quality, artifacts, distorted faces, extra limbs,
flickering, watermark, text overlay, unrealistic motion, choppy frames
Añade términos específicos según aquello en lo que fallen tus generaciones. Si los rostros se deforman, añade "rostro deformado, anatomía incorrecta". Si el video es demasiado estático, añade "sin movimiento, estático, congelado".
5 errores que arruinan los resultados de Wan 2.6
Estos son los errores más comunes que hacen tropezar a quienes usan Wan 2.6 por primera vez:
Prompts que describen una imagen estática, no un movimiento: "Una mujer de pie en un campo" produce casi ningún movimiento. Añade verbos de movimiento e instrucciones de cámara.
Cambiar demasiadas variables a la vez: si cambias el prompt, el guidance, la resolución y la semilla simultáneamente, nunca sabrás qué mejoró tu resultado.
Usar un guidance scale alto en escenas complejas con varios sujetos: varios sujetos con un CFG alto suelen dar lugar a artefactos. Baja entre 4,5 y 5,5 para multitudes o tomas con varias personas.
Ignorar por completo los prompts negativos: incluso un prompt negativo básico reduce de forma notable la frecuencia de artefactos.
Generar en la resolución máxima en el primer borrador: 1080p tarda bastante más en procesarse. Prueba tu prompt en 720p y luego haz la versión final aprobada en resolución completa.
Qué hacer con tus videos después
Un clip generado es un punto de partida. Así puedes llevarlo más allá:
Escálalo: pásalo por un modelo de escalado de video con IA para llevar la salida de 720p a una nitidez equivalente a 4K.
Edita y secuencia: une varios clips de Wan 2.6 en un editor de video para crear secuencias más largas.
Haz un bucle: los clips cortos, de 2 a 3 segundos, pueden editarse como bucles sin cortes para contenido en redes sociales.
Añade sincronización labial: anima un rostro con Wan 2.6 y aplica un modelo de sincronización labial para añadir movimiento de boca realista a cualquier pista de voz.
Empieza a crear ahora mismo
La barrera para hacer video de IA de calidad profesional nunca ha sido tan baja. Con Wan 2.6 accesible directamente a través de PicassoIA, no necesitas hardware de GPU local ni una configuración compleja. Escribe un prompt, ajusta unos cuantos parámetros y obtén un clip cinematográfico en minutos.
La mejor forma de ganar intuición con este modelo es probarlo mucho. Haz 10 generaciones. Compara lo que funcionó. Lleva un registro sencillo de los prompts que dieron buenos resultados. Tu tasa de aciertos mejorará rápido.
Abre Wan 2.6 T2V en PicassoIA y lanza tu primera generación ahora mismo. Si trabajas desde una foto fija, ve directamente a Wan 2.6 I2V. En cualquier caso, tendrás un clip de video listo para compartir en menos de cinco minutos.