Servidor MCP de generación de video: Veo, Kling y Seedance en un chat
Un servidor MCP de generación de video permite pedir clips a Veo, Kling y Seedance desde un solo chat, sin cambiar de pestaña. Este artículo muestra cómo funcionan las herramientas, los trabajos asíncronos y las consultas de estado, qué modelo encaja con cada plano, qué límites esperar y cómo escribir prompts que sobrevivan al primer render.
Tienes una pestaña de Veo abierta, una de Kling en otra ventana y una de Seedance que olvidaste cerrar, y el plano que buscas podría estar en cualquiera de las tres. Cada generador quiere su propio formato de prompt, su propio panel de ajustes y su propio botón de descarga. Un servidor MCP de generación de video sustituye esa rutina por una sola frase escrita en un chat: describes el clip, el asistente elige un modelo, envía el trabajo, comprueba su estado y te entrega un enlace. Este artículo explica cómo funciona esta configuración, qué hace mejor cada uno de Veo 3.1, Kling v3 Video y Seedance 2.5 Lite, y cómo escribir prompts que sobrevivan al primer render.
Por qué un solo chat gana a cinco pestañas
El costo de cambiar de pestaña
Cambiar de herramienta parece inofensivo hasta que cuentas los pasos. Copias un prompt en un sitio, esperas, descargas el archivo, le cambias el nombre, abres el siguiente sitio, pegas y te das cuenta de que el segundo modelo quiere el audio descrito de otra forma, así que reescribes. Al tercer intento ya no sabes qué semilla produjo qué clip, y la carpeta del escritorio es un montón de archivos llamados "final_v2_de_verdad".
Un chat le da la vuelta a eso. La conversación misma se convierte en el archivo del proyecto: cada prompt, cada ajuste y cada enlace de resultado queda en un historial que puedes buscar después. El asistente también puede convertir un único brief creativo en tres prompts adaptados a cada modelo, que es la parte tediosa que nadie disfruta hacer a mano.
Qué hace realmente MCP
El Model Context Protocol es un estándar abierto, presentado por Anthropic a finales de 2024, que permite a una aplicación de chat hablar con herramientas externas de forma predecible. Un servidor anuncia una lista de herramientas. Cada herramienta tiene un nombre, una descripción en lenguaje sencillo y un esquema JSON que detalla sus entradas. La aplicación de chat muestra esa lista al modelo, el modelo decide cuándo encaja una herramienta, y la aplicación reenvía la llamada al servidor y devuelve el resultado a la conversación.
Los servidores se ejecutan en local por stdio o en remoto por HTTP, así que un servidor de video puede ser un pequeño proceso en tu equipo o un endpoint alojado al que te conectas una sola vez. Desde el punto de vista del chat, "haz un clip de cinco segundos de un cocinero en un mercado nocturno" deja de ser un deseo vago y se convierte en una llamada estructurada con un prompt, una duración y una resolución.
💡 Consejo: Las descripciones de las herramientas importan más de lo que la gente espera. El modelo las lee para decidir qué herramienta llamar, así que un servidor que dice "genera un video a partir de un prompt de texto" se usa mucho más fiablemente que uno que dice "ejecuta trabajo".
Cómo gestiona el servidor los trabajos de video
Herramientas, esquemas y consultas de estado
El conector de PicassoIA es un buen ejemplo concreto porque su lista de herramientas es corta y legible. En el momento de escribir esto, expone estas herramientas:
Devuelve tu plan y tus límites de ejecución en paralelo
cancel_generation
Cancela un trabajo, salvo que la GPU ya esté renderizando el video
Cada herramienta de generación devuelve un predict_id en cuanto una GPU acepta el trabajo, junto con un tiempo estimado. Luego llamas a get_generation tras la espera sugerida, y de nuevo tras cada espera que devuelva, hasta que el estado sea succeeded o failed. Un fallo es definitivo, así que el asistente envía una generación nueva en lugar de reintentar la misma.
Por qué el video necesita trabajos asíncronos
Una llamada de texto a imagen responde en segundos. Un video no. Los ejemplos de renderizado en las páginas de los modelos dan una idea: los ejemplos de Veo 3.1 tardaron entre uno y dos minutos aproximadamente, los de Seedance 2.5 Lite unos dos o tres minutos, y los de Kling v3 Video entre cinco y dieciocho minutos según la duración y los ajustes. Una llamada de herramienta en un chat no puede esperar tanto.
Así que el servidor devuelve un ticket y deja que el asistente consulte su estado. Por eso también tu chat puede seguir hablando mientras se renderiza un clip: pide el prompt del siguiente plano mientras se cocina el primero.
Cómo es una sesión
Así es un intercambio realista una vez conectado el servidor:
Escribes: "Haz un clip de 5 segundos en 16:9 de un cocinero lanzando fideos en un mercado al atardecer, con luces cálidas y sonido de chisporroteo."
El asistente elige la herramienta de video, completa el prompt, la duración y la resolución, y envía el trabajo.
El servidor responde con un predict_id y un tiempo estimado.
El asistente espera el intervalo sugerido, llama a get_generation, ve que el trabajo sigue procesándose y vuelve a esperar.
El estado cambia a succeeded y el asistente publica el enlace del MP4 en el chat.
Dices "el mismo plano, pero el cocinero mira a la cámara", y el asistente reenvía con la misma semilla y una línea de movimiento editada.
Todo el ciclo ocurre dentro de una sola ventana, y nada de esto te obliga a leer una referencia de API.
Cinco trabajos a la vez
La documentación de la API de PicassoIA indica 5 predicciones simultáneas por cuenta, compartidas entre tu acceso a la API y tus conexiones MCP. Para un storyboard de ocho planos, eso significa que el asistente debe enviar cinco, consultar su estado y encolar el resto a medida que se liberen huecos. Puedes decirlo en palabras sencillas: "Ejecuta los planos en lotes de cinco y publica cada enlace en cuanto termine."
Tres modelos, tres fortalezas
Ningún modelo gana en todos los planos, y ese es el verdadero argumento para tener varios detrás de un solo chat. Esto es lo que dicen las páginas de los modelos sobre para qué está pensado cada uno.
Cuando importan el realismo y el sonido
Veo 3.1 convierte un prompt de texto en metraje 1080p con audio consciente del contexto, de modo que el tintineo, el viento o las voces llegan sincronizados con la imagen. Los clips duran 4, 6 u 8 segundos en 16:9 o 9:16. Puedes fijar un primer fotograma y un último fotograma para interpolar entre dos momentos, o darle hasta tres imágenes de referencia para mantener un sujeto coherente entre planos. Un campo de prompt negativo te permite excluir lo que no quieres. Una versión más rápida, Veo 3.1 Fast, existe para borradores más ágiles.
Recurre a él cuando el plano sea un momento creíble del mundo real: un coche en una carretera costera, una conversación en una cafetería, un producto sobre una mesa con sonido ambiente natural.
Cuando necesitas control de varios planos
Kling v3 Video es la opción de formato largo. Produce clips de hasta 15 segundos y admite guion de varios planos: defines hasta 6 escenas, cada una con su propio prompt y duración, dentro de una sola generación. El modo estándar renderiza en 720p y el modo pro en 1080p. Puedes fijar el primer y el último fotograma con imágenes, elegir 16:9, 9:16 o 1:1, y añadir un prompt negativo. La generación de audio es un interruptor que viene desactivado por defecto, así que indícale al chat que lo active cuando quieras sonido.
Es el que usas cuando un clip necesita un pequeño arco, como un plano general, un primer plano y una reacción, sin tener que unir tres archivos separados. Prepárate para los tiempos de espera más largos del grupo.
Cuando quieres iteraciones rápidas
Seedance 2.5 Lite está pensado para el volumen. Genera clips de 5 o 10 segundos a 480p o 720p, con audio sincronizado activado por defecto, a partir de texto o de una imagen inicial, y acepta una semilla que puedes fijar para reproducir un resultado. Su página de modelo lo describe como ilimitado para los miembros de Wonder, lo que lo convierte en el modelo natural para probar diez variaciones de prompt antes de comer. Existen hermanos más grandes si necesitas más: Seedance 2.5 figura con clips de hasta 30 segundos, y Seedance 2.0 ofrece texto a video con audio integrado.
Elegir el modelo adecuado para cada plano
Cuando pones las especificaciones una al lado de otra, las decisiones de enrutado se hacen más fáciles. Los tiempos de renderizado proceden de las generaciones de ejemplo de cada página de modelo, así que tómalos como cifras aproximadas, no como promesas.
Una mini historia con varias escenas en un solo archivo:Kling v3 Video.
Borradores rápidos, muchas variaciones, bucles para redes sociales:Seedance 2.5 Lite.
💡 Consejo: Haz los borradores en el modelo rápido y termina en el lento. Fija la idea, el encuadre y el movimiento con iteraciones rápidas, y reserva los renders largos para los planos que ya hayas aprobado.
Los clips en bruto rara vez son el último paso. PicassoIA también ofrece edición de video, escalado de video y un amplio catálogo de efectos visuales, que es donde añades un acabado estilizado o una pasada de limpieza después de que el generador haya hecho su trabajo. La lista completa está en picassoia.com/en/all-models.
Escribir prompts que el chat puede reutilizar
Las listas de planos ganan a los adjetivos
La página del modelo Seedance 2.5 Lite dice que funcionan mejor las descripciones cinematográficas y cronológicas, y el mismo hábito ayuda con cualquier modelo de video. Describe lo que pasa en orden, como lo leería un director en una lista de planos, en lugar de acumular adjetivos como "épico" y "espectacular". El modelo no puede filmar un adjetivo, pero sí puede filmar a un cocinero que lanza los fideos una vez mientras las llamas se avivan.
Una plantilla de prompt que funciona
Una estructura de cuatro líneas mantiene coherentes los prompts cuando el asistente los reescribe para distintos modelos:
Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.
Ya completada, queda así:
Un cocinero de comida callejera con delantal de lona sostiene un wok sobre una llama de gas. Lanza los fideos una vez, las llamas se avivan, el vapor avanza hacia la lente. Acercamiento lento desde la altura del pecho. Luces cálidas en lo alto, aceite chisporroteando y murmullo del mercado.
Después pide al chat que lo adapte a cada modelo. Para Veo 3.1, detalla el sonido, porque el audio sigue al prompt. Para Kling v3 Video, divide los momentos en escenas y haz que las duraciones de los planos sumen la duración total, con al menos un segundo por plano. Para Seedance 2.5 Lite, mantenlo en un solo párrafo fluido y fija la semilla cuando te guste el resultado.
Si el modelo de chat es flojo describiendo planos, redacta los prompts con un redactor más potente como Claude Sonnet 5 o Gemini 3.5 Flash y pega el resultado en la conversación.
Cómo corregir un primer render flojo
Cambia una variable a la vez. Fija la semilla y edita solo la línea de movimiento. Unos cuantos hábitos ahorran horas:
El sujeto se desvía: aporta una imagen de primer fotograma para que el modelo parta de un aspecto fijo.
Aparecen objetos no deseados: usa el campo de prompt negativo que ofrecen Veo 3.1 y Kling v3 Video.
El clip se ve recargado: acórtalo. Un clip de cinco segundos con una sola acción es mejor que uno de diez con tres.
💡 Consejo: Combina las herramientas. Genera una imagen fija con la herramienta de imágenes, aprueba el encuadre y luego introdúcela como primer fotograma para que el video empiece exactamente donde quieres.
Seedance 2.5 Lite es la primera parada práctica porque es rápido, gestiona el audio por defecto y es una de las dos herramientas de video del conector. Este es el flujo en PicassoIA:
Abre la página de Seedance 2.5 Lite, o pide a tu chat que llame a generate_video_seedance.
Escribe el prompt en orden cronológico usando la plantilla de cuatro líneas de arriba.
Elige una duración de 5 o 10 segundos. Usa 5 mientras pruebas.
Elige una resolución. 480p se renderiza más rápido y sirve para borradores; 720p es más nítido y sirve para la versión que te quedas.
Elige una relación de aspecto, o sube una imagen para usarla como fotograma de apertura. Con una imagen, el clip coincide con la imagen e ignora el ajuste de relación.
Deja guardar audio activado, a menos que quieras un clip sin sonido.
Fija una semilla si quieres reproducir el resultado más adelante.
Envía, consulta hasta que el trabajo tenga éxito y abre el enlace devuelto.
Ajuste
Opciones
Cuándo cambiarlo
Duración
5 o 10 segundos
Pasa a 10 cuando la acción necesite espacio
Resolución
480p o 720p
480p para borradores, 720p para los definitivos
Relación de aspecto
16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3
Ajústala a la plataforma donde publicas
Imagen de entrada
Opcional
Fija el aspecto del primer fotograma
Imagen del último fotograma
Opcional, necesita una imagen de entrada
Controla cómo termina el plano
Semilla
Cualquier entero
Reproduce o compara tomas
Guardar audio
Activado o desactivado
Desactivado para material de relleno sin sonido
El mismo flujo para Veo y Kling
Los pasos sirven igual con algunos cambios. En Veo 3.1, elige 4, 6 u 8 segundos y 720p o 1080p. Las imágenes de referencia solo funcionan con 16:9 y 8 segundos, y el último fotograma se ignora cuando hay referencias. En Kling v3 Video, elige el modo estándar (720p) o pro (1080p), activa el audio, mantén el prompt por debajo de 2.500 caracteres y añade una lista de varios planos cuando quieras varias escenas.
Límites con los que contar
Cola, reintentos y fallos
Límite paralelo: 5 predicciones simultáneas por cuenta, compartidas entre conexiones. Planifica tus lotes de cinco en cinco.
Fallos definitivos: consultar un trabajo fallido no lo recuperará. El asistente debe enviar uno nuevo, idealmente con un prompt más sencillo.
Tamaño del prompt: la API de PicassoIA acepta prompts de hasta 4.000 caracteres, y Kling v3 Video limita el suyo a 2.500, así que escribe primero la versión más corta.
Cancelación: un trabajo puede cancelarse hasta que la GPU empiece a renderizar el video. A partir de ahí se ejecuta hasta el final.
Lo que el conector no hace
Conviene ser honesto con el alcance. En el momento de escribir esto, el conector de PicassoIA incluye cuatro modelos: un generador de imágenes, un editor de imágenes, PicassoIA Video y Seedance 2.5 Lite. Veo 3.1 y Kling v3 Video funcionan desde el sitio de PicassoIA, y llevarlos al mismo chat requeriría un servidor MCP propio que envuelva las APIs de sus proveedores.
Ejecuta list_models en tu propia cuenta para ver qué está expuesto hoy, y consulta picassoia.com/en/pricing para comprobar qué planes incluyen conexiones MCP antes de montar un flujo de trabajo sobre ellas.
Crea tu primer clip hoy
Elige un plano que normalmente filmarías o comprarías como metraje de stock, escríbelo como prompt de cuatro líneas y pásalo por los tres modelos. Empieza con Seedance 2.5 Lite para un borrador rápido, envía la versión aprobada a Veo 3.1 para un sonido realista o a Kling v3 Video para un corte de varios planos, y compara los resultados lado a lado. En una tarde sabrás hacia qué modelo se inclina tu estilo.
Puedes probarlo todo en PicassoIA. Genera una imagen fija con uno de los modelos de imagen, úsala como primer fotograma y mira cómo se mueve. Explora el catálogo completo en picassoia.com/en/all-models y ejecuta tu primer prompt esta noche.