Servidor MCP de generación de video: Veo, Kling y Seedance en un chat

Un servidor MCP de generación de video permite pedir clips a Veo, Kling y Seedance desde un solo chat, sin cambiar de pestaña. Este artículo muestra cómo funcionan las herramientas, los trabajos asíncronos y las consultas de estado, qué modelo encaja con cada plano, qué límites esperar y cómo escribir prompts que sobrevivan al primer render.

Servidor MCP de generación de video: Veo, Kling y Seedance en un chat
Cristian Da Conceicao
Fundador de Picasso IA

Tienes una pestaña de Veo abierta, una de Kling en otra ventana y una de Seedance que olvidaste cerrar, y el plano que buscas podría estar en cualquiera de las tres. Cada generador quiere su propio formato de prompt, su propio panel de ajustes y su propio botón de descarga. Un servidor MCP de generación de video sustituye esa rutina por una sola frase escrita en un chat: describes el clip, el asistente elige un modelo, envía el trabajo, comprueba su estado y te entrega un enlace. Este artículo explica cómo funciona esta configuración, qué hace mejor cada uno de Veo 3.1, Kling v3 Video y Seedance 2.5 Lite, y cómo escribir prompts que sobrevivan al primer render.

Por qué un solo chat gana a cinco pestañas

El costo de cambiar de pestaña

Cambiar de herramienta parece inofensivo hasta que cuentas los pasos. Copias un prompt en un sitio, esperas, descargas el archivo, le cambias el nombre, abres el siguiente sitio, pegas y te das cuenta de que el segundo modelo quiere el audio descrito de otra forma, así que reescribes. Al tercer intento ya no sabes qué semilla produjo qué clip, y la carpeta del escritorio es un montón de archivos llamados "final_v2_de_verdad".

Un hombre con una sudadera carbón revisando una ventana de chat en un equipo portátil sobre una mesa de cocina durante el desayuno

Un chat le da la vuelta a eso. La conversación misma se convierte en el archivo del proyecto: cada prompt, cada ajuste y cada enlace de resultado queda en un historial que puedes buscar después. El asistente también puede convertir un único brief creativo en tres prompts adaptados a cada modelo, que es la parte tediosa que nadie disfruta hacer a mano.

Qué hace realmente MCP

El Model Context Protocol es un estándar abierto, presentado por Anthropic a finales de 2024, que permite a una aplicación de chat hablar con herramientas externas de forma predecible. Un servidor anuncia una lista de herramientas. Cada herramienta tiene un nombre, una descripción en lenguaje sencillo y un esquema JSON que detalla sus entradas. La aplicación de chat muestra esa lista al modelo, el modelo decide cuándo encaja una herramienta, y la aplicación reenvía la llamada al servidor y devuelve el resultado a la conversación.

Los servidores se ejecutan en local por stdio o en remoto por HTTP, así que un servidor de video puede ser un pequeño proceso en tu equipo o un endpoint alojado al que te conectas una sola vez. Desde el punto de vista del chat, "haz un clip de cinco segundos de un cocinero en un mercado nocturno" deja de ser un deseo vago y se convierte en una llamada estructurada con un prompt, una duración y una resolución.

Primer plano de las manos de una mujer escribiendo en un equipo portátil junto a una taza de té humeante

💡 Consejo: Las descripciones de las herramientas importan más de lo que la gente espera. El modelo las lee para decidir qué herramienta llamar, así que un servidor que dice "genera un video a partir de un prompt de texto" se usa mucho más fiablemente que uno que dice "ejecuta trabajo".

Cómo gestiona el servidor los trabajos de video

Herramientas, esquemas y consultas de estado

El conector de PicassoIA es un buen ejemplo concreto porque su lista de herramientas es corta y legible. En el momento de escribir esto, expone estas herramientas:

HerramientaQué hace
generate_imageInicia un trabajo de generación de imágenes
edit_imageEdita una imagen existente
generate_video_picassoiaInicia un clip con PicassoIA Video
generate_video_seedanceInicia un clip con Seedance 2.5 Lite
get_generationConsulta un trabajo por su predict_id
list_generationsMuestra tus trabajos recientes
list_modelsEnumera los modelos que tu cuenta puede usar
get_accountDevuelve tu plan y tus límites de ejecución en paralelo
cancel_generationCancela un trabajo, salvo que la GPU ya esté renderizando el video

Cada herramienta de generación devuelve un predict_id en cuanto una GPU acepta el trabajo, junto con un tiempo estimado. Luego llamas a get_generation tras la espera sugerida, y de nuevo tras cada espera que devuelva, hasta que el estado sea succeeded o failed. Un fallo es definitivo, así que el asistente envía una generación nueva en lugar de reintentar la misma.

Por qué el video necesita trabajos asíncronos

Una llamada de texto a imagen responde en segundos. Un video no. Los ejemplos de renderizado en las páginas de los modelos dan una idea: los ejemplos de Veo 3.1 tardaron entre uno y dos minutos aproximadamente, los de Seedance 2.5 Lite unos dos o tres minutos, y los de Kling v3 Video entre cinco y dieciocho minutos según la duración y los ajustes. Una llamada de herramienta en un chat no puede esperar tanto.

Así que el servidor devuelve un ticket y deja que el asistente consulte su estado. Por eso también tu chat puede seguir hablando mientras se renderiza un clip: pide el prompt del siguiente plano mientras se cocina el primero.

Cómo es una sesión

Así es un intercambio realista una vez conectado el servidor:

  1. Escribes: "Haz un clip de 5 segundos en 16:9 de un cocinero lanzando fideos en un mercado al atardecer, con luces cálidas y sonido de chisporroteo."
  2. El asistente elige la herramienta de video, completa el prompt, la duración y la resolución, y envía el trabajo.
  3. El servidor responde con un predict_id y un tiempo estimado.
  4. El asistente espera el intervalo sugerido, llama a get_generation, ve que el trabajo sigue procesándose y vuelve a esperar.
  5. El estado cambia a succeeded y el asistente publica el enlace del MP4 en el chat.
  6. Dices "el mismo plano, pero el cocinero mira a la cámara", y el asistente reenvía con la misma semilla y una línea de movimiento editada.

Todo el ciclo ocurre dentro de una sola ventana, y nada de esto te obliga a leer una referencia de API.

Cinco trabajos a la vez

La documentación de la API de PicassoIA indica 5 predicciones simultáneas por cuenta, compartidas entre tu acceso a la API y tus conexiones MCP. Para un storyboard de ocho planos, eso significa que el asistente debe enviar cinco, consultar su estado y encolar el resto a medida que se liberen huecos. Puedes decirlo en palabras sencillas: "Ejecuta los planos en lotes de cinco y publica cada enlace en cuanto termine."

Las manos de un desarrollador escribiendo en un escritorio de una oficina en casa con poca luz y una pequeña suculenta cerca

Tres modelos, tres fortalezas

Ningún modelo gana en todos los planos, y ese es el verdadero argumento para tener varios detrás de un solo chat. Esto es lo que dicen las páginas de los modelos sobre para qué está pensado cada uno.

Cuando importan el realismo y el sonido

Veo 3.1 convierte un prompt de texto en metraje 1080p con audio consciente del contexto, de modo que el tintineo, el viento o las voces llegan sincronizados con la imagen. Los clips duran 4, 6 u 8 segundos en 16:9 o 9:16. Puedes fijar un primer fotograma y un último fotograma para interpolar entre dos momentos, o darle hasta tres imágenes de referencia para mantener un sujeto coherente entre planos. Un campo de prompt negativo te permite excluir lo que no quieres. Una versión más rápida, Veo 3.1 Fast, existe para borradores más ágiles.

Recurre a él cuando el plano sea un momento creíble del mundo real: un coche en una carretera costera, una conversación en una cafetería, un producto sobre una mesa con sonido ambiente natural.

Vista aérea de un descapotable crema en una carretera costera sinuosa al atardecer dorado

Cuando necesitas control de varios planos

Kling v3 Video es la opción de formato largo. Produce clips de hasta 15 segundos y admite guion de varios planos: defines hasta 6 escenas, cada una con su propio prompt y duración, dentro de una sola generación. El modo estándar renderiza en 720p y el modo pro en 1080p. Puedes fijar el primer y el último fotograma con imágenes, elegir 16:9, 9:16 o 1:1, y añadir un prompt negativo. La generación de audio es un interruptor que viene desactivado por defecto, así que indícale al chat que lo active cuando quieras sonido.

Es el que usas cuando un clip necesita un pequeño arco, como un plano general, un primer plano y una reacción, sin tener que unir tres archivos separados. Prepárate para los tiempos de espera más largos del grupo.

Fotografía en contrapicado de una bailarina congelada en mitad de un giro en un estudio luminoso con un vestido de lino que ondea

Cuando quieres iteraciones rápidas

Seedance 2.5 Lite está pensado para el volumen. Genera clips de 5 o 10 segundos a 480p o 720p, con audio sincronizado activado por defecto, a partir de texto o de una imagen inicial, y acepta una semilla que puedes fijar para reproducir un resultado. Su página de modelo lo describe como ilimitado para los miembros de Wonder, lo que lo convierte en el modelo natural para probar diez variaciones de prompt antes de comer. Existen hermanos más grandes si necesitas más: Seedance 2.5 figura con clips de hasta 30 segundos, y Seedance 2.0 ofrece texto a video con audio integrado.

Un cocinero de comida callejera lanzando fideos en un wok ennegrecido en un mercado al atardecer

Elegir el modelo adecuado para cada plano

Cuando pones las especificaciones una al lado de otra, las decisiones de enrutado se hacen más fáciles. Los tiempos de renderizado proceden de las generaciones de ejemplo de cada página de modelo, así que tómalos como cifras aproximadas, no como promesas.

Veo 3.1Kling v3 VideoSeedance 2.5 Lite
Duración del clip4, 6 u 8 segundosHasta 15 segundos5 o 10 segundos
Resolución máxima1080p1080p (modo pro)720p
AudioActivado por defectoDesactivado por defecto, se puede activarActivado por defecto
Varios planos en una sola ejecuciónNoHasta 6 escenasNo
Primer y último fotogramaSíSíSí (el último fotograma necesita un primero)
Imágenes de referenciaHasta 3NoNo
Tiempo de renderizado de ejemplo1 a 2 minutos5 a 18 minutos2 a 3 minutos

Vista cenital de nueve tarjetas de storyboard, un cronómetro y una taza de café sobre un escritorio de madera

Una regla práctica de enrutado que funciona bien:

  • Diálogo, sonido ambiente, localizaciones creíbles: Veo 3.1.
  • Una mini historia con varias escenas en un solo archivo: Kling v3 Video.
  • Borradores rápidos, muchas variaciones, bucles para redes sociales: Seedance 2.5 Lite.

💡 Consejo: Haz los borradores en el modelo rápido y termina en el lento. Fija la idea, el encuadre y el movimiento con iteraciones rápidas, y reserva los renders largos para los planos que ya hayas aprobado.

Los clips en bruto rara vez son el último paso. PicassoIA también ofrece edición de video, escalado de video y un amplio catálogo de efectos visuales, que es donde añades un acabado estilizado o una pasada de limpieza después de que el generador haya hecho su trabajo. La lista completa está en picassoia.com/en/all-models.

Escribir prompts que el chat puede reutilizar

Las listas de planos ganan a los adjetivos

La página del modelo Seedance 2.5 Lite dice que funcionan mejor las descripciones cinematográficas y cronológicas, y el mismo hábito ayuda con cualquier modelo de video. Describe lo que pasa en orden, como lo leería un director en una lista de planos, en lugar de acumular adjetivos como "épico" y "espectacular". El modelo no puede filmar un adjetivo, pero sí puede filmar a un cocinero que lanza los fideos una vez mientras las llamas se avivan.

Una mano con una pluma estilográfica escribiendo una lista de planos en una libreta junto a un carrete de película de latón

Una plantilla de prompt que funciona

Una estructura de cuatro líneas mantiene coherentes los prompts cuando el asistente los reescribe para distintos modelos:

Subject and starting pose.
What moves, in order, over the clip.
Camera move.
Light and sound.

Ya completada, queda así:

Un cocinero de comida callejera con delantal de lona sostiene un wok sobre una llama de gas. Lanza los fideos una vez, las llamas se avivan, el vapor avanza hacia la lente. Acercamiento lento desde la altura del pecho. Luces cálidas en lo alto, aceite chisporroteando y murmullo del mercado.

Después pide al chat que lo adapte a cada modelo. Para Veo 3.1, detalla el sonido, porque el audio sigue al prompt. Para Kling v3 Video, divide los momentos en escenas y haz que las duraciones de los planos sumen la duración total, con al menos un segundo por plano. Para Seedance 2.5 Lite, mantenlo en un solo párrafo fluido y fija la semilla cuando te guste el resultado.

Si el modelo de chat es flojo describiendo planos, redacta los prompts con un redactor más potente como Claude Sonnet 5 o Gemini 3.5 Flash y pega el resultado en la conversación.

Cómo corregir un primer render flojo

Cambia una variable a la vez. Fija la semilla y edita solo la línea de movimiento. Unos cuantos hábitos ahorran horas:

  • El sujeto se desvía: aporta una imagen de primer fotograma para que el modelo parta de un aspecto fijo.
  • Aparecen objetos no deseados: usa el campo de prompt negativo que ofrecen Veo 3.1 y Kling v3 Video.
  • El clip se ve recargado: acórtalo. Un clip de cinco segundos con una sola acción es mejor que uno de diez con tres.

💡 Consejo: Combina las herramientas. Genera una imagen fija con la herramienta de imágenes, aprueba el encuadre y luego introdúcela como primer fotograma para que el video empiece exactamente donde quieres.

Cómo usar Seedance 2.5 Lite

Seedance 2.5 Lite es la primera parada práctica porque es rápido, gestiona el audio por defecto y es una de las dos herramientas de video del conector. Este es el flujo en PicassoIA:

  1. Abre la página de Seedance 2.5 Lite, o pide a tu chat que llame a generate_video_seedance.
  2. Escribe el prompt en orden cronológico usando la plantilla de cuatro líneas de arriba.
  3. Elige una duración de 5 o 10 segundos. Usa 5 mientras pruebas.
  4. Elige una resolución. 480p se renderiza más rápido y sirve para borradores; 720p es más nítido y sirve para la versión que te quedas.
  5. Elige una relación de aspecto, o sube una imagen para usarla como fotograma de apertura. Con una imagen, el clip coincide con la imagen e ignora el ajuste de relación.
  6. Deja guardar audio activado, a menos que quieras un clip sin sonido.
  7. Fija una semilla si quieres reproducir el resultado más adelante.
  8. Envía, consulta hasta que el trabajo tenga éxito y abre el enlace devuelto.
AjusteOpcionesCuándo cambiarlo
Duración5 o 10 segundosPasa a 10 cuando la acción necesite espacio
Resolución480p o 720p480p para borradores, 720p para los definitivos
Relación de aspecto16:9, 9:16, 1:1, 4:3, 3:4, 3:2, 2:3Ajústala a la plataforma donde publicas
Imagen de entradaOpcionalFija el aspecto del primer fotograma
Imagen del último fotogramaOpcional, necesita una imagen de entradaControla cómo termina el plano
SemillaCualquier enteroReproduce o compara tomas
Guardar audioActivado o desactivadoDesactivado para material de relleno sin sonido

El mismo flujo para Veo y Kling

Los pasos sirven igual con algunos cambios. En Veo 3.1, elige 4, 6 u 8 segundos y 720p o 1080p. Las imágenes de referencia solo funcionan con 16:9 y 8 segundos, y el último fotograma se ignora cuando hay referencias. En Kling v3 Video, elige el modo estándar (720p) o pro (1080p), activa el audio, mantén el prompt por debajo de 2.500 caracteres y añade una lista de varios planos cuando quieras varias escenas.

Límites con los que contar

Cola, reintentos y fallos

  • Límite paralelo: 5 predicciones simultáneas por cuenta, compartidas entre conexiones. Planifica tus lotes de cinco en cinco.
  • Fallos definitivos: consultar un trabajo fallido no lo recuperará. El asistente debe enviar uno nuevo, idealmente con un prompt más sencillo.
  • Tamaño del prompt: la API de PicassoIA acepta prompts de hasta 4.000 caracteres, y Kling v3 Video limita el suyo a 2.500, así que escribe primero la versión más corta.
  • Cancelación: un trabajo puede cancelarse hasta que la GPU empiece a renderizar el video. A partir de ahí se ejecuta hasta el final.

Un cronómetro antiguo junto a una claqueta sobre una mesa de trabajo de hormigón

Lo que el conector no hace

Conviene ser honesto con el alcance. En el momento de escribir esto, el conector de PicassoIA incluye cuatro modelos: un generador de imágenes, un editor de imágenes, PicassoIA Video y Seedance 2.5 Lite. Veo 3.1 y Kling v3 Video funcionan desde el sitio de PicassoIA, y llevarlos al mismo chat requeriría un servidor MCP propio que envuelva las APIs de sus proveedores.

Ejecuta list_models en tu propia cuenta para ver qué está expuesto hoy, y consulta picassoia.com/en/pricing para comprobar qué planes incluyen conexiones MCP antes de montar un flujo de trabajo sobre ellas.

Crea tu primer clip hoy

Elige un plano que normalmente filmarías o comprarías como metraje de stock, escríbelo como prompt de cuatro líneas y pásalo por los tres modelos. Empieza con Seedance 2.5 Lite para un borrador rápido, envía la versión aprobada a Veo 3.1 para un sonido realista o a Kling v3 Video para un corte de varios planos, y compara los resultados lado a lado. En una tarde sabrás hacia qué modelo se inclina tu estilo.

Puedes probarlo todo en PicassoIA. Genera una imagen fija con uno de los modelos de imagen, úsala como primer fotograma y mira cómo se mueve. Explora el catálogo completo en picassoia.com/en/all-models y ejecuta tu primer prompt esta noche.

Compartir este artículo

Elige tu idioma