Servidor MCP de Veo 3.1: genera videos de Veo en Claude y Gemini

Un servidor MCP de Veo 3.1 permite que Claude y Gemini inicien renders de video de Google, consulten el estado del trabajo y guarden el MP4 por ti. Mira los nombres reales de las herramientas, los bloques de configuración para Claude Desktop, Claude Code y Gemini CLI, los precios por segundo y los patrones de prompt que dan mejores clips.

Servidor MCP de Veo 3.1: genera videos de Veo en Claude y Gemini
Cristian Da Conceicao
Fundador de Picasso IA

Escribir una frase en Claude y recibir de vuelta un video terminado con sonido ya no es un truco de laboratorio. Con un servidor MCP de Veo 3.1, es una llamada a herramienta normal: tu cliente envía el prompt al modelo de video de Google, espera mientras se renderiza el clip y guarda el MP4 en una carpeta que elijas. El problema es que nada funciona listo para usar. Tienes que elegir un servidor, conectarlo a Claude o Gemini y revisar la facturación antes del primer render, para que no se coma tu presupuesto.

Este artículo recorre esa configuración con nombres de herramientas reales, bloques de configuración reales y precios por segundo reales, y después muestra la alternativa sin configuración en PicassoIA. Todo lo que se dice de los servidores de terceros procede de sus README y fichas públicas, así que tómalo como una lista de lectura, no como un informe de pruebas.

Manos escribiendo en un equipo portátil con un fotograma pausado de un video del océano en la pantalla

Qué hace un servidor MCP de Veo

MCP, el Model Context Protocol, es el estándar abierto que permite a un cliente de IA llamar a herramientas externas. Un servidor MCP de Veo es un pequeño programa que expone la generación de video como un conjunto de herramientas. Tu cliente lo inicia como un proceso local, lee la lista de herramientas y llama a esas herramientas cada vez que pides un clip.

¿Por qué no llamar directamente a la API de Gemini? Puedes hacerlo, y un script corto de Python hace el trabajo. Un servidor MCP se justifica cuando quieres que la conversación dirija el trabajo: Claude redacta la lista de planos, elige la configuración, inicia el render, revisa cómo va y te dice dónde quedó el archivo, todo en un mismo hilo.

Un pequeño minipc sin ventilador sobre una estantería de roble con un solo cable ethernet

Las tres piezas que intervienen

Cada configuración tiene las mismas tres capas, sea cual sea el servidor que elijas.

PiezaEjemploFunción
ClienteClaude Desktop, Claude Code, Gemini CLIRecibe tu petición y decide qué herramienta llamar
ServidorUn paquete de Python iniciado con uvxConvierte las llamadas a herramientas en peticiones a la API de Gemini
ModeloVeo 3.1Renderiza el video y su audio

El servidor guarda tu credencial de Google, así que es la pieza que más conviene revisar.

Por qué el video necesita herramientas asíncronas

Una respuesta de texto llega en segundos. Un video, no. El README de un servidor cita tiempos de render de entre 11 segundos y 6 minutos según el prompt, y otro inicia el trabajo en segundo plano, devuelve un ID de trabajo y le indica al cliente que consulte el estado cada 15 a 20 segundos. Ese patrón importa, porque los clientes de chat abandonan las llamadas a herramientas que se alargan demasiado.

💡 Si un servidor se queda bloqueado hasta que el video está terminado, prepárate para que se agote el tiempo de espera en renders largos. Prefiere los servidores con una herramienta que inicia el trabajo y otra aparte que consulta su estado.

Servidores de la comunidad y sus herramientas

Google distribuye Veo a través de la API de Gemini, y la comunidad lo ha encapsulado en varios servidores MCP. Ninguno es obra de Google ni de PicassoIA. Los detalles de abajo proceden del servidor alohc en GitHub, la ficha de Gemini Media MCP, visualgen mcp y mcp-veo de AceDataCloud.

Un desarrollador con barba leyendo código en un monitor ancho en un apartamento tipo estudio al atardecer

Las herramientas que vas a encontrar

ServidorHerramientasLímites
alohc veo-mcp-servergenerate_video, animate_image, extend_video_clip, generate_video_with_style, list_veo_models4, 6 u 8 segundos, 720p o 1080p, 16:9 o 9:16
Gemini Media MCPveo_generate_video, veo_image_to_video, veo_interpolate_video, veo_extend_video, veo_check_job, veo_list_jobs y tres herramientas de utilidad720p, 1080p o 4K, lotes de 1 a 4 videos
visualgen mcpUn generador de imágenes más Veo 3.1 en los niveles lite, fast y standardDe 720p hasta 4K, imagen a video opcional
mcp-veo (AceDataCloud)Texto a video, imagen a video, escalado a 1080p, seguimiento de tareasFunciona a través de la API de AceDataCloud, no directamente con Google

Tres tipos de herramienta se repiten en todas partes: texto a video, imagen a video y extensión. La extensión añade unos 7 segundos a un clip existente, pero un README la limita a 720p y a 148 segundos en total, y Veo 3.1 Lite no admite extensión en absoluto.

El modelo por defecto del servidor alohc es veo-3.1-generate-preview, y el servidor Gemini Media MCP ofrece una variante estándar y otra rápida. Cuando un servidor te deja elegir el modelo por su nombre, escribe esa elección en tu prompt para que el cliente no tenga que adivinar.

Elige uno que puedas auditar

Estos programas se ejecutan en tu equipo con tu credencial de Google en su entorno. Antes de instalar uno:

  • Lee el código fuente, ya que cada uno es lo bastante corto como para revisarlo por encima.
  • Fija una versión en lugar de seguir la última publicación.
  • Crea una credencial de Google exclusiva para él, así podrás revocarla sin romper nada más.
  • Configura una alerta de presupuesto en la cuenta de facturación, porque un bucle descontrolado se cobra por segundo de video.

Conecta Veo a Claude

Claude se conecta a servidores MCP de dos maneras: Claude Desktop mediante un archivo de configuración JSON, y Claude Code mediante un solo comando. Ambos inician el mismo paquete de servidor.

Una mujer trabajando en un equipo portátil en una mesa de mármol de una cafetería junto a una ventana a la calle

Configuración en Claude Desktop

  1. Instala uv, el ejecutor de Python que proporciona uvx.
  2. En Claude Desktop, abre Settings, luego Developer y después Edit Config.
  3. Añade un bloque de servidor como este:
{
  "mcpServers": {
    "veo": {
      "command": "uvx",
      "args": ["veo-mcp-server"],
      "env": {
        "VIDEO_OUTPUT_DIR": "./videos"
      }
    }
  }
}
  1. Añade tu credencial de Gemini en ese mismo bloque env, usando el nombre de variable que liste el README que hayas elegido.
  2. Cierra Claude Desktop por completo y vuelve a abrirlo. Las herramientas de Veo deberían aparecer en el menú de herramientas.

💡 Las variables de la carpeta de salida cambian según el servidor. Un README usa VIDEO_OUTPUT_DIR, otro usa VEO_OUTPUT_DIR. Copia el nombre del proyecto que instalaste.

Si las herramientas no aparecen, valida primero el JSON, porque una sola coma final rompe todo el archivo. Después confirma que uvx está en tu PATH y que has cerrado la aplicación en lugar de solo cerrar la ventana.

Configuración en Claude Code

Un solo comando registra el servidor para cada proyecto que abras:

claude mcp add veo -s user -- uvx veo-mcp-server

Pasa tu credencial con el flag -e y luego ejecuta /mcp para confirmar que el servidor aparece como conectado. Después, un prompt como "Genera un clip vertical de 6 segundos de lluvia en la ventana de un tranvía, sin música, y dime dónde se guarda el archivo" produce una llamada de inicio, varias comprobaciones de estado y, al final, una ruta de archivo. En tu primera prueba, pide un clip de 4 segundos a 720p, para que una configuración errónea o un prompt vago te cueste céntimos y no dólares.

Conecta Veo a Gemini

Tienes dos caminos. Gemini CLI puede cargar los mismos servidores MCP, y la aplicación de Gemini puede generar clips de Veo por su cuenta.

Vista cenital de un escritorio con un teléfono reproduciendo un video de una costa junto a un equipo portátil

Configuración de Gemini CLI

Gemini CLI lee ~/.gemini/settings.json y espera los servidores dentro de un objeto mcpServers, con la misma estructura que usa Claude:

{
  "mcpServers": {
    "veo": {
      "command": "uvx",
      "args": ["veo-mcp-server"],
      "env": {
        "VIDEO_OUTPUT_DIR": "./videos"
      }
    }
  }
}

Añade también aquí la variable de la credencial, reinicia la CLI y ejecuta /mcp para listar todas las herramientas que ha cargado. Gemini CLI también admite servidores SSE y HTTP en streaming, así que un servidor alojado funciona igual, siempre que sea uno en el que confíes.

Si quieres que un modelo de chat redacte listas de planos antes de gastar nada en render, Gemini 3.5 Flash es rápido para borradores aproximados, y Gemini 3.1 Pro va mejor con guiones más largos.

La aplicación de Gemini sin MCP

La aplicación de Gemini también puede generar videos de Veo directamente en los planes compatibles. Esa vía sirve para clips puntuales. No ofrece scripts, ni lotes, ni una ruta de archivo que controles. En cuanto necesitas resultados repetibles, MCP gana.

Prompts que dan mejores clips

Veo 3.1 renderiza clips de 4, 6 u 8 segundos en 16:9 o 9:16, con audio generado junto a la imagen. Acepta un prompt negativo, una semilla, hasta 3 imágenes de referencia y un primer y último fotograma. Los ejemplos del propio modelo en PicassoIA escriben el diálogo y el sonido de la habitación directamente en el prompt, así que trata el prompt como un guion y no como una lista de etiquetas.

Las manos de un cineasta dibujando un storyboard a lápiz junto a un fotómetro antiguo

Plano, sujeto, movimiento, sonido

Construye cada prompt en cuatro partes:

  1. Plano: lente, ángulo y distancia, como "contrapicado, 35 mm, empuje lento hacia delante".
  2. Sujeto: quién o qué aparece en pantalla, con dos o tres detalles concretos.
  3. Movimiento: qué cambia a lo largo del clip, y en qué orden.
  4. Sonido: ruido ambiente, música o diálogo entre comillas.

El sonido es la parte que más gente se salta. El modelo genera audio por defecto, así que describe el ambiente de la sala y cualquier frase hablada, y escribe "sin música" cuando solo quieras sonido natural. Si tu herramienta tiene un interruptor de audio, desactivarlo te da un metraje silencioso que puedes musicalizar después tú mismo.

Un ejemplo práctico: Contrapicado, 35 mm, empuje lento hacia delante sobre una taza de cerámica con té en un alféizar lluvioso. El vapor sube en espiral y una gota de lluvia resbala por el cristal de detrás. Lluvia suave, la campana lejana de un tranvía, sin música.

Prompt débilPrompt sólido
Un video genial de la ciudadToma aérea que se aleja sobre un mercado callejero bajo la lluvia al atardecer, los vendedores bajando los toldos, bombillas de cuerda cálidas reflejándose en el asfalto mojado, trueno lejano y voces murmurando
Una persona hablandoPlano medio de una mujer con abrigo de lana en un andén de tren, dice "El último que llegue a casa apaga las luces", y de fondo resuena el anuncio de la estación

💡 Pon lo que no quieres, como textos superpuestos o temblor de cámara en mano, en el prompt negativo en lugar de en el prompt principal.

Primer fotograma y último fotograma

La imagen a video te da el control máximo. Define image como primer fotograma y last_frame como último, y el modelo construye la transición entre ambos. Las entradas ideales coinciden con la relación de salida, unos 1280x720 para 16:9 o 720x1280 para 9:16. Puedes generar esas imágenes fijas con PicassoIA Image, que ofrece ambas relaciones.

Dos límites que conviene recordar: las imágenes de referencia solo funcionan con 16:9 y 8 segundos, y el último fotograma se ignora siempre que haya imágenes de referencia.

El costo real por clip

El servidor MCP en sí no cuesta nada. Google cobra la API de Gemini por segundo de video, con el audio incluido, y el mismo clip puede costar 8 veces más o menos según el nivel que elijas.

Una calculadora, un cronómetro y una libreta sobre una mesa de nogal oscuro

Tarifas por segundo

Tarifas publicadas de la API de Gemini en el momento de escribir esto:

Nivel720p1080p4K8 segundos a 1080p
Veo 3.1$0.40$0.40$0.60$3.20
Veo 3.1 Fast$0.10$0.12$0.30$0.96
Veo 3.1 Lite$0.05$0.08No disponible$0.64

Consulta la página de precios de Google antes de presupuestar, porque las tarifas cambian. A 1080p y 4K, los clips duran 8 segundos.

Elige el nivel adecuado

  • Haz borradores con Lite o Fast a 720p. Un borrador de 8 segundos en Fast cuesta $0.80, y un borrador en Lite cuesta $0.40.
  • Renderiza el resultado final en el nivel estándar de Veo 3.1 cuando la calidad sea lo más importante. Lite no tiene 4K ni extensión.
  • Procesa por lotes con un tope. Veinte clips sociales de 8 segundos suman 160 segundos de video: $8.00 en Lite a 720p, $19.20 en Fast a 1080p, $64.00 en estándar a 1080p.

💡 Diez borradores de 8 segundos a 720p cuestan $8 en Fast y $32 en estándar. Itera barato y paga una sola vez por la versión final.

Un costo más que no aparece en la factura: el README de alohc advierte de que los videos generados permanecen en los servidores de Google durante unos 2 días. Asegúrate de que tu servidor descargue cada archivo al disco el mismo día.

Cómo usar Veo 3.1 en PicassoIA

Olvídate de las credenciales, los archivos de configuración y la cuenta de facturación. La página del modelo en PicassoIA ofrece los mismos controles en el navegador, y el clip aparece en tu galería listo para descargar.

Un joven viendo la vista previa de una autopista del desierto en un monitor grande en un estudio

Ajustes que importan

  1. Abre Veo 3.1 en PicassoIA.
  2. Escribe tu prompt usando las cuatro partes de arriba.
  3. Elige las opciones de la tabla de abajo.
  4. Opcionalmente, añade un primer fotograma, un último fotograma, hasta 3 imágenes de referencia, un prompt negativo o una semilla.
  5. Genera, previsualiza y descarga el MP4.
AjusteOpcionesPor defecto
Duración4, 6 u 8 segundos8
Resolución720p o 1080p1080p
Relación de aspecto16:9 o 9:1616:9
AudioActivado o desactivadoActivado

Veo 3.1 Fast usa los mismos ajustes salvo las imágenes de referencia, que no ofrece. Elígelo para borradores rápidos: los ejemplos de Fast en su página se renderizaron en 45 a 59 segundos, mientras que los del modelo estándar tardaron entre 73 y 114 segundos aproximadamente.

PicassoIA a través de MCP

PicassoIA también tiene una API para desarrolladores en https://api.picassoia.com/v1, con endpoints de predicción al estilo de Replicate y autenticación Bearer, además de un conector MCP. Ambos exponen cuatro modelos: un modelo de imagen, un editor de imágenes, un modelo de video y Seedance 2.5 Lite con audio. Veo 3.1 no está en esa lista, así que para Veo usas la página del modelo, y para generar video mediante scripts dentro de Claude puedes llamar a PicassoIA Video o a Seedance 2.5 Lite. Cada cuenta ejecuta hasta 5 predicciones a la vez, compartidas entre todas las conexiones.

Haz tu primer clip

Elige una frase que podrías filmar en un solo plano. Una mano vertiendo té, un tranvía cruzando un puente, un perro esperando junto a una puerta. Las escenas cortas y concretas le dan a Veo el objetivo más claro, y repetirlas cuesta lo mínimo.

Un cineasta en una azotea al atardecer sosteniendo una tableta con un clip terminado

Tres errores que conviene evitar

  1. Olvidar la caducidad. Los videos que quedan en el lado de Google desaparecen tras unos 2 días, así que descárgalos.
  2. Hacer borradores en 4K. Haz borradores baratos y termina una sola vez.
  3. Saltarse la herramienta de estado. Los clientes que esperan una llamada larga agotan el tiempo de espera. Usa los ID de trabajo y consulta el estado.

¿Listo para probarlo tú? Abre PicassoIA, genera un primer fotograma con PicassoIA Image y luego anímalo con Veo 3.1. Cambia un detalle por render, compara los resultados con Seedance 2.5 Lite y guarda las versiones que te gusten. Tus propias imágenes y videos están a un prompt de distancia en PicassoIA, y la lista completa de modelos te espera en picassoia.com/en/all-models.

Compartir este artículo

Elige tu idioma