API de imagen a video: opciones gratis, baratas y precios comparados

Las API de imagen a video cobran desde nada hasta 2,00 $ por un solo clip de 5 segundos. Aquí comparamos las rutas gratuitas, las opciones baratas por segundo y los costos ocultos, con precios revisados en octubre de 2026 y un ejemplo funcional de la API de PicassoIA.

API de imagen a video: opciones gratis, baratas y precios comparados
Cristian Da Conceicao
Fundador de Picasso IA

Un clip de cinco segundos hecho a partir de una sola imagen puede costar nada, un cuarto de dólar o dos dólares, según la API de imagen a video que llames y el nivel que elijas. Esa diferencia es la verdadera historia de los precios de este mes, y por eso echar un vistazo rápido a la página de un proveedor casi nunca predice lo que costará un proyecto. A continuación encontrarás las rutas gratuitas, las baratas, las caras, el cálculo para un clip de 5 segundos y los puntos donde el precio de la página no coincide con el de la factura.

💡 Los precios cambian cada mes. Todas las cifras de aquí se revisaron en octubre de 2026 frente a la página de un proveedor o a un rastreador citado. Úsalas como una referencia y confirma en la página del proveedor antes de comprometer un volumen.

Qué hace una API de imagen a video

Las manos de un fotógrafo sosteniendo una fotografía impresa de una montaña, ligeramente levantada de una mesa de madera

Una imagen dentro, un clip fuera

Envías una imagen como primer fotograma más un prompt corto de movimiento. La API devuelve un MP4, normalmente de 5 a 10 segundos, en resoluciones que van desde 480p hasta 4K. Muchos modelos ya generan audio sincronizado en la misma pasada, y eso cambia el precio (más sobre esto abajo). La imagen fija el sujeto, los colores y el encuadre, así que el resultado es mucho más predecible que el texto a video, donde el modelo lo inventa todo desde cero.

Las entradas se parecen en todos los proveedores: una URL de imagen o un archivo subido, un prompt escrito como descripción cronológica ("la cámara se acerca despacio mientras el vapor sube desde la taza"), una resolución, una duración y, a veces, una semilla para obtener resultados repetibles.

Por qué los trabajos son asíncronos

Vista cenital de un escritorio de nogal con un equipo portátil, un diagrama en una libreta y fotografías impresas

El render lleva su tiempo, así que casi todas las API de video funcionan en dos pasos: crear un trabajo y luego consultarlo hasta que el estado indique succeeded o failed. Los ejemplos de ejecución que aparecen en las propias páginas de modelos de PicassoIA muestran el rango: unos 30 a 80 segundos para clips de 5 segundos en Picasso IA Video, y entre 100 y 190 segundos aproximadamente para clips de 10 a 15 segundos en Seedance 2.5 Lite. Tu código tiene que esperar, reintentar y gestionar los fallos, y un trabajo fallido sigue costándote tiempo y, a veces, dinero.

API de imagen a video gratuitas

Un estudiante universitario escribiendo en un equipo portátil en un rincón silencioso de una biblioteca

"Gratis" tiene tres versiones, y solo una de ellas es gratuita como la gente espera.

Niveles gratuitos que existen

  • La API de PicassoIA. La documentación dice "API predictions are currently free. They use no credits," con un plan Infinite requerido. Los detalles están en la sección de PicassoIA más abajo.
  • Modelos abiertos alojados con un nivel gratuito. ModelsLab ofrece un nivel gratuito para la imagen a video de LTX 2.3 Fast y después cobra por uso.
  • Créditos de aplicaciones de consumo. Un rastreador anotó Kling 3.0 con 66 créditos diarios y Runway con 125 créditos mensuales a fecha de febrero. Son cuotas de la aplicación, no llamadas a la API, así que no construyas un producto sobre ellas.

💡 La trampa: los niveles gratuitos vienen con límites, colas y la palabra "currently" en sus condiciones. Son perfectos para probar prompts y arriesgados como único plan para un producto de pago.

Pesos abiertos en tu propia GPU

Un pequeño pasillo de centro de datos con filas de racks de servidores negros

Modelos abiertos como Wan 2.2 I2V, LTX Video y Stable Video Diffusion no tienen tarifa por clip. Pagas con hardware. Según lo reportado, Stable Video Diffusion necesita aproximadamente entre 10 y 16 GB de VRAM a 576x1024, y Wan 2.2 I2V A14B 24 GB o más a 720p. Hugging Face también aloja Spaces de demostración, pero espera colas.

Alquilar una GPU por hora devuelve la factura a un número por clip, así que mide los segundos de GPU que usa cada clip antes de llamarlo gratuito.

Precios baratos por segundo

Una calculadora de escritorio vintage junto a monedas, un recibo y un cronómetro

La facturación por segundo es la más fácil de comparar: multiplicas la tarifa por la duración del clip y obtienes el costo.

Cuánto cuestan cinco segundos

ModeloFuentePrecio por segundoClip de 5 segundos
Veo 3.1 Lite, 720pPágina de la API de Google Gemini$0.05$0.25
Veo 3.1 Fast, 720pPágina de la API de Google Gemini$0.10$0.50
Veo 3.1, 720pPágina de la API de Google Gemini$0.40$2.00
Kling 2.5 Turbo ProPágina de precios de fal$0.07$0.35
Kling 3.0, nivel ProPágina de precios de fal$0.14$0.70
Kling 3.0Rastreador externo, febrerounos $0.029unos $0.15
Imagen a video de MiniMax (dos modelos listados)Página de precios de fal$0.025 a $0.05$0.13 a $0.25

Las filas de Google incluyen audio. Seedance 2 se factura por token (0,014 $ por cada 1000 tokens en la página de fal), así que no puedes convertirlo en una tarifa por segundo sin saber cuántos tokens usa un clip. Haz un clip de prueba y revisa la factura.

La resolución también mueve la factura. En la página de Google, Veo 3.1 Fast cuesta 0,10 $ por segundo a 720p, 0,12 $ a 1080p y 0,30 $ a 4K. Mismo modelo, el triple de precio. Haz borradores a 720p y mejora solo los clips que vayas a conservar.

Mismo modelo, cuatro precios

Kling 3.0 aparece a unos 0,029 $ por segundo en un rastreador y a 0,14 $ en el nivel Pro de fal. La diferencia viene del nivel (estándar o pro), de si el audio está activado, del margen del revendedor y de la fecha de la captura. Compara lo comparable: misma resolución, misma duración, mismo ajuste de audio y mismo nivel.

Qué compra realmente lo barato

Los precios bajos suelen venir de variantes más pequeñas, no de un descuento sobre el modelo insignia. Una versión Lite o Fast cambia el máximo detalle y las resoluciones más altas por velocidad y volumen. Seedance 2.5 Lite, por ejemplo, está limitado a 480p y 720p a propósito. Para clips de redes sociales, bucles de producto y storyboards animados, es más que suficiente. Para una toma principal en 4K en la portada de un cliente, no lo es.

Sea cual sea el nivel que elijas, pruébalo con tus propias imágenes antes de comprar volumen. Las mismas pocas cosas rompen los clips en casi todos los modelos: manos en movimiento, texto legible dentro del encuadre, movimientos de cámara rápidos y multitudes de figuras pequeñas. Un sujeto tranquilo con un solo movimiento claro, como vapor, nubes que se desplazan, un acercamiento lento o un giro de cabeza, es donde los modelos baratos rinden mejor. Pasa cinco de tus fotos reales por un nivel barato y por uno intermedio, y compara los resultados lado a lado. Si no puedes distinguirlos al tamaño en que vas a publicar, gana el más barato.

Comparativa de precios lado a lado

Un hombre comparando tres hojas de cálculo impresas, una al lado de otra, sobre una mesa de conferencias

Modelos de facturación explicados

Estilo de facturaciónEjemploVentajaQué vigilar
Por segundoLa familia Veo 3.1 de GoogleCálculo sencilloEl audio y la resolución cambian la tarifa
Por tokenSeedance 2 en falClips cortos baratosDifícil de prever
CréditosApiframeUn solo saldo para muchos modelosLos créditos por segundo varían unas 7 veces
SuscripciónPlanes tipo RunwayFactura predecibleLa cuota no usada caduca
AutoalojadoWan 2.2 I2V, LTX VideoSin tarifa por clipGPU, configuración, mantenimiento

La diferencia en créditos es real. La tabla de agosto de Apiframe lista Seedance 1.5 Pro a 720p durante 4 segundos con 15 créditos, y Luma Ray 2 a 720p durante 5 segundos con 131 créditos. Eso equivale a unos 3,75 créditos por segundo frente a 26,2, unas siete veces más.

Las suscripciones siguen una regla sencilla de punto de equilibrio: cuota mensual dividida entre el costo por clip. Un rastreador situó los planes de Runway entre 12 y 76 $ al mes. Un plan de 12 $ equivale a unos 34 clips de 0,35 $ cada uno. Si haces menos clips que eso, paga por segundo.

Presupuesto para 100 clips

Esta es una toma por cada uno de 100 clips de 5 segundos a 720p:

ModeloCosto por clip100 clips
Veo 3.1 Lite$0.25$25
Kling 2.5 Turbo Pro$0.35$35
Veo 3.1 Fast$0.50$50
Kling 3.0 Pro$0.70$70
Veo 3.1$2.00$200

💡 Prevé los reintentos. Pocos prompts salen bien a la primera. Si necesitas una media de 3 tomas por clip utilizable, multiplica por 3 todos los números de esa tabla.

Qué opción te conviene

  • Probar prompts e ideas: usa una ruta gratuita, ya sea la API de PicassoIA o un nivel gratuito alojado, y acepta los límites.
  • Clips para redes sociales en volumen: un nivel Lite o Fast a 720p, como Veo 3.1 Lite o Kling 2.5 Turbo Pro, mantiene 100 clips entre 25 y 35 $ con una toma por clip.
  • Trabajo para clientes a 1080p o más: Veo 3.1 Fast o Kling 3.0 Pro, con un presupuesto de reintentos aparte.
  • Trabajo privado o sin conexión: pesos abiertos como Wan 2.2 I2V en tu propia GPU, si ya tienes el hardware.
  • Uso ocasional: evita las suscripciones, que solo compensan por encima del número de equilibrio indicado arriba.

La API de PicassoIA

Un desarrollador de software en un escritorio elevable con dos monitores que muestran código difuminado

Modelos y límites

La API está en https://api.picassoia.com/v1 y usa un token Bearer que empieza por pia_sk_. Los endpoints siguen el patrón conocido de Replicate: crear una predicción, consultarla y obtener la salida. Se exponen cuatro modelos:

Los límites importan en cualquier trabajo por lotes: 5 predicciones en curso a la vez por cuenta (una sexta devuelve 429 concurrency_limit), un cuerpo de solicitud de 10 MB, 5 MB por imagen en data URL, prompts de hasta 4000 caracteres y 2 tokens por cuenta.

Qué cuesta hoy

La documentación indica que las predicciones de la API son actualmente gratuitas y no usan créditos, y que el precio es "Free with the Infinite plan". Sin ese plan, crear una predicción devuelve 403 plan_required. Hay un matiz: la página de precios enumera API Access y MCP Connections como funciones nuevas de sus planes, mientras que la documentación exige Infinite. Toma la documentación como norma y revisa la página de planes antes de construir sobre ella. Y recuerda la palabra currently.

Una solicitud que funciona

Esta solicitud anima una foto con Seedance 2.5 Lite. Los parámetros van dentro de un objeto input:

curl -s -X POST https://api.picassoia.com/v1/models/picassoia/seedance-2.5-lite/predictions \
  -H "Authorization: Bearer $PICASSOIA_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{"input": {"image": "https://example.com/first-frame.jpg", "prompt": "The camera pushes in slowly as steam rises from the cup and morning light shifts across the table", "resolution": "720p", "duration": 5}}'

Recibes una respuesta 201 con un id, un status de starting, una URL de consulta y un eta. Consulta GET /v1/predictions/{id} hasta que el estado sea succeeded, failed o canceled. El bucle de Python documentado es corto:

import os, time, requests

API = "https://api.picassoia.com/v1"
HEADERS = {"Authorization": f"Bearer {os.environ['PICASSOIA_TOKEN']}"}

def run(model, input):
    r = requests.post(f"{API}/models/{model}/predictions", json={"input": input}, headers=HEADERS)
    p = r.json()
    if not r.ok:
        raise RuntimeError(f"{p['code']}: {p['detail']}")
    while p["status"] not in ("succeeded", "failed", "canceled"):
        time.sleep((p.get("eta") or {}).get("next_poll_in_seconds", 2))
        p = requests.get(p["urls"]["get"], headers=HEADERS).json()
    if p["status"] != "succeeded":
        raise RuntimeError(p["error"] or p["status"])
    return p["output"]

Cómo usar Seedance 2.5 Lite

No necesitas código si solo quieres unos cuantos clips. Seedance 2.5 Lite funciona desde la página del modelo, y su descripción dice que los miembros de Wonder pueden generar sin límites.

  1. Elige el primer fotograma. Sube la imagen que quieres animar. El clip la usa como fotograma inicial y hereda su relación de aspecto, así que el ajuste de relación de aspecto se ignora.
  2. Escribe el movimiento como una línea de tiempo. Describe qué se mueve primero, qué hace la cámara y cómo cambia la luz. Los prompts cinematográficos y cronológicos funcionan mejor.
  3. Empieza a 480p. Es el más rápido en renderizar. Cambia a 720p cuando el movimiento te convenza.
  4. Elige 5 o 10 segundos. Cinco segundos bastan para un avance de producto o un bucle para redes sociales.
  5. Decide sobre el audio. El audio sincronizado viene activado por defecto. Desactiva save_audio para un clip sin sonido.
  6. Fija una semilla cuando te guste un resultado y quieras reproducirlo. Añade una imagen de último fotograma si necesitas que el clip termine en una toma concreta.

Tres prompts iniciales para un movimiento tranquilo y de bajo riesgo:

  • Foto de producto: "Acercamiento lento sobre la botella mientras la luz suave de la ventana se desplaza por el cristal, nada más se mueve."
  • Retrato: "Ella gira la cabeza hacia la cámara y sonríe levemente, con el pelo moviéndose en una brisa suave y poca profundidad de campo."
  • Paisaje: "Las nubes se desplazan sobre la cresta, la niebla recorre el valle, la cámara sube despacio con la luz de la hora dorada."

¿Necesitas el primer fotograma en sí? Genéralo con Picasso IA Image, corrige los detalles con Picasso IA Image Editor Pro y luego anímalo. Picasso IA Video es la alternativa más sencilla: cada clip dura 5 segundos fijos a 24 fotogramas por segundo, a 480p o 720p.

Costos ocultos que vigilar

Un editor de video con auriculares alrededor del cuello revisando un fotograma en un estudio de edición con poca luz

Clips fallidos y repetidos

El precio por segundo es el precio de un intento. Manos que se deforman, caras que se desvían y un movimiento de cámara que ignora tu prompt significan otra toma. Con 3 tomas por clip utilizable, un clip de 0,25 $ cuesta en realidad 0,75 $. Pregunta a cada proveedor si las predicciones fallidas o canceladas se cobran, y lleva la cuenta de las tomas por clip utilizable en tu propio contenido, porque esa proporción cambia con cada modelo.

Audio, duración y concurrencia

  • El audio puede duplicar el precio. La misma tabla de Apiframe lista Seedance 1.5 Pro a 720p durante 4 segundos con 15 créditos, y 30 créditos con audio.
  • La duración escala la factura. Un clip de 10 segundos cuesta el doble que uno de 5 segundos en cualquier plan por segundo.
  • La concurrencia cuesta tiempo. Con 5 trabajos a la vez y alrededor de un minuto por clip, 100 clips suponen unos 20 minutos de espera. Los modelos más lentos lo estiran hasta horas.

Crea tu propio clip hoy

Una dueña de una tienda de cerámica colocando cuencos hechos a mano en una estantería de madera en una tienda luminosa

La forma más barata de saber cuánto costarán tus clips es hacer uno. Elige una foto que ya tengas, como una foto de producto, un paisaje o un retrato. Abre Seedance 2.5 Lite o Picasso IA Video en PicassoIA, añade un prompt de movimiento de una sola frase y renderiza un borrador a 480p. Después prueba tres variaciones del prompt y anota cuántas necesitaste para obtener un clip que publicarías.

Si necesitas un primer fotograma nuevo, créalo con Picasso IA Image y anímalo en la misma sesión. Cuando el borrador funcione, pasa a 720p y, si tu volumen lo justifica, llama a la API con la solicitud de arriba. Explora todos los modelos de video e imagen en picassoia.com/en/all-models y haz tu propia comparativa antes de comprometerte con un proveedor de pago.

Compartir este artículo

Elige tu idioma