API de imagen a video: opciones gratis, baratas y precios comparados
Las API de imagen a video cobran desde nada hasta 2,00 $ por un solo clip de 5 segundos. Aquí comparamos las rutas gratuitas, las opciones baratas por segundo y los costos ocultos, con precios revisados en octubre de 2026 y un ejemplo funcional de la API de PicassoIA.
Un clip de cinco segundos hecho a partir de una sola imagen puede costar nada, un cuarto de dólar o dos dólares, según la API de imagen a video que llames y el nivel que elijas. Esa diferencia es la verdadera historia de los precios de este mes, y por eso echar un vistazo rápido a la página de un proveedor casi nunca predice lo que costará un proyecto. A continuación encontrarás las rutas gratuitas, las baratas, las caras, el cálculo para un clip de 5 segundos y los puntos donde el precio de la página no coincide con el de la factura.
💡 Los precios cambian cada mes. Todas las cifras de aquí se revisaron en octubre de 2026 frente a la página de un proveedor o a un rastreador citado. Úsalas como una referencia y confirma en la página del proveedor antes de comprometer un volumen.
Qué hace una API de imagen a video
Una imagen dentro, un clip fuera
Envías una imagen como primer fotograma más un prompt corto de movimiento. La API devuelve un MP4, normalmente de 5 a 10 segundos, en resoluciones que van desde 480p hasta 4K. Muchos modelos ya generan audio sincronizado en la misma pasada, y eso cambia el precio (más sobre esto abajo). La imagen fija el sujeto, los colores y el encuadre, así que el resultado es mucho más predecible que el texto a video, donde el modelo lo inventa todo desde cero.
Las entradas se parecen en todos los proveedores: una URL de imagen o un archivo subido, un prompt escrito como descripción cronológica ("la cámara se acerca despacio mientras el vapor sube desde la taza"), una resolución, una duración y, a veces, una semilla para obtener resultados repetibles.
Por qué los trabajos son asíncronos
El render lleva su tiempo, así que casi todas las API de video funcionan en dos pasos: crear un trabajo y luego consultarlo hasta que el estado indique succeeded o failed. Los ejemplos de ejecución que aparecen en las propias páginas de modelos de PicassoIA muestran el rango: unos 30 a 80 segundos para clips de 5 segundos en Picasso IA Video, y entre 100 y 190 segundos aproximadamente para clips de 10 a 15 segundos en Seedance 2.5 Lite. Tu código tiene que esperar, reintentar y gestionar los fallos, y un trabajo fallido sigue costándote tiempo y, a veces, dinero.
API de imagen a video gratuitas
"Gratis" tiene tres versiones, y solo una de ellas es gratuita como la gente espera.
Niveles gratuitos que existen
La API de PicassoIA. La documentación dice "API predictions are currently free. They use no credits," con un plan Infinite requerido. Los detalles están en la sección de PicassoIA más abajo.
Modelos abiertos alojados con un nivel gratuito. ModelsLab ofrece un nivel gratuito para la imagen a video de LTX 2.3 Fast y después cobra por uso.
Créditos de aplicaciones de consumo. Un rastreador anotó Kling 3.0 con 66 créditos diarios y Runway con 125 créditos mensuales a fecha de febrero. Son cuotas de la aplicación, no llamadas a la API, así que no construyas un producto sobre ellas.
💡 La trampa: los niveles gratuitos vienen con límites, colas y la palabra "currently" en sus condiciones. Son perfectos para probar prompts y arriesgados como único plan para un producto de pago.
Pesos abiertos en tu propia GPU
Modelos abiertos como Wan 2.2 I2V, LTX Video y Stable Video Diffusion no tienen tarifa por clip. Pagas con hardware. Según lo reportado, Stable Video Diffusion necesita aproximadamente entre 10 y 16 GB de VRAM a 576x1024, y Wan 2.2 I2V A14B 24 GB o más a 720p. Hugging Face también aloja Spaces de demostración, pero espera colas.
Alquilar una GPU por hora devuelve la factura a un número por clip, así que mide los segundos de GPU que usa cada clip antes de llamarlo gratuito.
Precios baratos por segundo
La facturación por segundo es la más fácil de comparar: multiplicas la tarifa por la duración del clip y obtienes el costo.
Las filas de Google incluyen audio. Seedance 2 se factura por token (0,014 $ por cada 1000 tokens en la página de fal), así que no puedes convertirlo en una tarifa por segundo sin saber cuántos tokens usa un clip. Haz un clip de prueba y revisa la factura.
La resolución también mueve la factura. En la página de Google, Veo 3.1 Fast cuesta 0,10 $ por segundo a 720p, 0,12 $ a 1080p y 0,30 $ a 4K. Mismo modelo, el triple de precio. Haz borradores a 720p y mejora solo los clips que vayas a conservar.
Mismo modelo, cuatro precios
Kling 3.0 aparece a unos 0,029 $ por segundo en un rastreador y a 0,14 $ en el nivel Pro de fal. La diferencia viene del nivel (estándar o pro), de si el audio está activado, del margen del revendedor y de la fecha de la captura. Compara lo comparable: misma resolución, misma duración, mismo ajuste de audio y mismo nivel.
Qué compra realmente lo barato
Los precios bajos suelen venir de variantes más pequeñas, no de un descuento sobre el modelo insignia. Una versión Lite o Fast cambia el máximo detalle y las resoluciones más altas por velocidad y volumen. Seedance 2.5 Lite, por ejemplo, está limitado a 480p y 720p a propósito. Para clips de redes sociales, bucles de producto y storyboards animados, es más que suficiente. Para una toma principal en 4K en la portada de un cliente, no lo es.
Sea cual sea el nivel que elijas, pruébalo con tus propias imágenes antes de comprar volumen. Las mismas pocas cosas rompen los clips en casi todos los modelos: manos en movimiento, texto legible dentro del encuadre, movimientos de cámara rápidos y multitudes de figuras pequeñas. Un sujeto tranquilo con un solo movimiento claro, como vapor, nubes que se desplazan, un acercamiento lento o un giro de cabeza, es donde los modelos baratos rinden mejor. Pasa cinco de tus fotos reales por un nivel barato y por uno intermedio, y compara los resultados lado a lado. Si no puedes distinguirlos al tamaño en que vas a publicar, gana el más barato.
La diferencia en créditos es real. La tabla de agosto de Apiframe lista Seedance 1.5 Pro a 720p durante 4 segundos con 15 créditos, y Luma Ray 2 a 720p durante 5 segundos con 131 créditos. Eso equivale a unos 3,75 créditos por segundo frente a 26,2, unas siete veces más.
Las suscripciones siguen una regla sencilla de punto de equilibrio: cuota mensual dividida entre el costo por clip. Un rastreador situó los planes de Runway entre 12 y 76 $ al mes. Un plan de 12 $ equivale a unos 34 clips de 0,35 $ cada uno. Si haces menos clips que eso, paga por segundo.
Presupuesto para 100 clips
Esta es una toma por cada uno de 100 clips de 5 segundos a 720p:
💡 Prevé los reintentos. Pocos prompts salen bien a la primera. Si necesitas una media de 3 tomas por clip utilizable, multiplica por 3 todos los números de esa tabla.
Qué opción te conviene
Probar prompts e ideas: usa una ruta gratuita, ya sea la API de PicassoIA o un nivel gratuito alojado, y acepta los límites.
Clips para redes sociales en volumen: un nivel Lite o Fast a 720p, como Veo 3.1 Lite o Kling 2.5 Turbo Pro, mantiene 100 clips entre 25 y 35 $ con una toma por clip.
Trabajo para clientes a 1080p o más:Veo 3.1 Fast o Kling 3.0 Pro, con un presupuesto de reintentos aparte.
Trabajo privado o sin conexión: pesos abiertos como Wan 2.2 I2V en tu propia GPU, si ya tienes el hardware.
Uso ocasional: evita las suscripciones, que solo compensan por encima del número de equilibrio indicado arriba.
La API de PicassoIA
Modelos y límites
La API está en https://api.picassoia.com/v1 y usa un token Bearer que empieza por pia_sk_. Los endpoints siguen el patrón conocido de Replicate: crear una predicción, consultarla y obtener la salida. Se exponen cuatro modelos:
Los límites importan en cualquier trabajo por lotes: 5 predicciones en curso a la vez por cuenta (una sexta devuelve 429 concurrency_limit), un cuerpo de solicitud de 10 MB, 5 MB por imagen en data URL, prompts de hasta 4000 caracteres y 2 tokens por cuenta.
Qué cuesta hoy
La documentación indica que las predicciones de la API son actualmente gratuitas y no usan créditos, y que el precio es "Free with the Infinite plan". Sin ese plan, crear una predicción devuelve 403 plan_required. Hay un matiz: la página de precios enumera API Access y MCP Connections como funciones nuevas de sus planes, mientras que la documentación exige Infinite. Toma la documentación como norma y revisa la página de planes antes de construir sobre ella. Y recuerda la palabra currently.
Una solicitud que funciona
Esta solicitud anima una foto con Seedance 2.5 Lite. Los parámetros van dentro de un objeto input:
curl -s -X POST https://api.picassoia.com/v1/models/picassoia/seedance-2.5-lite/predictions \
-H "Authorization: Bearer $PICASSOIA_TOKEN" \
-H "Content-Type: application/json" \
-d '{"input": {"image": "https://example.com/first-frame.jpg", "prompt": "The camera pushes in slowly as steam rises from the cup and morning light shifts across the table", "resolution": "720p", "duration": 5}}'
Recibes una respuesta 201 con un id, un status de starting, una URL de consulta y un eta. Consulta GET /v1/predictions/{id} hasta que el estado sea succeeded, failed o canceled. El bucle de Python documentado es corto:
import os, time, requests
API = "https://api.picassoia.com/v1"
HEADERS = {"Authorization": f"Bearer {os.environ['PICASSOIA_TOKEN']}"}
def run(model, input):
r = requests.post(f"{API}/models/{model}/predictions", json={"input": input}, headers=HEADERS)
p = r.json()
if not r.ok:
raise RuntimeError(f"{p['code']}: {p['detail']}")
while p["status"] not in ("succeeded", "failed", "canceled"):
time.sleep((p.get("eta") or {}).get("next_poll_in_seconds", 2))
p = requests.get(p["urls"]["get"], headers=HEADERS).json()
if p["status"] != "succeeded":
raise RuntimeError(p["error"] or p["status"])
return p["output"]
Cómo usar Seedance 2.5 Lite
No necesitas código si solo quieres unos cuantos clips. Seedance 2.5 Lite funciona desde la página del modelo, y su descripción dice que los miembros de Wonder pueden generar sin límites.
Elige el primer fotograma. Sube la imagen que quieres animar. El clip la usa como fotograma inicial y hereda su relación de aspecto, así que el ajuste de relación de aspecto se ignora.
Escribe el movimiento como una línea de tiempo. Describe qué se mueve primero, qué hace la cámara y cómo cambia la luz. Los prompts cinematográficos y cronológicos funcionan mejor.
Empieza a 480p. Es el más rápido en renderizar. Cambia a 720p cuando el movimiento te convenza.
Elige 5 o 10 segundos. Cinco segundos bastan para un avance de producto o un bucle para redes sociales.
Decide sobre el audio. El audio sincronizado viene activado por defecto. Desactiva save_audio para un clip sin sonido.
Fija una semilla cuando te guste un resultado y quieras reproducirlo. Añade una imagen de último fotograma si necesitas que el clip termine en una toma concreta.
Tres prompts iniciales para un movimiento tranquilo y de bajo riesgo:
Foto de producto: "Acercamiento lento sobre la botella mientras la luz suave de la ventana se desplaza por el cristal, nada más se mueve."
Retrato: "Ella gira la cabeza hacia la cámara y sonríe levemente, con el pelo moviéndose en una brisa suave y poca profundidad de campo."
Paisaje: "Las nubes se desplazan sobre la cresta, la niebla recorre el valle, la cámara sube despacio con la luz de la hora dorada."
¿Necesitas el primer fotograma en sí? Genéralo con Picasso IA Image, corrige los detalles con Picasso IA Image Editor Pro y luego anímalo. Picasso IA Video es la alternativa más sencilla: cada clip dura 5 segundos fijos a 24 fotogramas por segundo, a 480p o 720p.
Costos ocultos que vigilar
Clips fallidos y repetidos
El precio por segundo es el precio de un intento. Manos que se deforman, caras que se desvían y un movimiento de cámara que ignora tu prompt significan otra toma. Con 3 tomas por clip utilizable, un clip de 0,25 $ cuesta en realidad 0,75 $. Pregunta a cada proveedor si las predicciones fallidas o canceladas se cobran, y lleva la cuenta de las tomas por clip utilizable en tu propio contenido, porque esa proporción cambia con cada modelo.
Audio, duración y concurrencia
El audio puede duplicar el precio. La misma tabla de Apiframe lista Seedance 1.5 Pro a 720p durante 4 segundos con 15 créditos, y 30 créditos con audio.
La duración escala la factura. Un clip de 10 segundos cuesta el doble que uno de 5 segundos en cualquier plan por segundo.
La concurrencia cuesta tiempo. Con 5 trabajos a la vez y alrededor de un minuto por clip, 100 clips suponen unos 20 minutos de espera. Los modelos más lentos lo estiran hasta horas.
Crea tu propio clip hoy
La forma más barata de saber cuánto costarán tus clips es hacer uno. Elige una foto que ya tengas, como una foto de producto, un paisaje o un retrato. Abre Seedance 2.5 Lite o Picasso IA Video en PicassoIA, añade un prompt de movimiento de una sola frase y renderiza un borrador a 480p. Después prueba tres variaciones del prompt y anota cuántas necesitaste para obtener un clip que publicarías.
Si necesitas un primer fotograma nuevo, créalo con Picasso IA Image y anímalo en la misma sesión. Cuando el borrador funcione, pasa a 720p y, si tu volumen lo justifica, llama a la API con la solicitud de arriba. Explora todos los modelos de video e imagen en picassoia.com/en/all-models y haz tu propia comparativa antes de comprometerte con un proveedor de pago.