API de Kling Avatar 2.0: precios de lip sync y ejemplos
Kling Avatar 2.0 convierte una foto y un archivo de audio en un video con una persona hablando. Este artículo enumera los precios por segundo de la API en fal, PoYo y Picsart, muestra una solicitud que funciona, calcula el costo con duraciones de clip reales y compara los modelos de foto parlante que puedes usar en PicassoIA.
Kling Avatar 2.0 toma una foto de retrato y un archivo de audio, y devuelve un video en el que los labios, los ojos y el movimiento de la cabeza siguen el habla. El modelo se cobra por segundo de audio, así que los precios de lip sync de la API de Kling Avatar 2.0 son fáciles de prever una vez que sabes a qué proveedor llamas y qué nivel eliges. Este artículo pone las cifras reales una al lado de otra: $0.056 por segundo en fal, $0.035 en PoYo, 2 créditos en Picsart, con tarifas Pro que son aproximadamente el doble de cada una de esas. También encontrarás una solicitud que funciona, tres ejemplos de producción, reglas de entrada que evitan renders malos y un tutorial para los modelos de lip sync más parecidos en PicassoIA.
Qué hace Kling Avatar 2.0
Kling Avatar 2.0 es un modelo de avatar impulsado por audio de la familia Kling. Le entregas una imagen fija y una grabación de voz, y anima el rostro para que la forma de la boca siga las sílabas, los ojos mantengan el contacto con la lente y la cabeza y los hombros se muevan como lo haría una persona real al hablar. No interviene ninguna grabación de cámara ni un rig 3D, y la identidad de la persona de la foto se mantiene estable desde el primer fotograma hasta el último.
Una foto, un archivo de audio
El contrato de entrada es breve. Todos los proveedores que revisé piden las mismas tres cosas:
Una imagen de una persona, un animal, un personaje de dibujos animados o un personaje estilizado. PoYo acepta archivos JPEG, PNG y WebP de hasta 10 MB.
Un archivo de audio con el habla. PoYo acepta de 2 a 60 segundos y hasta 5 MB, mientras que Hedra indica un rango de 2 a 300 segundos, así que revisa el límite del proveedor al que vayas a llamar.
Un prompt de texto opcional que describa la emoción, el gesto o el comportamiento de cámara, por ejemplo "presentador tranquilo, pequeño asentimiento al final de cada frase".
La salida es un MP4. Hedra indica 16:9, 9:16 y 1:1 como relaciones de aspecto compatibles, que encajan con YouTube, Reels y publicaciones cuadradas en el feed.
Niveles Standard y Pro
Ambos niveles aceptan las mismas entradas. La diferencia está en la calidad de la salida y en el precio.
Videos de marketing, trabajo para clientes, contenido principal
Precio frente al otro nivel
Base
Aproximadamente 2 veces Standard
Endpoint de fal
fal-ai/kling-video/ai-avatar/v2/standard
fal-ai/kling-video/ai-avatar/v2/pro
Entradas
Imagen, audio, prompt opcional
Lo mismo
💡 Las cifras de resolución varían según el proveedor. APIPass indica 720p para Standard y 1080p para Pro, mientras que Hedra indica 720p nativo para Pro. Renderiza un clip de prueba y revisa el archivo antes de lanzar un lote.
Precios de la API de Kling Avatar 2.0 comparados
Los precios son donde más difieren los proveedores. La facturación es por segundo de audio, así que una locución más larga cuesta más, sin importar lo sencilla que sea la foto.
Tarifas por segundo según proveedor
Proveedor
Standard
Pro
Notas de facturación
fal
$0.056 por segundo
$0.115 por segundo
Tarifas según las publica PoYo y Hedra
PoYo
$0.035 por segundo (7 créditos)
$0.070 por segundo (14 créditos)
Duración del audio redondeada al segundo siguiente
Picsart API
2 créditos por segundo
4 créditos por segundo
El precio del crédito depende de tu plan de Picsart
APIPass
Créditos por segundo
Créditos por segundo
Las cifras que encontré no coincidían
La página de PoYo sitúa su tarifa Standard alrededor de un 38 % por debajo de la de fal, y su tarifa Pro alrededor de un 39 % por debajo, lo que coincide con la aritmética: $0.035 frente a $0.056, y $0.070 frente a $0.115.
💡 Revisa antes de presupuestar. Dos capturas de la página de precios de APIPass no coincidían, con una diferencia de aproximadamente diez veces, así que dejé su tarifa fuera del cálculo de costos de abajo. Confirma el precio de cualquier proveedor en su propio panel antes de encolar un lote grande.
Ejemplos de costo con volúmenes reales
La facturación es lineal: segundos de audio por la tarifa. Redondea primero cada clip. Una locución de 12.3 segundos se factura como 13 segundos, así que en fal Standard cuesta 13 × $0.056, que son $0.73.
Duración del clip
fal Standard
fal Pro
PoYo Standard
PoYo Pro
10 segundos
$0.56
$1.15
$0.35
$0.70
30 segundos
$1.68
$3.45
$1.05
$2.10
60 segundos
$3.36
$6.90
$2.10
$4.20
El volumen es donde la diferencia crece. Un lote de 500 clips de 30 segundos cada uno son 15,000 segundos de audio:
Proveedor y nivel
500 clips de 30 segundos
fal Standard
$840
fal Pro
$1,725
PoYo Standard
$525
PoYo Pro
$1,050
Pro se justifica su sobrecosto cuando un rostro permanece en pantalla durante un minuto completo, como en un anuncio pagado. Standard es la opción sensata por defecto para clips de formación interna, borradores y pruebas A/B de guiones.
💡 Reserva margen para reintentos. Mientras ajustas fotos y prompts, algunos clips necesitarán un segundo render. Añade un margen de 20 a 30 por ciento a la estimación de tu primer lote y recórtalo cuando tus ajustes estén estables.
Formato de la solicitud y límites
Cada proveedor envuelve el mismo modelo en un formato ligeramente distinto. Dos ejemplos muestran la forma.
Entradas y límites de archivo
Parámetro
Obligatorio
Notas
image_url / image
Sí
JPEG, PNG o WebP de hasta 10 MB. APIPass también pide al menos 300 px y una relación de aspecto entre 1:2.5 y 2.5:1
audio_url / audio
Sí
MP3, WAV, M4A o AAC en APIPass, 5 MB como máximo en PoYo y APIPass
prompt
No
Por defecto es "." en fal. APIPass acepta hasta 2,500 caracteres
mode
Solo APIPass
std o pro
Una solicitud de fal que funciona
En fal, cada nivel es su propio endpoint y el trabajo pasa por una cola. Esta llamada en JavaScript usa el cliente oficial y espera el resultado:
import { fal } from "@fal-ai/client";
const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
input: {
image_url: "https://example.com/presenter.jpg",
audio_url: "https://example.com/voiceover.mp3",
prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
},
logs: true,
});
console.log(result.data.video.url, result.data.duration);
Cambia el endpoint a fal-ai/kling-video/ai-avatar/v2/pro para el nivel Pro. La respuesta incluye un archivo video con una URL de descarga y un duration en segundos, un dato útil para anotarlo y compararlo con tu factura.
APIPass usa una única ruta para crear tareas y un campo mode en su lugar:
Envías ese cuerpo con POST a https://api.apipass.dev/api/v1/jobs/createTask con un token bearer en la cabecera Authorization, y la respuesta devuelve un taskId. PoYo sigue el mismo patrón: una llamada asíncrona de envío y, después, un callback por webhook o una consulta de estado por ID de tarea.
💡 Usa webhooks en producción. Los renders de avatar son trabajos encolados, no respuestas instantáneas. Un webhook deja libres a tus workers, mientras que un bucle de consultas gasta solicitudes mientras esperas.
Ejemplos de lip sync que funcionan
Tres configuraciones muestran dónde se amortiza el precio por segundo.
Videos de portavoz
Una marca de cuidado de la piel quiere 40 clips de producto de 20 segundos cada uno, uno por ingrediente. Son 800 segundos de audio. En fal Standard cuesta $44.80, en PoYo Pro cuesta $56 y en fal Pro cuesta $92. Compáralo con contratar a un presentador y un día de estudio para cada variante. El mismo retrato se reutiliza en todos los clips, así que el rostro se mantiene coherente en toda la serie.
💡 Prompt para probar: "Presentadora cálida y segura, contacto visual constante, pequeños asentimientos de cabeza, hombros relajados."
Narración de cursos
Una lección de 10 minutos son 600 segundos de narración. Divídela en diez segmentos de 60 segundos para que cada uno quepa en el límite de audio más estricto que encontré, y reutiliza una sola foto para todos. En PoYo Standard la lección cuesta $21.00 y en fal Standard cuesta $33.60. Cortar en los límites de las frases mantiene las uniones invisibles, porque el orador ya está en reposo entre frases.
Versiones multilingües
Una foto más un guion en tres idiomas te da tres clips. A 30 segundos cada uno en fal Standard, son 90 segundos y $5.04. Genera el audio de cada idioma con un modelo de texto a voz como MiniMax Speech 2.8 HD o ElevenLabs V3, y luego pasa cada archivo al modelo de avatar. Si ya tienes un video terminado, HeyGen Video Translate lo dobla directamente.
Los personajes estilizados y los animales también funcionan, ya que el modelo acepta dibujos animados y rostros no humanos. Prueba algunos renders antes de construir una serie entera alrededor de una mascota.
Prepara las entradas para mejores resultados
La mayoría de los renders malos vienen de las entradas, no del modelo. Corrige esto antes de gastar créditos.
Reglas para la foto
Mira a cámara. Un encuadre de cabeza y hombros de frente le da al modelo la mayor geometría facial para animar.
Mantén la boca cerrada o neutra. Una sonrisa amplia con los dientes visibles en la imagen original puede verse extraña cuando los labios empiezan a moverse.
Muestra las orejas y la línea del cabello. Los bordes claros ayudan a que la cabeza mantenga un contorno estable durante el movimiento.
Ilumina el rostro de forma uniforme. La luz suave de una ventana por delante es mejor que una sombra lateral dura.
Parte de 300 px o más en el lado corto. Si tu retrato es pequeño, aumenta primero su resolución con Crystal Upscaler, que está diseñado para retratos.
Reglas para el audio y el prompt
Un solo hablante por archivo. Las voces superpuestas no dan a la boca nada claro que seguir.
Nada de música bajo la voz. Mezcla la música después del render del avatar.
Recorta el silencio al inicio y al final. Pagas cada segundo de audio, incluido el silencio.
Respeta el límite del proveedor. El tope más corto que encontré es de 60 segundos, y el mínimo es de 2 segundos.
Mantén el prompt corto. Una línea sobre la emoción, una sobre el gesto y una sobre la cámara bastan. Un prompt largo compite con el audio en lugar de apoyarlo.
Cómo usar Kling Lip Sync
Kling Avatar 2.0 en sí no aparece en el catálogo de lipsync de PicassoIA en el momento de escribir esto. La opción de Kling que sí está, Kling Lip Sync, resuelve un problema cercano: ajusta la boca del hablante de un clip de video existente a una nueva pista de audio, o a un guion que escribas. Acepta clips MP4 y MOV de entre 2 y 10 segundos, de 720p a 1080p.
Tienes una foto y solo un guion:P Video Avatar escribe la voz por ti.
Tienes metraje y necesitas audio nuevo:Kling Lip Sync es la herramienta adecuada.
Necesitas primero una voz:Realtime TTS 2 y ElevenLabs V3 producen audio que puedes pasar a cualquiera de los modelos de arriba.
💡 Prueba un clip antes de un lote. Ejecuta el mismo retrato y los mismos 10 segundos de audio en dos modelos, y luego compara las formas de la boca en los sonidos duros como "p", "b" y "m".
Prueba tu propio video de lip sync
Elige un clip y pruébalo antes de planificar un lote: un retrato, diez segundos de audio limpio, un nivel. Pásalo por Omni Human 1.5 o Fabric 1.0 en Picasso IA, compara las formas de la boca con el audio y guarda como plantilla los ajustes que funcionen. Después genera el propio retrato con los modelos de imagen de la plataforma, graba o sintetiza la voz y anímalo. Abre Picasso IA, sube tu primera foto y comprueba hasta dónde puede llegar una sola imagen fija con una grabación de voz corta.