API de Kling Avatar 2.0: precios de lip sync y ejemplos

Kling Avatar 2.0 convierte una foto y un archivo de audio en un video con una persona hablando. Este artículo enumera los precios por segundo de la API en fal, PoYo y Picsart, muestra una solicitud que funciona, calcula el costo con duraciones de clip reales y compara los modelos de foto parlante que puedes usar en PicassoIA.

API de Kling Avatar 2.0: precios de lip sync y ejemplos
Cristian Da Conceicao
Fundador de Picasso IA

Kling Avatar 2.0 toma una foto de retrato y un archivo de audio, y devuelve un video en el que los labios, los ojos y el movimiento de la cabeza siguen el habla. El modelo se cobra por segundo de audio, así que los precios de lip sync de la API de Kling Avatar 2.0 son fáciles de prever una vez que sabes a qué proveedor llamas y qué nivel eliges. Este artículo pone las cifras reales una al lado de otra: $0.056 por segundo en fal, $0.035 en PoYo, 2 créditos en Picsart, con tarifas Pro que son aproximadamente el doble de cada una de esas. También encontrarás una solicitud que funciona, tres ejemplos de producción, reglas de entrada que evitan renders malos y un tutorial para los modelos de lip sync más parecidos en PicassoIA.

Qué hace Kling Avatar 2.0

Kling Avatar 2.0 es un modelo de avatar impulsado por audio de la familia Kling. Le entregas una imagen fija y una grabación de voz, y anima el rostro para que la forma de la boca siga las sílabas, los ojos mantengan el contacto con la lente y la cabeza y los hombros se muevan como lo haría una persona real al hablar. No interviene ninguna grabación de cámara ni un rig 3D, y la identidad de la persona de la foto se mantiene estable desde el primer fotograma hasta el último.

Un fotógrafo iluminando un retrato de estudio de una mujer sonriente con blazer azul marino

Una foto, un archivo de audio

El contrato de entrada es breve. Todos los proveedores que revisé piden las mismas tres cosas:

  • Una imagen de una persona, un animal, un personaje de dibujos animados o un personaje estilizado. PoYo acepta archivos JPEG, PNG y WebP de hasta 10 MB.
  • Un archivo de audio con el habla. PoYo acepta de 2 a 60 segundos y hasta 5 MB, mientras que Hedra indica un rango de 2 a 300 segundos, así que revisa el límite del proveedor al que vayas a llamar.
  • Un prompt de texto opcional que describa la emoción, el gesto o el comportamiento de cámara, por ejemplo "presentador tranquilo, pequeño asentimiento al final de cada frase".

La salida es un MP4. Hedra indica 16:9, 9:16 y 1:1 como relaciones de aspecto compatibles, que encajan con YouTube, Reels y publicaciones cuadradas en el feed.

Niveles Standard y Pro

Ambos niveles aceptan las mismas entradas. La diferencia está en la calidad de la salida y en el precio.

StandardPro
Pensado paraGeneración masiva, prototipos rápidos, videos educativosVideos de marketing, trabajo para clientes, contenido principal
Precio frente al otro nivelBaseAproximadamente 2 veces Standard
Endpoint de falfal-ai/kling-video/ai-avatar/v2/standardfal-ai/kling-video/ai-avatar/v2/pro
EntradasImagen, audio, prompt opcionalLo mismo

💡 Las cifras de resolución varían según el proveedor. APIPass indica 720p para Standard y 1080p para Pro, mientras que Hedra indica 720p nativo para Pro. Renderiza un clip de prueba y revisa el archivo antes de lanzar un lote.

Precios de la API de Kling Avatar 2.0 comparados

Los precios son donde más difieren los proveedores. La facturación es por segundo de audio, así que una locución más larga cuesta más, sin importar lo sencilla que sea la foto.

Un escritorio visto desde arriba con una calculadora, una libreta y una taza de café espresso

Tarifas por segundo según proveedor

ProveedorStandardProNotas de facturación
fal$0.056 por segundo$0.115 por segundoTarifas según las publica PoYo y Hedra
PoYo$0.035 por segundo (7 créditos)$0.070 por segundo (14 créditos)Duración del audio redondeada al segundo siguiente
Picsart API2 créditos por segundo4 créditos por segundoEl precio del crédito depende de tu plan de Picsart
APIPassCréditos por segundoCréditos por segundoLas cifras que encontré no coincidían

La página de PoYo sitúa su tarifa Standard alrededor de un 38 % por debajo de la de fal, y su tarifa Pro alrededor de un 39 % por debajo, lo que coincide con la aritmética: $0.035 frente a $0.056, y $0.070 frente a $0.115.

💡 Revisa antes de presupuestar. Dos capturas de la página de precios de APIPass no coincidían, con una diferencia de aproximadamente diez veces, así que dejé su tarifa fuera del cálculo de costos de abajo. Confirma el precio de cualquier proveedor en su propio panel antes de encolar un lote grande.

Ejemplos de costo con volúmenes reales

La facturación es lineal: segundos de audio por la tarifa. Redondea primero cada clip. Una locución de 12.3 segundos se factura como 13 segundos, así que en fal Standard cuesta 13 × $0.056, que son $0.73.

Duración del clipfal Standardfal ProPoYo StandardPoYo Pro
10 segundos$0.56$1.15$0.35$0.70
30 segundos$1.68$3.45$1.05$2.10
60 segundos$3.36$6.90$2.10$4.20

El volumen es donde la diferencia crece. Un lote de 500 clips de 30 segundos cada uno son 15,000 segundos de audio:

Proveedor y nivel500 clips de 30 segundos
fal Standard$840
fal Pro$1,725
PoYo Standard$525
PoYo Pro$1,050

Pro se justifica su sobrecosto cuando un rostro permanece en pantalla durante un minuto completo, como en un anuncio pagado. Standard es la opción sensata por defecto para clips de formación interna, borradores y pruebas A/B de guiones.

💡 Reserva margen para reintentos. Mientras ajustas fotos y prompts, algunos clips necesitarán un segundo render. Añade un margen de 20 a 30 por ciento a la estimación de tu primer lote y recórtalo cuando tus ajustes estén estables.

Formato de la solicitud y límites

Cada proveedor envuelve el mismo modelo en un formato ligeramente distinto. Dos ejemplos muestran la forma.

Una desarrolladora escribiendo en un escritorio de pie con dos monitores

Entradas y límites de archivo

ParámetroObligatorioNotas
image_url / imageSíJPEG, PNG o WebP de hasta 10 MB. APIPass también pide al menos 300 px y una relación de aspecto entre 1:2.5 y 2.5:1
audio_url / audioSíMP3, WAV, M4A o AAC en APIPass, 5 MB como máximo en PoYo y APIPass
promptNoPor defecto es "." en fal. APIPass acepta hasta 2,500 caracteres
modeSolo APIPassstd o pro

Una solicitud de fal que funciona

En fal, cada nivel es su propio endpoint y el trabajo pasa por una cola. Esta llamada en JavaScript usa el cliente oficial y espera el resultado:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/kling-video/ai-avatar/v2/standard", {
  input: {
    image_url: "https://example.com/presenter.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    prompt: "Calm presenter, relaxed shoulders, small nod after each sentence",
  },
  logs: true,
});

console.log(result.data.video.url, result.data.duration);

Cambia el endpoint a fal-ai/kling-video/ai-avatar/v2/pro para el nivel Pro. La respuesta incluye un archivo video con una URL de descarga y un duration en segundos, un dato útil para anotarlo y compararlo con tu factura.

APIPass usa una única ruta para crear tareas y un campo mode en su lugar:

{
  "model": "kling/avatar-v2",
  "callBackUrl": "https://your-domain.com/api/callback",
  "input": {
    "image": "https://example.com/avatar-image.jpg",
    "audio": "https://example.com/speech-audio.mp3",
    "prompt": "Professional spokesperson with confident gestures",
    "mode": "std"
  }
}

Envías ese cuerpo con POST a https://api.apipass.dev/api/v1/jobs/createTask con un token bearer en la cabecera Authorization, y la respuesta devuelve un taskId. PoYo sigue el mismo patrón: una llamada asíncrona de envío y, después, un callback por webhook o una consulta de estado por ID de tarea.

💡 Usa webhooks en producción. Los renders de avatar son trabajos encolados, no respuestas instantáneas. Un webhook deja libres a tus workers, mientras que un bucle de consultas gasta solicitudes mientras esperas.

Ejemplos de lip sync que funcionan

Tres configuraciones muestran dónde se amortiza el precio por segundo.

Videos de portavoz

Una mujer con blazer carbón presentando a cámara un pequeño frasco ámbar

Una marca de cuidado de la piel quiere 40 clips de producto de 20 segundos cada uno, uno por ingrediente. Son 800 segundos de audio. En fal Standard cuesta $44.80, en PoYo Pro cuesta $56 y en fal Pro cuesta $92. Compáralo con contratar a un presentador y un día de estudio para cada variante. El mismo retrato se reutiliza en todos los clips, así que el rostro se mantiene coherente en toda la serie.

💡 Prompt para probar: "Presentadora cálida y segura, contacto visual constante, pequeños asentimientos de cabeza, hombros relajados."

Narración de cursos

Un profesor grabando una lección en línea desde un estudio en casa

Una lección de 10 minutos son 600 segundos de narración. Divídela en diez segmentos de 60 segundos para que cada uno quepa en el límite de audio más estricto que encontré, y reutiliza una sola foto para todos. En PoYo Standard la lección cuesta $21.00 y en fal Standard cuesta $33.60. Cortar en los límites de las frases mantiene las uniones invisibles, porque el orador ya está en reposo entre frases.

Versiones multilingües

Un ingeniero de audio ajustando un fader mientras un locutor graba tras un cristal

Una foto más un guion en tres idiomas te da tres clips. A 30 segundos cada uno en fal Standard, son 90 segundos y $5.04. Genera el audio de cada idioma con un modelo de texto a voz como MiniMax Speech 2.8 HD o ElevenLabs V3, y luego pasa cada archivo al modelo de avatar. Si ya tienes un video terminado, HeyGen Video Translate lo dobla directamente.

Los personajes estilizados y los animales también funcionan, ya que el modelo acepta dibujos animados y rostros no humanos. Prueba algunos renders antes de construir una serie entera alrededor de una mascota.

Prepara las entradas para mejores resultados

La mayoría de los renders malos vienen de las entradas, no del modelo. Corrige esto antes de gastar créditos.

Reglas para la foto

Un retrato frontal de un hombre con cabello gris corto y camisa azul marino

  • Mira a cámara. Un encuadre de cabeza y hombros de frente le da al modelo la mayor geometría facial para animar.
  • Mantén la boca cerrada o neutra. Una sonrisa amplia con los dientes visibles en la imagen original puede verse extraña cuando los labios empiezan a moverse.
  • Muestra las orejas y la línea del cabello. Los bordes claros ayudan a que la cabeza mantenga un contorno estable durante el movimiento.
  • Ilumina el rostro de forma uniforme. La luz suave de una ventana por delante es mejor que una sombra lateral dura.
  • Parte de 300 px o más en el lado corto. Si tu retrato es pequeño, aumenta primero su resolución con Crystal Upscaler, que está diseñado para retratos.

Reglas para el audio y el prompt

Un hombre con barba plateada narrando frente a un micrófono en una esquina forrada de espuma

  • Un solo hablante por archivo. Las voces superpuestas no dan a la boca nada claro que seguir.
  • Nada de música bajo la voz. Mezcla la música después del render del avatar.
  • Recorta el silencio al inicio y al final. Pagas cada segundo de audio, incluido el silencio.
  • Respeta el límite del proveedor. El tope más corto que encontré es de 60 segundos, y el mínimo es de 2 segundos.
  • Mantén el prompt corto. Una línea sobre la emoción, una sobre el gesto y una sobre la cámara bastan. Un prompt largo compite con el audio en lugar de apoyarlo.

Cómo usar Kling Lip Sync

Kling Avatar 2.0 en sí no aparece en el catálogo de lipsync de PicassoIA en el momento de escribir esto. La opción de Kling que sí está, Kling Lip Sync, resuelve un problema cercano: ajusta la boca del hablante de un clip de video existente a una nueva pista de audio, o a un guion que escribas. Acepta clips MP4 y MOV de entre 2 y 10 segundos, de 720p a 1080p.

Una mujer en un espacio de trabajo luminoso con una línea de tiempo de video en su monitor

Paso a paso

  1. Abre la página de Kling Lip Sync en PicassoIA.
  2. Sube tu clip o pega su enlace en video_url. Usa un MP4 o MOV de menos de 100 MB y de 2 a 10 segundos de duración.
  3. Añade la voz. Sube un archivo MP3, WAV, M4A o AAC de menos de 5 MB en audio_file, o escribe un guion en text.
  4. Si escribiste un guion, elige una voice_id de la lista en inglés o chino y ajusta voice_speed.
  5. Ejecuta la generación, previsualiza el resultado y descarga el clip.

Consejos sobre los parámetros

  • Usa solo audio o texto en cada ejecución. El campo text está pensado para cuando no tienes un archivo de audio.
  • voice_id viene por defecto en en_AOT. Escucha dos o tres voces en la misma línea antes de elegir una.
  • voice_speed viene por defecto en 1. Ajústalo hasta que el ritmo del habla coincida con el ritmo de la toma.
  • video_url y video_id no se pueden combinar, así que elige una sola fuente por ejecución.
  • Divide las escenas largas en fragmentos de 10 segundos antes de subirlas.

Alternativas de PicassoIA para fotos parlantes

Cuando partes de una foto en lugar de un video, tres modelos de PicassoIA siguen el mismo patrón de foto más audio que Kling Avatar 2.0.

ModeloEntradaVozNotas de salida
Omni Human 1.5Foto, audio, prompt opcionalTu audio, de menos de 35 segundosRostros, planos de cuerpo entero y personajes ilustrados. Modo rápido y semilla para resultados repetibles
Fabric 1.0Foto y audioTu audio480p o 720p
P Video AvatarFoto, más un guion o audioMás de 30 voces integradas en 10 idiomas720p o 1080p
Kling Lip SyncVideo, más audio o textoTu audio o una voz integradaClips de 2 a 10 segundos

Una forma rápida de elegir:

💡 Prueba un clip antes de un lote. Ejecuta el mismo retrato y los mismos 10 segundos de audio en dos modelos, y luego compara las formas de la boca en los sonidos duros como "p", "b" y "m".

Prueba tu propio video de lip sync

Elige un clip y pruébalo antes de planificar un lote: un retrato, diez segundos de audio limpio, un nivel. Pásalo por Omni Human 1.5 o Fabric 1.0 en Picasso IA, compara las formas de la boca con el audio y guarda como plantilla los ajustes que funcionen. Después genera el propio retrato con los modelos de imagen de la plataforma, graba o sintetiza la voz y anímalo. Abre Picasso IA, sube tu primera foto y comprueba hasta dónde puede llegar una sola imagen fija con una grabación de voz corta.

Compartir este artículo

Elige tu idioma