API de OmniHuman 1.5: precios, sincronización labial y videos de avatares

OmniHuman 1.5 convierte una foto de retrato y un archivo de audio en un video hablado, con un costo de $0.16 por segundo en fal.ai. Este artículo desglosa el costo real de cada clip, los límites de entrada, la calidad de la sincronización labial y cómo usar el modelo en PicassoIA sin escribir código.

API de OmniHuman 1.5: precios, sincronización labial y videos de avatares
Cristian Da Conceicao
Fundador de Picasso IA

Una sola foto de retrato y una grabación de voz de 30 segundos pueden convertirse en un video hablado por $4.80. Esa es la cuenta detrás de la API de OmniHuman 1.5, el modelo de avatares impulsado por audio de ByteDance, que fal.ai cobra a $0.16 por segundo de video generado. Sin cámara, sin estudio, sin actor. Solo un rostro, una voz y unos minutos de espera.

Este artículo pone cifras reales a todo esto. Verás cuánto cuestan los clips de distintas duraciones, qué límites te bloquearán de verdad (duración del audio, resolución, formatos de archivo), cómo aguanta la sincronización labial con rostros reales y en qué casos una foto que habla supera a grabar. También incluye una guía paso a paso para usar OmniHuman 1.5 en PicassoIA desde el navegador, y una lista breve de alternativas con las que compararlo.

💡 Respuesta rápida: OmniHuman 1.5 toma una imagen de una persona más un archivo de audio y devuelve un video en el que el rostro y la cabeza se mueven con la voz. En fal.ai cuesta $0.16 por segundo y admite hasta 60 segundos de audio en 720p o 30 segundos en 1080p.

Qué hace realmente OmniHuman 1.5

OmniHuman 1.5 es un modelo de imagen a video basado en audio. En lugar de inventar una escena a partir de un prompt de texto, parte de una persona que ya tienes y hace que hable, cante o reaccione a cualquier sonido que le des.

Una foto, un archivo de audio

El flujo de trabajo es casi demasiado sencillo. Subes una imagen con una persona, un rostro o un personaje. Subes una pista de audio. El modelo anima al sujeto para que la boca, las expresiones y el movimiento de la cabeza sigan el sonido. Un prompt de texto opcional te permite dirigir los gestos, la composición de la escena o el movimiento de cámara.

Primer plano de una mujer sonriente hablando a cámara en una cocina luminosa

Tres cosas lo diferencian de las herramientas antiguas de fotos parlantes:

  • Movimiento más allá de los labios. Las expresiones faciales, los gestos y el movimiento de la cabeza responden a la emoción y al ritmo del habla, no solo a las palabras.
  • Sujetos flexibles. OmniHuman 1.5 en PicassoIA acepta retratos reales, planos de cuerpo entero y personajes ilustrados.
  • Audio multilingüe. La página de PicassoIA indica que admite locuciones en inglés, español, japonés, coreano, chino e indonesio.

Qué cambió respecto a OmniHuman 1

El modelo original sigue disponible, y la diferencia entre ambos es lo bastante pequeña como para que el precio pese en la decisión. La comparación de fal.ai los pone uno al lado del otro:

CaracterísticaOmniHuman (original)OmniHuman 1.5
Precio en fal.ai$0.14 por segundo$0.16 por segundo
ResoluciónFija, sin elección720p o 1080p
Límite de audio30 segundos60 segundos en 720p, 30 segundos en 1080p
Modo turboNo disponibleDisponible
Entradas difícilesA veces necesita varios intentosMás fiable en el primer intento

"Entradas difíciles" significa rostros parcialmente ocultos, audio con ruido, iluminación dura y retratos en ángulo, los casos que antes arruinaban una toma.

En PicassoIA la diferencia también se ve. La página del OmniHuman original recomienda audios de 15 segundos o menos, porque la calidad empieza a degradarse a partir de ahí. OmniHuman 1.5 acepta clips de menos de 35 segundos y añade un prompt de texto, un modo rápido y una semilla.

El precio de la API de OmniHuman 1.5 explicado

El precio es la parte más sencilla de este modelo. Pagas por segundo de video generado, y la salida dura lo mismo que tu audio. Una locución de 12 segundos te da un video de 12 segundos y una factura de $1.92.

Vista desde arriba de un escritorio con una libreta de cifras a lápiz, una calculadora y un cronómetro

Costo por segundo de video

Esto es lo que cuestan las duraciones habituales de clip a la tarifa de fal.ai de $0.16 por segundo:

Duración del clipCostoUso habitual
5 segundos$0.80Fragmento de prueba antes de una versión completa
15 segundos$2.40Publicación en redes o saludo corto
30 segundos$4.80Presentación de producto, el clip más largo en 1080p
60 segundos$9.60Explicativo, el clip más largo en 720p

La escala cambia el panorama rápido. Cien clips de 30 segundos suman $480. Una actualización semanal de 20 segundos durante un año completo (52 clips) cuesta $166.40. Para verlo claro, estos son tres presupuestos mensuales realistas:

EscenarioResultadoSegundosCosto mensual
Creador independiente8 clips de 20 segundos160$25.60
Tienda online pequeña30 clips de 15 segundos450$72.00
Equipo de formación40 lecciones de 45 segundos1800$288.00

La versión 1.5 tiene un sobreprecio frente al original, que fal.ai publica a $0.14 por segundo. En un clip de 30 segundos son $4.20 frente a $4.80, es decir, 60 centavos más, o un 14 por ciento. En 100 clips así, la diferencia es de $60. Si el límite de audio más largo y la elección de resolución compensan ese costo depende por completo de tu volumen.

💡 Revisa tu proveedor. Las cifras de arriba provienen de fal.ai. Otros proveedores de API fijan sus propias tarifas, así que lee la línea de precios de tu proveedor antes de presupuestar una campaña.

Formas de reducir la factura

Pagas cada segundo, así que el ahorro viene de desperdiciar menos segundos:

  1. Prueba primero con 5 segundos. Un fragmento de $0.80 te dice si el retrato funciona antes de gastar $9.60 en un minuto completo.
  2. Recorta los silencios. El aire muerto al principio y al final de un archivo de audio se convierte en video facturado.
  3. Borradores rápidos, acabado lento. Usa 720p o el modo turbo para los borradores y luego renderiza la toma aprobada en 1080p. Revisa si tu proveedor cobra el turbo de forma distinta.
  4. Corta a B-roll. Deja que el avatar hable 10 segundos y luego muestra el producto durante 5. Solo pagas los segundos en los que habla.
  5. Guarda la semilla. Cuando una toma funcione, reutiliza su semilla en PicassoIA para reproducirla en lugar de pagar dos veces por una toma con suerte.

Entradas, límites y parámetros

La mayoría de las ejecuciones fallidas vienen de unos pocos errores de entrada que se repiten. Estos son los límites que importan.

Requisitos de imagen y audio

Los dos lugares donde puedes ejecutar el modelo tienen reglas algo distintas:

EntradaAPI de fal.aiPicassoIA
Imagenimage_url, JPEG o PNG, accesible públicamenteSube una foto con una persona, un rostro o un personaje
Audioaudio_url, MP3, WAV o M4AMP3, WAV y formatos similares
Duración del audio60 s en 720p, 30 s en 1080pMenos de 35 segundos, los archivos más largos fallan
Resolución720p o 1080p, por defecto 1080pNo aparece como ajuste
Entradas opcionalesprompt, turbo_mode, mask_urlPrompt, modo rápido, semilla

Vista por encima del hombro de una desarrolladora escribiendo código en un equipo portátil en una oficina tipo loft

Si llamas al modelo a través de fal.ai, el endpoint es fal-ai/bytedance/omnihuman/v1.5. Instala @fal-ai/client, define tu token de API de fal.ai como variable de entorno y una llamada tiene este aspecto:

import { fal } from "@fal-ai/client";

const result = await fal.subscribe("fal-ai/bytedance/omnihuman/v1.5", {
  input: {
    image_url: "https://example.com/portrait.jpg",
    audio_url: "https://example.com/voiceover.mp3",
    resolution: "720p",
    turbo_mode: false,
    prompt: "Warm smile, small hand gestures, steady medium shot"
  },
  logs: true
});

console.log(result.data.video.url);

La URL del video llega en data.video.url. fal.ai indica que el enlace sigue siendo válido durante unas 24 horas, así que descarga el archivo y guárdalo en un lugar permanente cuanto antes.

Resolución, modo turbo y prompts

  • Resolución. 1080p es el valor por defecto y limita el audio a 30 segundos. Baja a 720p cuando necesites hasta 60 segundos o una generación más rápida.
  • Modo turbo. Salida más rápida a cambio de algo de calidad. Ideal para revisar un retrato, no para la entrega final. PicassoIA llama modo rápido a la misma idea.
  • Prompt. Texto opcional para expresiones, movimiento y cámara. PicassoIA acepta prompts en chino, inglés, japonés, coreano, español e indonesio.
  • Máscara. En fal.ai, mask_url aísla a la persona que debe hablar cuando varias personas comparten el encuadre.

Escribe los prompts sobre el comportamiento, no sobre los labios. "Sonrisa tranquila, leve asentimiento, manos apoyadas sobre el escritorio" funciona mejor que "la boca se mueve con las palabras", porque el audio ya se encarga de la boca.

Calidad de la sincronización labial en la práctica

La sincronización labial es donde un modelo de avatares gana o pierde, así que júzgala como la juzgarán los espectadores: en un teléfono, a velocidad normal y con el sonido activado.

Perfil de un actor de voz hablando frente a un micrófono de estudio con filtro antipop

Dónde destaca

  • Coincidencia emocional. Las sonrisas, el movimiento de las cejas y las inclinaciones de cabeza siguen el tono de la voz, así que una lectura entusiasta se ve entusiasta.
  • Entradas imperfectas. fal.ai informa de un mejor manejo de rostros parcialmente ocultos, audio con ruido, iluminación difícil y retratos en ángulo que el modelo original.
  • Clips de un solo orador. Un monólogo de 10 a 30 segundos es el punto ideal: una presentación, un anuncio, la introducción de una lección.
  • Personajes ilustrados. Las mascotas y los retratos estilizados también se animan, lo que ayuda a las marcas que no tienen portavoz.

Dónde todavía flaquea

  • Límites de duración. Menos de 35 segundos en PicassoIA y 60 segundos como máximo en fal.ai. Los guiones más largos deben dividirse en escenas y editarse juntos.
  • Tiempo de espera. Los tres ejemplos publicados por PicassoIA con el modo rápido activado tardaron 197, 280 y 370 segundos, unos 3 a 6 minutos cada uno. Eso descarta el chat en vivo o el uso en tiempo real.
  • Repeticiones. Incluso con más fiabilidad, reserva tiempo para algún segundo intento en retratos difíciles.
  • Entradas débiles. Un rostro pequeño, borroso o muy filtrado da un resultado pobre. Una locución plana y monótona da una interpretación plana.

Usos reales de los videos de avatares

Los casos de uso más sólidos comparten un rasgo: hace falta que una persona aparezca en pantalla, pero grabarla es lento, caro o imposible.

Explicativos y anuncios de producto

Un pequeño tendero puede convertir una sola foto del fundador en una presentación de producto de 20 segundos para cada artículo nuevo, grabada una vez como audio y actualizada cada vez que cambie el guion.

Mujer con delantal vaquero fotografiando una taza de gres en un taller de cerámica

El formato funciona bien en páginas de aterrizaje, anuncios pagados en redes sociales y fichas de marketplace, donde un rostro humano breve aumenta la confianza. Combina el clip hablado con B-roll del producto y el avatar solo necesita hablar en el gancho inicial y en la oferta final.

Formación y educación

Quienes crean cursos pueden producir un presentador para cada lección sin grabar delante de una cámara. Escribe la introducción de la lección, graba el audio y deja que el retrato la presente. Mantén cada clip por debajo del límite de duración y encadena varios cortos a lo largo de la lección.

Profesor con cárdigan grabando una lección en un pupitre de aula

Los equipos internos usan el mismo truco para mensajes de bienvenida y actualizaciones de políticas, donde un rostro siempre igual importa más que el pulido cinematográfico.

Mensajes multilingües

Un solo retrato puede llevar muchas voces. Graba o genera el mismo guion en español, japonés e inglés, y luego ejecuta cada archivo con la misma foto. Los labios siguen el idioma en lugar de pelear con él.

Joven con auriculares sosteniendo una tableta frente a un mapamundi

Si ya tienes material grabado y solo necesitas doblarlo, Video Translate se encarga de esa tarea, mientras que OmniHuman 1.5 es la mejor opción cuando lo único que tienes es una foto fija.

💡 Usa rostros reales con responsabilidad. Anima la foto de una persona real solo si tienes su permiso, nunca imites a alguien para engañar a los espectadores y etiqueta los videos sintéticos siempre que una plataforma lo pida.

Cómo usar OmniHuman 1.5 en PicassoIA

No necesitas una cuenta de API ni ningún código. OmniHuman 1.5 en PicassoIA funciona desde el navegador: dos subidas, un prompt opcional y un clic.

Manos de una mujer sobre un equipo portátil con una ventana de carga que muestra una miniatura de retrato y un archivo de audio

Prepara el retrato

Elige una foto en la que el rostro se vea con claridad, esté bien iluminado y mire a la cámara o esté ligeramente girado. Evita las gafas de sol, los filtros intensos y los rostros pequeños entre una multitud.

¿No tienes una foto adecuada? Genera una con Seedream 4.5, que produce imágenes en 2K o 4K con 16:9 y otras relaciones de aspecto. Describe una persona realista, una expresión neutra y luz suave de ventana, y usa el resultado como tu avatar.

Añade tu audio

Graba tu propia voz o genera una locución con Speech 2.8 HD o ElevenLabs v3. Expórtala como MP3 o WAV y mantenla por debajo de 35 segundos, ya que los archivos más largos hacen que la generación falle. Quita la música de fondo, porque la voz limpia da la sincronización más precisa.

Ejecuta y revisa el resultado

Sube la imagen y el audio, añade un prompt si quieres dirigir la escena e inicia la ejecución. Los ejemplos publicados de modo rápido en PicassoIA terminaron en unos 3 a 6 minutos. Después revisa el clip en este orden:

  1. Los primeros dos segundos, donde los errores de sincronización aparecen antes.
  2. Los dientes y las comisuras de la boca en las vocales largas.
  3. Las manos y los hombros, para ver si el movimiento parece natural.

Así se comporta cada parámetro:

ParámetroQué haceConsejo
ImagenLa persona que hablaDe frente, nítida, bien iluminada
AudioControla el habla y la duraciónMenos de 35 segundos, sin música
PromptEscena, movimiento y cámaraDescribe el comportamiento, no los labios
Modo rápidoCambia detalle fino por velocidadActivado para borradores, desactivado para finales
SemillaHace que una toma sea reproducibleGuarda la semilla de cualquier toma que sirva

Tres prompts que vale la pena copiar como punto de partida:

  • "Presentador amable, hombros relajados, pequeños asentimientos, plano medio estable."
  • "Entrega enérgica, sonrisa amplia, gestos expresivos con las manos, luz de día suave."
  • "Tono calmado y serio, movimiento mínimo, acercamiento lento al rostro."

Otros modelos de avatares que vale la pena probar

Ningún modelo gana en todos los trabajos, y cada uno de estos está disponible en la misma plataforma, así que una prueba lado a lado solo te costará unos minutos.

Cuatro compañeros alrededor de una mesa comparando clips de video de retratos en una pantalla de pared

ModeloIdeal paraNotas
OmniHuman 1.5Clips expresivos de hasta 35 segundosPrompt, modo rápido y semilla
OmniHumanClips cortosMejor calidad en 15 segundos o menos
Fabric 1.0Fotos parlantes rápidasSalida en 480p o 720p
Kling Avatar v2Rostros, dibujos animados y animalesModos Standard y Pro, prompt opcional
P Video AvatarDe guion a video sin audioMás de 30 voces, 10 idiomas, hasta 1080p
Lipsync 2 ProResincronizar material ya grabadoAcepta un video MP4 y un archivo de audio WAV

Elige según la entrada. Si partes de una foto y una grabación, empieza con OmniHuman 1.5 y compáralo con Fabric 1.0 o Kling Avatar v2. Si solo tienes un guion escrito y no hay voz, P Video Avatar puede ponerle voz por ti. Si ya rodaste el video y solo necesitas nuevos labios, Lipsync 2 Pro reescribe el movimiento de la boca para que coincida con una nueva pista de audio.

Crea hoy tu primera foto parlante

Leer sobre precios solo te lleva hasta cierto punto. La forma más rápida de juzgar OmniHuman 1.5 es darle tu propio retrato y una nota de voz de 10 segundos, y luego ver el resultado a velocidad normal.

Genera un rostro con Seedream 4.5, graba o sintetiza una frase corta y ejecuta ambos con OmniHuman 1.5. Prueba la misma foto con tres voces distintas. Cambia el prompt de "tranquilo y estable" a "enérgico, sonrisa amplia" y compara las tomas.

Todos los modelos mencionados aquí están en un solo lugar: picassoia.com/en/all-models. Ábrelo, elige dos modelos de avatares y crea tu primer video parlante antes de que se enfríe el café.

Compartir este artículo

Elige tu idioma