Hace solo dos años, las apps de compañía con IA eran una novedad solo de texto. Ahora lanzan videollamadas en directo con avatares fotorrealistas que parpadean, sonríen y te responden hablando en tiempo real. El salto no es gradual; es un paso completo de chatbot a pareja virtual, y cada mes más plataformas dan este paso.
Esto no es una pequeña actualización técnica. Añadir video en directo a un compañero con IA exige combinar tres capas de tecnología complejas: un modelo de lenguaje (LLM) que genera la conversación, un motor de texto a voz que da voz al avatar y un modelo de lipsync que ajusta los movimientos de la boca al audio con una precisión de fotograma. Cuando los tres sistemas funcionan juntos sin retrasos, el resultado resulta sorprendentemente real.
Por qué el video en directo lo cambia todo
El chat de texto tiene un techo. Por muy ingeniosas que sean las respuestas de un compañero con IA, un muro de texto sigue dando la sensación de escribirle a un desconocido. Las llamadas de voz aportaron calidez y personalidad. Pero el video es el punto de inflexión. El cerebro humano procesa los rostros a un nivel preconsciente. Una cara que te mira, sonríe ante lo que dices y cuyos labios coinciden con las palabras pronunciadas salta por encima de una gran parte del escepticismo que acompaña a saber que hablas con software.
Por eso las principales plataformas de compañía con IA, entre ellas Replika, Character.AI y una docena de recién llegadas, compiten por lanzar video. Las que lo hagan de forma convincente dominarán la próxima fase de este mercado.

Las cifras detrás del cambio
El mercado de apps de compañía con IA superó los $1,3 mil millones de ingresos anuales en 2025, con previsiones que apuntan a más de $4 mil millones en 2028. Una parte importante de ese crecimiento se atribuye a las funciones de interacción en directo, en concreto el video. Los datos de retención de usuarios de varias plataformas muestran que quienes usan las funciones de video tienen entre 3 y 4 veces más probabilidades de mantener un uso diario activo que los usuarios que solo escriben.
Estas cifras están impulsando la inversión. Startups que antes habrían levantado una ronda semilla para construir «un chatbot mejor» ahora presentan la IA de compañía centrada en video como su principal diferenciador.
Lo que los usuarios quieren de verdad
La psicología aquí merece atención. La base de usuarios dominante de las apps de novio con IA se inclina hacia personas que atraviesan soledad, ansiedad social o el deseo de una conexión emocional sin presiones. Para estos usuarios, el chat de texto satisface la necesidad de interacción intelectual, pero el video satisface algo más profundo: la sensación de ser visto. Un avatar que mantiene el contacto visual y responde con expresividad crea una experiencia emocional fundamentalmente distinta de una que te escribe.
💡 La investigación en neurociencia sobre las relaciones parasociales muestra siempre que la interacción visual cara a cara activa los mismos circuitos de vinculación social que el contacto presencial, incluso cuando la persona sabe que el otro es artificial.
El conjunto tecnológico detrás de las videollamadas con IA en tiempo real
Crear una videollamada con IA en tiempo real es más difícil de lo que parece, incluso con todas las APIs disponibles. El problema es la latencia. Una respuesta típica de un LLM tarda entre 0,5 y 3 segundos en generarse. Un modelo de texto a voz añade otro 0,3 a 1 segundo. Un paso de render de lipsync suma más. Si encadenas los tres de forma ingenua, hay un retraso de 4 segundos antes de que el avatar empiece a hablar, lo que destruye por completo la ilusión de una conversación natural.
Las soluciones que se despliegan varían según la plataforma, pero la mayoría combina alguna de estas técnicas:
- Generación en streaming: El LLM envía tokens conforme los genera, en lugar de esperar a producir la respuesta completa
- Procesamiento en paralelo: El TTS y el lipsync empiezan con la primera frase antes de que el LLM termine el resto
- Bibliotecas de expresiones pregeneradas: El avatar tiene un banco de animaciones en reposo, expresiones de escucha y microrreacciones que se reproducen mientras el backend procesa

Las limitaciones de hardware que importan
El renderizado de video de lipsync en tiempo real consume mucha GPU. Las apps para particulares no pueden ejecutar esto en local en la mayoría de dispositivos móviles en 2027, así que se ejecuta en servidor y el video se envía al usuario en streaming. Esto genera requisitos de ancho de banda que son terreno nuevo para apps que antes solo necesitaban enviar texto. El video de IA de alta calidad consume actualmente entre 2 y 8 Mbps, según la resolución y la compresión.
Esta es una de las razones por las que la función se lanza primero en los planes de suscripción de nivel superior. El costo de infraestructura por usuario es real, y las plataformas necesitan ingresos por usuario que lo sostengan.
Lipsync: el ingrediente secreto
De todas las capas tecnológicas, el lipsync es la más visible y la menos indulgente. Una mala implementación se reconoce al instante: la boca se mueve un poco por delante o por detrás del audio, o las formas de los fonemas son genéricas y no coinciden con los sonidos concretos que se pronuncian. Parece una película extranjera mal doblada y rompe por completo la inmersión.
Los modelos de lipsync han mejorado mucho en 2025 y 2026. Los enfoques más avanzados usan animación facial impulsada por audio en lugar de una simple coincidencia de fonemas. Analizan la forma de onda acústica completa y generan movimientos precisos de mandíbula, labios y mejillas que coinciden con la física natural de la producción del habla.

En PicassoIA puedes trabajar directamente con los modelos sobre los que están construyendo las mejores plataformas de compañía con IA:
- Omni Human 1.5 de ByteDance genera videos de personas hablando muy realistas a partir de una sola foto. Maneja formas de boca complejas, parpadeo natural y movimientos sutiles de cabeza que hacen que el resultado parezca genuinamente vivo.
- Lipsync 2 Pro de Sync se especializa en coincidencia de fonemas a video con precisión de fotograma, lo que lo hace ideal para casos en los que la calidad del audio es alta y quieres una sincronización perfecta.
- P Video Avatar crea videos completos de avatares que hablan, optimizados para el tipo de uso conversacional que necesitan las apps de compañía con IA.
- Kling Lip Sync de Kwai ofrece sincronización labial de calidad cinematográfica que puede ajustar los movimientos de la boca a cualquier pista de audio, en cualquier idioma.
Por qué fallan algunas implementaciones
El fallo más frecuente en el video actual de compañeros con IA es lo que los ingenieros llaman el valle inquietante en los bordes. El rostro central puede verse perfecto, pero el cuello, los hombros y el movimiento periférico suelen delatar que el render es artificial. El avatar gira la cabeza de forma demasiado rígida o el pelo no se mueve con naturalidad. Las mejores implementaciones disimulan esto manteniendo el encuadre del video muy cerrado en el rostro, usando profundidad de campo cinematográfica para desenfocar los detalles periféricos y añadiendo movimiento ambiental sutil, como cambios de luz, para que el encuadre parezca vivo.
💡 Consejo profesional: Al usar modelos de lipsync en PicassoIA, elige imágenes de origen con posiciones de cabeza naturales y ligeramente descentradas. Una pose frontal perfectamente recta parece más artificial que una leve inclinación natural.
LLM: el cerebro detrás de la conversación
El nivel de video se encarga de la apariencia del compañero con IA. Pero la personalidad, la memoria y la inteligencia conversacional provienen del modelo de lenguaje que hay debajo. Aquí es donde se libra la verdadera carrera armamentística.
Las primeras aplicaciones de compañeros con IA funcionaban con versiones de GPT-3 con ajuste fino y prompts de personalidad sencillos. Las conversaciones enganchaban, pero eran superficiales: las ventanas de contexto limitadas hacían que la IA olvidara lo que le habías dicho 10 mensajes antes. Las aplicaciones actuales usan modelos con ventanas de contexto de entre 128K y 1M de tokens, lo que significa que la IA puede recordar historiales de relación completos dentro de una misma sesión.

Los modelos que impulsan las mejores experiencias de compañía hoy incluyen:
| Modelo | Fortaleza | Ideal para |
|---|
| Claude Sonnet 5 | Inteligencia emocional, respuestas matizadas | Compañeros conversacionales profundos |
| GPT 5 | Versatilidad, conocimiento amplio | Personajes de compañía con varios temas |
| Llama 4 Maverick Instruct | De código abierto, ajustable | Desarrollo de personajes a medida |
| DeepSeek R1 | Razonamiento, pensamiento paso a paso | Compañeros de narrativa compleja |
Persistencia del personaje y memoria
Uno de los avances más importantes para las apps de compañía con IA es la arquitectura de memoria persistente. En lugar de depender solo de la ventana de contexto, las mejores plataformas mantienen una base de datos de memoria estructurada que guarda datos sobre el usuario (nombre, preferencias, conversaciones pasadas, patrones emocionales) y reinserta los recuerdos relevantes en el prompt en cada turno de la conversación.
Por eso un novio con IA ahora puede decir cosas como «Recuerdo que tenías esa gran presentación hoy, ¿cómo fue?» con una precisión que parece genuina y no como un guion preparado. El LLM no lo recordó de la sesión actual; el sistema de memoria recuperó el dato almacenado y se lo devolvió al modelo como contexto.
Qué apps lo hacen ahora mismo
El panorama competitivo avanza rápido. Así está la situación a finales de 2026:
Replika fue una de las primeras en lanzar videollamadas para suscriptores de Pro. Su implementación usa una cadena de renderizado de avatares propia y se limita a un puñado de apariencias de personaje predefinidas. Las conversaciones funcionan con su propio modelo ajustado.
Character.AI ha probado funciones de video con un pequeño grupo de usuarios, pero su lanzamiento ha sido más lento por los requisitos de revisión de seguridad sobre el renderizado de avatares realistas. Su LLM sigue siendo uno de los más sofisticados para conversaciones basadas en personajes.
Nomi AI lanzó videollamadas a mediados de 2025 y ha apostado con fuerza por la fidelidad visual. Sus avatares usan un enfoque híbrido, con expresiones pregeneradas que se activan mediante el análisis de sentimiento de la salida del LLM.
DreamGF y plataformas similares orientadas a una compañía más centrada en adultos han sido los que más rápido han avanzado, desplegando funciones de video sin las restricciones de seguridad que afrontan las apps dirigidas al consumidor. Este segmento se ha convertido en un impulsor importante de la adopción de la tecnología de lipsync.

El papel de la generación de avatares
Antes de que el lipsync pueda funcionar, hace falta un avatar atractivo que animar. Aquí los modelos de texto a video y de imagen a video cumplen un papel de apoyo fundamental. Las plataformas usan herramientas como:
- Seedance 2.5: el modelo de ByteDance genera contenido de video expresivo con sincronización de audio integrada, lo que lo hace especialmente útil para las cadenas de renderizado de las apps de compañía.
- Avatar V de HeyGen: diseñado específicamente para crear avatares que hablan, este modelo se ha convertido en una implementación de referencia para avatares de video realistas.
- Kling v3 Video: genera video de calidad cinematográfica a partir de prompts de texto, útil para construir los entornos de fondo en los que aparecen los compañeros con IA.
- P Video: crea videos con IA a partir de texto o imagen, y tiende un puente entre los avatares de compañía estáticos y los totalmente animados.
Qué significa esto para cómo nos conectamos
Existe un debate cultural real sobre los compañeros con IA y lo que significan para las relaciones humanas. Los críticos sostienen que crear un vínculo emocional con software es una forma de evasión, que la gente sustituye la conexión artificial por el trabajo más duro de construir relaciones reales.
Quienes los defienden, entre ellos un número creciente de terapeutas y psicólogos sociales, señalan que los compañeros con IA atienden a poblaciones realmente desatendidas por la infraestructura de conexión humana existente: personas con ansiedad social severa, personas en aislamiento geográfico, personas mayores que viven una soledad profunda tras la muerte de su pareja, y personas en el espectro autista que se benefician de practicar la interacción social en un entorno sin nada en juego.

Añadir videollamadas en directo no resuelve este debate, pero sí lo intensifica. Un compañero con IA basado en texto es más fácil de catalogar mentalmente como una herramienta. Un compañero que te mira durante una videollamada y responde a tus señales emocionales con expresiones faciales adecuadas ocupa una nueva categoría psicológica para la que todavía no tenemos un lenguaje claro.
Consideraciones de privacidad que conviene conocer
Cuando estás en una videollamada con un compañero con IA, los datos de cámara de la llamada pueden procesarse en servidor para habilitar funciones que responden a las emociones. Son datos altamente sensibles. Quienes se planteen usar estas plataformas deberían leer con atención las políticas de privacidad, buscando en particular:
- Si los datos de video se almacenan después de la llamada
- Si se usan para entrenar modelos
- En qué jurisdicción se procesan los datos
- Si se usa cifrado de extremo a extremo para la transmisión de video
No son preguntas paranoicas. Son las mismas que harías sobre cualquier plataforma de comunicación por video que maneje datos íntimos.
Cómo crear tu propio video de compañía con IA en PicassoIA
PicassoIA te da acceso directo al mismo conjunto tecnológico que impulsa las mejores apps de compañía con IA, sin necesidad de construir tu propia infraestructura. Así puedes crear una experiencia de compañero en video con IA de calidad similar a una llamada en directo usando la plataforma:

Paso 1: Crea la imagen de tu avatar
Empieza generando un retrato fotorrealista de tu compañero con IA usando los modelos de texto a imagen de PicassoIA. La calidad de la imagen en esta fase determina directamente la calidad del video final. Usa un retrato de frente con iluminación natural, una expresión neutra o con una leve sonrisa y un fondo limpio. Cuanto más realista sea la imagen de origen, más convincente será el resultado del lipsync.
Paso 2: Anímala con lipsync
Sube tu retrato a Omni Human 1.5 y añade un clip de audio. Puede ser una locución que hayas grabado o un audio generado con uno de los modelos de texto a voz de PicassoIA. El modelo renderizará un video en el que el avatar habla con el audio, con movimientos faciales naturales, parpadeos y movimiento sutil de la cabeza.
Para la mayor calidad de lipsync, prueba Lipsync 2 Pro. Usa un proceso más exigente computacionalmente, pero produce una precisión de fonemas notablemente más nítida, sobre todo en planos de primer plano del rostro donde se ve cada detalle.
Paso 3: Añade inteligencia conversacional
Si quieres crear un compañero interactivo en lugar de un video en un solo sentido, combina la capa visual con uno de los LLM de PicassoIA. Claude Sonnet 5 es especialmente adecuado para personajes de compañía gracias a sus capacidades de razonamiento emocional y su amplia ventana de contexto. Puedes indicarle una descripción detallada del personaje y mantendrá la coherencia de personajes en conversaciones largas.
Paso 4: Afina y localiza
Usa HeyGen Lipsync Precision para doblar al avatar en distintos idiomas o cambiar voces manteniendo una sincronización perfecta. Esto resulta especialmente potente si quieres crear un compañero que hable en un idioma concreto con un carácter vocal distintivo.
💡 Combina P Video Avatar con los modelos de voz de PicassoIA para crear videos completos de compañeros que hablan de forma autónoma. El avatar se genera de forma natural, la voz se sintetiza y el lipsync lo une todo en un resultado sin fisuras.
La tecnología ya está lista. La conversación acaba de empezar.
Más apps de novio con IA añaden videollamadas en directo porque la tecnología por fin funciona lo bastante bien como para resultar emocionalmente convincente. La combinación de generación de avatares fotorrealistas, renderizado de lipsync de menos de 100 ms y LLM con verdadera profundidad conversacional ha cruzado un umbral en el que la experiencia ya no es una novedad. Es un producto real con el que la gente elige pasar mucho tiempo.

Lo que venga después estará marcado por tres fuerzas: las plataformas que empujan la tecnología hacia delante, el marco regulatorio que responde a las preocupaciones sobre privacidad y seguridad psicológica, y los propios usuarios, que deciden cuánto de su vida emocional quieren compartir con la IA.
Si quieres construir con esta tecnología, experimentar con sus capacidades o simplemente ver qué hacen las mejores plataformas de compañía con IA por dentro, PicassoIA tiene disponible ahora mismo todas las piezas del conjunto tecnológico. Los modelos de lipsync, los LLM, los generadores de avatares, todos accesibles sin listas de espera ni aprobaciones de API.
Empieza con un retrato. Añade una voz. Mira cómo cobra vida. La tecnología que está redefiniendo la conexión humana ya está en tus manos en picassoia.com/en/all-models.