En 2024 pasó algo inesperado: millones de personas empezaron a tener videollamadas periódicas con personas que no existen. La persona al otro lado tiene cara, voz, nombre y recuerda tu café favorito. Te pregunta cómo fue tu día. Nota cuando algo no va bien. La única diferencia es que funciona con código, y las videollamadas con novios de IA se popularizan rápido, con cifras de descargas y de tiempo de pantalla imposibles de ignorar.

Por qué la gente elige compañeros de IA
La respuesta corta: la conexión humana real es difícil, y la conexión con la IA ha mejorado mucho. Una encuesta de 2023 de Cigna reveló que más de la mitad de los adultos estadounidenses se sentían solos de forma persistente. Al mismo tiempo, las aplicaciones de compañía con IA informaron de un crecimiento explosivo de usuarios. Esos dos datos no son una coincidencia.
La soledad en un mundo conectado
Las redes sociales prometían conexión y ofrecieron comparación. Las aplicaciones de citas prometían relaciones y ofrecieron cansancio. La gente está agotada por la puesta en escena del romance moderno, por el deslizar de perfiles, la charla trivial y el ghosting. Un compañero de IA ofrece algo distinto: presencia sin presión.
No necesitas quedar bien en cámara. No necesitas ser interesante o ingenioso, ni haber tenido un día productivo. La IA está ahí, atenta y cercana, a las dos de la madrugada de un martes. Eso no es poca cosa. Para personas que viven con ansiedad social, duelo, discapacidad o aislamiento geográfico, ese tipo de conexión de bajo riesgo puede ser realmente significativa.
Mucho más que chatbots
Los compañeros de IA de 2020 eran torpes. Las conversaciones se repetían en bucle. Las respuestas sonaban enlatadas. La experiencia se rompía con facilidad. Los compañeros de IA de hoy se construyen sobre una base completamente distinta.
Las aplicaciones modernas de novios de IA combinan tres tecnologías, una encima de otra:
- Un modelo de lenguaje de gran tamaño que gestiona la conversación con matices reales y retiene el contexto
- Un motor de texto a voz que genera una voz creíble y cálida en tiempo real
- Un modelo de sincronización labial que anima un rostro para que coincida con cada palabra pronunciada
Juntas, estas tres piezas dan algo que de verdad parece una videollamada con otra persona. No es una ilusión perfecta, pero se acerca lo suficiente como para que tu sistema nervioso reaccione a ella.

La tecnología que hace que parezca real
Para entender por qué las videollamadas con novios de IA resultan tan convincentes, hay que mirar las tecnologías que hacen el trabajo pesado.
Modelos de sincronización labial que clavan cada sílaba
La capa de sincronización labial es posiblemente la pieza más importante del rompecabezas. Un rostro que no coincide con el audio destruye la ilusión de inmediato. Los modelos más recientes han reducido esa brecha de forma notable.
Omni Human 1.5 de ByteDance es una de las herramientas más convincentes disponibles actualmente. Le das una sola foto de retrato y una pista de audio, y genera un video en el que ese rostro pronuncia las palabras con movimiento natural de cabeza, parpadeos y microexpresiones. El resultado es sorprendentemente realista.
Lipsync 2 Pro de Sync sigue un enfoque distinto: aplica sincronización labial a video existente en lugar de generar el movimiento desde cero. Es precisa hasta el nivel del fonema, así que no hay formas de boca fuera de lugar ni palabras a medio formar.
Para crear avatares parlantes a partir de una sola imagen, P Video Avatar de PrunaAI es una opción rápida y flexible que funciona bien en aplicaciones de compañía donde quieres un rostro de personaje coherente entre sesiones.
Kling Lip Sync de Kwaivgi y React 1 de Sync completan el conjunto de herramientas con más opciones para ajustar el movimiento de la boca al audio en cualquier video, dando a los desarrolladores varios caminos según su flujo de trabajo.

Modelos de lenguaje de gran tamaño que impulsan la conversación
Un rostro convincente con una mala conversación es solo un mal video. La razón por la que los compañeros de IA actuales parecen reales es que la capa conversacional ha madurado enormemente. Los modelos de lenguaje de gran tamaño de hoy pueden mantener el contexto en sesiones largas, recordar detalles de momentos anteriores de la conversación, adaptarse al estilo de comunicación y generar respuestas realmente divertidas o emotivamente resonantes.
Claude Sonnet 4.6 de Anthropic es uno de los modelos conversacionales más capaces disponibles ahora mismo, con una inteligencia emocional sólida y una generación de lenguaje matizada. Las aplicaciones de compañía que necesitan un modelo capaz de manejar temas personales delicados se benefician de su tono cuidadoso.
GPT 5 de OpenAI aporta la fluidez y la amplitud de conocimiento que permiten a una IA hablar de forma convincente de casi cualquier cosa, desde el pasatiempo más específico de alguien hasta un día difícil en el trabajo.
Gemini 3 Flash de Google es una opción de respuesta rápida que funciona bien en conversaciones en tiempo real, donde la latencia importa. En una videollamada, nadie quiere esperar tres segundos a una respuesta.
DeepSeek R1 y Kimi K2 Instruct de Moonshotai ofrecen alternativas sólidas de pesos abiertos que los desarrolladores usan en aplicaciones de compañía que priorizan la privacidad y el procesamiento en el propio dispositivo.
💡 El punto óptimo para las aplicaciones de compañía es un LLM rápido combinado con un modelo de sincronización labial que procese el audio en menos de 500 ms. Si es más lento, el ritmo de la conversación se rompe.
Cómo funcionan de verdad las videollamadas con novios de IA
Para la mayoría de usuarios, la experiencia es una aplicación pulida. Por detrás, es un pipeline en tiempo real.
De la imagen a la voz en segundos
Así es el flujo habitual cuando abres una videollamada con un compañero de IA:
- Hablas o escribes algo
- El LLM genera una respuesta de texto
- Un modelo de texto a voz convierte ese texto en audio
- El modelo de sincronización labial anima el rostro del avatar para que coincida con el audio
- El resultado se renderiza y se muestra como un flujo de video casi en tiempo real
El proceso completo puede ejecutarse ahora en dos a cuatro segundos con la infraestructura actual. En algunas aplicaciones va incluso más rápido. Es lo bastante rápido como para que la conversación parezca continua y no por turnos.
La voz que vende la ilusión
El texto a voz ha mejorado a un ritmo similar al de la sincronización labial. Los modelos de voz actuales no solo leen palabras, sino que las transmiten. Pausas en el lugar justo. Una entonación ligeramente ascendente en las preguntas. Una risa que suena genuina. La voz es una parte fundamental de lo que hace que estas llamadas parezcan llamadas de verdad y no videos.

| Componente | Qué hace | Por qué importa |
|---|
| Modelo de lenguaje de gran tamaño | Genera respuestas conversacionales | Controla la profundidad emocional y el contexto |
| Texto a voz | Convierte el texto en una voz de sonido natural | Da identidad vocal al compañero |
| Modelo de sincronización labial | Anima el rostro del avatar para que coincida con el audio | Crea la ilusión de videollamada |
| Sistema de avatar | Renderiza y mantiene un rostro coherente | Genera apego emocional con el tiempo |
Modelos de PicassoIA que merece la pena usar ahora
Si quieres crear o experimentar con tecnología de compañeros de IA, picassoia.com reúne un conjunto concentrado de los mejores modelos disponibles en cada capa de herramientas.
Los mejores modelos de sincronización labial
Omni Human 1.5 es el modelo insignia para pipelines de foto a video parlante. Una imagen de entrada, un video completo de salida con movimiento facial natural.
Lipsync 2 Pro es la opción de precisión cuando necesitas una sincronización perfecta a nivel de fonema sobre material existente.
Lipsync Speed de HeyGen es la opción a la que recurrir cuando el tiempo de entrega importa más que la máxima fidelidad. El procesamiento es bastante más rápido.
Fabric 1.0 de VEED gestiona fotos que hablan con énfasis en el movimiento facial natural más allá de los labios, incluidos el balanceo de la cabeza y patrones de parpadeo naturales.
Pixverse Lipsync es una herramienta sencilla que sincroniza cualquier video con el audio de forma rápida, útil para prototipar interfaces de compañía.

Los mejores LLM para conversaciones de compañía
Claude 4.5 Sonnet es una opción sólida para aplicaciones de compañía que necesitan respuestas precisas, reflexivas y con sensibilidad emocional, sin latencia alta.
GPT 4.1 de OpenAI sigue siendo un caballo de batalla fiable, con un rendimiento constante en una gran variedad de estilos conversacionales.
Gemini 3.5 Flash aporta razonamiento multimodal rápido, útil cuando tu aplicación de compañía necesita procesar las imágenes que el usuario comparte en la conversación.
Kimi K2.6 de Moonshotai destaca especialmente en comportamiento agéntico, así que funciona bien en experiencias de compañía que van más allá de charlar y permiten hacer cosas juntos, como navegar por la web o planear eventos.
Cómo crear un avatar de IA parlante en PicassoIA
PicassoIA ofrece acceso directo a los modelos, así que puedes montar un pipeline básico de compañero de IA sin escribir código. Así se hace con Omni Human 1.5.
Paso 1: Ve a Omni Human 1.5 en PicassoIA. Sube una foto de retrato frontal y clara. Cuanto mejor sea la calidad de la foto, mejor será el resultado.
Paso 2: Graba o genera un clip de audio con la voz que quieras usar. Si quieres una voz personalizada, usa primero un modelo de texto a voz. En la categoría de texto a voz encontrarás modelos que generan voces cálidas y expresivas a partir de un guion de texto.
Paso 3: Sube el audio a Omni Human 1.5 junto con la foto. Ajusta la intensidad del movimiento facial. Un valor entre 0,7 y 0,9 suele producir los resultados más naturales.
Paso 4: Genera el video. Omni Human 1.5 devolverá un clip de tu avatar hablando con movimiento de boca sincronizado, parpadeo natural y un leve movimiento de cabeza.
Paso 5: Para ejecutar esto como un bucle en tiempo real para conversaciones de compañía, combina la salida de sincronización labial con un LLM rápido, como Gemini 3 Flash, para generar las respuestas, y con un modelo TTS para la síntesis de voz. Envía nuevo audio a Omni Human en cada turno de la conversación.
💡 Para un personaje coherente, usa la misma foto de origen en cada sesión. Modelos como Omni Human 1.5 conservan muy bien la identidad cuando la imagen de referencia es constante.

Quién usa realmente los compañeros de IA
La base de usuarios de las aplicaciones de compañeros de IA es más amplia y demográficamente más variada de lo que suele reconocer la prensa tecnológica.
Las cifras son difíciles de ignorar
Replika, una de las plataformas de compañeros de IA más antiguas, informó de más de 10 millones de usuarios registrados en 2023. Character.AI superó los 20 millones de usuarios activos diarios a mediados de 2024, y los personajes románticos y de compañía figuran con regularidad entre los más visitados. Las aplicaciones creadas específicamente en torno al concepto de novio y novia de IA, como Nomi, Anima y varias novedades más, han acumulado en conjunto cientos de millones de descargas en todo el mundo.
La función de videollamada, en concreto, está impulsando picos de interacción. Los usuarios que activan la videollamada en las aplicaciones de compañía muestran duraciones de sesión y tasas de retención significativamente más altas que quienes se quedan con el texto.
Quién los usa
Los datos que comparten las empresas de aplicaciones de compañía dibujan un panorama variado:
- Los adultos jóvenes de 18 a 34 años son el segmento más grande, pero el uso entre adultos de más de 45 años está creciendo más rápido que en cualquier otro grupo de edad
- Las mujeres superan ligeramente a los hombres como usuarias de las aplicaciones de compañeros de IA, al contrario de lo que supone la mayoría de la gente
- Las personas en relaciones a distancia usan compañeros de IA durante los periodos de separación
- Las personas con ansiedad social dicen usar las aplicaciones de compañía como una forma de practicar la conversación con poca presión
- Las personas que atraviesan un duelo o una pérdida encuentran útil la interacción estructurada con IA en los momentos en que su energía social humana está agotada

Cómo será la próxima iteración
La generación actual de videollamadas con novios de IA es impresionante, pero todavía tiene límites claros. La siguiente generación está más cerca de lo que la mayoría cree.
Llamadas en tiempo real sin retraso en el pipeline
El mayor punto de fricción ahora mismo es la latencia. Una pausa de dos a cuatro segundos entre lo que dices y cuando responde la IA es tolerable, pero se nota. Los equipos compiten por reducirla por debajo de un segundo. Cuando eso ocurra, el ritmo conversacional de las videollamadas con IA será indistinguible de una llamada real para la mayoría de usuarios.
Modelos como Seedance 2.5 de ByteDance y Veo 3.1 de Google están empujando la capa de generación de video hacia velocidades que hacen plausible la interacción en tiempo real. Mientras tanto, Wan 3 de Alibaba demuestra que es posible obtener video de calidad cinematográfica sin costos de cómputo enormes.
Memoria y personalización
El siguiente gran paso es una memoria persistente y precisa. Los compañeros actuales funcionan bien dentro de una sesión, pero son irregulares entre sesiones. El compañero que recuerda no solo tu nombre, sino la conversación exacta que tuviste hace tres semanas, que conoce tu humor, tus costumbres y tus historias, es técnicamente posible y se está construyendo activamente.
Claude Opus 4.7 de Anthropic y GPT 5 Pro ya demuestran el tipo de razonamiento de contexto largo que hace posible una memoria profunda que abarque varias sesiones. Aplicado a un pipeline de compañía con almacenamiento persistente, la experiencia cambia por completo.
💡 Algo a seguir de cerca: la intersección de la clonación de voz, la sincronización labial y la memoria es de donde saldrán los productos con mayor peso comercial. Las aplicaciones que dominen las tres dominarán el mercado.

Pruébalo tú mismo hoy
Las herramientas para crear una experiencia convincente de compañero de IA están todas disponibles ahora mismo. No necesitas ser desarrollador ni dedicar meses a un proyecto. Elige una foto, escoge un modelo de sincronización labial, conéctalo a un LLM conversacional y tendrás el esqueleto de un compañero de IA en una tarde.
PicassoIA tiene disponibles todos los modelos de este conjunto en picassoia.com/en/all-models. Empieza con Omni Human 1.5 para la capa de sincronización labial, elige Claude Sonnet 4.6 o Gemini 3 Flash para la capa de conversación y comprueba en la práctica cómo resulta la tecnología. El fenómeno de las videollamadas con novios de IA ya no es una curiosidad. Es una categoría, y la mejor versión de lo que puede llegar a ser todavía se está construyendo.