Ese video que circula en redes sociales podría no ser real. Ni siquiera un poco. En los últimos dos años, el video generado por IA ha cruzado un umbral que la mayoría no vio venir: los falsos son ahora lo bastante convincentes como para engañar a periodistas entrenados, a las fuerzas del orden e incluso, a veces, a las personas que aparecen en ellos. Pero que sea convincente no significa que sea perfecto. Todo video sintético deja huellas y, una vez sepas qué buscar, detectarás siempre las grietas.

Por qué los videos de IA son tan difíciles de detectar hoy
La distancia entre las imágenes reales y el video sintético se ha reducido drásticamente. Herramientas como Veo 3, Sora 2 y Kling v2.6 pueden producir video con audio nativo, desenfoque por movimiento realista y una continuidad de escena coherente, algo que hace cinco años habría requerido un presupuesto de Hollywood.
Los modelos se entrenan con miles de millones de fotogramas reales
Los modelos de texto a video actuales se entrenan con conjuntos de datos masivos de grabaciones del mundo real, lo que significa que han absorbido el vocabulario visual de la autenticidad. Saben cómo se dispersa la luz a través de una ventana. Saben cómo se arruga la ropa cuando alguien se sienta. El problema no es que fallen en todo, sino que aciertan casi en todo, lo que hace que los errores que quedan sean más difíciles de ver si no sabes dónde mirar.
El valle inquietante se ha reducido
Los primeros deepfakes tenían pistas evidentes: tonos de piel que no encajaban, expresiones congeladas, fondos borrosos como acuarela. Eso ha desaparecido en gran medida. Lo que queda son problemas más sutiles y sistémicos, relacionados con la forma en que estos modelos generan el movimiento a lo largo del tiempo.
💡 Idea clave: El video con IA se genera prestando atención a la coherencia espacial, pero a menudo le cuesta la coherencia temporal: la constancia de los detalles finos a lo largo de varios segundos de imagen. Ahí es donde se desmoronan la mayoría de los falsos.
El rostro: casi perfecto, pero no del todo
El rostro humano es lo más difícil de falsificar de forma convincente, y sigue siendo donde la mayoría de los videos con IA se desmoronan al examinarlos de cerca.

El problema de la textura de la piel
La piel humana real tiene miles de microdetalles: poros, vello fino, lunares asimétricos, capilares, y variaciones sutiles de color por el flujo sanguíneo bajo la superficie. Los modelos de IA lo aproximan con texturas procedurales que a menudo se ven algo demasiado lisas o algo demasiado regulares.
Al examinar un rostro en un video que sospechas que es de IA, busca:
- Coherencia de los poros: La piel real tiene patrones de poros irregulares. La piel de IA suele tener una textura uniforme que se repite por todo el rostro.
- Transición entre cabello y piel: ¿Dónde termina la línea del cabello y empieza la piel? La IA falla con regularidad en este límite.
- Asimetría facial: Los rostros humanos son asimétricos de forma natural. Los rasgos perfectamente simétricos son una señal de alerta importante.
- Cambios en el tono de la piel: ¿El tono se mantiene exactamente igual con distintos ángulos de luz? Los rostros reales cambian sutilmente a medida que la luz se mueve.
Dientes e interior de la boca
Una de las pistas más valiosas en cualquier análisis de deepfakes. Cuando el sujeto habla, observa con atención el interior de su boca. Los modelos de IA producen con frecuencia:
- Dientes que aparecen y desaparecen entre fotogramas
- Líneas de encías que cambian de posición cuando deberían permanecer fijas
- Lenguas que se mueven en arcos físicamente imposibles
- Sombras en el interior de la boca que ignoran la dirección real de la fuente de luz
Desplazamiento de accesorios faciales
Las gafas, los pendientes y los piercings son especialmente difíciles de mantener estables entre fotogramas para la IA. Fíjate en pendientes que cambian de forma entre planos, en monturas de gafas que se deforman en las patillas o en joyas que parecen flotar ligeramente sobre la piel en lugar de apoyarse en ella.
Parpadeo: la pista más antigua que sigue funcionando
Los patrones de parpadeo siguen siendo uno de los indicadores más fiables de video sintético, a pesar de los años de investigación activa para corregir el problema.
Tasas de parpadeo naturales frente a sintéticas
Las personas parpadean entre 15 y 20 veces por minuto. Los primeros deepfakes apenas parpadeaban. Los modelos actuales han corregido la frecuencia, pero de maneras que siguen siendo detectables si sabes qué observar:
| Patrón | Persona real | Generado por IA |
|---|
| Tasa de parpadeo | 15-20 por minuto | A menudo 10-18 por minuto |
| Duración del parpadeo | 150-400ms, variable | A menudo uniforme, en torno a 200ms |
| Simetría de los párpados | Los párpados se mueven ligeramente de forma independiente | Ambos párpados suelen moverse de forma idéntica |
| Microparpadeos involuntarios | Presentes | Raros o completamente ausentes |
| Ajuste tras el parpadeo | Los ojos suelen reenfocar ligeramente | Los ojos vuelven de golpe a la posición exacta previa |
Observa las pestañas durante un parpadeo
Esta técnica es muy eficaz y no requiere herramientas especiales. En imágenes reales, los pelos de las pestañas se separan ligeramente, se agrupan de forma natural y crean patrones de sombra variables en el párpado inferior durante cada parpadeo. En la mayoría de los videos generados por IA, las pestañas se mueven como una sola unidad lisa, sin comportamiento individual de cada pelo.
💡 Consejo: Reproduce el video a 0,25x de velocidad y céntrate solo en el momento en que el párpado se cierra. Si las pestañas se comportan como una sola forma curva uniforme, sin diferenciación de las fibras, trátalo como una señal de alerta importante.
Audio: cuando la voz no coincide con el rostro
Muchas personas se centran por completo en lo visual al evaluar la autenticidad de un video. Es un error. La sincronización entre audio e imagen es, a menudo, donde el contenido sintético se derrumba con más claridad.

Desfase de la sincronización labial
Incluso con herramientas de sincronización labial específicas, la voz generada por IA suele desfasarse de forma sutil. Esto se nota especialmente en determinados tipos de fonemas:
- Consonantes bilabiales (sonidos P, B, M) que exigen que los dos labios se cierren por completo
- Fricativas (sonidos F, V) que requieren que los dientes superiores toquen el labio inferior
- Finales de palabra en los que el movimiento de los labios se detiene un poco antes o después de que el audio se corte
El entorno acústico no coincide con el espacio visual
En las grabaciones reales, el carácter acústico de un espacio coincide con lo que se ve en pantalla. Una persona filmada en un baño grande de azulejos suena distinta a alguien en un dormitorio alfombrado. El video generado por IA aplica con frecuencia un perfil de audio plano y limpio que no coincide con el entorno aparente. Presta atención a:
- Ausencia de reverberación o eco natural de la sala en relación con el espacio visible
- Voz demasiado limpia, sin ruido de fondo ambiental
- Volumen de audio constante, independientemente de la distancia del sujeto a la cámara o del ángulo de la cabeza
Patrones de respiración y cadencia
Las personas reales respiran. A menudo se oye, sobre todo antes de frases largas o entre frases rápidas. La voz generada por IA suele carecer por completo de esto y produce una cadencia robótica, aunque la calidad de la voz sea convincente. Las frases fluyen con una regularidad de metrónomo que suena profesional, pero que al escuchar de cerca resulta poco humano.
Artefactos de fondo y de bordes

El fondo de un video generado por IA suele ser su elemento más débil, porque el modelo debe mantener la coherencia espacial a lo largo del tiempo y, al mismo tiempo, gestionar un movimiento complejo en primer plano.
Halos en los bordes y efecto fantasma
Donde un sujeto en movimiento se encuentra con el fondo, el video con IA produce con frecuencia artefactos visibles:
- Halos suaves: Un borde ligeramente más claro u oscuro alrededor del contorno del sujeto que pulsa a medida que se mueve
- Efecto fantasma: Duplicados semitransparentes del sujeto que aparecen en los bordes, sobre todo durante movimientos rápidos
- Difuminado de los límites: Los bordes del cabello o de la ropa se funden con el fondo de formas que desafían la física
Inestabilidad del fondo a lo largo del tiempo
Incluso en clips en los que la cámara parece estática, los fondos generados por IA suelen desplazarse de forma sutil. Si avanzas el video fotograma a fotograma, verás:
- Líneas arquitectónicas rectas (marcos de ventanas, marcos de puertas, juntas de azulejos) con una ligera ondulación o curvatura
- Objetos del fondo que cambian de forma entre fotogramas
- Texto en carteles, pósteres o pantallas que se ve ilegible, cambia de ortografía o usa secuencias de letras sin sentido
Profundidad de campo que no corresponde a ningún objetivo real
Las cámaras reales con una distancia focal y una apertura determinadas producen una profundidad de campo predecible. Los modelos de IA a menudo generan gradientes de desenfoque que no corresponden a ningún comportamiento físico de un objetivo. El fondo puede estar a la vez demasiado desenfocado en una zona y demasiado nítido en una zona contigua dentro del mismo fotograma.
💡 Comprobación rápida: Busca cualquier texto en el fondo del video. Las cámaras reales captan el texto con precisión, incluso cuando está ligeramente fuera de foco. Los fondos generados por IA producen con frecuencia cadenas de texto ilegibles e inventadas que cambian entre fotogramas. Esta sola comprobación descarta un gran porcentaje de contenido sintético.
Comparar las versiones lado a lado

Cuando tienes acceso tanto a un video que sospechas que es de IA como a un clip original de referencia de la misma persona, la comparación lado a lado es muy reveladora. Las áreas clave que comparar:
- Mapas de textura de la piel: ¿Cambia la calidad o el carácter de la textura entre los dos clips?
- Momento de las microexpresiones: ¿Las reacciones emocionales llegan con una sincronización natural o con un instante de retraso?
- Respuesta a la iluminación: Cuando la luz de la escena cambia, ¿la piel del sujeto responde con una dispersión subsuperficial realista o el tono se mantiene plano?
- Timbre vocal: ¿La voz tiene la misma resonancia y el mismo aliento que las grabaciones auténticas confirmadas?
Cómo funcionan en realidad los modelos de video con IA
Entender cómo generan video estas herramientas te ayuda a saber qué es probable que hagan mal. Los modelos de texto a video más capaces de hoy, todos disponibles en Picasso IA, incluyen:
- Veo 3 de Google: genera video con audio sincronizado nativo a partir de prompts de texto, con salida en 1080p
- Sora 2 de OpenAI: produce video en HD con una fuerte coherencia temporal en clips más largos
- Kling v2.6 de Kuaishou: ofrece texto a video de calidad cinematográfica en 1080p con control de movimiento
- Seedance 2.0 de ByteDance: generación de texto a video con síntesis de audio integrada
- Hailuo 02 de Minimax: generación de video con IA en 1080p a partir de descripciones de texto y con inferencia rápida
- Wan 2.7 T2V de Wan Video: gran fidelidad de movimiento con calidad de salida en 1080p
- LTX 2 Pro de Lightricks: generación de video en 4K a partir de texto con alta retención de detalle
- Pixverse v5 de Pixverse: video con IA en 1080p a partir de prompts de texto y con una velocidad de generación rápida

Los modelos de difusión y su debilidad temporal
La mayoría de los sistemas de video con IA actuales usan arquitecturas basadas en difusión. Parten de ruido estructurado y lo van refinando gradualmente hasta convertirlo en video coherente, fotograma a fotograma, guiados por el prompt de texto y por los fotogramas anteriores. Esto produce fotogramas individuales visualmente impresionantes, pero crea desafíos persistentes para mantener una coherencia de grano fino a lo largo del tiempo:
- Los detalles finos, como la forma de la oreja, el número de dedos o el texto del fondo, se vuelven a decidir en cada fotograma en lugar de quedar fijados desde el primero
- El modelo equilibra entre hacer que cada fotograma se vea bien por separado y ajustarse a los fotogramas vecinos, y esta contrapartida es precisamente donde aparecen los artefactos
- El desenfoque por movimiento se sintetiza en lugar de ser ópticamente real, de modo que puede aparecer en direcciones físicamente imposibles respecto al movimiento
Por qué las manos siguen siendo una pista fiable
A pesar de las enormes mejoras en todo lo demás, el video con IA sigue fallando con regularidad con las manos y los dedos. El número correcto de dedos aparece y desaparece a mitad de clip. Las articulaciones se doblan en direcciones anatómicamente imposibles. Las uñas cambian de forma entre fotogramas. Cuando veas manos en un video que estás evaluando, examínalas siempre con atención, sobre todo en movimiento.

La inspección visual por sí sola no basta para verificaciones en las que hay mucho en juego. El análisis de los metadatos técnicos añade una segunda capa de confianza que funciona al margen de la calidad visual.
Qué revisar en los metadatos del archivo
Los videos reales contienen metadatos integrados que el contenido sintético a menudo no tiene o rellena de forma incorrecta. Herramientas gratuitas como ExifTool o MediaInfo pueden revelar:
- Dispositivo de creación: Las grabaciones reales muestran un modelo de cámara específico y una versión de firmware. La salida de IA suele mostrar un renderizador de software o no incluir información del dispositivo.
- Firmas del códec: El video generado por IA a menudo usa firmas de códec incompatibles con el dispositivo o la plataforma de grabación supuestos.
- Datos GPS: Las grabaciones de cámaras reales suelen incorporar coordenadas de ubicación. La salida de IA nunca las incluye.
- Marca de tiempo de creación frente a la fecha del evento declarada: Si un video supuestamente muestra un evento concreto en una fecha concreta, la marca de tiempo de creación del archivo debe ser coherente con esa afirmación.
Búsqueda inversa de video en la práctica
Extraer fotogramas fijos para la búsqueda inversa de imágenes es una de las técnicas de detección más accesibles que existen sin herramientas especializadas:
- Extrae de 3 a 5 fotogramas del video en momentos clave, sobre todo primeros planos del rostro
- Sube cada fotograma a Google Images o TinEye para hacer la búsqueda inversa
- Busca imágenes casi idénticas que aparezcan en contextos distintos y sin relación
- Comprueba la fecha más antigua en la que la imagen aparece en internet frente a la fecha de publicación del video
Herramientas de detección automatizada
Varias plataformas ofrecen autenticación de video basada en IA:
| Herramienta | Método principal | Ideal para |
|---|
| Hive Moderation | Clasificador de redes neuronales | Detección general de deepfakes |
| Sensity | Análisis de coherencia temporal | Detección de intercambio de rostros |
| Intel FakeCatcher | Análisis de la señal del flujo sanguíneo | Verificación de vitalidad biológica |
| Microsoft Video Authenticator | Detección de artefactos a nivel de fotograma | Verificación de medios informativos |
Estas herramientas no son infalibles, ya que se entrenan con resultados de modelos existentes y pueden pasar por alto contenido de sistemas más nuevos. Pero aportan una confianza significativa cuando se usan junto a la inspección visual manual, en lugar de como sustituto de ella.
Señales de alerta del mundo real sin necesidad de herramientas
Al ver contenido de video compartido en redes sociales, estas señales de advertencia son las que tienen mayor valor predictivo:
- Ninguna fuente original verificable adjunta al video o a su descripción
- El sujeto hace afirmaciones sospechosamente convenientes para una determinada narrativa política o comercial
- El clip es muy corto (menos de 15 segundos) y no tiene contexto alrededor
- Solo se ve el rostro, con poco movimiento corporal o interacción con el entorno
- La calidad del audio es notablemente más limpia que la del video, o al revés
- El video está muy comprimido, lo que oculta artefactos que de otro modo serían visibles
💡 La compresión oculta las pistas: El video compartido a través de aplicaciones de mensajería suele comprimirse a tasas que destruyen los artefactos de detalle fino que, de otro modo, delatarían su origen sintético. Busca siempre la versión de mayor calidad disponible antes de emitir un juicio.
Lo que enseña ver video de IA

Hay un atajo contraintuitivo para desarrollar un instinto de detección rápido: genera tú mismo videos con IA. Cuando has producido suficiente material sintético, empiezas a ver los patrones de fallo desde dentro. Notas qué prompts producen más artefactos. Observas de primera mano cómo los modelos gestionan el cabello, las manos y el texto del fondo. Desarrollas un reconocimiento de patrones intuitivo para el «aspecto de IA» que hace que la detección en tiempo real sea más rápida y mucho más fiable que cualquier lista de comprobación.
Este es el valor real de la experiencia práctica con estas herramientas. El escepticismo sin conocimiento es solo sospecha. Familiarizarse con cómo se crea el video sintético genera una percepción calibrada que resiste en condiciones reales, cuando tienes segundos y no minutos para evaluar lo que estás viendo.
Crea para aprender a detectar
La forma más rápida de entrenar tu ojo es producir tú mismo video sintético y compararlo directamente con grabaciones reales. Picasso IA reúne en un solo lugar los modelos de texto a video más capaces del mundo, entre ellos Veo 3, Kling v2.6, Sora 2 y LTX 2 Pro, sin necesidad de configuración.

Genera un clip de un rostro que habla, luego ralentízalo a 0,25x y repasa cada punto de este artículo. Revisa el parpadeo. Revisa los dientes. Revisa el texto del fondo. Revisa las manos. En unos pocos experimentos, tu percepción se calibrará de una forma que ninguna cantidad de lectura puede replicar.
La misma plataforma te da acceso a generadores de imágenes, herramientas de intercambio de rostros, modelos de sincronización labial y funciones de mejora de video, para que puedas explorar todo el espectro de la creación de medios sintéticos. Ese conocimiento de primera mano es la herramienta de detección más poderosa que puedes construir, y no cuesta nada más que curiosidad.
Detectar video generado por IA no tiene que ver con la paranoia. Se trata de mantener el pensamiento crítico básico que el entorno mediático actual exige a cualquiera que lo consume. Las pistas están ahí. Ahora sabes dónde mirar.