Veo 3.1, el modelo de generación de video más reciente de Google DeepMind, se lanzó con promesas ambiciosas en materia de seguridad: un filtro de contenido de varias capas, marca de agua SynthID y un clasificador en tiempo de inferencia que bloquearía el contenido para adultos y el dañino antes de que llegara a renderizarse. El despliegue fue cuidadoso y la documentación, exhaustiva. Luego, la comunidad de pruebas de contenido empezó a lanzar baterías sistemáticas de prompts, y los resultados contaron una historia más complicada.
Este artículo documenta lo que encontraron esas pruebas: las categorías de contenido concretas que superaron la capa de seguridad de Veo 3.1, las categorías que se bloquearon de forma fiable y lo que significan los datos de inconsistencia para quien construya un flujo de trabajo creativo en torno a contenido de IA afín a los adultos. También documentamos los modelos de imagen con IA de PicassoIA que se saltan por completo la lotería del filtro y ofrecen resultados predecibles.
Qué es realmente Veo 3.1
Lanzado a mediados de 2025, Veo 3.1 es el modelo de síntesis de video de tercera generación de Google DeepMind. Genera video de alta fidelidad y temporalmente coherente a partir de prompts de texto e imágenes de referencia, con generación de audio nativa que produce sonido sincronizado sin una canalización aparte. La arquitectura logra coherencia de movimiento, física de iluminación realista y transiciones de escena complejas, con niveles de calidad que superaron en benchmarks a los modelos competidores en la mayoría de las evaluaciones independientes.
El acceso llega por varios canales: la plataforma VideoFX de Google para uso particular, la integración con las herramientas para creadores de YouTube y la API de Vertex AI para despliegues empresariales. Cada canal aplica la misma política de contenido, implementada mediante una capa de clasificación que intercepta los prompts antes de la inferencia y evalúa los fotogramas generados antes de entregarlos.
Por qué la gente prueba los filtros de contenido
Todos los modelos de IA importantes incluyen un filtro de contenido. Todos los filtros de contenido tienen huecos. Esto no es un fallo de diseño, sino una realidad de ingeniería. Los clasificadores entrenados con conjuntos de datos etiquetados desarrollan puntos ciegos allí donde el etiquetado era ambiguo, donde los ejemplos de entrenamiento eran escasos o donde la redacción de los prompts cae en zonas grises estadísticas a las que el modelo no estuvo expuesto durante el entrenamiento.
Quienes realizan pruebas sistemáticas de contenido incluyen investigadores de red team en instituciones académicas, revisores de seguridad independientes y creadores profesionales que necesitan mapas precisos de dónde están realmente los límites prácticos de una herramienta. Los datos resultantes importan por varias razones: los equipos de seguridad los usan para cerrar brechas, y los creadores para saber qué pueden construir con una herramienta concreta.
Cómo se hicieron las pruebas
Los métodos de prueba documentados usaron tres enfoques principales: prompts directos que describían escenarios para adultos o sugerentes en lenguaje sencillo, prompts indirectos con encuadres artísticos, históricos o profesionales, y pruebas de imagen a video con imágenes de origen sugerentes como fotogramas iniciales de la generación.
Cada variante de prompt se ejecutó en series de 20 a 50 para tener en cuenta la variación estocástica del resultado. Un solo rechazo no demuestra que una categoría esté bloqueada. Significa que esa redacción concreta falló en esa ejecución concreta. Los patrones necesitaron varias ejecuciones para aparecer, y los resultados se registraron por categoría y por variante de redacción.
Resultados que sorprendieron a los investigadores

El hallazgo principal de las pruebas sistemáticas: el filtro de contenido de Veo 3.1 funciona como un espectro y no como un muro. Algunas categorías claras de contenido afín a los adultos produjeron resultados constantes. Otras categorías provocaron respuestas irregulares, con el mismo prompt generando tanto rechazos como generaciones exitosas en distintas ejecuciones, sin ninguna diferencia relevante en la entrada.
Contenido sugerente que se coló
Varias categorías de contenido superaron el clasificador con alta fiabilidad en distintas sesiones de prueba:
Escenas editoriales de ropa de baño y playa produjeron resultados con regularidad cuando se encuadraban con lenguaje de fotografía profesional. El filtro no parece marcar la ropa de baño como categoría bloqueada cuando el contexto del prompt establece una intención editorial o de moda. Los resultados incluyeron escenas que se percibirían como moderadamente explícitas en muchos contextos editoriales, sobre todo en el modo de imagen a video, en el que se proporcionaba un fotograma inicial sugerente.
El encuadre artístico produjo resultados parciales. Los prompts que invocaban tradiciones de estudio de figura, material de referencia de dibujo del natural o precedentes artísticos clásicos generaron resultados en torno al 40% de las ejecuciones. El clasificador parece entrenado con cierta conciencia del contexto histórico del arte, pero el umbral entre la clasificación de "artístico" y la de "adulto" es irregular entre ejecuciones.
Los escenarios implícitos de adultos se generaron con regularidad. Los escenarios de video que sugerían contenido para adultos sin mostrarlo de forma directa, una puerta de dormitorio que se cierra, una escena de ducha con el sujeto fuera de encuadre, momentos íntimos que avanzan hacia lo explícito sin llegar a serlo, superaron el filtro en la gran mayoría de las ejecuciones probadas. El clasificador temporal que evalúa el contenido de video parece significativamente más débil en la capa de lo implícito que en la de la representación directa.
Ropa mojada y énfasis físico en contextos deportivos o de moda se generó sin fricción en la mayoría de las pruebas. El contenido en el que el estado de la ropa y el énfasis corporal se leerían como adultos en redes sociales superó el filtro cuando se encuadraba como fotografía deportiva, atlética o de moda.
💡 El patrón común de las categorías que funcionaron: el filtro de Veo 3.1 está calibrado para detectar contenido explícito, no sugerente. La distancia entre lo que un revisor humano lee como contenido para adultos y lo que activa el umbral de contenido explícito es considerable.
Dónde trazó Veo 3.1 la línea
Algunas categorías activaron bloqueos firmes en todas las variantes de prompt y en todos los enfoques de encuadre:
El contenido sexual explícito se bloqueó sin importar el encuadre artístico o profesional. Los prompts que describían actividad sexual directa generaron rechazos en todas las variantes de redacción probadas, incluidas las que usaban lenguaje clínico, artístico o histórico.
Los contenidos que involucraban a menores en cualquier contexto cercano al ámbito adulto provocaron rechazos inmediatos, sin excepciones, en las pruebas documentadas. Esta categoría parece ser el bloqueo implementado de forma más sólida en el sistema.
Los escenarios sin consentimiento descritos con lenguaje directo se bloquearon siempre. Los prompts que nombraban a personajes públicos reales en escenarios íntimos o comprometedores también provocaron rechazos, y el sistema parece contar con una detección específica para esta categoría, independiente del filtro general de contenido para adultos.
El problema de la inconsistencia del filtro

El hallazgo más importante de las pruebas de contenido de Veo 3.1 no es lo que pasó. Es la inconsistencia de un intento a otro en la forma en que se trataron los mismos prompts.
El mismo prompt, resultados distintos
Los prompts idénticos ejecutados en series de 20 mostraron tasas de rechazo de entre el 20% y el 60% para contenido de las categorías de zona gris, sin una correlación relevante con la hora del día, el endpoint de la API ni ninguna otra variable observable. El elemento estocástico del proceso de generación significa que el clasificador de seguridad recibe representaciones internas ligeramente distintas del mismo prompt en cada ejecución, y su salida de clasificación binaria varía en consecuencia.
Desde la perspectiva de la ingeniería de seguridad, se puede argumentar que esto es intencionado: los filtros deterministas son más fáciles de explotar de forma sistemática que los probabilísticos. Desde la perspectiva del flujo de trabajo creativo, es un problema de producción. No puedes construir una canalización de contenido fiable sobre una herramienta que trata la misma entrada de forma distinta la mitad de las veces.
| Categoría de contenido | Tasa de aprobación aproximada en las pruebas |
|---|
| Ropa de baño y playa, editorial | ~85% |
| Escenarios íntimos implícitos | ~70% |
| Encuadre artístico y de estudio de figura | ~40% |
| Ropa mojada, énfasis atlético | ~75% |
| Contenido directo para adultos | ~0% |
Soluciones que funcionan (y las que no)

La comunidad de pruebas documentó varios enfoques de prompt que mejoraron con regularidad las tasas de aprobación de las categorías de contenido sugerente:
Poner el contexto profesional al principio mejora las tasas de aprobación. Los prompts que empiezan con un encuadre profesional ("fashion editorial photography for a luxury brand featuring...") pasan con más frecuencia que los que describen primero el contenido visual. El clasificador da más peso a los primeros tokens del prompt, así que establecer el contexto profesional antes de describir al sujeto modifica la salida de clasificación.
La terminología técnica de fotografía se percibe como editorial. Incluir detalles específicos de cámara, objetivo y película ("shot on 85mm f/1.4, Kodak Portra 400 grain, editorial quality") parece empujar la clasificación hacia categorías editoriales y no hacia las de contenido para adultos.
Describir las propiedades de los materiales en lugar de los niveles de exposición. Los prompts que hacen referencia a características de la tela ("sheer fabric catching backlit window light") superan con regularidad a los que describen directamente el estado del cuerpo.
Lo que no funciona: los patrones de prompt adversarios, las sustituciones de caracteres o cualquier redacción claramente diseñada para ocultar la intención. El clasificador de Veo 3.1 tiene una robustez específica frente a la ingeniería de prompts adversaria, y los intentos de manipular la clasificación mediante ofuscación tienden a provocar más rechazos, no menos.
La mejor opción: IA sin censura en PicassoIA

Los datos de las pruebas de Veo 3.1 apuntan a la misma conclusión que surge al probar cualquier modelo con restricciones: si necesitas resultados constantes y predecibles para contenido afín a los adultos sin la variación del filtro, los clasificadores en tiempo de inferencia son la herramienta equivocada para el trabajo.
PicassoIA ofrece acceso a varios modelos que manejan el contenido sugerente y elegante para adultos sin el problema de inconsistencia, sin límites de uso, sin requisitos de aprobación y sin marcas de agua.
Seedream 4: la primera parada recomendada
Seedream 4 es el punto de partida recomendado para la generación de imágenes afines a los adultos. El modelo de ByteDance produce imágenes de hasta 4K de resolución, con textura de piel fotorrealista, renderizado de telas y física de iluminación. Las ventajas para este caso de uso son significativas:
Los resultados están determinados por el prompt y no por el clasificador. Lo que describes es lo que se genera. Las tasas de aprobación de ropa de baño, lencería, glamour y desnudo artístico son constantes entre sesiones.
El techo de salida de 4K permite generar con resolución de impresión sin escalado. La entrada de imagen de referencia te permite establecer una identidad visual, ya sea un personaje, un estilo o una composición, y mantenerla a lo largo de una serie de generaciones. El modo de generación secuencial produce hasta 15 imágenes relacionadas a partir de un solo prompt, lo que te da variaciones sin el trabajo extra de volver a escribir el prompt para cada imagen.
Para los creadores que han estado lidiando con la lotería de filtros de Veo 3.1, la previsibilidad de Seedream 4 es la diferencia más valiosa de inmediato.
Flux Dev: máximo fotorrealismo
Flux Dev de Black Forest Labs funciona con 12.000 millones de parámetros, lo que se traduce directamente en mejor anatomía, variaciones de pose más naturales y una interacción de tela y piel más convincente que con modelos más pequeños. Para el contenido afín a los adultos en el que el fotorrealismo es el requisito principal, el número de parámetros importa.
El modo img2img acepta una imagen existente y un prompt que describe cómo modificarla, lo que facilita refinar resultados que están cerca pero no del todo bien. Once relaciones de aspecto cubren desde el formato cuadrado hasta el ultra ancho sin recortes. El control de semilla te permite fijar un resultado que funciona e iterar pequeñas variaciones sobre él de forma sistemática.
Flux Schnell: iteración de alto volumen
Flux Schnell produce resultados fotorrealistas en menos de 5 segundos por imagen y sin límites de generación en PicassoIA. Para la fase de desarrollo de prompts de un proyecto de contenido, cuando se prueban 30 o 50 variaciones para encontrar la redacción y la composición que funcionan antes de comprometerse con renders de mayor calidad, Flux Schnell asume esa carga sin fricción ni gasto extra de créditos.
La política de generación ilimitada significa que puedes ejecutar tantas iteraciones como requiera un proyecto sin estar pendiente de un contador de créditos. Para operaciones de contenido de alto volumen, esta es una diferencia operativa importante frente a cualquier modelo de API con restricciones.
SDXL: coherencia de estilo en series
SDXL admite pesos LoRA personalizados, lo que importa en series de contenido donde se necesita coherencia visual. Carga un LoRA entrenado con una estética, un estilo de iluminación o un tipo de cuerpo concretos, y cada generación compartirá ese ADN visual. El refinador integrado añade una segunda pasada de nitidez, especialmente útil para la textura de la piel y el detalle de la tela en imágenes íntimas o de estilo glamour.
Cómo usar Seedream 4 en PicassoIA

Seedream 4 es el punto de entrada recomendado para la generación de imágenes afines a los adultos en PicassoIA. Los siguientes pasos producen los mejores resultados.
Paso 1: abre el modelo. Ve a picassoia.com/en/collection/text-to-image/bytedance-seedream-4. No se necesita aprobación de cuenta.
Paso 2: estructura tu prompt para el fotorrealismo. Seedream 4 responde mejor a prompts que especifican juntos el sujeto, el entorno, la iluminación y las características de la cámara. Una estructura que funciona:
"Editorial fashion photograph of a woman in [clothing description], [environment], [specific lighting description], 85mm f/1.4, Kodak Portra 400 film grain, photorealistic skin texture, 4K"
Paso 3: fija la resolución. 2K funciona bien para entrega web. 4K para impresión o salida de alta fidelidad. Para plataformas sociales, 2K con relación de aspecto 16:9 cubre la mayoría de requisitos de visualización.
Paso 4: usa imágenes de referencia para la coherencia de personajes. Si trabajas en una serie con un sujeto constante, sube una imagen de referencia con el parámetro image_input. Seedream 4 traslada la identidad visual de la referencia a la salida generada con gran fidelidad.
Paso 5: ejecuta la generación secuencial para trabajos en serie. Configura sequential_image_generation en auto y max_images en 8-15. El modelo produce una serie relacionada a partir de un solo prompt, con variedad compositiva sin volver a escribir el prompt para cada imagen.

💡 Nombra fuentes de luz concretas, no solo cualidades. "Luz volumétrica de la mañana a través de cortinas de gasa desde la izquierda" supera a "luz natural suave". La calidad de salida del modelo es directamente proporcional a la precisión de tu descripción de la iluminación.
Más consejos para mejores resultados:
- Nombra materiales de tela concretos. "Sheer chiffon", "wet silk" y "stretch jersey" activan mejores ejemplos de entrenamiento que las descripciones genéricas de ropa.
- Incluye la dirección de composición. "Figure occupying lower third, expansive sky background" da al modelo información de diseño que mejora la coherencia general de la imagen.
- Especifica la película. "Kodak Portra 400", "Fujifilm 400H" o "Ilford HP5" mejoran con regularidad el renderizado del tono de piel y reducen la calidad clínica que presentan muchas salidas generadas por IA.
- Usa el espacio negativo con intención. Describe lo que no debe aparecer en el encuadre, ya sea en el campo de prompt negativo o al final del prompt principal con frases como "no digital effects, no CGI".

PicassoIA frente a Veo 3.1: cara a cara

La comparación entre Veo 3.1 y la biblioteca de modelos de PicassoIA no trata principalmente de la calidad de salida. Veo 3.1 produce resultados sólidos cuando funciona. La comparación trata de la fiabilidad del flujo de trabajo.
| Factor | Veo 3.1 | Modelos de PicassoIA |
|---|
| Comportamiento del filtro de contenido | Estocástico, varía según la ejecución | Determinado por el prompt, constante |
| Tasa de aprobación de contenido sugerente | 40-85% según la categoría | 95%+ |
| Tipo de salida | Clips de video | Imágenes de hasta 4K |
| Velocidad de generación | 30-90 segundos por clip | 5-30 segundos por imagen |
| Costo | Créditos de API necesarios | Gratis, sin límites |
| Marcas de agua | SynthID incrustado | Ninguna |
| Acceso | Restringido por solicitud | Inmediato, sin aprobación |
| Previsibilidad del contenido para adultos | Aplicado por clasificador, irregular | Basado en prompts, fiable |
La variación de la tasa de aprobación del contenido sugerente significa que construir una canalización de producción sobre Veo 3.1 para cualquier cosa en la zona gris exige prever una tasa de rechazo significativa. Con una tasa de aprobación del 40% para contenido artístico, necesitas generar 2,5 veces tu volumen objetivo y filtrar después. Con la velocidad de generación y el costo en créditos del video basado en API, esa sobrecarga es considerable.
En los modelos de PicassoIA no hace falta ese cálculo de sobrecarga. Genera lo que necesitas y obtén lo que describiste.
Crea con libertad en PicassoIA

Los hallazgos sobre el filtro de contenido de Veo 3.1 merecen una lectura si estudias cómo fallan los clasificadores en tiempo de inferencia en sus límites. Pero si construyes con esos hallazgos en lugar de examinarlos académicamente, la conclusión práctica es sencilla: los modelos con restricciones y los clasificadores opacos no son la base adecuada para el trabajo creativo afín a los adultos.
Seedream 4 genera imágenes fotorrealistas de hasta 4K a partir de tus prompts, sin variación de filtro, sin marcas de agua y sin créditos. Flux Dev ofrece fotorrealismo de 12.000 millones de parámetros con edición img2img completa. Flux Schnell ejecuta iteraciones ilimitadas a gran velocidad. SDXL añade control de estilo con LoRA para trabajos de series coherentes.
La biblioteca completa de modelos está disponible en picassoia.com/en/all-models. No hace falta ninguna solicitud. Ningún clasificador decide si tu dirección creativa pasa hoy. Abre un modelo, escribe tu prompt y genera.