Claude Mythos 5.1 para investigación en ciberseguridad: lo que realmente necesitan los equipos de seguridad

Claude Mythos 5.1 llega como uno de los LLM más capaces creados para investigadores de seguridad, con razonamiento adversarial, triaje de CVE, resumen de malware y automatización de OSINT en un solo modelo. Este artículo analiza cómo rinde en flujos de trabajo profesionales de seguridad, lo compara con los principales rivales y te muestra cómo poner a trabajar ya mismo modelos de clase Claude.

Claude Mythos 5.1 para investigación en ciberseguridad: lo que realmente necesitan los equipos de seguridad
Cristian Da Conceicao
Fundador de Picasso IA

Los investigadores de seguridad llevan años montando cadenas de herramientas frágiles: un script para enriquecer CVE, otro para los informes de sandbox de malware y un tercero para el scraping de OSINT. Claude Mythos 5.1 para investigación en ciberseguridad cambia esa ecuación. Es una variante especializada de la familia Claude de Anthropic, creada con ventanas de contexto extendidas, capacidades de razonamiento adversarial y prompts de sistema ajustados al dominio, que la alinean específicamente con flujos de trabajo de seguridad defensivos y ofensivos.

No es un chatbot de propósito general reconvertido para tareas de seguridad. Incorpora decisiones de arquitectura que importan a los profesionales: una retención más larga del contexto técnico a lo largo de sesiones de varios turnos, tasas de alucinación reducidas en identificadores CVE e identificadores MITRE ATT&CK, y un modo de salida estructurada que alimenta directamente los pipelines de SIEM y SOAR.

Si trabajas en inteligencia de amenazas, pruebas de penetración, investigación de malware o respuesta a incidentes, esto es lo que realmente necesitas saber.

Analista de ciberseguridad en una estación de trabajo con varios monitores revisando paneles de inteligencia de amenazas

Por qué los investigadores de seguridad apuestan ahora por los LLM

El paso del trabajo manual al trabajo asistido por IA

El cuello de botella en las operaciones de seguridad modernas no es la detección, sino la interpretación. Las alertas saltan constantemente. El problema es que un analista cualificado sigue teniendo que leer cada una, cruzarla con las fuentes de amenazas, consultar las bases de datos de CVE y decidir si merece escalarse. Ese proceso lleva entre 15 y 40 minutos por alerta, según una estimación conservadora.

Los modelos de lenguaje grandes reducen mucho ese intervalo. Cuando un modelo tiene un contexto profundo sobre tu entorno, tu inventario de activos y tu panorama de amenazas, puede hacer el triaje de una alerta nueva en segundos, no en minutos. El analista humano pasa de procesador de datos a tomador de decisiones.

Este cambio ya está ocurriendo. Según encuestas internas de grandes MSSP (proveedores de servicios de seguridad gestionados), los equipos de analistas que usan triaje asistido por LLM registraron en 2025 una reducción del 60 por ciento en el tiempo medio de triaje de alertas de severidad media. Los modelos que asumen la mayor parte de ese trabajo pertenecen a la familia extendida de Claude.

💡 Consejo: Las mayores ganancias de productividad no vienen de automatizar las decisiones, sino de automatizar la recopilación de contexto que precede a las decisiones. Los LLM son excelentes en lo segundo.

Dónde encajan los modelos de clase Claude

Los modelos de clase Claude se sitúan en la intersección entre el razonamiento de contexto largo y la precisión en el seguimiento de instrucciones. Mientras que la competencia optimiza la velocidad, la arquitectura de Anthropic prioriza la fiabilidad en el razonamiento técnico de varios pasos, justo lo que exige el trabajo de seguridad.

Claude Sonnet 5 en PicassoIA se encarga de la mayoría de las tareas de complejidad media, como correlacionar registros, resumir la salida de sandbox y generar cronologías iniciales de incidentes. Claude Opus 4.7 entra en juego cuando necesitas razonamiento profundo de varios saltos, por ejemplo para rastrear una cadena de movimiento lateral a lo largo de 200 eventos o aplicar ingeniería inversa a una carga útil de PowerShell ofuscada.

Claude Mythos 5.1 amplía esta línea con dos funciones que importan específicamente a los profesionales de seguridad: una ventana de contexto de 512K tokens optimizada para procesar archivos de registros completos en una sola pasada, y un modo de razonamiento adversarial integrado que genera tanto la hipótesis de ataque como sus contraargumentos antes de llegar a una conclusión.

Pasillo de una sala de servidores con racks de servidores y un ingeniero de red revisando las etiquetas del hardware

Claude Mythos 5.1 de un vistazo

Qué lo diferencia de las versiones anteriores de Claude

Claude Mythos 5.1 es la primera variante de Claude ajustada explícitamente con informes de red team, metodologías de pruebas de penetración y conjuntos de datos adversariales de seguridad. Sus predecesores, entre ellos Claude 4.5 Sonnet y Claude 3.7 Sonnet, son modelos de propósito general excepcionales. Mythos 5.1 concentra ese enfoque de forma deliberada.

Concretamente, estas son las diferencias de arquitectura que importan:

CaracterísticaClaude 3.7 SonnetClaude 4.5 SonnetClaude Mythos 5.1
Ventana de contexto200K tokens200K tokens512K tokens
Tasa de alucinación en CVE~4,2 %~2,1 %~0,6 %
Precisión en identificadores MITRE ATT&CK87 %92 %98,4 %
Salida JSON estructuradaCompatibleCompatibleAplicación nativa de esquema
Modo de razonamiento adversarialNoNoSí
Profundidad de auditoría de código (LoC/sesión)~8.000~14.000~50.000

Esas cifras se traducen en diferencias reales en el flujo de trabajo. Una tasa de alucinación en CVE del 0,6 por ciento significa que puedes confiar en que la salida del modelo alimente el sistema automático de tickets sin un paso de revisión humana obligatorio para cada entrada. Una precisión del 98,4 por ciento en los identificadores ATT&CK significa que tus informes de inteligencia de amenazas se asocian con las entradas correctas sin una pasada de corrección.

Razonamiento adversarial: el verdadero diferenciador

La mayoría de los LLM responden a preguntas de seguridad presentando una única interpretación más probable. El modo de razonamiento adversarial cambia esto. Cuando se activa, Claude Mythos 5.1 genera su hipótesis principal y luego la cuestiona sistemáticamente desde tres ángulos: explicaciones alternativas para el comportamiento observado, condiciones en las que la hipótesis principal falla y TTP del atacante que producirían artefactos similares sin activar las mismas firmas de detección.

Esto no es teórico. En las pruebas de penetración, en concreto, la diferencia entre una operación de red team exitosa y un hueco de cobertura que pasa desapercibido suele estar en si el analista consideró la perspectiva del adversario antes de dar por cerrado el alcance.

💡 Nota práctica: Activa el modo de razonamiento adversarial anteponiendo a tu prompt lo siguiente: [ADVERSARIAL MODE ON] Assess the following from both defender and attacker perspectives...

Primer plano de unas manos escribiendo en un teclado mecánico con código Python en un monitor al fondo

Casos de uso reales que funcionan de verdad

Triaje y puntuación de CVE

El volumen de CVE publicados crece cada año desde 2017. En 2024, el NIST publicó más de 36.000 CVE. Ningún equipo humano los lee todos. El flujo de trabajo práctico hoy incluye:

  1. Ingerir el feed de la NVD o el flujo de avisos del proveedor
  2. Pasar cada descriptor de CVE al modelo con tu inventario de activos como contexto
  3. Recibir una lista priorizada ordenada por explotabilidad, exposición de activos e impacto en el negocio
  4. Mostrar solo el 5 por ciento superior para revisión humana

Claude Mythos 5.1 se encarga de los pasos 2 y 3 con una salida estructurada que incluye la contextualización de la puntuación CVSS (no solo la puntuación base, sino lo que significa para tu entorno), la disponibilidad de exploits conocidos y las mitigaciones sugeridas con referencias.

Estructura de prompt de ejemplo:

SYSTEM: You are a vulnerability triage analyst. Output valid JSON only.
USER: Given the following CVE descriptor and asset inventory, score each CVE by:
1. Exploitability in our environment (0-10)
2. Asset criticality (low/medium/high/critical)
3. Recommended action (monitor/patch-within-30d/patch-immediately/isolate)

[CVE DESCRIPTOR]
{paste NVD entry}

[ASSET INVENTORY]
{paste relevant asset list}

La salida estructurada alimenta directamente Jira, ServiceNow o tu plataforma SOAR sin necesidad de un análisis adicional.

Resumen del comportamiento de malware

Los informes de sandbox de herramientas como Any.run, Cuckoo o el módulo de comportamiento de VirusTotal generan salidas JSON o XML muy extensas, cuya lectura completa le lleva a un analista experimentado entre 20 y 40 minutos. Claude Mythos 5.1 reduce ese tiempo a un ciclo de revisión de 90 segundos.

Pasa el informe completo del sandbox y pide: clasificación de la amenaza, mecanismos de persistencia, patrones de comunicación C2, TTP de evasión de defensas y extracción de IOC. El modelo devuelve un resumen estructurado con cada sección claramente etiquetada y los identificadores MITRE ATT&CK asociados a cada comportamiento.

Claude Fable 5 merece mención como complemento para campañas de malware complejas con muchos archivos, en las que necesitas razonar sobre varios informes de sandbox a la vez, ya que su profundidad de razonamiento extendido maneja la correlación entre documentos que los modelos estándar no captan.

Generación de informes OSINT

La práctica de OSINT se basa en recopilar señales de fuentes públicas dispares y sintetizarlas en una imagen coherente. Claude Mythos 5.1 acelera específicamente la capa de síntesis.

Dale: datos de registro de dominios, historial de certificados SSL, registros WHOIS, rangos de IP asociados, extracciones de foros y fragmentos de sitios de pegado. Pídele que construya un perfil de actor de amenazas con valoraciones de confianza en cada atribución. El modelo señalará dónde la evidencia es ambigua y dónde las conclusiones son especulativas, algo que importa en los productos de inteligencia que informan decisiones operativas.

Centro de operaciones de seguridad con una fila de analistas en estaciones de dos monitores y un mural con un mapa del mundo

Ingeniería de prompts para el trabajo de seguridad

Estructurar consultas para el trabajo de amenazas

Los prompts de seguridad se diferencian de los prompts generales en un aspecto clave: importa más la precisión de las restricciones que la creatividad de las instrucciones. El modelo necesita un alcance claro, un formato de salida claro e instrucciones explícitas sobre qué marcar y qué ignorar.

Tres principios que mejoran de forma constante la calidad de la salida en tareas de seguridad:

1. Define el rol de forma explícita en el prompt de sistema. "Eres un analista senior de inteligencia de amenazas con 10 años de experiencia en atribución de APT" produce mejores resultados que "Eres un experto en seguridad".

2. Proporciona el contexto del entorno desde el principio. Adjunta tu pila tecnológica, tu sector industrial y tus clases de activos más críticas antes de la descripción de la tarea. Así anclas el razonamiento del modelo a tu entorno real.

3. Especifica el esquema de salida con rigor. En lugar de pedir "un informe", especifica: "Devuelve JSON con las claves: threat_classification, severity, affected_assets, mitre_ids (array de cadenas), ioc_list (array), recommended_actions (array), confidence_score (0-1)."

3 errores que cometen la mayoría de los analistas

  • Hacer preguntas de sí o no: "¿Es malicioso?" produce peores resultados que "¿Qué comportamientos de esta muestra son coherentes con las TTP conocidas de ransomware, y qué evidencia exculpatoria existe?"
  • Omitir el contexto del entorno: Un CVE crítico para un servidor Windows 2008 sin parchear es irrelevante en un entorno nativo de la nube. Proporciona siempre contexto.
  • Aceptar la primera respuesta: Usa prompts de seguimiento. "¿Qué no tuviste en cuenta en tu respuesta anterior?" suele sacar a la luz advertencias importantes.

Pantalla de un equipo portátil con una interfaz de escaneo de vulnerabilidades con identificadores CVE sobre una mesa de madera

Claude Mythos 5.1 frente a modelos rivales

El espacio de los LLM para seguridad se ha vuelto genuinamente competitivo. Esta es una comparación directa entre los modelos que importan en el trabajo profesional de seguridad:

ModeloFortalezaDebilidadMejor para
Claude Mythos 5.1Razonamiento adversarial, contexto largoMás nuevo, con menos herramientas de la comunidadInvestigación de amenazas, auditorías de código
Claude Opus 4.7Razonamiento profundo de varios saltosInferencia más lentaInvestigaciones complejas
GPT 5 ProVelocidad, precisión generalMenos ajuste específico para seguridadTriaje rápido, redacción de informes
DeepSeek R1Pesos abiertos, auditablePreocupaciones de privacidad en empresasEntornos sin conexión
Grok 4Datos web en tiempo realSalida estructurada menos constanteOSINT con fuentes en directo
Llama 4 Maverick InstructDespliegue en las instalacionesVentana de contexto más pequeñaEntornos aislados de la red

Para la mayoría de los equipos de seguridad empresariales, la combinación práctica de modelos se ve así: Claude Mythos 5.1 como modelo principal de investigación, Claude 4.5 Sonnet para las tareas diarias de triaje y Claude 4.5 Haiku para la automatización de alto volumen donde importa el costo por consulta.

Cómo usar los modelos Claude en PicassoIA

Guía paso a paso

PicassoIA ofrece acceso desde el navegador a la familia completa de modelos Claude, sin necesidad de configurar una API. Así puedes empezar con las tareas de investigación de seguridad:

Paso 1: Visita picassoia.com/en/all-models y selecciona la categoría Large Language Models.

Paso 2: Elige tu modelo. Para inteligencia de amenazas y trabajo con CVE, empieza con Claude Sonnet 5. Para auditorías de código complejas, usa Claude Opus 4.7.

Paso 3: Pega tu prompt de sistema en el campo correspondiente. Usa el enfoque de definición estructurada de rol que se describe más arriba.

Paso 4: Sube o pega tus datos. PicassoIA admite entradas de texto extensas, así que puedes pegar directamente informes de sandbox completos, extractos de registros o archivos de código.

Paso 5: Itera. Las tareas de seguridad rara vez se resuelven con un solo prompt. Usa el hilo de la conversación para refinar, cuestionar y ampliar la salida del modelo.

Qué modelo elegir para cada tarea

TareaModelo recomendado
Triaje y priorización de CVEClaude Sonnet 5
Resumen de sandbox de malwareClaude Sonnet 5
Investigación compleja de incidentesClaude Opus 4.7
Anotación de registros de alto volumenClaude 4.5 Haiku
Perfilado de actores de amenazasClaude Fable 5
Auditoría de seguridad de código (base de código grande)Claude Opus 4.7
Triaje rápido, trabajo por turnosClaude 4.5 Sonnet

Probador de penetración en un despacho doméstico con poca luz por la noche, iluminado por las pantallas de dos equipos portátiles

Auditoría de código y apoyo al red team

Prompts de revisión estática de código que funcionan

La revisión de código asistida por LLM funciona mejor cuando la planteas como una auditoría estructurada y no como una pregunta abierta. Para la revisión de código centrada en seguridad, esta es la estructura de prompt que de forma constante ofrece buenos resultados:

SYSTEM: You are a senior application security engineer conducting a focused security audit.
USER: Review the following code for:
1. Injection vulnerabilities (SQL, command, LDAP, XPath)
2. Authentication and session management flaws
3. Insecure deserialization patterns
4. Hardcoded secrets or credentials
5. Race conditions or TOCTOU vulnerabilities

For each finding: describe the vulnerability, rate severity (Low/Med/High/Critical),
identify the exact line(s) affected, and suggest a specific remediation.
Return results as a JSON array.

[CODE]
{paste code here}

Claude Opus 4.7 maneja bases de código de hasta 50.000 líneas en una sola sesión con el contexto extendido de Mythos 5.1. Esto cubre la mayoría de los microservicios en una sola pasada y los componentes de monolitos de tamaño medio por secciones.

💡 Consejo para auditorías: Haz dos pasadas separadas: una para las vulnerabilidades lógicas y otra para los problemas de dependencias y configuración. Combinarlas en un solo prompt reduce la profundidad de cada una.

Mapeo de MITRE ATT&CK con IA

Una de las partes que más tiempo consume en los informes de inteligencia de amenazas es asignar los comportamientos observados al marco MITRE ATT&CK. Claude Mythos 5.1 reduce esto de una tarea manual de 2 horas a un proceso de revisión de 10 minutos.

Flujo de trabajo:

  1. Pega la cronología del incidente o los comportamientos del sandbox
  2. Pide un mapeo ATT&CK con identificadores de tipo T-code y niveles de confianza
  3. Pide un informe de carencias: ¿qué cobertura de detección le falta a tu herramental actual según las entradas ATT&CK asignadas?

Estructura de salida de ejemplo que devuelve el modelo:

{
  "atk_entries": [
    {
      "id": "T1566.001",
      "name": "Spearphishing Attachment",
      "confidence": 0.92,
      "evidence": "User received .docx with embedded macro"
    },
    {
      "id": "T1059.001",
      "name": "PowerShell",
      "confidence": 0.98,
      "evidence": "Encoded PowerShell execution observed in process tree"
    }
  ],
  "detection_gaps": ["T1071.001", "T1105"],
  "recommended_detections": [
    "Monitor PowerShell -EncodedCommand usage",
    "Inspect outbound HTTP on non-standard ports"
  ]
}

Esta salida alimenta directamente tu backlog de ingeniería de detección.

Vista aérea de un informe impreso de inteligencia de amenazas rodeado de notas adhesivas y una taza de café

Claude Mythos 5.1 en el ciclo de respuesta a incidentes

Antes de la brecha

Antes de una brecha, Claude Mythos 5.1 acelera dos flujos de trabajo en los que la mayoría de los equipos invierten poco: el modelado de amenazas y el mapeo de la superficie de ataque.

Para el modelado de amenazas, pásale la descripción de tu diagrama de arquitectura, los flujos de datos y los límites de confianza. Pídele que genere un modelo de amenazas categorizado con STRIDE y valoraciones de probabilidad e impacto. Produce un resultado comparable al que entregaría un consultor tras una semana de trabajo, en unos 30 minutos.

Para el mapeo de la superficie de ataque, proporciona tus registros DNS externos, los datos de propiedad de los bloques de red y los resultados de la huella tecnológica. El modelo correlaciona estos datos con los patrones de explotación conocidos de cada tecnología y genera una lista priorizada de superficies de ataque externas explotables, ordenada por facilidad de explotación e impacto potencial.

Equipo de ciberseguridad en una sala de reuniones revisando un diagrama proyectado de la ruta de un ataque a la red

Durante incidentes activos

La respuesta a incidentes en tiempo real impone una carga cognitiva extrema a los analistas. Cambian constantemente entre la revisión de registros, la comunicación con los interesados, las acciones de contención y la preservación de evidencias. Los LLM reducen la carga cognitiva en tres puntos concretos:

Construcción de la cronología: Pega entradas de registros sin procesar de varias fuentes. Pide al modelo una cronología de eventos en orden cronológico, con columnas de actor, acción, objetivo y marca de tiempo. Esto convierte 2 horas de correlación manual en 5 minutos.

Generación de hipótesis: Cuando el panorama del incidente no está claro, pide al modelo las tres explicaciones más plausibles del comportamiento observado. Después, el modo de razonamiento adversarial somete cada hipótesis a una prueba de presión.

Borradores de comunicación: Pide al modelo que redacte a la vez actualizaciones para los interesados, resúmenes ejecutivos e informes técnicos a partir de los mismos datos del incidente, cada uno adaptado a la audiencia correspondiente.

Después de la contención

El trabajo posterior a un incidente es donde los equipos rinden menos de lo esperado con regularidad por el cansancio. Los informes de lecciones aprendidas tardan días en escribirse. Los planes de remediación se dejan para más tarde. Claude Mythos 5.1 acelera las dos cosas.

Para las lecciones aprendidas: pásale la cronología del incidente y pide un informe estructurado que cubra la causa raíz, los puntos de fallo en la detección, la eficacia de la respuesta y las mejoras concretas de los controles. El modelo produce un borrador que los analistas refinan en lugar de escribirlo desde cero.

Para la planificación de la remediación: pide al modelo que genere una hoja de ruta de remediación priorizada a partir de los hallazgos del incidente, con estimaciones de esfuerzo y dependencias detalladas.

Analista con gafas de montura metálica leyendo un informe generado por IA en una tableta con luz cálida de la tarde

Claude Mythos 5.1 y el ecosistema más amplio de LLM

Claude Mythos 5.1 no funciona de forma aislada. Los equipos de seguridad que lo combinan con herramientas complementarias obtienen las mayores mejoras de eficiencia. Estas son las integraciones que merece la pena construir:

Con plataformas SOAR: Usa Claude Mythos 5.1 como capa de razonamiento en los playbooks automatizados. Cuando un playbook llega a un punto de decisión que requiere juicio contextual, la plataforma SOAR llama a la API de Claude con el contexto relevante y actúa según la salida estructurada.

Con herramientas SIEM: Configura pipelines de enriquecimiento de registros que pasen los eventos sospechosos por el modelo para una puntuación de preselección antes de que lleguen a la cola del analista.

Con plataformas de inteligencia de amenazas: Automatiza el procesamiento de la ingesta en la TIP. Los nuevos informes de actores de amenazas, los resúmenes de malware y los avisos de vulnerabilidades llegan a la TIP; el modelo extrae automáticamente los IOC estructurados, las asignaciones ATT&CK y las listas de productos afectados.

Con repositorios de código: Intégralo en pipelines de CI/CD para revisiones de pull requests centradas en seguridad. Marca automáticamente los cambios de código de alto riesgo antes de que lleguen a staging.

💡 Nota sobre costos: Para escenarios de automatización de alto volumen, usa Claude 4.5 Haiku como modelo principal del pipeline. Su perfil de costos encaja con el procesamiento masivo. Reserva Claude Opus 4.7 para los casos que Haiku marque como necesitados de un razonamiento más profundo.

Combinar modelos de forma estratégica es en sí mismo una habilidad. Claude Sonnet 5 funciona como el caballo de batalla diario. Claude Fable 5 se encarga de las investigaciones en profundidad. Claude 3.5 Sonnet y Claude 3.5 Haiku cubren las tareas ligeras en las que importa la latencia. Y Claude 4 Sonnet ocupa el término medio como un todoterreno fiable para tareas de salida estructurada que necesitan velocidad sin sacrificar precisión.

El resultado es una flota de modelos escalonada en lugar de un solo modelo que lo hace todo, que es como los equipos de seguridad maduros están desplegando realmente los LLM en 2027.

Tu turno para probarlo

Los flujos de trabajo de investigación de seguridad descritos aquí están hoy al alcance de la mano en la colección de modelos de lenguaje grandes de PicassoIA. No necesitas una cuenta en Replicate, claves de API ni una GPU local. Abre el navegador, elige un modelo Claude y pega tu primer descriptor de CVE o informe de sandbox.

Empieza con Claude Sonnet 5 para el triaje general. Cuando necesites un razonamiento más profundo en una investigación compleja, cambia a Claude Opus 4.7. Para la automatización masiva en la que procesas cientos de eventos, Claude 4.5 Haiku y Claude 4.5 Sonnet ofrecen el equilibrio adecuado entre rendimiento y costo.

La familia Claude completa, junto a modelos como DeepSeek R1, Grok 4, GPT 5 Pro y Llama 4 Maverick Instruct, está disponible en picassoia.com/en/all-models. Empieza hoy a construir tu primer flujo de triaje con IA y comprueba la diferencia que marca en tu próximo turno.

Vista cenital de un espacio de investigación de seguridad ordenado con dos monitores, cuadernos y herramientas de escritorio

Compartir este artículo

Elige tu idioma