Evaluamos agentes de IA con modelos base y harnesses estándar en múltiples tareas reales de ciberseguridad.
Tasa de éxito frente a coste, tiempo o pasos por resolución frente a k intentos independientes.
Cada porcentaje es aprobado @1 en esa categoría.
Los agentes líderes ya completan la mayoría de nuestros retos básicos de seguridad reales en su primer intento.
El mismo modelo puede rendir sustancialmente mejor o peor bajo Claude Code frente a ADK React. Evaluamos el emparejamiento, no solo el modelo.
Un ataque exitoso de un agente de IA suele costar unos pocos euros y se completa en minutos. Intentos adicionales (por ejemplo, pass@3) aumentan la tasa de éxito del ataque.
Cubrimos muchos desafíos de encontrar vulnerabilidades en una gran base de código y explotación de un día (CVE conocida). Encontramos que estas tareas son más difíciles de resolver para los agentes.
Code Vulns
221 Desafíos
Identificar patrones de vulnerabilidad conocidos en el código fuente y explotar los 1-day (CVE conocidos).
Identifica la causa raíz de la vulnerabilidad en Python, Java y Go, o aprovecha un CVE en vivo de un día.
Seguridad de API
54 Desafíos
Descubre y explota vulnerabilidades web mediante API en vivo.
Accede a todos los caminos explotables en los laboratorios sin código fuente y, a menudo, sin especificaciones de API.
Websec.fr CTFs
29 Desafíos
Analizar el código fuente de Web CTF y escribir exploits funcionales para capturar banderas.
Utiliza el público websec.fr tareas de la web.
Seguridad en la nube
23 Desafíos
Errores de configuración de exploits entre diferentes proveedores de nube (tomado de Wiz CTF Challenges).
Captura una bandera dentro de configuraciones tipo AWS / Azure / GCP / Kubernetes.
ADK React
Un bucle ReAct sencillo desarrollado con ADK. Utiliza una única herramienta bash, no tiene herramientas cibernéticas especializadas y utiliza una indicación general del sistema.
Claude Code
CLI estándar de codificación de Anthropic. Utiliza herramientas ordinarias de archivos, búsqueda y shell, no tiene herramientas cibernéticas especializadas y utiliza un prompt general del sistema.
El agente recibe solo la instrucción de la tarea, sin manuales de ataque adicionales ni plantillas de exploit.
Cada combinación de arnés-modelo-desafío se ejecuta 3 veces (pass@3: el mejor resultado entre partidas se obtiene por desafío), con un límite de 3 intentos por vez para errores de infrarestructura.
Cada partida de agente está limitada a 1000 segundos. Cuando expira el tiempo, el agente es detenido y el verificador califica lo que el agente haya producido. No se vuelve a intentar un tiempo de espera.
El nivel de razonamiento está configurado en alto en todos los modelos.
Anti-trampas: los agentes se ejecutan en contenedores Docker aislados sin bases de datos CVE ni recursos externos.
Toda la puntuación es determinista mediante ganchos API, banderas exactas, cadenas exactas de causa raíz y la ejecución de la ruta vulnerable.
La puntuación global es el macro-promedio en las 4 categorías.