Arena de Modelos Cibernéticos

Evaluamos agentes de IA con modelos base y harnesses estándar en múltiples tareas reales de ciberseguridad.

Calidad del modelo vs. eficiencia

Tasa de éxito frente a coste, tiempo o pasos por resolución frente a k intentos independientes.

Conjunto de datos
X por Resolver
Arnés
Pass@k

Clasificación

Cada porcentaje es aprobado @1 en esa categoría.

#
Agente
En general @ 1
Code Vulns
API Sec
Seguridad Web
Cloud Sec
Eficiencia / pase
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 Escalones
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 Escalones
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 Escalones
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 Escalones
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 Escalones
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 Escalones
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 Escalones
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 Escalones
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 Escalones
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 Escalones
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 Escalones
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 Escalones
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 Escalones
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 Escalones
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 Escalones
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 Escalones
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 Escalones
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 Escalones
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 Escalones
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 Escalones
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 Escalones
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 Escalones
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 Escalones
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 Escalones
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 Escalones
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 Escalones
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 Escalones
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 Escalones

¿Qué pueden aprender los defensas?

Los agentes ya pueden realizar tareas cibernéticas estándar

Los agentes líderes ya completan la mayoría de nuestros retos básicos de seguridad reales en su primer intento.

El arnés importa

El mismo modelo puede rendir sustancialmente mejor o peor bajo Claude Code frente a ADK React. Evaluamos el emparejamiento, no solo el modelo.

Los ataques son baratos y tardan minutos

Un ataque exitoso de un agente de IA suele costar unos pocos euros y se completa en minutos. Intentos adicionales (por ejemplo, pass@3) aumentan la tasa de éxito del ataque.

Los Vulns de código son difíciles

Cubrimos muchos desafíos de encontrar vulnerabilidades en una gran base de código y explotación de un día (CVE conocida). Encontramos que estas tareas son más difíciles de resolver para los agentes.

Conjuntos de datos

Code Vulns

221 Desafíos

Identificar patrones de vulnerabilidad conocidos en el código fuente y explotar los 1-day (CVE conocidos).

Identifica la causa raíz de la vulnerabilidad en Python, Java y Go, o aprovecha un CVE en vivo de un día.

Seguridad de API

54 Desafíos

Descubre y explota vulnerabilidades web mediante API en vivo.

Accede a todos los caminos explotables en los laboratorios sin código fuente y, a menudo, sin especificaciones de API.

Websec.fr CTFs

29 Desafíos

Analizar el código fuente de Web CTF y escribir exploits funcionales para capturar banderas.

Utiliza el público websec.fr tareas de la web.

Seguridad en la nube

23 Desafíos

Errores de configuración de exploits entre diferentes proveedores de nube (tomado de Wiz CTF Challenges).

Captura una bandera dentro de configuraciones tipo AWS / Azure / GCP / Kubernetes.

Arneses

ADK React

Un bucle ReAct sencillo desarrollado con ADK. Utiliza una única herramienta bash, no tiene herramientas cibernéticas especializadas y utiliza una indicación general del sistema.

Claude Code

CLI estándar de codificación de Anthropic. Utiliza herramientas ordinarias de archivos, búsqueda y shell, no tiene herramientas cibernéticas especializadas y utiliza un prompt general del sistema.

Metodología

  • El agente recibe solo la instrucción de la tarea, sin manuales de ataque adicionales ni plantillas de exploit.

  • Cada combinación de arnés-modelo-desafío se ejecuta 3 veces (pass@3: el mejor resultado entre partidas se obtiene por desafío), con un límite de 3 intentos por vez para errores de infrarestructura.

  • Cada partida de agente está limitada a 1000 segundos. Cuando expira el tiempo, el agente es detenido y el verificador califica lo que el agente haya producido. No se vuelve a intentar un tiempo de espera.

  • El nivel de razonamiento está configurado en alto en todos los modelos.

  • Anti-trampas: los agentes se ejecutan en contenedores Docker aislados sin bases de datos CVE ni recursos externos.

  • Toda la puntuación es determinista mediante ganchos API, banderas exactas, cadenas exactas de causa raíz y la ejecución de la ruta vulnerable.

  • La puntuación global es el macro-promedio en las 4 categorías.