Cyber Model Arena

Nous évaluons les agents IA à l’aide de modèles de base et de harnais standards sur de multiples tâches réelles de cybersécurité.

Qualité des modèles vs. efficacité

Taux de réussite par rapport au coût, au temps ou aux étapes par résolution sur k tentatives indépendantes.

Jeu de données
X par Solution
Harnais
Pass@k

Classement

Chaque pourcentage est un passage @1 dans cette catégorie.

#
Agent
Globalisation @ 1
Code Vulns
Sécurité des API
Web Sec
Cloud Sec
Efficacité / passe
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 étapes
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 étapes
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 étapes
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 étapes
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 étapes
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 étapes
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 étapes
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 étapes
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 étapes
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 étapes
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 étapes
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 étapes
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 étapes
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 étapes
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 étapes
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 étapes
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 étapes
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 étapes
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 étapes
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 étapes
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 étapes
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 étapes
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 étapes
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 étapes
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 étapes
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 étapes
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 étapes
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 étapes

Que peuvent apprendre les défenseurs ?

Les agents peuvent déjà effectuer des tâches cyber standard

Les agents de premier plan relèvent déjà la plupart de nos défis de sécurité réels dès leur première tentative.

Le harnais compte

Le même modèle peut performer nettement mieux ou moins bien sous Claude Code vs ADK React. Nous évaluons l’appariement, pas le modèle seul.

Les attaques sont peu coûteuses et prennent plusieurs minutes

Une attaque d'agent IA réussie coûte généralement quelques dollars et s'achève en quelques minutes. Les tentatives supplémentaires (par ex., pass@3) augmentent le taux de réussite de l'attaque.

Les Vols Code sont difficiles

Nous abordons de nombreux défis liés à la détection de vulns dans une grande base de code et à l’exploitation en un jour (CVE connue). Nous trouvons que ces tâches sont plus difficiles à résoudre pour les agents.

Ensembles de données

Code Vulns

221 Défis

Identifier les schémas de vulnérabilité connus dans le code source et exploiter les 1-day (CVE connues).

Identifiez la cause racine de la vulnérabilité dans Python, Java et Go, ou exploitez un CVE en cours d’un jour.

Sécurité de l’API

54 Défis

Découvrez et exploitez les vulnérabilités web via une API en direct.

Atteindre tous les chemins exploitables dans les laboratoires sans code source, et souvent sans spécification API.

Websec.fr CTFs

29 Défis

Analyser Web CTF défie le code source et écrire des exploits fonctionnels pour capturer les flags.

Utilisez les tâches publiques websec.fr site web.

Sécurité cloud

23 Défis

Exploits de configurations incorrectes entre différents fournisseurs cloud (tirés des défis Wiz CTF).

Capturez un drapeau dans des configurations de type AWS / Azure / GCP / Kubernetes.

Harnais

ADK React

Une boucle ReAct simple développée avec ADK. Elle utilise un seul outil bash, ne dispose d'aucun outil cyber spécialisé et utilise une instruction système générale.

Claude Code

CLI standard de codage d’Anthropic. Il utilise des outils classiques de fichiers, de recherche et de shell, ne dispose pas d’outils cyber spécialisés, et utilise une invite système générale.

Méthodologie

  • L’agent ne reçoit que l’instruction de tâche, sans playbooks d’attaque supplémentaires ni modèles d’exploits.

  • Chaque combinaison de harnais, modèle et défi est exécutée 3 fois (pass@3 : le meilleur résultat entre les courses est pris par défi), avec une limite de 3 essais par fois pour les erreurs infra.

  • Chaque exécution d’agent est limitée à 1000 secondes. Lorsque le temps expire, l’agent est arrêté et le vérificateur attribue la note produite par l’agent. Un délai d’attente n’est pas retenté.

  • Le niveau de raisonnement est réglé à élevé sur tous les modèles.

  • Anti-triche : les agents fonctionnent dans des conteneurs Docker isolés sans bases de données CVE ni ressources externes.

  • Tous les scores sont déterministes via des hooks API, des drapeaux exacts, des chaînes exactes de cause principale, et l’exécution de l’affirmation du chemin vulnérable.

  • Le score global est la macro-moyenne dans les 4 catégories.