Nous évaluons les agents IA à l’aide de modèles de base et de harnais standards sur de multiples tâches réelles de cybersécurité.
Taux de réussite par rapport au coût, au temps ou aux étapes par résolution sur k tentatives indépendantes.
Chaque pourcentage est un passage @1 dans cette catégorie.
Les agents de premier plan relèvent déjà la plupart de nos défis de sécurité réels dès leur première tentative.
Le même modèle peut performer nettement mieux ou moins bien sous Claude Code vs ADK React. Nous évaluons l’appariement, pas le modèle seul.
Une attaque d'agent IA réussie coûte généralement quelques dollars et s'achève en quelques minutes. Les tentatives supplémentaires (par ex., pass@3) augmentent le taux de réussite de l'attaque.
Nous abordons de nombreux défis liés à la détection de vulns dans une grande base de code et à l’exploitation en un jour (CVE connue). Nous trouvons que ces tâches sont plus difficiles à résoudre pour les agents.
Code Vulns
221 Défis
Identifier les schémas de vulnérabilité connus dans le code source et exploiter les 1-day (CVE connues).
Identifiez la cause racine de la vulnérabilité dans Python, Java et Go, ou exploitez un CVE en cours d’un jour.
Sécurité de l’API
54 Défis
Découvrez et exploitez les vulnérabilités web via une API en direct.
Atteindre tous les chemins exploitables dans les laboratoires sans code source, et souvent sans spécification API.
Websec.fr CTFs
29 Défis
Analyser Web CTF défie le code source et écrire des exploits fonctionnels pour capturer les flags.
Utilisez les tâches publiques websec.fr site web.
Sécurité cloud
23 Défis
Exploits de configurations incorrectes entre différents fournisseurs cloud (tirés des défis Wiz CTF).
Capturez un drapeau dans des configurations de type AWS / Azure / GCP / Kubernetes.
ADK React
Une boucle ReAct simple développée avec ADK. Elle utilise un seul outil bash, ne dispose d'aucun outil cyber spécialisé et utilise une instruction système générale.
Claude Code
CLI standard de codage d’Anthropic. Il utilise des outils classiques de fichiers, de recherche et de shell, ne dispose pas d’outils cyber spécialisés, et utilise une invite système générale.
L’agent ne reçoit que l’instruction de tâche, sans playbooks d’attaque supplémentaires ni modèles d’exploits.
Chaque combinaison de harnais, modèle et défi est exécutée 3 fois (pass@3 : le meilleur résultat entre les courses est pris par défi), avec une limite de 3 essais par fois pour les erreurs infra.
Chaque exécution d’agent est limitée à 1000 secondes. Lorsque le temps expire, l’agent est arrêté et le vérificateur attribue la note produite par l’agent. Un délai d’attente n’est pas retenté.
Le niveau de raisonnement est réglé à élevé sur tous les modèles.
Anti-triche : les agents fonctionnent dans des conteneurs Docker isolés sans bases de données CVE ni ressources externes.
Tous les scores sont déterministes via des hooks API, des drapeaux exacts, des chaînes exactes de cause principale, et l’exécution de l’affirmation du chemin vulnérable.
Le score global est la macro-moyenne dans les 4 catégories.