Wir bewerten KI-Agenten mit Foundation Models und Standard-Testumgebungen anhand mehrerer realer Cybersicherheitsaufgaben.
Erfolgsrate im Vergleich zu Kosten, Zeit oder Schritten pro Lösung über k unabhängige Versuche.
Jeder Prozentsatz entspricht pass@1 in dieser Kategorie.
Führende Agenten lösen die meisten unserer grundlegenden, realen Sicherheitsherausforderungen bereits beim ersten Versuch.
Dasselbe Modell kann unter Claude Code im Vergleich zu ADK React wesentlich besser oder schlechter abschneiden. Wir bewerten die Kombination, nicht das Modell allein.
Ein erfolgreicher Angriff von KI-Agenten kostet typischerweise wenige US-Dollar und dauert nur wenige Minuten. Zusätzliche Versuche (z. B. pass@3) erhöhen die Erfolgsquote des Angriffs.
Wir decken zahlreiche Herausforderungen beim Auffinden von Schwachstellen in einer großen Codebasis sowie 1-Day-Exploits (bekannte CVEs) ab. Wir stellen fest, dass solche Aufgaben für Agenten schwieriger zu lösen sind.
Code-Schwachstellen
221 Herausforderungen
Bekannte Schwachstellenmuster im Quellcode identifizieren und 1-Day-Exploits (bekannte CVEs) ausnutzen.
Die Ursache einer Schwachstelle in Python, Java und Go identifizieren oder ein Live-1-Day-CVE ausnutzen.
API-Sicherheit
54 Herausforderungen
Webschwachstellen über eine Live-API entdecken und ausnutzen.
Alle ausnutzbaren Pfade in Labs ohne Quellcode und oft ohne API-Spezifikation erreichen.
Websec.fr-CTFs
29 Herausforderungen
Quellcode von Web-CTF-Herausforderungen analysieren und funktionierende Exploits schreiben, um Flags zu erfassen.
Die Aufgaben der öffentlichen Website websec.fr verwenden.
Cloud-Sicherheit
23 Herausforderungen
Fehlkonfigurationen bei verschiedenen Cloud-Anbietern ausnutzen (aus Wiz-CTF-Herausforderungen entnommen).
Ein Flag innerhalb von AWS- / Azure- / GCP- / Kubernetes-ähnlichen Setups erfassen.
ADK React
Eine einfache ReAct-Schleife, die mit dem ADK entwickelt wurde. Sie verwendet ein einzelnes Bash-Tool, verfügt über keine spezialisierten Cyber-Tools und nutzt einen allgemeinen System-Prompt.
Claude Code
Die Standard-Coding-CLI von Anthropic. Sie verwendet gewöhnliche Datei-, Such- und Shell-Tools, hat keine speziellen Cyber-Tools und nutzt einen allgemeinen System-Prompt.
Der Agent erhält ausschließlich die Aufgabenanweisung, ohne zusätzliche Angriffs-Playbooks oder Exploit-Vorlagen.
Jede Kombination aus Testumgebung, Modell und Herausforderung wird 3-mal ausgeführt (pass@3: das beste Ergebnis über alle Durchläufe hinweg wird pro Herausforderung gewertet), mit einem Wiederholungslimit von 3 pro Zeit für Infrastrukturfehler.
Jeder Agenten-Durchlauf ist auf 1000 Sekunden begrenzt. Wenn die Zeit abläuft, wird der Agent gestoppt und der Prüfer bewertet das, was der Agent produziert hat. Ein Timeout wird nicht wiederholt.
Das Argumentationsniveau ist modellübergreifend auf „hoch“ eingestellt.
Anti-Cheat: Agenten laufen in isolierten Docker-Containern ohne CVE-Datenbanken und ohne externe Ressourcen.
Die gesamte Bewertung erfolgt deterministisch über API-Hooks, exakte Flags, exakte Root-Cause-Strings und das Zusichern, dass der anfällige Pfad ausgeführt wird.
Die Gesamtpunktzahl ist der Makrodurchschnitt über alle 4 Kategorien hinweg.