Cyber Model Arena

Wir bewerten KI-Agenten mit Foundation Models und Standard-Testumgebungen anhand mehrerer realer Cybersicherheitsaufgaben.

Modellqualität vs. Effizienz

Erfolgsrate im Vergleich zu Kosten, Zeit oder Schritten pro Lösung über k unabhängige Versuche.

Datensatz
X pro Lösung
Testumgebung
Pass@k

Bestenliste

Jeder Prozentsatz entspricht pass@1 in dieser Kategorie.

#
Agent
Gesamt @ 1
Code-Schwachstellen
API-Sicherheit
Web Sec
Cloud Sec
Effizienz / Pass
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 Schritte
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 Schritte
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 Schritte
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 Schritte
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 Schritte
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 Schritte
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 Schritte
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 Schritte
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 Schritte
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 Schritte
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 Schritte
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 Schritte
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 Schritte
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 Schritte
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 Schritte
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 Schritte
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 Schritte
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 Schritte
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 Schritte
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 Schritte
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 Schritte
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 Schritte
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 Schritte
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 Schritte
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 Schritte
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 Schritte
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 Schritte
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 Schritte

Was können Verteidiger lernen?

Agenten können bereits Standard-Cyberaufgaben ausführen

Führende Agenten lösen die meisten unserer grundlegenden, realen Sicherheitsherausforderungen bereits beim ersten Versuch.

Die Testumgebung macht den Unterschied

Dasselbe Modell kann unter Claude Code im Vergleich zu ADK React wesentlich besser oder schlechter abschneiden. Wir bewerten die Kombination, nicht das Modell allein.

Angriffe sind kostengünstig und dauern nur wenige Minuten

Ein erfolgreicher Angriff von KI-Agenten kostet typischerweise wenige US-Dollar und dauert nur wenige Minuten. Zusätzliche Versuche (z. B. pass@3) erhöhen die Erfolgsquote des Angriffs.

Code-Schwachstellen sind schwer zu finden

Wir decken zahlreiche Herausforderungen beim Auffinden von Schwachstellen in einer großen Codebasis sowie 1-Day-Exploits (bekannte CVEs) ab. Wir stellen fest, dass solche Aufgaben für Agenten schwieriger zu lösen sind.

Datensätze

Code-Schwachstellen

221 Herausforderungen

Bekannte Schwachstellenmuster im Quellcode identifizieren und 1-Day-Exploits (bekannte CVEs) ausnutzen.

Die Ursache einer Schwachstelle in Python, Java und Go identifizieren oder ein Live-1-Day-CVE ausnutzen.

API-Sicherheit

54 Herausforderungen

Webschwachstellen über eine Live-API entdecken und ausnutzen.

Alle ausnutzbaren Pfade in Labs ohne Quellcode und oft ohne API-Spezifikation erreichen.

Websec.fr-CTFs

29 Herausforderungen

Quellcode von Web-CTF-Herausforderungen analysieren und funktionierende Exploits schreiben, um Flags zu erfassen.

Die Aufgaben der öffentlichen Website websec.fr verwenden.

Cloud-Sicherheit

23 Herausforderungen

Fehlkonfigurationen bei verschiedenen Cloud-Anbietern ausnutzen (aus Wiz-CTF-Herausforderungen entnommen).

Ein Flag innerhalb von AWS- / Azure- / GCP- / Kubernetes-ähnlichen Setups erfassen.

Geschirre

ADK React

Eine einfache ReAct-Schleife, die mit dem ADK entwickelt wurde. Sie verwendet ein einzelnes Bash-Tool, verfügt über keine spezialisierten Cyber-Tools und nutzt einen allgemeinen System-Prompt.

Claude Code

Die Standard-Coding-CLI von Anthropic. Sie verwendet gewöhnliche Datei-, Such- und Shell-Tools, hat keine speziellen Cyber-Tools und nutzt einen allgemeinen System-Prompt.

Methodik

  • Der Agent erhält ausschließlich die Aufgabenanweisung, ohne zusätzliche Angriffs-Playbooks oder Exploit-Vorlagen.

  • Jede Kombination aus Testumgebung, Modell und Herausforderung wird 3-mal ausgeführt (pass@3: das beste Ergebnis über alle Durchläufe hinweg wird pro Herausforderung gewertet), mit einem Wiederholungslimit von 3 pro Zeit für Infrastrukturfehler.

  • Jeder Agenten-Durchlauf ist auf 1000 Sekunden begrenzt. Wenn die Zeit abläuft, wird der Agent gestoppt und der Prüfer bewertet das, was der Agent produziert hat. Ein Timeout wird nicht wiederholt.

  • Das Argumentationsniveau ist modellübergreifend auf „hoch“ eingestellt.

  • Anti-Cheat: Agenten laufen in isolierten Docker-Containern ohne CVE-Datenbanken und ohne externe Ressourcen.

  • Die gesamte Bewertung erfolgt deterministisch über API-Hooks, exakte Flags, exakte Root-Cause-Strings und das Zusichern, dass der anfällige Pfad ausgeführt wird.

  • Die Gesamtpunktzahl ist der Makrodurchschnitt über alle 4 Kategorien hinweg.