Cyber Model Arena

Valutiamo gli agenti di IA con modelli di base e imbracaggi standard su molteplici compiti reali di cybersecurity.

Qualità del modello vs. efficienza

Tasso di successo rispetto a costo, tempo o passaggi per soluzione rispetto a k tentativi indipendenti.

Dataset
X per ogni Soluzione
Imbracatura
Pass@k

Classifica

Ogni percentuale è approvata @1 in quella categoria.

#
Agente
Complessivo @ 1
Code Vulns
API Sec
Web Sec
Cloud Sec
Efficienza / passaggio
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 Passi
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 Passi
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 Passi
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 Passi
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 Passi
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 Passi
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 Passi
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 Passi
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 Passi
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 Passi
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 Passi
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 Passi
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 Passi
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 Passi
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 Passi
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 Passi
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 Passi
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 Passi
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 Passi
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 Passi
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 Passi
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 Passi
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 Passi
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 Passi
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 Passi
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 Passi
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 Passi
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 Passi

Cosa possono imparare i difensori?

Gli agenti possono già svolgere compiti standard di cyber

Gli agenti di primo piano già completano la maggior parte delle nostre sfide di sicurezza reali al primo tentativo.

L'imbracatura conta

Lo stesso modello può ottenere risultati sostanzialmente migliori o peggiori con Claude Code rispetto ad ADK React. Valutiamo l'accoppiamento, non il modello da solo.

Gli attacchi sono economici e richiedono minuti

Un attacco di agenti IA riuscito costa in genere pochi dollari e si completa in pochi minuti. I tentativi aggiuntivi (ad esempio, pass@3) aumentano il tasso di successo dell'attacco.

I Code Vuln sono difficili

Copriamo molte sfide nel trovare vulnerabilità in una grande base di codice e nello sfruttamento di 1 giorno (CVE noto). Troviamo tali compiti più difficili da risolvere per gli agenti.

Dataset

Code Vulns

221 Sfide

Identificare i modelli di vulnerabilità noti nel codice sorgente e sfruttare i 1-day (CVE noti).

Identifica la causa principale della vulnerabilità in Python, Java e Go, oppure sfrutta un CVE in tempo reale di 1 giorno.

Sicurezza API

54 Sfide

Scopri ed sfrutta le vulnerabilità web tramite l'API in tempo reale.

Raggiungere tutti i percorsi sfruttabili nei laboratori senza codice sorgente, e spesso senza specifiche API.

Websec.fr CTF

29 Sfide

Analizza il Web CTF sfida il codice sorgente e scrive exploit operativi per catturare flag.

Usa il pubblico websec.fr attività sul sito.

Sicurezza nel cloud

23 Sfide

Configurazioni errate degli exploit tra diversi provider cloud (tratti da Wiz CTF Challenges).

Cattura una bandiera all'interno di configurazioni in stile AWS / Azure / GCP / Kubernetes.

Imbracature

ADK React

Un semplice ciclo ReAct sviluppato con ADK. Utilizza un singolo strumento bash, non ha strumenti informatici specializzati e utilizza un prompt di sistema generale.

Claude Code

CLI standard di codifica di Anthropic. Utilizza strumenti ordinari di file, ricerca e shell, non dispone di strumenti informatici specializzati e utilizza un prompt generale di sistema.

Metodologia

  • L'agente riceve solo l'istruzione del compito, senza playbook di attacco aggiuntivi o template di exploit.

  • Ogni combinazione di imbracatura-modello-sfida viene eseguita 3 volte (pass@3: il miglior risultato tra le run viene ottenuto per ogni sfida), con un limite di ritentativo di 3 per ogni volta per errori infra.

  • Ogni run con l'agente è limitata a 1000 secondi. Quando il tempo scade, l'agente viene fermato e il verificatore valuta ciò che l'agente ha prodotto. Un timeout non viene ripetuto.

  • Il livello di ragionamento è impostato su alto tra i modelli.

  • Anti-cheat: gli agenti girano in container Docker isolati senza database CVE e senza risorse esterne.

  • Tutti i punteggi sono deterministici tramite hook API, flag esatti, stringhe di causa radice esatte e l'esecuzione del percorso vulnerabile.

  • Il punteggio complessivo è la macro-media in tutte e 4 le categorie.