Valutiamo gli agenti di IA con modelli di base e imbracaggi standard su molteplici compiti reali di cybersecurity.
Tasso di successo rispetto a costo, tempo o passaggi per soluzione rispetto a k tentativi indipendenti.
Ogni percentuale è approvata @1 in quella categoria.
Gli agenti di primo piano già completano la maggior parte delle nostre sfide di sicurezza reali al primo tentativo.
Lo stesso modello può ottenere risultati sostanzialmente migliori o peggiori con Claude Code rispetto ad ADK React. Valutiamo l'accoppiamento, non il modello da solo.
Un attacco di agenti IA riuscito costa in genere pochi dollari e si completa in pochi minuti. I tentativi aggiuntivi (ad esempio, pass@3) aumentano il tasso di successo dell'attacco.
Copriamo molte sfide nel trovare vulnerabilità in una grande base di codice e nello sfruttamento di 1 giorno (CVE noto). Troviamo tali compiti più difficili da risolvere per gli agenti.
Code Vulns
221 Sfide
Identificare i modelli di vulnerabilità noti nel codice sorgente e sfruttare i 1-day (CVE noti).
Identifica la causa principale della vulnerabilità in Python, Java e Go, oppure sfrutta un CVE in tempo reale di 1 giorno.
Sicurezza API
54 Sfide
Scopri ed sfrutta le vulnerabilità web tramite l'API in tempo reale.
Raggiungere tutti i percorsi sfruttabili nei laboratori senza codice sorgente, e spesso senza specifiche API.
Websec.fr CTF
29 Sfide
Analizza il Web CTF sfida il codice sorgente e scrive exploit operativi per catturare flag.
Usa il pubblico websec.fr attività sul sito.
Sicurezza nel cloud
23 Sfide
Configurazioni errate degli exploit tra diversi provider cloud (tratti da Wiz CTF Challenges).
Cattura una bandiera all'interno di configurazioni in stile AWS / Azure / GCP / Kubernetes.
ADK React
Un semplice ciclo ReAct sviluppato con ADK. Utilizza un singolo strumento bash, non ha strumenti informatici specializzati e utilizza un prompt di sistema generale.
Claude Code
CLI standard di codifica di Anthropic. Utilizza strumenti ordinari di file, ricerca e shell, non dispone di strumenti informatici specializzati e utilizza un prompt generale di sistema.
L'agente riceve solo l'istruzione del compito, senza playbook di attacco aggiuntivi o template di exploit.
Ogni combinazione di imbracatura-modello-sfida viene eseguita 3 volte (pass@3: il miglior risultato tra le run viene ottenuto per ogni sfida), con un limite di ritentativo di 3 per ogni volta per errori infra.
Ogni run con l'agente è limitata a 1000 secondi. Quando il tempo scade, l'agente viene fermato e il verificatore valuta ciò che l'agente ha prodotto. Un timeout non viene ripetuto.
Il livello di ragionamento è impostato su alto tra i modelli.
Anti-cheat: gli agenti girano in container Docker isolati senza database CVE e senza risorse esterne.
Tutti i punteggi sono deterministici tramite hook API, flag esatti, stringhe di causa radice esatte e l'esecuzione del percorso vulnerabile.
Il punteggio complessivo è la macro-media in tutte e 4 le categorie.