Avaliamos agentes de IA com modelos de fundação e harnesses padrão em múltiplas tarefas de cibersegurança do mundo real.
Taxa de sucesso em relação a custo, tempo ou etapas por resolução ao longo de k tentativas independentes.
Cada porcentagem é pass@1 nessa categoria.
Agentes líderes já concluem a maioria dos nossos desafios básicos de segurança do mundo real em sua primeira tentativa.
O mesmo modelo pode ter um desempenho substancialmente melhor ou pior com o Claude Code em comparação ao ADK React. Nós avaliamos a combinação, não o modelo isoladamente.
Um ataque de agente de IA bem-sucedido normalmente custa alguns dólares e é concluído em minutos. Tentativas adicionais (por exemplo, pass@3) aumentam a taxa de sucesso do ataque.
Cobrimos muitos desafios de encontrar vulnerabilidades em grandes bases de código e exploração de falhas de 1 dia (CVEs conhecidas). Consideramos que essas tarefas são mais difíceis para os agentes resolverem.
Vulnerabilidades de código
221 desafios
Identificar padrões de vulnerabilidade conhecidos no código-fonte e explorar falhas de 1 dia (CVEs conhecidas).
Identificar a causa-raiz da vulnerabilidade em Python, Java e Go, ou explorar um CVE ativo de 1 dia.
Segurança de API
54 desafios
Descobrir e explorar vulnerabilidades web por meio de uma API ativa.
Acessar todos os caminhos exploráveis em laboratórios sem usar código-fonte e, frequentemente, sem nenhuma especificação de API.
CTFs do Websec.fr
29 desafios
Analisar o código-fonte de desafios de CTF web e escrever exploits funcionais para capturar flags.
Usar as tarefas públicas do site websec.fr.
Segurança na nuvem
23 desafios
Explorar configurações incorretas em diferentes provedores de nuvem (extraído dos Desafios de CTF da Wiz).
Capturar uma flag em configurações estilo AWS / Azure / GCP / Kubernetes.
ADK React
Um loop ReAct simples desenvolvido com ADK. Ele usa uma única ferramenta bash, não tem ferramentas cibernéticas especializadas e usa um prompt de sistema geral.
Claude Code
CLI de codificação padrão da Anthropic. Utiliza ferramentas comuns de arquivo, busca e shell, não possui ferramentas cibernéticas especializadas e usa um prompt de sistema geral.
O agente recebe apenas a instrução da tarefa, sem manuais de ataque extras ou modelos de exploit.
Cada combinação de harness-modelo-desafio é executada 3 vezes (pass@3: o melhor resultado entre as execuções é considerado por desafio), com um limite de repetição de 3 vezes por erro de infraestrutura.
Cada execução de agente é limitada a 1000 segundos. Quando o tempo expira, o agente é interrompido e o verificador pontua o que o agente produziu. Um tempo limite esgotado não é repetido.
O nível de raciocínio está definido como alto em todos os modelos.
Antifraude: os agentes são executados em containers Docker isolados, sem bancos de dados de CVEs e sem recursos externos.
Todas as pontuações são determinísticas por meio de ganchos de API, flags exatas, strings de causa-raiz exatas e confirmação de que o caminho vulnerável é executado.
A pontuação geral é a média macro em todas as 4 categorias.