Cyber Model Arena

Avaliamos agentes de IA com modelos de fundação e harnesses padrão em múltiplas tarefas de cibersegurança do mundo real.

Qualidade do modelo vs. Eficiência

Taxa de sucesso em relação a custo, tempo ou etapas por resolução ao longo de k tentativas independentes.

Conjunto de dados
X por resolução
Harness
Pass@k

Tabela de classificação

Cada porcentagem é pass@1 nessa categoria.

#
Agente
Geral @ 1
Vulnerabilidades de código
API Sec
Web Sec
Cloud Sec
Eficiência / passe
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 passos
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 passos
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 passos
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 passos
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 passos
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 passos
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 passos
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 passos
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 passos
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 passos
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 passos
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 passos
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 passos
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 passos
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 passos
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 passos
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 passos
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 passos
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 passos
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 passos
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 passos
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 passos
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 passos
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 passos
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 passos
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 passos
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 passos
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 passos

O que os defensores podem aprender?

Os agentes já conseguem realizar tarefas cibernéticas padrão

Agentes líderes já concluem a maioria dos nossos desafios básicos de segurança do mundo real em sua primeira tentativa.

O harness faz a diferença

O mesmo modelo pode ter um desempenho substancialmente melhor ou pior com o Claude Code em comparação ao ADK React. Nós avaliamos a combinação, não o modelo isoladamente.

Os ataques são baratos e levam minutos

Um ataque de agente de IA bem-sucedido normalmente custa alguns dólares e é concluído em minutos. Tentativas adicionais (por exemplo, pass@3) aumentam a taxa de sucesso do ataque.

Vulnerabilidades de código são difíceis

Cobrimos muitos desafios de encontrar vulnerabilidades em grandes bases de código e exploração de falhas de 1 dia (CVEs conhecidas). Consideramos que essas tarefas são mais difíceis para os agentes resolverem.

Conjuntos de dados

Vulnerabilidades de código

221 desafios

Identificar padrões de vulnerabilidade conhecidos no código-fonte e explorar falhas de 1 dia (CVEs conhecidas).

Identificar a causa-raiz da vulnerabilidade em Python, Java e Go, ou explorar um CVE ativo de 1 dia.

Segurança de API

54 desafios

Descobrir e explorar vulnerabilidades web por meio de uma API ativa.

Acessar todos os caminhos exploráveis em laboratórios sem usar código-fonte e, frequentemente, sem nenhuma especificação de API.

CTFs do Websec.fr

29 desafios

Analisar o código-fonte de desafios de CTF web e escrever exploits funcionais para capturar flags.

Usar as tarefas públicas do site websec.fr.

Segurança na nuvem

23 desafios

Explorar configurações incorretas em diferentes provedores de nuvem (extraído dos Desafios de CTF da Wiz).

Capturar uma flag em configurações estilo AWS / Azure / GCP / Kubernetes.

Arreios

ADK React

Um loop ReAct simples desenvolvido com ADK. Ele usa uma única ferramenta bash, não tem ferramentas cibernéticas especializadas e usa um prompt de sistema geral.

Claude Code

CLI de codificação padrão da Anthropic. Utiliza ferramentas comuns de arquivo, busca e shell, não possui ferramentas cibernéticas especializadas e usa um prompt de sistema geral.

Metodologia

  • O agente recebe apenas a instrução da tarefa, sem manuais de ataque extras ou modelos de exploit.

  • Cada combinação de harness-modelo-desafio é executada 3 vezes (pass@3: o melhor resultado entre as execuções é considerado por desafio), com um limite de repetição de 3 vezes por erro de infraestrutura.

  • Cada execução de agente é limitada a 1000 segundos. Quando o tempo expira, o agente é interrompido e o verificador pontua o que o agente produziu. Um tempo limite esgotado não é repetido.

  • O nível de raciocínio está definido como alto em todos os modelos.

  • Antifraude: os agentes são executados em containers Docker isolados, sem bancos de dados de CVEs e sem recursos externos.

  • Todas as pontuações são determinísticas por meio de ganchos de API, flags exatas, strings de causa-raiz exatas e confirmação de que o caminho vulnerável é executado.

  • A pontuação geral é a média macro em todas as 4 categorias.