사이버 모델 아레나

우리는 여러 실제 사이버 보안 과제에서 기본 모델과 표준 하네스를 사용하여 AI 에이전트를 평가합니다.

모델 품질 대 효율성

k번의 독립적인 시도에 따른 비용, 시간, 또는 해결당 단계별 성공률.

데이터셋
해결당 X
하네스
Pass@k

리더보드

각 퍼센트는 합격입니다 @1 그 범주에 속합니다.

#
에이전트
전반 @ 1
코드 불른스
API Sec
웹 보안
클라우드 섹
효율성 / 패스
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 단계
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 단계
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 단계
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 단계
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 단계
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 단계
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 단계
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 단계
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 단계
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 단계
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 단계
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 단계
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 단계
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 단계
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 단계
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 단계
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 단계
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 단계
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 단계
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 단계
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 단계
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 단계
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 단계
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 단계
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 단계
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 단계
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 단계
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 단계

수비수들은 무엇을 배울 수 있을까요?

에이전트는 이미 표준 사이버 작업을 수행할 수 있습니다

주요 요원들은 이미 대부분의 기본적이고 현실적인 보안 과제를 첫 시도에 완료합니다.

하네스가 중요합니다

동일한 모델이 Claude Code와 ADK React 대비 성능이 크게 더 좋거나 나빠질 수 있습니다. 우리는 모델만이 아니라 조합을 평가합니다.

공격은 비용이 저렴하고 몇 분 만에 끝납니다

성공적인 AI 에이전트 공격은 일반적으로 몇 달러의 비용이 들고 몇 분 안에 완료됩니다. 추가 시도(예: pass@3)는 공격 성공률을 높입니다.

코드 벌은 어렵습니다

우리는 대규모 코드베이스에서 취약점을 찾는 문제와 1일간(알려진 CVE) 익스플로잇의 여러 도전 과제를 다룹니다. 이러한 작업은 에이전트가 해결하기 더 어렵다는 것을 알게 되었습니다.

데이터셋

코드 불른스

221 도전 과제

소스 코드에서 알려진 취약점 패턴을 식별하고, 1일(알려진 CVE) 문제를 악용합니다.

Python, Java, Go에서 취약점의 근본 원인을 파악하거나, 1일 지속되는 CVE를 악용하세요.

API 보안

54 도전 과제

라이브 API를 통해 웹 취약점을 발견하고 악용하세요.

소스 코드나 API 명세도 없이 실험실에서 모든 악용 가능한 경로에 접근하세요.

Websec.fr CTF

29 도전 과제

웹 CTF 분석, 도전 소스 코드, 그리고 플래그를 캡처하기 위한 작동 중인 익스플로잇을 작성하세요.

공개 websec.fr 웹사이트 작업을 활용하세요.

클라우드 보안

23 도전 과제

Wiz CTF 챌린지에서 가져온 다양한 클라우드 제공업체 간의 잘못된 설정을 악용하세요.

AWS / Azure / GCP / Kubernetes 스타일 설정 내에서 플래그를 캡처하세요.

하네스

ADK 반응

ADK로 개발된 간단한 ReAct 루프입니다. 단일 bash 도구를 사용하며, 전문화된 사이버 도구가 없고 일반적인 시스템 프롬프트를 사용합니다.

클로드 코드

Anthropic의 표준 코딩 CLI입니다. 일반 파일, 검색, 셸 도구를 사용하며, 특수 사이버 도구는 없고 일반적인 시스템 프롬프트를 사용합니다.

방법론

  • 에이전트는 추가 공격 플레이북이나 익스플로잇 템플릿 없이 작업 지시만 받습니다.

  • 각 하네스-모델-챌린지 조합은 3회 실행되며(pass@3: 각 도전마다 최고 결과가 나옵니다), 인프라 오류에 대해 한 번에 3번의 재시도 제한이 있습니다.

  • 각 에이전트 실행은 1000초로 제한됩니다. 시간이 다 되면 에이전트를 멈추고 검증자는 에이전트가 생성한 점수를 계산합니다. 타임아웃은 다시 시도되지 않습니다.

  • 추론 수준은 모델별로 높게 설정되어 있습니다.

  • 안티치트: 에이전트는 CVE 데이터베이스나 외부 자원이 없는 격리된 Docker 컨테이너에서 실행됩니다.

  • 모든 점수 산정은 API 훅, 정확한 플래그, 정확한 근본 원인 문자열을 통해 결정적이며, 취약한 경로가 실행됩니다.

  • 전체 점수는 4개 항목 모두에 걸친 거시평균입니다.