サイバーモデルアリーナ

私たちは、複数の実世界のサイバーセキュリティタスクにおいて、基盤モデルと標準的なハーネスを用いたAIエージェントを評価しています。

モデルの品質と効率

k回の独立的な試みに対するコスト、時間、または1回の解決に対する成功率。

データセット
解決あたりX
ハーネス
Pass@k

リーダーボード

各パーセンテージは合格です@1 そのカテゴリーで。

#
エージェント
総じて@ 1
コード・ヴルンズ
APIセック
ウェブセック
クラウドセック
効率/パス
1
ADK React
74.9%57%85.2%90.8%66.7%
5 min$1.6258 ステップ
2
Claude Code
71.2%55.2%84%81.6%63.8%
12.2 min$2.6319 ステップ
3
Claude Code
68.5%50.1%84.6%78.2%60.9%
5.7 min$1.5258 ステップ
4
ADK React
66.9%41.8%78.4%85.1%62.3%
15.3 min$7.4612 ステップ
5
Claude Code
65.4%44%79%74.7%63.8%
11.9 min$2.7715 ステップ
6
Claude Code
64.4%38.9%78.4%79.3%60.9%
22.4 min$3.4847 ステップ
7
Claude Code
64.2%33.8%82.7%79.3%60.9%
27.2 min$8.2957 ステップ
8
ADK React
61%25.8%80.2%81.6%56.5%
30.6 min$2.3139 ステップ
9
ADK React
60.9%35.3%77.2%75.9%55.1%
15.7 min$4.1612 ステップ
10
Claude Code
60.5%37.7%73.5%81.6%49.3%
22.5 min$8.9947 ステップ
11
ADK React
59.7%17%80.2%85.1%56.5%
38.7 min$0.9537 ステップ
12
Claude Code
59.3%36.3%76.5%67.8%56.5%
14.1 min$1.5816 ステップ
13
Claude Code
59.1%26.1%82.1%74.7%53.6%
27.4 min$6.4738 ステップ
14
Claude Code
59.1%39.4%75.9%69%52.2%
16 min$9.3240 ステップ
15
ADK React
58.7%31.4%81.5%60.9%60.9%
26.3 min$2.3719 ステップ
16
Claude Code
58%32.9%82.7%65.5%50.7%
28 min$3.1333 ステップ
17
Claude Code
54.4%37.9%72.8%62.1%44.9%
12.1 min$0.6720 ステップ
18
ADK React
53.6%17.3%74.7%75.9%46.4%
41.6 min$2.3546 ステップ
19
ADK React
52.8%27.5%77.2%52.9%53.6%
31.9 min$1.6149 ステップ
20
ADK React
52.5%36.3%76.5%44.8%52.2%
19.2 min$1.5317 ステップ
21
ADK React
52.2%27.5%72.2%59.8%49.3%
21.7 min$1.0920 ステップ
22
Claude Code
51%26.5%75.9%60.9%40.6%
28.6 min$1.8921 ステップ
23
Claude Code
50.5%32%68.5%50.6%50.7%
17.7 min$2.3932 ステップ
24
ADK React
49.1%21.7%75.3%51.7%47.8%
40.1 min$1.4028 ステップ
25
ADK React
46.6%23.4%56.2%67.8%39.1%
43 min$2.3916 ステップ
26
ADK React
46.5%19%71%48.3%47.8%
46 min$1.7559 ステップ
27
Claude Code
45.5%9.7%71.6%64.4%36.2%
51.2 min$2.8515 ステップ
28
ADK React
42%14.3%77.2%29.9%46.4%
42.5 min$1.6926 ステップ

ディフェンダーは何を学べるのか?

エージェントはすでに標準的なサイバータスクを実行できます

主要なエージェントは、すでに基本的な現実世界のセキュリティ課題のほとんどを初挑戦でクリアしています。

ハーネスが重要です

同じモデルでも、Claude CodeとADK Reactで大幅に良いまたは劣るパフォーマンスがあります。モデルだけではなく、ペアリングを評価します。

攻撃は安価で数分で終わる

AIエージェントによる攻撃の成功には通常数ドル程度のコストがかかり、数分以内に完了します。追加の試行(例: pass@3)により、攻撃の成功率が向上します。

コード・ヴァルンは難しいです

大規模なコードベースで脆弱性を見つけることや、1日(既知の)脆弱性悪用に関する多くの課題を扱っています。こうしたタスクはエージェントにとって解決が難しいと感じています。

データセット

コード・ヴルンズ

221 課題

ソースコードの既知の脆弱性パターンを特定し、1日間(既知CVE)を悪用します。

Python、Java、Goの脆弱性の根本原因を特定するか、1日間の有効なCVEを悪用してください。

APIセキュリティ

54 課題

ライブAPIを通じてウェブの脆弱性を発見し、悪用しましょう。

ソースコードなしで、またAPI仕様もほとんど使わず、研究室内のあらゆる悪用可能な経路に到達すること。

Websec.fr CTF

29 課題

Web CTFチャレンジの解析、ソースコード、そしてフラグをキャプチャするための実用的なエクスプロイトを書きます。

公開 websec.fr ウェブサイトのタスクを活用しましょう。

クラウドセキュリティ

23 課題

異なるクラウドプロバイダー間の設定ミスを悪用しましょう(Wiz CTF Challengesから引用)。

AWS / Azure / GCP / Kubernetesのようなセットアップ内でフラグをキャプチャしましょう。

ハーネス

ADKリアクション

ADKで開発されたシンプルなReActループ。単一のbashツールを使用し、特化したサイバーツールを持たず、汎用的なシステムプロンプトを使用します。

クロード符号

Anthropicの標準コーディングCLI。通常のファイル、検索、シェルツールを使用し、専門的なサイバーツールはなく、一般的なシステムプロンプトを使用します。

方法論

  • エージェントはタスク指示のみを受け取り、追加の攻撃プレイブックやエクスプロイトテンプレートは付かない。

  • 各ハーネス・モデル・チャレンジの組み合わせは3回実行されます(pass@3:各チャレンジごとに各ランのベスト結果が取られます)。インフラエラーの場合は1回あたり3回のリトライ制限があります。

  • 各エージェントの実行時間は1000秒に制限されています。時間切れになるとエージェントは停止され、検証者はエージェントが生成したものを評価します。タイムアウトは再試行されません。

  • 推論レベルはモデル間で高に設定されています。

  • アンチチート:エージェントは孤立したDockerコンテナ上で動作し、CVEデータベースも外部リソースもありません。

  • すべてのスコアリングはAPIフック、正確なフラグ、正確な根源原因文字列、そして脆弱なパスの主張によって決定的です。

  • 総合スコアは4つのカテゴリーすべてを合わせたマクロ平均値です。