私たちは、複数の実世界のサイバーセキュリティタスクにおいて、基盤モデルと標準的なハーネスを用いたAIエージェントを評価しています。
k回の独立的な試みに対するコスト、時間、または1回の解決に対する成功率。
各パーセンテージは合格です@1 そのカテゴリーで。
主要なエージェントは、すでに基本的な現実世界のセキュリティ課題のほとんどを初挑戦でクリアしています。
同じモデルでも、Claude CodeとADK Reactで大幅に良いまたは劣るパフォーマンスがあります。モデルだけではなく、ペアリングを評価します。
AIエージェントによる攻撃の成功には通常数ドル程度のコストがかかり、数分以内に完了します。追加の試行(例: pass@3)により、攻撃の成功率が向上します。
大規模なコードベースで脆弱性を見つけることや、1日(既知の)脆弱性悪用に関する多くの課題を扱っています。こうしたタスクはエージェントにとって解決が難しいと感じています。
コード・ヴルンズ
221 課題
ソースコードの既知の脆弱性パターンを特定し、1日間(既知CVE)を悪用します。
Python、Java、Goの脆弱性の根本原因を特定するか、1日間の有効なCVEを悪用してください。
APIセキュリティ
54 課題
ライブAPIを通じてウェブの脆弱性を発見し、悪用しましょう。
ソースコードなしで、またAPI仕様もほとんど使わず、研究室内のあらゆる悪用可能な経路に到達すること。
Websec.fr CTF
29 課題
Web CTFチャレンジの解析、ソースコード、そしてフラグをキャプチャするための実用的なエクスプロイトを書きます。
公開 websec.fr ウェブサイトのタスクを活用しましょう。
クラウドセキュリティ
23 課題
異なるクラウドプロバイダー間の設定ミスを悪用しましょう(Wiz CTF Challengesから引用)。
AWS / Azure / GCP / Kubernetesのようなセットアップ内でフラグをキャプチャしましょう。
ADKリアクション
ADKで開発されたシンプルなReActループ。単一のbashツールを使用し、特化したサイバーツールを持たず、汎用的なシステムプロンプトを使用します。
クロード符号
Anthropicの標準コーディングCLI。通常のファイル、検索、シェルツールを使用し、専門的なサイバーツールはなく、一般的なシステムプロンプトを使用します。
エージェントはタスク指示のみを受け取り、追加の攻撃プレイブックやエクスプロイトテンプレートは付かない。
各ハーネス・モデル・チャレンジの組み合わせは3回実行されます(pass@3:各チャレンジごとに各ランのベスト結果が取られます)。インフラエラーの場合は1回あたり3回のリトライ制限があります。
各エージェントの実行時間は1000秒に制限されています。時間切れになるとエージェントは停止され、検証者はエージェントが生成したものを評価します。タイムアウトは再試行されません。
推論レベルはモデル間で高に設定されています。
アンチチート:エージェントは孤立したDockerコンテナ上で動作し、CVEデータベースも外部リソースもありません。
すべてのスコアリングはAPIフック、正確なフラグ、正確な根源原因文字列、そして脆弱なパスの主張によって決定的です。
総合スコアは4つのカテゴリーすべてを合わせたマクロ平均値です。