AIエージェントの出口テストと検証のための専門的なベンチマーク
agent-egress-benchは、LuckyPipewrenchによって作成されたオープンソースのベンチマークおよび攻撃コーパスであり、自律エージェントのアウトバウンドコントロールを検証するためのものです。これは、ファイアウォール、プロキシ、またはMCPラッパーが情報漏洩、プロンプトインジェクション、およびツールベースの攻撃をどれだけうまくブロックできるかを測定するために、構造化されたテストスイートを実行します。主要な要素には、250以上のテストケースコーパス、ツールに依存しないランナー、および自動スコアリングアプローチが含まれます。ターゲットユーザーは、証拠に基づくアウトバウンド保証を求めるAIセキュリティ研究者、ファイアウォール開発者、および企業セキュリティアーキテクトです。
実際にどのようなタスクに使用できますか?
ベンチマークは明確な仕事を定義しています:自律エージェントの出口保護を測定することです。このプロジェクトは、大規模な攻撃コーパスをランナーと組み合わせて、複数のカテゴリにわたってアダプタを運用し、DLP回避、プロンプトインジェクション、SSRF、シェル難読化、ツールポイズニングやスキーマインジェクションなどのMCP特有のベクトルを明示的にカバーしています。ユーザーは、ベンチマークを使用して、エージェントのアウトバウンドポリシーが実際の敵対的パターンにどのように反応するかを反映した再現可能な攻撃実行とパフォーマンスデータを生成できます。
精度はどのように報告され、限界はどこにありますか?
プロジェクトには、攻撃ブロック率と誤検知率の両方を報告する自動スコアリング方法論が含まれており、意思決定のための定量的な指標を提供します。ランナーは各ケースの決定を記録するため、チームはどの入力が検出を引き起こしたかを調査できます。精度は、テストされたアダプタの統合品質に依存します;ベンチマーク自体は結果を報告しますが、製品の内部検出ロジックを変更することはないため、結果はセキュリティチームによる解釈を必要とします。
どのような入力、プロトコル、環境が必要ですか?
ランナーはGoで書かれており、Linux上で実行するように設計されており、コーパスはMCP、HTTP、およびWebSocketトラフィックを運用します。互換性は、能力プロファイルまたはアダプタを通じて達成されるため、アダプタインターフェースを提供する任意のセキュリティツールをテストできます。コードベースとデータはApache-2.0ライセンスであり、組織のテスト環境内での検査とローカル展開を許可します。
典型的なセキュリティワークフローに実用的ですか?
ベンチマークは、技術的に熟練したチームを対象としています:AIセキュリティ研究者、AIファイアウォールやプロキシの開発者、企業アーキテクトなど、明示されたターゲットオーディエンスに合致しています。そのツール中立的な設計とアダプタモデルにより、セキュリティチームはベンダーロックインなしで複数の製品を評価できます。実用的な限界には、フルスタック脆弱性スキャンではなく、厳密にアウトバウンドエージェントの動作に焦点を当てること、そしてチームがランナーを既存のCIまたは監査ワークフローに統合することが期待されることが含まれます。
専門のセキュリティチームのための実用的で証拠に基づいたツール
ベンチマークは、検証可能な出口テストが必要で、監査ワークフローにコマンドラインランナーを組み込む準備ができているチームにとって実用的な選択肢です。その証拠指向は、規律あるセキュリティ保証をサポートし、GUIファーストまたは一般的なネットワークスキャナーを求める組織は、より急な統合努力を期待する必要があります。自律エージェントのアウトバウンドリスクに焦点を当てたグループにとって、これは運用テストの厳格さを信頼性高く引き上げます。





