
ActGuardは、ツールを使用するLLMエージェントにおける間接的プロンプトインジェクションに対する実行前アクション監査防御です。このリポジトリには、最終的なActGuard実装と、それを評価するために必要なAgentDojoベースのランタイムが含まれています。
このリリースには、最終的な完全なActGuard構成のみが含まれています。内部コンポーネントは、AgentDojoベンチマークおよびトレース形式との互換性のために、引き続き識別子reflective_auditを使用しています。
meta-llama/Meta-Llama-3.1-8B-Instructチェックポイント、または同等のローカルチェックポイントへのアクセスuvの使用を推奨します:
uv sync --frozen --extra actguard
または、アクティブ化されたPython環境にインストールします:
python -m pip install -e '.[actguard]'
リポジトリのルートから:
export OPENROUTER_API_KEY=...
uv run --frozen --extra actguard ./scripts/run_actguard.sh
プロジェクトをpipでインストールした場合は、次を実行します:
export OPENROUTER_API_KEY=...
./scripts/run_actguard.sh
このスクリプトは、important_instructions攻撃を使用してworkspaceスイートを評価します。メインエージェントと検証器にはOpenRouterを使用し、埋め込み検索と対比的対数確率帰属にはHugging Face互換のローカルモデルを使用します。デフォルトのゲート付きLlamaチェックポイントをダウンロードする前に、Hugging Face認証が必要になる場合があります。
ダウンロード済みのチェックポイントを使用するには、scripts/run_actguard.sh内の--reflective-audit-embedding-modelと--reflective-audit-logprob-modelの値をローカルパスに置き換えてください。すべてのベンチマークオプションを表示するには、uv run --frozen actguard-benchmark --helpを使用します。
結果は以下に書き込まれます:
runs/openai_gpt-4o-mini-2024-07-18-reflective_audit/actguard/
runs/ディレクトリはGitによって無視されます。
ActGuard回帰テストを実行します:
uv run --frozen pytest -q tests/test_agent_pipeline/test_reflective_audit.py
src/agentdojo/agent_pipeline/reflective_audit.py: ActGuard実装src/agentdojo/agent_pipeline/agent_pipeline.py: パイプライン統合src/agentdojo/scripts/benchmark.py: ベンチマークCLIsrc/agentdojo/default_suites/: 評価スイートとタスク定義tests/test_agent_pipeline/test_reflective_audit.py: 回帰テストsrc/agentdojo/reflective_audit_trace.py: トレース生成と検査実行ログ、ローカル環境、認証情報、論文草稿、一時的な分析出力、および比較防御は、このリリースから意図的に除外されています。
このプロジェクトはMITライセンスの下で配布されています。AgentDojo由来のベンチマークランタイムが含まれています。保持されている上流の著作権表示についてはLICENSEを参照してください。
| パラメータ | 設定 |
|---|
| バックエンドモデル | OpenRouter経由のopenai/gpt-4o-mini-2024-07-18 |
| バックエンドモデル温度 | 0 |
| チャンク長 | 80~180文字 |
| 埋め込みモデル | sentence-transformers/all-MiniLM-L6-v2 |
| 取得チャンク数 | k = 3 |
| 対比的対数確率モデル | meta-llama/Meta-Llama-3.1-8B-Instruct |
| 対数確率しきい値 | 0 |
| 類似チャンクグループ化しきい値 | 0.9 |
| ツール結果コンテキスト | 完全な監査可能履歴 |
| 検証器モデル | OpenRouter経由のopenai/gpt-5-mini |
| 検証器温度 | 0 |
| 予測次ツールセットサイズ | 1~3 |
| 隣接チャンク拡張 | 両側1チャンク |
| アクションあたりの最大修復試行回数 | 2 |
| ローカルマスキングテキスト | [Removed suspicious instruction from external tool result.] |