
टूल-उपयोग करने वाले LLM एजेंट्स में embedding retrieval और contrastive log-probability scoring का उपयोग करके अप्रत्यक्ष prompt injection का पता लगाने और उसे छिपाने वाली प्री-एक्ज़िक्यूशन एक्शन-ऑडिटिंग रक्षा।
ActGuard टूल-उपयोग करने वाले LLM एजेंट्स में अप्रत्यक्ष प्रॉम्प्ट इंजेक्शन के विरुद्ध एक प्री-एक्ज़ीक्यूशन एक्शन-ऑडिटिंग रक्षा है। इस रिपॉज़िटरी में अंतिम ActGuard कार्यान्वयन और इसके मूल्यांकन के लिए आवश्यक AgentDojo-आधारित रनटाइम शामिल है।
रिलीज़ में केवल अंतिम, पूर्ण ActGuard कॉन्फ़िगरेशन शामिल है। आंतरिक घटक अभी भी AgentDojo बेंचमार्क और ट्रेस प्रारूपों के साथ संगतता के लिए reflective_audit पहचानकर्ता का उपयोग करते हैं।
meta-llama/Meta-Llama-3.1-8B-Instruct चेकपॉइंट तक पहुँच, या एक समकक्ष स्थानीय चेकपॉइंटuv का उपयोग करने की अनुशंसा की जाती है:
uv sync --frozen --extra actguard
वैकल्पिक रूप से, एक सक्रिय Python वातावरण में इंस्टॉल करें:
python -m pip install -e '.[actguard]'
रिपॉज़िटरी रूट से:
export OPENROUTER_API_KEY=...
uv run --frozen --extra actguard ./scripts/run_actguard.sh
यदि प्रोजेक्ट pip के साथ इंस्टॉल किया गया था, तो चलाएँ:
export OPENROUTER_API_KEY=...
./scripts/run_actguard.sh
स्क्रिप्ट important_instructions हमले के साथ workspace सूट का मूल्यांकन करती है। यह मुख्य एजेंट और सत्यापनकर्ता के लिए OpenRouter का उपयोग करती है, और एम्बेडिंग रिट्रीवल तथा कॉन्ट्रास्टिव लॉग-प्रोबेबिलिटी एट्रिब्यूशन के लिए Hugging Face-संगत स्थानीय मॉडल का उपयोग करती है। डिफ़ॉल्ट गेटेड Llama चेकपॉइंट डाउनलोड किए जाने से पहले Hugging Face प्रमाणीकरण की आवश्यकता हो सकती है।
डाउनलोड किए गए चेकपॉइंट का उपयोग करने के लिए, scripts/run_actguard.sh में --reflective-audit-embedding-model और --reflective-audit-logprob-model के मानों को उनके स्थानीय पथों से बदलें। सभी बेंचमार्क विकल्प देखने के लिए uv run --frozen actguard-benchmark --help का उपयोग करें।
परिणाम नीचे लिखे जाते हैं:
runs/openai_gpt-4o-mini-2024-07-18-reflective_audit/actguard/
runs/ निर्देशिका को Git द्वारा अनदेखा किया जाता है।
ActGuard रिग्रेशन परीक्षण चलाएँ:
uv run --frozen pytest -q tests/test_agent_pipeline/test_reflective_audit.py
src/agentdojo/agent_pipeline/reflective_audit.py: ActGuard कार्यान्वयनsrc/agentdojo/agent_pipeline/agent_pipeline.py: पाइपलाइन एकीकरणsrc/agentdojo/scripts/benchmark.py: बेंचमार्क CLIsrc/agentdojo/default_suites/: मूल्यांकन सूट और कार्य परिभाषाएँtests/test_agent_pipeline/test_reflective_audit.py: रिग्रेशन परीक्षणsrc/agentdojo/reflective_audit_trace.py: ट्रेस जनरेशन और निरीक्षणरन लॉग, स्थानीय वातावरण, क्रेडेंशियल, पेपर ड्राफ्ट, अस्थायी विश्लेषण आउटपुट, और तुलना रक्षाएँ जानबूझकर इस रिलीज़ से बाहर रखी गई हैं।
यह प्रोजेक्ट MIT लाइसेंस के अंतर्गत वितरित किया गया है। इसमें एक AgentDojo-व्युत्पन्न बेंचमार्क रनटाइम शामिल है; बनाए रखी गई अपस्ट्रीम कॉपीराइट सूचना के लिए LICENSE देखें।
| पैरामीटर | सेटिंग |
|---|
| बैकएंड मॉडल | openai/gpt-4o-mini-2024-07-18 via OpenRouter |
| बैकएंड मॉडल तापमान | 0 |
| चंक लंबाई | 80--180 अक्षर |
| एम्बेडिंग मॉडल | sentence-transformers/all-MiniLM-L6-v2 |
| प्राप्त चंक | k = 3 |
| कॉन्ट्रास्टिव लॉग-प्रोबेबिलिटी मॉडल | meta-llama/Meta-Llama-3.1-8B-Instruct |
| लॉग-प्रोबेबिलिटी थ्रेशोल्ड | 0 |
| समान-चंक समूहन थ्रेशोल्ड | 0.9 |
| टूल-परिणाम संदर्भ | पूर्ण ऑडिटेबल इतिहास |
| सत्यापनकर्ता मॉडल | openai/gpt-5-mini via OpenRouter |
| सत्यापनकर्ता तापमान | 0 |
| अनुमानित अगला-टूल सेट आकार | 1--3 |
| पड़ोसी-चंक विस्तार | प्रत्येक ओर 1 चंक |
| प्रति क्रिया अधिकतम मरम्मत प्रयास | 2 |
| स्थानीय मास्किंग टेक्स्ट | [Removed suspicious instruction from external tool result.] |