
LLM एजेंट टूल आउटपुट पर प्रॉम्प्ट-इंजेक्शन डिटेक्टरों का पुनर्मूल्यांकन (पेपर ड्राफ्ट, स्क्रिप्ट, स्कोर)
प्रॉम्प्ट-इंजेक्शन डिटेक्टरों का पुनर्मूल्यांकन वहाँ करना जहाँ LLM एजेंट वास्तव में उनका उपयोग करते हैं: उन टूल आउटपुट पर जिन्हें एक एजेंट पढ़ता है।
टीमें इंजेक्शन डिटेक्टरों को उनके बेंचमार्क स्कोर के आधार पर चुनती हैं। हम जाँचते हैं कि क्या वे स्कोर एक एजेंट के भीतर व्यवहार की भविष्यवाणी करते हैं, और पाते हैं कि वे अधिकतर यह मापते हैं कि बेंचमार्क डिटेक्टर के प्रशिक्षण डेटा के कितना करीब है।
पंद्रह डिटेक्टर (नौ ओपन, छह लाइसेंस-गेटेड जिनमें Meta का Prompt Guard 2 भी शामिल है) और दो टास्क-अवेयर LLM जज, दो एजेंट बेंचमार्क (AgentDojo, tau-bench) और BIPIA पर। बिनाइन टूल आउटपुट प्रत्येक बेंचमार्क के ग्राउंड-ट्रुथ टूल कॉल को बिना किसी LLM के रीप्ले करके प्राप्त किए जाते हैं। डिटेक्शन उस थ्रेशोल्ड पर TPR है जो 1% FPR देता है।
| डिटेक्टर | रिलीज़ | बिनाइन टूल आउटपुट पर FPR (AgentDojo / tau-bench) | डिटेक्शन AgentDojo | डिटेक्शन tau-bench | डिटेक्शन BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(सभी 15 डिटेक्टर और दोनों जज: paper/tab_many.tex।)
सभी संख्याएँ स्कोर फ़ाइलों से analysis/compute_all.py द्वारा पुनर्जनित की जाती हैं; पेपर उन्हें केवल paper/numbers.tex के माध्यम से पढ़ता है।
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
केवल जारी किए गए स्कोर से संख्याओं और आंकड़ों को पुनर्जनित करने के लिए, results/*.json को कार्यशील निर्देशिका में कॉपी करें, .jsonl सेट पुनर्निर्मित करें (reproduce.sh के चरण 1–3, केवल CPU), फिर python analysis/compute_all.py && python analysis/make_macros.py चलाएँ।
मूल्यांकन डेटा सार्वजनिक स्रोतों से पुनर्निर्मित किया जाता है, पुनर्वितरित नहीं: AgentDojo v1.2, tau-bench (MIT), InjecAgent attacks (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu। कुछ स्क्रिप्ट मानती हैं कि BIPIA और PIGuard को ~/agentsec/ के अंतर्गत क्लोन किया गया है।
paper/usenix-2020-09-xetex.sty USENIX शैली की एक बिल्ड कॉपी है जो tectonic/XeTeX के साथ कंपाइल होती है। सबमिशन के लिए, main.tex को आधिकारिक usenix-2020-09.sty पर स्विच करें और pdflatex से कंपाइल करें।
ड्राफ़्ट। अभी तक अनुकूली हमलों के विरुद्ध मूल्यांकन नहीं किया गया; दोनों एजेंट बेंचमार्क सिमुलेशन हैं और tau-bench का इंजेक्शन पॉइंट हमारा है; व्यावसायिक API डिटेक्टर शामिल नहीं हैं। पेपर का §6 देखें।
कोड, विश्लेषण स्क्रिप्ट, और स्कोर फ़ाइलें: MIT (LICENSE देखें)। तृतीय-पक्ष फ़ाइलें अपनी स्वयं की शर्तें रखती हैं: USENIX LaTeX शैली (paper/usenix-2020-09*.sty) और बेंचमार्क तथा डिटेक्टर जिन्हें स्क्रिप्ट डाउनलोड करती हैं (AgentDojo, tau-bench, InjecAgent, BIPIA, और प्रत्येक डिटेक्टर का मॉडल लाइसेंस)।