Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

फ़ीडसंपर्कगोपनीयता© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
benign-instruction-bench — LLM एजेंट टूल आउटपुट पर प्रॉम्प्ट-इंजेक्शन डिटेक्टरों का पुनर्मूल्यांकन (पेपर ड्राफ्ट, स्क्रिप्ट, स्कोर) | Kitploit
उपकरण/GitHubGitHub/lzwhehe/benign-instruction-bench
रक्षात्मक उपकरणभेद्यता विश्लेषणमशीन लर्निंगपेपर और शोधलर्निंग और शिक्षाAI सुरक्षा
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

LLM एजेंट टूल आउटपुट पर प्रॉम्प्ट-इंजेक्शन डिटेक्टरों का पुनर्मूल्यांकन (पेपर ड्राफ्ट, स्क्रिप्ट, स्कोर)

रिपॉजिटरी देखें
33 दिन पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

जिस परीक्षा पर आपने प्रशिक्षण लिया है, उसे पास करना

प्रॉम्प्ट-इंजेक्शन डिटेक्टरों का पुनर्मूल्यांकन वहाँ करना जहाँ LLM एजेंट वास्तव में उनका उपयोग करते हैं: उन टूल आउटपुट पर जिन्हें एक एजेंट पढ़ता है।

टीमें इंजेक्शन डिटेक्टरों को उनके बेंचमार्क स्कोर के आधार पर चुनती हैं। हम जाँचते हैं कि क्या वे स्कोर एक एजेंट के भीतर व्यवहार की भविष्यवाणी करते हैं, और पाते हैं कि वे अधिकतर यह मापते हैं कि बेंचमार्क डिटेक्टर के प्रशिक्षण डेटा के कितना करीब है।

निष्कर्ष

पंद्रह डिटेक्टर (नौ ओपन, छह लाइसेंस-गेटेड जिनमें Meta का Prompt Guard 2 भी शामिल है) और दो टास्क-अवेयर LLM जज, दो एजेंट बेंचमार्क (AgentDojo, tau-bench) और BIPIA पर। बिनाइन टूल आउटपुट प्रत्येक बेंचमार्क के ग्राउंड-ट्रुथ टूल कॉल को बिना किसी LLM के रीप्ले करके प्राप्त किए जाते हैं। डिटेक्शन उस थ्रेशोल्ड पर TPR है जो 1% FPR देता है।

डिटेक्टररिलीज़बिनाइन टूल आउटपुट पर FPR (AgentDojo / tau-bench)डिटेक्शन AgentDojoडिटेक्शन tau-benchडिटेक्शन BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(सभी 15 डिटेक्टर और दोनों जज: paper/tab_many.tex।)

  1. डिटेक्शन रैंकिंग बेंचमार्कों के बीच खराब तरीके से स्थानांतरित होती हैं (15 डिटेक्टरों पर Kendall τ): BIPIA बनाम AgentDojo के लिए 0.01, AgentDojo बनाम tau-bench के लिए 0.28, BIPIA बनाम tau-bench के लिए 0.31; कोई भी महत्वपूर्ण नहीं। BIPIA का लीडर (PIGuard) AgentDojo पर 15 में से 13वें स्थान पर है; Prismor AgentDojo पर 72% से tau-bench पर 15% पर गिर जाता है।
  2. बिनाइन टूल आउटपुट पर फ़ॉल्स-पॉज़िटिव दरें 0% से लेकर 90% से अधिक तक होती हैं, दोनों एजेंट बेंचमार्कों में सुसंगत हैं (τ = 0.67, p = 0.001), और सामान्य टेक्स्ट पर फ़ॉल्स पॉज़िटिव द्वारा इनकी भविष्यवाणी नहीं की जाती।
  3. परिणामों को प्रशिक्षण इनपुट का रूप समझाता है, न कि अटैक स्ट्रिंग्स में ओवरलैप। PIGuard को 1,116 पूर्ण BIPIA इनपुट पर प्रशिक्षित किया गया था और वह BIPIA में अग्रणी है। इसने InjecAgent के 62 हमलों में से 53 भी देखे, लेकिन केवल छोटे प्रॉम्प्ट के रूप में; tau-bench टूल आउटपुट के भीतर यह देखे गए और अनदेखे InjecAgent हमलों को समान रूप से डिटेक्ट करता है (52.1% बनाम 55.8%)। Horizon-Labs किसी भी बेंचमार्क के साथ कोई डेटा साझा नहीं करता, एजेंट-शैली इनपुट पर प्रशिक्षित है, और दोनों एजेंट बेंचमार्कों में अग्रणी है।
  4. टास्क-अवेयर 7–8B जज (एक को AgentDojo के अस्तित्व में आने से पहले प्रशिक्षित किया गया था) एजेंट टूल आउटपुट पर 1% FPR पर 54–78% तक पहुँचते हैं, जो सर्वश्रेष्ठ समर्पित डिटेक्टरों से नीचे है। अपने प्रशिक्षण वितरण के बाहर प्रत्येक दृष्टिकोण इंजेक्शनों की पूरी श्रेणियों को चूक जाता है; PIGuard के अलावा, कोई भी दृष्टिकोण टास्क-अप्रासंगिक इंजेक्शनों का 39% से अधिक नहीं पकड़ता।
  5. सीरियलाइज़ेशन मार्कअप हटाने या इनपुट प्रकार घोषित करने से डिफ़ॉल्ट-थ्रेशोल्ड फ़ॉल्स पॉज़िटिव लगभग बीस गुना तक कम हो जाते हैं, लेकिन कम-FPR डिटेक्शन ठीक नहीं होता।

सभी संख्याएँ स्कोर फ़ाइलों से analysis/compute_all.py द्वारा पुनर्जनित की जाती हैं; पेपर उन्हें केवल paper/numbers.tex के माध्यम से पढ़ता है।

लेआउट

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

पुनरुत्पादन

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

केवल जारी किए गए स्कोर से संख्याओं और आंकड़ों को पुनर्जनित करने के लिए, results/*.json को कार्यशील निर्देशिका में कॉपी करें, .jsonl सेट पुनर्निर्मित करें (reproduce.sh के चरण 1–3, केवल CPU), फिर python analysis/compute_all.py && python analysis/make_macros.py चलाएँ।

मूल्यांकन डेटा सार्वजनिक स्रोतों से पुनर्निर्मित किया जाता है, पुनर्वितरित नहीं: AgentDojo v1.2, tau-bench (MIT), InjecAgent attacks (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu। कुछ स्क्रिप्ट मानती हैं कि BIPIA और PIGuard को ~/agentsec/ के अंतर्गत क्लोन किया गया है।

पेपर का निर्माण

paper/usenix-2020-09-xetex.sty USENIX शैली की एक बिल्ड कॉपी है जो tectonic/XeTeX के साथ कंपाइल होती है। सबमिशन के लिए, main.tex को आधिकारिक usenix-2020-09.sty पर स्विच करें और pdflatex से कंपाइल करें।

स्थिति

ड्राफ़्ट। अभी तक अनुकूली हमलों के विरुद्ध मूल्यांकन नहीं किया गया; दोनों एजेंट बेंचमार्क सिमुलेशन हैं और tau-bench का इंजेक्शन पॉइंट हमारा है; व्यावसायिक API डिटेक्टर शामिल नहीं हैं। पेपर का §6 देखें।

लाइसेंस

कोड, विश्लेषण स्क्रिप्ट, और स्कोर फ़ाइलें: MIT (LICENSE देखें)। तृतीय-पक्ष फ़ाइलें अपनी स्वयं की शर्तें रखती हैं: USENIX LaTeX शैली (paper/usenix-2020-09*.sty) और बेंचमार्क तथा डिटेक्टर जिन्हें स्क्रिप्ट डाउनलोड करती हैं (AgentDojo, tau-bench, InjecAgent, BIPIA, और प्रत्येक डिटेक्टर का मॉडल लाइसेंस)।

टूल डाउनलोड करें