Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

الخلاصاتاتصالالخصوصية© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
benign-instruction-bench — إعادة تقييم كاشفات حقن الأوامر على مخرجات أدوات وكيل LLM (مسودة ورقة، نصوص برمجية، نتائج) | Kitploit
أدوات/GitHubGitHub/lzwhehe/benign-instruction-bench
أدوات دفاعيةتحليل الثغرات الأمنيةتعلم الآلةالأوراق والأبحاثالتعلم والتعليمأمن الذكاء الاصطناعي
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

إعادة تقييم كاشفات حقن الأوامر على مخرجات أدوات وكيل LLM (مسودة ورقة، نصوص برمجية، نتائج)

عرض المستودع
3منذ 3 أياملم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

اجتياز الاختبار الذي تدربت عليه

إعادة تقييم كواشف حقن الأوامر في المواضع التي يستخدمها فيها وكلاء LLM فعليًا: على مخرجات الأدوات التي يقرأها الوكيل.

تختار الفرق كواشف الحقن بناءً على درجاتها في المعايير المرجعية. نتحقق مما إذا كانت هذه الدرجات تتنبأ بالسلوك داخل الوكيل، ونجد أنها تقيس في الغالب مدى قرب المعيار المرجعي من بيانات تدريب الكاشف.

النتائج

خمسة عشر كاشفًا (تسعة مفتوحة، وستة مقيّدة بترخيص بما في ذلك Prompt Guard 2 من Meta) وحكمان من نماذج LLM مدركان بالمهمة، على معيارين مرجعيين للوكلاء (AgentDojo، tau-bench) وعلى BIPIA. تأتي مخرجات الأدوات الحميدة من إعادة تشغيل استدعاءات الأدوات المرجعية لكل معيار دون LLM. الكشف هو TPR عند العتبة التي تعطي 1% FPR.

الكاشفتاريخ الإصدارFPR على مخرجات الأدوات الحميدة (AgentDojo / tau-bench)الكشف AgentDojoالكشف tau-benchالكشف BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(جميع الكواشف الخمسة عشر وكلا الحكمين: paper/tab_many.tex.)

  1. تنتقل تصنيفات الكشف بشكل ضعيف بين المعايير المرجعية (Kendall τ على 15 كاشفًا): 0.01 لـ BIPIA مقابل AgentDojo، و0.28 لـ AgentDojo مقابل tau-bench، و0.31 لـ BIPIA مقابل tau-bench؛ ولا شيء منها ذو دلالة إحصائية. متصدر BIPIA (PIGuard) يحتل المرتبة 13 من 15 على AgentDojo؛ وPrismor يهبط من 72% على AgentDojo إلى 15% على tau-bench.
  2. تتراوح معدلات الإيجابيات الكاذبة على مخرجات الأدوات الحميدة من 0% إلى أكثر من 90%، وهي متسقة عبر معياري الوكيل (τ = 0.67، p = 0.001)، ولا تتنبأ بها الإيجابيات الكاذبة على النص العادي.
  3. شكل مدخلات التدريب، وليس التداخل في سلاسل الهجوم، هو ما يفسر النتائج. تدرب PIGuard على 1,116 مدخلًا كاملًا من BIPIA ويتصدر BIPIA. كما رأى 53 من أصل 62 هجومًا من InjecAgent، لكن فقط كأوامر قصيرة؛ وداخل مخرجات أدوات tau-bench يكتشف هجمات InjecAgent المرئية وغير المرئية على حد سواء (52.1% مقابل 55.8%). لا يشارك Horizon-Labs أي بيانات مع أي معيار مرجعي، وتدرب على مدخلات بأسلوب الوكيل، ويتصدر كلا معياري الوكيل.
  4. تصل أحكام النماذج المدركة بالمهمة بحجم 7–8B (أحدها تدرب قبل وجود AgentDojo) إلى 54–78% عند 1% FPR على مخرجات أدوات الوكيل، وهو أقل من أفضل الكواشف المخصصة. خارج توزيع تدريبه، يفوت كل نهج فئات كاملة من الحقن؛ وباستثناء PIGuard، لا يلتقط أي نهج أكثر من 39% من الحقن غير المتعلق بالمهمة.
  5. إزالة ترميز التسلسل أو الإعلان عن نوع المدخل يخفض الإيجابيات الكاذبة عند العتبة الافتراضية بما يصل إلى نحو عشرين ضعفًا لكنه لا يصلح الكشف عند FPR المنخفض.

تُعاد جميع الأرقام توليدها من ملفات الدرجات بواسطة analysis/compute_all.py؛ ولا تقرأها الورقة إلا عبر paper/numbers.tex.

البنية

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

إعادة الإنتاج

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

لإعادة توليد الأرقام والرسوم فقط من الدرجات المنشورة، انسخ results/*.json إلى دليل العمل، وأعد بناء مجموعات .jsonl (الخطوات 1–3 من reproduce.sh، على CPU فقط)، ثم شغّل python analysis/compute_all.py && python analysis/make_macros.py.

تُعاد بيانات التقييم بناؤها من المصادر العامة، ولا يُعاد توزيعها: AgentDojo v1.2، tau-bench (MIT)، هجمات InjecAgent (MIT)، BIPIA (MIT)، ملفات README على GitHub (h1alexbel/github-readmes)، AESLC، FineWeb-Edu. تفترض بعض السكربتات أن BIPIA وPIGuard مستنسخان تحت ~/agentsec/.

بناء الورقة

paper/usenix-2020-09-xetex.sty هو نسخة بناء من نمط USENIX تُصرَّف باستخدام tectonic/XeTeX. للتقديم، بدّل main.tex إلى usenix-2020-09.sty الرسمي وصرّفه باستخدام pdflatex.

الحالة

مسودة. لم تُقيَّم بعد مقابل الهجمات التكيفية؛ كلا معياري الوكيل محاكاة ونقطة الحقن في tau-bench هي نقطتنا؛ وكواشف واجهات API التجارية غير مشمولة. انظر §6 من الورقة.

الترخيص

الكود وسكربتات التحليل وملفات الدرجات: MIT (انظر LICENSE). تحتفظ ملفات الأطراف الثالثة بشروطها الخاصة: نمط LaTeX الخاص بـ USENIX (paper/usenix-2020-09*.sty) والمعايير المرجعية والكواشف التي تنزّلها السكربتات (AgentDojo، tau-bench، InjecAgent، BIPIA، وترخيص نموذج كل كاشف).

تنزيل الأداة