
إعادة تقييم كاشفات حقن الأوامر على مخرجات أدوات وكيل LLM (مسودة ورقة، نصوص برمجية، نتائج)
إعادة تقييم كواشف حقن الأوامر في المواضع التي يستخدمها فيها وكلاء LLM فعليًا: على مخرجات الأدوات التي يقرأها الوكيل.
تختار الفرق كواشف الحقن بناءً على درجاتها في المعايير المرجعية. نتحقق مما إذا كانت هذه الدرجات تتنبأ بالسلوك داخل الوكيل، ونجد أنها تقيس في الغالب مدى قرب المعيار المرجعي من بيانات تدريب الكاشف.
خمسة عشر كاشفًا (تسعة مفتوحة، وستة مقيّدة بترخيص بما في ذلك Prompt Guard 2 من Meta) وحكمان من نماذج LLM مدركان بالمهمة، على معيارين مرجعيين للوكلاء (AgentDojo، tau-bench) وعلى BIPIA. تأتي مخرجات الأدوات الحميدة من إعادة تشغيل استدعاءات الأدوات المرجعية لكل معيار دون LLM. الكشف هو TPR عند العتبة التي تعطي 1% FPR.
| الكاشف | تاريخ الإصدار | FPR على مخرجات الأدوات الحميدة (AgentDojo / tau-bench) | الكشف AgentDojo | الكشف tau-bench | الكشف BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(جميع الكواشف الخمسة عشر وكلا الحكمين: paper/tab_many.tex.)
تُعاد جميع الأرقام توليدها من ملفات الدرجات بواسطة analysis/compute_all.py؛ ولا تقرأها الورقة إلا عبر paper/numbers.tex.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
لإعادة توليد الأرقام والرسوم فقط من الدرجات المنشورة، انسخ results/*.json إلى دليل العمل، وأعد بناء مجموعات .jsonl (الخطوات 1–3 من reproduce.sh، على CPU فقط)، ثم شغّل python analysis/compute_all.py && python analysis/make_macros.py.
تُعاد بيانات التقييم بناؤها من المصادر العامة، ولا يُعاد توزيعها: AgentDojo v1.2، tau-bench (MIT)، هجمات InjecAgent (MIT)، BIPIA (MIT)، ملفات README على GitHub (h1alexbel/github-readmes)، AESLC، FineWeb-Edu. تفترض بعض السكربتات أن BIPIA وPIGuard مستنسخان تحت ~/agentsec/.
paper/usenix-2020-09-xetex.sty هو نسخة بناء من نمط USENIX تُصرَّف باستخدام tectonic/XeTeX. للتقديم، بدّل main.tex إلى usenix-2020-09.sty الرسمي وصرّفه باستخدام pdflatex.
مسودة. لم تُقيَّم بعد مقابل الهجمات التكيفية؛ كلا معياري الوكيل محاكاة ونقطة الحقن في tau-bench هي نقطتنا؛ وكواشف واجهات API التجارية غير مشمولة. انظر §6 من الورقة.
الكود وسكربتات التحليل وملفات الدرجات: MIT (انظر LICENSE). تحتفظ ملفات الأطراف الثالثة بشروطها الخاصة: نمط LaTeX الخاص بـ USENIX (paper/usenix-2020-09*.sty) والمعايير المرجعية والكواشف التي تنزّلها السكربتات (AgentDojo، tau-bench، InjecAgent، BIPIA، وترخيص نموذج كل كاشف).