
Повторная оценка детекторов prompt-injection на выводах инструментов LLM-агентов (черновик статьи, скрипты, оценки)
Переоценка детекторов prompt-injection там, где LLM-агенты действительно их используют: на выводах инструментов, которые читает агент.
Команды выбирают детекторы инъекций по их оценкам в бенчмарках. Мы проверяем, предсказывают ли эти оценки поведение внутри агента, и обнаруживаем, что они в основном измеряют, насколько бенчмарк близок к обучающим данным детектора.
Пятнадцать детекторов (девять открытых, шесть с лицензионным ограничением, включая Meta's Prompt Guard 2) и два LLM-судьи, учитывающих задачу, на двух агентных бенчмарках (AgentDojo, tau-bench) и на BIPIA. Безвредные выводы инструментов получаются путём воспроизведения эталонных вызовов инструментов каждого бенчмарка без LLM. Детекция — это TPR при пороге, дающем 1% FPR.
| Детектор | Выпущен | FPR на безвредных выводах инструментов (AgentDojo / tau-bench) | Детекция AgentDojo | Детекция tau-bench | Детекция BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(Все 15 детекторов и оба судьи: paper/tab_many.tex.)
Все числа регенерируются из файлов оценок с помощью analysis/compute_all.py; статья читает их только через paper/numbers.tex.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
Чтобы регенерировать только числа и рисунки из выпущенных оценок, скопируйте results/*.json в рабочий каталог, пересоберите наборы .jsonl (шаги 1–3 из reproduce.sh, только CPU), затем выполните python analysis/compute_all.py && python analysis/make_macros.py.
Данные оценки пересобираются из публичных источников, а не распространяются: AgentDojo v1.2, tau-bench (MIT), атаки InjecAgent (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Некоторые скрипты предполагают, что BIPIA и PIGuard клонированы в ~/agentsec/.
paper/usenix-2020-09-xetex.sty — это сборочная копия стиля USENIX, которая компилируется с tectonic/XeTeX. Для подачи переключите main.tex на официальный usenix-2020-09.sty и компилируйте с pdflatex.
Черновик. Ещё не оценивался против адаптивных атак; оба агентных бенчмарка являются симуляциями, и точка инъекции в tau-bench — наша; коммерческие API-детекторы не включены. См. §6 статьи.
Код, скрипты анализа и файлы оценок: MIT (см. LICENSE). Сторонние файлы сохраняют свои собственные условия: стиль LaTeX USENIX (paper/usenix-2020-09*.sty) и бенчмарки и детекторы, которые скачивают скрипты (AgentDojo, tau-bench, InjecAgent, BIPIA и лицензия модели каждого детектора).