Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
benign-instruction-bench — Повторная оценка детекторов prompt-injection на выводах инструментов LLM-агентов (черновик статьи, скрипты, оценки) | Kitploit
Инструменты/GitHubGitHub/lzwhehe/benign-instruction-bench
Оборонительные ИнструментыАнализ уязвимостейМашинное ОбучениеСтатьи и ИсследованияОбучение и ОбразованиеБезопасность ИИ
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

Повторная оценка детекторов prompt-injection на выводах инструментов LLM-агентов (черновик статьи, скрипты, оценки)

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Репозиторий
33 дней назадЕщё не проверено
Поделиться

Прохождение теста, на котором вы обучались

Переоценка детекторов prompt-injection там, где LLM-агенты действительно их используют: на выводах инструментов, которые читает агент.

Команды выбирают детекторы инъекций по их оценкам в бенчмарках. Мы проверяем, предсказывают ли эти оценки поведение внутри агента, и обнаруживаем, что они в основном измеряют, насколько бенчмарк близок к обучающим данным детектора.

Результаты

Пятнадцать детекторов (девять открытых, шесть с лицензионным ограничением, включая Meta's Prompt Guard 2) и два LLM-судьи, учитывающих задачу, на двух агентных бенчмарках (AgentDojo, tau-bench) и на BIPIA. Безвредные выводы инструментов получаются путём воспроизведения эталонных вызовов инструментов каждого бенчмарка без LLM. Детекция — это TPR при пороге, дающем 1% FPR.

ДетекторВыпущенFPR на безвредных выводах инструментов (AgentDojo / tau-bench)Детекция AgentDojoДетекция tau-benchДетекция BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(Все 15 детекторов и оба судьи: paper/tab_many.tex.)

  1. Рейтинги детекции плохо переносятся между бенчмарками (Kendall τ по 15 детекторам): 0.01 для BIPIA против AgentDojo, 0.28 для AgentDojo против tau-bench, 0.31 для BIPIA против tau-bench; ни один не значим. Лидер BIPIA (PIGuard) занимает 13-е место из 15 на AgentDojo; Prismor падает с 72% на AgentDojo до 15% на tau-bench.
  2. Доли ложноположительных срабатываний на безвредных выводах инструментов варьируются от 0% до более чем 90%, согласованы между двумя агентными бенчмарками (τ = 0.67, p = 0.001) и не предсказываются ложноположительными срабатываниями на обычном тексте.
  3. Форма обучающих входных данных, а не пересечение строк атак, объясняет результаты. PIGuard обучался на 1 116 полных входных данных BIPIA и лидирует на BIPIA. Он также видел 53 из 62 атак InjecAgent, но только в виде коротких промптов; внутри выводов инструментов tau-bench он детектирует как виденные, так и невиденные атаки InjecAgent одинаково (52.1% против 55.8%). Horizon-Labs не разделяет данные ни с одним бенчмарком, обучался на входных данных агентного стиля и лидирует на обоих агентных бенчмарках.
  4. Судьи 7–8B, учитывающие задачу (один обучен до появления AgentDojo), достигают 54–78% при 1% FPR на выводах инструментов агента, что ниже лучших специализированных детекторов. Вне своего обучающего распределения каждый подход пропускает целые классы инъекций; помимо PIGuard, ни один подход не ловит более 39% инъекций, не относящихся к задаче.
  5. Удаление разметки сериализации или объявление типа входных данных снижает ложноположительные срабатывания при пороге по умолчанию вплоть до примерно двадцатикратного, но не исправляет детекцию при низком FPR.

Все числа регенерируются из файлов оценок с помощью analysis/compute_all.py; статья читает их только через paper/numbers.tex.

Структура

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

Воспроизведение

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

Чтобы регенерировать только числа и рисунки из выпущенных оценок, скопируйте results/*.json в рабочий каталог, пересоберите наборы .jsonl (шаги 1–3 из reproduce.sh, только CPU), затем выполните python analysis/compute_all.py && python analysis/make_macros.py.

Данные оценки пересобираются из публичных источников, а не распространяются: AgentDojo v1.2, tau-bench (MIT), атаки InjecAgent (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Некоторые скрипты предполагают, что BIPIA и PIGuard клонированы в ~/agentsec/.

Сборка статьи

paper/usenix-2020-09-xetex.sty — это сборочная копия стиля USENIX, которая компилируется с tectonic/XeTeX. Для подачи переключите main.tex на официальный usenix-2020-09.sty и компилируйте с pdflatex.

Статус

Черновик. Ещё не оценивался против адаптивных атак; оба агентных бенчмарка являются симуляциями, и точка инъекции в tau-bench — наша; коммерческие API-детекторы не включены. См. §6 статьи.

Лицензия

Код, скрипты анализа и файлы оценок: MIT (см. LICENSE). Сторонние файлы сохраняют свои собственные условия: стиль LaTeX USENIX (paper/usenix-2020-09*.sty) и бенчмарки и детекторы, которые скачивают скрипты (AgentDojo, tau-bench, InjecAgent, BIPIA и лицензия модели каждого детектора).

Скачать инструмент