Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

FeedsKontaktDatenschutz© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
benign-instruction-bench — Neubewertung von Prompt-Injection-Detektoren bei Tool-Ausgaben von LLM-Agenten (Paper-Entwurf, Skripte, Bewertungen) | Kitploit
Tools/GitHubGitHub/lzwhehe/benign-instruction-bench
DefensivwerkzeugeSchwachstellenanalyseMaschinelles LernenPapers & ForschungLernen & BildungKI-Sicherheit
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

Neubewertung von Prompt-Injection-Detektoren bei Tool-Ausgaben von LLM-Agenten (Paper-Entwurf, Skripte, Bewertungen)

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Repository anzeigen
3vor 3 TagenNoch nicht geprüft
Teilen

Den Test bestehen, auf den man trainiert hat

Neubewertung von Prompt-Injection-Detektoren dort, wo LLM-Agenten sie tatsächlich einsetzen: bei den Tool-Ausgaben, die ein Agent liest.

Teams wählen Injection-Detektoren nach ihren Benchmark-Ergebnissen aus. Wir prüfen, ob diese Ergebnisse das Verhalten innerhalb eines Agenten vorhersagen, und stellen fest, dass sie größtenteils messen, wie nah der Benchmark an den Trainingsdaten des Detektors liegt.

Ergebnisse

Fünfzehn Detektoren (neun offene, sechs lizenzbeschränkte, darunter Metas Prompt Guard 2) und zwei aufgabenbewusste LLM-Richter, auf zwei Agent-Benchmarks (AgentDojo, tau-bench) und auf BIPIA. Gutartige Tool-Ausgaben stammen aus dem Replay der Ground-Truth-Tool-Aufrufe jedes Benchmarks ohne LLM. Detektion ist TPR bei dem Schwellenwert, der 1 % FPR ergibt.

DetektorVeröffentlichtFPR bei gutartigen Tool-Ausgaben (AgentDojo / tau-bench)Detektion AgentDojoDetektion tau-benchDetektion BIPIA
Horizon-Labs guard-base20260,0 % / 0,7 %82,2 %100,0 %37,7 %
Wolf Defender20260,9 % / 0,0 %73,8 %90,8 %3,5 %
Prompt Guard 2 (86M)20250,6 % / 0,0 %69,4 %57,9 %10,4 %
Prompt Guard 2 (22M)20250,0 % / 0,0 %60,9 %60,8 %31,7 %
Prismor-1.5B20266,5 % / 46,2 %72,2 %15,2 %4,0 %
Sheltron-68M202610,6 % / 4,4 %20,1 %95,2 %57,2 %
Judge (Llama-3.1-8B)––55,3 %78,3 %8,3 %
PIGuard202529,5 % / 11,0 %2,1 %52,7 %95,1 %
ProtectAI v2202430,1 % / 66,9 %0,5 %10,1 %0,7 %

(Alle 15 Detektoren und beide Richter: paper/tab_many.tex.)

  1. Detektions-Rankings übertragen sich schlecht zwischen Benchmarks (Kendall τ über 15 Detektoren): 0,01 für BIPIA vs. AgentDojo, 0,28 für AgentDojo vs. tau-bench, 0,31 für BIPIA vs. tau-bench; keiner signifikant. Der BIPIA-Spitzenreiter (PIGuard) rangiert auf Platz 13 von 15 bei AgentDojo; Prismor fällt von 72 % bei AgentDojo auf 15 % bei tau-bench.
  2. Falsch-Positiv-Raten bei gutartigen Tool-Ausgaben reichen von 0 % bis über 90 %, sind konsistent über die beiden Agent-Benchmarks (τ = 0,67, p = 0,001) und werden nicht durch Falsch-Positive bei gewöhnlichem Text vorhergesagt.
  3. Die Form der Trainings-Eingaben, nicht die Überlappung bei Angriffsstrings, erklärt die Ergebnisse. PIGuard wurde auf 1.116 vollständigen BIPIA-Eingaben trainiert und führt BIPIA an. Es sah außerdem 53 von InjecAgents 62 Angriffen, aber nur als kurze Prompts; innerhalb von tau-bench-Tool-Ausgaben erkennt es gesehene und ungesehene InjecAgent-Angriffe gleichermaßen (52,1 % vs. 55,8 %). Horizon-Labs teilt keine Daten mit irgendeinem Benchmark, wurde auf Agent-artigen Eingaben trainiert und führt beide Agent-Benchmarks an.
  4. Aufgabenbewusste 7–8B-Richter (einer trainiert, bevor AgentDojo existierte) erreichen 54–78 % bei 1 % FPR auf Agent-Tool-Ausgaben, unterhalb der besten spezialisierten Detektoren. Außerhalb ihrer Trainingsverteilung verfehlt jeder Ansatz ganze Klassen von Injektionen; abgesehen von PIGuard fängt kein Ansatz mehr als 39 % der aufgabenirrelevanten Injektionen ab.
  5. Das Entfernen von Serialisierungs-Markup oder das Deklarieren des Eingabetyps senkt Falsch-Positive beim Standard-Schwellenwert um bis zu etwa das Zwanzigfache, behebt aber nicht die Detektion bei niedrigem FPR.

Alle Zahlen werden aus den Score-Dateien durch analysis/compute_all.py neu generiert; das Paper liest sie nur über paper/numbers.tex.

Layout

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

Reproduzieren

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

Um nur die Zahlen und Abbildungen aus den veröffentlichten Scores neu zu generieren, kopiere results/*.json in das Arbeitsverzeichnis, baue die .jsonl-Sets neu auf (Schritte 1–3 von reproduce.sh, nur CPU) und führe dann python analysis/compute_all.py && python analysis/make_macros.py aus.

Die Evaluationsdaten werden aus den öffentlichen Quellen neu aufgebaut, nicht weiterverbreitet: AgentDojo v1.2, tau-bench (MIT), InjecAgent-Angriffe (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Einige Skripte gehen davon aus, dass BIPIA und PIGuard unter ~/agentsec/ geklont sind.

Das Paper bauen

paper/usenix-2020-09-xetex.sty ist eine Build-Kopie des USENIX-Stils, die mit tectonic/XeTeX kompiliert. Für die Einreichung stelle main.tex auf den offiziellen usenix-2020-09.sty um und kompiliere mit pdflatex.

Status

Entwurf. Noch nicht gegen adaptive Angriffe evaluiert; beide Agent-Benchmarks sind Simulationen und tau-benchs Injektionspunkt ist unserer; kommerzielle API-Detektoren nicht enthalten. Siehe §6 des Papers.

Lizenz

Code, Analyse-Skripte und Score-Dateien: MIT (siehe LICENSE). Dateien Dritter behalten ihre eigenen Bedingungen: der USENIX-LaTeX-Stil (paper/usenix-2020-09*.sty) sowie die Benchmarks und Detektoren, die die Skripte herunterladen (AgentDojo, tau-bench, InjecAgent, BIPIA und die Modelllizenz jedes Detektors).

Tool herunterladen