Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
benign-instruction-bench — Rivalutazione dei rilevatori di prompt-injection sugli output degli strumenti degli agenti LLM (bozza del paper, script, punteggi) | Kitploit
Strumenti/GitHubGitHub/lzwhehe/benign-instruction-bench
Strumenti DifensiviAnalisi delle VulnerabilitàMachine LearningPaper e RicercaApprendimento e FormazioneSicurezza dell'IA
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

Rivalutazione dei rilevatori di prompt-injection sugli output degli strumenti degli agenti LLM (bozza del paper, script, punteggi)

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Vedi Repository
33 giorni faNon ancora revisionato
Condividi

Superare il test su cui è stato addestrato

Rivalutare i rilevatori di prompt-injection dove gli agenti LLM li usano effettivamente: sugli output degli strumenti che un agente legge.

I team scelgono i rilevatori di injection in base ai loro punteggi di benchmark. Verifichiamo se quei punteggi predicono il comportamento all'interno di un agente, e scopriamo che misurano per lo più quanto il benchmark sia vicino ai dati di addestramento del rilevatore.

Risultati

Quindici rilevatori (nove open, sei con licenza vincolata incluso Prompt Guard 2 di Meta) e due giudici LLM task-aware, su due benchmark per agenti (AgentDojo, tau-bench) e su BIPIA. Gli output benigni degli strumenti provengono dal replay delle chiamate agli strumenti ground-truth di ciascun benchmark senza un LLM. Il rilevamento è il TPR alla soglia che dà 1% di FPR.

RilevatoreRilasciatoFPR su output benigni degli strumenti (AgentDojo / tau-bench)Rilevamento AgentDojoRilevamento tau-benchRilevamento BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(Tutti i 15 rilevatori ed entrambi i giudici: paper/tab_many.tex.)

  1. Le classifiche di rilevamento si trasferiscono male tra i benchmark (Kendall τ su 15 rilevatori): 0.01 per BIPIA vs AgentDojo, 0.28 per AgentDojo vs tau-bench, 0.31 per BIPIA vs tau-bench; nessuna significativa. Il leader di BIPIA (PIGuard) si classifica 13° su 15 su AgentDojo; Prismor scende dal 72% su AgentDojo al 15% su tau-bench.
  2. I tassi di falsi positivi sugli output benigni degli strumenti vanno dallo 0% a oltre il 90%, sono coerenti tra i due benchmark per agenti (τ = 0.67, p = 0.001), e non sono predetti dai falsi positivi su testo ordinario.
  3. La forma degli input di addestramento, non la sovrapposizione nelle stringhe di attacco, spiega i risultati. PIGuard è stato addestrato su 1.116 input BIPIA completi e guida BIPIA. Ha anche visto 53 dei 62 attacchi di InjecAgent, ma solo come prompt brevi; all'interno degli output degli strumenti di tau-bench rileva allo stesso modo attacchi InjecAgent visti e non visti (52.1% vs 55.8%). Horizon-Labs non condivide dati con alcun benchmark, è stato addestrato su input in stile agente, e guida entrambi i benchmark per agenti.
  4. I giudici task-aware da 7–8B (uno addestrato prima che AgentDojo esistesse) raggiungono il 54–78% a 1% di FPR sugli output degli strumenti degli agenti, al di sotto dei migliori rilevatori dedicati. Al di fuori della loro distribuzione di addestramento ogni approccio manca intere classi di injection; a parte PIGuard, nessun approccio cattura più del 39% delle injection irrilevanti per il task.
  5. Rimuovere il markup di serializzazione o dichiarare il tipo di input riduce i falsi positivi alla soglia predefinita fino a circa venti volte ma non risolve il rilevamento a basso FPR.

Tutti i numeri sono rigenerati dai file dei punteggi da analysis/compute_all.py; il paper li legge solo attraverso paper/numbers.tex.

Struttura

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

Riproduzione

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

Per rigenerare solo i numeri e le figure dai punteggi rilasciati, copia results/*.json nella directory di lavoro, ricostruisci i set .jsonl (passi 1–3 di reproduce.sh, solo CPU), poi esegui python analysis/compute_all.py && python analysis/make_macros.py.

I dati di valutazione sono ricostruiti dalle fonti pubbliche, non ridistribuiti: AgentDojo v1.2, tau-bench (MIT), attacchi InjecAgent (MIT), BIPIA (MIT), README di GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Alcuni script presuppongono che BIPIA e PIGuard siano clonati sotto ~/agentsec/.

Compilazione del paper

paper/usenix-2020-09-xetex.sty è una copia di build dello stile USENIX che compila con tectonic/XeTeX. Per la sottomissione, passa main.tex allo stile ufficiale usenix-2020-09.sty e compila con pdflatex.

Stato

Bozza. Non ancora valutato contro attacchi adattivi; entrambi i benchmark per agenti sono simulazioni e il punto di injection di tau-bench è il nostro; i rilevatori API commerciali non sono inclusi. Vedi §6 del paper.

Licenza

Codice, script di analisi e file dei punteggi: MIT (vedi LICENSE). I file di terze parti mantengono i propri termini: lo stile LaTeX USENIX (paper/usenix-2020-09*.sty) e i benchmark e i rilevatori che gli script scaricano (AgentDojo, tau-bench, InjecAgent, BIPIA, e la licenza del modello di ciascun rilevatore).

Scarica lo strumento