Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

FeedsContatoPrivacidade© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
benign-instruction-bench — Reavaliando detectores de prompt-injection em saídas de ferramentas de agentes LLM (rascunho de artigo, scripts, pontuações) | Kitploit
Ferramentas/GitHubGitHub/lzwhehe/benign-instruction-bench
Ferramentas DefensivasAnálise de VulnerabilidadesAprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoSegurança de IA
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

Reavaliando detectores de prompt-injection em saídas de ferramentas de agentes LLM (rascunho de artigo, scripts, pontuações)

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Ver Repositório
3há 3 diasAinda não revisado
Compartilhar

Passando no Teste em que Você Foi Treinado

Reavaliando detectores de injeção de prompt onde agentes LLM realmente os utilizam: nas saídas de ferramentas que um agente lê.

As equipes escolhem detectores de injeção pelas suas pontuações em benchmarks. Verificamos se essas pontuações preveem o comportamento dentro de um agente e descobrimos que elas medem, em grande parte, o quão próximo o benchmark está dos dados de treinamento do detector.

Resultados

Quinze detectores (nove abertos, seis com licença restrita, incluindo o Prompt Guard 2 da Meta) e dois juízes LLM cientes da tarefa, em dois benchmarks de agentes (AgentDojo, tau-bench) e no BIPIA. As saídas benignas de ferramentas vêm da reprodução das chamadas de ferramentas ground-truth de cada benchmark sem um LLM. A detecção é a TPR no limiar que fornece 1% de FPR.

DetectorLançadoFPR em saídas benignas de ferramentas (AgentDojo / tau-bench)Detecção AgentDojoDetecção tau-benchDetecção BIPIA
Horizon-Labs guard-base20260,0% / 0,7%82,2%100,0%37,7%
Wolf Defender20260,9% / 0,0%73,8%90,8%3,5%
Prompt Guard 2 (86M)20250,6% / 0,0%69,4%57,9%10,4%
Prompt Guard 2 (22M)20250,0% / 0,0%60,9%60,8%31,7%
Prismor-1.5B20266,5% / 46,2%72,2%15,2%4,0%
Sheltron-68M202610,6% / 4,4%20,1%95,2%57,2%
Judge (Llama-3.1-8B)––55,3%78,3%8,3%
PIGuard202529,5% / 11,0%2,1%52,7%95,1%
ProtectAI v2202430,1% / 66,9%0,5%10,1%0,7%

(Todos os 15 detectores e ambos os juízes: paper/tab_many.tex.)

  1. Os rankings de detecção transferem-se mal entre benchmarks (Kendall τ sobre 15 detectores): 0,01 para BIPIA vs AgentDojo, 0,28 para AgentDojo vs tau-bench, 0,31 para BIPIA vs tau-bench; nenhum significativo. O líder do BIPIA (PIGuard) classifica-se em 13º de 15 no AgentDojo; Prismor cai de 72% no AgentDojo para 15% no tau-bench.
  2. As taxas de falsos positivos em saídas benignas de ferramentas variam de 0% a mais de 90%, são consistentes entre os dois benchmarks de agentes (τ = 0,67, p = 0,001) e não são previstas por falsos positivos em texto comum.
  3. A forma das entradas de treinamento, e não a sobreposição em strings de ataque, explica os resultados. O PIGuard foi treinado em 1.116 entradas completas do BIPIA e lidera o BIPIA. Ele também viu 53 dos 62 ataques do InjecAgent, mas apenas como prompts curtos; dentro das saídas de ferramentas do tau-bench, ele detecta ataques do InjecAgent vistos e não vistos de forma semelhante (52,1% vs 55,8%). O Horizon-Labs não compartilha dados com nenhum benchmark, foi treinado em entradas no estilo de agente e lidera ambos os benchmarks de agentes.
  4. Juízes de 7–8B cientes da tarefa (um treinado antes de o AgentDojo existir) alcançam 54–78% a 1% de FPR em saídas de ferramentas de agentes, abaixo dos melhores detectores dedicados. Fora de sua distribuição de treinamento, toda abordagem deixa passar classes inteiras de injeções; exceto pelo PIGuard, nenhuma abordagem captura mais de 39% das injeções irrelevantes para a tarefa.
  5. Remover a marcação de serialização ou declarar o tipo de entrada reduz os falsos positivos no limiar padrão em até cerca de vinte vezes, mas não corrige a detecção com baixo FPR.

Todos os números são regenerados a partir dos arquivos de pontuação por analysis/compute_all.py; o artigo os lê apenas através de paper/numbers.tex.

Estrutura

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

Reproduzir

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

Para regenerar apenas os números e figuras a partir das pontuações divulgadas, copie results/*.json para o diretório de trabalho, reconstrua os conjuntos .jsonl (etapas 1–3 de reproduce.sh, somente CPU) e então execute python analysis/compute_all.py && python analysis/make_macros.py.

Os dados de avaliação são reconstruídos a partir das fontes públicas, não redistribuídos: AgentDojo v1.2, tau-bench (MIT), ataques do InjecAgent (MIT), BIPIA (MIT), READMEs do GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Alguns scripts assumem que BIPIA e PIGuard estão clonados em ~/agentsec/.

Compilando o artigo

paper/usenix-2020-09-xetex.sty é uma cópia de build do estilo USENIX que compila com tectonic/XeTeX. Para submissão, mude main.tex para o usenix-2020-09.sty oficial e compile com pdflatex.

Status

Rascunho. Ainda não avaliado contra ataques adaptativos; ambos os benchmarks de agentes são simulações e o ponto de injeção do tau-bench é nosso; detectores de API comerciais não incluídos. Veja a §6 do artigo.

Licença

Código, scripts de análise e arquivos de pontuação: MIT (veja LICENSE). Arquivos de terceiros mantêm seus próprios termos: o estilo LaTeX do USENIX (paper/usenix-2020-09*.sty) e os benchmarks e detectores que os scripts baixam (AgentDojo, tau-bench, InjecAgent, BIPIA e a licença do modelo de cada detector).

Baixar ferramenta