Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
benign-instruction-bench — Reevaluación de los detectores de inyección de prompts en las salidas de herramientas de agentes LLM (borrador de artículo, scripts, puntuaciones) | Kitploit
Herramientas/GitHubGitHub/lzwhehe/benign-instruction-bench
Herramientas DefensivasAnálisis de VulnerabilidadesAprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónSeguridad de IA
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

Reevaluación de los detectores de inyección de prompts en las salidas de herramientas de agentes LLM (borrador de artículo, scripts, puntuaciones)

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Ver Repositorio
3hace 3 díasAún no revisado
Compartir

Aprobar el examen con el que se entrenó

Reevaluando los detectores de inyección de prompts donde los agentes LLM realmente los utilizan: en las salidas de herramientas que un agente lee.

Los equipos eligen detectores de inyección por sus puntuaciones en los benchmarks. Comprobamos si esas puntuaciones predicen el comportamiento dentro de un agente y descubrimos que, en su mayoría, miden cuán cerca está el benchmark de los datos de entrenamiento del detector.

Hallazgos

Quince detectores (nueve abiertos, seis con licencia restringida, incluido Prompt Guard 2 de Meta) y dos jueces LLM conscientes de la tarea, sobre dos benchmarks de agentes (AgentDojo, tau-bench) y sobre BIPIA. Las salidas de herramientas benignas provienen de reproducir las llamadas a herramientas de referencia de cada benchmark sin un LLM. La detección es TPR en el umbral que da un 1% de FPR.

DetectorPublicadoFPR en salidas de herramientas benignas (AgentDojo / tau-bench)Detección AgentDojoDetección tau-benchDetección BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(Los 15 detectores y ambos jueces: paper/tab_many.tex.)

  1. Las clasificaciones de detección se transfieren mal entre benchmarks (Kendall τ sobre 15 detectores): 0.01 para BIPIA vs AgentDojo, 0.28 para AgentDojo vs tau-bench, 0.31 para BIPIA vs tau-bench; ninguna significativa. El líder en BIPIA (PIGuard) ocupa el puesto 13 de 15 en AgentDojo; Prismor cae del 72% en AgentDojo al 15% en tau-bench.
  2. Las tasas de falsos positivos en salidas de herramientas benignas van del 0% a más del 90%, son consistentes entre los dos benchmarks de agentes (τ = 0.67, p = 0.001) y no se predicen por los falsos positivos en texto ordinario.
  3. La forma de las entradas de entrenamiento, no el solapamiento en las cadenas de ataque, explica los resultados. PIGuard se entrenó con 1,116 entradas completas de BIPIA y lidera BIPIA. También vio 53 de los 62 ataques de InjecAgent, pero solo como prompts cortos; dentro de las salidas de herramientas de tau-bench detecta por igual ataques de InjecAgent vistos y no vistos (52.1% vs 55.8%). Horizon-Labs no comparte datos con ningún benchmark, se entrenó con entradas de estilo agente y lidera ambos benchmarks de agentes.
  4. Los jueces de 7–8B conscientes de la tarea (uno entrenado antes de que existiera AgentDojo) alcanzan un 54–78% con un 1% de FPR en salidas de herramientas de agentes, por debajo de los mejores detectores dedicados. Fuera de su distribución de entrenamiento, todos los enfoques fallan clases enteras de inyecciones; aparte de PIGuard, ningún enfoque captura más del 39% de las inyecciones irrelevantes para la tarea.
  5. Eliminar el marcado de serialización o declarar el tipo de entrada reduce los falsos positivos con el umbral predeterminado hasta aproximadamente veinte veces, pero no soluciona la detección con FPR bajo.

Todas las cifras se regeneran a partir de los archivos de puntuaciones mediante analysis/compute_all.py; el artículo solo las lee a través de paper/numbers.tex.

Estructura

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

Reproducir

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

Para regenerar solo las cifras y figuras a partir de las puntuaciones publicadas, copia results/*.json en el directorio de trabajo, reconstruye los conjuntos .jsonl (pasos 1–3 de reproduce.sh, solo CPU) y luego ejecuta python analysis/compute_all.py && python analysis/make_macros.py.

Los datos de evaluación se reconstruyen a partir de las fuentes públicas, no se redistribuyen: AgentDojo v1.2, tau-bench (MIT), ataques de InjecAgent (MIT), BIPIA (MIT), READMEs de GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Algunos scripts asumen que BIPIA y PIGuard están clonados en ~/agentsec/.

Compilar el artículo

paper/usenix-2020-09-xetex.sty es una copia de compilación del estilo de USENIX que compila con tectonic/XeTeX. Para el envío, cambia main.tex al usenix-2020-09.sty oficial y compila con pdflatex.

Estado

Borrador. Aún no evaluado frente a ataques adaptativos; ambos benchmarks de agentes son simulaciones y el punto de inyección de tau-bench es nuestro; los detectores de API comerciales no están incluidos. Véase la §6 del artículo.

Licencia

Código, scripts de análisis y archivos de puntuaciones: MIT (véase LICENSE). Los archivos de terceros conservan sus propios términos: el estilo LaTeX de USENIX (paper/usenix-2020-09*.sty) y los benchmarks y detectores que descargan los scripts (AgentDojo, tau-bench, InjecAgent, BIPIA y la licencia del modelo de cada detector).

Descargar herramienta