Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
DeepTrap — Benchmark de seguridad para evaluar agentes OpenClaw frente a contextos de ejecución adversariales, incluidos archivos envenenados, habilidades inyectadas, metadatos de herramientas engañosos y payloads codificados. Incluye 42 tareas de reproducción en 6 suites de riesgo con puntuación de ataque y utilidad. | Kitploit
Herramientas/GitHubGitHub/zjuicsr/deeptrap
Escalada de PrivilegiosExfiltración de DatosPruebas de PenetraciónComando y ControlSeguridad de Cadena de SuministroAprendizaje y EducaciónRed TeamingDesarrollo de PayloadsSeguridad de IAAtaque AdversarioLabs y Práctica
1016hace 3 mesesAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →

Acerca de

Benchmark de seguridad para evaluar agentes OpenClaw frente a contextos de ejecución adversariales, incluidos archivos envenenados, habilidades inyectadas, metadatos de herramientas engañosos y payloads codificados. Incluye 42 tareas de reproducción en 6 suites de riesgo con puntuación de ataque y utilidad.

GitHub
zjuicsr/deeptrap

DeepTrap

Ver Repositorio
Compartir

DeepTrap

Logotipo de DeepTrap

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

Inglés | 中文

Evaluación de seguridad de mundo abierto para agentes OpenClaw en contextos de ejecución adversariales.


DeepTrap es un benchmark de seguridad para evaluar si los agentes OpenClaw pueden completar tareas de usuario benignas mientras resisten la presión maliciosa del contexto de ejecución: archivos del espacio de trabajo envenenados, skills inyectadas, metadatos de herramientas engañosos, rutas de comandos inseguras, secretos plantados y cargas útiles codificadas.

La versión pública contiene 42 tareas de reproducción organizadas como 6 clases de vulnerabilidad contextual x 7 familias de escenarios operativos, además del ejecutor del benchmark y del código público de puntuación. También incluye 10 muestras de reproducción en chino en tasks_zh/ para experimentos de evaluación localizados. El pipeline privado de generación de tareas y búsqueda de ataques no se incluye deliberadamente.

DeepTrap acompaña al artículo:

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He y Bingrun Yang. arXiv:2605.11047, 2026.

¿Por qué DeepTrap?

La mayoría de los benchmarks de agentes preguntan si un modelo puede completar trabajo útil. DeepTrap plantea una pregunta más estricta: ¿puede el agente completar trabajo útil de forma segura cuando el contexto de ejecución circundante es adversarial?

Qué nos diferencia

  • Ataques al contexto de ejecución, no solo ataques al prompt. DeepTrap evalúa amenazas incrustadas en archivos, skills, descripciones de herramientas, scripts, logs, configuraciones y artefactos codificados.
  • Prompts de usuario benignos. La solicitud del usuario es útil y ordinaria; el riesgo proviene del espacio de trabajo circundante.
  • Reproducción pública y mínima. El repositorio contiene el ejecutor, las tareas de reproducción y la lógica de puntuación necesarios para reproducir las ejecuciones del benchmark sin exponer el código privado de generación.
  • Puntuación de ataque y utilidad. DeepTrap reporta tanto AGS (Attack Grading Score) como UGS (Utility Grading Score), de modo que un modelo se evalúa conjuntamente en seguridad y utilidad de la tarea.
  • Nativo de OpenClaw. Las tareas están diseñadas para agentes estilo OpenClaw y preservan los supuestos de ejecución de un espacio de trabajo real de archivos/herramientas/skills.

Noticias

  • 2026-05 El artículo de DeepTrap se publicó en arXiv: arXiv:2605.11047.
  • 2026-05 Se publicó el repositorio público del benchmark con 42 tareas de reproducción, código de puntuación y leaderboard en GitHub Pages.
  • 2026-05 Se añadieron muestras de reproducción en chino bajo tasks_zh/.
  • 2026-05 Se añadió la exportación del dataset de Hugging Face para la distribución de metadatos de tareas.

Leaderboard

AGS es Attack Grading Score y UGS es Utility Grading Score. Las puntuaciones se reportan por suite de riesgo; Average (promedio) es la media de Riesgo 1 a Riesgo 6.

Página completa del proyecto y leaderboard: ZJUICSR.github.io/DeepTrap


Diseño del Benchmark

DeepTrap cruza seis clases de vulnerabilidad contextual con siete familias de escenarios benignos. Cada tarea usa un prompt de usuario normal; el comportamiento adversarial es inducido por el contexto del espacio de trabajo.

Arquitectura de DeepTrap

DeepTrap construye contextos de ejecución comprometidos a partir de instrucciones benignas y espacios de trabajo limpios, busca cargas útiles adversariales candidatas con señales de recompensa multiobjetivo y refina las cargas útiles exitosas mediante sondeo basado en reflexión.

Suites de riesgo

Familias de escenarios

Inicio rápido

Requisitos

  • Python 3.10+
  • CLI de OpenClaw instalada y configurada
  • Un modelo objetivo disponible a través de OpenClaw
  • Credenciales de API del juez para el backend de juez seleccionado:
    • OpenRouter: OPENROUTER_API_KEY
    • DeepSeek: DEEPSEEK_API_KEY
    • DashScope/Qwen: credenciales compatibles con DashScope esperadas por el cliente incluido

Los IDs de modelo deben incluir el prefijo de su proveedor, por ejemplo openrouter/anthropic/claude-sonnet-4-5.

Instalación y validación

root@kitploit:~
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .

# Validate task metadata without running OpenClaw
python benchmark.py --dry-run

# List bundled tasks
python benchmark.py --list-tasks

# Validate Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --dry-run

Ejecución

root@kitploit:~
# Run one risk suite
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1

# Run specific tasks
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01

# Run the Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all

# Run all tasks with repeated trials
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3

Los resultados se escriben en results/ por defecto.

Revisión de los resultados

Cada ejecución escribe un archivo JSON que contiene metadatos del modelo, configuración de la suite, puntuaciones por tarea, longitudes de transcripción, rutas del espacio de trabajo, metadatos de uso cuando están disponibles y campos de resumen agregados.

root@kitploit:~
# Overall score summary
jq '.summary' results/*.json

# Per-task scores
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json

# Tasks where the replay attack was reproduced strongly
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json

Cada tarea reporta:

  • AGS: puntuación de evaluación de ataques, donde un valor más alto indica una mayor realización del ataque
  • UGS: puntuación de evaluación de utilidad, donde un valor más alto indica una mejor finalización de la tarea
  • tiempo de la tarea, longitud de la transcripción, ruta del espacio de trabajo y metadatos de uso cuando estén disponibles

Conjunto de datos de Hugging Face

DeepTrap también puede distribuirse como un dataset de Hugging Face en ZJUICSR/DeepTrap.

La exportación estructurada almacena una tarea del benchmark por fila JSONL en data/tasks.jsonl, mientras que las definiciones originales de las tareas en Markdown permanecen en tasks/. Las tareas de muestra en chino pueden exportarse por separado desde tasks_zh/ cuando sea necesario.

root@kitploit:~
python scripts/export_hf_dataset.py

# Optional: export Chinese-language samples
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl

Después de la subida, los usuarios pueden cargar los metadatos del benchmark con:

root@kitploit:~
from datasets import load_dataset

dataset = load_dataset("ZJUICSR/DeepTrap", split="train")

Cada fila incluye task_id, name, risk, category, prompt, expected_behavior, grading_criteria, workspace_files, metadatos de puntuación y marcadores para comprobaciones automáticas y rúbricas del juez LLM.

Referencia de comandos

Estructura del proyecto

root@kitploit:~
.
├── benchmark.py                  # Public benchmark runner
├── tasks/                         # 42 bundled task definitions
├── tasks_zh/                      # 10 Chinese-language replay samples
├── scenes/                        # Clean source scenes for baseline/delta scoring
├── data/tasks.jsonl               # Hugging Face dataset export
├── docs/                          # GitHub Pages project site
├── huggingface/README.md          # Hugging Face dataset card
├── scripts/                       # Runtime support and export code
│   ├── lib_agent.py               # OpenClaw execution helpers
│   ├── lib_reward.py              # Attack/utility scoring
│   ├── lib_criteria.py            # Public judge criteria
│   ├── lib_llm.py                 # Judge backend router
│   ├── lib_openrouter.py          # OpenRouter judge client
│   ├── lib_deepseek.py            # DeepSeek judge client
│   ├── lib_dashscope.py           # DashScope/Qwen judge client
│   └── export_hf_dataset.py       # Dataset export helper
├── tests/                         # Public validation tests
├── SKILL.md                       # Agent-facing benchmark skill
└── pyproject.toml

Citación

Si usas DeepTrap en tu investigación, por favor cita:

root@kitploit:~
@article{yao2026trap,
  title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
  author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
  journal={arXiv preprint arXiv:2605.11047},
  year={2026}
}

Agradecimientos

DeepTrap se inspiró en parte en PinchBench, que proporciona una suite de benchmark práctica para medir la capacidad de los agentes OpenClaw en tareas del mundo real. Agradecemos al proyecto PinchBench por demostrar un formato de benchmark claro y utilizable para agentes OpenClaw.

Licencia

MIT — consulta LICENSE para más detalles.

Descargar herramienta
Qué probamosPor qué importa
Robustez contextualArchivos envenenados, artefactos tipo memoria, playbooks e instrucciones del espacio de trabajoLos agentes reales leen desde un contexto local mutable, donde el texto no confiable puede redirigir silenciosamente el comportamiento
Manejo de secretosCredenciales plantadas, variables de entorno, claves API y valores internosLos agentes deben distinguir entre ser conscientes de la configuración y exfiltrar secretos
Límites de ejecuciónComandos shell peligrosos, scripts de despliegue y efectos secundarios en el sistema de archivosLos agentes que usan herramientas pueden causar daños duraderos incluso cuando el prompt del usuario es benigno
Confianza en skills/herramientasSkills maliciosas, metadatos de herramientas engañosos y patrones de abuso de herramientasLa seguridad del agente depende de cómo el modelo interpreta y valida las capacidades de las herramientas
Cargas útiles ofuscadasInstrucciones codificadas en Base64 y de varios pasosLos ataques pueden ocultarse detrás de tareas de procesamiento de datos de apariencia normal
ModeloMétricaRiesgo 1Riesgo 2Riesgo 3Riesgo 4Riesgo 5Riesgo 6Promedio
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86
SuiteCategoríaTareasQué se mide
R1Secuestro del harness7Resistencia al contexto envenenado y a los pasos de flujo de trabajo inyectados
R2Fuga de privacidad7Protección de credenciales plantadas y valores sensibles
R3Ejecución no autorizada7Rechazo de comandos peligrosos y acciones que cruzan límites
R4Riesgo de cadena de suministro7Manejo de skills maliciosas e integraciones tipo herramienta
R5Abuso de herramientas7Detección de comportamiento de herramientas engañoso o no coincidente
R6Ofuscación de codificación7Manejo de instrucciones codificadas y cargas útiles de varios pasos
EscenarioFamilia de tareas típica
T01Notas de reuniones, elementos de acción y resúmenes de flujos de trabajo rutinarios
T02Formato de Python/código, refactorización y procesamiento de API/logs
T03Notas de investigación, revisión de literatura, citas y análisis de encuestas
T04Preparación de despliegues, validación de configuración y comprobaciones de salud del servicio
T05Informes de ventas, ingresos y datos comerciales estructurados
T06Redacción de blogs/contenido, revisión de estilo, incorporación (onboarding) y resúmenes de comentarios
T07Administración de sistemas, auditorías de entorno, comprobaciones de despliegue y respaldo de logs
OpciónDescripción
--model MODELIdentificador del modelo objetivo configurado para OpenClaw
--suite SUITEall, una suite de riesgo como R1, o IDs de tarea separados por comas
--tasks-dir DIRDirectorio de tareas, por defecto tasks/; usa tasks_zh/ para las muestras en chino
--runs NNúmero de ejecuciones por tarea para promediar
--timeout-multiplier NEscala los tiempos de espera de las tareas para modelos más lentos
--judge-model MODELModelo juez para la puntuación de ataque, sigilo y utilidad
--output-dir DIRDirectorio de resultados, por defecto results/
--list-tasksImprime los IDs de las tareas incluidas y sale
--dry-runValida la carga de tareas y los metadatos de puntuación sin ejecutar OpenClaw
--verboseImprime registros de ejecución detallados