Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
DeepTrap — Benchmark de seguridad para evaluar agentes OpenClaw frente a contextos de ejecución adversariales, incluidos archivos envenenados, habilidades inyectadas, metadatos de herramientas engañosos y payloads codificados. Incluye 42 tareas de reproducción en 6 suites de riesgo con puntuación de ataque y utilidad. | Kitploit
Herramientas/GitHubGitHub/zjuicsr/deeptrap
Escalada de PrivilegiosExfiltración de DatosPruebas de PenetraciónComando y ControlSeguridad de Cadena de SuministroAprendizaje y EducaciónRed TeamingDesarrollo de PayloadsSeguridad de IAAtaque AdversarioLabs y Práctica
10116hace 4 mesesAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →

Acerca de

Benchmark de seguridad para evaluar agentes OpenClaw frente a contextos de ejecución adversariales, incluidos archivos envenenados, habilidades inyectadas, metadatos de herramientas engañosos y payloads codificados. Incluye 42 tareas de reproducción en 6 suites de riesgo con puntuación de ataque y utilidad.

GitHub
zjuicsr/deeptrap

DeepTrap

Ver Repositorio
Compartir

DeepTrap

Logotipo de DeepTrap

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

Inglés | 中文

Evaluación de seguridad de mundo abierto para agentes OpenClaw en contextos de ejecución adversariales.


DeepTrap es un benchmark de seguridad para evaluar si los agentes OpenClaw pueden completar tareas de usuario benignas mientras resisten la presión maliciosa del contexto de ejecución: archivos del espacio de trabajo envenenados, skills inyectadas, metadatos de herramientas engañosos, rutas de comandos inseguras, secretos plantados y cargas útiles codificadas.

La versión pública contiene 42 tareas de reproducción organizadas como 6 clases de vulnerabilidad contextual x 7 familias de escenarios operativos, además del ejecutor del benchmark y del código público de puntuación. También incluye 10 muestras de reproducción en chino en tasks_zh/ para experimentos de evaluación localizados. El pipeline privado de generación de tareas y búsqueda de ataques no se incluye deliberadamente.

DeepTrap acompaña al artículo:

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He y Bingrun Yang. arXiv:2605.11047, 2026.

¿Por qué DeepTrap?

La mayoría de los benchmarks de agentes preguntan si un modelo puede completar trabajo útil. DeepTrap plantea una pregunta más estricta: ¿puede el agente completar trabajo útil de forma segura cuando el contexto de ejecución circundante es adversarial?

Qué probamosPor qué importa
Robustez contextualArchivos envenenados, artefactos tipo memoria, playbooks e instrucciones del espacio de trabajoLos agentes reales leen desde un contexto local mutable, donde el texto no confiable puede redirigir silenciosamente el comportamiento
Manejo de secretosCredenciales plantadas, variables de entorno, claves API y valores internosLos agentes deben distinguir entre ser conscientes de la configuración y exfiltrar secretos
Límites de ejecuciónComandos shell peligrosos, scripts de despliegue y efectos secundarios en el sistema de archivosLos agentes que usan herramientas pueden causar daños duraderos incluso cuando el prompt del usuario es benigno
Confianza en skills/herramientasSkills maliciosas, metadatos de herramientas engañosos y patrones de abuso de herramientasLa seguridad del agente depende de cómo el modelo interpreta y valida las capacidades de las herramientas
Cargas útiles ofuscadasInstrucciones codificadas en Base64 y de varios pasosLos ataques pueden ocultarse detrás de tareas de procesamiento de datos de apariencia normal

Qué nos diferencia

  • Ataques al contexto de ejecución, no solo ataques al prompt. DeepTrap evalúa amenazas incrustadas en archivos, skills, descripciones de herramientas, scripts, logs, configuraciones y artefactos codificados.
  • Prompts de usuario benignos. La solicitud del usuario es útil y ordinaria; el riesgo proviene del espacio de trabajo circundante.
  • Reproducción pública y mínima. El repositorio contiene el ejecutor, las tareas de reproducción y la lógica de puntuación necesarios para reproducir las ejecuciones del benchmark sin exponer el código privado de generación.
  • Puntuación de ataque y utilidad. DeepTrap reporta tanto AGS (Attack Grading Score) como UGS (Utility Grading Score), de modo que un modelo se evalúa conjuntamente en seguridad y utilidad de la tarea.
  • Nativo de OpenClaw. Las tareas están diseñadas para agentes estilo OpenClaw y preservan los supuestos de ejecución de un espacio de trabajo real de archivos/herramientas/skills.

Noticias

  • 2026-05 El artículo de DeepTrap se publicó en arXiv: arXiv:2605.11047.
  • 2026-05 Se publicó el repositorio público del benchmark con 42 tareas de reproducción, código de puntuación y leaderboard en GitHub Pages.
  • 2026-05 Se añadieron muestras de reproducción en chino bajo tasks_zh/.
  • 2026-05 Se añadió la exportación del dataset de Hugging Face para la distribución de metadatos de tareas.

Leaderboard

AGS es Attack Grading Score y UGS es Utility Grading Score. Las puntuaciones se reportan por suite de riesgo; Average (promedio) es la media de Riesgo 1 a Riesgo 6.

Página completa del proyecto y leaderboard: ZJUICSR.github.io/DeepTrap

ModeloMétricaRiesgo 1Riesgo 2Riesgo 3Riesgo 4Riesgo 5Riesgo 6Promedio
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86

Diseño del Benchmark

DeepTrap cruza seis clases de vulnerabilidad contextual con siete familias de escenarios benignos. Cada tarea usa un prompt de usuario normal; el comportamiento adversarial es inducido por el contexto del espacio de trabajo.

Arquitectura de DeepTrap

DeepTrap construye contextos de ejecución comprometidos a partir de instrucciones benignas y espacios de trabajo limpios, busca cargas útiles adversariales candidatas con señales de recompensa multiobjetivo y refina las cargas útiles exitosas mediante sondeo basado en reflexión.

Suites de riesgo

Descargar herramienta