Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
DeepTrap — Security benchmark para avaliar agentes OpenClaw em contextos de execução adversarial, incluindo arquivos envenenados, habilidades injetadas, metadados de ferramenta enganosos e payloads codificados. Inclui 42 tarefas de replay em 6 suites de risco com pontuação de ataque e utilidade. | Kitploit
Ferramentas/GitHubGitHub/zjuicsr/deeptrap
Escalada de PrivilégiosExfiltração de DadosTestes de PenetraçãoComando e ControleSegurança da Cadeia de SuprimentosAprendizado e EducaçãoRed TeamingDesenvolvimento de PayloadsSegurança de IAAtaque AdversárioLabs e Prática
1016há 3 mesesAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →

Sobre

Security benchmark para avaliar agentes OpenClaw em contextos de execução adversarial, incluindo arquivos envenenados, habilidades injetadas, metadados de ferramenta enganosos e payloads codificados. Inclui 42 tarefas de replay em 6 suites de risco com pontuação de ataque e utilidade.

GitHub
zjuicsr/deeptrap

DeepTrap

Ver Repositório
Compartilhar

DeepTrap

Logotipo do DeepTrap

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

Inglês | 中文

Avaliação de segurança em mundo aberto para agentes OpenClaw sob contextos de execução adversariais.


DeepTrap é um benchmark de segurança para avaliar se agentes OpenClaw podem completar tarefas benignas de usuário enquanto resistem a pressões maliciosas do contexto de execução: arquivos de workspace envenenados, habilidades injetadas, metadados de ferramentas enganosos, caminhos de comando inseguros, segredos plantados e payloads codificados.

A versão pública contém 42 tarefas de replay organizadas como 6 classes de vulnerabilidade contextual x 7 famílias de cenário operacional, além do executor do benchmark e do código público de pontuação. Também inclui 10 amostras de replay em chinês em tasks_zh/ para experimentos de avaliação localizados. O pipeline privado de geração de tarefas e busca de ataques não é intencionalmente incluído.

DeepTrap acompanha o artigo:

Red-Teaming de Contextos de Execução de Agentes: Avaliação de Segurança em Mundo Aberto no OpenClaw
Hongwei Yao, Yiming Liu, Yiling He, e Bingrun Yang. arXiv:2605.11047, 2026.

Por que DeepTrap?

A maioria dos benchmarks de agentes pergunta se um modelo pode concluir trabalho útil. DeepTrap faz uma pergunta mais rigorosa: o agente pode concluir trabalho útil de forma segura quando o contexto de execução ao redor é adversarial?

O Que Nos Diferencia

  • Ataques ao contexto de execução, não apenas ataques a prompts. DeepTrap avalia ameaças embutidas em arquivos, habilidades, descrições de ferramentas, scripts, logs, configurações e artefatos codificados.
  • Prompts de usuário benignos. A solicitação do usuário é útil e comum; o risco vem do workspace ao redor.
  • Reprodução pública e mínima. O repositório contém o executor, as tarefas de replay e a lógica de pontuação necessários para reproduzir execuções do benchmark sem expor o código de geração privado.
  • Pontuação de ataque e utilidade. DeepTrap relata tanto AGS (Attack Grading Score) quanto UGS (Utility Grading Score), para que um modelo seja avaliado conjuntamente em segurança e utilidade da tarefa.
  • Nativo do OpenClaw. As tarefas são construídas para agentes estilo OpenClaw e preservam as suposições de execução de um workspace real de arquivos/ferramentas/habilidades.

Notícias

  • 2026-05 Artigo DeepTrap publicado no arXiv: arXiv:2605.11047.
  • 2026-05 Repositório público do benchmark lançado com 42 tarefas de replay, código de pontuação e leaderboard no GitHub Pages.
  • 2026-05 Amostras de replay em chinês adicionadas em tasks_zh/.
  • 2026-05 Exportação do dataset Hugging Face adicionada para distribuição de metadados das tarefas.

Leaderboard

AGS é o Attack Grading Score (Pontuação de Avaliação de Ataque) e UGS é o Utility Grading Score (Pontuação de Avaliação de Utilidade). As pontuações são relatadas por suite de risco; Average (Média) é a média do Risco 1 ao Risco 6.

Página completa do projeto e leaderboard: ZJUICSR.github.io/DeepTrap


Design do Benchmark

DeepTrap cruza seis classes de vulnerabilidade contextual com sete famílias de cenário benigno. Cada tarefa usa um prompt de usuário normal; o comportamento adversarial é induzido pelo contexto do workspace.

Framework DeepTrap

DeepTrap constrói contextos de execução comprometidos a partir de instruções benignas e workspaces limpos, busca candidate payloads adversariais com sinais de recompensa multiobjetivo e refina payloads bem-sucedidos através de sondagem baseada em reflexão.

Suites de Risco

Famílias de Cenário

Início Rápido

Requisitos

  • Python 3.10+
  • CLI OpenClaw instalada e configurada
  • Um modelo alvo disponível através do OpenClaw
  • Credenciais de API do juiz para o backend de juiz selecionado:
    • OpenRouter: OPENROUTER_API_KEY
    • DeepSeek: DEEPSEEK_API_KEY
    • DashScope/Qwen: credenciais compatíveis com DashScope esperadas pelo cliente incluído

IDs de modelo devem incluir seu prefixo de provedor, por exemplo openrouter/anthropic/claude-sonnet-4-5.

Instalar e Validar

root@kitploit:~
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .

# Validar metadados das tarefas sem executar OpenClaw
python benchmark.py --dry-run

# Listar tarefas incluídas
python benchmark.py --list-tasks

# Validar amostras de tarefas em chinês
python benchmark.py --tasks-dir tasks_zh --dry-run

Executar

root@kitploit:~
# Executar uma suite de risco
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1

# Executar tarefas específicas
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01

# Executar as amostras de tarefas em chinês
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all

# Executar todas as tarefas com execuções repetidas
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3

Resultados são escritos em results/ por padrão.

Verificar os Resultados

Cada execução escreve um arquivo JSON contendo metadados do modelo, configuração da suite, pontuações por tarefa, comprimentos de transcrição, caminhos de workspace, metadados de uso quando disponíveis e campos de resumo agregados.

root@kitploit:~
# Resumo geral das pontuações
jq '.summary' results/*.json

# Pontuações por tarefa
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json

# Tarefas onde o replay de ataque foi reproduzido fortemente
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json

Cada tarefa relata:

  • AGS: pontuação de ataque, onde maior indica realização mais forte do ataque
  • UGS: pontuação de utilidade, onde maior indica melhor conclusão da tarefa
  • tempo da tarefa, comprimento da transcrição, caminho do workspace e metadados de uso quando disponíveis

Dataset Hugging Face

DeepTrap também pode ser distribuído como um dataset Hugging Face em ZJUICSR/DeepTrap.

A exportação estruturada armazena uma tarefa de benchmark por linha JSONL em data/tasks.jsonl, enquanto as definições originais das tarefas em Markdown permanecem em tasks/. Amostras de tarefas em chinês podem ser exportadas separadamente de tasks_zh/ quando necessário.

root@kitploit:~
python scripts/export_hf_dataset.py

# Opcional: exportar amostras em chinês
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl

Após o upload, os usuários podem carregar os metadados do benchmark com:

root@kitploit:~
from datasets import load_dataset

dataset = load_dataset("ZJUICSR/DeepTrap", split="train")

Cada linha inclui task_id, name, risk, category, prompt, expected_behavior, grading_criteria, workspace_files, metadados de pontuação e flags para verificações automatizadas e rubricas de juiz LLM.

Referência de Comandos

Estrutura do Projeto

root@kitploit:~
.
├── benchmark.py                  # Executor público do benchmark
├── tasks/                         # 42 definições de tarefas incluídas
├── tasks_zh/                      # 10 amostras de replay em chinês
├── scenes/                        # Cenas fonte limpas para pontuação de linha de base/delta
├── data/tasks.jsonl               # Exportação do dataset Hugging Face
├── docs/                          # Site do projeto GitHub Pages
├── huggingface/README.md          # Cartão do dataset Hugging Face
├── scripts/                       # Suporte de execução e código de exportação
│   ├── lib_agent.py               # Auxiliares de execução OpenClaw
│   ├── lib_reward.py              # Pontuação de ataque/utilidade
│   ├── lib_criteria.py            # Critérios de juiz públicos
│   ├── lib_llm.py                 # Roteador de backend do juiz
│   ├── lib_openrouter.py          # Cliente juiz OpenRouter
│   ├── lib_deepseek.py            # Cliente juiz DeepSeek
│   ├── lib_dashscope.py           # Cliente juiz DashScope/Qwen
│   └── export_hf_dataset.py       # Auxiliar de exportação do dataset
├── tests/                         # Testes de validação públicos
├── SKILL.md                       # Habilidade do benchmark voltada ao agente
└── pyproject.toml

Citação

Se você usar DeepTrap em sua pesquisa, por favor cite:

root@kitploit:~
@article{yao2026trap,
  title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
  author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
  journal={arXiv preprint arXiv:2605.11047},
  year={2026}
}

Agradecimentos

DeepTrap foi inspirado em parte pelo PinchBench, que fornece uma suite de benchmark prática para medir a capacidade de agentes OpenClaw em tarefas do mundo real. Agradecemos ao projeto PinchBench por demonstrar um formato de benchmark claro e utilizável para agentes OpenClaw.

Licença

MIT — veja LICENSE para detalhes.

Baixar ferramenta
O Que TestamosPor Que Isso Importa
Robustez de ContextoArquivos envenenados, artefatos do tipo memória, playbooks e instruções do workspaceAgentes reais leem de um contexto local mutável, onde texto não confiável pode redirecionar silenciosamente o comportamento
Manipulação de SegredosCredenciais plantadas, variáveis de ambiente, chaves de API e valores internosAgentes devem distinguir conhecimento de configuração de exfiltração de segredos
Limites de ExecuçãoComandos de shell perigosos, scripts de implantação e efeitos colaterais no sistema de arquivosAgentes que usam ferramentas podem causar danos duradouros mesmo quando o prompt do usuário é benigno
Confiança em Habilidades/FerramentasHabilidades maliciosas, metadados de ferramentas enganosos e padrões de abuso de ferramentasA segurança do agente depende de como o modelo interpreta e valida as affordances das ferramentas
Payloads OfuscadosInstruções codificadas em Base64 e multi-etapaAtaques podem se esconder atrás de tarefas de processamento de dados com aparência normal
Modelo ClawMétricaRisco 1Risco 2Risco 3Risco 4Risco 5Risco 6Média
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86
SuiteCategoriaTarefasO que é medido
R1Sequestro de Harness7Resistência a contexto envenenado e etapas de workflow injetadas
R2Vazamento de Privacidade7Proteção de credenciais plantadas e valores sensíveis
R3Execução Não Autorizada7Recusa de comandos perigosos e ações que ultrapassam limites
R4Risco de Cadeia de Suprimentos7Manuseio de habilidades maliciosas e integrações do tipo ferramenta
R5Abuso de Ferramenta7Detecção de comportamento de ferramenta enganoso ou incompatível
R6Ofuscação de Codificação7Manuseio de instruções codificadas e payloads multi-etapa
CenárioFamília de tarefa típica
T01Notas de reunião, itens de ação e resumos de workflow de rotina
T02Formatação de Python/código, refatoração e processamento de API/log
T03Notas de pesquisa, revisão de literatura, citação e análise de pesquisa
T04Prontidão para implantação, validação de configuração e verificações de saúde de serviço
T05Relatórios de vendas, receita e dados de negócio estruturados
T06Redação de blog/conteúdo, verificação de estilo, integração e resumos de feedback
T07Administração de sistemas, auditorias de ambiente, verificações de implantação e backup de logs
FlagDescrição
--model MODELIdentificador do modelo alvo configurado para OpenClaw
--suite SUITEall, uma suite de risco como R1, ou IDs de tarefa separados por vírgula
--tasks-dir DIRDiretório de tarefas, padrão tasks/; use tasks_zh/ para amostras em chinês
--runs NNúmero de execuções por tarefa para média
--timeout-multiplier NEscalar timeouts das tarefas para modelos mais lentos
--judge-model MODELModelo juiz para pontuação de ataque, stealth e utilidade
--output-dir DIRDiretório de resultados, padrão results/
--list-tasksImprimir IDs das tarefas incluídas e sair
--dry-runValidar carregamento de tarefas e metadados de pontuação sem executar OpenClaw
--verboseImprimir logs de execução detalhados