Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
AgentWatcher — Atribuição causal de contexto e monitor baseado em regras para defesa de LLM contra injeção indireta de prompt em agentes LLM, alcançando desempenho de última geração no AgentDyn e em outros benchmarks. | Kitploit
Ferramentas/GitHubGitHub/wang-yanting/agentwatcher
Aprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoSegurança de IAAtaque Adversário
GitHubwang-yanting/agentwatcher

AgentWatcher

Atribuição causal de contexto e monitor baseado em regras para defesa de LLM contra injeção indireta de prompt em agentes LLM, alcançando desempenho de última geração no AgentDyn e em outros benchmarks.

Ver Repositório
926há 5 mesesAinda não revisado

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

AgentWatcher

AgentWatcher é uma defesa baseada em detecção contra injeção indireta de prompts em agentes LLM. Primeiro, executa atribuição causal de contexto sobre contextos não confiáveis para encontrar os contextos mais influentes, depois aplica um LLM monitor que classifica esses contextos sob regras explícitas e personalizáveis. Comparado com detectores totalmente caixa-preta, este pipeline é mais fácil de interpretar: a atribuição mostra onde o modelo focou, e o julgamento do LLM monitor é baseado em raciocínio fundamentado em regras. Um exemplo da saída do LLM monitor é mostrado abaixo:

Exemplo de saída do AgentWatcher

Esta detecção baseada em regras pode alavancar a capacidade de raciocínio do LLM monitor para alcançar um melhor equilíbrio entre utilidade e robustez. AgentWatcher alcança desempenho de ponta em benchmarks de agentes LLM como AgentDyn:

Exemplo de saída do AgentWatcher

Este repositório destina-se a reproduzir os principais experimentos do artigo.

🔨 Requisitos

  • Python 3.10+ (testado com ambientes conda).
  • GPU(s) CUDA para o LLM de backend (vLLM pode ser usado opcionalmente).
  • Acesso ao Hugging Face para conjuntos de dados e modelos.
root@kitploit:~
pip install -r requirements.txt
huggingface-cli login   # if needed for gated models

🤗 Monitor LLM no Hugging Face

O monitor treinado é um adaptador LoRA (PEFT). Por padrão, main.py carrega automaticamente o checkpoint do Hub SecureLLMSys/AgentWatcher-Qwen3-4B-Instruct-2507 no SecureLLMSys (substitua com --monitor_llm).

🔬 Executando experimentos

Todos os lançadores estão em scripts/. Eles assumem que você executa a partir da raiz do repositório AgentWatcher (ou execute cd para lá primeiro). Primeiro, defina a chave OpenAI com export OPENAI_API_KEY=<SUA_CHAVE>. Edite os lançadores Python (all_datasets, all_defenses, gpus, name, modelos, etc.) para corresponder à sua varredura antes de executar.

Benchmark de contexto longo (main.py)

Trabalhos em lote (GPUs locais ou Slurm):

root@kitploit:~
python scripts/run_long_context.py

Isso aciona main.py com vLLM (--use_vllm) e escreve logs em logs/main_logs/<nome>/.... Sem GPU local, submete Slurm via scripts/main.sh.

Execução única sem o lançador:

root@kitploit:~
python main.py \
  --dataset lcc_long \
  --attack combined \
  --defense agentwatcher \
  --backend_llm Qwen/Qwen3-4B-Instruct-2507 \
  --monitor_llm SecureLLMSys/AgentWatcher-Qwen3-4B-Instruct-2507 \
  --use_vllm \
  --name my_run

Substituições de atribuição opcionais em main.py: --w_s, --w_l, --w_r, --K, --attribution_model.

AgentDojo

Para executar AgentDojo/AgentDyn, primeiro configure o ambiente seguindo PIArena (https://github.com/sleeepeer/PIArena):

root@kitploit:~
cd agents/agentdojo && pip install -e . && cd ../..

Depois execute:

root@kitploit:~
python scripts/run_agentdojo.py

Isso chama main_agentdojo.py e escreve logs em logs/agentdojo_logs/.... Sem GPU local, usa scripts/main_agentdojo.sh para Slurm. Para uma execução manual única, você pode chamar python main_agentdojo.py --model ... --defense agentwatcher --monitor_llm ... a partir da raiz do repositório; defina PIARENA_DEFENSE / PIARENA_MONITOR_LLM se seu wrapper esperar por eles. A defesa agentwatcher usa PIMonitorLLMDefenseAdapter.

AgentDyn

root@kitploit:~
./scripts/run_agentdyn.sh

Opcional: ./scripts/run_agentdyn.sh --model gpt-4o-2024-08-06 para executar agentwatcher com gpt-4o como LLM de backbone. O script ativa o ambiente conda agentdojo e executa a partir de agents/agentdyn/src. Recomendamos usar tmux para evitar que a execução seja interrompida.

InjecAgent

root@kitploit:~
python scripts/run_injecagent.py

Isso lança main_injecagent.py e registra logs em logs/main_logs/.... Ponto de entrada Slurm: scripts/main_injecagent.sh.

Invocação direta sem o lançador:

root@kitploit:~
python main_injecagent.py \
  --model meta-llama/Llama-3.1-8B-Instruct \
  --defense agentwatcher \
  --monitor_llm SecureLLMSys/AgentWatcher-Qwen3-4B-Instruct-2507 \
  --name my_injecagent_run

Agradecimentos

  • Este projeto incorpora código de PIArena, AgentDojo, AgentDyn, InjecAgent e AT2.

Citação

Se você usar este código, por favor cite o artigo AgentWatcher (quando disponível).

Baixar ferramenta