Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
PISmith — PISmith: Red Teaming baseado em Aprendizado por Reforço para Defesas contra Injeção de Prompts | Kitploit
Ferramentas/GitHubGitHub/albert-y1n/pismith
Geração de PayloadsAprendizado de MáquinaPapers e PesquisaRed TeamingSegurança de IAAtaque Adversário
GitHubalbert-y1n/pismith

PISmith

PISmith: Red Teaming baseado em Aprendizado por Reforço para Defesas contra Injeção de Prompts

Ver Repositório
2232há 1 mêsRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar

PISmith: Red Teaming baseado em Aprendizado por Reforço para Defesas contra Injeção de Prompt (COLM 2026)

Esta é uma implementação oficial de PISmith: Red Teaming baseado em Aprendizado por Reforço para Defesas contra Injeção de Prompt


Configuração do Ambiente

O PISmith foi testado usando Python 3.10 e CUDA Version: 12.9

1. Crie um ambiente conda Python 3.10

root@kitploit:~
conda create -n PISmith python=3.10 -y
conda activate PISmith

2. Instale as dependências

root@kitploit:~
pip install -r requirements.txt

3. (Opcional) Prepare o checkpoint do modelo Meta-SecAlign

Para experimentos que visam a defesa secalign, execute o script de mesclagem fornecido para baixar e mesclar o modelo base com o adaptador SecAlign:

root@kitploit:~
python merge_meta_secalign.py

Isso baixa meta-llama/Llama-3.1-8B-Instruct e facebook/Meta-SecAlign-8B do HuggingFace, mescla-os e salva o resultado em checkpoints/Meta-SecAlign-8B-merged/.


Scripts

PIArena

O PIArena oferece suporte a treinamento e avaliação contra uma variedade de defesas contra injeção de prompt. Use o argumento defense para selecionar a defesa alvo.

Defesas suportadas: secalign, none, promptguard, promptarmor, sandwich, instructional, datasentinel, piguard, datafilter

Treinamento

root@kitploit:~
bash scripts/train_piarena.sh <defense> [train_gpus] [target_gpu] [target_port]
ArgumentoPadrãoDescrição
defensesecalignDefesa contra a qual treinar
train_gpus"1,2,3"Índices de GPU para treinamento RL
target_gpu0GPU para o servidor vLLM alvo
target_port8010Porta para o servidor vLLM alvo

Exemplos:

root@kitploit:~
# Train against SecAlign defense
bash scripts/train_piarena.sh secalign

# Train against no defense (plain LLM)
bash scripts/train_piarena.sh none

Avaliação

root@kitploit:~
bash scripts/eval_piarena.sh <checkpoint> <defense> [target_port] [target_gpu] [attacker_gpu] [attacker_port] [num_samples]
ArgumentoPadrãoDescrição
checkpoint—Caminho para o checkpoint do atacante treinado
defensesecalignDefesa contra a qual avaliar
target_port8000Porta para o servidor vLLM alvo
target_gpu0GPU para o servidor vLLM alvo
attacker_gpu1GPU para o servidor vLLM do atacante
attacker_port8001Porta para o servidor vLLM do atacante
num_samples10pass@k: número de amostras por caso de teste

Exemplos:

root@kitploit:~
# Evaluate against SecAlign (default settings)
bash scripts/eval_piarena.sh checkpoints/piarena/checkpoint-500 secalign

# Evaluate against no piguard, pass@10
bash scripts/eval_piarena.sh checkpoints/piarena_none/checkpoint-500 piguard

AgentDojo

Suporta alvos GPT-4o-mini, GPT-4o, GPT-5-nano e vLLM local.

root@kitploit:~
bash scripts/train_agentdojo.sh [target_type] [suites] [train_gpus]
root@kitploit:~
# Default: GPT-4o-mini target on the firsr 7 injected task of workspace suite
bash scripts/train_agentdojo.sh

# Train on all suites (workspace, banking, travel, slack)
bash scripts/train_agentdojo.sh gpt4o-mini all

Avaliação:

root@kitploit:~
bash scripts/eval_agentdojo.sh <checkpoint> [target_type] [eval_suites] [num_samples] [target_defense]

# Example
bash scripts/eval_agentdojo.sh checkpoints/agentdojo/checkpoint-500 gpt4o-mini

AgentDyn

O AgentDyn é construído sobre o AgentDojo. Instale-o separadamente antes de executar experimentos com AgentDyn:

root@kitploit:~
git clone https://github.com/SaFo-Lab/AgentDyn.git
cd AgentDyn
pip install -e . --no-deps

O treinamento suporta suítes do AgentDyn, como github, dailylife e shopping.

root@kitploit:~
bash scripts/train_agentdyn.sh [target_type] [suites] [train_gpus]

# Example
bash scripts/train_agentdyn.sh gpt5-nano github "0,1,2,3"

A avaliação reporta tanto pass@k quanto ASR média em nível de amostra, e suporta servidor vLLM do atacante em paralelismo de dados:

root@kitploit:~
ATTACKER_GPUS=0,1,2,3 ATTACKER_DP_SIZE=4 \
bash scripts/eval_agentdyn.sh checkpoints/agentdyn/checkpoint-500 gpt5-nano "github,dailylife,shopping" 5

InjecAgent

Suporta um alvo vLLM local, GPT-4o-mini ou modo multi-alvo.

root@kitploit:~
bash scripts/train_injecagent.sh [target_type] [train_gpus] [target_gpu] [target_port]
root@kitploit:~
# Default: local vLLM target (Meta-SecAlign-8B)
bash scripts/train_injecagent.sh

# GPT-4o-mini API target
bash scripts/train_injecagent.sh gpt4o-mini

Avaliação:

root@kitploit:~
bash scripts/eval_injecagent.sh <checkpoint> [target_type] [target_gpu] [target_port] [eval_gpu] [num_samples]

# Example
bash scripts/eval_injecagent.sh checkpoints/injecagent/checkpoint-500

Resultados dos Experimentos

Resultados Principais (vs. Meta-SecAlign-8B, 13 Benchmarks)

O PISmith é avaliado contra 7 baselines que abrangem categorias de ataque estáticas, baseadas em busca e baseadas em RL. Todos os métodos baseados em RL reportam ASR@10 / ASR@1; métodos estáticos e baseados em busca reportam ASR@1.

MétodoCategoriaASR@10 MédioASR@1 Médio
DirectEstática—0.04
CombinedEstática—0.07
TAPBaseada em busca—0.11
PAIRBaseada em busca—0.16
StrategyBaseada em busca—0.21
Vanilla GRPOBaseada em RL0.130.05
RL-HammerBaseada em RL0.700.48
PISmith (Nosso)Baseada em RL1.000.87

Trade-off entre Utilidade e Robustez (8 Defesas, Qwen3-4B-Instruct-2507)

ASR@1 do PISmith calculado com média sobre 13 benchmarks. Utilidade mede a precisão da tarefa sem ataque.

DefesaTipoUtilidadeASR@1 do PISmith
Sem Defesa—0.740.92
SandwichPrevenção0.740.91
InstructionalPrevenção0.730.92
PromptArmorPrevenção0.740.92
DataFilterPrevenção0.630.49
PIGuardFiltro0.720.82
PromptGuardFiltro0.660.89
DataSentinelFiltro0.550.52

Permanece desafiador para defesas de última geração alcançar simultaneamente alta utilidade (≥0.70) e baixo ASR (≤0.60), revelando um trade-off fundamental entre utilidade e robustez.

Configurações de Agentes

InjecAgent

Modelo AlvoASR@1 DiretoASR@10/1 do PISmith
Meta-SecAlign-8B0.001.00 / 0.99
GPT-4o-mini0.021.00 / 0.99
GPT-4.1-nano0.011.00 / 1.00
GPT-5-nano0.001.00 / 0.95

AgentDojo (melhor baseline estático vs. PISmith)

Modelo AlvoMelhor ASR@1 EstáticoASR@10/1 do PISmith
GPT-4o-mini0.230.78 / 0.62
GPT-4.1-nano0.200.81 / 0.64
GPT-5-nano0.010.38 / 0.24
Baixar ferramenta