Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
PISmith — PISmith: Reinforcement-Learning-basiertes Red Teaming für Prompt-Injection-Abwehrmaßnahmen | Kitploit
Tools/GitHubGitHub/albert-y1n/pismith
Payload-GenerierungMaschinelles LernenPapers & ForschungRed TeamingKI-SicherheitAdversarial-Angriff
GitHubalbert-y1n/pismith

PISmith

PISmith: Reinforcement-Learning-basiertes Red Teaming für Prompt-Injection-Abwehrmaßnahmen

Repository anzeigen
2232vor 1 MonatVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen

PISmith: Reinforcement Learning-basiertes Red Teaming für Prompt-Injection-Abwehrmechanismen(COLM 2026)

Dies ist die offizielle Implementierung von PISmith: Reinforcement Learning-basiertes Red Teaming für Prompt-Injection-Abwehrmechanismen


Umgebungseinrichtung

PISmith wurde mit Python 3.10 und CUDA Version 12.9 getestet.

1. Erstellen Sie eine Conda-Umgebung mit Python 3.10

root@kitploit:~
conda create -n PISmith python=3.10 -y
conda activate PISmith

2. Abhängigkeiten installieren

root@kitploit:~
pip install -r requirements.txt

3. (Optional) Den Meta-SecAlign-Modell-Checkpoint vorbereiten

Führen Sie für Experimente gegen die secalign-Abwehr das mitgelieferte Merge-Skript aus, um das Basismodell mit dem SecAlign-Adapter herunterzuladen und zusammenzuführen:

root@kitploit:~
python merge_meta_secalign.py

Dies lädt meta-llama/Llama-3.1-8B-Instruct und facebook/Meta-SecAlign-8B von HuggingFace herunter, führt sie zusammen und speichert das Ergebnis unter checkpoints/Meta-SecAlign-8B-merged/.


Skripte

PIArena

PIArena unterstützt Training und Evaluierung gegen eine Reihe von Prompt-Injection-Abwehrmechanismen. Verwenden Sie das Argument defense, um die Zielabwehr auszuwählen.

Unterstützte Abwehrmechanismen: secalign, none, promptguard, promptarmor, sandwich, instructional, datasentinel, piguard, datafilter

Training

root@kitploit:~
bash scripts/train_piarena.sh <defense> [train_gpus] [target_gpu] [target_port]
ArgumentStandardBeschreibung
defensesecalignAbwehr, gegen die trainiert wird
train_gpus"1,2,3"GPU-Indizes für das RL-Training
target_gpu0GPU für den Ziel-vLLM-Server
target_port8010Port für den Ziel-vLLM-Server

Beispiele:

root@kitploit:~
# Train against SecAlign defense
bash scripts/train_piarena.sh secalign

# Train against no defense (plain LLM)
bash scripts/train_piarena.sh none

Evaluierung

root@kitploit:~
bash scripts/eval_piarena.sh <checkpoint> <defense> [target_port] [target_gpu] [attacker_gpu] [attacker_port] [num_samples]
ArgumentStandardBeschreibung
checkpoint—Pfad zum trainierten Angreifer-Checkpoint
defensesecalignAbwehr, gegen die evaluiert wird
target_port8000Port für den Ziel-vLLM-Server
target_gpu0GPU für den Ziel-vLLM-Server
attacker_gpu1GPU für den Angreifer-vLLM-Server
attacker_port8001Port für den Angreifer-vLLM-Server
num_samples10Pass@k: Anzahl der Stichproben pro Testfall

Beispiele:

root@kitploit:~
# Evaluate against SecAlign (default settings)
bash scripts/eval_piarena.sh checkpoints/piarena/checkpoint-500 secalign

# Evaluate against no piguard, pass@10
bash scripts/eval_piarena.sh checkpoints/piarena_none/checkpoint-500 piguard

AgentDojo

Unterstützt GPT-4o-mini, GPT-4o, GPT-5-nano und lokale vLLM-Ziele.

root@kitploit:~
bash scripts/train_agentdojo.sh [target_type] [suites] [train_gpus]
root@kitploit:~
# Default: GPT-4o-mini target on the firsr 7 injected task of workspace suite
bash scripts/train_agentdojo.sh

# Train on all suites (workspace, banking, travel, slack)
bash scripts/train_agentdojo.sh gpt4o-mini all

Evaluierung:

root@kitploit:~
bash scripts/eval_agentdojo.sh <checkpoint> [target_type] [eval_suites] [num_samples] [target_defense]

# Example
bash scripts/eval_agentdojo.sh checkpoints/agentdojo/checkpoint-500 gpt4o-mini

AgentDyn

AgentDyn basiert auf AgentDojo. Installieren Sie es separat, bevor Sie AgentDyn-Experimente ausführen:

root@kitploit:~
git clone https://github.com/SaFo-Lab/AgentDyn.git
cd AgentDyn
pip install -e . --no-deps

Das Training unterstützt AgentDyn-Suiten wie github, dailylife und shopping.

root@kitploit:~
bash scripts/train_agentdyn.sh [target_type] [suites] [train_gpus]

# Example
bash scripts/train_agentdyn.sh gpt5-nano github "0,1,2,3"

Die Evaluierung berichtet sowohl pass@k als auch die durchschnittliche ASR auf Stichprobenebene und unterstützt datenparalleles Serving des Angreifer-vLLM:

root@kitploit:~
ATTACKER_GPUS=0,1,2,3 ATTACKER_DP_SIZE=4 \
bash scripts/eval_agentdyn.sh checkpoints/agentdyn/checkpoint-500 gpt5-nano "github,dailylife,shopping" 5

InjecAgent

Unterstützt ein lokales vLLM-Ziel, GPT-4o-mini oder den Multi-Ziel-Modus.

root@kitploit:~
bash scripts/train_injecagent.sh [target_type] [train_gpus] [target_gpu] [target_port]
root@kitploit:~
# Default: local vLLM target (Meta-SecAlign-8B)
bash scripts/train_injecagent.sh

# GPT-4o-mini API target
bash scripts/train_injecagent.sh gpt4o-mini

Evaluierung:

root@kitploit:~
bash scripts/eval_injecagent.sh <checkpoint> [target_type] [target_gpu] [target_port] [eval_gpu] [num_samples]

# Example
bash scripts/eval_injecagent.sh checkpoints/injecagent/checkpoint-500

Experimentergebnisse

Hauptergebnisse (vs. Meta-SecAlign-8B, 13 Benchmarks)

PISmith wird gegen 7 Baselines aus den Kategorien statisch, suchbasiert und RL-basiert evaluiert. Alle RL-basierten Methoden berichten ASR@10 / ASR@1; statische und suchbasierte Methoden berichten ASR@1.

MethodeKategorieAvg. ASR@10Avg. ASR@1
DirectStatisch—0.04
CombinedStatisch—0.07
TAPSuchbasiert—0.11
PAIRSuchbasiert—0.16
StrategySuchbasiert—0.21
Vanilla GRPORL-basiert0.130.05
RL-HammerRL-basiert0.700.48
PISmith (unser)RL-basiert1.000.87

Nutzen–Robustheits-Abwägung (8 Abwehrmechanismen, Qwen3-4B-Instruct-2507)

PISmith ASR@1 gemittelt über 13 Benchmarks. Der Nutzen misst die Aufgaben-Genauigkeit ohne Angriff.

AbwehrTypNutzenPISmith ASR@1
Keine Abwehr—0.740.92
SandwichPrävention0.740.91
InstructionalPrävention0.730.92
PromptArmorPrävention0.740.92
DataFilterPrävention0.630.49
PIGuardFilter0.720.82
PromptGuardFilter0.660.89
DataSentinelFilter0.550.52

Es bleibt eine Herausforderung für moderne Abwehrmechanismen, gleichzeitig einen hohen Nutzen (≥0.70) und eine niedrige ASR (≤0.60) zu erreichen, was einen grundlegenden Nutzen–Robustheits-Konflikt offenbart.

Agentische Szenarien

InjecAgent

ZielmodellDirect ASR@1PISmith ASR@10/1
Meta-SecAlign-8B0.001.00 / 0.99
GPT-4o-mini0.021.00 / 0.99
GPT-4.1-nano0.011.00 / 1.00
GPT-5-nano0.001.00 / 0.95

AgentDojo (beste statische Baseline vs. PISmith)

ZielmodellBeste statische ASR@1PISmith ASR@10/1
GPT-4o-mini0.230.78 / 0.62
GPT-4.1-nano0.200.81 / 0.64
GPT-5-nano0.010.38 / 0.24
Tool herunterladen