Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
StealthRL — StealthRL: RL-Framework zum adversarialen Umschreiben von KI-Text, um die Robustheit von Detektoren zu testen. | Kitploit
Tools/GitHubGitHub/suraj-ranganath/stealthrl
Papers & ForschungLernen & BildungRed TeamingKI-SicherheitAdversarial-Angriff
GitHubsuraj-ranganath/stealthrl

StealthRL

StealthRL: RL-Framework zum adversarialen Umschreiben von KI-Text, um die Robustheit von Detektoren zu testen.

Repository anzeigen
182vor 2 MonatenNoch nicht geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Webseite

StealthRL: Paraphrase-Angriffe mit Reinforcement Learning zur Umgehung mehrerer KI-Text-Detektoren

Paper (arXiv)
Demo
Modell (Hugging Face)
Benchmark-Datensatz (Hugging Face)

StealthRL-Pipeline-Übersicht

Zusammenfassung

KI-Text-Detektoren werden zunehmend in sicherheitskritischen Umgebungen eingesetzt, doch ihre Robustheit gegenüber bedeutungserhaltendem adversarialem Umschreiben bleibt ungewiss. Wir stellen StealthRL vor, ein Reinforcement-Learning-Framework zum Stresstesten von KI-Text-Detektoren mit adaptiven Paraphrase-Angriffen. StealthRL trainiert eine Paraphrase-Policy gegen ein Detektor-Ensemble, während der semantische Gehalt erhalten bleibt, und bewertet anschließend die Übertragung auf nicht im Training verwendete Detektorfamilien. Im vollständigen gefilterten MAGE-Testpool (15.310 menschliche / 14.656 KI-Stichproben) reduziert StealthRL die mittlere AUROC von 0,79 auf 0,43 und erreicht einen mittleren TPR@1%FPR von 0,024 über RoBERTa, Fast-DetectGPT, Binoculars und MAGE. Der Angriff überträgt sich auf zwei Detektoren, die nicht im Training verwendet wurden, und legt dabei gemeinsame Schwachstellen offen statt eines einzelnen Detektorversagens. Wir analysieren darüber hinaus die Score-Verteilungen der Detektoren und bewerten die Qualität mit E5, BERTScore und LLM-basierten Likert-Bewertungen. Unsere Ergebnisse zeigen, dass aktuelle KI-Text-Detektoren unter realistischem Paraphrasierungsdruck fragil bleiben, und liefern ein reproduzierbares Protokoll für die Bewertung adversarialer Robustheit.

Was dieses Repository enthält

Dieses Repository ist die Forschungs- und Engineering-Codebasis hinter StealthRL. Es enthält:

  • GRPO-basierten Trainingscode für die StealthRL-Paraphrase-Policy
  • Implementierungen der Angriffsmethoden für die Paper-Methoden M0-M5
  • Detektor-Wrapper und Evaluationswerkzeuge
  • die mehrstufige Full-MAGE-Evaluationspipeline zur Erzeugung der berichteten Ergebnisse
  • Code für Plots, Metriken und Qualitätsbewertung, um publikationsreife Abbildungen und Tabellen zu erstellen

Das Repository soll ein nützlicher Ausgangspunkt für Forschende sein, die Folgendes möchten:

  • unsere Evaluierung der Detektor-Robustheit reproduzieren
  • neue Detektoren oder Angriffsmethoden einbinden
  • die Übertragung auf nicht im Training verwendete Detektorfamilien untersuchen
  • eigene Paraphrasierungsabwehr oder Red-Team-Methoden benchmarken

Repository-Übersicht

  • stealthrl/: Trainingscode, Detektor-Wrapper, Belohnungen, Datenwerkzeuge und das ursprüngliche StealthBench-Paket
  • eval/: Evaluations-Harness in Forschungsqualität für die Paper-Ergebnisse
  • scripts/: ausführbare Einstiegspunkte für Training, Evaluierung, Orchestrierung, Plotten und Dienstprogramme
  • configs/: YAML-Konfigurationen für Training, Evaluierung und Ablationen
  • figures/: Pipeline-Diagramme und statische Ressourcen
  • tests/: Integrations- und Plausibilitätstests
  • analysis/: Ad-hoc-Analysehelfer und Einmal-Werkzeuge

Umgebungseinrichtung

Grundumgebung

root@kitploit:~
python -m venv venv
source venv/bin/activate
pip install --upgrade pip
pip install -r requirements.txt

Optionale Abhängigkeiten

Je nachdem, welche Teile des Projekts Sie ausführen möchten, benötigen Sie möglicherweise auch:

root@kitploit:~
pip install tinker
pip install openai
pip install vllm

Hinweise:

  • tinker wird für den cloudbasierten StealthRL-Checkpoint-Inferenzpfad benötigt, der von M2 verwendet wird.
  • openai wird nur für den Qualitätsbewertungsschritt mit GPT/Likert benötigt.
  • vllm wird für schnelle lokale Generierung in den Paper-Baselines empfohlen.

Umgebungsvariablen

Typische Umgebungsvariablen, die vom Repository verwendet werden:

root@kitploit:~
export HF_HOME=$HOME/.cache/huggingface
export TRANSFORMERS_CACHE=$HF_HOME
export OPENAI_API_KEY=...
export TINKER_API_KEY=...

Für die mehrstufige Paper-Evaluationspipeline haben wir eine Env-Datei sowie ein Checkpoint-Deskriptor-JSON verwendet. Die öffentlichen Skripte ermöglichen es Ihnen, beide Pfade explizit zu überschreiben:

root@kitploit:~
python scripts/run_full_mage_research_eval.py \
  --env-file ~/.config/stealthrl/eval.env \
  --checkpoint-json ~/.config/stealthrl/m2_checkpoint.json

Schnellstart

Schneller Evaluations-Smoke-Test

root@kitploit:~
python scripts/run_eval.py --quick

Das Legacy-StealthBench-Harness ausführen

root@kitploit:~
python scripts/run_stealthbench.py --config configs/stealthbench.yaml

Dies lädt nun die konfigurierten Textdateien, führt die konfigurierten Detektoren aus, speichert CSV-Ausgaben und erzeugt Vergleichsplots. Der alte Nur-TODO-Stub wurde entfernt.

Eine mehrstufige vollständige MAGE-Evaluierung ausführen

root@kitploit:~
python scripts/run_full_mage_research_eval.py \
  --env-file ~/.config/stealthrl/eval.env \
  --checkpoint-json ~/.config/stealthrl/m2_checkpoint.json \
  --run-root outputs/eval_runs/full_mage_public \
  --gpus 0 1 2 3

Die Demo-Website ausführen

Das Repository enthält eine auf FastAPI basierende Demo-Website unter demo/. Sie bietet eine ausgereifte statische Benutzeroberfläche und stellt POST /api/paraphrase mit API-Key-Unterstützung sowie einem öffentlichen Kontingent von 20 Anfragen pro Tag für nicht authentifizierte Benutzer bereit.

root@kitploit:~
pip install -r demo/requirements.txt
uvicorn demo.stealthrl_demo.app:app --reload --port 8080

Standardmäßig läuft die Demo im kostenlosen mock-Modus für UI-Tests. Um den echten StealthRL-Sampler zu verwenden, setzen Sie STEALTHRL_DEMO_INFERENCE_BACKEND=tinker, STEALTHRL_DEMO_CHECKPOINT_JSON und TINKER_API_KEY. Hinweise zu API-Key, Kontingent, Docker und AWS-Bereitstellung finden Sie in demo/README.md.

Reproduktion der Paper-Ergebnisse

Das Paper berichtet Ergebnisse über den vollständigen gefilterten MAGE-Evaluationspool:

  • 15.310 menschliche Stichproben
  • 14.656 KI-Stichproben
  • 29.966 insgesamt

Die Evaluationspipeline in Forschungsqualität ist im Modul eval/ sowie in den mehrstufigen Skripten unter scripts/ implementiert.

Empfohlener Ablauf zur Reproduktion

  1. Bereiten Sie Anmeldedaten und Checkpoint-Metadaten vor.

    Erstellen Sie eine Env-Datei mit OPENAI_API_KEY und TINKER_API_KEY sowie ein Checkpoint-JSON, das den Pfad des StealthRL-Tinker-Samplers beschreibt.

  2. Führen Sie den Preflight aus.

root@kitploit:~
python scripts/preflight_research_eval.py \
  --env-file ~/.config/stealthrl/eval.env \
  --checkpoint-json ~/.config/stealthrl/m2_checkpoint.json
  1. Starten Sie die vollständige Evaluierung.
root@kitploit:~
python scripts/run_full_mage_research_eval.py \
  --env-file ~/.config/stealthrl/eval.env \
  --checkpoint-json ~/.config/stealthrl/m2_checkpoint.json \
  --run-root outputs/eval_runs/full_mage_repro \
  --gpus 0 1 2 3
  1. Prüfen Sie die erzeugten Methodenausgaben, Detektor-Scores, Metriken und Plots im gewählten Run-Verzeichnis.

  2. Wenn Sie nur die GPT-basierte Qualitätsbewertung auf zwischengespeicherten Ausgaben erneut ausführen müssen:

root@kitploit:~
python scripts/run_gpt_quality_only.py \
  --run-root outputs/eval_runs/full_mage_repro \
  --env-file ~/.config/stealthrl/eval.env
  1. Wenn Sie nur BERTScore zu einem assemblierten Run mit zwischengespeicherten Ausgaben hinzufügen müssen:
root@kitploit:~
python scripts/compute_bertscore_for_run.py \
  --run-dir outputs/eval_runs/full_mage_repro/assembled \
  --device cuda:0 \
  --batch-size 16 \
  --chunk-size 512

Das BERTScore-Skript aktualisiert quality.parquet und quality.csv nach jedem Chunk direkt im Bestand, sodass unterbrochene Läufe fortgesetzt werden können, ohne abgeschlossene Zeilen neu zu berechnen. Verwenden Sie --limit-per-method für einen kleinen Smoke-Test und --force nur, wenn Sie vorhandene BERTScore-Spalten gezielt neu berechnen möchten.

Hauptausgabe-Artefakte

Der mehrstufige Lauf erzeugt:

  • method_runs/: pro Methode erzeugte Ausgaben
  • detector_scores/: Parquet-Score-Dateien pro Detektor
  • assembled/metrics.json: aggregierte Detektor-Metriken
  • assembled/thresholds.json: kalibrierte Detektor-Schwellenwerte
  • assembled/quality.parquet: automatische Qualitätsmetriken
  • assembled/quality_gpt.parquet: GPT/Likert-Qualitätsbewertungen
  • assembled/figures/: publikationsreife Plots

Kanonische Paper-Einstellungen

Der primäre Paper-Checkpoint verwendet configs/tinker_mage_10k.yaml als kanonische Trainingskonfiguration: Qwen3-4B-Instruct mit LoRA-Rang 32, GRPO-Gruppengröße 8, 10.000 MAGE-Trainingsstichproben, drei Epochen, Lernrate 2.8e-4, KL-Koeffizient 0.05, Temperatur 1.0, Top-p 0.9 sowie ein Zwei-Detektor-Belohnungsensemble mit Gewichtung 0.6 RoBERTa / 0.4 Fast-DetectGPT. Andere Konfigurationen in configs/ sind als Legacy-Beispiele, Smoke-Test-Einstellungen oder Ablationsvorlagen enthalten und sollten, sofern nicht ausdrücklich dokumentiert, nicht als maßgeblich für das Paper behandelt werden.

Trainingsimplementierung

StealthRL trainiert eine Paraphrase-Policy anstelle eines Detektors. Die Kernidee besteht darin, ein Modell zu optimieren, das KI-generierten Text so umschreibt, dass er semantisch treu bleibt und gleichzeitig die Detektor-Konfidenz verringert.

Modell und Optimierung

  • Basismodell: Qwen/Qwen3-4B-Instruct-2507
  • Adaption: LoRA
  • RL-Algorithmus: GRPO
  • Trainingsstil: detektorgeführte Optimierung der Paraphrase-Policy

Belohnungsdesign

Die Belohnung ist multikriteriell und balanciert:

  • Detektor-Umgehung gegenüber dem im Training verwendeten Detektor-Ensemble
  • semantische Erhaltung relativ zum Quelltext
  • Randbedingungen für Gültigkeit und Stabilität der Generierung

Die Implementierung befindet sich hauptsächlich in:

  • stealthrl/tinker/train.py
  • stealthrl/rewards/
  • configs/

Verhalten zur Inferenzzeit

Der StealthRL-Angriff des Papers ist zur Testzeit Single-Shot:

  • ein Policy-Generierungsaufruf pro Stichprobe
  • keine iterative Verfeinerungsschleife
  • keine Abfragen des Zieldetektors während der Evaluierung

Der Detektorzugriff wird für das Offline-RL-Training und die externe Evaluierung verwendet, nicht für adaptive Suchabfragen zur Laufzeit in M2.

Evaluationsimplementierung

Die Paper-Evaluierung ist im neueren eval/-Stack implementiert und nicht im älteren stealthrl/evaluation/-Harness.

Methoden

  • M0: kein Angriff
  • M1: einfache Paraphrase-Baseline
  • M2: StealthRL
  • M3: detektorgeführte adversarial Paraphrasierungs-Baseline
  • M4: AuthorMist-Baseline
  • M5: Zeichenebenen-Verschleierungs-Baseline

Relevanter Code:

  • eval/methods/
  • scripts/generate_method_outputs.py

Detektor-Panel

Das Haupt-Detektor-Panel des Papers verwendet:

  • roberta: openai-community/roberta-large-openai-detector
  • fast_detectgpt
  • binoculars
  • mage: yaful/MAGE

Das Repository behält außerdem ghostbuster-Unterstützung für Legacy-/Kompatibilitätsexperimente bei, aber Ghostbuster ist nicht Teil des endgültigen Vier-Detektor-Panels des Papers.

Relevanter Code:

  • eval/detectors.py
  • scripts/score_detector_outputs.py
  • eval/runner.py

Metriken und Qualitätsanalyse

Der öffentliche Evaluierungscode berechnet:

  • AUROC
  • TPR@1%FPR
  • TPR@5%FPR
  • ASR
  • E5-Ähnlichkeit
  • BERTScore-Präzision/Recall/F1
  • Perplexität
  • Editierrate
  • GPT/Likert-Qualitäts- und Ähnlichkeitswerte
  • Bootstrap-Konfidenzintervalle

Relevanter Code:

  • eval/metrics.py
  • eval/plots.py
  • eval/quality_judge.py
  • scripts/finalize_eval_run.py

Technische Hinweise

vLLM-Integration

Der aktuelle Evaluierungscode unterstützt vLLM-gestützte lokale Generierung für die Hochdurchsatz-Evaluierung von Baselines. Dies ist implementiert in:

  • eval/methods/vllm_backend.py

Tinker-Integration

Die StealthRL-Methode M2 unterstützt Tinker-gestütztes Sampling über ein Checkpoint-Deskriptor-JSON. Dieser Pfad ist implementiert in:

  • eval/methods/stealthrl.py

Fortsetzbarkeit und mehrstufige Orchestrierung

Die Full-MAGE-Pipeline ist bewusst mehrstufig aufgebaut:

  • Preflight-Prüfungen schlagen bei Detektor-/Modell-Setup-Problemen schnell fehl
  • die Generierung pro Methode ist isoliert und fortsetzbar
  • die Detektor-Bewertung ist von der Generierung getrennt
  • die finale Assemblierung und GPT-Bewertung sind fortsetzbar

Dadurch werden lange Multi-GPU-Läufe robuster und einfacher zu debuggen.

Erweiterung des Repositorys

Eine neue Angriffsmethode hinzufügen

  1. Fügen Sie eine Klasse unter eval/methods/ hinzu
  2. Implementieren Sie die BaseAttackMethod-Schnittstelle
  3. Registrieren Sie die Methode in eval/methods/__init__.py
  4. Fügen Sie sie dem mehrstufigen Runner hinzu, wenn Sie sie in orchestrierte Läufe einbeziehen möchten

Einen neuen Detektor hinzufügen

  1. Fügen Sie einen Detektor-Wrapper zum Evaluations-Stack hinzu
  2. Implementieren Sie Laden und Batch-Bewertung
  3. Registrieren Sie ihn im Detektor-Registry, das von eval/runner.py verwendet wird
  4. Fügen Sie bei Bedarf Schwellenwerte, Plots und Tabellen-Hooks hinzu

Einen neuen Benchmark-Datensatz hinzufügen

  1. Fügen Sie einen Datensatz-Loader oder Adapter hinzu
  2. Normalisieren Sie ihn in das Evaluations-Stichprobenschema
  3. Aktualisieren Sie die Run-Skripte mit dem Datensatznamen und der Sampling-Logik

Verantwortungsvolle Nutzung

Dieses Repository wird für die Forschung zur Robustheit von KI-Text-Detektoren, zur adversarialen Evaluierung und zum defensiven Benchmarking veröffentlicht. Es ist nicht dazu gedacht, Betrug, Plagiate oder die Umgehung legitimer Sicherheits- und Integritätssysteme zu unterstützen.

Wenn Sie auf dieser Arbeit aufbauen, nutzen Sie sie bitte, um die Robustheit der Detektoren, die Kalibrierung, die Übertragbarkeitsbewertung und die Transparenz hinsichtlich der Einschränkungen bei der Bereitstellung zu verbessern.

Zitieren

Wenn Sie dieses Repository verwenden, zitieren Sie bitte das Paper:

root@kitploit:~
@article{ranganath2026stealthrl,
  title={StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors},
  author={Ranganath, Suraj and others},
  journal={arXiv preprint arXiv:2602.08934},
  year={2026}
}
Tool herunterladen