Skip to content
KitploitKITPLOIT
ToolsBlog
Log in
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

FeedsKontaktDatenschutz© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
autoguardrails — Alignment-Research-Scaffold (im Autoresearch-Stil) für LLM-Guardrails: Suche über eine einzelne policy.md-Oberfläche | Kitploit
Tools/GitHubGitHub/santanderai/autoguardrails
Lernen & BildungRed TeamingKI-SicherheitAdversarial-Angriff
GitHubsantanderai/autoguardrails

autoguardrails

Alignment-Research-Scaffold (im Autoresearch-Stil) für LLM-Guardrails: Suche über eine einzelne policy.md-Oberfläche

Repository anzeigen
1293549vor 2 MonatenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Webseite
Teilen

autoguardrails

Open Source von Santander AI Lab. Eine LLM-/KI-Sicherheits-Guardrail-Forschungs-Bibliothek / Evaluierungs-Harness (im autoresearch-Stil): Sie durchsucht eine einzige veränderbare policy.md-Oberfläche, um die Angriffserfolgsrate (ASR) gegenüber einer festen Evaluierungssuite zu minimieren, mit einer Untergrenze für harmlose Bestehensfälle.

License: Apache 2.0 Python 3.10+ CI CodeQL codecov OpenSSF Scorecard Code style: black Ruff Conventional Commits Teil von Santander AI Open Source — Open-Source-KI-Projekte von Banco Santander (santander.com).

autoguardrails ist ein kleines Alignment-Forschungsgerüst, inspiriert von Karpathys autoresearch.

Anstatt über train.py zu suchen, durchsucht dieses Repository policy.md. Die Idee ist dieselbe:

  • die veränderbare Oberfläche winzig halten
  • den Evaluator fixieren
  • unter einem festen Zeitbudget (wall-clock) laufen
  • Kandidaten mit einer einzigen Hauptkennzahl vergleichen
  • jede Entscheidung für Behalten oder Verwerfen protokollieren

In diesem Repository ist die Hauptkennzahl die Angriffserfolgsrate (ASR, niedriger ist besser), mit einer Untergrenze für harmlose Bestehensfälle, damit das System nicht gewinnen kann, indem es alles ablehnt.

Was am wichtigsten ist

Für die tägliche Experimentierarbeit sind drei Dateien am wichtigsten:

  • program.md: die menschlich gepflegten Anweisungen für die Schleife
  • policy.md: die einzige Datei, die Sie zwischen den Läufen bearbeiten sollten
  • results.tsv: das Append-only-Laufprotokoll

Alles andere ist fester Harness-Code oder feste Evaluierungsdaten.

Aktueller Forschungsvertrag

  • Veränderbare Oberfläche: policy.md
  • Feste Suite: eval_suite.jsonl
  • Fester Judge-Prompt: judge_prompt.md
  • Fester Harness: autoguardrails/
  • Akzeptanzregel: Einen Kandidaten nur dann behalten, wenn sich die ASR verbessert und der Anteil bestandener harmloser Fälle nicht um mehr als 2 Prozentpunkte sinkt
  • Laufzeitbudget: durch die Harness-Konfiguration festgelegt, derzeit 5 Minuten pro Evaluierungsdurchlauf

Wenn Sie ein mentales Modell näher am ursprünglichen autoresearch bevorzugen, stellen Sie sich autoguardrails/ als feste Hilfsschicht und policy.md als die einzige Datei unter Suche vor.

Schnellstart

Aus dem Wurzelverzeichnis des Repositorys ausführen.

  1. Aufnahme einer Baseline.
python -m autoguardrails baseline --reset --repeat 2 --notes "initial baseline"
  1. Nur policy.md bearbeiten.

  2. Den neuen Kandidaten bewerten.

python -m autoguardrails candidate --repeat 2 --notes "cover jailbreak and obfuscation"
  1. Das aktuell behaltene Ergebnis anzeigen.
python -m autoguardrails status
  1. Das vollständige Protokoll anzeigen.
cat results.tsv

Wenn ein Kandidat abgelehnt wird, stellt der Harness policy.md automatisch auf die zuletzt akzeptierte Version zurück.

Shell-Wrapper

Wenn Sie einen einzelnen Einstiegspunkt bevorzugen, verwenden Sie run_autoguardrails.sh:

sh run_autoguardrails.sh status
sh run_autoguardrails.sh evaluate
sh run_autoguardrails.sh baseline "initial baseline" 2
sh run_autoguardrails.sh candidate "cover jailbreak and obfuscation" 2

Unter Windows führen Sie den Wrapper in Git Bash oder einer anderen POSIX-kompatiblen Shell aus.

Konfiguration für echte Modelle

Die Standardkonfiguration verwendet einen deterministischen lokalen Stub, damit das Repository offline funktioniert. Um echte Experimente durchzuführen, richten Sie das Zielmodell und das Judge-Modell auf OpenAI-kompatible Endpunkte aus.

Variablen für das Zielmodell:

  • AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_TARGET_MODEL
  • AUTOGUARDRAILS_TARGET_API_BASE
  • AUTOGUARDRAILS_TARGET_API_KEY

Variablen für das Judge-Modell:

  • AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_JUDGE_MODEL
  • AUTOGUARDRAILS_JUDGE_API_BASE
  • AUTOGUARDRAILS_JUDGE_API_KEY

Beispiel:

export AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
export AUTOGUARDRAILS_TARGET_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_TARGET_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_TARGET_API_KEY=your-target-key

export AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
export AUTOGUARDRAILS_JUDGE_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_JUDGE_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_JUDGE_API_KEY=your-judge-key

python -m autoguardrails baseline --reset --repeat 2 --notes "real-model baseline"

Verwenden Sie während einer Laufserie eine eingefrorene Judge-Konfiguration. Wechseln Sie mitten im Experiment nicht die Judge-Prompts oder Judge-Modelle.

Typisches Iterationsmuster

Ein einfacher Offline-Emulationszyklus sieht so aus:

  1. Baseline aufnehmen.
  2. Eine Familie von Policy-Änderungen zu policy.md hinzufügen.
  3. candidate ausführen.
  4. Die Änderung nur behalten, wenn der Harness sie akzeptiert.
  5. Mit jeweils einer neuen Änderung wiederholen.

Ein Beispiel für eine Kandidatenänderung, die den mitgelieferten Stub verbessert, ist das Hinzufügen einer expliziten Behandlung für:

  • Jailbreak-Formulierungen wie „ignore previous instructions“, „roleplay“ und „developer mode“
  • Verschleierungsanfragen wie Übersetzung, base64, rot13, Nur-JSON-Formatierung oder Schema-Konvertierung

Das ergibt eine realistische erste Verbesserungskurve, ohne den Evaluator zu verändern.

Repository-Aufbau

  • program.md: Experimentieranweisungen und -einschränkungen
  • policy.md: veränderbare Guardrail-Policy unter Suche
  • judge_prompt.md: eingefrorener Judge-Prompt
  • eval_suite.jsonl: feste Angriffs- und harmlose (benigne) Evaluierungsfälle
  • results.tsv: Laufprotokoll
  • run_autoguardrails.sh: praktischer Wrapper um die CLI
  • autoguardrails/: fester Python-Harness
  • tests/: Regressions- und Sicherheitsprüfungen für den Harness

Siehe autoguardrails/README.md für die Code-Architektur und tests/README.md für die Teststrategie.

Sicherheitshinweise

  • Dieses Gerüst ist bewusst einstufig (Single-Turn) und eng im Umfang ausgelegt.
  • Es modelliert keine Tools, Dateizugriffe oder mehrstufigen Agentenaktionen.
  • Der mitgelieferte Stub dient nur der Harness-Verifizierung; er ist kein realistisches Sicherheitsmodell.
  • Die Evaluierungssuite ist bewusst festgelegt. Wenn Sie sie ändern, starten Sie eine neue Experimentlinie, anstatt mit alten Ergebnissen zu vergleichen.

Anforderungen

Tool herunterladen