Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
autoguardrails — Alignment-Research-Scaffold (im Autoresearch-Stil) für LLM-Guardrails: Suche über eine einzelne policy.md-Oberfläche | Kitploit
Tools/GitHubGitHub/santanderai/autoguardrails
Lernen & BildungRed TeamingKI-SicherheitAdversarial-Angriff
GitHubsantanderai/autoguardrails

autoguardrails

Alignment-Research-Scaffold (im Autoresearch-Stil) für LLM-Guardrails: Suche über eine einzelne policy.md-Oberfläche

Repository anzeigen
1293537vor 1 MonatVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Webseite
Teilen

autoguardrails

Open Source von Santander AI Lab. Eine LLM-/KI-Sicherheits-Guardrail-Forschungs-Bibliothek / Evaluierungs-Harness (im autoresearch-Stil): Sie durchsucht eine einzige veränderbare policy.md-Oberfläche, um die Angriffserfolgsrate (ASR) gegenüber einer festen Evaluierungssuite zu minimieren, mit einer Untergrenze für harmlose Bestehensfälle.

License: Apache 2.0 Python 3.10+ CI CodeQL codecov OpenSSF Scorecard Code style: black Ruff Conventional Commits Teil von Santander AI Open Source — Open-Source-KI-Projekte von Banco Santander (santander.com).

autoguardrails ist ein kleines Alignment-Forschungsgerüst, inspiriert von Karpathys autoresearch.

Anstatt über train.py zu suchen, durchsucht dieses Repository policy.md. Die Idee ist dieselbe:

  • die veränderbare Oberfläche winzig halten
  • den Evaluator fixieren
  • unter einem festen Zeitbudget (wall-clock) laufen
  • Kandidaten mit einer einzigen Hauptkennzahl vergleichen
  • jede Entscheidung für Behalten oder Verwerfen protokollieren

In diesem Repository ist die Hauptkennzahl die Angriffserfolgsrate (ASR, niedriger ist besser), mit einer Untergrenze für harmlose Bestehensfälle, damit das System nicht gewinnen kann, indem es alles ablehnt.

Was am wichtigsten ist

Für die tägliche Experimentierarbeit sind drei Dateien am wichtigsten:

  • program.md: die menschlich gepflegten Anweisungen für die Schleife
  • policy.md: die einzige Datei, die Sie zwischen den Läufen bearbeiten sollten
  • results.tsv: das Append-only-Laufprotokoll

Alles andere ist fester Harness-Code oder feste Evaluierungsdaten.

Aktueller Forschungsvertrag

  • Veränderbare Oberfläche: policy.md
  • Feste Suite: eval_suite.jsonl
  • Fester Judge-Prompt: judge_prompt.md
  • Fester Harness: autoguardrails/
  • Akzeptanzregel: Einen Kandidaten nur dann behalten, wenn sich die ASR verbessert und der Anteil bestandener harmloser Fälle nicht um mehr als 2 Prozentpunkte sinkt
  • Laufzeitbudget: durch die Harness-Konfiguration festgelegt, derzeit 5 Minuten pro Evaluierungsdurchlauf

Wenn Sie ein mentales Modell näher am ursprünglichen autoresearch bevorzugen, stellen Sie sich autoguardrails/ als feste Hilfsschicht und policy.md als die einzige Datei unter Suche vor.

Schnellstart

Aus dem Wurzelverzeichnis des Repositorys ausführen.

  1. Aufnahme einer Baseline.
root@kitploit:~
python -m autoguardrails baseline --reset --repeat 2 --notes "initial baseline"
  1. Nur policy.md bearbeiten.

  2. Den neuen Kandidaten bewerten.

root@kitploit:~
python -m autoguardrails candidate --repeat 2 --notes "cover jailbreak and obfuscation"
  1. Das aktuell behaltene Ergebnis anzeigen.
root@kitploit:~
python -m autoguardrails status
  1. Das vollständige Protokoll anzeigen.
root@kitploit:~
cat results.tsv

Wenn ein Kandidat abgelehnt wird, stellt der Harness policy.md automatisch auf die zuletzt akzeptierte Version zurück.

Shell-Wrapper

Wenn Sie einen einzelnen Einstiegspunkt bevorzugen, verwenden Sie run_autoguardrails.sh:

root@kitploit:~
sh run_autoguardrails.sh status
sh run_autoguardrails.sh evaluate
sh run_autoguardrails.sh baseline "initial baseline" 2
sh run_autoguardrails.sh candidate "cover jailbreak and obfuscation" 2

Unter Windows führen Sie den Wrapper in Git Bash oder einer anderen POSIX-kompatiblen Shell aus.

Konfiguration für echte Modelle

Die Standardkonfiguration verwendet einen deterministischen lokalen Stub, damit das Repository offline funktioniert. Um echte Experimente durchzuführen, richten Sie das Zielmodell und das Judge-Modell auf OpenAI-kompatible Endpunkte aus.

Variablen für das Zielmodell:

  • AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_TARGET_MODEL
  • AUTOGUARDRAILS_TARGET_API_BASE
  • AUTOGUARDRAILS_TARGET_API_KEY

Variablen für das Judge-Modell:

  • AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_JUDGE_MODEL
  • AUTOGUARDRAILS_JUDGE_API_BASE
  • AUTOGUARDRAILS_JUDGE_API_KEY

Beispiel:

root@kitploit:~
export AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
export AUTOGUARDRAILS_TARGET_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_TARGET_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_TARGET_API_KEY=your-target-key

export AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
export AUTOGUARDRAILS_JUDGE_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_JUDGE_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_JUDGE_API_KEY=your-judge-key

python -m autoguardrails baseline --reset --repeat 2 --notes "real-model baseline"

Verwenden Sie während einer Laufserie eine eingefrorene Judge-Konfiguration. Wechseln Sie mitten im Experiment nicht die Judge-Prompts oder Judge-Modelle.

Typisches Iterationsmuster

Ein einfacher Offline-Emulationszyklus sieht so aus:

  1. Baseline aufnehmen.
  2. Eine Familie von Policy-Änderungen zu policy.md hinzufügen.
  3. candidate ausführen.
  4. Die Änderung nur behalten, wenn der Harness sie akzeptiert.
  5. Mit jeweils einer neuen Änderung wiederholen.

Ein Beispiel für eine Kandidatenänderung, die den mitgelieferten Stub verbessert, ist das Hinzufügen einer expliziten Behandlung für:

  • Jailbreak-Formulierungen wie „ignore previous instructions“, „roleplay“ und „developer mode“
  • Verschleierungsanfragen wie Übersetzung, base64, rot13, Nur-JSON-Formatierung oder Schema-Konvertierung

Das ergibt eine realistische erste Verbesserungskurve, ohne den Evaluator zu verändern.

Repository-Aufbau

  • program.md: Experimentieranweisungen und -einschränkungen
  • policy.md: veränderbare Guardrail-Policy unter Suche
  • judge_prompt.md: eingefrorener Judge-Prompt
  • eval_suite.jsonl: feste Angriffs- und harmlose (benigne) Evaluierungsfälle
  • results.tsv: Laufprotokoll
  • run_autoguardrails.sh: praktischer Wrapper um die CLI
  • autoguardrails/: fester Python-Harness
  • tests/: Regressions- und Sicherheitsprüfungen für den Harness

Siehe autoguardrails/README.md für die Code-Architektur und tests/README.md für die Teststrategie.

Sicherheitshinweise

  • Dieses Gerüst ist bewusst einstufig (Single-Turn) und eng im Umfang ausgelegt.
  • Es modelliert keine Tools, Dateizugriffe oder mehrstufigen Agentenaktionen.
  • Der mitgelieferte Stub dient nur der Harness-Verifizierung; er ist kein realistisches Sicherheitsmodell.
  • Die Evaluierungssuite ist bewusst festgelegt. Wenn Sie sie ändern, starten Sie eine neue Experimentlinie, anstatt mit alten Ergebnissen zu vergleichen.

Anforderungen

  • Python 3.10+
  • Keine Laufzeitabhängigkeiten von Drittanbietern — der Harness basiert vollständig auf der Python-Standardbibliothek und läuft standardmäßig offline.
  • Optional, nur für die Entwicklung: ruff, black, mypy, pytest, pytest-cov (siehe CONTRIBUTING.md).
  • Optional, für Experimente mit echten Modellen: Zugang zu einem OpenAI-kompatiblen Chat-Completions-Endpunkt (konfiguriert über die oben beschriebenen AUTOGUARDRAILS_*-Umgebungsvariablen).

Mitwirken

Beiträge sind willkommen! Bitte lesen Sie vor dem Start unsere Richtlinien für Beiträge und unseren Verhaltenskodex.

  • Melden Sie Fehler und fordern Sie Funktionen über GitHub Issues an.
  • Externe Mitwirkende unterzeichnen die CLA (wird automatisch vom CLA-Assistant-Bot bei Ihrem ersten PR übernommen).
  • Führen Sie vor dem Öffnen eines PR ruff check ., black --check ., mypy autoguardrails und pytest aus.
  • Respektieren Sie den Forschungsvertrag: policy.md ist die einzige veränderbare Oberfläche; eval_suite.jsonl und judge_prompt.md sind eingefroren.

Sicherheit

Bitte melden Sie Sicherheitslücken verantwortungsvoll. Informationen zur Meldung finden Sie in unserer Sicherheitsrichtlinie (öffnen Sie für Schwachstellen kein öffentliches Issue). Kontakt: [email protected] oder nutzen Sie GitHub Security Advisories.

Haftungsausschluss

Diese Software ist ein Open-Source-Projekt des Santander AI Lab und wird unter seiner Lizenz „wie besehen“ ohne jegliche Gewährleistungen oder Bedingungen bereitgestellt. Sie ist kein offizielles Produkt oder Dienstleistungsangebot der Banco Santander, beinhaltet keine Zusage von Produktionssupport und stellt keine Finanz-, Rechts- oder Fachberatung dar.

„Santander“ und sein Logo sind eingetragene Marken der Banco Santander, S.A. Die Projektlizenz gewährt kein Recht, sie über eine sachliche Nennung hinaus zu verwenden.

Wenn Sie glauben, eine Sicherheitslücke gefunden zu haben, befolgen Sie unsere Sicherheitsrichtlinie — eröffnen Sie kein öffentliches Issue. Sie sind dafür verantwortlich, die Eignung dieser Software für Ihren Anwendungsfall zu prüfen und Ihre eigenen Bereitstellungen aktuell zu halten.

Lizenz

Dieses Projekt ist unter der Apache License 2.0 lizenziert — Details finden Sie in den Dateien LICENSE und NOTICE.

root@kitploit:~
Copyright (c) 2026 Santander Group
SPDX-License-Identifier: Apache-2.0

Zitieren

Wenn Sie autoguardrails in Ihrer Forschung verwenden, zitieren Sie es bitte wie folgt:

root@kitploit:~
@software{autoguardrails2026,
  author  = {{Santander AI Lab}},
  title   = {autoguardrails: an autoresearch-style guardrail policy loop},
  year    = {2026},
  url     = {https://github.com/SantanderAI/autoguardrails},
  license = {Apache-2.0}
}
Tool herunterladen