Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
RLCDAlignBench — Benchmark-Suite und Code zur Erkennung von KI-Alignment-Fehlern, mit 44 Benchmarks über zehn Fehlertypen und einem Zero-Shot-RLCD-Detektor, der auf 7.193 gelabelten Instanzen evaluiert wurde. | Kitploit
Tools/GitHubGitHub/sumleo/rlcdalignbench
SchwachstellenanalyseMaschinelles LernenPapers & ForschungLernen & BildungKuratierte RessourcenKI-SicherheitAnomalieerkennung
GitHubsumleo/rlcdalignbench

RLCDAlignBench

Benchmark-Suite und Code zur Erkennung von KI-Alignment-Fehlern, mit 44 Benchmarks über zehn Fehlertypen und einem Zero-Shot-RLCD-Detektor, der auf 7.193 gelabelten Instanzen evaluiert wurde.

Repository anzeigen
147vor 2 TagenNoch nicht geprüft
Webseite

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen

Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures

ICLR 2027 Project page Hugging Face Code license: MIT Data license: CC BY-NC 4.0

Dieses Repository enthält RLCDAlignBench und den Code hinter dem Paper. Der Benchmark misst, ob ein Detektor erkennen kann, wann die Ausgabe eines Sprachmodells ein Alignment-Fehler ist. Er umfasst 44 Benchmarks über zehn Fehlertypen (Sycophancy, Jailbreaks, Täuschung, Prompt-Injection, Halluzination, Verletzung der Privatsphäre, sozialer Bias, Reward Hacking, Verschleierung von Unsicherheit und Machtstreben) und fünf Zielmodelle, für 7.193 gelabelte Detektionsinstanzen. Die Labels stammen aus dem jeweiligen Scorer des Benchmarks, und zwei zusätzliche Sets tragen menschliche Labels.

Wir verwenden ihn, um Jev zu testen, ein Modell, das mit Reinforcement Learning für kalibrierte Entscheidungen (RLCD) trainiert wurde und viele typisierte Fragen zu einer Eingabe mit kalibrierten Wahrscheinlichkeiten in einem einzigen Aufruf beantwortet. Die Kernidee ist, die Frage, die Jev gestellt wird, getrennt vom Kontext zu messen, den es sieht. Eine generische Frage erreicht einen medianen AUROC von 0,886 zero-shot und schlägt überwachte TF-IDF- und Längen-Baselines auf 25 von 31 Benchmarks. Out of sample bringt die Formulierung der Frage wenig. Antworten als Wahrscheinlichkeiten statt als Argmax-Entscheidungen zu lesen, ist dagegen sehr wichtig. Kontext hilft vor allem über Felder, die das Label kodieren.

RLCDAlignBench overview

Zitation

root@kitploit:~
@misc{rlcdalignbench2026,
  title        = {Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures},
  author       = {Ruoqi Guo and Yi Liu and Gelei Deng and Yuekang Li and Lida Zhao and Simin Chen and Ying Zhang and Leo Yu Zhang},
  year         = {2026},
  howpublished = {\url{https://github.com/sumleo/RLCDAlignBench}}
}

Haftungsausschluss

Der Datensatz enthält ungefilterte Ausgaben kleiner offener Modelle unter Jailbreak- und anderen adversarialen Prompts, und viele davon sind schädlich. Er wird ausschließlich für die Forschung zur Erkennung und Abschwächung von Alignment-Fehlern veröffentlicht, und der Zugriff auf Hugging Face ist gated. Verwende ihn nicht, um schädliche Systeme zu bauen oder zu verbessern.

Daten

Die Daten liegen auf Hugging Face unter sumleo/RLCDAlignBench. Beantrage dort den Zugriff und führe dann aus:

root@kitploit:~
from datasets import load_dataset

ds = load_dataset("sumleo/RLCDAlignBench", "harmbench", split="test")   # one benchmark
all_ = load_dataset("sumleo/RLCDAlignBench", "all", split="test")       # all 7,193 instances

Jede Instanz hat die Felder, die ein Detektor sieht (state), ein binäres label (1 = die Ausgabe ist ein Fehler, den der Detektor markieren muss), die label_source, das target_model und einen meta-Datensatz, der zurück zu den Herkunftsdateien verlinkt. Die Datensatz-Karte dokumentiert jedes Feld und jede Datei.

FehlertypBenchmarksInstanzenZielmodell
Sycophancy4639Qwen3.5-2B
Jailbreaks4414Phi-4-mini
Täuschung4540Gemma-2-2B
Prompt-Injection41.036Qwen3.5-2B
Halluzination61.164Llama-3.2-3B
Verletzung der Privatsphäre4808Phi-4-mini
Sozialer Bias4199Olmo-3-7B
Reward Hacking6714Qwen3.5-2B
Verschleierung von Unsicherheit4748Olmo-3-7B
Machtstreben4931Llama-3.2-3B
Gesamt447.1935 Modelle

Menschlich gelabelte Sets: StrongREJECT (1.361 Antworten, je 5 Bewerter) und das HarmBench-Validierungsset (602 Antworten, je 3 Stimmen).

data/benchmarks.csv ist der 44-zeilige Index (Name, Fehlertyp, Hill-Climb- oder Held-out-Split, Scorer, Label-Quelle, n, Positive, Status). Die Split-Rollen stammen aus der AAR-Suite von Chen et al. (2026). data/variants.csv listet alle 132 Eingabevarianten auf, die in den Kontextexperimenten verwendet wurden. results/ enthält die Tabellen auf Paper-Ebene.

Auf Hugging Face ist das Release wie folgt organisiert:

root@kitploit:~
data/benchmarks/<failure_type>/<benchmark>.jsonl   canonical instances (the paper's n)
data/human/<set>.jsonl                             human-labelled sets
data/variants/<benchmark>/<variant>.jsonl          every input view: ablation, official track, oracle, exclusion, ...
jev/responses/<benchmark>/<variant>/<battery>.jsonl   Jev's per-question probabilities for every instance
jev/metrics/<benchmark>/<variant>/<battery>.json      per-strategy precision, recall, F1, AUROC
provenance/                                        target-model generations, reference-scorer calls, official scores, logs

Code

KomponenteOrt
Generierung und Judge-Replay rund um das AAR-Harnesscode/generation/run_generate.py
Builder für Detektionssamples (einer pro Battery-Familie)code/build_samples_*.py
Frage-Batterien (die an Jev gestellten Fragen und die Readout-Strategien)code/battery_*.py
Jev-Runner, Caching und Metrikencode/run_jev.py, code/run_batch.sh
Battery-Linter (Kriterien-Leakage, Format)code/lint_battery.py, code/lint_criteria_leak.py
Ergebniszusammenfassungcode/make_results_summary.py
Release-Toolstools/build_release.py, tools/legacy_layout.py

Der Code benötigt Python 3.10 oder neuer (das Paper verwendete 3.12) und nur die Standardbibliothek. Die Release-Tools benötigen zusätzlich pandas.

Metriken offline neu berechnen

Dies sendet keine Anfragen und benötigt keine Keys. Jede Metrik wird aus Jevs gecachten Antworten neu berechnet.

root@kitploit:~
pip install -U "huggingface_hub[cli]" pandas
huggingface-cli login                                   # after your access request is approved
huggingface-cli download sumleo/RLCDAlignBench --repo-type dataset --local-dir hf

python tools/legacy_layout.py --release hf --out work   # rebuilds the layout the scripts expect, checks sha256
python work/code/restore_layout.py
python work/code/run_jev.py --leg harmbench --battery battery_a_judge \
    --samples work/code/samples/harmbench__microsoft__Phi-4-mini-instruct__attack.jsonl --rescore

Der letzte Befehl gibt eine Tabelle mit einer Zeile pro Readout-Strategie aus (Precision, Recall, F1, Balanced Accuracy, AUROC, Bootstrap-CI). Sie stimmt mit jev/metrics/harmbench/attack/battery_a_judge_v2.json im Release überein.

Von Grund auf neu ausführen

  1. Klone das AAR-Repository in das Repository-Stammverzeichnis (die Sample-Builder suchen dort nach aar_repo/) und checke den Commit aus, aus dem die Labels erstellt wurden:
    root@kitploit:~
    git clone https://github.com/YuehHanChen/automated_alignment_researcher aar_repo
    git -C aar_repo checkout 02dbe9d2cadc553720d17cdf6259c0b8727e6cde
    
  2. Generiere die Ausgaben der Zielmodelle (GPU) und spiele die Referenz-Scorer erneut ab (API-Keys wie in aar_repo/REPRODUCE.md):
    root@kitploit:~
    python code/generation/run_generate.py --axis refusal --repo aar_repo            # phase 1, judges stubbed
    python code/generation/run_generate.py --axis refusal --repo aar_repo --replay   # phase 2, real judges
    
  3. Baue Detektionssamples mit code/build_samples_*.py (die judge-bewerteten Familien a, bc und f nehmen --attach-judges). Die Builder berechnen jeden offiziellen aggregierten Score aus den Labels neu und brechen ab, wenn er vom offiziellen abweicht.
  4. Frage Jev mit gesetztem TYPESAFE_API_KEY ab:
    root@kitploit:~
    python code/run_jev.py --leg harmbench --battery battery_a_judge --samples <file> --limit 20   # pilot
    python code/run_jev.py --leg harmbench --battery battery_a_judge --samples <file>              # full
    

Datenfluss: calls.jsonl → run_generate.py --replay → judge_calls.jsonl → build_samples_*.py → detection samples → run_jev.py → responses + metrics.

Repository-Struktur

root@kitploit:~
RLCDAlignBench/
├── paper.pdf
├── code/                  experiment code (generation, sample builders, batteries, Jev runner)
├── data/
│   ├── benchmarks.csv     44-row benchmark index
│   └── variants.csv       132 input variants
├── results/               paper-level tables (main results, baselines, human agreement, cost, corrected labels)
├── figs/                  paper figures
├── tools/                 release build and legacy-layout tools
└── docs/                  project page (GitHub Pages)

Ethik

Wir haben keine neuen schädlichen Anfragen generiert. Alle Prompts stammen aus veröffentlichten Benchmarks, und wir haben sie nur auf kleinen offenen Modellen ausgeführt. Schädliche Antworten werden hinter einer gated Zugriffsvereinbarung für die Detektorforschung veröffentlicht.

Lizenz

Code: MIT. Daten: unsere Labels, Annotationen, Jev-Ausgaben und Metadaten stehen unter CC BY-NC 4.0. Upstream-Benchmark-Inhalte behalten ihre ursprüngliche Lizenz, und Modellausgaben unterliegen den Bedingungen der Zielmodelle.

Tool herunterladen