
Vollautomatische Zensurentfernung für Sprachmodelle
Heretic ist ein Werkzeug, das Zensur (auch „Safety Alignment“ genannt) aus transformer-basierten Sprachmodellen entfernt – ohne teures Post-Training. Es kombiniert eine fortschrittliche Implementierung von directional ablation, auch bekannt als „Abliteration“ (Arditi et al. 2024, Lai 2025 (1, 2)), mit einem TPE-basierten Parameteroptimierer, der auf Optuna aufbaut.
Dieser Ansatz ermöglicht es Heretic, vollständig automatisch zu arbeiten. Heretic findet hochwertige Abliterationsparameter, indem es die Anzahl der Verweigerungen und die KL-Divergenz vom Originalmodell gleichzeitig minimiert. Das Ergebnis ist ein entsensorisiertes Modell, das so viel wie möglich von der Intelligenz des ursprünglichen Modells bewahrt. Die Verwendung von Heretic erfordert kein Verständnis der Transformatoren-Innereien. Tatsächlich kann jeder, der weiß, wie man ein Kommandozeilenprogramm ausführt, Heretic nutzen, um Sprachmodelle zu entsensorisieren.
Heretic unterstützt die meisten dichten Modelle, einschließlich vieler multimodaler Modelle, mehrerer verschiedener MoE-Architekturen und sogar einiger Hybridmodelle wie Qwen3.5. Reine State-Space-Modelle und bestimmte andere Forschungsarchitekturen werden noch nicht out-of-the-box unterstützt.
Bei unbeaufsichtigtem Betrieb mit der Standardkonfiguration kann Heretic entsensorisierte Modelle erzeugen, die qualitativ mit manuell von menschlichen Experten erstellten Abliterationen mithalten:
| Modell | Verweigerungen bei „schädlichen“ Prompts | KL-Divergenz vom Originalmodell bei „harmlosen“ Prompts |
|---|---|---|
| google/gemma-3-12b-it (Original) | 97/100 | 0 (per Definition) |
| mlabonne/gemma-3-12b-it-abliterated-v2 | 3/100 | 1.04 |
| huihui-ai/gemma-3-12b-it-abliterated | 3/100 | 0.45 |
| p-e-w/gemma-3-12b-it-heretic (unser) | 3/100 | 0.16 |
Die Heretic-Version, die ohne jeden menschlichen Aufwand erstellt wurde, erreicht das gleiche Maß an Verweigerungsunterdrückung wie andere Abliterationen, jedoch mit einer viel geringeren KL-Divergenz, was auf geringere Schädigung der Fähigkeiten des Originalmodells hindeutet.
(Sie können diese Zahlen mit der integrierten Evaluierungsfunktion von Heretic reproduzieren, z. B. heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic. Beachten Sie, dass die exakten Werte plattform- und hardwareabhängig sein können. Die obige Tabelle wurde mit PyTorch 2.8 auf einer RTX 5090 erstellt.)
Natürlich erzählen mathematische Metriken und automatisierte Benchmarks nie die ganze Geschichte und sind kein Ersatz für eine menschliche Bewertung. Mit Heretic erstellte Modelle wurden von Benutzern gut aufgenommen (Links und Hervorhebungen hinzugefügt):
„Ich war vorher skeptisch, aber ich habe gerade das GPT-OSS 20B Heretic Modell heruntergeladen und heilige Scheiße. Es gibt ordentlich formatierte lange Antworten zu sensiblen Themen, verwendet die exakt unzensierten Wörter, die man von einem unzensierten Modell erwartet, erzeugt Tabellen im Markdown-Format mit Details und so weiter. Sieht so aus, als ob dies die beste abliterierte Version dieses Modells bisher ist...“ (Link zum Kommentar)
„Heretic GPT 20b scheint das beste unzensierte Modell zu sein, das ich bisher ausprobiert habe. Es zerstört nicht die Intelligenz des Modells und beantwortet Eingabeaufforderungen normal, die vom Basismodell normalerweise abgelehnt würden.“ (Link zum Kommentar)
„[Qwen3-4B-Instruct-2507-heretic] Bisher das beste unquantisierte abliterierte Modell, das ich auf 16 GB VRAM ausführen konnte.“ (Link zum Kommentar)
Heretic-Modelle wurden auch unabhängig mit Standardmetriken wie MMLU und GSM8K bewertet und schneiden im Vergleich zu Modellen, die mit konkurrierenden Abliterationswerkzeugen erstellt wurden, günstig ab: 1, 2.
Die Community hat mit Heretic weit über 4000 Modelle erstellt und veröffentlicht.
Bereiten Sie eine Python 3.10+ Umgebung mit entsprechend installiertem PyTorch 2.2+ für Ihre Hardware vor. Führen Sie dann aus:
pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507
Ersetzen Sie Qwen/Qwen3-4B-Instruct-2507 durch das Modell, das Sie entsensorisieren möchten.
[!IMPORTANT]
Obwohl PyTorch 2.2 die Mindestversion von PyTorch ist, die für Heretic benötigt wird, erfordern einige Modelle und Konfigurationen möglicherweise Funktionen, die nur in späteren Versionen vorhanden sind. Beispielsweise verwendet das Laden von MXFP4-quantisierten Modellen wie gpt-oss
torch.accelerator, das in PyTorch 2.6 hinzugefügt wurde.
[!TIP]
Heretic verwendet uv für das Abhängigkeitsmanagement, und das Repository enthält eine
uv.lock-Datei, die jede Paketversion festlegt. Wenn Sie bereits uv verwenden (und das sollten Sie wahrscheinlich!), können Sie einfach das Repository klonen und Heretic mituv run hereticausführen, was sicherstellt, dass Ihre Abhängigkeiten mit denen übereinstimmen, die von den Entwicklern verwendet werden, was die Zuverlässigkeit und Sicherheit verbessert.
Der Prozess ist vollautomatisch und erfordert keine Konfiguration; Heretic bietet jedoch eine Vielzahl von Konfigurationsparametern, die für mehr Kontrolle geändert werden können. Führen Sie heretic --help aus, um die verfügbaren Befehlszeilenoptionen zu sehen, oder schauen Sie sich config.default.toml an, wenn Sie lieber eine Konfigurationsdatei verwenden möchten.