Skip to content
KitploitKITPLOIT
ToolsBlog
Log in
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
Uncensored-AI — Vollautomatische Zensurentfernung für Sprachmodelle | Kitploit
Tools/GitHubGitHub/0xsojalsec/uncensored-ai
Maschinelles LernenPapers & ForschungLernen & BildungKI-SicherheitAdversarial-Angriff
GitHub0xsojalsec/uncensored-ai

Uncensored-AI

Vollautomatische Zensurentfernung für Sprachmodelle

Repository anzeigen
2315251vor 3 MonatenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Logo

Heretic: Vollautomatische Zensurentfernung für Sprachmodelle

Discord Matrix Follow us on Hugging Face Codeberg mirror

#1 Repository of the Day

Heretic ist ein Werkzeug, das Zensur (auch „Safety Alignment“ genannt) aus transformer-basierten Sprachmodellen entfernt – ohne teures Post-Training. Es kombiniert eine fortschrittliche Implementierung von directional ablation, auch bekannt als „Abliteration“ (Arditi et al. 2024, Lai 2025 (1, 2)), mit einem TPE-basierten Parameteroptimierer, der auf Optuna aufbaut.

Dieser Ansatz ermöglicht es Heretic, vollständig automatisch zu arbeiten. Heretic findet hochwertige Abliterationsparameter, indem es die Anzahl der Verweigerungen und die KL-Divergenz vom Originalmodell gleichzeitig minimiert. Das Ergebnis ist ein entsensorisiertes Modell, das so viel wie möglich von der Intelligenz des ursprünglichen Modells bewahrt. Die Verwendung von Heretic erfordert kein Verständnis der Transformatoren-Innereien. Tatsächlich kann jeder, der weiß, wie man ein Kommandozeilenprogramm ausführt, Heretic nutzen, um Sprachmodelle zu entsensorisieren.

Heretic unterstützt die meisten dichten Modelle, einschließlich vieler multimodaler Modelle, mehrerer verschiedener MoE-Architekturen und sogar einiger Hybridmodelle wie Qwen3.5. Reine State-Space-Modelle und bestimmte andere Forschungsarchitekturen werden noch nicht out-of-the-box unterstützt.

Screenshot

 

Bei unbeaufsichtigtem Betrieb mit der Standardkonfiguration kann Heretic entsensorisierte Modelle erzeugen, die qualitativ mit manuell von menschlichen Experten erstellten Abliterationen mithalten:

ModellVerweigerungen bei „schädlichen“ PromptsKL-Divergenz vom Originalmodell bei „harmlosen“ Prompts
google/gemma-3-12b-it (Original)97/1000 (per Definition)
mlabonne/gemma-3-12b-it-abliterated-v23/1001.04
huihui-ai/gemma-3-12b-it-abliterated3/1000.45
p-e-w/gemma-3-12b-it-heretic (unser)3/1000.16

Die Heretic-Version, die ohne jeden menschlichen Aufwand erstellt wurde, erreicht das gleiche Maß an Verweigerungsunterdrückung wie andere Abliterationen, jedoch mit einer viel geringeren KL-Divergenz, was auf geringere Schädigung der Fähigkeiten des Originalmodells hindeutet. (Sie können diese Zahlen mit der integrierten Evaluierungsfunktion von Heretic reproduzieren, z. B. heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic. Beachten Sie, dass die exakten Werte plattform- und hardwareabhängig sein können. Die obige Tabelle wurde mit PyTorch 2.8 auf einer RTX 5090 erstellt.)

Natürlich erzählen mathematische Metriken und automatisierte Benchmarks nie die ganze Geschichte und sind kein Ersatz für eine menschliche Bewertung. Mit Heretic erstellte Modelle wurden von Benutzern gut aufgenommen (Links und Hervorhebungen hinzugefügt):

„Ich war vorher skeptisch, aber ich habe gerade das GPT-OSS 20B Heretic Modell heruntergeladen und heilige Scheiße. Es gibt ordentlich formatierte lange Antworten zu sensiblen Themen, verwendet die exakt unzensierten Wörter, die man von einem unzensierten Modell erwartet, erzeugt Tabellen im Markdown-Format mit Details und so weiter. Sieht so aus, als ob dies die beste abliterierte Version dieses Modells bisher ist...“ (Link zum Kommentar)

„Heretic GPT 20b scheint das beste unzensierte Modell zu sein, das ich bisher ausprobiert habe. Es zerstört nicht die Intelligenz des Modells und beantwortet Eingabeaufforderungen normal, die vom Basismodell normalerweise abgelehnt würden.“ (Link zum Kommentar)

„[Qwen3-4B-Instruct-2507-heretic] Bisher das beste unquantisierte abliterierte Modell, das ich auf 16 GB VRAM ausführen konnte.“ (Link zum Kommentar)

Heretic-Modelle wurden auch unabhängig mit Standardmetriken wie MMLU und GSM8K bewertet und schneiden im Vergleich zu Modellen, die mit konkurrierenden Abliterationswerkzeugen erstellt wurden, günstig ab: 1, 2.

Die Community hat mit Heretic weit über 4000 Modelle erstellt und veröffentlicht.

Verwendung

Bereiten Sie eine Python 3.10+ Umgebung mit entsprechend installiertem PyTorch 2.2+ für Ihre Hardware vor. Führen Sie dann aus:

pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507

Ersetzen Sie Qwen/Qwen3-4B-Instruct-2507 durch das Modell, das Sie entsensorisieren möchten.

[!IMPORTANT]

Obwohl PyTorch 2.2 die Mindestversion von PyTorch ist, die für Heretic benötigt wird, erfordern einige Modelle und Konfigurationen möglicherweise Funktionen, die nur in späteren Versionen vorhanden sind. Beispielsweise verwendet das Laden von MXFP4-quantisierten Modellen wie gpt-oss torch.accelerator, das in PyTorch 2.6 hinzugefügt wurde.

[!TIP]

Heretic verwendet uv für das Abhängigkeitsmanagement, und das Repository enthält eine uv.lock-Datei, die jede Paketversion festlegt. Wenn Sie bereits uv verwenden (und das sollten Sie wahrscheinlich!), können Sie einfach das Repository klonen und Heretic mit uv run heretic ausführen, was sicherstellt, dass Ihre Abhängigkeiten mit denen übereinstimmen, die von den Entwicklern verwendet werden, was die Zuverlässigkeit und Sicherheit verbessert.

Der Prozess ist vollautomatisch und erfordert keine Konfiguration; Heretic bietet jedoch eine Vielzahl von Konfigurationsparametern, die für mehr Kontrolle geändert werden können. Führen Sie heretic --help aus, um die verfügbaren Befehlszeilenoptionen zu sehen, oder schauen Sie sich config.default.toml an, wenn Sie lieber eine Konfigurationsdatei verwenden möchten.

Tool herunterladen