Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
Learning-to-Detect — Erkennt unbekannte Jailbreak-Angriffe in großen Vision-Sprachmodellen mithilfe von Hidden-State-Analyse und Autoencodern, mit Trainings- und Evaluierungspipelines für robuste Sicherheitsüberwachung. | Kitploit
Tools/GitHubGitHub/shuangliangx/learning-to-detect
DefensivwerkzeugeSchwachstellenanalyseMaschinelles LernenKI-SicherheitAnomalieerkennung
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

Erkennt unbekannte Jailbreak-Angriffe in großen Vision-Sprachmodellen mithilfe von Hidden-State-Analyse und Autoencodern, mit Trainings- und Evaluierungspipelines für robuste Sicherheitsüberwachung.

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Repository anzeigen
18vor 3 MonatenNoch nicht geprüft
Teilen

Lernen, unbekannte Jailbreak-Angriffe in großen Vision-Language-Modellen zu erkennen

Dieses Repository enthält die offizielle Implementierung von „Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".

Inhalt

  • Basis-Modell

  • Erkennung von Jailbreak-Angriffen

  • Datensatz

Basis-Modell

Unsere Methode verwendet die folgenden zwei Basis-Modelle:

LLaVA-v1.6-Vicuna ist ein leistungsstarkes Vision-Language-Modell, das einen visuellen Encoder mit dem Vicuna-Sprachmodell kombiniert, um multimodale Eingaben zu verarbeiten und natürliche Sprachantworten zu erzeugen.

LlamaGuard3 ist ein von Meta AI entwickeltes Sicherheits-Schutzmodell, das speziell dafür ausgelegt ist, die Erzeugung schädlicher Inhalte zu erkennen und zu verhindern sowie potenziell unsichere Anfragen und Antworten effektiv zu identifizieren.

Bitte laden Sie die Modellgewichte herunter und legen Sie sie im Verzeichnis code/asset/weights ab.

Erkennung von Jailbreak-Angriffen

1. Datenverarbeitung und Extraktion verborgener Zustände

(Optional, da die verarbeiteten Daten und extrahierten Zustände bereits im Repository gespeichert sind.)

Modell auf $I^-$ (AdvBench) und $I^+$ (GQA) abfragen

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

Modellantworten bewerten und in Trainings-/Testdatensätze aufteilen

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

Verborgene Zustände für das LoD-Training und die Benchmark-Auswertung extrahieren

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. Trainieren und Testen der MSCAV-Klassifikatoren

Klassifikatoren trainieren und testen

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. Trainieren des Safety Pattern Auto-Encoders (SPAE)

root@kitploit:~
    python code/autoencoder.py

4. Erkennungsleistung auswerten

root@kitploit:~
    python code/test.py

Datensatz

DatensatzDetails
MM-SafetyBench
HADES

Bitte laden Sie die Datensätze herunter und legen Sie sie im Verzeichnis code/asset ab.

Tool herunterladen