Skip to content
KitploitKITPLOIT
StrumentiBlog
Invia
StrumentiBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
Learning-to-Detect — Rileva attacchi jailbreak sconosciuti nei grandi modelli visione-linguaggio utilizzando l'analisi degli stati nascosti e autoencoder, con pipeline di addestramento e valutazione per un monitoraggio di sicurezza robusto. | Kitploit
Strumenti/GitHubGitHub/shuangliangx/learning-to-detect
Strumenti DifensiviAnalisi delle VulnerabilitàMachine LearningSicurezza dell'IARilevamento di Anomalie
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

Rileva attacchi jailbreak sconosciuti nei grandi modelli visione-linguaggio utilizzando l'analisi degli stati nascosti e autoencoder, con pipeline di addestramento e valutazione per un monitoraggio di sicurezza robusto.

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Vedi Repository
183 mesi faNon ancora revisionato
Condividi

Imparare a Rilevare Attacchi Jailbreak Sconosciuti nei Grandi Modelli Visione-Linguaggio

Questo repository fornisce l'implementazione ufficiale di "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".

Contenuto

  • Modello base

  • Rilevamento degli Attacchi Jailbreak

  • Dataset

Modello base

Il nostro metodo utilizza i seguenti due modelli base:

LLaVA-v1.6-Vicuna è un potente modello visione-linguaggio che combina un encoder visivo con il modello linguistico Vicuna per elaborare input multimodali e generare risposte in linguaggio naturale.

LlamaGuard3 è un modello di salvaguardia sviluppato da Meta AI, progettato specificamente per rilevare e prevenire la generazione di contenuti dannosi e identificare efficacemente richieste e risposte potenzialmente non sicure.

Si prega di scaricare i pesi del modello e di inserirli nella directory code/asset/weights.

Rilevamento degli Attacchi Jailbreak

1. Elaborazione dei Dati ed Estrazione degli Stati Nascosti

(Opzionale, poiché i dati elaborati e gli stati estratti sono già conservati nel repository.)

Interrogare il modello su $I^-$ (AdvBench) e $I^+$ (GQA)

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

Valutare le risposte del modello e suddividere in dataset di addestramento/test

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

Estrarre gli stati nascosti per l'addestramento LoD e la valutazione del benchmark

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. Addestrare e Testare i classificatori MSCAV

Addestrare e testare i classificatori

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. Addestrare l'Auto-Encoder dei Pattern di Sicurezza (SPAE)

root@kitploit:~
    python code/autoencoder.py

4. Valutare le Prestazioni di Rilevamento

root@kitploit:~
    python code/test.py

Dataset

DatasetDettagli
MM-SafetyBench
HADES

Si prega di scaricare i dataset e di inserirli nella directory code/asset.

Scarica lo strumento