Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
SLDR — Framework di difesa che mitiga il fine-tuning malevolo dei LLM utilizzando il ripristino selettivo dei layer e il routing dinamico, con script per il training, lo scoring di pericolosità e la valutazione dei jailbreak. | Kitploit
Strumenti/GitHubGitHub/stardust457/sldr
Strumenti DifensiviMachine LearningPaper e RicercaSicurezza dell'IAAttacco Avversario
GitHubstardust457/sldr

SLDR

Framework di difesa che mitiga il fine-tuning malevolo dei LLM utilizzando il ripristino selettivo dei layer e il routing dinamico, con script per il training, lo scoring di pericolosità e la valutazione dei jailbreak.

Vedi Repository
27 giorni faNon ancora revisionato

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

[NeurIPS 2026] SLDR: Difendersi dal fine-tuning malevolo tramite il ripristino selettivo dei layer e il routing dinamico

🔧 Configurazione dell'ambiente

Clona il repository, crea e attiva l'ambiente Conda, quindi installa le dipendenze richieste:

git clone https://github.com/Stardust457/SLDR.git
cd SLDR

conda create -n sldr python=3.12 -y

conda activate sldr

python -m pip install --upgrade pip

python -m pip install -r requirements.txt

🔑 Accesso e download dei modelli Llama

I modelli Llama richiedono una richiesta di accesso su Hugging Face.

Prima di utilizzare un modello, accedi a Hugging Face, visita la pagina del modello desiderato sotto Meta Llama, accetta i termini di utilizzo e invia una richiesta di accesso. Una volta ottenuto l'accesso, utilizza lo stesso account per creare un Access Token con accesso in lettura al modello di destinazione nella pagina delle impostazioni degli Access Tokens. Per i dettagli, consulta la guida di Hugging Face ai modelli con accesso controllato.

Per prima cosa, configura HF-Mirror in un terminale Bash:

export HF_ENDPOINT="https://hf-mirror.com"

Poi, esegui il seguente comando per effettuare il login:

hf auth login

Inserisci il tuo Access Token di Hugging Face appena creato quando richiesto.


🚀 Addestramento e valutazione

Esegui i seguenti comandi dalla root del repository per addestrare e valutare ciascun modello:

Llama 3.1

bash scripts/run_llama31_downstream.sh

Llama 3

bash scripts/run_llama3_downstream.sh

Qwen 2.5

bash scripts/run_qwen25_downstream.sh

Mistral

bash scripts/run_mistral_downstream.sh

Deployment di Llama Guard e scoring della dannosità

Dopo aver raccolto le risposte del modello, esegui il deployment di Llama Guard e avvia il servizio in un terminale:

bash scripts/run_llama_guard.sh serve

Mantieni questo terminale in esecuzione e attendi che il servizio sia pronto. Poi, apri un altro terminale, attiva l'ambiente sldr ed esegui il seguente comando dalla root del repository per valutare la dannosità delle risposte del modello:

bash scripts/run_llama_guard.sh score

⚠️ Promemoria importante: valutazione su Alpaca

Prima di eseguire la valutazione di Llama 3.1 sul dataset Alpaca, configura l'API base URL e l'API key del giudice GPT nello stesso terminale:

export GPT_JUDGE_BASE_URL='your base url'
export OPENAI_API_KEY='your API key'

Sostituisci i segnaposto con la tua API base URL e la tua API key prima di avviare la valutazione.

Valutazione aggiuntiva su benchmark dannosi

Dopo aver generato i corrispondenti checkpoint downstream, esegui il seguente comando per valutare Llama 3.1 su ulteriori benchmark dannosi, tra cui DirectHarm4, HarmBench e HEx-PHI:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
SEEDS="42" \
VARIANTS="defended" \
bash /root/scripts/run_llama31_harm_benchmarks.sh

Valutazione dei jailbreak Zulu e IJP

Esegui il seguente comando per valutare Llama 3.1 contro gli attacchi jailbreak Zulu e IJP utilizzando i corrispondenti checkpoint downstream:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
TRAIN_SAMPLES="1000" \
SEEDS="42" \
VARIANTS="defended" \
JAILBREAK_ATTACKS="zulu ijp" \
bash /root/scripts/run_llama31_jailbreak.sh

Nota: Le risposte del modello generate per il dataset Zulu devono essere tradotte in inglese prima che la loro dannosità venga valutata utilizzando Llama Guard.


Scarica lo strumento