Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
refusal-relocates — Il rifiuto si localizza, il danno si sposta, i livelli di sicurezza sotto fine-tuning con pochi campioni | Kitploit
Strumenti/GitHubGitHub/js-lee-ai/refusal-relocates
Strumenti DifensiviAnalisi delle VulnerabilitàMachine LearningPaper e RicercaSicurezza dell'IAAttacco Avversario
GitHubjs-lee-ai/refusal-relocates

refusal-relocates

Il rifiuto si localizza, il danno si sposta, i livelli di sicurezza sotto fine-tuning con pochi campioni

Vedi Repository
54 giorni faNon ancora revisionato

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi

Refusal Relocates, refusal localizes, the damage relocates, safety layers under few-sample fine-tuning

Code MIT Paper CC BY 4.0 Python 3.10+ CI Stars

Avvio rapido · Utilizzo · CLI · Risultati · Riproduzione · FAQ · Citazione


Novità

  • [2026-09-28] Codice rilasciato, con i registri di esecuzione e gli script che ricostruiscono le tabelle del paper.

Panoramica

Poche decine di esempi dannosi possono rimuovere il rifiuto di una richiesta dannosa da parte di un modello allineato. Lavori precedenti localizzano la sicurezza in layer e direzioni specifici, il che suggerisce di proteggere il punto individuato. Questo repository verifica tale premessa nel modo in cui lo farebbe un attaccante adattivo. Individua dove il rifiuto può essere recuperato, congela quella regione e attacca di nuovo, poi ripara l'aggiornamento dei pesi e lascia che l'attaccante lo diffonda.

Lo studio si basa su tre misurazioni.

  • Il rifiuto si recupera a una sola profondità. Il lockstep patching passa l'intero hidden state del modello pulito a un certo layer al modello compromesso, in prefill e a ogni passo di decodifica, e il rifiuto ritorna a una profondità di transizione riproducibile.
  • Congelare quella profondità sposta il danno. Nel confronto appaiato su Llama-3.1-8B, congelare i layer 0–17 sposta la transizione dal layer 15 ai layer 27 e 28, e il rifiuto dopo l'attacco limitato è 0,00–0,01 contro 0,92–0,96 del modello pulito.
  • La riparazione top-two soccombe a un aggiornamento diffuso. Rimuovere le due direzioni singolari principali dell'aggiornamento ripristina il rifiuto dopo brevi fine-tuning solo su attention su quattro checkpoint. Un attaccante che diffonde l'aggiornamento riduce la riparazione top-two relativa a 0,000, e un rilevatore calibrato su 75 fine-tuning benigni segnala solo 3 dei 14 fallimenti di riparazione.

Questo repository è la misurazione e entrambe le difese come piccola libreria, più i registri di esecuzione e gli script che ricostruiscono le tabelle del paper.

Cosa fa in una sola immagine

Left, the clean and compromised models run on shared tokens and the clean hidden state is patched into the compromised model at one layer. Right, the attack is repeated with layers 0 to 17 frozen and patching is run again on the restricted checkpoint

(a) Il lockstep activation patching sovrascrive l'output del layer del modello compromesso con lo stato pulito in prefill e a ogni passo di decodifica. (b) Nell'attacco appaiato su Llama, congelare i layer 0–17 sposta la transizione half-ceiling da 15 a 27–28.

Avvio rapido```bash

pip install "git+https://github.com/js-lee-AI/refusal-relocates.git"

## Funzionalità
Scarica lo strumento