
Il rifiuto si localizza, il danno si sposta, i livelli di sicurezza sotto fine-tuning con pochi campioni
Avvio rapido · Utilizzo · CLI · Risultati · Riproduzione · FAQ · Citazione
Poche decine di esempi dannosi possono rimuovere il rifiuto di una richiesta dannosa da parte di un modello allineato. Lavori precedenti localizzano la sicurezza in layer e direzioni specifici, il che suggerisce di proteggere il punto individuato. Questo repository verifica tale premessa nel modo in cui lo farebbe un attaccante adattivo. Individua dove il rifiuto può essere recuperato, congela quella regione e attacca di nuovo, poi ripara l'aggiornamento dei pesi e lascia che l'attaccante lo diffonda.
Lo studio si basa su tre misurazioni.
Questo repository è la misurazione e entrambe le difese come piccola libreria, più i registri di esecuzione e gli script che ricostruiscono le tabelle del paper.
(a) Il lockstep activation patching sovrascrive l'output del layer del modello compromesso con lo stato pulito in prefill e a ogni passo di decodifica. (b) Nell'attacco appaiato su Llama, congelare i layer 0–17 sposta la transizione half-ceiling da 15 a 27–28.
pip install "git+https://github.com/js-lee-AI/refusal-relocates.git"
## Funzionalità