Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
refusal-relocates — La negativa se localiza, el daño se reubica, las capas de seguridad bajo ajuste fino con pocas muestras | Kitploit
Herramientas/GitHubGitHub/js-lee-ai/refusal-relocates
Herramientas DefensivasAnálisis de VulnerabilidadesAprendizaje AutomáticoPapers e InvestigaciónSeguridad de IAAtaque Adversario
GitHubjs-lee-ai/refusal-relocates

refusal-relocates

La negativa se localiza, el daño se reubica, las capas de seguridad bajo ajuste fino con pocas muestras

Ver Repositorio
5hace 4 díasAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

La negativa se reubica, la negativa se localiza, el daño se reubica, capas de seguridad bajo ajuste fino con pocas muestras

Code MIT Paper CC BY 4.0 Python 3.10+ CI Stars

Inicio rápido · Uso · CLI · Resultados · Reproducir · FAQ · Citación


Noticias

  • [2026-09-28] Código publicado, junto con los registros de ejecución y los scripts que reconstruyen las tablas del artículo.

Descripción general

Unas pocas docenas de ejemplos dañinos pueden eliminar la negativa de un modelo alineado a responder solicitudes dañinas. Trabajos previos localizan la seguridad en capas y direcciones específicas, lo que sugiere proteger el lugar que se encontró. Este repositorio pone a prueba esa premisa tal como lo haría un atacante adaptativo. Encuentra dónde puede recuperarse la negativa, congela esa región y ataca de nuevo, y repara la actualización de pesos y luego deja que el atacante la disperse.

El estudio se apoya en tres mediciones.

  • La negativa se recupera en una profundidad. El parcheo sincronizado entrega el estado oculto completo del modelo limpio en una capa al modelo comprometido, en el prefill y en cada paso de decodificación, y la negativa regresa en una profundidad de transición reproducible.
  • Congelar esa profundidad desplaza el daño. En la comparación emparejada de Llama-3.1-8B, congelar las capas 0–17 mueve la transición de la capa 15 a las capas 27 y 28, y la negativa tras el ataque restringido es de 0.00 a 0.01 frente a un 0.92 a 0.96 en el modelo limpio.
  • La reparación de las dos principales direcciones cae ante una actualización dispersa. Eliminar las dos direcciones singulares principales de la actualización restaura la negativa tras ajustes finos breves solo de atención en cuatro checkpoints. Un atacante que dispersa la actualización reduce la reparación relativa de las dos principales a 0.000, y un detector calibrado con 75 ajustes finos benignos solo señala 3 de 14 fallos de reparación.

Este repositorio es la medición y ambas defensas como una pequeña biblioteca, además de los registros de ejecución y los scripts que reconstruyen las tablas del artículo.

Qué hace en una imagen

A la izquierda, los modelos limpio y comprometido se ejecutan sobre tokens compartidos y el estado oculto limpio se parchea en el modelo comprometido en una capa. A la derecha, el ataque se repite con las capas 0 a 17 congeladas y el parcheo se ejecuta de nuevo sobre el checkpoint restringido

(a) El parcheo de activaciones sincronizado sobrescribe la salida de capa del modelo comprometido con el estado limpio en el prefill y en cada paso de decodificación. (b) En el ataque emparejado de Llama, congelar las capas 0–17 desplaza la transición de medio techo de 15 a 27–28.

Inicio rápido```bash

pip install "git+https://github.com/js-lee-AI/refusal-relocates.git"

## Características

- **Escaneo de red**: Descubre dispositivos en tu red local
- **Detección de puertos**: Identifica puertos abiertos y servicios en ejecución
- **Detección de servicios**: Reconoce servicios comunes y sus versiones
- **Detección de sistema operativo**: Estima el sistema operativo del objetivo
- **Detección de vulnerabilidades**: Comprueba vulnerabilidades comunes
- **Salida JSON**: Formato de salida legible por máquina
- **Multiplataforma**: Funciona en Linux, macOS y Windows

## Instalación

### Desde el código fuente

```bash
git clone https://github.com/example/netscan.git
cd netscan
pip install -r requirements.txt

Usando pip

pip install netscan

Uso

Escaneo básico

python netscan.py 192.168.1.1

Escanear un rango de red

python netscan.py 192.168.1.0/24

Escaneo de puertos específicos

python netscan.py 192.168.1.1 -p 22,80,443

Escaneo con detección de sistema operativo

python netscan.py 192.168.1.1 -O

Salida en formato JSON

python netscan.py 192.168.1.1 -o json

Opciones

OpciónDescripción
-p, --portsPuertos a escanear (por defecto: 1-1000)
-t, --timeoutTiempo de espera en segundos (por defecto: 1)
-O, --os-detectionHabilitar detección de sistema operativo
-sV, --service-detectionHabilitar detección de servicios
-o, --outputFormato de salida (text, json)
-v, --verboseSalida detallada
-h, --helpMostrar mensaje de ayuda

Ejemplos

Ejemplo 1: Escaneo de red simple

$ python netscan.py 192.168.1.0/24

Salida:

Iniciando escaneo de red...
Host: 192.168.1.1 (activo)
Host: 192.168.1.10 (activo)
Host: 192.168.1.15 (activo)
Escaneo completado. 3 hosts activos encontrados.

Ejemplo 2: Escaneo de puertos

$ python netscan.py 192.168.1.1 -p 22,80,443

Salida:

Escaneando 192.168.1.1...
Puerto 22/tcp abierto (ssh)
Puerto 80/tcp abierto (http)
Puerto 443/tcp abierto (https)

Requisitos

  • Python 3.6 o superior
  • Bibliotecas: socket, argparse, json, threading

Licencia

Este proyecto está licenciado bajo la Licencia MIT - consulta el archivo LICENSE para más detalles.

Contribuir

Las contribuciones son bienvenidas. Por favor, lee CONTRIBUTING.md para más detalles.

Descargo de responsabilidad

Esta herramienta está destinada únicamente a pruebas de seguridad autorizadas. Los usuarios son responsables de cumplir con todas las leyes aplicables.```python import numpy as np import refusal

Descargar herramienta