Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Uncensored-AI — Eliminación de censura totalmente automática para modelos de lenguaje | Kitploit
Herramientas/GitHubGitHub/0xsojalsec/uncensored-ai
Aprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónSeguridad de IAAtaque Adversario
GitHub0xsojalsec/uncensored-ai

Uncensored-AI

Eliminación de censura totalmente automática para modelos de lenguaje

Ver Repositorio
2315251hace 3 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Logotipo

Heretic: Eliminación automática de censura para modelos de lenguaje

Discord Matrix Follow us on Hugging Face Codeberg mirror

#1 Repository of the Day

Heretic es una herramienta que elimina la censura (también conocida como "alineación de seguridad") de modelos de lenguaje basados en transformers sin necesidad de un post-entrenamiento costoso. Combina una implementación avanzada de ablación direccional, también conocida como "abliteración" (Arditi et al. 2024, Lai 2025 (1, 2)), con un optimizador de parámetros basado en TPE impulsado por Optuna.

Este enfoque permite que Heretic funcione completamente de forma automática. Heretic encuentra parámetros de abliteración de alta calidad minimizando conjuntamente el número de rechazos y la divergencia KL con respecto al modelo original. Esto resulta en un modelo desensurado que retiene tanta inteligencia del modelo original como sea posible. Usar Heretic no requiere comprender el funcionamiento interno de los transformers. De hecho, cualquiera que sepa cómo ejecutar un programa de línea de comandos puede usar Heretic para desensurar modelos de lenguaje.

Heretic admite la mayoría de los modelos densos, incluyendo muchos modelos multimodales, varias arquitecturas MoE diferentes, e incluso algunos modelos híbridos como Qwen3.5. Los modelos de espacio de estado puros y ciertas otras arquitecturas de investigación aún no son compatibles de forma nativa.

Captura de pantalla

 

Ejecutándose sin supervisión con la configuración predeterminada, Heretic puede producir modelos desensurados que rivalizan en calidad con las abliteraciones creadas manualmente por expertos humanos:

ModeloRechazos para indicaciones "dañinas"Divergencia KL del modelo original para indicaciones "inocuas"
google/gemma-3-12b-it (original)97/1000 (por definición)
mlabonne/gemma-3-12b-it-abliterated-v23/1001.04
huihui-ai/gemma-3-12b-it-abliterated3/1000.45
p-e-w/gemma-3-12b-it-heretic (nuestro)3/1000.16

La versión de Heretic, generada sin ningún esfuerzo humano, logra el mismo nivel de supresión de rechazos que otras abliteraciones, pero con una divergencia KL mucho menor, lo que indica un menor daño a las capacidades del modelo original. (Puedes reproducir esos números usando la funcionalidad de evaluación integrada de Heretic, por ejemplo heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic. Ten en cuenta que los valores exactos pueden depender de la plataforma y el hardware. La tabla anterior se compiló usando PyTorch 2.8 en una RTX 5090.)

Por supuesto, las métricas matemáticas y los benchmarks automatizados nunca cuentan toda la historia y no sustituyen la evaluación humana. Los modelos generados con Heretic han sido bien recibidos por los usuarios (enlaces y énfasis añadidos):

"Era escéptico antes, pero acabo de descargar el modelo GPT-OSS 20B Heretic y, madre mía. Da respuestas largas y bien formateadas sobre temas sensibles, usando las palabras sin censura exactas que esperarías de un modelo sin censura, produce tablas en formato markdown con detalles y todo. Parece que esta es la mejor versión abliterada de este modelo hasta ahora..." (Enlace al comentario)

"Heretic GPT 20b parece ser el mejor modelo sin censura que he probado hasta ahora. No destruye la inteligencia del modelo y responde a indicaciones que normalmente serían rechazadas por el modelo base." (Enlace al comentario)

"[Qwen3-4B-Instruct-2507-heretic] Ha sido el mejor modelo abliterado sin cuantificar que he podido ejecutar en 16 GB de VRAM." (Enlace al comentario)

Los modelos de Heretic también han sido evaluados de forma independiente usando métricas estándar como MMLU y GSM8K, y se ha encontrado que se comparan favorablemente con los modelos producidos por otras herramientas de abliteración: 1, 2.

La comunidad ha creado y publicado más de 4000 modelos con Heretic.

Uso

Prepara un entorno Python 3.10+ con PyTorch 2.2+ instalado según tu hardware. Luego ejecuta:

pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507

Reemplaza Qwen/Qwen3-4B-Instruct-2507 con el modelo que quieras desensurar.

[!IMPORTANTE]

Si bien PyTorch 2.2 es la versión mínima necesaria para que Heretic funcione, algunos modelos y configuraciones pueden requerir características que solo se encuentran en versiones posteriores. Por ejemplo, cargar modelos cuantificados en MXFP4 como gpt-oss utiliza torch.accelerator, que se añadió en PyTorch 2.6.

[!CONSEJO]

Heretic utiliza uv para la gestión de dependencias, y el repositorio incluye un archivo uv.lock que fija la versión de cada paquete. Si ya usas uv (¡y probablemente deberías!), puedes simplemente clonar el repositorio y ejecutar Heretic con uv run heretic, lo que asegura que tus dependencias coincidan con las utilizadas por los desarrolladores, mejorando la fiabilidad y la seguridad.

El proceso es completamente automático y no requiere configuración; sin embargo, Heretic tiene varios parámetros de configuración que se pueden cambiar para un mayor control. Ejecuta heretic --help para ver las opciones de línea de comandos disponibles, o consulta config.default.toml si prefieres usar un archivo de configuración.

Descargar herramienta