Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Uncensored-AI — Remoção de censura totalmente automática para modelos de linguagem | Kitploit
Ferramentas/GitHubGitHub/0xsojalsec/uncensored-ai
Aprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoSegurança de IAAtaque Adversário
GitHub0xsojalsec/uncensored-ai

Uncensored-AI

Remoção de censura totalmente automática para modelos de linguagem

Ver Repositório
2315251há 3 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Logotipo

Heretic: Remoção automática total de censura para modelos de linguagem

Discord Matrix Follow us on Hugging Face Codeberg mirror

#1 Repository of the Day

Heretic é uma ferramenta que remove a censura (também conhecida como "alinhamento de segurança") de modelos de linguagem baseados em transformadores sem necessidade de pós-treinamento caro. Ela combina uma implementação avançada de ablação direcional, também conhecida como "abliteration" (Arditi et al. 2024, Lai 2025 (1, 2)), com um otimizador de parâmetros baseado em TPE alimentado pelo Optuna.

Essa abordagem permite que o Heretic funcione de forma completamente automática. O Heretic encontra parâmetros de abliteração de alta qualidade minimizando conjuntamente o número de recusas e a divergência KL em relação ao modelo original. Isso resulta em um modelo sem censura que retém o máximo possível da inteligência do modelo original. Usar o Heretic não exige compreensão dos internos do transformador. Na verdade, qualquer pessoa que saiba executar um programa de linha de comando pode usar o Heretic para descensurar modelos de linguagem.

O Heretic suporta a maioria dos modelos densos, incluindo muitos modelos multimodais, várias arquiteturas MoE diferentes e até mesmo alguns modelos híbridos como Qwen3.5. Modelos puros de espaço de estado e algumas outras arquiteturas de pesquisa ainda não são suportados prontamente.

Captura de tela

 

Executado sem supervisão com a configuração padrão, o Heretic pode produzir modelos descensurados que rivalizam com a qualidade de abliterações criadas manualmente por especialistas humanos:

ModeloRecusas para prompts "prejudiciais"Divergência KL do modelo original para prompts "inócuos"
google/gemma-3-12b-it (original)97/1000 (por definição)
mlabonne/gemma-3-12b-it-abliterated-v23/1001.04
huihui-ai/gemma-3-12b-it-abliterated3/1000.45
p-e-w/gemma-3-12b-it-heretic (nosso)3/1000.16

A versão do Heretic, gerada sem qualquer esforço humano, atinge o mesmo nível de supressão de recusas que outras abliterações, mas com uma divergência KL muito menor, indicando menos dano às capacidades do modelo original. (Você pode reproduzir esses números usando a funcionalidade de avaliação integrada do Heretic, ex: heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic. Observe que os valores exatos podem depender da plataforma e do hardware. A tabela acima foi compilada usando PyTorch 2.8 em uma RTX 5090.)

É claro que métricas matemáticas e benchmarks automatizados nunca contam toda a história e não substituem a avaliação humana. Modelos gerados com Heretic têm sido bem recebidos pelos usuários (links e ênfase adicionados):

"Eu estava cético antes, mas acabei de baixar GPT-OSS 20B Heretic e caramba. Ele dá respostas longas e bem formatadas sobre tópicos sensíveis, usando exatamente as palavras sem censura que você esperaria de um modelo sem censura, produz tabelas em markdown com detalhes e tudo mais. Parece que esta é a melhor versão abliterada deste modelo até agora..." (Link para o comentário)

"Heretic GPT 20b parece ser o melhor modelo sem censura que já experimentei. Ele não destrói a inteligência do modelo e responde a prompts que normalmente seriam rejeitados pelo modelo base." (Link para o comentário)

"[Qwen3-4B-Instruct-2507-heretic] Tem sido o melhor modelo abliterado não quantizado que consegui executar em 16gb de vram." (Link para o comentário)

Modelos do Heretic também foram avaliados independentemente usando métricas padrão como MMLU e GSM8K, e descobriu-se que se comparam favoravelmente com modelos produzidos por ferramentas de abliteração concorrentes: 1, 2.

A comunidade criou e publicou bem mais de 4000 modelos com o Heretic.

Uso

Prepare um ambiente Python 3.10+ com PyTorch 2.2+ instalado conforme apropriado para seu hardware. Em seguida, execute:

pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507

Substitua Qwen/Qwen3-4B-Instruct-2507 pelo modelo que você deseja descensurar.

[!IMPORTANT]

Embora PyTorch 2.2 seja a versão mínima necessária para o Heretic funcionar, alguns modelos e configurações podem exigir recursos encontrados apenas em versões posteriores. Por exemplo, carregar modelos quantizados em MXFP4 como gpt-oss usa torch.accelerator, que foi adicionado no PyTorch 2.6.

[!TIP]

O Heretic usa uv para gerenciamento de dependências, e o repositório inclui um arquivo uv.lock que fixa a versão de cada pacote. Se você já usa uv (e provavelmente deveria!), pode simplesmente clonar o repositório e executar o Heretic com uv run heretic, o que garante que suas dependências correspondam às usadas pelos desenvolvedores, melhorando a confiabilidade e a segurança.

O processo é totalmente automático e não requer configuração; no entanto, o Heretic possui uma variedade de parâmetros de configuração que podem ser alterados para maior controle. Execute heretic --help para ver as opções de linha de comando disponíveis, ou veja config.default.toml se preferir usar um arquivo de configuração.

Baixar ferramenta