
Remoção de censura totalmente automática para modelos de linguagem
Heretic é uma ferramenta que remove a censura (também conhecida como "alinhamento de segurança") de modelos de linguagem baseados em transformadores sem necessidade de pós-treinamento caro. Ela combina uma implementação avançada de ablação direcional, também conhecida como "abliteration" (Arditi et al. 2024, Lai 2025 (1, 2)), com um otimizador de parâmetros baseado em TPE alimentado pelo Optuna.
Essa abordagem permite que o Heretic funcione de forma completamente automática. O Heretic encontra parâmetros de abliteração de alta qualidade minimizando conjuntamente o número de recusas e a divergência KL em relação ao modelo original. Isso resulta em um modelo sem censura que retém o máximo possível da inteligência do modelo original. Usar o Heretic não exige compreensão dos internos do transformador. Na verdade, qualquer pessoa que saiba executar um programa de linha de comando pode usar o Heretic para descensurar modelos de linguagem.
O Heretic suporta a maioria dos modelos densos, incluindo muitos modelos multimodais, várias arquiteturas MoE diferentes e até mesmo alguns modelos híbridos como Qwen3.5. Modelos puros de espaço de estado e algumas outras arquiteturas de pesquisa ainda não são suportados prontamente.
Executado sem supervisão com a configuração padrão, o Heretic pode produzir modelos descensurados que rivalizam com a qualidade de abliterações criadas manualmente por especialistas humanos:
| Modelo | Recusas para prompts "prejudiciais" | Divergência KL do modelo original para prompts "inócuos" |
|---|---|---|
| google/gemma-3-12b-it (original) | 97/100 | 0 (por definição) |
| mlabonne/gemma-3-12b-it-abliterated-v2 | 3/100 | 1.04 |
| huihui-ai/gemma-3-12b-it-abliterated | 3/100 | 0.45 |
| p-e-w/gemma-3-12b-it-heretic (nosso) | 3/100 | 0.16 |
A versão do Heretic, gerada sem qualquer esforço humano, atinge o mesmo nível de supressão de recusas que outras abliterações, mas com uma divergência KL muito menor, indicando menos dano às capacidades do modelo original.
(Você pode reproduzir esses números usando a funcionalidade de avaliação integrada do Heretic, ex: heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic.
Observe que os valores exatos podem depender da plataforma e do hardware.
A tabela acima foi compilada usando PyTorch 2.8 em uma RTX 5090.)
É claro que métricas matemáticas e benchmarks automatizados nunca contam toda a história e não substituem a avaliação humana. Modelos gerados com Heretic têm sido bem recebidos pelos usuários (links e ênfase adicionados):
"Eu estava cético antes, mas acabei de baixar GPT-OSS 20B Heretic e caramba. Ele dá respostas longas e bem formatadas sobre tópicos sensíveis, usando exatamente as palavras sem censura que você esperaria de um modelo sem censura, produz tabelas em markdown com detalhes e tudo mais. Parece que esta é a melhor versão abliterada deste modelo até agora..." (Link para o comentário)
"Heretic GPT 20b parece ser o melhor modelo sem censura que já experimentei. Ele não destrói a inteligência do modelo e responde a prompts que normalmente seriam rejeitados pelo modelo base." (Link para o comentário)
"[Qwen3-4B-Instruct-2507-heretic] Tem sido o melhor modelo abliterado não quantizado que consegui executar em 16gb de vram." (Link para o comentário)
Modelos do Heretic também foram avaliados independentemente usando métricas padrão como MMLU e GSM8K, e descobriu-se que se comparam favoravelmente com modelos produzidos por ferramentas de abliteração concorrentes: 1, 2.
A comunidade criou e publicou bem mais de 4000 modelos com o Heretic.
Prepare um ambiente Python 3.10+ com PyTorch 2.2+ instalado conforme apropriado para seu hardware. Em seguida, execute:
pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507
Substitua Qwen/Qwen3-4B-Instruct-2507 pelo modelo que você deseja descensurar.
[!IMPORTANT]
Embora PyTorch 2.2 seja a versão mínima necessária para o Heretic funcionar, alguns modelos e configurações podem exigir recursos encontrados apenas em versões posteriores. Por exemplo, carregar modelos quantizados em MXFP4 como gpt-oss usa
torch.accelerator, que foi adicionado no PyTorch 2.6.
[!TIP]
O Heretic usa uv para gerenciamento de dependências, e o repositório inclui um arquivo
uv.lockque fixa a versão de cada pacote. Se você já usa uv (e provavelmente deveria!), pode simplesmente clonar o repositório e executar o Heretic comuv run heretic, o que garante que suas dependências correspondam às usadas pelos desenvolvedores, melhorando a confiabilidade e a segurança.
O processo é totalmente automático e não requer configuração; no entanto,
o Heretic possui uma variedade de parâmetros de configuração que podem ser alterados para
maior controle. Execute heretic --help para ver as opções de linha de comando disponíveis,
ou veja config.default.toml se preferir usar um
arquivo de configuração.