
Remoção de censura totalmente automática para modelos de linguagem
Heretic é uma ferramenta que remove a censura (também conhecida como "alinhamento de segurança") de modelos de linguagem baseados em transformadores sem pós-treinamento caro. Ela combina uma implementação avançada de ablação direcional, também conhecida como "abliteration" (Arditi et al. 2024, Lai 2025 (1, 2)), com um otimizador de parâmetros baseado em TPE alimentado por Optuna.
Essa abordagem permite que o Heretic funcione de forma totalmente automática. O Heretic encontra parâmetros de abliteration de alta qualidade co-minimizando o número de recusas e a divergência KL em relação ao modelo original. Isso resulta em um modelo sem censura que preserva o máximo possível da inteligência do modelo original. Usar o Heretic não exige compreensão dos mecanismos internos dos transformadores. Na verdade, qualquer pessoa que saiba executar um programa de linha de comando pode usar o Heretic para remover a censura de modelos de linguagem.
O Heretic suporta a maioria dos modelos densos, incluindo muitos modelos multimodais, diversas arquiteturas MoE diferentes e até mesmo alguns modelos híbridos como o Qwen3.5. Modelos puros de espaço de estado e certas outras arquiteturas de pesquisa ainda não são suportados de fábrica.
Quando executado sem supervisão com a configuração padrão, o Heretic pode produzir modelos sem censura que rivalizam com a qualidade das abliterations criadas manualmente por especialistas humanos:
| Modelo | Recusas para prompts "prejudiciais" | Divergência KL do modelo original para prompts "inofensivos" |
|---|---|---|
| google/gemma-3-12b-it (original) | 97/100 | 0 (por definição) |
| mlabonne/gemma-3-12b-it-abliterated-v2 | 3/100 | 1.04 |
| huihui-ai/gemma-3-12b-it-abliterated | 3/100 | 0.45 |
| p-e-w/gemma-3-12b-it-heretic (nosso) | 3/100 | 0.16 |
A versão do Heretic, gerada sem nenhum esforço humano, atinge o mesmo nível de supressão de recusas que outras abliterations, mas com uma divergência KL muito menor, indicando menos danos às capacidades do modelo original.
(Você pode reproduzir esses números usando a funcionalidade de avaliação integrada do Heretic, ex. heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic. Observe que os valores exatos podem depender da plataforma e do hardware. A tabela acima foi compilada usando PyTorch 2.8 em uma RTX 5090.)
É claro que métricas matemáticas e benchmarks automatizados nunca contam a história completa e não substituem a avaliação humana. Os modelos gerados com o Heretic foram bem recebidos pelos usuários (links e ênfase adicionados):
"Eu estava cético antes, mas acabei de baixar o GPT-OSS 20B Heretic e, caramba. Ele fornece respostas longas bem formatadas sobre tópicos sensíveis, usando exatamente as palavras sem censura que você esperaria de um modelo sem censura, produz tabelas em formato markdown com detalhes e tudo mais. Parece que esta é a melhor versão abliterated desse modelo até agora..." (Link para o comentário)
"Heretic GPT 20b parece ser o melhor modelo sem censura que já experimentei. Ele não destrói a inteligência do modelo e está respondendo a prompts que normalmente seriam rejeitados pelo modelo base." (Link para o comentário)
"[Qwen3-4B-Instruct-2507-heretic] Tem sido o melhor modelo abliterated não quantizado que consegui rodar em 16 GB de VRAM." (Link para o comentário)
Os modelos do Heretic também foram avaliados de forma independente usando métricas padrão como MMLU e GSM8K e mostraram-se favoráveis em comparação com modelos produzidos por ferramentas de abliteration concorrentes: 1, 2.
A comunidade criou e publicou bem mais de 4000 modelos com o Heretic.
Prepare um ambiente Python 3.10+ com PyTorch 2.2+ instalado conforme apropriado para o seu hardware. Em seguida, execute:
pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507
Substitua Qwen/Qwen3-4B-Instruct-2507 pelo modelo que você deseja que tenha a censura removida.
[!IMPORTANT]
Embora o PyTorch 2.2 seja a versão mínima do PyTorch necessária para o Heretic funcionar, alguns modelos e configurações podem exigir recursos encontrados apenas em versões posteriores. Por exemplo, carregar modelos quantizados em MXFP4 como gpt-oss usa
torch.accelerator, que foi adicionado no PyTorch 2.6.
[!TIP]
O Heretic usa uv para gerenciamento de dependências, e o repositório inclui um arquivo
uv.lockfixando cada versão de pacote. Se você já usa uv (e provavelmente deveria!), você pode simplesmente clonar o repositório e executar o Heretic comuv run heretic, o que garante que suas dependências correspondam às usadas pelos desenvolvedores, melhorando a confiabilidade e a segurança.
O processo é totalmente automático e não requer configuração; no entanto, o Heretic tem uma variedade de parâmetros de configuração que podem ser alterados para maior controle. Execute heretic --help para ver as opções de linha de comando disponíveis ou consulte config.default.toml se preferir usar um arquivo de configuração.