
Полностью автоматическое снятие цензуры для языковых моделей
Heretic — это инструмент, который удаляет цензуру (так называемое «согласование безопасности») из трансформерных языковых моделей без дорогостоящего пост-обучения. Он сочетает в себе продвинутую реализацию направленной абляции, также известной как «аблитерация» (Arditi et al. 2024, Lai 2025 (1, 2)), с оптимизатором параметров на основе TPE на базе Optuna.
Такой подход позволяет Heretic работать полностью автоматически. Heretic находит высококачественные параметры аблитерации, одновременно минимизируя количество отказов и KL-дивергенцию относительно исходной модели. В результате получается модель без цензуры, сохраняющая как можно больше интеллекта исходной модели. Для использования Heretic не требуется понимания внутреннего устройства трансформеров. По сути, любой, кто умеет запускать программу из командной строки, может использовать Heretic для удаления цензуры из языковых моделей.
Heretic поддерживает большинство плотных моделей, включая многие мультимодальные модели, несколько различных архитектур MoE и даже некоторые гибридные модели, такие как Qwen3.5. Чисто state-space модели и некоторые другие исследовательские архитектуры пока не поддерживаются из коробки.
Запускаемый без контроля с конфигурацией по умолчанию, Heretic может создавать модели без цензуры, качество которых сопоставимо с аблитерациями, созданными вручную экспертами-людьми:
| Модель | Отказы на «вредные» промпты | KL-дивергенция с исходной моделью на «безвредные» промпты |
|---|---|---|
| google/gemma-3-12b-it (исходная) | 97/100 | 0 (по определению) |
| mlabonne/gemma-3-12b-it-abliterated-v2 | 3/100 | 1.04 |
| huihui-ai/gemma-3-12b-it-abliterated | 3/100 | 0.45 |
| p-e-w/gemma-3-12b-it-heretic (наша) | 3/100 | 0.16 |
Версия Heretic, созданная без каких-либо усилий человека, достигает того же
уровня подавления отказов, что и другие аблитерации, но при гораздо более низкой
KL-дивергенции, что указывает на меньший ущерб возможностям исходной модели.
(Вы можете воспроизвести эти цифры с помощью встроенной функции оценки Heretic,
например heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic.
Обратите внимание, что точные значения могут зависеть от платформы и аппаратного обеспечения.
Таблица выше была составлена с использованием PyTorch 2.8 на RTX 5090.)
Конечно, математические метрики и автоматизированные бенчмарки никогда не рассказывают всей истории и не заменяют человеческую оценку. Модели, созданные с помощью Heretic, были хорошо приняты пользователями (ссылки и выделение добавлены):
«Раньше я скептически относился, но я только что скачал модель GPT-OSS 20B Heretic и, черт возьми. Она даёт правильно отформатированные длинные ответы на чувствительные темы, используя именно те слова, которые и ожидаешь от модели без цензуры, создаёт таблицы в формате markdown с деталями и всем таким. Похоже, это лучшая аблитерированная версия этой модели на данный момент...» (Ссылка на комментарий)
«Heretic GPT 20b, похоже, лучшая модель без цензуры из всех, что я пробовал. Она не разрушает интеллект модели и отвечает на промпты, которые базовая модель обычно отклоняла бы». (Ссылка на комментарий)
«[Qwen3-4B-Instruct-2507-heretic] — лучшая неквантованная аблитерированная модель, которую мне удалось запустить на 16 ГБ видеопамяти». (Ссылка на комментарий)
Модели Heretic также были независимо протестированы с использованием стандартных метрик, таких как MMLU и GSM8K, и было обнаружено, что они выгодно отличаются от моделей, созданных конкурирующими инструментами аблитерации: 1, 2.
Сообщество создало и опубликовало с помощью Heretic значительно более 4000 моделей.
Подготовьте окружение Python 3.10+ с установленным PyTorch 2.2+, подходящим для вашего аппаратного обеспечения. Затем выполните:
pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507
Замените Qwen/Qwen3-4B-Instruct-2507 на любую модель, из которой вы хотите удалить цензуру.
[!IMPORTANT]
Хотя PyTorch 2.2 — это минимальная версия PyTorch, необходимая для работы Heretic, некоторые модели и конфигурации могут требовать функций, доступных только в более поздних версиях. Например, загрузка MXFP4-квантованных моделей, таких как gpt-oss, использует
torch.accelerator, который был добавлен в PyTorch 2.6.
[!TIP]
Heretic использует uv для управления зависимостями, и в репозиторий включён файл
uv.lock, фиксирующий версии всех пакетов. Если вы уже используете uv (а вам, вероятно, стоит!), вы можете просто клонировать репозиторий и запустить Heretic с помощьюuv run heretic, что гарантирует соответствие ваших зависимостей тем, которые используют разработчики, повышая надёжность и безопасность.
Процесс полностью автоматический и не требует настройки; однако
у Heretic есть множество параметров конфигурации, которые можно изменить для
более точного контроля. Запустите heretic --help, чтобы увидеть доступные параметры командной строки,
или загляните в config.default.toml, если предпочитаете использовать
файл конфигурации.