Hereticは、高価なポストトレーニングを必要とせずに、トランスフォーマーベースの言語モデルから検閲(別名「セーフティアラインメント」)を除去するツールです。 これは、方向性アブレーション(別名「アブリタレーション」、Arditi et al. 2024、Lai 2025(1、2))の高度な実装と、Optuna を利用したTPEベースのパラメータ最適化を組み合わせています。
このアプローチにより、Hereticは完全に自動的に動作します。Hereticは、拒否の回数と元のモデルからのKLダイバージェンスを同時に最小化することで、高品質なアブリタレーションパラメータを見つけ出します。その結果、元のモデルの知能を可能な限り保持した検閲除去モデルが得られます。Hereticを使用するためにトランスフォーマーの内部構造を理解する必要はありません。実際、コマンドラインプログラムの実行方法を知っている人なら誰でも、Hereticを使って言語モデルの検閲を解除できます。
Hereticは、ほとんどの高密度モデル、多くのマルチモーダルモデル、いくつかの異なるMoEアーキテクチャ、さらにはQwen3.5のような一部のハイブリッドモデルをサポートしています。純粋な状態空間モデルや特定の研究用アーキテクチャは、現時点では標準ではサポートされていません。
デフォルト設定で教師なしで実行すると、Hereticは人間の専門家が手動で作成したアブリタレーションに匹敵する品質の検閲除去モデルを生成できます。
| モデル | 「有害な」プロンプトに対する拒否数 | 「無害な」プロンプトに対する元モデルとのKLダイバージェンス |
|---|---|---|
| google/gemma-3-12b-it (元モデル) | 97/100 | 0 (定義による) |
| mlabonne/gemma-3-12b-it-abliterated-v2 | 3/100 | 1.04 |
| huihui-ai/gemma-3-12b-it-abliterated | 3/100 | 0.45 |
| p-e-w/gemma-3-12b-it-heretic (弊社) | 3/100 | 0.16 |
Heretic版は、人間の労力を一切かけずに生成され、他のアブリタレーションと同じレベルの拒否抑制を達成しながら、はるかに低いKLダイバージェンスを示し、元のモデルの能力へのダメージが少ないことを示しています。
(Hereticの内蔵評価機能を使用してこれらの数値を再現できます。例:heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic。正確な値はプラットフォームやハードウェアに依存する可能性があることに注意してください。上の表は、PyTorch 2.8を使用し、RTX 5090上で作成されました。)
もちろん、数学的な指標や自動ベンチマークだけでは全てを語ることはできず、人間による評価の代わりにはなりません。Hereticで生成されたモデルはユーザーから好評を得ています(リンクと強調を追加)。
「当初は懐疑的でしたが、GPT-OSS 20B Hereticをダウンロードしてびっくりしました。センシティブなトピックに対して、適切にフォーマットされた長文の応答を、検閲されていないモデルに期待されるまさにその言葉を使って返してきます。詳細なマークダウン形式の表まで生成します。これは今までのこのモデルのアブリタレーション版の中でも最高のもののようです...」 (コメントへのリンク)
「Heretic GPT 20bは、今まで試した中で最高の検閲解除モデルのようです。モデルの知能を破壊せず、ベースモデルでは拒否されるようなプロンプトに対しても通常通り応答します。」 (コメントへのリンク)
「[Qwen3-4B-Instruct-2507-heretic] は、16GB VRAMで動作させた中で最高の未量子化アブリタレーションモデルでした。」 (コメントへのリンク)
Hereticモデルは、MMLUやGSM8Kなどの標準的な指標を用いて独立にベンチマークも行われており、競合するアブリタレーションツールで生成されたモデルと好意的に比較されることが確認されています: 1、 2。
コミュニティはHereticを使用して、4000を超えるモデルを作成し公開しています。
ハードウェアに適したPyTorch 2.2以上がインストールされたPython 3.10以上の環境を準備してください。その後、以下を実行します:
pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507
Qwen/Qwen3-4B-Instruct-2507を、検閲を解除したい任意のモデルに置き換えてください。
[!IMPORTANT]
Hereticが動作するために必要なPyTorchの最小バージョンは2.2ですが、一部のモデルや設定では、それ以降のバージョンでのみ利用可能な機能が必要になる場合があります。例えば、gpt-ossのようなMXFP4量子化モデルの読み込みには、PyTorch 2.6で追加された
torch.acceleratorを使用します。
[!TIP]
Hereticは依存関係管理にuvを使用しており、リポジトリにはすべてのパッケージバージョンを固定した
uv.lockファイルが含まれています。すでにuvを使用している場合(推奨)、リポジトリをクローンしてuv run hereticでHereticを実行するだけで、依存関係が開発者のものと一致し、信頼性とセキュリティが向上します。
このプロセスは完全に自動で、設定は不要です。ただし、Hereticにはより細かい制御のために変更可能なさまざまな設定パラメータがあります。利用可能なコマンドラインオプションを確認するにはheretic --helpを実行するか、設定ファイルを使用したい場合はconfig.default.tomlを参照してください。
プログラム実行の開始時に、Hereticはシステムをベンチマークして最適なバッチサイズを決定し、利用可能なハードウェアを最大限に活用します。デフォルト設定で、RTX 3090上でQwen3-4B-Instruct-2507の検閲を解除するには約20〜30分かかります。Hereticはbitsandbytesによるモデル量子化をサポートしており、モデルの処理に必要なVRAMを大幅に削減できることに注意してください。量子化を有効にするには、quantizationオプションをbnb_4bitに設定してください。
Hereticがモデルの検閲解除を完了すると、モデルの保存、Hugging Faceへのアップロード、チャットによる動作テスト、標準ベンチマークの実行、またはこれらの任意の組み合わせを選択できます。
Hereticは、モデル内部の意味論(解釈可能性)に関する研究を支援するために設計された機能も提供します。これらの機能を使用するには、オプションのresearchエクストラを指定してHereticをインストールする必要があります:
pip install -U heretic-llm[research]
これにより、以下の機能が利用可能になります:
--plot-residuals を指定して残差ベクトルのプロットを生成このフラグを指定して実行すると、Hereticは以下の処理を行います:
生成されるプロットのさまざまな側面を制御するオプションについては、設定ファイルを参照してください。
PaCMAPはCPU上で実行される負荷の高い操作であることに注意してください。大規模なモデルでは、すべての層の投影を計算するのに1時間以上かかる場合があります。
--print-residual-geometry を指定して残差幾何の詳細を表示「有害な」プロンプトと「無害な」プロンプトに対する残差ベクトルが互いにどのように関係しているかを定量的に分析したい場合、このフラグは以下の表を出力します。この表には、理解を促進するための多くの指標が含まれています(ここではgemma-3-270m-itの場合):