Skip to content
KitploitKITPLOIT
工具漏洞利用博客
Log in
提交
工具漏洞利用博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
Uncensored-AI — 全自动语言模型审查移除 | Kitploit
工具/GitHubGitHub/0xsojalsec/uncensored-ai
机器学习论文与研究学习与教育AI 安全对抗性攻击
GitHub0xsojalsec/uncensored-ai

Uncensored-AI

全自动语言模型审查移除

查看仓库
23152513个月前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享
徽标

Heretic:完全自动的语言模型审查移除

Discord Matrix 在 Hugging Face 上关注我们 Codeberg 镜像

#1 当日仓库

Heretic 是一个从基于 Transformer 的语言模型中移除审查(又名“安全对齐”)的工具,无需昂贵的后训练。它结合了方向消融(也称为“abliteration”(Arditi 等人,2024,Lai 2025(1,2))的高级实现,以及基于 Optuna (Optuna) 的 TPE 参数优化器。

这种设计使得 Heretic 能够完全自动地运行。Heretic 通过共同最小化拒绝次数和与原模型的 KL 散度,找到高质量的 abliteration 参数。这产生了一个去审查的模型,同时尽可能保留了原模型的智能。使用 Heretic 不需要理解 Transformer 内部结构。实际上,任何知道如何运行命令行程序的人都可以使用 Heretic 来去审查语言模型。

Heretic 支持大多数稠密模型,包括许多多模态模型、几种不同的 MoE 架构,甚至一些混合模型如 Qwen3.5。纯状态空间模型和某些其他研究架构暂不支持开箱即用。

截图

 

使用默认配置无监督运行,Heretic 可以产生与人类专家手动创建的 abliteration 质量相媲美的去审查模型:

模型对“有害”提示的拒绝次数对“无害”提示的KL散度(与原模型相比)
google/gemma-3-12b-it(原始)97/1000 (根据定义)
mlabonne/gemma-3-12b-it-abliterated-v23/1001.04
huihui-ai/gemma-3-12b-it-abliterated3/1000.45
p-e-w/gemma-3-12b-it-heretic(我们的)3/1000.16

Heretic 版本在没有任何人工投入的情况下生成,达到了与其他 abliteration 相同的拒绝抑制水平,但 KL 散度低得多,表明对原模型能力的损害更小。 (您可以使用 Heretic 内置的评估功能重现这些数字,例如 heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic。请注意,具体数值可能因平台和硬件而异。上表是在 RTX 5090 上使用 PyTorch 2.8 编译的。)

当然,数学指标和自动化基准永远无法完全反映实际情况,也不能替代人工评估。使用 Heretic 生成的模型受到了用户的好评(添加了链接和强调):

“我之前持怀疑态度,但刚刚下载了 GPT-OSS 20B Heretic 模型,天哪。它对敏感主题给出了格式正确、内容详尽的回答,使用了您对未审查模型所期望的准确未审查词语,生成了带有详细信息的 Markdown 格式表格等。这似乎是迄今为止该模型最好的 abliterated 版本……” (评论链接)

“Heretic GPT 20b 似乎是我尝试过的最好的未审查模型。它没有破坏模型的智能,并且能够回答原本会被基础模型拒绝的提示。” (评论链接)

“[Qwen3-4B-Instruct-2507-heretic] 是我能在 16GB 显存上运行的最好的未量化 abliterated 模型。” (评论链接)

Heretic 模型还通过标准指标(如 MMLU 和 GSM8K)进行了独立基准测试,并发现与竞争 abliteration 工具生成的模型相比具有优势: 1, 2.

社区已经创建并发布了 超过 4000 个 使用 Heretic 的模型。

使用方法

准备一个 Python 3.10+ 环境,并根据您的硬件安装合适的 PyTorch 2.2+。然后运行:

pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507

将 Qwen/Qwen3-4B-Instruct-2507 替换为您想要去审查的模型。

[!重要]

尽管 PyTorch 2.2 是 Heretic 运行所需的最低版本,但某些模型和配置可能需要更高版本的功能。例如,加载 MXFP4 量化的模型(如 gpt-oss)需要 torch.accelerator,该功能在 PyTorch 2.6 中添加。

[!提示]

Heretic 使用 uv 进行依赖管理,并且仓库包含一个锁定每个包版本的 uv.lock 文件。如果您已经使用 uv(您应该使用!),您只需克隆仓库并使用 uv run heretic 运行 Heretic,这样可以确保您的依赖与开发人员使用的依赖匹配,从而提高可靠性和安全性。

该过程完全自动,无需配置;但是,Heretic 有多种配置参数可以更改以获得更好的控制。运行 heretic --help 查看可用的命令行选项,或者如果您更喜欢使用配置文件,请查看 config.default.toml。

在程序运行开始时,Heretic 会对系统进行基准测试,以确定最佳批量大小,从而充分利用可用硬件。 在 RTX 3090 上,使用默认配置,去审查 Qwen3-4B-Instruct-2507 大约需要 20-30 分钟。请注意,Heretic 支持使用 bitsandbytes 进行模型量化,这可以大幅减少处理模型所需的 VRAM 量。将 quantization 选项设置为 bnb_4bit 以启用量化。

Heretic 完成去审查模型后,您可以选择保存模型、上传到 Hugging Face、与它聊天以测试其效果、运行标准基准测试,或这些操作的任意组合。

研究功能

除了其主要功能(移除模型审查)之外,Heretic 还提供旨在支持模型内部语义研究(可解释性)的功能。要使用这些功能,您需要使用可选的 research 扩展安装 Heretic:

pip install -U heretic-llm[research]

这将为您提供以下功能:

通过传递 --plot-residuals 生成残差向量图

使用此标志运行时,Heretic 将:

  1. 为每个 Transformer 层计算第一个输出 token 的残差向量(隐藏状态),分别针对“有害”和“无害”提示。
  2. 执行 PaCMAP 投影 从残差空间到二维空间。
  3. 通过其几何中位数对“有害”/“无害”残差的投影进行左右对齐,以使连续层的投影更相似。此外,PaCMAP 会使用前一层的投影初始化每个新层,从而最小化不连续的过渡。
  4. 散点图投影,为每一层生成 PNG 图像。
  5. 生成一个动画,展示残差如何在层之间变换,以 GIF 格式输出。
残差向量图

请参阅配置文件以了解允许控制生成图表各个方面的选项。

请注意,PaCMAP 是一种昂贵的操作,在 CPU 上执行。对于较大的模型,可能需要一个小时或更长时间来计算所有层的投影。

通过传递 --print-residual-geometry 打印残差几何细节

如果您对“有害”和“无害”提示的残差向量之间关系的定量分析感兴趣,此标志会提供以下表格,其中包含有助于理解相同关系的指标(本例中针对 gemma-3-270m-it):

下载工具