Skip to content
KitploitKITPLOIT
도구익스플로잇블로그
Log in
제출
도구익스플로잇블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
Uncensored-AI — 언어 모델을 위한 완전 자동 검열 제거 | Kitploit
도구/GitHubGitHub/0xsojalsec/uncensored-ai
Machine LearningPapers & ResearchLearning & EducationAI SecurityAdversarial Attack
GitHub0xsojalsec/uncensored-ai

Uncensored-AI

언어 모델을 위한 완전 자동 검열 제거

저장소 보기
23152513개월 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유
Logo

Heretic: 언어 모델의 완전 자동 검열 제거

Discord Matrix Follow us on Hugging Face Codeberg mirror

#1 Repository of the Day

Heretic은 트랜스포머 기반 언어 모델에서 검열(일명 "안전 정렬")을 비싼 사후 훈련 없이 제거하는 도구입니다. 방향성 절제(directional ablation)의 고급 구현체(일명 "abliteration", Arditi et al. 2024, Lai 2025 (1, 2))와 Optuna 기반 TPE 파라미터 최적화를 결합합니다.

이 접근 방식은 Heretic이 완전히 자동으로 작동하도록 합니다. Heretic은 거부 횟수와 원본 모델과의 KL 발산을 동시에 최소화하여 고품질의 abliteration 파라미터를 찾습니다. 그 결과 원본 모델의 지능을 최대한 유지하는 검열 해제 모델이 생성됩니다. Heretic을 사용하기 위해 트랜스포머 내부를 이해할 필요는 없습니다. 사실, 명령줄 프로그램 실행 방법을 아는 사람이라면 누구나 Heretic으로 언어 모델의 검열을 해제할 수 있습니다.

Heretic은 대부분의 밀집(dense) 모델, 많은 멀티모달 모델, 여러 MoE 아키텍처, 심지어 Qwen3.5와 같은 일부 하이브리드 모델도 지원합니다. 순수 상태-공간 모델 및 일부 연구용 아키텍처는 아직 기본적으로 지원되지 않습니다.

Screenshot

 

기본 구성으로 비지도 실행 시 Heretic은 인간 전문가가 수동으로 만든 abliterations과 필적하는 품질의 검열 해제 모델을 생성할 수 있습니다:

모델"유해한" 프롬프트에 대한 거부 횟수"무해한" 프롬프트에 대한 원본 모델과의 KL 발산
google/gemma-3-12b-it (원본)97/1000 (정의상)
mlabonne/gemma-3-12b-it-abliterated-v23/1001.04
huihui-ai/gemma-3-12b-it-abliterated3/1000.45
p-e-w/gemma-3-12b-it-heretic (당사)3/1000.16

Heretic 버전은 인간의 노력 없이 생성되었지만, 다른 abliterations과 동일한 수준의 거부 억제를 달성하면서도 KL 발산이 훨씬 낮아 원본 모델의 능력 손상이 더 적음을 나타냅니다. (Heretic의 내장 평가 기능을 사용하여 해당 수치를 재현할 수 있습니다. 예: heretic --model google/gemma-3-12b-it --evaluate-model p-e-w/gemma-3-12b-it-heretic. 정확한 값은 플랫폼 및 하드웨어에 따라 달라질 수 있습니다. 위 표는 PyTorch 2.8, RTX 5090 환경에서 작성되었습니다.)

물론, 수학적 지표와 자동화된 벤치마크가 전체 이야기를 말해주는 것은 아니며, 인간 평가를 대체할 수 없습니다. Heretic으로 생성된 모델은 사용자들로부터 좋은 반응을 얻었습니다 (링크 및 강조 추가):

"이전에는 회의적이었지만, 방금 GPT-OSS 20B Heretic 모델을 다운로드했는데, 정말 대단하네요. 민감한 주제에 대해 적절하게 형식화된 긴 응답을 제공하고, 검열되지 않은 모델에서 기대하는 정확한 표현을 사용하며, 세부 정보가 포함된 마크다운 형식 테이블을 생성합니다. 현재까지 이 모델의 최고의 abliterated 버전인 것 같습니다..." (댓글 링크)

"Heretic GPT 20b는 지금까지 시도해본 검열되지 않은 모델 중 최고인 것 같습니다. 모델의 지능을 파괴하지 않으며, 기본 모델에서는 거부되었을 프롬프트에 정상적으로 응답합니다." (댓글 링크)

"[Qwen3-4B-Instruct-2507-heretic] 16GB vram에서 실행할 수 있었던 최고의 양자화되지 않은 abliterated 모델이었습니다." (댓글 링크)

Heretic 모델은 MMLU, GSM8K와 같은 표준 지표를 사용하여 독립적으로 벤치마킹되었으며, 경쟁 abliteration 도구로 생성된 모델과 비교하여 우수한 성능을 보이는 것으로 확인되었습니다: 1, 2.

커뮤니티는 Heretic을 사용하여 4,000개 이상의 모델을 생성 및 게시했습니다.

사용법

하드웨어에 적합한 PyTorch 2.2+가 설치된 Python 3.10+ 환경을 준비합니다. 그런 다음 실행:

pip install -U heretic-llm
heretic Qwen/Qwen3-4B-Instruct-2507

Qwen/Qwen3-4B-Instruct-2507를 검열을 해제하려는 모델로 바꾸세요.

[!IMPORTANT]

PyTorch 2.2는 Heretic이 작동하는 데 필요한 최소 버전이지만, 일부 모델 및 구성은 이후 버전에서만 제공되는 기능이 필요할 수 있습니다. 예를 들어, gpt-oss와 같은 MXFP4 양자화 모델을 로드하려면 PyTorch 2.6에서 추가된 torch.accelerator를 사용합니다.

[!TIP]

Heretic은 종속성 관리를 위해 uv를 사용하며, 저장소에는 모든 패키지 버전을 고정한 uv.lock 파일이 포함되어 있습니다. 이미 uv를 사용하고 있다면(그래야 합니다!), 저장소를 클론하고 uv run heretic으로 Heretic을 실행하면 개발자가 사용한 것과 동일한 종속성이 보장되어 신뢰성과 보안이 향상됩니다.

프로세스는 완전 자동이며 구성이 필요하지 않습니다. 그러나 Heretic은 더 큰 제어를 위해 변경할 수 있는 다양한 구성 매개변수를 제공합니다. 사용 가능한 명령줄 옵션을 보려면 heretic --help를 실행하거나, 구성 파일을 선호하는 경우 config.default.toml을 확인하세요.

프로그램 실행 시작 시 Heretic은 시스템을 벤치마킹하여 사용 가능한 하드웨어를 최대한 활용하기 위한 최적의 배치 크기를 결정합니다. RTX 3090에서 기본 구성으로 Qwen3-4B-Instruct-2507의 검열을 해제하는 데 약 20-30분이 소요됩니다. 참고로 Heretic은 bitsandbytes를 사용한 모델 양자화를 지원하므로 모델 처리에 필요한 VRAM을 대폭 줄일 수 있습니다. 양자화를 활성화하려면 quantization 옵션을 bnb_4bit로 설정하세요.

Heretic이 모델 검열 해제를 완료한 후에는 모델 저장, Hugging Face에 업로드, 작동 테스트를 위한 채팅, 표준 벤치마크 실행, 또는 이들 중 조합을 선택할 수 있습니다.

연구 기능

Heretic은 모델 검열 제거의 주요 기능 외에도 모델 내부 의미론(해석 가능성) 연구를 지원하는 기능을 제공합니다. 이러한 기능을 사용하려면 선택적 research 확장과 함께 Heretic을 설치해야 합니다:

pip install -U heretic-llm[research]

그러면 다음 기능에 액세스할 수 있습니다:

--plot-residuals 플래그로 잔차 벡터 플롯 생성

이 플래그와 함께 실행하면 Heretic은 다음을 수행합니다:

  1. 각 트랜스포머 레이어에 대해 첫 번째 출력 토큰의 잔차 벡터(은닉 상태)를 "유해한" 프롬프트와 "무해한" 프롬프트 모두에 대해 계산합니다.
  2. 잔차 공간에서 2D 공간으로 PaCMAP 투영을 수행합니다.
  3. 연속 레이어의 투영을 더 유사하게 만들기 위해 "유해한"/"무해한" 잔차의 투영을 기하학적 중앙값으로 좌우 정렬합니다. 또한 각 새 레이어에 대해 PaCMAP은 이전 레이어의 투영으로 초기화되어 급격한 전환을 최소화합니다.
  4. 투영을 산점도로 표시하여 각 레이어의 PNG 이미지를 생성합니다.
  5. 레이어 간 잔차 변환을 보여주는 애니메이션 GIF를 생성합니다.
잔차 벡터 플롯

생성된 플롯의 다양한 측면을 제어할 수 있는 옵션은 구성 파일을 참조하세요.

PaCMAP은 CPU에서 수행되는 비용이 많이 드는 연산입니다. 더 큰 모델의 경우 모든 레이어에 대한 투영을 계산하는 데 한 시간 이상 걸릴 수 있습니다.

--print-residual-geometry 플래그로 잔차 기하학 세부 정보 출력

"유해한" 및 "무해한" 프롬프트에 대한 잔차 벡터가 서로 어떻게 관련되는지에 대한 정량적 분석에 관심이 있다면, 이 플래그는 다음 표를 제공합니다. (이 경우 gemma-3-270m-it에 대한) 다양한 지표로 가득 차 있어 이해를 돕습니다:

도구 다운로드