Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
gradient-untangler — 오픈 가중치 LLM을 위한 로컬 화이트박스 그래디언트 공격: 레드팀을 위한 GCG/PEZ 접미사 탐색, 레이어 중요도, 가중치 스냅샷 및 rank-1 접미사-델타 피팅. | Kitploit
도구/GitLabGitLab/wattocyber/gradient-untangler
Machine LearningRed TeamingAI SecurityAdversarial Attack
GitLabwattocyber/gradient-untangler

gradient-untangler

오픈 가중치 LLM을 위한 로컬 화이트박스 그래디언트 공격: 레드팀을 위한 GCG/PEZ 접미사 탐색, 레이어 중요도, 가중치 스냅샷 및 rank-1 접미사-델타 피팅.

저장소 보기
3일 전아직 검토되지 않음

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유
웹사이트

gradient-untangler

gradient-untangler

디스크에 보유한 오픈 가중치(open-weight) 모델에 대한 로컬 화이트박스(white-box) 접미사 공격.

임포트gradjail
CLIgradient-untangler
용도로컬 가중치에 대한 실제 그래디언트. GCG, PEZ 및 관련 이산/연속 접미사 탐색. 원시 가중치 레지스트리 및 레이어 현저성(saliency).
아닌 것원격 API 탈옥 도구가 아님. 제3자 운영 환경을 공격할 수 있는 권한이 아님.

python license repro

승인된 보안 연구에만 사용하세요. 소유한 모델, 로컬 가중치, 범위 내 버그 바운티 프로그램, 서면 계약된 펜테스트, CTF, 그리고 통제하는 실습 환경에서만 사용하십시오. SECURITY.md 참조.

설치

root@kitploit:~
git clone https://gitlab.com/WattoCyber/gradient-untangler.git
cd gradient-untangler
py -3.12 -m pip install -e ".[dev,web]"
py -3.12 scripts/repro.py

REPRO_OK가 출력될 것입니다. 이 게이트는 오프라인으로 작동합니다: GPU도 네트워크도 필요 없습니다.

실행

root@kitploit:~
py -3.12 -m gradjail.cli run \
  --model sshleifer/tiny-gpt2 \
  --goal "Say the lab marker." \
  --target-prefix "CANARY_OK" \
  --optimizer gcg \
  --device cpu \
  --judge "contains:CANARY_OK" \
  --out runs/demo.json

웹 테일(공격을 실행하지 않음):

root@kitploit:~
py -3.12 -m gradjail.web

http://127.0.0.1:8787을 열고 runs/*.json 파일을 선택하세요.

구현된 옵티마이저 목록: py -3.12 -m gradjail.cli list.

제공 기능

  • 로컬 모델에서 GCG / PEZ 클래스 탐색. Teacher-forced 교차 엔트로피. Prefix-KV 후보 평가.
  • 가중치 레지스트리(WeightRegistry.from_path): 디스크에서 텐서를 읽고, 스냅샷 및 diff 생성. 편집 전에 매핑.
  • 레이어 현저성(layer saliency): 역전파 한 번으로 동일한 이름으로 키가 지정된 텐서별 L2 그래디언트 노름(norm).
  • 접미사-델타(suffix-to-delta): GCG 접미사는 낭비입니다. 임베딩에 rank-1 U V^T를 피팅하여 클린 프롬프트가 동일한 teacher-forced 목표 CE에 도달하게 합니다. 원본 가중치는 변경되지 않습니다. ROME도, abliteration도, 비트 플립도 아닙니다.
root@kitploit:~
from gradjail.suffix_delta import fit_suffix_delta

inject_target=True를 전달하지 않는 한 대상 토큰 주입은 꺼져 있습니다.

원격 API URL은 거부됩니다. 그래디언트는 로컬 가중치가 필요합니다.

정직성

이것은 로컬 하네스이며, 모든 옵티마이저가 새롭다는 주장이 아닙니다. GCG와 PEZ는 이미 발표된 방법입니다. 이 제품은 하나의 중심 구조로 이루어져 있습니다: 로컬 그래디언트, 가중치 맵, 현저성, 접미사-델타 흡수기, 그리고 재현 게이트.

단일 asr=True 디스크 파일을 발견으로 취급하지 마세요. 다시 실행하세요. 짧은 거절도 실패입니다.

구조

root@kitploit:~
src/gradjail/     package
tests/            pytest
scripts/repro.py  offline product gate
docs/             design and benchmark notes

일부 체크아웃에는 Electron이 디스크에 존재하지만 배포되지는 않습니다.

라이선스

MIT. LICENSE를 참조하세요.

배너 왼쪽 패널: 렘브란트, 명상하는 철학자 (1632), 퍼블릭 도메인, Wikimedia Commons 제공. 과학 오버레이는 저장소 내부에서 생성됩니다.

도구 다운로드