
오픈 가중치 LLM을 위한 로컬 화이트박스 그래디언트 공격: 레드팀을 위한 GCG/PEZ 접미사 탐색, 레이어 중요도, 가중치 스냅샷 및 rank-1 접미사-델타 피팅.

디스크에 보유한 오픈 가중치(open-weight) 모델에 대한 로컬 화이트박스(white-box) 접미사 공격.
| 임포트 | gradjail |
| CLI | gradient-untangler |
| 용도 | 로컬 가중치에 대한 실제 그래디언트. GCG, PEZ 및 관련 이산/연속 접미사 탐색. 원시 가중치 레지스트리 및 레이어 현저성(saliency). |
| 아닌 것 | 원격 API 탈옥 도구가 아님. 제3자 운영 환경을 공격할 수 있는 권한이 아님. |
승인된 보안 연구에만 사용하세요. 소유한 모델, 로컬 가중치, 범위 내 버그 바운티 프로그램, 서면 계약된 펜테스트, CTF, 그리고 통제하는 실습 환경에서만 사용하십시오. SECURITY.md 참조.
git clone https://gitlab.com/WattoCyber/gradient-untangler.git
cd gradient-untangler
py -3.12 -m pip install -e ".[dev,web]"
py -3.12 scripts/repro.py
REPRO_OK가 출력될 것입니다. 이 게이트는 오프라인으로 작동합니다: GPU도 네트워크도 필요 없습니다.
py -3.12 -m gradjail.cli run \
--model sshleifer/tiny-gpt2 \
--goal "Say the lab marker." \
--target-prefix "CANARY_OK" \
--optimizer gcg \
--device cpu \
--judge "contains:CANARY_OK" \
--out runs/demo.json
웹 테일(공격을 실행하지 않음):
py -3.12 -m gradjail.web
http://127.0.0.1:8787을 열고 runs/*.json 파일을 선택하세요.
구현된 옵티마이저 목록: py -3.12 -m gradjail.cli list.
WeightRegistry.from_path): 디스크에서 텐서를 읽고, 스냅샷 및 diff 생성. 편집 전에 매핑.U V^T를 피팅하여 클린 프롬프트가 동일한 teacher-forced 목표 CE에 도달하게 합니다. 원본 가중치는 변경되지 않습니다. ROME도, abliteration도, 비트 플립도 아닙니다.from gradjail.suffix_delta import fit_suffix_delta
inject_target=True를 전달하지 않는 한 대상 토큰 주입은 꺼져 있습니다.
원격 API URL은 거부됩니다. 그래디언트는 로컬 가중치가 필요합니다.
이것은 로컬 하네스이며, 모든 옵티마이저가 새롭다는 주장이 아닙니다. GCG와 PEZ는 이미 발표된 방법입니다. 이 제품은 하나의 중심 구조로 이루어져 있습니다: 로컬 그래디언트, 가중치 맵, 현저성, 접미사-델타 흡수기, 그리고 재현 게이트.
단일 asr=True 디스크 파일을 발견으로 취급하지 마세요. 다시 실행하세요. 짧은 거절도 실패입니다.
src/gradjail/ package
tests/ pytest
scripts/repro.py offline product gate
docs/ design and benchmark notes
일부 체크아웃에는 Electron이 디스크에 존재하지만 배포되지는 않습니다.
MIT. LICENSE를 참조하세요.
배너 왼쪽 패널: 렘브란트, 명상하는 철학자 (1632), 퍼블릭 도메인, Wikimedia Commons 제공. 과학 오버레이는 저장소 내부에서 생성됩니다.