Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
AutoRAN-public | Kitploit
도구/GitHubGitHub/jackpurcell/autoran-public
ExploitationPapers & ResearchRed TeamingAI SecurityAdversarial Attack
GitHubjackpurcell/autoran-public

AutoRAN-public

저장소 보기
11110개월 전아직 검토되지 않음

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

🧠 AutoRAN: 대형 추론 모델의 안전 추론 자동 하이재킹

AutoRAN은 정렬이 덜 된(보조) 보조 모델을 활용하여 추론 흔적을 시뮬레이션하고, 서술형 프롬프트를 생성한 뒤, 이를 반복적으로 정제하여 최신 대형 추론 모델(LRM)의 안전 추론을 우회하는 자동화된 안전 추론 하이재킹 도구입니다.

AutoRAN 개요

⚠️ 고지 사항: 이 저장소는 통제된 보안 연구 및 AI 안전 레드티밍(red-teaming) 목적으로만 사용하십시오.

🔍 주요 기능

  • ⚙️ 반복적 프롬프트 정제를 통한 자동 다중 턴 탈옥(Jailbreak)
  • 🧩 그럴듯한 교육적/윤리적 구실로 악의적 목표를 포장하는 서술형 템플릿
  • 🔁 중간 추론 흔적을 활용해 프롬프트를 진화시키는 정제 전략
  • 📈 상용 LRM에서 100%에 가까운 공격 성공률
  • 🔬 AdvBench, HarmBench, StrongReject에서 평가

🛠️ 방법 개요

AutoRAN은 3단계 파이프라인으로 동작합니다:

  1. 추론 시뮬레이션: 약한 모델을 사용해 피해 모델의 고수준 CoT 구조를 모방합니다.
  2. 프롬프트 생성: 시뮬레이션된 추론을 사용해 서술형 템플릿을 채웁니다.
  3. 프롬프트 정제: 중간 추론 및 안전 거부 패턴에 따라 프롬프트를 조정합니다.

AutoRAN 파이프라인

📊 결과

공격 성능

📁 실행 기록

로그와 결과는 /records 디렉토리에서 확인할 수 있습니다. 예시:

root@kitploit:~
ls -lh records/

🚀 빠른 시작: 데모

root@kitploit:~
# 저장소 클론
git clone {THIS_REPO}
cd AutoRAN

# 의존성 설치
pip install -r requirements.txt

# 모델 액세스 신청 (HuggingFace 링크 참조)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# 모델 서버 시작 (권장: tmux 또는 screen 사용)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# 필요에 따라 demo.py에서 공격 프롬프트 수정
python demo.py

# 명령줄 지침을 따르세요.
# GPT-o3, GPT-o4 Mini 또는 Gemini 2.5-Flash/Pro에 질문을 복사한 다음
# 프롬프트에 따라 결과를 터미널에 다시 붙여넣어야 할 수 있습니다.

🚀 전체 실험 워크플로우

root@kitploit:~
# 저장소 클론
git clone {THIS_REPO}
cd AutoRAN

# 의존성 설치
pip install -r requirements.txt

# 자동 ChatGPT 상호작용을 위한 chat2api 설정:
# https://github.com/lanqian528/chat2api

# 모델 액세스 신청 (HuggingFace 링크 참조)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# 모델 서버 시작 (권장: tmux 또는 screen 사용)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# 메인 실험 스크립트 실행
python main.py

🧷 고지 사항

이 코드는 연구 및 교육 목적으로만 공개됩니다. LLM의 안전 취약점에 대한 책임 있는 평가를 지원하기 위한 것입니다. 통제된 환경 밖에서 실제 시스템을 대상으로 이 코드를 사용하거나 유해한 출력을 생성하지 마십시오.

📚 인용

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
도구 다운로드