Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
BrokenHill — 대규모 언어 모델(LLM)을 위한 프로덕션화된 그리디 좌표 경사도(GCG) 공격 도구 | Kitploit
도구/GitHubGitHub/bishopfox/brokenhill
ExploitationMachine LearningRed TeamingAI SecurityAdversarial Attack
GitHubbishopfox/brokenhill

BrokenHill

대규모 언어 모델(LLM)을 위한 프로덕션화된 그리디 좌표 경사도(GCG) 공격 도구

저장소 보기
172251년 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유
[ Broken Hill logo ]

Broken Hill

Broken Hill은 대규모 언어 모델(LLM)의 제한을 우회하도록 제작된 프롬프트를 생성하는, 프로덕션 수준에서 바로 사용 가능한 자동화 공격 도구입니다. Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J. Zico Kolter, Matt Fredrikson의 "Universal and Transferable Adversarial Attacks on Aligned Language Models" 논문에 설명된 greedy coordinate gradient(GCG) 공격을 사용합니다.

Broken Hill은 프롬프트를 생성하는 데 사용된 LLM과 다르게 구성된 LLM도 성공적으로 탈옥(jailbreak)시키는 강력한 프롬프트를 생성할 수 있습니다. 예:

  • 매개변수가 더 많거나 적은 동일한 모델
    • 예: 20억 매개변수 버전의 Gemma로 프롬프트를 생성했지만, 70억 매개변수 버전의 Gemma 기반 구현에 사용되는 경우
  • 가중치가 다른 유형으로 양자화된 동일한 모델
    • 예: 가중치가 FP16 형식으로 저장된 Phi 3 버전으로 프롬프트를 생성했지만, 가중치가 4비트 q4_0 정수 형식으로 양자화된 ollama 기본 Phi 3 버전에 사용되는 경우
  • 동일한 모델이지만 무작위화 설정이 다른 경우
    • 예: 기본값이 아닌 temperature 또는 random seed
  • 잠재적으로는 프롬프트를 생성하는 데 사용된 모델과 다른 모델일 수도 있음

이 도구는 부분적으로 "Universal and Transferable Adversarial Attacks on Aligned Language Models" 논문과 관련된 llm-attacks 저장소의 대폭 커스터마이즈된 버전을 기반으로 합니다. 또한 nanoGCG의 일부 알고리즘도 통합합니다.

Zou, Wang, Carlini, Nasr, Kolter, Fredrikson의 원래 연구는 Nvidia A100 및 H100과 같은 80GiB VRAM을 갖춘 고사양 클라우드/호스팅 제공업체 하드웨어를 사용하여 수행되었습니다. 해당 GPU를 구매하는 것은 일반 개인에게는 일반적으로 너무 비싸며, 임대 접근 권한을 얻는 것도 상당한 비용이 발생할 수 있습니다.

우리의 원래 목표는 CUDA를 지원하는 현재 세대 소비자 GPU 중 가장 많은 VRAM(24GiB)을 갖춘 GeForce RTX 4090에서 가능한 한 많은 모델을 대상으로 GCG 공격을 수행할 수 있는 도구를 만들어 이 흥미로운 연구 분야의 접근성을 크게 확장하는 것이었습니다. RTX 4090은 여전히 비싸지만, 한 대를 outright 구매하는 비용은(현재 시점 기준) A100 또는 H100이 장착된 클라우드 인스턴스를 한 달 임대하는 비용과 거의 같습니다. 또한 정보 보안 분야에 종사하는 사람들 중 적어도 일부는 이미 해시 크래킹 및/또는 게임용으로 RTX 4090을 한 대 이상 보유하고 있습니다.

버전 0.34부터 Broken Hill은 CUDA 하드웨어가 없는 장치에서도 허용 가능한 속도로 처리할 수 있으며(CUDA 하드웨어가 제공하는 성능보다는 낮지만), Mac OS와 Windows에서도 사용할 수 있습니다(주로 Linux에서 테스트됨). 이를 통해 이전 버전보다 훨씬 더 많은 사용자가 더 큰 모델을 대상으로 공격을 수행할 수 있습니다.

문서

자료의 양이 많아 Broken Hill 문서는 자체 디렉터리 트리에 있습니다.

Broken Hill 버전 기록

Broken Hill을 소개하는 하이레벨 블로그 게시물

BishopFox.com의 Broken Hill 도구 페이지

기능

  • 광범위한 명령줄 인터페이스
  • 다양한 모델 계열 지원, 그중 다수는 RTX 4090에서 실행할 수 있을 만큼 작은 크기로 제공됨(자세한 내용은 "모델 노트" 문서 참조). 주요 하이라이트:
    • Azurro의 APT 계열
    • Falcon
    • Gemma(Vikhr-Gemma-2B-instruct와 같은 서드파티 파생 모델 포함)
    • Gemma 2
    • GLM-4
    • GPT-J, GPT-Neo, GPT-NeoX
    • Guanaco
    • Llama(Llama-68M-Chat-v1, alpaca-13b와 같은 서드파티 파생 모델 포함)
    • Llama-2(Meta-Llama-Guard-2, Swallow, Youri와 같은 퍼스트파티 및 서드파티 파생 모델 포함)
    • Llama-3(Llama-Guard-3, Swallow, Youko와 같은 퍼스트파티 및 서드파티 파생 모델 포함)
    • MPT
    • Mamba
    • Mistral(Intel의 Neural Chat과 같은 파생 서드파티 모델 포함)
    • Mixtral
    • OPT
    • Orca-2
    • Phi-1 ~ Phi-3.5
    • Pythia(OpenAssistant 모델의 Pythia 기반 하위 집합과 같은 파생 서드파티 모델 포함)
    • Qwen 1, 1.5, 2(nekomata-7b-instruction과 같은 서드파티 파생 모델 포함)
    • RedPajama-INCITE
    • SOLAR
    • SmolLM
    • Snowflake Arctic
    • StableLM 1 및 2
    • TinyLlama
    • Vicuna
  • 필터링/분석을 위해 결과를 JSON 형식으로 출력 가능
  • 여러 가지 다른 무작위화 설정으로 동일한 LLM에 대해 각 반복의 적대적 데이터를 테스트하여 불안정한 결과를 걸러내는 데 도움
  • 각 반복에서 자동 상태 백업을 수행하므로 오류 발생 시 체크포인트에서 재개하거나 테스트 종료 후 추가 반복을 계속 수행할 수 있음
  • 공격이 올바르게 구성되었고 유용한 결과를 생성할 것인지 검증하는 데 도움이 되는 자체 테스트 기능
    • 대화가 모델이 학습된 형식으로 제공되는지 검증
    • 적대적 콘텐츠가 포함되지 않았을 때 모델이 요청된 출력을 제공하지 않는지 검증
    • GCG 공격의 이상적인 결과를 시뮬레이션하는 프롬프트가 주어졌을 때 모델이 요청된 출력을 제공하는지 검증
  • 손실 값 외에도 적대적 콘텐츠 생성 과정을 안내하는 추가 기법
    • 탈옥 횟수 기준으로 최고 기록(high-water-mark) 결과로 롤백
    • 손실 값이 이전 결과를 충족(또는 근접)하도록 요구
  • 테스트 사례에 대한 탐지를 더 정확하게 만들기 위해 JSON 형식의 사용자 지정 탈옥 탐지 규칙 지정 기능
    • Zou, Wang, Carlini, Nasr, Kolter, Fredrikson이 개발한 기본 방법에 대한 개선된 탈옥 탐지 규칙

향후 릴리스 계획

  • 기존 결과를 테스트하거나 재분석하는 기능(다른 모델/구성, 다른 탈옥 탐지 규칙 등으로)
    • "전이 가능한(transferrable)" 적대적 콘텐츠를 더 쉽게 발견할 수 있게 함
    • GCG 공격에 필요한 데이터(그래디언트, 역전파 데이터 등)는 기기에 맞지 않더라도 기기 메모리에 들어갈 수 있는 모델에 대해 결과를 테스트할 수 있게 함
    • 콘텐츠 생성을 다시 실행하는 오버헤드 없이 수정된 탈옥 탐지 규칙을 테스트할 수 있게 함
  • 대화 템플릿을 더욱 정교화하기 위한 더 광범위한 자체 테스트
  • 더 유연한 롤백 모델
  • 더 고유한 변형을 생성하는 데 도움이 되는 구성 가능한 무작위화 규칙("Gamma garden mode")
  • 후속 작업을 위해 결과 데이터를 출력하는 기본 제공 기능(현재 버전의 jq 사용 대신)
  • 개선된 기본 탈옥 탐지 로직
  • 추가 손실 알고리즘
  • 중앙 노드가 조정하는, 실행 중인 Broken Hill 시스템 클러스터를 운영하는 기능
  • 추가 공격 모드
  • 국제화(i18n)
도구 다운로드
  • 비방, 욕설 등이 포함된 적대적 결과가 생성되지 않도록 도와주는 사전 구성된 선택적 차단 목록(denylist)
  • 결과를 개선하기 위한 필터링 및 기타 제어 기능
  • GCG 공격의 변형을 테스트하기 위한 수많은 실험적 옵션
  • 그 외 다양한 기능