Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
PurpleLlama — LLM 보안을 평가하고 개선하기 위한 도구 모음입니다. | Kitploit
도구/GitHubGitHub/meta-llama/purplellama
Defensive ToolsVulnerability AnalysisCode AnalysisPapers & ResearchRed TeamingAI SecurityAdversarial AttackAdversarial Attack #10위AI Security #4위
4.4k7736425일 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유
GitHub
meta-llama/purplellama

PurpleLlama

LLM 보안을 평가하고 개선하기 위한 도구 모음입니다.

저장소 보기

🤗 Hugging Face의 모델  | 블로그  | 웹사이트  | CyberSec Eval 논문   | Llama Guard 논문 


Purple Llama

Purple Llama는 시간이 지남에 따라 커뮤니티가 오픈 생성형 AI 모델을 책임감 있게 구축할 수 있도록 도와주는 도구와 평가를 한데 모으는 포괄 프로젝트입니다. 초기 릴리스에는 사이버 보안 및 입력/출력 안전장치를 위한 도구와 평가가 포함되지만, 가까운 시일 내에 더 많은 기여를 계획하고 있습니다.

왜 퍼플(Purple)인가?

사이버보안 세계에서 차용한 개념으로, 우리는 생성형 AI가 제기하는 문제를 진정으로 완화하려면 공격(레드팀)과 방어(블루팀) 자세를 모두 취해야 한다고 믿습니다. 레드팀과 블루팀의 책임을 모두 포함하는 퍼플 팀링(Purple teaming)은 잠재적 위험을 평가하고 완화하는 협업적 접근 방식이며, 동일한 정신이 생성형 AI에도 적용됩니다. 따라서 Purple Llama에 대한 우리의 투자는 포괄적일 것입니다.

라이선스

Purple Llama 프로젝트의 구성 요소는 연구 및 상업적 사용을 모두 허용하는 허용적(permissive) 라이선스로 제공됩니다. 이는 커뮤니티 협업을 가능하게 하고 생성형 AI 개발을 위한 신뢰 및 안전 도구의 개발과 사용을 표준화하는 중요한 단계라고 믿습니다. 보다 구체적으로, 평가(Evals)와 벤치마크는 MIT 라이선스로 제공되며, 모든 모델은 해당 Llama 커뮤니티 라이선스를 사용합니다. 아래 표를 참조하십시오:

구성 요소 유형구성 요소라이선스
평가/벤치마크Cyber Security Eval (추후 추가 예정)MIT
안전장치Llama GuardLlama 2 Community License
안전장치Llama Guard 2Llama 3 Community License
안전장치Llama Guard 3-8BLlama 3.2 Community License
안전장치Llama Guard 3-1BLlama 3.2 Community License
안전장치Llama Guard 3-11B-visionLlama 3.2 Community License
안전장치Prompt GuardLlama 3.2 Community License
안전장치Code ShieldMIT

시스템 수준 안전장치

Llama 3의 Responsible Use Guide에서 설명한 바와 같이, LLM에 대한 모든 입력과 출력을 애플리케이션에 적합한 콘텐츠 지침에 따라 검사하고 필터링할 것을 권장합니다.

Llama Guard

Llama Guard 3는 개발자가 다양한 일반적인 유형의 위반 콘텐츠를 탐지할 수 있도록 지원하기 위해 설계된 일련의 고성능 입력 및 출력 조정(모더레이션) 모델로 구성됩니다.

이 모델들은 Meta-Llama 3.1 및 3.2 모델을 파인튜닝하여 구축되었으며, 다양한 개발자 사용 사례를 지원하기 위해 MLCommons 표준 위험 분류 체계 탐지를 지원하도록 최적화되었습니다. 또한 Llama 3.2 기능(신규 언어 7개, 128k 컨텍스트 창, 이미지 추론)을 지원하며, 유용한 사이버 공격 응답을 탐지하고 코드 인터프리터를 사용하는 Llama 시스템의 호스팅 환경에서 LLM이 생성한 악성 코드 출력이 실행되지 않도록 방지하도록 최적화되었습니다.

Prompt Guard

Prompt Guard는 LLM 기반 애플리케이션을 악성 프롬프트로부터 보호하여 보안과 무결성을 보장하는 강력한 도구입니다.

프롬프트 공격의 범주에는 프롬프트 인젝션과 제일브레이킹이 포함됩니다:

  • 프롬프트 인젝션(Prompt Injections)은 제3자의 신뢰할 수 없는 데이터가 모델의 컨텍스트 창에 포함되는 것을 악용하여 의도하지 않은 지침을 실행하게 하는 입력입니다.
  • 제일브레이킹(Jailbreaks)은 모델에 내장된 안전 및 보안 기능을 무력화하도록 설계된 악성 지침입니다.

Code Shield

Code Shield는 LLM이 생성한 안전하지 않은 코드에 대한 추론 시점 필터링 지원을 추가합니다. Code Shield는 안전하지 않은 코드 제안 위험 완화, 코드 인터프리터 남용 방지, 안전한 명령 실행을 제공합니다. CodeShield 예제 노트북.

평가 및 벤치마크

사이버 보안

CyberSec Eval v1

CyberSec Eval v1은 우리가 알기로 LLM을 위한 최초의 업계 전반 사이버 보안 안전 평가 세트였습니다. 이 벤치마크는 업계 지침 및 표준(예: CWE 및 MITRE ATT&CK)에 기반하며 보안 전문가들과의 협업으로 구축되었습니다. 우리는 책임 있는 AI 개발에 관한 백악관 약속에 명시된 일부 위험을 해결하는 데 도움이 되는 도구를 제공하는 것을 목표로 합니다. 여기에는 다음이 포함됩니다:

  • LLM 사이버 보안 위험을 정량화하기 위한 지표.
  • 안전하지 않은 코드 제안의 빈도를 평가하는 도구.
  • 악성 코드를 생성하거나 사이버 공격을 수행하는 데 도움이 되기 어렵게 LLM을 평가하는 도구.

우리는 이러한 도구가 LLM이 안전하지 않은 AI 생성 코드를 제안하는 빈도를 줄이고 사이버 적에게 도움이 되는 정도를 줄일 것이라고 믿습니다. 초기 결과에 따르면 LLM은 안전하지 않은 코드를 추천하고 악성 요청을 따르는 데 있어 상당한 사이버 보안 위험이 있습니다. 자세한 내용은 Cybersec Eval 논문을 참조하십시오.

CyberSec Eval 2

CyberSec Eval 2는 코드 인터프리터를 남용하려는 LLM의 성향, 공격적 사이버 보안 역량, 프롬프트 인젝션에 대한 취약성을 측정하여 이전 버전을 확장합니다. 논문은 여기에서 읽을 수 있습니다.

또한 🤗 리더보드는 여기에서 확인할 수 있습니다.

CyberSec Eval 3

새로 출시된 CyberSec Eval 3에는 시각적 프롬프트 인젝션 테스트, 표적 피싱(spear phishing) 역량 테스트, 자율적 공격형 사이버 작전 테스트라는 세 가지 추가 테스트 스위트가 포함되어 있습니다.

시작하기

Llama 레퍼런스 시스템의 일부로, 이러한 안전장치의 채택과 배포를 용이하게 하기 위해 안전 계층을 통합하고 있습니다. 안전장치를 시작하는 데 필요한 리소스는 Llama-recipe GitHub 저장소에서 확인할 수 있습니다.

FAQ

Purple Llama 구성 요소뿐만 아니라 일반적으로 Llama 모델에 대한 자주 묻는 질문의 최신 목록은 FAQ 여기에서 확인하십시오.

Purple Llama 커뮤니티에 참여하기

참여 방법은 CONTRIBUTING 파일을 참조하십시오.

도구 다운로드