
LLM 보안을 평가하고 개선하기 위한 도구 모음입니다.
🤗 Hugging Face의 모델 | 블로그 | 웹사이트 | CyberSec Eval 논문 | Llama Guard 논문
Purple Llama는 시간이 지남에 따라 커뮤니티가 오픈 생성형 AI 모델을 책임감 있게 구축할 수 있도록 도와주는 도구와 평가를 한데 모으는 포괄 프로젝트입니다. 초기 릴리스에는 사이버 보안 및 입력/출력 안전장치를 위한 도구와 평가가 포함되지만, 가까운 시일 내에 더 많은 기여를 계획하고 있습니다.
사이버보안 세계에서 차용한 개념으로, 우리는 생성형 AI가 제기하는 문제를 진정으로 완화하려면 공격(레드팀)과 방어(블루팀) 자세를 모두 취해야 한다고 믿습니다. 레드팀과 블루팀의 책임을 모두 포함하는 퍼플 팀링(Purple teaming)은 잠재적 위험을 평가하고 완화하는 협업적 접근 방식이며, 동일한 정신이 생성형 AI에도 적용됩니다. 따라서 Purple Llama에 대한 우리의 투자는 포괄적일 것입니다.
Purple Llama 프로젝트의 구성 요소는 연구 및 상업적 사용을 모두 허용하는 허용적(permissive) 라이선스로 제공됩니다. 이는 커뮤니티 협업을 가능하게 하고 생성형 AI 개발을 위한 신뢰 및 안전 도구의 개발과 사용을 표준화하는 중요한 단계라고 믿습니다. 보다 구체적으로, 평가(Evals)와 벤치마크는 MIT 라이선스로 제공되며, 모든 모델은 해당 Llama 커뮤니티 라이선스를 사용합니다. 아래 표를 참조하십시오:
| 구성 요소 유형 | 구성 요소 | 라이선스 |
|---|---|---|
| 평가/벤치마크 | Cyber Security Eval (추후 추가 예정) | MIT |
| 안전장치 | Llama Guard | Llama 2 Community License |
| 안전장치 | Llama Guard 2 | Llama 3 Community License |
| 안전장치 | Llama Guard 3-8B | Llama 3.2 Community License |
| 안전장치 | Llama Guard 3-1B | Llama 3.2 Community License |
| 안전장치 | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| 안전장치 | Prompt Guard | Llama 3.2 Community License |
| 안전장치 | Code Shield | MIT |
Llama 3의 Responsible Use Guide에서 설명한 바와 같이, LLM에 대한 모든 입력과 출력을 애플리케이션에 적합한 콘텐츠 지침에 따라 검사하고 필터링할 것을 권장합니다.
Llama Guard 3는 개발자가 다양한 일반적인 유형의 위반 콘텐츠를 탐지할 수 있도록 지원하기 위해 설계된 일련의 고성능 입력 및 출력 조정(모더레이션) 모델로 구성됩니다.
이 모델들은 Meta-Llama 3.1 및 3.2 모델을 파인튜닝하여 구축되었으며, 다양한 개발자 사용 사례를 지원하기 위해 MLCommons 표준 위험 분류 체계 탐지를 지원하도록 최적화되었습니다. 또한 Llama 3.2 기능(신규 언어 7개, 128k 컨텍스트 창, 이미지 추론)을 지원하며, 유용한 사이버 공격 응답을 탐지하고 코드 인터프리터를 사용하는 Llama 시스템의 호스팅 환경에서 LLM이 생성한 악성 코드 출력이 실행되지 않도록 방지하도록 최적화되었습니다.
Prompt Guard는 LLM 기반 애플리케이션을 악성 프롬프트로부터 보호하여 보안과 무결성을 보장하는 강력한 도구입니다.
프롬프트 공격의 범주에는 프롬프트 인젝션과 제일브레이킹이 포함됩니다:
Code Shield는 LLM이 생성한 안전하지 않은 코드에 대한 추론 시점 필터링 지원을 추가합니다. Code Shield는 안전하지 않은 코드 제안 위험 완화, 코드 인터프리터 남용 방지, 안전한 명령 실행을 제공합니다. CodeShield 예제 노트북.
CyberSec Eval v1은 우리가 알기로 LLM을 위한 최초의 업계 전반 사이버 보안 안전 평가 세트였습니다. 이 벤치마크는 업계 지침 및 표준(예: CWE 및 MITRE ATT&CK)에 기반하며 보안 전문가들과의 협업으로 구축되었습니다. 우리는 책임 있는 AI 개발에 관한 백악관 약속에 명시된 일부 위험을 해결하는 데 도움이 되는 도구를 제공하는 것을 목표로 합니다. 여기에는 다음이 포함됩니다:
우리는 이러한 도구가 LLM이 안전하지 않은 AI 생성 코드를 제안하는 빈도를 줄이고 사이버 적에게 도움이 되는 정도를 줄일 것이라고 믿습니다. 초기 결과에 따르면 LLM은 안전하지 않은 코드를 추천하고 악성 요청을 따르는 데 있어 상당한 사이버 보안 위험이 있습니다. 자세한 내용은 Cybersec Eval 논문을 참조하십시오.
CyberSec Eval 2는 코드 인터프리터를 남용하려는 LLM의 성향, 공격적 사이버 보안 역량, 프롬프트 인젝션에 대한 취약성을 측정하여 이전 버전을 확장합니다. 논문은 여기에서 읽을 수 있습니다.
또한 🤗 리더보드는 여기에서 확인할 수 있습니다.
새로 출시된 CyberSec Eval 3에는 시각적 프롬프트 인젝션 테스트, 표적 피싱(spear phishing) 역량 테스트, 자율적 공격형 사이버 작전 테스트라는 세 가지 추가 테스트 스위트가 포함되어 있습니다.
Llama 레퍼런스 시스템의 일부로, 이러한 안전장치의 채택과 배포를 용이하게 하기 위해 안전 계층을 통합하고 있습니다. 안전장치를 시작하는 데 필요한 리소스는 Llama-recipe GitHub 저장소에서 확인할 수 있습니다.
Purple Llama 구성 요소뿐만 아니라 일반적으로 Llama 모델에 대한 자주 묻는 질문의 최신 목록은 FAQ 여기에서 확인하십시오.
참여 방법은 CONTRIBUTING 파일을 참조하십시오.