Skip to content
KitploitKITPLOIT
도구익스플로잇블로그
Log in
제출
도구익스플로잇블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
Meta_SecAlign — 프롬프트 인젝션 공격에 대응하기 위한 오픈 웨이트 LLM과 학습/평가 코드, 그리고 에이전트 도구 호출 및 명령 수행 보안을 위한 벤치마크. | Kitploit
도구/GitHubGitHub/facebookresearch/meta_secalign
Defensive ToolsMachine LearningPapers & ResearchLearning & EducationAI SecurityAdversarial Attack
GitHubfacebookresearch/meta_secalign

Meta_SecAlign

프롬프트 인젝션 공격에 대응하기 위한 오픈 웨이트 LLM과 학습/평가 코드, 그리고 에이전트 도구 호출 및 명령 수행 보안을 위한 벤치마크.

저장소 보기
7118103개월 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

Meta SecAlign: 프롬프트 인젝션 공격에 대응하는 안전한 파운데이션 LLM

Sizhe Chen*, Arman Zharmagambetov, David Wagner, Chuan Guo* (* 동등한 기술적 기여)

🔥 Meta-SecAlign 모델은 이 코드베이스가 비상업적 용도로만 라이선스되었음에도 불구하고, 이제 Llama 커뮤니티 라이선스에 따라 상업적 사용이 허가되었습니다.

Meta-SecAlign-70B는 프롬프트 인젝션 방어 기능이 내장된 최초의 완전 오픈소스 상용 등급 LLM으로, 에이전트(도구/웹) 보안 측면에서 gpt-5 및 gemini-3-pro에 필적합니다. 우리의 SoTA 학습 레시피는 지금까지 가장 포괄적인 평가를 기준으로 다양한 유틸리티 점수에서 눈에 띄는 하락을 초래하지 않습니다.

환경 설정

  • 하드웨어 요구사항: Meta-SecAlign-8B는 학습에 4×80 GB A100이 필요하고 평가에 16 GB GPU 하나가 필요합니다. Meta-SecAlign-70B는 학습에 8×141 GB H200이 필요하고 평가에 4대(효율성을 위해 8대를 권장)의 80 GB A100이 필요합니다.
  • uv(Python 패키지 관리 도구)를 설치합니다.
  • Meta-SecAlign 패키지 의존성을 설치합니다:

git clone --recurse-submodules https://github.com/facebookresearch/Meta_SecAlign.git
cd Meta_SecAlign
uv venv metasecalign --python 3.13
source metasecalign/bin/activate
uv pip install -r requirements.txt
uv pip install torchtune==0.6.0 --index-url https://download.pytorch.org/whl/cu126

  • Meta-SecAlign 데이터 의존성(GPU가 있는 경우 SEP 유틸리티 평가에 사용되는 항목 포함)을 설치합니다:

python setup.py

  • data/openai_configs.yaml에 OpenAI 키(유틸리티 평가에 사용)를 설정합니다. 해당 파일에는 AzureOpenAI를 통해 OpenAI API에 접근하는 예시가 포함되어 있습니다. 더 자세한 예시는 여기에서 확인할 수 있습니다.
  • [선택사항] Gemini 모델을 평가하려면 data/gemini_configs.yaml에 Gemini 키를 설정합니다.

데모

  • demo.py에는 두 Meta-SecAlign 모델을 사용하기 위한 최소한의 코드가 포함되어 있습니다. 새로운 샘플과 프롬프트 인젝션을 자유롭게 시도하거나, 여러분의 코드베이스에서 모델을 테스트해 보세요:

python demo.py

평가

  • run_tests.py에는 논문에서 보고된 평가 결과를 재현하기 위한 명령이 포함되어 있습니다. 이 스크립트는 tests.py, test_lm_eval.py, test_agentdojo.py, test_injecagent.py를 순차적으로 호출합니다. 결과는 [model_path]/summary.tsv에 기록됩니다.

python run_tests.py -m [model_path] --lora_alpha [lora_alpha]

  • model_path는 테스트할 모델의 경로입니다. 다음을 지원합니다:
    • 로컬 모델(vLLM 추론)
      • meta-llama/Llama-3.1-8B-Instruct_SecAlign (setup.py로 다운로드되는 Meta-SecAlign-8B): 최첨단 프롬프트 인젝션 방어 기능을 갖춘 최초의 완전 오픈 모델
      • meta-llama/Llama-3.3-70B-Instruct_SecAlign (setup.py로 다운로드되는 Meta-SecAlign-70B): 최첨단 프롬프트 인젝션 방어 기능을 갖춘 최초의 완전 오픈 모델
      • meta-llama/Llama-3.1-8B-Instruct
      • meta-llama/Llama-3.3-70B-Instruct
      • 다른 Hugging Face 오픈 가중치 모델도 기본적으로 지원될 수 있습니다.
    • OpenAI GPT 모델
      • gpt-4o-mini: 명령 계층 프롬프트 인젝션 방어 기능을 갖춘 최초의 상용 모델.
      • gpt-4o: 프롬프트 인젝션 방어 기능도 갖춘 후속 플래그십 모델.
      • gpt-5: 우리 평가에서 가장 최신이자 가장 안전한 상용 모델로, --gpt5_reasoning_effort를 지정하여 추론 수준을 변경할 수 있습니다(기본값은 high).
    • Google Gemini 모델
      • gemini-2.0-flash: 프롬프트 인젝션 방어를 주장하는 Google 상용 모델
      • gemini-2.5-flash: 프롬프트 인젝션 방어를 주장하는 Google 상용 모델
      • gemini-2.0-pro: Google 플래그십 모델(프롬프트 인젝션 방어 기능이 포함되었다고 주장하지 않음)
      • gemini-2.5-pro: Google 플래그십 모델(프롬프트 인젝션 방어 기능이 포함되었다고 주장하지 않음)
      • gemini-3-pro-preview: 강력한 프롬프트 인젝션 방어 기능을 갖춘 최첨단 Google 모델
  • [선택사항] lora_alpha는 Meta-SecAlign 모델의 테스트 시점 하이퍼파라미터입니다. 기본값은 8이며, 이는 학습된 그대로의 정확한 Meta-SecAlign 모델을 사용합니다. 0과 8 사이의 lora_alpha 값은 방어되지 않은 모델과 우리의 방어된 모델 사이를 보간하여 유연한 유틸리티-보안 트레이드오프를 가능하게 합니다. lora_alpha를 8 이상으로 외삽하는 것도 가능하지만 테스트되지 않았습니다.
  • 커뮤니티를 위해 다음과 같은 프롬프트 인젝션 벤치마크 평가를 지원합니다:
    • 6개의 보안 벤치마크
      • 명령 수행: AlpacaFarm-Hacked, SEP, TaskTracker, CyberSecEval2
      • 에이전트 도구 호출: InjecAgent, AgentDojo
    • 8개의 유틸리티 벤치마크
      • 일반 지식(lm_eval에서): MMLU, MMLU-Pro, BBH, IFEval, GPQA Diamond
      • 명령 수행: AlpacaEval2, SEP (SEP에서는 meta-llama/Meta-Llama-3-8B-Instruct의 참조 응답과 비교하기 위해 AlpacaEval2 프롬프팅을 사용합니다)
      • 에이전트 도구 호출: AgentDojo

방어적 파인튜닝 (SecAlign++)

  • secalign_plus_plus.py는 우리의 학습 레시피인 SecAlign++를 사용하여 meta-llama/Llama-3.1-8B-Instruct(기본값) 또는 meta-llama/Llama-3.3-70B-Instruct(파인튜닝하려면 해당 줄의 주석을 해제)를 견고한 LoRA 모델로 방어적 파인튜닝하기 위한 명령을 제공합니다.

python secalign_plus_plus.py

코드 감사의 글

SecAlign에서 크게 개선되었으며, Meta-SecAlign 코드의 대부분은 CC-BY-NC에 따라 라이선스됩니다. 프로젝트의 일부는 별도의 라이선스 조건으로 제공됩니다: AgentDojo, TaskTracker, lm-evaluation-harness는 MIT에 따라 라이선스됩니다. 다른 저장소의 코드에는 AgentDojo(agentdojo), TaskTracker(setup.py), lm_eval_harness(lm_eval_config)가 포함됩니다. 이 소프트웨어 및/또는 데이터는 2025년에 BAIR Open Research Commons 저장소에 기탁되었습니다.

도구 다운로드