Skip to content
KitploitKITPLOIT
도구익스플로잇블로그
Log in
제출
도구익스플로잇블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

피드문의개인정보© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
benign-instruction-bench — LLM 에이전트 도구 출력에 대한 프롬프트 인젝션 탐지기 재평가 (논문 초안, 스크립트, 점수) | Kitploit
도구/GitHubGitHub/lzwhehe/benign-instruction-bench
Defensive ToolsVulnerability AnalysisMachine LearningPapers & ResearchLearning & EducationAI Security
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

LLM 에이전트 도구 출력에 대한 프롬프트 인젝션 탐지기 재평가 (논문 초안, 스크립트, 점수)

저장소 보기
33일 전아직 검토되지 않음

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

훈련한 테스트를 통과하기

프롬프트 인젝션 탐지기를 LLM 에이전트가 실제로 사용하는 지점, 즉 에이전트가 읽는 도구 출력에서 재평가한다.

팀들은 벤치마크 점수로 인젝션 탐지기를 고른다. 우리는 그 점수가 에이전트 내부에서의 동작을 예측하는지 확인하고, 대체로 그 점수는 벤치마크가 탐지기의 훈련 데이터에 얼마나 가까운지를 측정한다는 것을 발견한다.

발견 사항

15개의 탐지기(오픈 9개, Meta의 Prompt Guard 2를 포함한 라이선스 제한 6개)와 2개의 작업 인식 LLM 판정자를, 두 개의 에이전트 벤치마크(AgentDojo, tau-bench)와 BIPIA에서 평가한다. 정상 도구 출력은 각 벤치마크의 정답 도구 호출을 LLM 없이 재생하여 얻는다. 탐지는 1% FPR을 주는 임계값에서의 TPR이다.

탐지기출시정상 도구 출력에서의 FPR (AgentDojo / tau-bench)탐지 AgentDojo탐지 tau-bench탐지 BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(15개 탐지기와 두 판정자 전체: paper/tab_many.tex.)

  1. 탐지 순위는 벤치마크 간에 잘 전이되지 않는다(15개 탐지기에 대한 Kendall τ): BIPIA 대 AgentDojo는 0.01, AgentDojo 대 tau-bench는 0.28, BIPIA 대 tau-bench는 0.31이며, 어느 것도 유의하지 않다. BIPIA 선두인 PIGuard는 AgentDojo에서 15개 중 13위이고, Prismor는 AgentDojo의 72%에서 tau-bench의 15%로 떨어진다.
  2. 정상 도구 출력에서의 거짓 양성률은 0%에서 90% 이상까지이며, 두 에이전트 벤치마크에서 일관되고(τ = 0.67, p = 0.001), 일반 텍스트에서의 거짓 양성으로는 예측되지 않는다.
  3. 결과를 설명하는 것은 훈련 입력의 형태이지, 공격 문자열의 중복이 아니다. PIGuard는 1,116개의 전체 BIPIA 입력으로 훈련되어 BIPIA를 선도한다. 또한 InjecAgent의 62개 공격 중 53개를 보았지만, 짧은 프롬프트로만 보았다. tau-bench 도구 출력 내부에서는 본 InjecAgent 공격과 보지 못한 공격을 똑같이 탐지한다(52.1% 대 55.8%). Horizon-Labs는 어떤 벤치마크와도 데이터를 공유하지 않고 에이전트 스타일 입력으로 훈련되어 두 에이전트 벤치마크 모두를 선도한다.
  4. 작업 인식 7–8B 판정자(하나는 AgentDojo가 존재하기 전에 훈련됨)는 에이전트 도구 출력에서 1% FPR에서 54–78%에 도달하여, 최고의 전용 탐지기보다 낮다. 훈련 분포 밖에서는 모든 접근법이 인젝션의 전체 부류를 놓친다. PIGuard를 제외하면 어떤 접근법도 작업 무관 인젝션의 39% 이상을 잡지 못한다.
  5. 직렬화 마크업을 제거하거나 입력 유형을 선언하면 기본 임계값 거짓 양성이 최대 약 20배까지 낮아지지만, 낮은 FPR에서의 탐지를 고치지는 못한다.

모든 수치는 analysis/compute_all.py에 의해 점수 파일로부터 재생성되며, 논문은 paper/numbers.tex를 통해서만 이들을 읽는다.

레이아웃

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

재현

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

공개된 점수로부터 수치와 그림만 재생성하려면, results/*.json을 작업 디렉터리로 복사하고, .jsonl 세트를 다시 빌드한 뒤(reproduce.sh의 1–3단계, CPU만 사용), python analysis/compute_all.py && python analysis/make_macros.py를 실행한다.

평가 데이터는 공개 소스로부터 재빌드되며 재배포되지 않는다: AgentDojo v1.2, tau-bench (MIT), InjecAgent attacks (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu. 일부 스크립트는 BIPIA와 PIGuard가 ~/agentsec/ 아래에 클론되어 있다고 가정한다.

논문 빌드

paper/usenix-2020-09-xetex.sty는 tectonic/XeTeX로 컴파일되는 USENIX 스타일의 빌드 사본이다. 제출 시에는 main.tex를 공식 usenix-2020-09.sty로 바꾸고 pdflatex로 컴파일한다.

상태

초안. 아직 적응형 공격에 대해 평가되지 않았으며, 두 에이전트 벤치마크 모두 시뮬레이션이고 tau-bench의 인젝션 지점은 우리 것이다. 상용 API 탐지기는 포함되지 않았다. 논문의 §6을 참조하라.

라이선스

코드, 분석 스크립트, 점수 파일: MIT (LICENSE 참조). 서드파티 파일은 자체 조건을 유지한다: USENIX LaTeX 스타일(paper/usenix-2020-09*.sty)과 스크립트가 다운로드하는 벤치마크 및 탐지기(AgentDojo, tau-bench, InjecAgent, BIPIA, 그리고 각 탐지기의 모델 라이선스).

도구 다운로드