
LLM 에이전트 도구 출력에 대한 프롬프트 인젝션 탐지기 재평가 (논문 초안, 스크립트, 점수)
프롬프트 인젝션 탐지기를 LLM 에이전트가 실제로 사용하는 지점, 즉 에이전트가 읽는 도구 출력에서 재평가한다.
팀들은 벤치마크 점수로 인젝션 탐지기를 고른다. 우리는 그 점수가 에이전트 내부에서의 동작을 예측하는지 확인하고, 대체로 그 점수는 벤치마크가 탐지기의 훈련 데이터에 얼마나 가까운지를 측정한다는 것을 발견한다.
15개의 탐지기(오픈 9개, Meta의 Prompt Guard 2를 포함한 라이선스 제한 6개)와 2개의 작업 인식 LLM 판정자를, 두 개의 에이전트 벤치마크(AgentDojo, tau-bench)와 BIPIA에서 평가한다. 정상 도구 출력은 각 벤치마크의 정답 도구 호출을 LLM 없이 재생하여 얻는다. 탐지는 1% FPR을 주는 임계값에서의 TPR이다.
| 탐지기 | 출시 | 정상 도구 출력에서의 FPR (AgentDojo / tau-bench) | 탐지 AgentDojo | 탐지 tau-bench | 탐지 BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(15개 탐지기와 두 판정자 전체: paper/tab_many.tex.)
모든 수치는 analysis/compute_all.py에 의해 점수 파일로부터 재생성되며, 논문은 paper/numbers.tex를 통해서만 이들을 읽는다.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
공개된 점수로부터 수치와 그림만 재생성하려면, results/*.json을 작업 디렉터리로 복사하고, .jsonl 세트를 다시 빌드한 뒤(reproduce.sh의 1–3단계, CPU만 사용), python analysis/compute_all.py && python analysis/make_macros.py를 실행한다.
평가 데이터는 공개 소스로부터 재빌드되며 재배포되지 않는다: AgentDojo v1.2, tau-bench (MIT), InjecAgent attacks (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu. 일부 스크립트는 BIPIA와 PIGuard가 ~/agentsec/ 아래에 클론되어 있다고 가정한다.
paper/usenix-2020-09-xetex.sty는 tectonic/XeTeX로 컴파일되는 USENIX 스타일의 빌드 사본이다. 제출 시에는 main.tex를 공식 usenix-2020-09.sty로 바꾸고 pdflatex로 컴파일한다.
초안. 아직 적응형 공격에 대해 평가되지 않았으며, 두 에이전트 벤치마크 모두 시뮬레이션이고 tau-bench의 인젝션 지점은 우리 것이다. 상용 API 탐지기는 포함되지 않았다. 논문의 §6을 참조하라.
코드, 분석 스크립트, 점수 파일: MIT (LICENSE 참조). 서드파티 파일은 자체 조건을 유지한다: USENIX LaTeX 스타일(paper/usenix-2020-09*.sty)과 스크립트가 다운로드하는 벤치마크 및 탐지기(AgentDojo, tau-bench, InjecAgent, BIPIA, 그리고 각 탐지기의 모델 라이선스).