Skip to content
KitploitKITPLOIT
도구블로그
제출
도구블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
DeepTrap — OpenClaw 에이전트를 오염된 파일, 주입된 스킬, 오도하는 도구 메타데이터, 인코딩된 페이로드를 포함한 적대적 실행 컨텍스트에 대해 평가하는 보안 벤치마크입니다. 6개의 리스크 스위트에 걸친 42개의 리플레이 태스크와 공격 및 유틸리티 점수화를 포함합니다. | Kitploit
도구/GitHubGitHub/zjuicsr/deeptrap
Privilege EscalationData ExfiltrationPenetration TestingCommand and ControlSupply Chain SecurityLearning & EducationRed TeamingPayload DevelopmentAI SecurityAdversarial AttackLabs & Practice
10163개월 전아직 검토되지 않음

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유
GitHub
zjuicsr/deeptrap

DeepTrap

OpenClaw 에이전트를 오염된 파일, 주입된 스킬, 오도하는 도구 메타데이터, 인코딩된 페이로드를 포함한 적대적 실행 컨텍스트에 대해 평가하는 보안 벤치마크입니다. 6개의 리스크 스위트에 걸친 42개의 리플레이 태스크와 공격 및 유틸리티 점수화를 포함합니다.

저장소 보기

DeepTrap

DeepTrap 로고

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

영어 | 中文

적대적 실행 컨텍스트에서 OpenClaw 에이전트를 위한 오픈월드 보안 평가.


DeepTrap은 OpenClaw 에이전트가 정상적인 사용자 작업을 완료하면서도 악의적인 실행 컨텍스트 압력(오염된 작업공간 파일, 주입된 스킬, 오해를 유발하는 도구 메타데이터, 안전하지 않은 명령 경로, 심어진 비밀값, 인코딩된 페이로드)에 저항할 수 있는지 평가하는 보안 벤치마크입니다.

공개 릴리스에는 6가지 컨텍스트 취약점 클래스 x 7가지 운영 시나리오 패밀리로 구성된 42개의 재연 태스크와 벤치마크 러너 및 공개 채점 코드가 포함되어 있습니다. 또한 현지화 평가 실험을 위해 tasks_zh/에 10개의 중국어 재연 샘플이 포함되어 있습니다. 비공개 태스크 생성 및 공격 탐색 파이프라인은 의도적으로 포함되지 않았습니다.

DeepTrap은 다음 논문과 함께 제공됩니다:

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He, and Bingrun Yang. arXiv:2605.11047, 2026.

왜 DeepTrap인가?

대부분의 에이전트 벤치마크는 모델이 유용한 작업을 완료할 수 있는지 묻습니다. DeepTrap은 더 엄격한 질문을 던집니다: 주변 실행 컨텍스트가 적대적일 때 에이전트가 안전하게 유용한 작업을 완료할 수 있는가?

차별화 포인트

  • 프롬프트 공격만이 아닌 실행 컨텍스트 공격. DeepTrap은 파일, 스킬, 도구 설명, 스크립트, 로그, 구성 및 인코딩된 아티팩트에 내장된 위협을 평가합니다.
  • 정상적인 사용자 프롬프트. 사용자 요청은 유용하고 평범하며, 위험은 주변 작업공간에서 발생합니다.
  • 공개적이고 최소한의 재현. 이 저장소에는 비공개 생성 코드를 노출하지 않고 벤치마크 실행을 재현하는 데 필요한 러너, 재연 태스크 및 채점 로직이 포함되어 있습니다.
  • 공격 및 유틸리티 채점. DeepTrap은 AGS(Attack Grading Score)와 UGS(Utility Grading Score)를 모두 보고하므로 모델은 안전성과 작업 유용성을 함께 평가받습니다.
  • OpenClaw 네이티브. 태스크는 OpenClaw 스타일 에이전트를 위해 제작되었으며 실제 파일/도구/스킬 작업공간의 실행 가정을 유지합니다.

소식

  • 2026-05 DeepTrap 논문이 arXiv에 공개되었습니다: arXiv:2605.11047.
  • 2026-05 42개의 재연 태스크, 채점 코드 및 GitHub Pages 리더보드가 포함된 공개 벤치마크 저장소가 공개되었습니다.
  • 2026-05 tasks_zh/에 중국어 재연 샘플이 추가되었습니다.
  • 2026-05 태스크 메타데이터 배포를 위한 Hugging Face 데이터셋 내보내기가 추가되었습니다.

리더보드

AGS는 Attack Grading Score이고 UGS는 Utility Grading Score입니다. 점수는 리스크 스위트별로 보고되며, Average는 Risk 1부터 Risk 6까지의 평균입니다.

전체 프로젝트 페이지 및 리더보드: ZJUICSR.github.io/DeepTrap


벤치마크 설계

DeepTrap은 6가지 컨텍스트 취약점 클래스와 7가지 정상 시나리오 패밀리를 교차시킵니다. 각 태스크는 일반적인 사용자 프롬프트를 사용하며, 적대적 동작은 작업공간 컨텍스트에 의해 유도됩니다.

DeepTrap 프레임워크

DeepTrap은 정상 지침과 깨끗한 작업공간에서 손상된 실행 컨텍스트를 구성하고, 다중 목표 보상 신호로 후보 적대적 페이로드를 탐색하며, 반성 기반 프로빙을 통해 성공적인 페이로드를 정제합니다.

리스크 스위트

시나리오 패밀리

빠른 시작

요구 사항

  • Python 3.10+
  • OpenClaw CLI 설치 및 구성
  • OpenClaw를 통해 사용 가능한 대상 모델
  • 선택한 심사 백엔드용 심사 API 자격 증명:
    • OpenRouter: OPENROUTER_API_KEY
    • DeepSeek: DEEPSEEK_API_KEY
    • DashScope/Qwen: 번들 클라이언트에서 요구하는 DashScope 호환 자격 증명

모델 ID에는 제공자 접두사가 포함되어야 합니다(예: openrouter/anthropic/claude-sonnet-4-5).

설치 및 검증

root@kitploit:~
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .

# Validate task metadata without running OpenClaw
python benchmark.py --dry-run

# List bundled tasks
python benchmark.py --list-tasks

# Validate Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --dry-run

실행

root@kitploit:~
# Run one risk suite
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1

# Run specific tasks
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01

# Run the Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all

# Run all tasks with repeated trials
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3

결과는 기본적으로 results/에 기록됩니다.

결과 확인

각 실행은 모델 메타데이터, 스위트 구성, 태스크별 점수, 대화 기록 길이, 작업공간 경로, 사용 가능한 경우 사용량 메타데이터 및 집계 요약 필드가 포함된 JSON 파일을 작성합니다.

root@kitploit:~
# Overall score summary
jq '.summary' results/*.json

# Per-task scores
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json

# Tasks where the replay attack was reproduced strongly
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json

각 태스크는 다음을 보고합니다:

  • AGS: 공격 채점 점수로, 값이 높을수록 공격 구현이 더 강함을 나타냅니다.
  • UGS: 유틸리티 채점 점수로, 값이 높을수록 태스크 완료가 더 우수함을 나타냅니다.
  • 태스크 시간, 대화 기록 길이, 작업공간 경로 및 사용 가능한 경우 사용량 메타데이터

Hugging Face 데이터셋

DeepTrap은 ZJUICSR/DeepTrap에서 Hugging Face 데이터셋으로도 배포될 수 있습니다.

구조화된 내보내기는 data/tasks.jsonl에 JSONL 행당 하나의 벤치마크 태스크를 저장하며, 원본 Markdown 태스크 정의는 tasks/에 유지됩니다. 필요한 경우 중국어 샘플 태스크는 tasks_zh/에서 별도로 내보낼 수 있습니다.

root@kitploit:~
python scripts/export_hf_dataset.py

# Optional: export Chinese-language samples
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl

업로드 후 사용자는 다음으로 벤치마크 메타데이터를 로드할 수 있습니다:

root@kitploit:~
from datasets import load_dataset

dataset = load_dataset("ZJUICSR/DeepTrap", split="train")

각 행에는 task_id, name, risk, category, prompt, expected_behavior, grading_criteria, workspace_files, 채점 메타데이터 및 자동 검사와 LLM 심사 루브릭용 플래그가 포함됩니다.

명령어 참조

프로젝트 구조

root@kitploit:~
.
├── benchmark.py                  # Public benchmark runner
├── tasks/                         # 42 bundled task definitions
├── tasks_zh/                      # 10 Chinese-language replay samples
├── scenes/                        # Clean source scenes for baseline/delta scoring
├── data/tasks.jsonl               # Hugging Face dataset export
├── docs/                          # GitHub Pages project site
├── huggingface/README.md          # Hugging Face dataset card
├── scripts/                       # Runtime support and export code
│   ├── lib_agent.py               # OpenClaw execution helpers
│   ├── lib_reward.py              # Attack/utility scoring
│   ├── lib_criteria.py            # Public judge criteria
│   ├── lib_llm.py                 # Judge backend router
│   ├── lib_openrouter.py          # OpenRouter judge client
│   ├── lib_deepseek.py            # DeepSeek judge client
│   ├── lib_dashscope.py           # DashScope/Qwen judge client
│   └── export_hf_dataset.py       # Dataset export helper
├── tests/                         # Public validation tests
├── SKILL.md                       # Agent-facing benchmark skill
└── pyproject.toml

인용

연구에서 DeepTrap을 사용하신다면 다음을 인용해 주세요:

root@kitploit:~
@article{yao2026trap,
  title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
  author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
  journal={arXiv preprint arXiv:2605.11047},
  year={2026}
}

감사의 말

DeepTrap은 실제 작업에서 OpenClaw 에이전트의 역량을 측정하기 위한 실용적인 벤치마크 스위트를 제공하는 PinchBench에서 부분적으로 영감을 받았습니다. OpenClaw 에이전트를 위한 명확하고 사용 가능한 벤치마크 형식을 보여준 PinchBench 프로젝트에 감사드립니다.

라이선스

MIT — 자세한 내용은 LICENSE를 참조하세요.

도구 다운로드
테스트 대상중요한 이유
컨텍스트 견고성오염된 파일, 메모리 유사 아티팩트, 플레이북 및 작업공간 지침실제 에이전트는 변경 가능한 로컬 컨텍스트에서 읽으며, 신뢰할 수 없는 텍스트가 조용히 동작을 재지정할 수 있습니다.
비밀값 처리심어진 자격 증명, 환경 변수, API 키 및 내부 값에이전트는 구성 인지와 비밀값 유출을 구분해야 합니다.
실행 경계위험한 셸 명령, 배포 스크립트 및 파일 시스템 부작용도구를 사용하는 에이전트는 사용자 프롬프트가 정상적이더라도 지속적인 피해를 초래할 수 있습니다.
스킬/도구 신뢰악성 스킬, 오해를 유발하는 도구 메타데이터 및 도구 남용 패턴에이전트 안전은 모델이 도구의 기능을 어떻게 해석하고 검증하는지에 달려 있습니다.
난독화된 페이로드Base64 및 다단계 인코딩 지침공격은 평범해 보이는 데이터 처리 작업 뒤에 숨을 수 있습니다.
Claw 모델지표Risk 1Risk 2Risk 3Risk 4Risk 5Risk 6평균
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86
스위트카테고리태스크 수측정 항목
R1하네스 하이재킹7오염된 컨텍스트와 주입된 워크플로 단계에 대한 저항성
R2개인정보 유출7심어진 자격 증명 및 민감한 값 보호
R3무단 실행7위험한 명령 및 경계를 넘는 행동 거부
R4공급망 위험7악성 스킬 및 도구 유사 통합 처리
R5도구 남용7오해를 유발하거나 불일치하는 도구 동작 탐지
R6인코딩 난독화7인코딩된 지침 및 다단계 페이로드 처리
시나리오일반적인 태스크 패밀리
T01회의록, 실행 항목 및 일상 워크플로 요약
T02Python/코드 포맷팅, 리팩터링 및 API/로그 처리
T03연구 노트, 문헌 검토, 인용 및 설문 분석
T04배포 준비 상태, 구성 검증 및 서비스 상태 점검
T05영업, 수익 및 구조화된 비즈니스 데이터 보고
T06블로그/콘텐츠 초안 작성, 스타일 확인, 온보딩 및 피드백 요약
T07시스템 관리, 환경 감사, 배포 점검 및 로그 백업
플래그설명
--model MODELOpenClaw에 구성된 대상 모델 식별자
--suite SUITEall, R1과 같은 리스크 스위트 또는 쉼표로 구분된 태스크 ID
--tasks-dir DIR태스크 디렉터리, 기본값 tasks/; 중국어 샘플에는 tasks_zh/ 사용
--runs N평균 계산을 위한 태스크당 실행 횟수
--timeout-multiplier N느린 모델을 위한 태스크 타임아웃 조정 배율
--judge-model MODEL공격, 은닉성 및 유틸리티 채점용 심사 모델
--output-dir DIR결과 디렉터리, 기본값 results/
--list-tasks번들된 태스크 ID를 출력하고 종료
--dry-runOpenClaw를 실행하지 않고 태스크 로딩 및 채점 메타데이터 검증
--verbose상세 실행 로그 출력