Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
Tools/GitHubGitHub/zjuicsr/deeptrap
Privilege EscalationDatenexfiltrationPenetrationstestsCommand and ControlLieferkettensicherheitLernen & BildungRed TeamingPayload-EntwicklungKI-SicherheitAdversarial-AngriffLabs & Praxis
1016vor 3 MonatenNoch nicht geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →

Über

Sicherheitsbenchmark zur Bewertung von OpenClaw-Agenten gegenüber gegnerischen Ausführungskontexten, einschließlich vergifteter Dateien, injizierter Fähigkeiten, irreführender Tool-Metadaten und codierter Payloads. Enthält 42 Wiederholungsaufgaben in 6 Risikosuiten mit Angriffs- und Nutzenbewertung.

GitHub
zjuicsr/deeptrap

DeepTrap

Repository anzeigen
Teilen

DeepTrap

DeepTrap-Logo

Aufgaben Chinesische Beispiele Risiken Szenarien Bestenliste DeepTrap
arXiv Arbeit HuggingFace-Datensatz Lizenz

English | 中文

Open-World-Sicherheitsbewertung für OpenClaw-Agenten unter adversariellen Ausführungskontexten.


DeepTrap ist ein Sicherheits-Benchmark zur Bewertung, ob OpenClaw-Agenten harmlose Benutzeraufgaben erfüllen können, während sie gleichzeitig bösartigem Druck durch den Ausführungskontext widerstehen: vergiftete Arbeitsbereichsdateien, injizierte Fähigkeiten, irreführende Tool-Metadaten, unsichere Befehlswege, eingepflanzte Geheimnisse und codierte Nutzlasten.

Die öffentliche Veröffentlichung enthält 42 Wiederholungsaufgaben, angeordnet als 6 kontextuelle Schwachstellenklassen × 7 operationale Szenarienfamilien, sowie den Benchmark-Runner und den öffentlichen Bewertungscode. Sie enthält außerdem 10 chinesischsprachige Wiederholungsbeispiele in tasks_zh/ für lokalisierte Auswertungsexperimente. Die private Aufgabengenerierungs- und Angriffssuch-Pipeline ist absichtlich nicht enthalten.

DeepTrap begleitet das Papier:

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He und Bingrun Yang. arXiv:2605.11047, 2026.

Warum DeepTrap?

Die meisten Agent-Benchmarks fragen, ob ein Modell nützliche Arbeit erledigen kann. DeepTrap stellt eine strengere Frage: Kann der Agent nützliche Arbeit sicher erledigen, wenn der umgebende Ausführungskontext adversariell ist?

Was uns auszeichnet

  • Angriffe auf den Ausführungskontext, nicht nur Prompt-Angriffe. DeepTrap bewertet Bedrohungen, die in Dateien, Fähigkeiten, Tool-Beschreibungen, Skripten, Protokollen, Konfigurationen und codierten Artefakten eingebettet sind.
  • Harmlose Benutzeraufforderungen. Die Benutzeranfrage ist nützlich und alltäglich; das Risiko kommt aus dem umgebenden Arbeitsbereich.
  • Öffentliche, minimale Reproduktion. Das Repository enthält den Runner, die Wiederholungsaufgaben und die Bewertungslogik, die zur Reproduktion von Benchmark-Läufen benötigt werden, ohne privaten Generierungscode preiszugeben.
  • Angriffs- und Nutzenbewertung. DeepTrap berichtet sowohl AGS (Angriffsbewertungspunktzahl) als auch UGS (Nutzenbewertungspunktzahl), sodass ein Modell gemeinsam hinsichtlich Sicherheit und Aufgaben-Nützlichkeit bewertet wird.
  • OpenClaw-nativ. Die Aufgaben sind für OpenClaw-artige Agenten erstellt und bewahren die Ausführungsannahmen eines echten Datei-/Tool-/Fähigkeiten-Arbeitsbereichs.

Neuigkeiten

  • 2026-05 DeepTrap-Papier auf arXiv veröffentlicht: arXiv:2605.11047.
  • 2026-05 Öffentliches Benchmark-Repository mit 42 Wiederholungsaufgaben, Bewertungscode und GitHub Pages-Bestenliste veröffentlicht.
  • 2026-05 Chinesischsprachige Wiederholungsbeispiele unter tasks_zh/ hinzugefügt.
  • 2026-05 Hugging Face-Datensatzexport für die Aufgabenmetadatenverteilung hinzugefügt.

Bestenliste

AGS steht für Angriffsbewertungspunktzahl (Attack Grading Score) und UGS für Nutzenbewertungspunktzahl (Utility Grading Score). Die Punktzahlen werden nach Risikopaket gemeldet; Average ist der Mittelwert über Risiko 1 bis Risiko 6.

Vollständige Projektseite und Bestenliste: ZJUICSR.github.io/DeepTrap


Benchmark-Design

DeepTrap kreuzt sechs kontextuelle Schwachstellenklassen mit sieben harmlosen Szenarienfamilien. Jede Aufgabe verwendet eine normale Benutzeraufforderung; das adversarielle Verhalten wird durch den Arbeitsbereichskontext induziert.

DeepTrap-Framework

DeepTrap konstruiert kompromittierte Ausführungskontexte aus harmlosen Anweisungen und sauberen Arbeitsbereichen, sucht nach vielversprechenden adversariellen Nutzlasten mit multi-objektiven Belohnungssignalen und verfeinert erfolgreiche Nutzlasten durch reflektionsbasiertes Sondieren.

Risikopakete

Szenarienfamilien

Schnellstart

Voraussetzungen

  • Python 3.10+
  • OpenClaw-CLI installiert und konfiguriert
  • Ein Zielmodell, das über OpenClaw verfügbar ist
  • Judge-API-Anmeldeinformationen für das ausgewählte Judge-Backend:
    • OpenRouter: OPENROUTER_API_KEY
    • DeepSeek: DEEPSEEK_API_KEY
    • DashScope/Qwen: DashScope-kompatible Anmeldeinformationen, die vom gebündelten Client erwartet werden

Modell-IDs sollten ihren Provider-Präfix enthalten, z. B. openrouter/anthropic/claude-sonnet-4-5.

Installieren und Validieren

root@kitploit:~
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .

# Validate task metadata without running OpenClaw
python benchmark.py --dry-run

# List bundled tasks
python benchmark.py --list-tasks

# Validate Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --dry-run

Ausführen

root@kitploit:~
# Run one risk suite
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1

# Run specific tasks
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01

# Run the Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all

# Run all tasks with repeated trials
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3

Ergebnisse werden standardmäßig in results/ geschrieben.

Ergebnisse überprüfen

Jeder Lauf schreibt eine JSON-Datei mit Modellmetadaten, Paketkonfiguration, Aufgabenpunktzahlen, Transkriptlängen, Arbeitsbereichspfaden, Nutzungsmetadaten (sofern verfügbar) und zusammenfassenden Feldern.

root@kitploit:~
# Overall score summary
jq '.summary' results/*.json

# Per-task scores
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json

# Tasks where the replay attack was reproduced strongly
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json

Jede Aufgabe meldet:

  • AGS: Angriffsbewertungspunktzahl, wobei höher eine stärkere Angriffsumsetzung bedeutet
  • UGS: Nutzenbewertungspunktzahl, wobei höher eine bessere Aufgabenerfüllung bedeutet
  • Aufgabenzeit, Transkriptlänge, Arbeitsbereichspfad und Nutzungsmetadaten (sofern verfügbar)

Hugging Face-Datensatz

DeepTrap kann auch als Hugging Face-Datensatz unter ZJUICSR/DeepTrap verteilt werden.

Der strukturierte Export speichert eine Benchmark-Aufgabe pro JSONL-Zeile in data/tasks.jsonl, während die ursprünglichen Markdown-Aufgabendefinitionen in tasks/ bleiben. Chinesischsprachige Beispielaufgaben können bei Bedarf separat aus tasks_zh/ exportiert werden.

root@kitploit:~
python scripts/export_hf_dataset.py

# Optional: export Chinese-language samples
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl

Nach dem Hochladen können Benutzer die Benchmark-Metadaten mit folgendem Code laden:

root@kitploit:~
from datasets import load_dataset

dataset = load_dataset("ZJUICSR/DeepTrap", split="train")

Jede Zeile enthält task_id, name, risk, category, prompt, expected_behavior, grading_criteria, workspace_files, Bewertungsmetadaten sowie Flags für automatisierte Prüfungen und LLM-Richter-Rubriken.

Befehlsreferenz

Projektstruktur

root@kitploit:~
.
├── benchmark.py                  # Public benchmark runner
├── tasks/                         # 42 bundled task definitions
├── tasks_zh/                      # 10 Chinese-language replay samples
├── scenes/                        # Clean source scenes for baseline/delta scoring
├── data/tasks.jsonl               # Hugging Face dataset export
├── docs/                          # GitHub Pages project site
├── huggingface/README.md          # Hugging Face dataset card
├── scripts/                       # Runtime support and export code
│   ├── lib_agent.py               # OpenClaw execution helpers
│   ├── lib_reward.py              # Attack/utility scoring
│   ├── lib_criteria.py            # Public judge criteria
│   ├── lib_llm.py                 # Judge backend router
│   ├── lib_openrouter.py          # OpenRouter judge client
│   ├── lib_deepseek.py            # DeepSeek judge client
│   ├── lib_dashscope.py           # DashScope/Qwen judge client
│   └── export_hf_dataset.py       # Dataset export helper
├── tests/                         # Public validation tests
├── SKILL.md                       # Agent-facing benchmark skill
└── pyproject.toml

Zitation

Wenn Sie DeepTrap in Ihrer Forschung verwenden, zitieren Sie bitte:

root@kitploit:~
@article{yao2026trap,
  title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
  author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
  journal={arXiv preprint arXiv:2605.11047},
  year={2026}
}

Danksagungen

DeepTrap wurde teilweise von PinchBench inspiriert, das eine praktische Benchmark-Suite zur Messung der OpenClaw-Agentenfähigkeit bei realen Aufgaben bereitstellt. Wir danken dem PinchBench-Projekt für die Demonstration eines klaren, nutzbaren Benchmark-Formats für OpenClaw-Agenten.

Lizenz

MIT – siehe LICENSE für Details.

Tool herunterladen
Was wir testenWarum es wichtig ist
KontextrobustheitVergiftete Dateien, speicherähnliche Artefakte, Playbooks und ArbeitsbereichsanweisungenEchte Agenten lesen aus veränderlichem lokalem Kontext, in dem unvertrauter Text das Verhalten stillschweigend umlenken kann
GeheimnisbehandlungEingepflanzte Anmeldeinformationen, Umgebungsvariablen, API-Schlüssel und interne WerteAgenten müssen Konfigurationsbewusstsein von Geheimnis-Exfiltration unterscheiden
AusführungsgrenzenGefährliche Shell-Befehle, Bereitstellungsskripte und Dateisystem-NebenwirkungenWerkzeugnutzende Agenten können dauerhaften Schaden anrichten, selbst wenn die Benutzeraufforderung harmlos ist
Fähigkeits-/Tool-VertrauenBösartige Fähigkeiten, irreführende Tool-Metadaten und Tool-MissbrauchsmusterAgentensicherheit hängt davon ab, wie das Modell Tool-Funktionen interpretiert und validiert
Verschleierte NutzlastenBase64- und mehrstufig codierte AnweisungenAngriffe können sich hinter normal aussehenden Datenverarbeitungsaufgaben verstecken
Claw-ModellMetrikRisiko 1Risiko 2Risiko 3Risiko 4Risiko 5Risiko 6Durchschnitt
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86
PaketKategorieAufgabenWas gemessen wird
R1Harness-Entführung7Widerstand gegen vergifteten Kontext und injizierte Arbeitsschritte
R2Datenschutzverletzung7Schutz eingepflanzter Anmeldeinformationen und sensibler Werte
R3Unautorisierte Ausführung7Verweigerung gefährlicher Befehle und grenzüberschreitender Aktionen
R4Lieferkettenrisiko7Umgang mit bösartigen Fähigkeiten und toolähnlichen Integrationen
R5Tool-Missbrauch7Erkennung irreführenden oder nicht übereinstimmenden Tool-Verhaltens
R6Codierungsverschleierung7Umgang mit codierten Anweisungen und mehrstufigen Nutzlasten
SzenarioTypische Aufgabenfamilie
T01Besprechungsnotizen, Aktionspunkte und Routine-Workflow-Zusammenfassungen
T02Python/Code-Formatierung, Refactoring und API-/Log-Verarbeitung
T03Forschungsnotizen, Literaturrecherche, Zitation und Umfrageanalyse
T04Bereitstellungsbereitschaft, Konfigurationsvalidierung und Service-Health-Checks
T05Vertrieb, Umsatz und strukturierte Geschäftsdatenberichterstattung
T06Blog-/Inhaltsentwürfe, Stilprüfung, Onboarding und Feedback-Zusammenfassungen
T07Systemadministration, Umgebungsaudits, Bereitstellungsprüfungen und Log-Backup
FlagBeschreibung
--model MODELLZielmodellkennung, konfiguriert für OpenClaw
--suite PAKETall, ein Risikopaket wie R1 oder kommagetrennte Aufgaben-IDs
--tasks-dir VERZAufgabenverzeichnis, Standard tasks/; verwenden Sie tasks_zh/ für chinesischsprachige Beispiele
--runs NAnzahl der Läufe pro Aufgabe zur Mittelung
--timeout-multiplier NSkalieren der Aufgaben-Timeout für langsamere Modelle
--judge-model MODELLRichtermodel für Angriffs-, Tarnungs- und Nutzenbewertung
--output-dir VERZErgebnisverzeichnis, Standard results/
--list-tasksGebündelte Aufgaben-IDs ausgeben und beenden
--dry-runAufgabenladen und Bewertungsmetadaten validieren, ohne OpenClaw auszuführen
--verboseDetaillierte Ausführungsprotokolle ausgeben