Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
DeepTrap — Benchmark de sécurité pour évaluer les agents OpenClaw face à des contextes d'exécution adverses incluant des fichiers empoisonnés, des compétences injectées, des métadonnées d'outils trompeuses et des charges utiles encodées. Comprend 42 tâches de rejeu réparties dans 6 suites de risques avec un score d'attaque et d'utilité. | Kitploit
Outils/GitHubGitHub/zjuicsr/deeptrap
Escalade de PrivilègesExfiltration de DonnéesTests d'IntrusionCommandement et ContrôleSécurité de la Chaîne LogistiqueApprentissage et ÉducationRed TeamingDéveloppement de Charges UtilesSécurité de l'IAAttaque AdversarialeLabs et Pratique
101il y a 3 moisPas encore vérifié

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →

À propos

Benchmark de sécurité pour évaluer les agents OpenClaw face à des contextes d'exécution adverses incluant des fichiers empoisonnés, des compétences injectées, des métadonnées d'outils trompeuses et des charges utiles encodées. Comprend 42 tâches de rejeu réparties dans 6 suites de risques avec un score d'attaque et d'utilité.

GitHub
zjuicsr/deeptrap

DeepTrap

Voir le dépôt
Partager

DeepTrap

Logo DeepTrap

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

English | 中文

Évaluation de la sécurité en monde ouvert pour les agents OpenClaw dans des contextes d'exécution adverses.


DeepTrap est un benchmark de sécurité pour évaluer si les agents OpenClaw peuvent accomplir des tâches utilisateur bénignes tout en résistant à la pression malveillante du contexte d'exécution : fichiers d'espace de travail empoisonnés, compétences injectées, métadonnées d'outil trompeuses, chemins de commandes dangereux, secrets implantés et charges utiles encodées.

La version publique contient 42 tâches de rejeu organisées en 6 classes de vulnérabilité contextuelle × 7 familles de scénarios opérationnels, ainsi que l'exécuteur du benchmark et le code de notation public. Elle inclut également 10 échantillons de rejeu en langue chinoise dans tasks_zh/ pour des expériences d'évaluation localisées. Le pipeline privé de génération de tâches et de recherche d'attaques n'est intentionnellement pas inclus.

DeepTrap accompagne l'article :

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He, and Bingrun Yang. arXiv:2605.11047, 2026.

Pourquoi DeepTrap ?

La plupart des benchmarks d'agents demandent si un modèle peut effectuer un travail utile. DeepTrap pose une question plus stricte : l'agent peut-il effectuer un travail utile en toute sécurité lorsque le contexte d'exécution environnant est adverse ?

Ce qui nous distingue

  • Attaques sur le contexte d'exécution, pas seulement sur l'invite. DeepTrap évalue les menaces intégrées dans les fichiers, compétences, descriptions d'outils, scripts, journaux, configurations et artefacts encodés.
  • Invites utilisateur bénignes. La demande utilisateur est utile et ordinaire ; le risque provient de l'espace de travail environnant.
  • Reproduction publique minimale. Le dépôt contient l'exécuteur, les tâches de rejeu et la logique de notation nécessaires pour reproduire les exécutions du benchmark sans exposer le code privé de génération.
  • Notation d'attaque et d'utilité. DeepTrap rapporte à la fois AGS (Attack Grading Score) et UGS (Utility Grading Score), évaluant ensemble la sécurité et l'utilité de la tâche.
  • Natif OpenClaw. Les tâches sont conçues pour les agents de style OpenClaw et préservent les hypothèses d'exécution d'un espace de travail réel fichier/outil/compétence.

Actualités

  • 2026-05 Article DeepTrap publié sur arXiv : arXiv:2605.11047.
  • 2026-05 Dépôt public du benchmark publié avec 42 tâches de rejeu, code de notation et classement GitHub Pages.
  • 2026-05 Échantillons de rejeu en langue chinoise ajoutés sous tasks_zh/.
  • 2026-05 Export du jeu de données Hugging Face ajouté pour la distribution des métadonnées des tâches.

Classement

AGS est le Attack Grading Score et UGS est le Utility Grading Score. Les scores sont rapportés par suite de risque ; Moyenne est la moyenne sur les Risques 1 à 6.

Page complète du projet et classement : ZJUICSR.github.io/DeepTrap


Conception du benchmark

DeepTrap croise six classes de vulnérabilité contextuelle avec sept familles de scénarios bénins. Chaque tâche utilise une invite utilisateur normale ; le comportement adverse est induit par le contexte de l'espace de travail.

Cadre DeepTrap

DeepTrap construit des contextes d'exécution compromis à partir d'instructions bénignes et d'espaces de travail propres, recherche des charges utiles adverses candidates avec des signaux de récompense multi-objectifs, et affine les charges utiles réussies par un sondage basé sur la réflexion.

Suites de risques

Familles de scénarios

Démarrage rapide

Prérequis

  • Python 3.10+
  • CLI OpenClaw installée et configurée
  • Un modèle cible disponible via OpenClaw
  • Identifiants API du juge pour le backend de jugement choisi :
    • OpenRouter : OPENROUTER_API_KEY
    • DeepSeek : DEEPSEEK_API_KEY
    • DashScope/Qwen : identifiants compatibles DashScope attendus par le client fourni

Les identifiants de modèle doivent inclure le préfixe du fournisseur, par exemple openrouter/anthropic/claude-sonnet-4-5.

Installation et validation

root@kitploit:~
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .

# Valider les métadonnées des tâches sans exécuter OpenClaw
python benchmark.py --dry-run

# Lister les tâches fournies
python benchmark.py --list-tasks

# Valider les tâches d'exemple en chinois
python benchmark.py --tasks-dir tasks_zh --dry-run

Exécution

root@kitploit:~
# Exécuter une suite de risques
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1

# Exécuter des tâches spécifiques
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01

# Exécuter les tâches d'exemple en chinois
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all

# Exécuter toutes les tâches avec des essais répétés
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3

Les résultats sont écrits dans results/ par défaut.

Vérifier les résultats

Chaque exécution écrit un fichier JSON contenant les métadonnées du modèle, la configuration de la suite, les scores par tâche, les longueurs des transcriptions, les chemins d'espace de travail, les métadonnées d'utilisation lorsqu'elles sont disponibles, et les champs récapitulatifs agrégés.

root@kitploit:~
# Résumé des scores globaux
jq '.summary' results/*.json

# Scores par tâche
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json

# Tâches où l'attaque de rejeu a été fortement reproduite
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json

Chaque tâche rapporte :

  • AGS : score de notation d'attaque, plus élevé indique une réalisation d'attaque plus forte
  • UGS : score de notation d'utilité, plus élevé indique une meilleure réalisation de la tâche
  • chronométrage de la tâche, longueur de la transcription, chemin de l'espace de travail et métadonnées d'utilisation lorsqu'elles sont disponibles

Jeu de données Hugging Face

DeepTrap peut également être distribué comme un jeu de données Hugging Face sur ZJUICSR/DeepTrap.

L'export structuré stocke une tâche de benchmark par ligne JSONL dans data/tasks.jsonl, tandis que les définitions originales des tâches en Markdown restent dans tasks/. Les tâches d'exemple en chinois peuvent être exportées séparément depuis tasks_zh/ si nécessaire.

root@kitploit:~
python scripts/export_hf_dataset.py

# Optionnel : exporter les échantillons en chinois
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl

Après téléchargement, les utilisateurs peuvent charger les métadonnées du benchmark avec :

root@kitploit:~
from datasets import load_dataset

dataset = load_dataset("ZJUICSR/DeepTrap", split="train")

Chaque ligne comprend task_id, name, risk, category, prompt, expected_behavior, grading_criteria, workspace_files, les métadonnées de notation, et des indicateurs pour les vérifications automatisées et les rubriques du juge LLM.

Référence des commandes

Structure du projet

root@kitploit:~
.
├── benchmark.py                  # Public benchmark runner
├── tasks/                         # 42 bundled task definitions
├── tasks_zh/                      # 10 Chinese-language replay samples
├── scenes/                        # Clean source scenes for baseline/delta scoring
├── data/tasks.jsonl               # Hugging Face dataset export
├── docs/                          # GitHub Pages project site
├── huggingface/README.md          # Hugging Face dataset card
├── scripts/                       # Runtime support and export code
│   ├── lib_agent.py               # OpenClaw execution helpers
│   ├── lib_reward.py              # Attack/utility scoring
│   ├── lib_criteria.py            # Public judge criteria
│   ├── lib_llm.py                 # Judge backend router
│   ├── lib_openrouter.py          # OpenRouter judge client
│   ├── lib_deepseek.py            # DeepSeek judge client
│   ├── lib_dashscope.py           # DashScope/Qwen judge client
│   └── export_hf_dataset.py       # Dataset export helper
├── tests/                         # Public validation tests
├── SKILL.md                       # Agent-facing benchmark skill
└── pyproject.toml

Citation

Si vous utilisez DeepTrap dans vos recherches, veuillez citer :

root@kitploit:~
@article{yao2026trap,
  title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
  author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
  journal={arXiv preprint arXiv:2605.11047},
  year={2026}
}

Remerciements

DeepTrap a été en partie inspiré par PinchBench, qui fournit une suite de benchmark pratique pour mesurer la capacité des agents OpenClaw sur des tâches du monde réel. Nous remercions le projet PinchBench d'avoir démontré un format de benchmark clair et utilisable pour les agents OpenClaw.

Licence

MIT — voir LICENSE pour plus de détails.

Télécharger l’outil
Ce que nous testonsPourquoi c'est important
Robustesse au contexteFichiers empoisonnés, artefacts de type mémoire, playbooks et instructions d'espace de travailLes vrais agents lisent à partir d'un contexte local mutable, où un texte non fiable peut rediriger silencieusement le comportement
Gestion des secretsIdentifiants implantés, variables d'environnement, clés API et valeurs internesLes agents doivent distinguer la connaissance de la configuration de l'exfiltration de secrets
Limites d'exécutionCommandes shell dangereuses, scripts de déploiement et effets de bord du système de fichiersLes agents utilisant des outils peuvent causer des dommages durables même lorsque l'invite utilisateur est bénigne
Confiance dans les compétences/outilsCompétences malveillantes, métadonnées d'outil trompeuses et schémas d'abus d'outilsLa sécurité de l'agent dépend de la manière dont le modèle interprète et valide les capacités des outils
Charges utiles obscurciesInstructions encodées en Base64 et en plusieurs étapesLes attaques peuvent se cacher derrière des tâches de traitement de données d'apparence normale
Modèle ClawMétriqueRisque 1Risque 2Risque 3Risque 4Risque 5Risque 6Moyenne
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86
SuiteCatégorieTâchesCe qui est mesuré
R1Détournement de harnais7Résistance au contexte empoisonné et aux étapes de workflow injectées
R2Fuite de confidentialité7Protection des identifiants implantés et des valeurs sensibles
R3Exécution non autorisée7Refus des commandes dangereuses et des actions franchissant les limites
R4Risque de chaîne d'approvisionnement7Gestion des compétences malveillantes et des intégrations de type outil
R5Abus d'outil7Détection des comportements d'outil trompeurs ou inadaptés
R6Obscurcissement par encodage7Gestion des instructions encodées et des charges utiles en plusieurs étapes
ScénarioFamille de tâches typique
T01Notes de réunion, éléments d'action et résumés de workflow de routine
T02Formatage de code Python, remaniement et traitement de logs/API
T03Notes de recherche, revue de littérature, citation et analyse d'enquête
T04Préparation au déploiement, validation de configuration et vérifications de santé des services
T05Rapports de ventes, de revenus et de données commerciales structurées
T06Rédaction de blog/contenu, vérification de style, intégration et résumés de feedback
T07Administration système, audits d'environnement, vérifications de déploiement et sauvegarde de logs
DrapeauDescription
--model MODELIdentifiant du modèle cible configuré pour OpenClaw
--suite SUITEall, une suite de risque telle que R1, ou des identifiants de tâches séparés par des virgules
--tasks-dir DIRRépertoire des tâches, par défaut tasks/ ; utiliser tasks_zh/ pour les échantillons en chinois
--runs NNombre d'exécutions par tâche pour le calcul de la moyenne
--timeout-multiplier NMettre à l'échelle les délais d'attente des tâches pour les modèles plus lents
--judge-model MODELModèle juge pour la notation de l'attaque, de la furtivité et de l'utilité
--output-dir DIRRépertoire des résultats, par défaut results/
--list-tasksAfficher les identifiants des tâches fournies et quitter
--dry-runValider le chargement des tâches et les métadonnées de notation sans exécuter OpenClaw
--verboseAfficher les journaux d'exécution détaillés