
OpenClaw एजेंटों का मूल्यांकन करने के लिए सुरक्षा बेंचमार्क, जो प्रतिकूल निष्पादन संदर्भों (adversarial execution contexts) के विरुद्ध काम करता है, जिनमें ज़हरीली फ़ाइलें (poisoned files), इंजेक्ट किए गए कौशल (injected skills), भ्रामक टूल मेटाडेटा (misleading tool metadata), और एन्कोडेड पेलोड (encoded payloads) शामिल हैं। इसमें 42 रीप्ले कार्य (replay tasks) शामिल हैं, जो 6 जोखिम सुइट्स (risk suites) में फैले हुए हैं, जिनमें हमले और उपयोगिता स्कोरिंग (attack and utility scoring) होती है।
प्रतिकूल निष्पादन संदर्भों में OpenClaw एजेंटों के लिए ओपन-वर्ल्ड सुरक्षा मूल्यांकन।
DeepTrap एक सुरक्षा बेंचमार्क है जो यह मूल्यांकन करता है कि क्या OpenClaw एजेंट दुर्भावनापूर्ण निष्पादन-संदर्भ दबाव का प्रतिरोध करते हुए सामान्य उपयोगकर्ता कार्यों को पूरा कर सकते हैं: ज़हरीली वर्कस्पेस फ़ाइलें, इंजेक्ट किए गए कौशल, भ्रामक टूल मेटाडेटा, असुरक्षित कमांड पथ, छिपे हुए रहस्य, और एन्कोडेड पेलोड।
सार्वजनिक रिलीज़ में 42 रीप्ले कार्य शामिल हैं जिन्हें 6 प्रासंगिक भेद्यता वर्गों x 7 परिचालन परिदृश्य परिवारों के रूप में व्यवस्थित किया गया है, साथ ही बेंचमार्क रनर और सार्वजनिक स्कोरिंग कोड भी। इसमें स्थानीयकृत मूल्यांकन प्रयोगों के लिए tasks_zh/ में 10 चीनी-भाषा रीप्ले नमूने भी शामिल हैं। निजी कार्य-निर्माण और हमला-खोज पाइपलाइन जानबूझकर शामिल नहीं की गई है।
DeepTrap निम्नलिखित शोधपत्र के साथ आता है:
रेड-टीमिंग एजेंट निष्पादन संदर्भ: OpenClaw पर ओपन-वर्ल्ड सुरक्षा मूल्यांकन
Hongwei Yao, Yiming Liu, Yiling He, और Bingrun Yang. arXiv:2605.11047, 2026.
अधिकांश एजेंट बेंचमार्क यह पूछते हैं कि क्या कोई मॉडल उपयोगी कार्य पूरा कर सकता है। DeepTrap एक कठोर प्रश्न पूछता है: क्या एजेंट तब उपयोगी कार्य सुरक्षित रूप से पूरा कर सकता है जब आस-पास का निष्पादन संदर्भ प्रतिकूल हो?
tasks_zh/ के अंतर्गत चीनी-भाषा रीप्ले नमूने जोड़े गए।AGS अटैक ग्रेडिंग स्कोर है और UGS यूटिलिटी ग्रेडिंग स्कोर है। स्कोर जोखिम सुइट के अनुसार रिपोर्ट किए जाते हैं; Average जोखिम 1 से जोखिम 6 तक का औसत है।
पूर्ण प्रोजेक्ट पृष्ठ और लीडरबोर्ड: ZJUICSR.github.io/DeepTrap
DeepTrap छह प्रासंगिक भेद्यता वर्गों को सात सामान्य परिदृश्य परिवारों के साथ जोड़ता है। प्रत्येक कार्य एक सामान्य उपयोगकर्ता प्रॉम्प्ट का उपयोग करता है; प्रतिकूल व्यवहार कार्यक्षेत्र संदर्भ द्वारा प्रेरित किया जाता है।
DeepTrap सामान्य निर्देशों और स्वच्छ वर्कस्पेस से समझौता किए गए निष्पादन संदर्भों का निर्माण करता है, बहु-उद्देश्यीय पुरस्कार संकेतों के साथ उम्मीदवार प्रतिकूल पेलोड की खोज करता है, और प्रतिबिंब-आधारित जांच के माध्यम से सफल पेलोड को परिष्कृत करता है।
OPENROUTER_API_KEYDEEPSEEK_API_KEYमॉडल ID में उनका प्रदाता उपसर्ग शामिल होना चाहिए, उदाहरण के लिए openrouter/anthropic/claude-sonnet-4-5।
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .
# Validate task metadata without running OpenClaw
python benchmark.py --dry-run
# List bundled tasks
python benchmark.py --list-tasks
# Validate Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --dry-run
# Run one risk suite
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1
# Run specific tasks
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01
# Run the Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all
# Run all tasks with repeated trials
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3
परिणाम डिफ़ॉल्ट रूप से results/ में लिखे जाते हैं।
प्रत्येक रन एक JSON फ़ाइल लिखता है जिसमें मॉडल मेटाडेटा, सुइट कॉन्फ़िगरेशन, प्रति-कार्य स्कोर, ट्रांसक्रिप्ट लंबाई, वर्कस्पेस पथ, उपलब्ध होने पर उपयोग मेटाडेटा, और समग्र सारांश फ़ील्ड शामिल होते हैं।
# Overall score summary
jq '.summary' results/*.json
# Per-task scores
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json
# Tasks where the replay attack was reproduced strongly
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json
प्रत्येक कार्य रिपोर्ट करता है:
AGS: अटैक ग्रेडिंग स्कोर, जहाँ उच्च मान मजबूत हमले की प्राप्ति दर्शाता हैUGS: यूटिलिटी ग्रेडिंग स्कोर, जहाँ उच्च मान बेहतर कार्य पूर्णता दर्शाता हैDeepTrap को ZJUICSR/DeepTrap पर Hugging Face डेटासेट के रूप में भी वितरित किया जा सकता है।
संरचित निर्यात data/tasks.jsonl में प्रति JSONL पंक्ति एक बेंचमार्क कार्य संग्रहीत करता है, जबकि मूल Markdown कार्य परिभाषाएँ tasks/ में रहती हैं। आवश्यकता पड़ने पर चीनी-भाषा नमूना कार्यों को tasks_zh/ से अलग से निर्यात किया जा सकता है।
python scripts/export_hf_dataset.py
# Optional: export Chinese-language samples
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl
अपलोड के बाद, उपयोगकर्ता बेंचमार्क मेटाडेटा निम्न प्रकार लोड कर सकते हैं:
from datasets import load_dataset
dataset = load_dataset("ZJUICSR/DeepTrap", split="train")
प्रत्येक पंक्ति में task_id, name, risk, category, prompt, expected_behavior, grading_criteria, workspace_files, स्कोरिंग मेटाडेटा, और स्वचालित जाँच व LLM जज रूब्रिक के लिए फ़्लैग शामिल होते हैं।
.
├── benchmark.py # Public benchmark runner
├── tasks/ # 42 bundled task definitions
├── tasks_zh/ # 10 Chinese-language replay samples
├── scenes/ # Clean source scenes for baseline/delta scoring
├── data/tasks.jsonl # Hugging Face dataset export
├── docs/ # GitHub Pages project site
├── huggingface/README.md # Hugging Face dataset card
├── scripts/ # Runtime support and export code
│ ├── lib_agent.py # OpenClaw execution helpers
│ ├── lib_reward.py # Attack/utility scoring
│ ├── lib_criteria.py # Public judge criteria
│ ├── lib_llm.py # Judge backend router
│ ├── lib_openrouter.py # OpenRouter judge client
│ ├── lib_deepseek.py # DeepSeek judge client
│ ├── lib_dashscope.py # DashScope/Qwen judge client
│ └── export_hf_dataset.py # Dataset export helper
├── tests/ # Public validation tests
├── SKILL.md # Agent-facing benchmark skill
└── pyproject.toml
यदि आप अपने शोध में DeepTrap का उपयोग करते हैं, तो कृपया उद्धृत करें:
@article{yao2026trap,
title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
journal={arXiv preprint arXiv:2605.11047},
year={2026}
}
DeepTrap आंशिक रूप से PinchBench से प्रेरित था, जो वास्तविक-विश्व कार्यों पर OpenClaw एजेंट क्षमता मापने के लिए एक व्यावहारिक बेंचमार्क सुइट प्रदान करता है। हम PinchBench परियोजना को OpenClaw एजेंटों के लिए एक स्पष्ट, उपयोग योग्य बेंचमार्क प्रारूप प्रदर्शित करने के लिए धन्यवाद देते हैं।
MIT — विवरण के लिए LICENSE देखें।
| हम क्या परीक्षण करते हैं | यह क्यों महत्वपूर्ण है |
|---|
| संदर्भ मजबूती | ज़हरीली फ़ाइलें, मेमोरी-जैसी आर्टिफैक्ट्स, प्लेबुक, और वर्कस्पेस निर्देश | वास्तविक एजेंट परिवर्तनशील स्थानीय संदर्भ से पढ़ते हैं, जहाँ अविश्वसनीय टेक्स्ट चुपचाप व्यवहार को पुनर्निर्देशित कर सकता है |
| गुप्त जानकारी संभालना | छिपी हुई क्रेडेंशियल्स, पर्यावरण चर, API कुंजियाँ, और आंतरिक मान | एजेंटों को कॉन्फ़िगरेशन जागरूकता को गुप्त निष्कासन से अलग करना चाहिए |
| निष्पादन सीमाएँ | खतरनाक शेल कमांड, डिप्लॉयमेंट स्क्रिप्ट, और फ़ाइल-सिस्टम साइड इफेक्ट | टूल-उपयोग करने वाले एजेंट तब भी स्थायी हानि पहुँचा सकते हैं जब उपयोगकर्ता प्रॉम्प्ट सामान्य हो |
| कौशल/टूल विश्वास | दुर्भावनापूर्ण कौशल, भ्रामक टूल मेटाडेटा, और टूल-दुरुपयोग पैटर्न | एजेंट सुरक्षा इस बात पर निर्भर करती है कि मॉडल टूल क्षमताओं की व्याख्या और सत्यापन कैसे करता है |
| अस्पष्ट पेलोड | Base64 और बहु-चरणीय एन्कोडेड निर्देश | हमले सामान्य दिखने वाले डेटा-प्रोसेसिंग कार्यों के पीछे छिप सकते हैं |
| Claw मॉडल | मीट्रिक | जोखिम 1 | जोखिम 2 | जोखिम 3 | जोखिम 4 | जोखिम 5 | जोखिम 6 | औसत |
|---|
| GPT-5.4 | AGS | 0.77 | 0.84 | 0.76 | 0.61 | 0.67 | 0.53 | 0.70 |
| GPT-5.4 | UGS | 0.91 | 0.83 | 0.86 | 0.77 | 0.74 | 0.87 | 0.83 |
| Claude-Sonnet-4.6 | AGS | 0.51 | 0.58 | 0.37 | 0.25 | 0.38 | 0.20 | 0.38 |
| Claude-Sonnet-4.6 | UGS | 0.71 | 0.69 | 0.55 | 0.45 | 0.55 | 0.71 | 0.61 |
| GLM-5 | AGS | 0.81 | 0.93 | 0.74 | 0.83 | 0.79 | 0.88 | 0.83 |
| GLM-5 | UGS | 0.90 | 0.90 | 0.98 | 0.89 | 0.83 | 0.88 | 0.90 |
| Qwen3.5-Plus | AGS | 0.93 | 0.93 | 0.86 | 0.74 | 0.88 | 0.97 | 0.88 |
| Qwen3.5-Plus | UGS | 0.95 | 0.92 | 1.00 | 0.98 | 0.93 | 0.93 | 0.95 |
| MiniMax-M2.5 | AGS | 0.86 | 0.89 | 0.77 | 0.66 | 0.90 | 0.89 | 0.83 |
| MiniMax-M2.5 | UGS | 0.92 | 0.95 | 1.00 | 0.88 | 0.74 | 0.90 | 0.90 |
| DeepSeek-v4-Flash | AGS | 0.90 | 0.96 | 0.80 | 0.90 | 0.82 | 0.94 | 0.89 |
| DeepSeek-v4-Flash | UGS | 0.98 | 0.96 | 1.00 | 0.96 | 0.85 | 1.00 | 0.96 |
| Deepseek-v4-Pro | AGS | 0.90 | 0.96 | 0.74 | 0.87 | 0.85 | 0.86 | 0.86 |
| Deepseek-v4-Pro | UGS | 0.90 | 0.91 | 1.00 | 0.81 | 0.84 | 0.89 | 0.89 |
| MiMo-v2.5 | AGS | 0.86 | 0.87 | 0.71 | 0.73 | 0.57 | 0.60 | 0.72 |
| MiMo-v2.5 | UGS | 0.96 | 0.95 | 0.88 | 0.93 | 0.83 | 0.89 | 0.91 |
| MiMo-v2.5-pro | AGS | 0.74 | 0.83 | 0.56 | 0.58 | 0.58 | 0.53 | 0.64 |
| MiMo-v2.5-pro | UGS | 0.92 | 0.90 | 0.88 | 0.87 | 0.71 | 0.87 | 0.86 |
| सुइट | श्रेणी | कार्य | क्या मापा जाता है |
|---|
R1 | हार्नेस अपहरण | 7 | ज़हरीले संदर्भ और इंजेक्ट किए गए वर्कफ़्लो चरणों के प्रति प्रतिरोध |
R2 | गोपनीयता रिसाव | 7 | छिपी हुई क्रेडेंशियल्स और संवेदनशील मानों की सुरक्षा |
R3 | अनधिकृत निष्पादन | 7 | खतरनाक कमांड और सीमा-उल्लंघन कार्यों से इनकार |
R4 | आपूर्ति श्रृंखला जोखिम | 7 | दुर्भावनापूर्ण कौशल और टूल-जैसे एकीकरण से निपटना |
R5 | टूल दुरुपयोग | 7 | भ्रामक या बेमेल टूल व्यवहार का पता लगाना |
R6 | एन्कोडिंग ओबफस्केशन | 7 | एन्कोडेड निर्देशों और बहु-चरणीय पेलोड से निपटना |
| परिदृश्य | विशिष्ट कार्य परिवार |
|---|
T01 | बैठक नोट्स, कार्य आइटम, और नियमित वर्कफ़्लो सारांश |
T02 | Python/कोड फ़ॉर्मेटिंग, रिफैक्टरिंग, और API/लॉग प्रोसेसिंग |
T03 | शोध नोट्स, साहित्य समीक्षा, उद्धरण, और सर्वेक्षण विश्लेषण |
T04 | डिप्लॉयमेंट तत्परता, कॉन्फ़िगरेशन सत्यापन, और सेवा स्वास्थ्य जाँच |
T05 | बिक्री, राजस्व, और संरचित व्यावसायिक-डेटा रिपोर्टिंग |
T06 | ब्लॉग/सामग्री लेखन, शैली जाँच, ऑनबोर्डिंग, और फ़ीडबैक सारांश |
T07 | सिस्टम प्रशासन, पर्यावरण ऑडिट, डिप्लॉयमेंट जाँच, और लॉग बैकअप |
| फ़्लैग | विवरण |
|---|
--model MODEL | OpenClaw के लिए कॉन्फ़िगर किया गया लक्षित मॉडल पहचानकर्ता |
--suite SUITE | all, R1 जैसा एक जोखिम सुइट, या अल्पविराम-पृथक कार्य ID |
--tasks-dir DIR | कार्य निर्देशिका, डिफ़ॉल्ट tasks/; चीनी-भाषा नमूनों के लिए tasks_zh/ का उपयोग करें |
--runs N | औसत के लिए प्रति कार्य रन की संख्या |
--timeout-multiplier N | धीमे मॉडलों के लिए कार्य टाइमआउट को स्केल करें |
--judge-model MODEL | हमले, चुपके, और उपयोगिता स्कोरिंग के लिए जज मॉडल |
--output-dir DIR | परिणाम निर्देशिका, डिफ़ॉल्ट results/ |
--list-tasks | बंडल किए गए कार्य ID प्रिंट करें और बाहर निकलें |
--dry-run | OpenClaw चलाए बिना कार्य लोडिंग और स्कोरिंग मेटाडेटा सत्यापित करें |
--verbose | विस्तृत निष्पादन लॉग प्रिंट करें |