
OpenClaw एजेंटों का मूल्यांकन करने के लिए सुरक्षा बेंचमार्क, जो प्रतिकूल निष्पादन संदर्भों (adversarial execution contexts) के विरुद्ध काम करता है, जिनमें ज़हरीली फ़ाइलें (poisoned files), इंजेक्ट किए गए कौशल (injected skills), भ्रामक टूल मेटाडेटा (misleading tool metadata), और एन्कोडेड पेलोड (encoded payloads) शामिल हैं। इसमें 42 रीप्ले कार्य (replay tasks) शामिल हैं, जो 6 जोखिम सुइट्स (risk suites) में फैले हुए हैं, जिनमें हमले और उपयोगिता स्कोरिंग (attack and utility scoring) होती है।
प्रतिकूल निष्पादन संदर्भों में OpenClaw एजेंटों के लिए ओपन-वर्ल्ड सुरक्षा मूल्यांकन।
DeepTrap एक सुरक्षा बेंचमार्क है जो यह मूल्यांकन करता है कि क्या OpenClaw एजेंट दुर्भावनापूर्ण निष्पादन-संदर्भ दबाव का प्रतिरोध करते हुए सामान्य उपयोगकर्ता कार्यों को पूरा कर सकते हैं: ज़हरीली वर्कस्पेस फ़ाइलें, इंजेक्ट किए गए कौशल, भ्रामक टूल मेटाडेटा, असुरक्षित कमांड पथ, छिपे हुए रहस्य, और एन्कोडेड पेलोड।
सार्वजनिक रिलीज़ में 42 रीप्ले कार्य शामिल हैं जिन्हें 6 प्रासंगिक भेद्यता वर्गों x 7 परिचालन परिदृश्य परिवारों के रूप में व्यवस्थित किया गया है, साथ ही बेंचमार्क रनर और सार्वजनिक स्कोरिंग कोड भी। इसमें स्थानीयकृत मूल्यांकन प्रयोगों के लिए tasks_zh/ में 10 चीनी-भाषा रीप्ले नमूने भी शामिल हैं। निजी कार्य-निर्माण और हमला-खोज पाइपलाइन जानबूझकर शामिल नहीं की गई है।
DeepTrap निम्नलिखित शोधपत्र के साथ आता है:
रेड-टीमिंग एजेंट निष्पादन संदर्भ: OpenClaw पर ओपन-वर्ल्ड सुरक्षा मूल्यांकन
Hongwei Yao, Yiming Liu, Yiling He, और Bingrun Yang. arXiv:2605.11047, 2026.
अधिकांश एजेंट बेंचमार्क यह पूछते हैं कि क्या कोई मॉडल उपयोगी कार्य पूरा कर सकता है। DeepTrap एक कठोर प्रश्न पूछता है: क्या एजेंट तब उपयोगी कार्य सुरक्षित रूप से पूरा कर सकता है जब आस-पास का निष्पादन संदर्भ प्रतिकूल हो?
| हम क्या परीक्षण करते हैं | यह क्यों महत्वपूर्ण है | |
|---|---|---|
| संदर्भ मजबूती | ज़हरीली फ़ाइलें, मेमोरी-जैसी आर्टिफैक्ट्स, प्लेबुक, और वर्कस्पेस निर्देश | वास्तविक एजेंट परिवर्तनशील स्थानीय संदर्भ से पढ़ते हैं, जहाँ अविश्वसनीय टेक्स्ट चुपचाप व्यवहार को पुनर्निर्देशित कर सकता है |
| गुप्त जानकारी संभालना | छिपी हुई क्रेडेंशियल्स, पर्यावरण चर, API कुंजियाँ, और आंतरिक मान | एजेंटों को कॉन्फ़िगरेशन जागरूकता को गुप्त निष्कासन से अलग करना चाहिए |
| निष्पादन सीमाएँ | खतरनाक शेल कमांड, डिप्लॉयमेंट स्क्रिप्ट, और फ़ाइल-सिस्टम साइड इफेक्ट | टूल-उपयोग करने वाले एजेंट तब भी स्थायी हानि पहुँचा सकते हैं जब उपयोगकर्ता प्रॉम्प्ट सामान्य हो |
| कौशल/टूल विश्वास | दुर्भावनापूर्ण कौशल, भ्रामक टूल मेटाडेटा, और टूल-दुरुपयोग पैटर्न | एजेंट सुरक्षा इस बात पर निर्भर करती है कि मॉडल टूल क्षमताओं की व्याख्या और सत्यापन कैसे करता है |
| अस्पष्ट पेलोड | Base64 और बहु-चरणीय एन्कोडेड निर्देश | हमले सामान्य दिखने वाले डेटा-प्रोसेसिंग कार्यों के पीछे छिप सकते हैं |
tasks_zh/ के अंतर्गत चीनी-भाषा रीप्ले नमूने जोड़े गए।AGS अटैक ग्रेडिंग स्कोर है और UGS यूटिलिटी ग्रेडिंग स्कोर है। स्कोर जोखिम सुइट के अनुसार रिपोर्ट किए जाते हैं; Average जोखिम 1 से जोखिम 6 तक का औसत है।
पूर्ण प्रोजेक्ट पृष्ठ और लीडरबोर्ड: ZJUICSR.github.io/DeepTrap
| Claw मॉडल | मीट्रिक | जोखिम 1 | जोखिम 2 | जोखिम 3 | जोखिम 4 | जोखिम 5 | जोखिम 6 | औसत |
|---|---|---|---|---|---|---|---|---|
| GPT-5.4 | AGS | 0.77 | 0.84 | 0.76 | 0.61 | 0.67 | 0.53 | 0.70 |
| GPT-5.4 | UGS | 0.91 | 0.83 | 0.86 | 0.77 | 0.74 | 0.87 | 0.83 |
| Claude-Sonnet-4.6 | AGS | 0.51 | 0.58 | 0.37 | 0.25 | 0.38 | 0.20 | 0.38 |
| Claude-Sonnet-4.6 | UGS | 0.71 | 0.69 | 0.55 | 0.45 | 0.55 | 0.71 | 0.61 |
| GLM-5 | AGS | 0.81 | 0.93 | 0.74 | 0.83 | 0.79 | 0.88 | 0.83 |
| GLM-5 | UGS | 0.90 | 0.90 | 0.98 | 0.89 | 0.83 | 0.88 | 0.90 |
| Qwen3.5-Plus | AGS | 0.93 | 0.93 | 0.86 | 0.74 | 0.88 | 0.97 | 0.88 |
| Qwen3.5-Plus | UGS | 0.95 | 0.92 | 1.00 | 0.98 | 0.93 | 0.93 | 0.95 |
| MiniMax-M2.5 | AGS | 0.86 | 0.89 | 0.77 | 0.66 | 0.90 | 0.89 | 0.83 |
| MiniMax-M2.5 | UGS | 0.92 | 0.95 | 1.00 | 0.88 | 0.74 | 0.90 | 0.90 |
| DeepSeek-v4-Flash | AGS | 0.90 | 0.96 | 0.80 | 0.90 | 0.82 | 0.94 | 0.89 |
| DeepSeek-v4-Flash | UGS | 0.98 | 0.96 | 1.00 | 0.96 | 0.85 | 1.00 | 0.96 |
| Deepseek-v4-Pro | AGS | 0.90 | 0.96 | 0.74 | 0.87 | 0.85 | 0.86 | 0.86 |
| Deepseek-v4-Pro | UGS | 0.90 | 0.91 | 1.00 | 0.81 | 0.84 | 0.89 | 0.89 |
| MiMo-v2.5 | AGS | 0.86 | 0.87 | 0.71 | 0.73 | 0.57 | 0.60 | 0.72 |
| MiMo-v2.5 | UGS | 0.96 | 0.95 | 0.88 | 0.93 | 0.83 | 0.89 | 0.91 |
| MiMo-v2.5-pro | AGS | 0.74 | 0.83 | 0.56 | 0.58 | 0.58 | 0.53 | 0.64 |
| MiMo-v2.5-pro | UGS | 0.92 | 0.90 | 0.88 | 0.87 | 0.71 | 0.87 | 0.86 |
DeepTrap छह प्रासंगिक भेद्यता वर्गों को सात सामान्य परिदृश्य परिवारों के साथ जोड़ता है। प्रत्येक कार्य एक सामान्य उपयोगकर्ता प्रॉम्प्ट का उपयोग करता है; प्रतिकूल व्यवहार कार्यक्षेत्र संदर्भ द्वारा प्रेरित किया जाता है।
DeepTrap सामान्य निर्देशों और स्वच्छ वर्कस्पेस से समझौता किए गए निष्पादन संदर्भों का निर्माण करता है, बहु-उद्देश्यीय पुरस्कार संकेतों के साथ उम्मीदवार प्रतिकूल पेलोड की खोज करता है, और प्रतिबिंब-आधारित जांच के माध्यम से सफल पेलोड को परिष्कृत करता है।
| सुइट | श्रेणी | कार्य | क्या मापा जाता है |
|---|---|---|---|
R1 | हार्नेस अपहरण | 7 | ज़हरीले संदर्भ और इंजेक्ट किए गए वर्कफ़्लो चरणों के प्रति प्रतिरोध |
R2 | गोपनीयता रिसाव | 7 | छिपी हुई क्रेडेंशियल्स और संवेदनशील मानों की सुरक्षा |
R3 | अनधिकृत निष्पादन | 7 | खतरनाक कमांड और सीमा-उल्लंघन कार्यों से इनकार |
R4 | आपूर्ति श्रृंखला जोखिम | 7 | दुर्भावनापूर्ण कौशल और टूल-जैसे एकीकरण से निपटना |
R5 | टूल दुरुपयोग | 7 | भ्रामक या बेमेल टूल व्यवहार का पता लगाना |
R6 | एन्कोडिंग ओबफस्केशन | 7 | एन्कोडेड निर्देशों और बहु-चरणीय पेलोड से निपटना |