
معيار أمان لتقييم وكلاء OpenClaw ضد سياقات تنفيذ عدائية تشمل ملفات مسمومة، ومهارات محقونة، وبيانات وصفية مضللة للأدوات، وحمولات مرمزة. يتضمن 42 مهمة إعادة تشغيل موزعة على 6 مجموعات مخاطر مع تسجيل نقاط للهجوم والفائدة.
الإنجليزية | 中文
تقييم أمني للعالم المفتوح لوكلاء OpenClaw في سياقات تنفيذ عدائية.
DeepTrap هو معيار أمني (benchmark) لتقييم ما إذا كان بإمكان وكلاء OpenClaw إكمال مهام مستخدم سليمة مع مقاومة ضغوط سياق التنفيذ الخبيثة: ملفات مساحة عمل مسمومة، ومهارات محقونة، وبيانات وصفية مضللة للأدوات، ومسارات أوامر غير آمنة، وأسرار مزروعة، وحمولات مشفّرة.
يحتوي الإصدار العلني على 42 مهمة إعادة تشغيل موزعة على 6 فئات من نقاط الضعف السياقية × 7 عائلات سيناريوهات تشغيلية، بالإضافة إلى مشغّل المعيار ورمز التسجيل العلني. ويتضمن أيضًا 10 عينات إعادة تشغيل باللغة الصينية في tasks_zh/ لتجارب التقييم المحلي. ولا يتم تضمين خط أنابيب توليد المهام الخاصة والبحث عن الهجمات عن قصد.
يرافق DeepTrap الورقة البحثية التالية:
اختبار الفريق الأحمر لسياقات تنفيذ الوكلاء: تقييم أمني للعالم المفتوح على OpenClaw
Hongwei Yao و Yiming Liu و Yiling He و Bingrun Yang. arXiv:2605.11047، 2026.
تسأل معظم معايير الوكلاء عما إذا كان النموذج يمكنه إنجاز عمل مفيد. يطرح DeepTrap سؤالًا أكثر صرامة: هل يمكن للوكيل إنجاز عمل مفيد بأمان عندما يكون سياق التنفيذ المحيط به عدائيًا؟
| ما نختبره | لماذا يهم | |
|---|---|---|
| متانة السياق | الملفات المسمومة، والقطع الأثرية الشبيهة بالذاكرة، ودفاتر التشغيل (playbooks)، وتعليمات مساحة العمل | يقرأ الوكلاء الحقيقيون من سياق محلي متغيّر، حيث يمكن للنص غير الموثوق إعادة توجيه السلوك بصمت |
| التعامل مع الأسرار | بيانات اعتماد مزروعة، ومتغيرات بيئة، ومفاتيح API، وقيم داخلية | يجب على الوكلاء التمييز بين الوعي بالتهيئة وتسريب الأسرار |
| حدود التنفيذ | أوامر الصدفة الخطيرة، ونصوص النشر، وآثار جانبية على نظام الملفات | يمكن للوكلاء الذين يستخدمون الأدوات إحداث ضرر دائم حتى عندما تكون مطالبة المستخدم سليمة |
| الثقة بالمهارات/الأدوات | مهارات خبيثة، وبيانات وصفية مضللة للأدوات، وأنماط إساءة استخدام الأدوات | تعتمد سلامة الوكيل على كيفية تفسير النموذج للقدرات المتاحة للأدوات والتحقق منها |
| الحمولات المُعمّاة | تعليمات مشفّرة بـ Base64 وعلى مراحل متعددة | يمكن للهجمات أن تختبئ خلف مهام معالجة بيانات ذات مظهر طبيعي |
tasks_zh/.AGS هي درجة تقييم الهجوم وUGS هي درجة تقييم الفائدة. تُبلّغ الدرجات حسب مجموعة المخاطر؛ والمتوسط هو المتوسط عبر المخاطر من 1 إلى 6.
صفحة المشروع كاملة ولوحة الصدارة: ZJUICSR.github.io/DeepTrap
| نموذج Claw | المقياس | المخاطرة 1 | المخاطرة 2 | المخاطرة 3 | المخاطرة 4 | المخاطرة 5 | المخاطرة 6 | المتوسط |
|---|---|---|---|---|---|---|---|---|
| GPT-5.4 | AGS | 0.77 | 0.84 | 0.76 | 0.61 | 0.67 | 0.53 | 0.70 |
| GPT-5.4 | UGS | 0.91 | 0.83 | 0.86 | 0.77 | 0.74 | 0.87 | 0.83 |
| Claude-Sonnet-4.6 | AGS | 0.51 | 0.58 | 0.37 | 0.25 | 0.38 | 0.20 | 0.38 |
| Claude-Sonnet-4.6 | UGS | 0.71 | 0.69 | 0.55 | 0.45 | 0.55 | 0.71 | 0.61 |
| GLM-5 | AGS | 0.81 | 0.93 | 0.74 | 0.83 | 0.79 | 0.88 | 0.83 |
| GLM-5 | UGS | 0.90 | 0.90 | 0.98 | 0.89 | 0.83 | 0.88 | 0.90 |
| Qwen3.5-Plus | AGS | 0.93 | 0.93 | 0.86 | 0.74 | 0.88 | 0.97 | 0.88 |
| Qwen3.5-Plus | UGS | 0.95 | 0.92 | 1.00 | 0.98 | 0.93 | 0.93 | 0.95 |
| MiniMax-M2.5 | AGS | 0.86 | 0.89 | 0.77 | 0.66 | 0.90 | 0.89 | 0.83 |
| MiniMax-M2.5 | UGS | 0.92 | 0.95 | 1.00 | 0.88 | 0.74 | 0.90 | 0.90 |
| DeepSeek-v4-Flash | AGS | 0.90 | 0.96 | 0.80 | 0.90 | 0.82 | 0.94 | 0.89 |
| DeepSeek-v4-Flash | UGS | 0.98 | 0.96 | 1.00 | 0.96 | 0.85 | 1.00 | 0.96 |
| Deepseek-v4-Pro | AGS | 0.90 | 0.96 | 0.74 | 0.87 | 0.85 | 0.86 | 0.86 |
| Deepseek-v4-Pro | UGS | 0.90 | 0.91 | 1.00 | 0.81 | 0.84 | 0.89 | 0.89 |
| MiMo-v2.5 | AGS | 0.86 | 0.87 | 0.71 | 0.73 | 0.57 | 0.60 | 0.72 |
| MiMo-v2.5 | UGS | 0.96 | 0.95 | 0.88 | 0.93 | 0.83 | 0.89 | 0.91 |
| MiMo-v2.5-pro | AGS | 0.74 | 0.83 | 0.56 | 0.58 | 0.58 | 0.53 | 0.64 |
| MiMo-v2.5-pro | UGS | 0.92 | 0.90 | 0.88 | 0.87 | 0.71 | 0.87 | 0.86 |
يجمع DeepTrap بين ست فئات من نقاط الضعف السياقية وسبع عائلات سيناريوهات سليمة. تستخدم كل مهمة مطالبة مستخدم عادية؛ ويُستحث السلوك العدائي من خلال سياق مساحة العمل.
يبني DeepTrap سياقات تنفيذ مخترقة من تعليمات سليمة ومساحات عمل نظيفة، ويبحث عن حمولات عدائية مرشحة باستخدام إشارات مكافأة متعددة الأهداف، ويصقل الحمولات الناجحة من خلال اختبار قائم على التأمل (reflection-based probing).
| المجموعة | الفئة | المهام | ما الذي يُقاس |
|---|---|---|---|
R1 | اختطاف الحِزام (Harness Hijacking) | 7 | مقاومة السياق المسموم وخطوات سير العمل المحقونة |
R2 | تسريب الخصوصية | 7 | حماية بيانات الاعتماد والقيم الحساسة المزروعة |
R3 | تنفيذ غير مصرّح به | 7 | رفض الأوامر الخطيرة والإجراءات التي تتجاوز الحدود |
R4 | مخاطر سلسلة التوريد | 7 | التعامل مع المهارات الخبيثة والتكاملات الشبيهة بالأدوات |
R5 | إساءة استخدام الأدوات | 7 | كشف سلوك الأدوات المضلّل أو غير المتطابق |
R6 | إخفاء الترميز | 7 | التعامل مع التعليمات المشفّرة والحمولات متعددة الخطوات |