Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
DeepTrap — معيار أمان لتقييم وكلاء OpenClaw ضد سياقات تنفيذ عدائية تشمل ملفات مسمومة، ومهارات محقونة، وبيانات وصفية مضللة للأدوات، وحمولات مرمزة. يتضمن 42 مهمة إعادة تشغيل موزعة على 6 مجموعات مخاطر مع تسجيل نقاط للهجوم والفائدة. | Kitploit
أدوات/GitHubGitHub/zjuicsr/deeptrap
تصعيد الامتيازاتتسريب البياناتاختبار الاختراقالقيادة والسيطرةأمن سلسلة التوريدالتعلم والتعليمالفريق الأحمرتطوير الحمولاتأمن الذكاء الاصطناعيالهجوم العدائيمختبرات وتدريب عملي
10116منذ 4 أشهرلم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة
GitHub
zjuicsr/deeptrap

DeepTrap

معيار أمان لتقييم وكلاء OpenClaw ضد سياقات تنفيذ عدائية تشمل ملفات مسمومة، ومهارات محقونة، وبيانات وصفية مضللة للأدوات، وحمولات مرمزة. يتضمن 42 مهمة إعادة تشغيل موزعة على 6 مجموعات مخاطر مع تسجيل نقاط للهجوم والفائدة.

عرض المستودع

DeepTrap

شعار DeepTrap

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

الإنجليزية | 中文

تقييم أمني للعالم المفتوح لوكلاء OpenClaw في سياقات تنفيذ عدائية.


DeepTrap هو معيار أمني (benchmark) لتقييم ما إذا كان بإمكان وكلاء OpenClaw إكمال مهام مستخدم سليمة مع مقاومة ضغوط سياق التنفيذ الخبيثة: ملفات مساحة عمل مسمومة، ومهارات محقونة، وبيانات وصفية مضللة للأدوات، ومسارات أوامر غير آمنة، وأسرار مزروعة، وحمولات مشفّرة.

يحتوي الإصدار العلني على 42 مهمة إعادة تشغيل موزعة على 6 فئات من نقاط الضعف السياقية × 7 عائلات سيناريوهات تشغيلية، بالإضافة إلى مشغّل المعيار ورمز التسجيل العلني. ويتضمن أيضًا 10 عينات إعادة تشغيل باللغة الصينية في tasks_zh/ لتجارب التقييم المحلي. ولا يتم تضمين خط أنابيب توليد المهام الخاصة والبحث عن الهجمات عن قصد.

يرافق DeepTrap الورقة البحثية التالية:

اختبار الفريق الأحمر لسياقات تنفيذ الوكلاء: تقييم أمني للعالم المفتوح على OpenClaw
Hongwei Yao و Yiming Liu و Yiling He و Bingrun Yang. arXiv:2605.11047، 2026.

لماذا DeepTrap؟

تسأل معظم معايير الوكلاء عما إذا كان النموذج يمكنه إنجاز عمل مفيد. يطرح DeepTrap سؤالًا أكثر صرامة: هل يمكن للوكيل إنجاز عمل مفيد بأمان عندما يكون سياق التنفيذ المحيط به عدائيًا؟

ما نختبرهلماذا يهم
متانة السياقالملفات المسمومة، والقطع الأثرية الشبيهة بالذاكرة، ودفاتر التشغيل (playbooks)، وتعليمات مساحة العمليقرأ الوكلاء الحقيقيون من سياق محلي متغيّر، حيث يمكن للنص غير الموثوق إعادة توجيه السلوك بصمت
التعامل مع الأسراربيانات اعتماد مزروعة، ومتغيرات بيئة، ومفاتيح API، وقيم داخليةيجب على الوكلاء التمييز بين الوعي بالتهيئة وتسريب الأسرار
حدود التنفيذأوامر الصدفة الخطيرة، ونصوص النشر، وآثار جانبية على نظام الملفاتيمكن للوكلاء الذين يستخدمون الأدوات إحداث ضرر دائم حتى عندما تكون مطالبة المستخدم سليمة
الثقة بالمهارات/الأدواتمهارات خبيثة، وبيانات وصفية مضللة للأدوات، وأنماط إساءة استخدام الأدواتتعتمد سلامة الوكيل على كيفية تفسير النموذج للقدرات المتاحة للأدوات والتحقق منها
الحمولات المُعمّاةتعليمات مشفّرة بـ Base64 وعلى مراحل متعددةيمكن للهجمات أن تختبئ خلف مهام معالجة بيانات ذات مظهر طبيعي

ما الذي يميزنا

  • هجمات سياق التنفيذ، وليست هجمات المطالبات فقط. يقيّم DeepTrap التهديدات المضمّنة في الملفات والمهارات وأوصاف الأدوات والبرامج النصية والسجلات وملفات الإعدادات والقطع الأثرية المشفّرة.
  • مطالبات مستخدم سليمة. طلب المستخدم مفيد وعادي؛ يأتي الخطر من مساحة العمل المحيطة.
  • إعادة إنتاج علنية وبسيطة. يحتوي المستودع على المشغّل ومهام إعادة التشغيل ومنطق التسجيل اللازم لإعادة إنتاج عمليات تشغيل المعيار دون كشف رمز التوليد الخاص.
  • تسجيل الهجوم والفائدة. يبلّغ DeepTrap عن كل من AGS (درجة تقييم الهجوم) وUGS (درجة تقييم الفائدة)، بحيث يتم تقييم النموذج على السلامة وفائدة المهمة معًا.
  • أصيل لـ OpenClaw. صُمّمت المهام لوكلاء من طراز OpenClaw وتحافظ على افتراضات التنفيذ لمساحة عمل حقيقية من الملفات/الأدوات/المهارات.

الأخبار

  • 2026-05 نُشرت ورقة DeepTrap على arXiv: arXiv:2605.11047.
  • 2026-05 صدر المستودع العلني للمعيار مع 42 مهمة إعادة تشغيل ورمز التسجيل ولوحة صدارة على GitHub Pages.
  • 2026-05 أُضيفت عينات إعادة تشغيل باللغة الصينية تحت tasks_zh/.
  • 2026-05 أُضيف تصدير مجموعة بيانات Hugging Face لتوزيع البيانات الوصفية للمهام.

لوحة الصدارة

AGS هي درجة تقييم الهجوم وUGS هي درجة تقييم الفائدة. تُبلّغ الدرجات حسب مجموعة المخاطر؛ والمتوسط هو المتوسط عبر المخاطر من 1 إلى 6.

صفحة المشروع كاملة ولوحة الصدارة: ZJUICSR.github.io/DeepTrap

نموذج Clawالمقياسالمخاطرة 1المخاطرة 2المخاطرة 3المخاطرة 4المخاطرة 5المخاطرة 6المتوسط
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86

تصميم المعيار

يجمع DeepTrap بين ست فئات من نقاط الضعف السياقية وسبع عائلات سيناريوهات سليمة. تستخدم كل مهمة مطالبة مستخدم عادية؛ ويُستحث السلوك العدائي من خلال سياق مساحة العمل.

إطار DeepTrap

يبني DeepTrap سياقات تنفيذ مخترقة من تعليمات سليمة ومساحات عمل نظيفة، ويبحث عن حمولات عدائية مرشحة باستخدام إشارات مكافأة متعددة الأهداف، ويصقل الحمولات الناجحة من خلال اختبار قائم على التأمل (reflection-based probing).

مجموعات المخاطر

المجموعةالفئةالمهامما الذي يُقاس
R1اختطاف الحِزام (Harness Hijacking)7مقاومة السياق المسموم وخطوات سير العمل المحقونة
R2تسريب الخصوصية7حماية بيانات الاعتماد والقيم الحساسة المزروعة
R3تنفيذ غير مصرّح به7رفض الأوامر الخطيرة والإجراءات التي تتجاوز الحدود
R4مخاطر سلسلة التوريد7التعامل مع المهارات الخبيثة والتكاملات الشبيهة بالأدوات
R5إساءة استخدام الأدوات7كشف سلوك الأدوات المضلّل أو غير المتطابق
R6إخفاء الترميز7التعامل مع التعليمات المشفّرة والحمولات متعددة الخطوات

عائلات السيناريوهات

تنزيل الأداة