
EpiReal-Bench
معيار للفريق الأحمر وإطار هجوم الصندوق الأسود لتقييم مخاطر التضليل البصري في مولّدات الصور التجارية، مع 10 آلاف مطالبة بادعاءات كاذبة ونصوص برمجية…

معيار للفريق الأحمر وإطار هجوم الصندوق الأسود لتقييم مخاطر التضليل البصري في مولّدات الصور التجارية، مع 10 آلاف مطالبة بادعاءات كاذبة ونصوص برمجية…

هجمات الصور الخصومية على وكلاء الويب البصريين-اللغويين، من الإرساء البصري إلى التنفيذ في المتصفح

إطار دفاعي يخفف من الضبط الدقيق الخبيث لنماذج اللغة الكبيرة (LLMs) باستخدام استعادة الطبقات الانتقائية والتوجيه الديناميكي، مع نصوص برمجية للتدريب…

تنفيذ بحثي لوكيل كسر حماية LLM يتجاوز حواجز الحماية للنماذج التجارية باستخدام نسج المطالبات غير الضارة والبحث الشجري التكيفي.

Curated collection of research papers on retrieval-augmented generation security, organized by the SLOT taxonomy covering knowledge poisoning,…

خط أنابيب بحثي يبني تجارب ناجحة موثّقة وينظّمها في سجلات تشكيل لتسميم مهارات النموذج تدريجيًا عبر مراحل HTS وLEGSA وGCTIR.

إطار عمل للضبط الدقيق يطبّق معايرة أمان مثلى من الدرجة الأولى وإعادة معايرة دورية على النماذج اللغوية الكبيرة، مع الحفاظ على التحديثات المتوافقة مع…

كود القياس والدفاع لهجمات الذاكرة الدائمة على وكلاء استخدام الحاسوب بأسلوب OpenClaw، مع تخفيف تقسيم الذاكرة، وسيناريوهات الهجوم، ونصوص التقييم.

معيار دورة حياة لهجمات استخراج نماذج اللغة الكبيرة ذات الصندوق الأسود، والدفاعات، والهجمات التكيفية.

الرفض يوطّن، والضرر ينتقل، وطبقات الأمان تحت الضبط الدقيق بقليل من العينات

أداة قياس مرجعية تقيس أين تُفعَّل دفاعات حقن الأوامر في خطوط أنابيب وكلاء النماذج اللغوية الكبيرة التي تستخدم الأدوات، وتتتبع رموز الكناري عبر مراحل…

فهرس منسّق لهجمات ودفاعات زمن الوصول في التعلم العميق، وزمن الوصول-الطاقة، والتوقيت (التوافر) — مرافق لإيداع ACM Computing Surveys.

نماذج لغوية كبيرة مفتوحة الأوزان وشيفرة تدريب/تقييم للدفاع ضد هجمات حقن الأوامر، مع معايير قياس لأمان استدعاء الأدوات بالوكلاء واتباع التعليمات.

أداة قياس وتقييم لاختبار مدى مقاومة وكلاء LLM للتعليمات الخبيثة المخفية في صور المهارات متعددة الوسائط، مع 108 حالات موزعة على خمس فئات مخاطر وتقييم…

إطار عمل للاختراق الذكي للوكلاء (Agentic Jailbreak) يستهدف الوكلاء القائمين على نماذج اللغة الكبيرة (LLM)، وذلك باستخدام تفكيك المهام القائم على…

إطار عمل تطوري لكسر حماية نماذج اللغة الكبيرة (LLM) وحواجز الأمان، ينمّي مجموعة استراتيجيات قابلة لإعادة الاستخدام عبر الطفرة الجينية، واختيار…

إطار عمل مفتوح لاختبار الاختراق الأحمر القائم على التعلم المعزز لحقن الأوامر، مع مدرب مشترك، وتعلم منهجي، ومعايير مثل AgentDojo وInjecAgent وPIArena.

منصة محاكاة الخصوم القائمة على الويب التي تنسّق اختبارات Atomic Red Team عبر نقاط نهاية Windows عبر وكلاء Go، مع ربط MITRE ATT&CK، وخطط محاكاة APT،…