
قائمة منتقاة من الموارد المفيدة التي تغطي الذكاء الاصطناعي الهجومي.
قائمة منسقة من الموارد المفيدة التي تغطي الذكاء الاصطناعي الهجومي.
استغلال نقاط ضعف نماذج الذكاء الاصطناعي.
التعلم الآلي الخصامي مسؤول عن تقييم نقاط ضعفها وتوفير التدابير المضادة.
يتم تنظيمها في أربعة أنواع من الهجمات: الاستخراج، والعكس، والتسميم، والتهرب.

يحاول سرقة المعاملات والمعاملات الفائقة لنموذج ما عن طريق تقديم طلبات تزيد من استخراج المعلومات.

اعتمادًا على معرفة نموذج الخصم، يمكن تنفيذ هجمات الصندوق الأبيض والصندوق الأسود.
في أبسط حالة للصندوق الأبيض (عندما يكون لدى الخصم معرفة كاملة بالنموذج، على سبيل المثال، دالة سيجمويد)، يمكن للمرء إنشاء نظام من المعادلات الخطية التي يمكن حلها بسهولة.
في الحالة العامة، حيث تكون المعرفة بالنموذج غير كافية، يتم استخدام النموذج البديل. يتم تدريب هذا النموذج بالطلبات المقدمة إلى النموذج الأصلي من أجل تقليد نفس وظائف النموذج الأصلي.

تدريب نموذج بديل يعادل (في كثير من الحالات) تدريب نموذج من الصفر.
كثيف حسابيًا للغاية.
لدى الخصم قيود على عدد الطلبات قبل اكتشافه.
تقريب قيم المخرجات.
استخدام الخصوصية التفاضلية.
استخدام التجميعات.
استخدام دفاعات محددة
تهدف إلى عكس تدفق المعلومات لنموذج التعلم الآلي.

تمكّن الخصم من معرفة النموذج الذي لم يكن المقصود صراحةً مشاركته.
تسمح لنا بمعرفة بيانات التدريب أو المعلومات كخصائص إحصائية للنموذج.
ثلاثة أنواع ممكنة:
هجوم استدلال العضوية (MIA): يحاول الخصم تحديد ما إذا كانت عينة قد استُخدمت كجزء من التدريب.
هجوم استدلال الخصائص (PIA): يهدف الخصم إلى استخراج خصائص إحصائية لم يتم ترميزها صراحةً كميزات خلال مرحلة التدريب.
إعادة البناء: يحاول الخصم إعادة بناء عينة أو أكثر من مجموعة التدريب و/أو تسمياتها المقابلة. يُسمى أيضًا العكس.
استخدام التشفير المتقدم. تشمل التدابير المضادة الخصوصية التفاضلية، والتشفير المتماثل، والحساب الآمن متعدد الأطراف.
استخدام تقنيات التنظيم مثل Dropout بسبب العلاقة بين الإفراط في التدريب والخصوصية.
تم اقتراح ضغط النموذج كدفاع ضد هجمات إعادة البناء.