
قائمة منتقاة من الموارد المفيدة التي تغطي الذكاء الاصطناعي الهجومي.
قائمة منتقاة من الموارد المفيدة التي تغطي الذكاء الاصطناعي الهجومي.
استغلال الثغرات في نماذج الذكاء الاصطناعي.
التعلم الآلي العدائي مسؤول عن تقييم نقاط ضعف النماذج وتوفير الإجراءات المضادة.
يُقسم إلى أربعة أنواع من الهجمات: الاستخراج، والانعكاس، والتسميم، والمراوغة.

يحاول سرقة معلمات النموذج ومعلماته الفائقة من خلال تقديم طلبات تزيد من استخراج المعلومات إلى أقصى حد.

اعتمادًا على معرفة الخصم بالنموذج، يمكن تنفيذ هجمات الصندوق الأبيض والصندوق الأسود.
في أبسط حالات الصندوق الأبيض (عندما يكون لدى الخصم معرفة كاملة بالنموذج، مثل دالة السيني)، يمكن إنشاء نظام معادلات خطية يسهل حله.
في الحالة العامة، عندما تكون المعرفة بالنموذج غير كافية، يُستخدم النموذج البديل. يُدرَّب هذا النموذج على الطلبات المقدمة إلى النموذج الأصلي لتقليد نفس وظائفه.

تدريب نموذج بديل يعادل (في كثير من الحالات) تدريب نموذج من الصفر.
مكلف حسابيًا للغاية.
يواجه الخصم قيودًا على عدد الطلبات قبل اكتشافه.
تقريب قيم المخرجات.
استخدام الخصوصية التفاضلية.
استخدام التعلم الجماعي.
استخدام دفاعات محددة
تهدف إلى عكس تدفق المعلومات لنموذج التعلم الآلي.

تمكّن الخصم من معرفة النموذج الذي لم يُقصد مشاركته صراحةً.
تسمح لنا بمعرفة بيانات التدريب أو المعلومات كخصائص إحصائية للنموذج.
هناك ثلاثة أنواع ممكنة:
هجوم استدلال العضوية (MIA): يحاول الخصم تحديد ما إذا كانت عينة ما قد استُخدمت كجزء من التدريب.
هجوم استدلال الخصائص (PIA): يهدف الخصم إلى استخراج خصائص إحصائية لم تُشفَّر صراحةً كميزات خلال مرحلة التدريب.
إعادة البناء: يحاول الخصم إعادة بناء عينة أو أكثر من مجموعة التدريب و/أو تسمياتها المقابلة. ويُسمى أيضًا الانعكاس.
استخدام التشفير المتقدم. تشمل الإجراءات المضادة الخصوصية التفاضلية والتشفير المتماثل والحساب الآمن متعدد الأطراف.
استخدام تقنيات التنظيم مثل التسرب نظرًا للعلاقة بين الإفراط في التدريب والخصوصية.
اقتُرح ضغط النماذج كدفاع ضد هجمات إعادة البناء.
تهدف إلى إفساد مجموعة التدريب من خلال جعل نموذج التعلم الآلي يقلل من دقته.

من الصعب اكتشاف هذا الهجوم عند تنفيذه على بيانات التدريب، إذ يمكن أن ينتشر الهجوم بين نماذج مختلفة تستخدم نفس بيانات التدريب.
يسعى الخصم إلى تدمير توافر النموذج عن طريق تعديل حدود القرار، مما يؤدي إلى إنتاج تنبؤات غير صحيحة، أو إنشاء باب خلفي في النموذج. في الحالة الأخيرة، يتصرف النموذج بشكل صحيح (يعيد التنبؤات المرغوبة) في معظم الحالات، باستثناء مدخلات معينة أنشأها الخصم خصيصًا وتنتج نتائج غير مرغوبة. يمكن للخصم التلاعب بنتائج التنبؤات وشن هجمات مستقبلية.
BadNets هي أبسط أنواع الباب الخلفي في نموذج التعلم الآلي. علاوة على ذلك، يمكن الحفاظ على BadNets في النموذج حتى إذا أُعيد تدريبه لمهمة مختلفة عن المهمة الأصلية (التعلم بالنقل).
من المهم ملاحظة أن النماذج المدربة مسبقًا والمتاحة للعموم قد تحتوي على أبواب خلفية.
كشف البيانات المسمومة، إلى جانب استخدام تنظيف البيانات.
طرق تدريب متينة.
دفاعات محددة.
يضيف الخصم تشويشًا صغيرًا (في شكل ضوضاء) إلى مدخلات نموذج التعلم الآلي لجعله يصنّف بشكل غير صحيح (مثال عدائي).

هي مشابهة لهجمات التسميم، لكن الفرق الرئيسي هو أن هجمات المراوغة تحاول استغلال نقاط ضعف النموذج في مرحلة الاستدلال.
هدف الخصم هو أن تكون الأمثلة العدائية غير محسوسة للبشر.
يمكن تنفيذ نوعين من الهجمات اعتمادًا على المخرجات التي يرغب بها الخصم:
موجه: يهدف الخصم إلى الحصول على تنبؤ من اختياره.

غير موجه: ينوي الخصم تحقيق تصنيف خاطئ.

أكثر الهجمات شيوعًا هي هجمات الصندوق الأبيض:
التدريب العدائي، الذي يتضمن إنشاء أمثلة عدائية أثناء التدريب للسماح للنموذج بتعلم ميزات الأمثلة العدائية، مما يجعله أكثر متانة تجاه هذا النوع من الهجمات.
تحويلات على المدخلات.
إخفاء/تنظيم التدرج. ليست فعالة جدًا.
دفاعات ضعيفة.
Prompt Injection Defenses: كل دفاع عملي ومقترح ضد حقن التعليمات.
Lakera PINT Benchmark: يوفر معيار اختبار حقن التعليمات (PINT) طريقة محايدة لتقييم أداء نظام كشف حقن التعليمات، مثل Lakera Guard، دون الاعتماد على مجموعات بيانات عامة معروفة يمكن لهذه الأدوات استخدامها لتحسين أداء التقييم.
Devil's Inference: طريقة لتقييم نموذج Phi-3 Instruct بشكل عدائي من خلال مراقبة توزيع الانتباه عبر رؤوسه عند تعريضه لمدخلات محددة. يدفع هذا النهج النموذج إلى تبنّي "عقلية الشيطان"، مما يمكنه من توليد مخرجات ذات طبيعة عنيفة.
كشف الهجمات العدائية عبر الهواء: من مجموعات البيانات إلى الدفاعات
Adversarial Robustness Toolbox، ويُختصر إلى ART، هي مكتبة مفتوحة المصدر للتعلم الآلي العدائي لاختبار متانة نماذج التعلم الآلي.

تم تطويرها بلغة Python وتنفذ هجمات ودفاعات الاستخراج والانعكاس والتسميم والتهرب.
تدعم ART أشهر الأطر: Tensorflow وKeras وPyTorch وMxNet وScikitLearn وغيرها الكثير.
لا تقتصر على استخدام النماذج التي تعتمد الصور كمدخلات بل تدعم أيضاً أنواعاً أخرى من البيانات، مثل الصوت والفيديو والبيانات الجدولية، إلخ.
Cleverhans هي مكتبة لتنفيذ هجمات التهرب واختبار متانة نموذج التعلم العميق على نماذج الصور.

تم تطويرها بلغة Python وتتكامل مع أطر Tensorflow وTorch وJAX.
تنفذ العديد من الهجمات مثل L-BFGS وFGSM وJSMA وC&W، وغيرها.
يُستخدم الذكاء الاصطناعي لتنفيذ مهام خبيثة وتعزيز الهجمات التقليدية.
| الاسم | النوع | الخوارزميات المدعومة | أنواع الهجمات المدعومة | الهجوم/الدفاع | الأطر المدعومة | الشعبية |
|---|
| Cleverhans | صورة | التعلم العميق | التهرب | هجوم | Tensorflow, Keras, JAX | |
| Foolbox | صورة | التعلم العميق | التهرب | هجوم | Tensorflow, PyTorch, JAX | |
| ART | أي نوع (صورة، بيانات جدولية، صوت، ...) | التعلم العميق، SVM، LR، إلخ. | أي (استخراج، استنتاج، تسميم، تهرب) | كلاهما | Tensorflow, Keras, Pytorch, Scikit Learn | |
| TextAttack | نص | التعلم العميق | التهرب | هجوم | Keras, HuggingFace | |
| Advertorch | صورة | التعلم العميق | التهرب | كلاهما | --- | |
| AdvBox | صورة | التعلم العميق | التهرب | كلاهما | PyTorch, Tensorflow, MxNet | |
| DeepRobust | صورة، رسم بياني | التعلم العميق | التهرب | كلاهما | PyTorch | |
| Counterfit | أي | أي | التهرب | هجوم | --- | |
| أمثلة صوتية عدائية | صوت | DeepSpeech | التهرب | هجوم | --- |