
आक्रामक AI को कवर करने वाले उपयोगी संसाधनों की एक चुनिंदा सूची।
Offensive AI को कवर करने वाले उपयोगी संसाधनों की एक क्यूरेटेड सूची।
AI मॉडलों की कमज़ोरियों का शोषण।
Adversarial Machine Learning उनकी कमज़ोरियों का आकलन करने और उपाय प्रदान करने के लिए ज़िम्मेदार है।
इसे चार प्रकार के हमलों में व्यवस्थित किया गया है: extraction, inversion, poisoning और evasion।

यह ऐसे अनुरोध करके किसी मॉडल के parameters और hyperparameters को चुराने का प्रयास करता है जो सूचना के extraction को अधिकतम करते हैं।

विरोधी के मॉडल के ज्ञान के आधार पर, white-box और black-box हमले किए जा सकते हैं।
सबसे सरल white-box मामले में (जब विरोधी को मॉडल का पूर्ण ज्ञान होता है, जैसे, एक sigmoid function), कोई एक रैखिक समीकरणों की प्रणाली बना सकता है जिसे आसानी से हल किया जा सकता है।
सामान्य मामले में, जहाँ मॉडल का अपर्याप्त ज्ञान होता है, substitute model का उपयोग किया जाता है। यह मॉडल मूल मॉडल के समान कार्यक्षमता की नकल करने के लिए मूल मॉडल को किए गए अनुरोधों के साथ प्रशिक्षित किया जाता है।

एक substitute model को प्रशिक्षित करना (कई मामलों में) शुरू से एक मॉडल को प्रशिक्षित करने के बराबर है।
बहुत अधिक कम्प्यूटेशनल रूप से गहन।
पकड़े जाने से पहले विरोधी के अनुरोधों की संख्या पर सीमाएँ होती हैं।
आउटपुट मानों की राउंडिंग।
differential privacy का उपयोग।
ensembles का उपयोग।
विशिष्ट रक्षा का उपयोग
इनका उद्देश्य एक machine-learning मॉडल के सूचना प्रवाह को उलटना है।

ये एक विरोधी को उस मॉडल को जानने में सक्षम बनाते हैं जिसे स्पष्ट रूप से साझा करने का इरादा नहीं था।
ये हमें प्रशिक्षण डेटा या मॉडल के सांख्यिकीय गुणों के रूप में जानकारी जानने की अनुमति देते हैं।
तीन प्रकार संभव हैं:
Membership Inference Attack (MIA): एक विरोधी यह निर्धारित करने का प्रयास करता है कि क्या किसी नमूने को प्रशिक्षण के भाग के रूप में उपयोग किया गया था।
Property Inference Attack (PIA): एक विरोधी उन सांख्यिकीय गुणों को निकालने का लक्ष्य रखता है जो प्रशिक्षण चरण के दौरान स्पष्ट रूप से features के रूप में एन्कोड नहीं किए गए थे।
Reconstruction: एक विरोधी प्रशिक्षण सेट से एक या अधिक नमूनों और/या उनके संबंधित labels को पुनर्निर्मित करने का प्रयास करता है। इसे inversion भी कहा जाता है।