
आक्रामक AI को कवर करने वाले उपयोगी संसाधनों की एक चुनिंदा सूची।
आक्रामक AI को कवर करने वाले उपयोगी संसाधनों की एक क्यूरेटेड सूची।
AI मॉडल की कमजोरियों का शोषण करना।
एडवर्सेरियल मशीन लर्निंग उनकी कमजोरियों का आकलन करने और प्रतिउपाय प्रदान करने के लिए उत्तरदायी है।
इसे चार प्रकार के हमलों में व्यवस्थित किया गया है: निष्कर्षण, व्युत्क्रमण, विषाक्तन और एवेज़न।

यह ऐसे अनुरोध करके किसी मॉडल के पैरामीटर और हाइपरपैरामीटर चुराने की कोशिश करता है जो सूचना के निष्कर्षण को अधिकतम करते हैं।

प्रतिद्वंद्वी के मॉडल के ज्ञान के आधार पर, व्हाइट-बॉक्स और ब्लैक-बॉक्स हमले किए जा सकते हैं।
सबसे सरल व्हाइट-बॉक्स मामले में (जब प्रतिद्वंद्वी को मॉडल का पूर्ण ज्ञान होता है, जैसे कि सिग्मॉइड फ़ंक्शन), कोई व्यक्ति रैखिक समीकरणों की एक प्रणाली बना सकता है जिसे आसानी से हल किया जा सकता है।
सामान्य मामले में, जहाँ मॉडल का अपर्याप्त ज्ञान होता है, विकल्प मॉडल का उपयोग किया जाता है। यह मॉडल मूल मॉडल के समान कार्यक्षमता की नकल करने के लिए मूल मॉडल को किए गए अनुरोधों के साथ प्रशिक्षित किया जाता है।

विकल्प मॉडल को प्रशिक्षित करना (कई मामलों में) एक मॉडल को शुरू से प्रशिक्षित करने के बराबर है।
संगणकीय रूप से अत्यंत गहन।
प्रतिद्वंद्वी के पास पकड़े जाने से पहले अनुरोधों की संख्या की सीमाएँ होती हैं।
आउटपुट मानों का पूर्णांकन।
विभेदक गोपनीयता का उपयोग।
एन्सेम्बल का उपयोग।
विशिष्ट सुरक्षा उपायों का उपयोग
इनका उद्देश्य मशीन-लर्निंग मॉडल के सूचना प्रवाह को उलट देना है।

ये प्रतिद्वंद्वी को उस मॉडल के बारे में जानने में सक्षम बनाते हैं जिसे स्पष्ट रूप से साझा करने का इरादा नहीं था।
ये हमें मॉडल के सांख्यिकीय गुणों के रूप में प्रशिक्षण डेटा या जानकारी जानने की अनुमति देते हैं।
तीन प्रकार संभव हैं:
सदस्यता अनुमान हमला (MIA): एक प्रतिद्वंद्वी यह निर्धारित करने का प्रयास करता है कि कोई नमूना प्रशिक्षण के भाग के रूप में उपयोग किया गया था या नहीं।
गुण अनुमान हमला (PIA): एक प्रतिद्वंद्वी उन सांख्यिकीय गुणों को निकालने का लक्ष्य रखता है जो प्रशिक्षण चरण के दौरान सुविधाओं के रूप में स्पष्ट रूप से एन्कोड नहीं किए गए थे।
पुनर्निर्माण: एक प्रतिद्वंद्वी प्रशिक्षण सेट से एक या अधिक नमूनों और/या उनके संबंधित लेबलों को पुनर्निर्मित करने का प्रयास करता है। इसे व्युत्क्रमण भी कहा जाता है।
उन्नत क्रिप्टोग्राफी का उपयोग। प्रतिउपायों में विभेदक गोपनीयता, समरूपी क्रिप्टोग्राफी और सुरक्षित बहु-पक्षीय गणना शामिल हैं।
ओवरट्रेनिंग और गोपनीयता के बीच संबंध के कारण ड्रॉपआउट जैसी नियमितीकरण तकनीकों का उपयोग।
मॉडल संपीड़न को पुनर्निर्माण हमलों के विरुद्ध सुरक्षा के रूप में प्रस्तावित किया गया है।
इनका उद्देश्य मशीन-लर्निंग मॉडल की सटीकता को कम करने के लिए प्रशिक्षण सेट को दूषित करना है।

प्रशिक्षण डेटा पर किए जाने पर इस हमले का पता लगाना कठिन होता है, क्योंकि यह हमला उसी प्रशिक्षण डेटा का उपयोग करने वाले विभिन्न मॉडलों के बीच फैल सकता है।
प्रतिद्वंद्वी निर्णय सीमा को संशोधित करके मॉडल की उपलब्धता को नष्ट करना चाहता है, और परिणामस्वरूप, गलत पूर्वानुमान उत्पन्न करता है, या किसी मॉडल में बैकडोर बनाता है।
बाद वाले मामले में, मॉडल अधिकांश स्थितियों में सही व्यवहार करता है (वांछित पूर्वानुमान लौटाता है), सिवाय कुछ विशेष इनपुटों के जो प्रतिद्वंद्वी द्वारा विशेष रूप से बनाए जाते हैं और अवांछित परिणाम उत्पन्न करते हैं।
प्रतिद्वंद्वी पूर्वानुमानों के परिणामों में हेरफेर कर सकता है और भविष्य के हमले शुरू कर सकता है।
BadNets मशीन लर्निंग मॉडल में सबसे सरल प्रकार के बैकडोर हैं। इसके अलावा, BadNets को मॉडल में संरक्षित किया जा सकता है, भले ही उन्हें मूल मॉडल से भिन्न कार्य के लिए फिर से प्रशिक्षित किया जाए (ट्रांसफर लर्निंग)।
यह ध्यान रखना महत्वपूर्ण है कि सार्वजनिक पूर्व-प्रशिक्षित मॉडलों में बैकडोर हो सकते हैं।
डेटा सैनिटाइज़ेशन के उपयोग के साथ विषाक्त डेटा का पता लगाना।
मजबूत प्रशिक्षण विधियाँ।
विशिष्ट सुरक्षा उपाय।
एक प्रतिद्वंद्वी मशीन लर्निंग मॉडल के इनपुट में एक छोटी सी गड़बड़ी (शोर के रूप में) जोड़ता है ताकि वह गलत वर्गीकरण करे (उदाहरण प्रतिद्वंद्वी)।

ये विषाक्तन हमलों के समान हैं, लेकिन इनका मुख्य अंतर यह है कि एवेज़न हमले अनुमान चरण में मॉडल की कमजोरियों का शोषण करने का प्रयास करते हैं।
प्रतिद्वंद्वी का लक्ष्य यह होता है कि प्रतिकूल उदाहरण मनुष्यों के लिए अदृश्य हों।
प्रतिद्वंद्वी द्वारा वांछित आउटपुट के आधार पर दो प्रकार के हमले किए जा सकते हैं:
लक्षित: प्रतिद्वंद्वी अपनी पसंद का पूर्वानुमान प्राप्त करना चाहता है।

अलक्षित: प्रतिद्वंद्वी गलत वर्गीकरण प्राप्त करने का इरादा रखता है।

सबसे आम हमले व्हाइट-बॉक्स हमले हैं:
प्रतिकूल प्रशिक्षण, जिसमें प्रशिक्षण के दौरान प्रतिकूल उदाहरण तैयार करना शामिल है ताकि मॉडल प्रतिकूल उदाहरणों की विशेषताओं को सीख सके, जिससे मॉडल इस प्रकार के हमले के प्रति अधिक मजबूत बन सके।
इनपुट पर परिवर्तन।
ग्रेडिएंट मास्किंग/नियमितीकरण। बहुत प्रभावी नहीं।
कमजोर सुरक्षा उपाय।
प्रॉम्प्ट इंजेक्शन सुरक्षा: प्रॉम्प्ट इंजेक्शन के विरुद्ध हर व्यावहारिक और प्रस्तावित सुरक्षा उपाय।
Lakera PINT बेंचमार्क: प्रॉम्प्ट इंजेक्शन टेस्ट (PINT) बेंचमार्क, Lakera Guard जैसी प्रॉम्प्ट इंजेक्शन पहचान प्रणाली के प्रदर्शन का मूल्यांकन करने का एक तटस्थ तरीका प्रदान करता है, बिना उन ज्ञात सार्वजनिक डेटासेट पर निर्भर हुए जिनका उपयोग ये उपकरण मूल्यांकन प्रदर्शन के लिए अनुकूलन करने हेतु कर सकते हैं।
Devil's Inference: विशिष्ट इनपुट के संपर्क में आने पर उसके हेड्स में ध्यान वितरण का अवलोकन करके Phi-3 Instruct मॉडल का प्रतिकूल रूप से आकलन करने की एक विधि। यह दृष्टिकोण मॉडल को 'शैतान की मानसिकता' अपनाने के लिए प्रेरित करता है, जिससे वह हिंसक प्रकृति के आउटपुट उत्पन्न करने में सक्षम हो जाता है।
ओवर-द-एयर प्रतिकूल हमले की पहचान: डेटासेट से सुरक्षा उपायों तक
हानिकारक प्रॉम्प्ट की पहचान और सैनिटाइज़ेशन के लिए हाइपरबोलिक ज्यामिति का उपयोग
Adversarial Robustness Toolbox, जिसे संक्षेप में ART कहा जाता है, मशीन लर्निंग मॉडल की मजबूती का परीक्षण करने के लिए एक ओपन-सोर्स एडवर्सेरियल मशीन लर्निंग लाइब्रेरी है।

यह Python में विकसित की गई है और निष्कर्षण, व्युत्क्रमण, विषाक्तीकरण और एवेज़न हमलों तथा बचावों को लागू करती है।
ART सबसे लोकप्रिय फ्रेमवर्क का समर्थन करती है: Tensorflow, Keras, PyTorch, MxNet और ScikitLearn के साथ-साथ कई अन्य भी।
यह केवल उन मॉडलों तक सीमित नहीं है जो इनपुट के रूप में छवियों का उपयोग करते हैं, बल्कि यह अन्य प्रकार के डेटा, जैसे ऑडियो, वीडियो, सारणीबद्ध डेटा आदि का भी समर्थन करती है।
ART के साथ एडवर्सेरियल मशीन लर्निंग सीखने के लिए कार्यशाला 🇪🇸
Cleverhans एक लाइब्रेरी है जो छवि मॉडल पर एवेज़न हमले करने और डीप लर्निंग मॉडल की मजबूती का परीक्षण करने के लिए है।

यह Python में विकसित की गई है और Tensorflow, Torch और JAX फ्रेमवर्क के साथ एकीकृत होती है।
यह कई हमलों को लागू करती है, जैसे L-BFGS, FGSM, JSMA, C&W, आदि।
AI का उपयोग दुर्भावनापूर्ण कार्यों को अंजाम देने और क्लासिक हमलों को बढ़ावा देने के लिए किया जाता है।
| नाम | प्रकार | समर्थित एल्गोरिथम | समर्थित हमले के प्रकार | हमला/बचाव | समर्थित फ्रेमवर्क | लोकप्रियता |
|---|
| Cleverhans | छवि | डीप लर्निंग | एवेज़न | हमला | Tensorflow, Keras, JAX | |
| Foolbox | छवि | डीप लर्निंग | एवेज़न | हमला | Tensorflow, PyTorch, JAX | |
| ART | कोई भी प्रकार (छवि, सारणीबद्ध डेटा, ऑडियो,...) | डीप लर्निंग, SVM, LR, आदि। | कोई भी (निष्कर्षण, अनुमान, विषाक्तीकरण, एवेज़न) | दोनों | Tensorflow, Keras, Pytorch, Scikit Learn | |
| TextAttack | पाठ | डीप लर्निंग | एवेज़न | हमला | Keras, HuggingFace | |
| Advertorch | छवि | डीप लर्निंग | एवेज़न | दोनों | --- | |
| AdvBox | छवि | डीप लर्निंग | एवेज़न | दोनों | PyTorch, Tensorflow, MxNet | |
| DeepRobust | छवि, ग्राफ़ | डीप लर्निंग | एवेज़न | दोनों | PyTorch | |
| Counterfit | कोई भी | कोई भी | एवेज़न | हमला | --- | |
| Adversarial Audio Examples | ऑडियो | DeepSpeech | एवेज़न | हमला | --- |