#1प्रतिकूल ML हमला फ्रेमवर्क, इवेजन तकनीक और मॉडल मजबूती मूल्यांकन उपकरण।
Kitploit अनुशंसित

पाठ्य प्रतिकूल हमले के लिए एक ओपन-सोर्स पैकेज।

AI / LLM Red Team फील्ड मैनुअल & कंसल्टेंट हैंडबुक

एक संरेखण ऑडिटिंग एजेंट जो संरेखण परिकल्पना को तेजी से खोजने में सक्षम है

स्क्रिप्टेड फ्रेमवर्क 50 से अधिक MITRE ATT&CK तकनीकों का अनुकरण करने के लिए ब्लू टीम की पहचान क्षमताओं का परीक्षण करने के लिए। इसमें Python…

दूरस्थ प्रणालियों को आपस में जोड़ने के लिए एक सुव्यवस्थित FTP-संचालित कमांड और नियंत्रण मार्ग।

वेब एजेंट्स के लिए प्रॉम्प्ट इंजेक्शन डिटेक्शन का बेंचमार्किंग।

LLM जजों में रूब्रिक-प्रेरित प्राथमिकता बहाव (RIPD) के लिए शोध कोड: विकासवादी रूब्रिक खोज, बेंचमार्क-संरक्षण चयन, और DPO नीति असंरेखण मूल्यांकन।

अनुसंधान कार्यान्वयन: छलावरण दस्तावेज़ों का उपयोग करके पुनर्प्राप्ति-संवर्धित भाषा मॉडलों के विरुद्ध विषाक्तता हमला, जो फ़िल्टरिंग सुरक्षा को दरकिनार…

आक्रामक AI को कवर करने वाले उपयोगी संसाधनों की एक चुनिंदा सूची।

Red Team K8S विपक्षी अनुकरण kubectl पर आधारित

टूल-उपयोग करने वाले LLM एजेंट्स पर कंट्रोल-टोकन चेन-ऑफ-थॉट दमन और पार्सर-लीनिएंसी हमलों के लिए प्रयोग

एक प्रतिकूल सिमुलेशन करने के लिए एक सूचना सुरक्षा तैयारी उपकरण।

पर्पल-टीम टेलीमेट्री और सिमुलेशन टूलकिट।

रक्षा ढाँचा जो ऑडियो-भाषा मॉडलों को स्थिर रखता है और अनुमान के समय ऑडियो जेलब्रेक को रोकने के लिए लेट-लेयर सुरक्षा अडैप्टरों के साथ एक मध्य-परत जोखिम…

बाह्य मान, प्रतिकूल और ड्रिफ्ट पहचान के लिए एल्गोरिदम

लॉग-प्रोबेबिलिटीज़ पर हल्के व्यवहार प्रोब्स को प्रशिक्षित करके LLM संदर्भ-रिसाव हमलों का पता लगाता है, vLLM offline/server पहचान पाइपलाइनों के साथ।

स्पाइकिंग न्यूरल नेटवर्क्स पर रेट, लेटेंसी, और जिटर ट्रिगर्स का उपयोग करते हुए स्थानिक व्यवधान के बिना टेम्पोरल-ट्रिगर बैकडोर हमलों, T-Backdoor को…

ब्लैक-बॉक्स इनपुट-चरण शुद्धिकरण रक्षा जो भ्रष्टाचार, विसरण पुनर्निर्माण, और DBSCAN सर्वसम्मति मतदान के माध्यम से ऑब्जेक्ट डिटेक्टरों पर बैकडोर हमलों…