#1प्रतिकूल ML हमला फ्रेमवर्क, इवेजन तकनीक और मॉडल मजबूती मूल्यांकन उपकरण।
Kitploit अनुशंसित

जेमिनी - प्रोडक्शन LLM रनटाइम अलाइनमेंट कॉन्टेक्स्ट इंजेक्शन
LLM जेलब्रेक प्रॉम्प्ट्स और बायपास तकनीकों का क्यूरेटेड संग्रह, जो AI मॉडल सुरक्षा गार्डरेल्स को बायपास करने वाले एडवर्सेरियल इनपुट्स का…

एडवर्सेरियल इमेज परटर्बेशन टूल जो सुरक्षा अनुसंधान के लिए AI-आधारित स्कैम इमेज क्लासिफायर से बचने हेतु SAM सेगमेंटेशन और CLIP मॉडल का उपयोग करता है।

Red Teaming होम लैब के लिए बिल्ड गाइड। Proxmox और pfSense में GOAD लैब सेटअप, Operator/C2 और Redirectors।

एक AD लैब के विरुद्ध स्वचालित adversary emulation (Caldera) Sigma डिटेक्शन कवरेज को मान्य करने और परिणामों को MITRE ATT&CK पर मैप करने के लिए।

सार्वजनिक रूप से रिपोर्ट की गई prompt-injection तकनीकों का ट्रैकर, जिसे डिलीवरी विधि, एन्कोडिंग, और प्रसार व्यवहार के आधार पर विभाजित किया गया है,…

स्पाइकिंग न्यूरल नेटवर्क्स पर रेट, लेटेंसी, और जिटर ट्रिगर्स का उपयोग करते हुए स्थानिक व्यवधान के बिना टेम्पोरल-ट्रिगर बैकडोर हमलों, T-Backdoor को…

रक्षा ढाँचा जो ऑडियो-भाषा मॉडलों को स्थिर रखता है और अनुमान के समय ऑडियो जेलब्रेक को रोकने के लिए लेट-लेयर सुरक्षा अडैप्टरों के साथ एक मध्य-परत जोखिम…

क्लाइंट-साइड पर JavaScript के माध्यम से फ़ाइलों को एम्बेड और पुनर्निर्मित करने वाले HTML स्मगलिंग पेज जनरेट करता है, जिसमें पेलोड एन्कोडिंग, चंकिंग,…

ब्लैक-बॉक्स इनपुट-चरण शुद्धिकरण रक्षा जो भ्रष्टाचार, विसरण पुनर्निर्माण, और DBSCAN सर्वसम्मति मतदान के माध्यम से ऑब्जेक्ट डिटेक्टरों पर बैकडोर हमलों…

वेब एजेंट्स के लिए प्रॉम्प्ट इंजेक्शन डिटेक्शन का बेंचमार्किंग।

टूल-उपयोग करने वाले LLM एजेंट्स पर कंट्रोल-टोकन चेन-ऑफ-थॉट दमन और पार्सर-लीनिएंसी हमलों के लिए प्रयोग

फाइन-ट्यून किए गए LLM क्लासिफायर में एकल KV-कैश बिट को फ्लिप करने वाले ग्रे-बॉक्स ट्रोजन हमले के लिए शोध कोड, जो प्रति-क्लास हमले की सफलता दर को…

टूल-एकीकृत LLM एजेंटों को प्रतिकूल हमलों से बचाने के लिए शोध कोड और प्रयोग, जिसमें नई रक्षा रणनीतियों और हमला परिदृश्यों के साथ Agent Security Bench…

Syntactic Ghost: पूर्व-प्रशिक्षित भाषा मॉडलों पर एक अगोचर सामान्य-उद्देश्य बैकडोर हमला

मल्टी-टर्न LLM जेलब्रेक प्रयोगों (FITD, MRCJ, ActorAttack, X-Teaming) को पुन: उत्पन्न करने वाला शोध कोड, SoK इंटेंट-उन्मुख व्यवस्थितकरण पेपर से।

LLM जजों में रूब्रिक-प्रेरित प्राथमिकता बहाव (RIPD) के लिए शोध कोड: विकासवादी रूब्रिक खोज, बेंचमार्क-संरक्षण चयन, और DPO नीति असंरेखण मूल्यांकन।

इस रिपॉज़िटरी में पेपर "[Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting]" का आधिकारिक कार्यान्वयन शामिल है