Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

फ़ीडसंपर्कगोपनीयता© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
CKA-Agent — शोध कार्यान्वयन एक LLM जेलब्रेक एजेंट का जो हानिरहित प्रॉम्प्ट बुनाई और अनुकूली ट्री सर्च का उपयोग करके वाणिज्यिक मॉडल गार्डरेल्स को बायपास करता है। | Kitploit
उपकरण/GitHubGitHub/graph-com/cka-agent
मशीन लर्निंगपेपर और शोधलर्निंग और शिक्षारेड टीमिंगAI सुरक्षाप्रतिकूल हमला
GitHubgraph-com/cka-agent

CKA-Agent

शोध कार्यान्वयन एक LLM जेलब्रेक एजेंट का जो हानिरहित प्रॉम्प्ट बुनाई और अनुकूली ट्री सर्च का उपयोग करके वाणिज्यिक मॉडल गार्डरेल्स को बायपास करता है।

रिपॉजिटरी देखें
21347154 महीने पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
वेबसाइट

[ICML 2026 और ICLR 2026 AIWILD] CKA-Agent: हानिरहित प्रॉम्प्ट बुनाई और अनुकूली ट्री सर्च के माध्यम से LLM गार्डरेल्स को बायपास करना

arXiv Website GitHub code Cite Python

🛡️ CKA के विरुद्ध रक्षा

TurnGate एक प्रतिक्रिया-जागरूक रक्षा तंत्र है जिसे बहु-चरणीय संवाद प्रणालियों में छिपे दुर्भावनापूर्ण इरादे का पता लगाने और उसे कम करने के लिए डिज़ाइन किया गया है। यह CKA-Agent जैसे अत्याधुनिक बहु-चरणीय दुर्भावनापूर्ण हमलों से बचाव करता है, बेहतरीन रक्षा प्रदर्शन प्राप्त करते हुए अत्यधिक इनकार से बचता है।

🔥 फ्रंटियर मॉडल्स पर नवीनतम परिणाम (दिसंबर 2025)

CKA-Agent नवीनतम फ्रंटियर मॉडल्स, जिनमें GPT-5.2, Gemini-3.0-Pro, और Claude-Haiku-4.5 शामिल हैं, के विरुद्ध लगातार उच्च हमला सफलता दर प्रदर्शित करता है। परिणाम नीचे संक्षेपित हैं:

Model HarmBench StrongREJECT
FS ↑ PS ↑ V ↓ R ↓ FS ↑ PS ↑ V ↓ R ↓
🟢 GPT-5.2 0.889 0.079 0.024 0.008 0.932 0.056 0.006 0.006
🟣 Gemini-3.0-Pro 0.881 0.087 0.000 0.032 0.951 0.037 0.006 0.006
🟠 Claude-Haiku-4.5 0.960 0.024 0.008 0.008 0.969 0.025 0.006 0.000

मेट्रिक्स: FS = पूर्ण सफलता, PS = आंशिक सफलता, V = शून्य, R = इनकार। परिणाम दिसंबर 2025 में एकत्र किए गए।

अवलोकन

इस रिपॉजिटरी में CKA-Agent का आधिकारिक कार्यान्वयन शामिल है, जो हानिरहित प्रॉम्प्ट बुनाई और अनुकूली ट्री सर्च तकनीकों के माध्यम से वाणिज्यिक बड़े भाषा मॉडल्स (LLMs) के गार्डरेल्स को बायपास करने का एक नवीन दृष्टिकोण है।

CKA-Agent

पर्यावरण सेटअप

uv इंस्टॉल करें

curl -LsSf https://astral.sh/uv/install.sh | sh

env बनाएं

uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic

प्रयोग कॉन्फ़िगरेशन

config/config.yml फ़ाइल को संशोधित करके अपने प्रयोगों को कॉन्फ़िगर करें। आप निम्नलिखित पहलुओं को नियंत्रित कर सकते हैं:

  1. टेस्ट डेटासेट: harmbench_cka या strongreject_cka जैसे उपलब्ध डेटासेट्स में से चुनें।
  2. लक्ष्य मॉडल्स: gpt-oss-120b या gemini-2.5-xxx जैसे ब्लैक-बॉक्स या व्हाइट-बॉक्स मॉडल्स का चयन करें।
  3. जेलब्रेक विधियाँ: विभिन्न कार्यान्वित बेसलाइन विधियों को सक्षम और कॉन्फ़िगर करें।
  4. मूल्यांकन: मूल्यांकन मेट्रिक्स और gemini-2.5-flash जैसे जज मॉडल्स को परिभाषित करें।
  5. रक्षा विधियाँ: आवश्यकतानुसार विभिन्न रक्षा तंत्रों को लागू करें।

विस्तृत कॉन्फ़िगरेशन निर्देशों और उदाहरणों के लिए, कृपया कॉन्फ़िगरेशन README देखें।

प्रयोग चलाना

run_experiment.sh स्क्रिप्ट डिफ़ॉल्ट रूप से पूरी प्रयोग पाइपलाइन (जेलब्रेक और मूल्यांकन) चलाने के लिए main.py को निष्पादित करती है।

./run_experiment.sh

आप विशिष्ट चरणों को चलाने के लिए run_experiment.sh स्क्रिप्ट को संशोधित कर सकते हैं या सीधे main.py को आर्गुमेंट्स पास कर सकते हैं:

  • full: पूरी पाइपलाइन चलाता है (डिफ़ॉल्ट)।
  • jailbreak: केवल जेलब्रेक विधियाँ चलाता है।
  • judge: मौजूदा परिणामों पर केवल मूल्यांकन चलाता है।
  • resume: बाधित प्रयोग को फिर से शुरू करता है।

उदाहरण (केवल जेलब्रेक चरण चलाना):

python main.py --phase jailbreak

उद्धरण

यदि आपको यह रिपॉजिटरी अपने शोध के लिए उपयोगी लगती है, तो कृपया निम्नलिखित पेपर का उद्धरण देने पर विचार करें:

@inproceedings{wei2025trojan,
      title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search}, 
      author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
    booktitle={Forty-third International Conference on Machine Learning},
    year={2026},
    url={https://openreview.net/forum?id=IlJeOnKW0K}
}
टूल डाउनलोड करें