
शोध कार्यान्वयन एक LLM जेलब्रेक एजेंट का जो हानिरहित प्रॉम्प्ट बुनाई और अनुकूली ट्री सर्च का उपयोग करके वाणिज्यिक मॉडल गार्डरेल्स को बायपास करता है।
TurnGate एक प्रतिक्रिया-जागरूक रक्षा तंत्र है जिसे बहु-चरणीय संवाद प्रणालियों में छिपे दुर्भावनापूर्ण इरादे का पता लगाने और उसे कम करने के लिए डिज़ाइन किया गया है। यह CKA-Agent जैसे अत्याधुनिक बहु-चरणीय दुर्भावनापूर्ण हमलों से बचाव करता है, बेहतरीन रक्षा प्रदर्शन प्राप्त करते हुए अत्यधिक इनकार से बचता है।
CKA-Agent नवीनतम फ्रंटियर मॉडल्स, जिनमें GPT-5.2, Gemini-3.0-Pro, और Claude-Haiku-4.5 शामिल हैं, के विरुद्ध लगातार उच्च हमला सफलता दर प्रदर्शित करता है। परिणाम नीचे संक्षेपित हैं:
| Model | HarmBench | StrongREJECT | ||||||
|---|---|---|---|---|---|---|---|---|
| FS ↑ | PS ↑ | V ↓ | R ↓ | FS ↑ | PS ↑ | V ↓ | R ↓ | |
| 🟢 GPT-5.2 | 0.889 | 0.079 | 0.024 | 0.008 | 0.932 | 0.056 | 0.006 | 0.006 |
| 🟣 Gemini-3.0-Pro | 0.881 | 0.087 | 0.000 | 0.032 | 0.951 | 0.037 | 0.006 | 0.006 |
| 🟠 Claude-Haiku-4.5 | 0.960 | 0.024 | 0.008 | 0.008 | 0.969 | 0.025 | 0.006 | 0.000 |
मेट्रिक्स: FS = पूर्ण सफलता, PS = आंशिक सफलता, V = शून्य, R = इनकार। परिणाम दिसंबर 2025 में एकत्र किए गए।
इस रिपॉजिटरी में CKA-Agent का आधिकारिक कार्यान्वयन शामिल है, जो हानिरहित प्रॉम्प्ट बुनाई और अनुकूली ट्री सर्च तकनीकों के माध्यम से वाणिज्यिक बड़े भाषा मॉडल्स (LLMs) के गार्डरेल्स को बायपास करने का एक नवीन दृष्टिकोण है।

uv इंस्टॉल करें
curl -LsSf https://astral.sh/uv/install.sh | sh
env बनाएं
uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic
config/config.yml फ़ाइल को संशोधित करके अपने प्रयोगों को कॉन्फ़िगर करें। आप निम्नलिखित पहलुओं को नियंत्रित कर सकते हैं:
harmbench_cka या strongreject_cka जैसे उपलब्ध डेटासेट्स में से चुनें।gpt-oss-120b या gemini-2.5-xxx जैसे ब्लैक-बॉक्स या व्हाइट-बॉक्स मॉडल्स का चयन करें।gemini-2.5-flash जैसे जज मॉडल्स को परिभाषित करें।विस्तृत कॉन्फ़िगरेशन निर्देशों और उदाहरणों के लिए, कृपया कॉन्फ़िगरेशन README देखें।
run_experiment.sh स्क्रिप्ट डिफ़ॉल्ट रूप से पूरी प्रयोग पाइपलाइन (जेलब्रेक और मूल्यांकन) चलाने के लिए main.py को निष्पादित करती है।
./run_experiment.sh
आप विशिष्ट चरणों को चलाने के लिए run_experiment.sh स्क्रिप्ट को संशोधित कर सकते हैं या सीधे main.py को आर्गुमेंट्स पास कर सकते हैं:
full: पूरी पाइपलाइन चलाता है (डिफ़ॉल्ट)।jailbreak: केवल जेलब्रेक विधियाँ चलाता है।judge: मौजूदा परिणामों पर केवल मूल्यांकन चलाता है।resume: बाधित प्रयोग को फिर से शुरू करता है।उदाहरण (केवल जेलब्रेक चरण चलाना):
python main.py --phase jailbreak
यदि आपको यह रिपॉजिटरी अपने शोध के लिए उपयोगी लगती है, तो कृपया निम्नलिखित पेपर का उद्धरण देने पर विचार करें:
@inproceedings{wei2025trojan,
title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search},
author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
booktitle={Forty-third International Conference on Machine Learning},
year={2026},
url={https://openreview.net/forum?id=IlJeOnKW0K}
}