Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
AutoRAN-public | Kitploit
उपकरण/GitHubGitHub/jackpurcell/autoran-public
शोषणपेपर और शोधरेड टीमिंगAI सुरक्षाप्रतिकूल हमला
GitHubjackpurcell/autoran-public

AutoRAN-public

रिपॉजिटरी देखें
11110 महीने पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

🧠 AutoRAN: बड़े रीज़निंग मॉडल्स में सुरक्षा तर्क का स्वचालित अपहरण

AutoRAN एक स्वचालित सुरक्षा-तर्क अपहरण (Hijacking of Safety Reasoning) तकनीक है, जो कम-संरेखित (द्वितीयक) सहायक मॉडलों का लाभ उठाकर तर्क-निशानों (reasoning traces) का अनुकरण करती है, कथात्मक प्रॉम्प्ट उत्पन्न करती है, और आधुनिक बड़े रीज़निंग मॉडल्स (LRMs) में सुरक्षा तर्क को बायपास करने के लिए उन प्रॉम्प्ट्स को पुनरावृत्त रूप से परिष्कृत करती है।

AutoRAN अवलोकन

⚠️ अस्वीकरण: यह रिपॉजिटरी केवल नियंत्रित सुरक्षा अनुसंधान और AI सुरक्षा रेड-टीमिंग के लिए है।

🔍 प्रमुख विशेषताएँ

  • ⚙️ पुनरावृत्त प्रॉम्प्ट परिशोधन के माध्यम से स्वचालित मल्टी-टर्न जेलब्रेक
  • 🧩 कथात्मक टेम्पलेट्स जो दुर्भावनापूर्ण लक्ष्यों को प्रशंसनीय शैक्षिक/नैतिक बहानों के रूप में प्रस्तुत करते हैं
  • 🔁 परिशोधन रणनीतियाँ जो प्रॉम्प्ट्स को विकसित करने के लिए मध्यवर्ती तर्क-निशानों का उपयोग करती हैं
  • 📈 वाणिज्यिक LRMs में लगभग 100% हमला सफलता दर
  • 🔬 AdvBench, HarmBench और StrongReject पर मूल्यांकित

🛠️ विधि अवलोकन

AutoRAN तीन-चरणीय पाइपलाइन का अनुसरण करता है:

  1. तर्क का अनुकरण करें: पीड़ित मॉडल की उच्च-स्तरीय CoT संरचना की नकल करने के लिए एक कमजोर मॉडल का उपयोग करें
  2. प्रॉम्प्ट उत्पन्न करें: अनुकरणित तर्क का उपयोग करके एक कथात्मक टेम्पलेट भरें
  3. प्रॉम्प्ट परिष्कृत करें: मध्यवर्ती तर्क और सुरक्षा अस्वीकृति पैटर्न के आधार पर समायोजित करें

AutoRAN पाइपलाइन

📊 परिणाम

हमला प्रदर्शन

📁 प्रयोग रिकॉर्ड्स

आप /records निर्देशिका में लॉग्स और परिणाम पा सकते हैं। उदाहरण के लिए:

root@kitploit:~
ls -lh records/

🚀 त्वरित प्रारंभ: डेमो

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Edit the attack prompt in demo.py as needed
python demo.py

# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.

🚀 संपूर्ण प्रयोग वर्कफ़्लो

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Run the main experiment script
python main.py

🧷 अस्वीकरण

यह कोड केवल शोध और शैक्षिक उद्देश्यों के लिए जारी किया गया है। इसका उद्देश्य LLMs में सुरक्षा कमजोरियों के जिम्मेदार मूल्यांकन का समर्थन करना है। इस कोड का उपयोग वास्तविक-विश्व प्रणालियों को निशाना बनाने या नियंत्रित वातावरण के बाहर हानिकारक आउटपुट उत्पन्न करने के लिए न करें।

📚 उद्धरण

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
टूल डाउनलोड करें