Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
batch_jailbreak — इस रिपॉज़िटरी में पेपर "[Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting]" का आधिकारिक कार्यान्वयन शामिल है | Kitploit
उपकरण/GitHubGitHub/96kihyun/batch_jailbreak
मशीन लर्निंगपेपर और शोधलर्निंग और शिक्षाAI सुरक्षाप्रतिकूल हमला
GitHub96kihyun/batch_jailbreak

batch_jailbreak

इस रिपॉज़िटरी में पेपर "[Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting]" का आधिकारिक कार्यान्वयन शामिल है

रिपॉजिटरी देखें
5 दिन पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
वेबसाइट

बैच में सुरक्षा? बैच प्रॉम्प्टिंग में सुरक्षा विफलताओं को समझना और कम करना के लिए आधिकारिक रेपो

Kihyun Kim, Hee-Seon Kim, Wonjun Lee, Changick Kim

Korea Advanced Institute of Science and Technology (KAIST)

arXiv

समाचार

  • 2026.09 हमारा पेपर AACL-IJCNLP 2026 (Main) में स्वीकृत हो गया है! 🎉
  • 2026.08 पेपर arXiv पर उपलब्ध है!
  • 2026.08 कोड जारी कर दिया गया है!

अवलोकन

बैच प्रॉम्प्टिंग एक व्यावहारिक इन्फरेंस रणनीति है जो कई क्वेरीज़ को एक ही कॉल में पैक करती है। हम दिखाते हैं कि उपयोगिता के लिए इसकी सफलता सुरक्षा तक नहीं बढ़ती: एक हानिकारक प्रश्न जिसे अकेले में विश्वसनीय रूप से अस्वीकार किया जाता है, वह बेनाइन प्रश्नों के बैच में एम्बेड किए जाने पर हानिकारक प्रतिक्रिया उत्पन्न कर सकता है।

यह रिपॉज़िटरी निम्नलिखित के लिए आधिकारिक कोड प्रदान करती है:

  1. बैच-प्रॉम्प्ट हमला डेटा उत्पन्न करना
  2. ओपन-सोर्स मॉडल (Phi / Llama / Qwen) और कमर्शियल API (GPT / Gemini / Claude) पर इन्फरेंस चलाना
  3. LlamaGuard-4, WildGuard, और Beaver-Dam के एन्सेम्बल के साथ हमले की सफलता का मूल्यांकन करना

तैयारी

  1. इस रिपॉज़िटरी को क्लोन करें।
root@kitploit:~
git clone https://github.com/96kihyun/batch_jailbreak.git
cd batch_jailbreak
  1. पर्यावरण सेटअप
root@kitploit:~
conda create -n batch python=3.10 -y
conda activate batch
pip install -r requirements.txt

लोकल मॉडल इन्फरेंस और तीन जज मॉडल के लिए GPU आवश्यक है। Python 3.10 + PyTorch 2.4 + transformers==5.2 के साथ परीक्षण किया गया।

नोट: src/evaluate/llamaguard4/ में LlamaGuard-4 (Llama4ForConditionalGeneration) के लिए transformers की एक वेंडर की गई प्रति शामिल है। इसे sys.path में केवल तब जोड़ा जाता है जब LlamaGuard लोड हो रहा हो।

  1. मॉडल / API कुंजियाँ रजिस्टर करें

configs/models.yaml को लोकल HuggingFace चेकपॉइंट पथों (जनरेटर + जज) के साथ संपादित करें, और configs/api.yaml में API कुंजियाँ सेट करें (या env वेरिएबल्स OPENAI_API_KEY / GEMINI_API_KEY / ANTHROPIC_API_KEY / HF_TOKEN के माध्यम से)।

आवश्यक डेटा और मॉडल

  • बेनाइन फिलर: data/context_dataset/gsm8k.jsonl (प्रत्येक पंक्ति में एक "question" कुंजी होती है)
  • हानिकारक डेटासेट (स्वतः-डाउनलोड): JailbreakBench/JBB-Behaviors, walledai/StrongREJECT
  • जनरेटर: Phi-4 / Llama-3.1-8B-Instruct / Qwen3-8B
  • जज: Llama-Guard-4-12B, PKU-Alignment/beaver-dam-7b, allenai/wildguard

बैच-प्रॉम्प्ट डेटा उत्पन्न करना

डिफ़ॉल्ट: --harmful_dataset JBB, बैच आकार n = 1..10, 313 नमूने। बेनाइन स्लॉट GSM8K (single_math) से भरे जाते हैं।

root@kitploit:~
python -m src.utils.generate_batch_question_prompt

आउटपुट data/batch_prompt/single_math/{n}/pos_{k}.jsonl के अंतर्गत लिखे जाते हैं।

उपयोगी फ़्लैग

इन्फरेंस चलाना

ओपन-सोर्स मॉडल (Phi / Llama / Qwen)

root@kitploit:~
python scripts/inference/run_inference_batch_prompt.py \
  --model_name qwen \
  --case single_math --n 9 --pos 2 \
  --harmful_dataset JBB

(model, case, batch_size, pos) पर बैच्ड स्वीप:

root@kitploit:~
bash scripts/inference/run_inference_batch_prompt_eval.sh \
  --dataset jbb --gpu_id 0 \
  --models phi qwen --cases single_math \
  --batch_sizes 12 --pos_values 1 2

कमर्शियल API (GPT / Gemini / Claude)

root@kitploit:~
python scripts/inference/run_inference_api.py \
  --api gpt \
  --input_file data/batch_prompt_jbb/single_math/12/pos_2.jsonl \
  --model_name gpt --output_subdir batch_prompt_jbb/single_math/12/pos_2 \
  --harmful_dataset JBB --extract_pos 2

आउटपुट result/inference/<model>/... के अंतर्गत {prompt, response} जोड़ों के साथ JSONL के रूप में सहेजे जाते हैं।

हमले की सफलता का मूल्यांकन

प्रत्येक प्रतिक्रिया को LlamaGuard-4, WildGuard, और Beaver-Dam द्वारा स्कोर किया जाता है, फिर बहुमत मत द्वारा संयोजित किया जाता है:

root@kitploit:~
python scripts/eval/run_ensemble.py \
  --input_file result/inference/qwen/batch_prompt_jbb/single_math/12/qwen_single_math_n12_pos_2_response.jsonl \
  --output_dir result/evaluation/batch_prompt_jbb/qwen/single_math/12/pos_2

आप इन्फरेंस के समान लूप में मूल्यांकन भी चला सकते हैं:

root@kitploit:~
bash scripts/inference/run_inference_batch_prompt_eval.sh \
  --dataset jbb --gpu_id 0 \
  --models qwen --cases single_math \
  --batch_sizes 12 --pos_values 2 \
  --conda_env batch

त्वरित शुरुआत (स्मोक रन)

root@kitploit:~
# 1. data
python -m src.utils.generate_batch_question_prompt \
  --harmful_dataset JBB --min_n 12 --max_n 12 --num_samples 100

# 2. inference
python scripts/inference/run_inference_batch_prompt.py \
  --model_name llama --case single_math --n 12 --pos 2 --harmful_dataset JBB

# 3. evaluation
python scripts/eval/run_ensemble.py \
  --input_file result/inference/llama/batch_prompt/llama_single_math_n12_pos_2_response.jsonl

उद्धरण

यदि हमारा कार्य आपके शोध में सहायक हो, तो कृपया हमारे पेपर का उद्धरण देने पर विचार करें।

root@kitploit:~
@article{kim2026safety,
  title={Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting},
  author={Kim, Kihyun and Kim, HeeSeon and Lee, Wonjun and Kim, Changick},
  journal={arXiv preprint arXiv:2608.02681},
  year={2026}
}

संपर्क

हमारे पेपर या कोड के बारे में किसी भी प्रश्न के लिए, कृपया [email protected] पर ईमेल करें।

टूल डाउनलोड करें
FlagDefaultDescription
--harmful_datasetJBBJBB या StrongREJECT
--min_n / --max_n1 / 10बैच आकार N की समावेशी सीमा
--num_samples313हानिकारक प्रॉम्प्ट की संख्या
--seed42RNG सीड
--output_dir./data/batch_promptआउटपुट रूट