
प्रॉम्प्ट इंजेक्शन हमलों से बचाव के लिए ओपन-वेट LLMs और प्रशिक्षण/मूल्यांकन कोड, साथ ही एजेंटिक टूल-कॉलिंग और निर्देश-अनुसरण सुरक्षा के लिए बेंचमार्क।
Sizhe Chen*, Arman Zharmagambetov, David Wagner, Chuan Guo* (* समान तकनीकी योगदान के लिए)
🔥 Meta-SecAlign मॉडल अब Llama समुदाय लाइसेंस के अंतर्गत व्यावसायिक उपयोग के लिए लाइसेंस प्राप्त हैं, हालांकि यह कोडबेस केवल गैर-व्यावसायिक उपयोग के लिए लाइसेंस प्राप्त है।
Meta-SecAlign-70B अंतर्निहित प्रॉम्प्ट इंजेक्शन सुरक्षा वाला पहला पूर्णतः ओपन-सोर्स व्यावसायिक-ग्रेड LLM है - जो एजेंटिक (टूल/वेब) सुरक्षा में gpt-5 और gemini-3-pro के बराबर है। हमारी SoTA प्रशिक्षण विधि आज तक के सबसे व्यापक मूल्यांकनों के आधार पर विभिन्न उपयोगिता स्कोरों पर कोई उल्लेखनीय गिरावट नहीं लाती है।
git clone --recurse-submodules https://github.com/facebookresearch/Meta_SecAlign.git
cd Meta_SecAlign
uv venv metasecalign --python 3.13
source metasecalign/bin/activate
uv pip install -r requirements.txt
uv pip install torchtune==0.6.0 --index-url https://download.pytorch.org/whl/cu126
python setup.py
data/openai_configs.yaml में OpenAI कुंजियाँ कॉन्फ़िगर करें (उपयोगिता मूल्यांकन के लिए उपयोग की जाती हैं)। उस फ़ाइल में AzureOpenAI के माध्यम से OpenAI API तक पहुँचने का एक उदाहरण है। अधिक विस्तृत उदाहरण यहाँ उपलब्ध है।data/gemini_configs.yaml में Gemini कुंजियाँ कॉन्फ़िगर करें।demo.py में हमारे दो Meta-SecAlign मॉडलों का उपयोग करने के लिए न्यूनतम कोड है। बेझिझक नए नमूने और प्रॉम्प्ट इंजेक्शन आज़माएँ, या अपने कोडबेस पर मॉडलों का परीक्षण करें:python demo.py
run_tests.py में हमारे पेपर में रिपोर्ट किए गए मूल्यांकन परिणामों को पुनः उत्पन्न करने के लिए कमांड हैं। यह क्रमिक रूप से tests.py, test_lm_eval.py, test_agentdojo.py, और test_injecagent.py को आमंत्रित करता है। परिणाम [model_path]/summary.tsv में लॉग किए जाएँगे।python run_tests.py -m [model_path] --lora_alpha [lora_alpha]
model_path परीक्षण किए गए मॉडल का पथ है। हम समर्थन करते हैं:
meta-llama/Llama-3.1-8B-Instruct_SecAlign (Meta-SecAlign-8B जो setup.py द्वारा डाउनलोड किया गया): अत्याधुनिक प्रॉम्प्ट इंजेक्शन सुरक्षा वाला पहला पूर्णतः ओपन मॉडलmeta-llama/Llama-3.3-70B-Instruct_SecAlign (Meta-SecAlign-70B जो setup.py द्वारा डाउनलोड किया गया): अत्याधुनिक प्रॉम्प्ट इंजेक्शन सुरक्षा वाला पहला पूर्णतः ओपन मॉडलmeta-llama/Llama-3.1-8B-Instructmeta-llama/Llama-3.3-70B-Instructgpt-4o-mini: पहला व्यावसायिक मॉडल जिसमें निर्देश पदानुक्रम प्रॉम्प्ट इंजेक्शन सुरक्षा है।gpt-4o: अनुवर्ती फ्लैगशिप मॉडल, जिसमें भी प्रॉम्प्ट इंजेक्शन सुरक्षा है।gpt-5: हमारे मूल्यांकन में नवीनतम और सबसे सुरक्षित व्यावसायिक मॉडल; --gpt5_reasoning_effort निर्दिष्ट करके तर्क स्तर बदलें (डिफ़ॉल्ट high है)।gemini-2.0-flash: एक Google व्यावसायिक मॉडल जिसमें दावा की गई प्रॉम्प्ट इंजेक्शन सुरक्षा हैgemini-2.5-flash: एक Google व्यावसायिक मॉडल जिसमें दावा की गई प्रॉम्प्ट इंजेक्शन सुरक्षा हैgemini-2.0-pro: एक फ्लैगशिप Google मॉडल (जिसमें प्रॉम्प्ट इंजेक्शन सुरक्षा शामिल होने का दावा नहीं है)gemini-2.5-pro: एक फ्लैगशिप Google मॉडल (जिसमें प्रॉम्प्ट इंजेक्शन सुरक्षा शामिल होने का दावा नहीं है)gemini-3-pro-preview: मजबूत प्रॉम्प्ट इंजेक्शन सुरक्षा वाला अत्याधुनिक Google मॉडलlora_alpha Meta-SecAlign मॉडलों के लिए एक परीक्षण-समय हाइपर-पैरामीटर है। यह डिफ़ॉल्ट रूप से 8 है, जो प्रशिक्षित किए गए सटीक Meta-SecAlign मॉडलों का उपयोग करता है। 0 और 8 के बीच का lora_alpha मान असुरक्षित मॉडल और हमारे सुरक्षित मॉडल के बीच इंटरपोलेट करता है ताकि एक लचीला उपयोगिता-सुरक्षा व्यापार-संतुलन संभव हो सके। lora_alpha को 8 से आगे बढ़ाना संभव है लेकिन अप्रशिक्षित है।meta-llama/Meta-Llama-3-8B-Instruct से संदर्भ प्रतिक्रियाओं की तुलना करने के लिए AlpacaEval2 प्रॉम्प्टिंग का उपयोग करते हैं)secalign_plus_plus.py हमारी प्रशिक्षण विधि, SecAlign++ का उपयोग करके meta-llama/Llama-3.1-8B-Instruct (डिफ़ॉल्ट) या meta-llama/Llama-3.3-70B-Instruct (इसे फाइन-ट्यून करने के लिए विशिष्ट पंक्ति को अनकमेंट करें) को एक मजबूत LoRA मॉडल में रक्षात्मक-फाइन-ट्यून करने के लिए कमांड प्रदान करता है।python secalign_plus_plus.py
SecAlign से महत्वपूर्ण रूप से बेहतर, Meta-SecAlign कोड का अधिकांश भाग CC-BY-NC के अंतर्गत लाइसेंस प्राप्त है। परियोजना के कुछ हिस्से अलग लाइसेंस शर्तों के अंतर्गत उपलब्ध हैं: AgentDojo, TaskTracker, और lm-evaluation-harness MIT के अंतर्गत लाइसेंस प्राप्त हैं। अन्य रिपॉज़िटरी से कोड में AgentDojo (agentdojo), TaskTracker (setup.py), और lm_eval_harness (lm_eval_config) शामिल हैं। यह सॉफ़्टवेयर और/या डेटा 2025 में BAIR Open Research Commons रिपॉज़िटरी में जमा किया गया था।