Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
उपकरण/GitHubGitHub/facebookresearch/meta_secalign
रक्षात्मक उपकरणमशीन लर्निंगपेपर और शोधलर्निंग और शिक्षाAI सुरक्षाप्रतिकूल हमला
GitHubfacebookresearch/meta_secalign

Meta_SecAlign

प्रॉम्प्ट इंजेक्शन हमलों से बचाव के लिए ओपन-वेट LLMs और प्रशिक्षण/मूल्यांकन कोड, साथ ही एजेंटिक टूल-कॉलिंग और निर्देश-अनुसरण सुरक्षा के लिए बेंचमार्क।

रिपॉजिटरी देखें
711843 महीने पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

Meta SecAlign: प्रॉम्प्ट इंजेक्शन हमलों के विरुद्ध एक सुरक्षित फाउंडेशन LLM

Sizhe Chen*, Arman Zharmagambetov, David Wagner, Chuan Guo* (* समान तकनीकी योगदान के लिए)

🔥 Meta-SecAlign मॉडल अब Llama समुदाय लाइसेंस के अंतर्गत व्यावसायिक उपयोग के लिए लाइसेंस प्राप्त हैं, हालांकि यह कोडबेस केवल गैर-व्यावसायिक उपयोग के लिए लाइसेंस प्राप्त है।

Meta-SecAlign-70B अंतर्निहित प्रॉम्प्ट इंजेक्शन सुरक्षा वाला पहला पूर्णतः ओपन-सोर्स व्यावसायिक-ग्रेड LLM है - जो एजेंटिक (टूल/वेब) सुरक्षा में gpt-5 और gemini-3-pro के बराबर है। हमारी SoTA प्रशिक्षण विधि आज तक के सबसे व्यापक मूल्यांकनों के आधार पर विभिन्न उपयोगिता स्कोरों पर कोई उल्लेखनीय गिरावट नहीं लाती है।

पर्यावरण सेटअप

  • हार्डवेयर आवश्यकताएँ: Meta-SecAlign-8B को प्रशिक्षण के लिए 4×80 GB A100s और मूल्यांकन के लिए एक 16 GB GPU की आवश्यकता होती है। Meta-SecAlign-70B को प्रशिक्षण के लिए 8×141 GB H200s और मूल्यांकन के लिए 4 (दक्षता के लिए हम 8 की सलाह देते हैं) 80 GB A100s की आवश्यकता होती है।
  • uv (एक Python पैकेज प्रबंधन टूल) इंस्टॉल करें।
  • Meta-SecAlign पैकेज निर्भरताएँ इंस्टॉल करें:

git clone --recurse-submodules https://github.com/facebookresearch/Meta_SecAlign.git
cd Meta_SecAlign
uv venv metasecalign --python 3.13
source metasecalign/bin/activate
uv pip install -r requirements.txt
uv pip install torchtune==0.6.0 --index-url https://download.pytorch.org/whl/cu126

  • Meta-SecAlign डेटा निर्भरताएँ इंस्टॉल करें (यदि आपके पास GPU उपलब्ध है तो SEP उपयोगिता मूल्यांकन के लिए उपयोग की जाने वाली निर्भरताएँ भी शामिल हैं):

python setup.py

  • data/openai_configs.yaml में OpenAI कुंजियाँ कॉन्फ़िगर करें (उपयोगिता मूल्यांकन के लिए उपयोग की जाती हैं)। उस फ़ाइल में AzureOpenAI के माध्यम से OpenAI API तक पहुँचने का एक उदाहरण है। अधिक विस्तृत उदाहरण यहाँ उपलब्ध है।
  • [वैकल्पिक] यदि आप Gemini मॉडल का मूल्यांकन करना चाहते हैं तो data/gemini_configs.yaml में Gemini कुंजियाँ कॉन्फ़िगर करें।

डेमो

  • demo.py में हमारे दो Meta-SecAlign मॉडलों का उपयोग करने के लिए न्यूनतम कोड है। बेझिझक नए नमूने और प्रॉम्प्ट इंजेक्शन आज़माएँ, या अपने कोडबेस पर मॉडलों का परीक्षण करें:

python demo.py

मूल्यांकन

  • run_tests.py में हमारे पेपर में रिपोर्ट किए गए मूल्यांकन परिणामों को पुनः उत्पन्न करने के लिए कमांड हैं। यह क्रमिक रूप से tests.py, test_lm_eval.py, test_agentdojo.py, और test_injecagent.py को आमंत्रित करता है। परिणाम [model_path]/summary.tsv में लॉग किए जाएँगे।

python run_tests.py -m [model_path] --lora_alpha [lora_alpha]

  • model_path परीक्षण किए गए मॉडल का पथ है। हम समर्थन करते हैं:
    • स्थानीय मॉडल (vLLM अनुमान)
      • meta-llama/Llama-3.1-8B-Instruct_SecAlign (Meta-SecAlign-8B जो setup.py द्वारा डाउनलोड किया गया): अत्याधुनिक प्रॉम्प्ट इंजेक्शन सुरक्षा वाला पहला पूर्णतः ओपन मॉडल
      • meta-llama/Llama-3.3-70B-Instruct_SecAlign (Meta-SecAlign-70B जो setup.py द्वारा डाउनलोड किया गया): अत्याधुनिक प्रॉम्प्ट इंजेक्शन सुरक्षा वाला पहला पूर्णतः ओपन मॉडल
      • meta-llama/Llama-3.1-8B-Instruct
      • meta-llama/Llama-3.3-70B-Instruct
      • अन्य Hugging Face ओपन-वेट मॉडल भी मूल रूप से समर्थित हो सकते हैं।
    • OpenAI GPT मॉडल
      • gpt-4o-mini: पहला व्यावसायिक मॉडल जिसमें निर्देश पदानुक्रम प्रॉम्प्ट इंजेक्शन सुरक्षा है।
      • gpt-4o: अनुवर्ती फ्लैगशिप मॉडल, जिसमें भी प्रॉम्प्ट इंजेक्शन सुरक्षा है।
      • gpt-5: हमारे मूल्यांकन में नवीनतम और सबसे सुरक्षित व्यावसायिक मॉडल; --gpt5_reasoning_effort निर्दिष्ट करके तर्क स्तर बदलें (डिफ़ॉल्ट high है)।
    • Google Gemini मॉडल
      • gemini-2.0-flash: एक Google व्यावसायिक मॉडल जिसमें दावा की गई प्रॉम्प्ट इंजेक्शन सुरक्षा है
      • gemini-2.5-flash: एक Google व्यावसायिक मॉडल जिसमें दावा की गई प्रॉम्प्ट इंजेक्शन सुरक्षा है
      • gemini-2.0-pro: एक फ्लैगशिप Google मॉडल (जिसमें प्रॉम्प्ट इंजेक्शन सुरक्षा शामिल होने का दावा नहीं है)
      • gemini-2.5-pro: एक फ्लैगशिप Google मॉडल (जिसमें प्रॉम्प्ट इंजेक्शन सुरक्षा शामिल होने का दावा नहीं है)
      • gemini-3-pro-preview: मजबूत प्रॉम्प्ट इंजेक्शन सुरक्षा वाला अत्याधुनिक Google मॉडल
  • [वैकल्पिक] lora_alpha Meta-SecAlign मॉडलों के लिए एक परीक्षण-समय हाइपर-पैरामीटर है। यह डिफ़ॉल्ट रूप से 8 है, जो प्रशिक्षित किए गए सटीक Meta-SecAlign मॉडलों का उपयोग करता है। 0 और 8 के बीच का lora_alpha मान असुरक्षित मॉडल और हमारे सुरक्षित मॉडल के बीच इंटरपोलेट करता है ताकि एक लचीला उपयोगिता-सुरक्षा व्यापार-संतुलन संभव हो सके। lora_alpha को 8 से आगे बढ़ाना संभव है लेकिन अप्रशिक्षित है।
  • हम समुदाय के लिए निम्नलिखित प्रॉम्प्ट-इंजेक्शन बेंचमार्क मूल्यांकनों का समर्थन करते हैं:
    • 6 सुरक्षा बेंचमार्क
      • निर्देश पालन: AlpacaFarm-Hacked, SEP, TaskTracker, CyberSecEval2
      • एजेंटिक टूल-कॉलिंग: InjecAgent, AgentDojo
    • 8 उपयोगिता बेंचमार्क
      • सामान्य ज्ञान (lm_eval से): MMLU, MMLU-Pro, BBH, IFEval, GPQA Diamond
      • निर्देश पालन: AlpacaEval2, SEP (SEP में, हम meta-llama/Meta-Llama-3-8B-Instruct से संदर्भ प्रतिक्रियाओं की तुलना करने के लिए AlpacaEval2 प्रॉम्प्टिंग का उपयोग करते हैं)
      • एजेंटिक टूल-कॉलिंग: AgentDojo

रक्षात्मक फाइन-ट्यूनिंग (SecAlign++)

  • secalign_plus_plus.py हमारी प्रशिक्षण विधि, SecAlign++ का उपयोग करके meta-llama/Llama-3.1-8B-Instruct (डिफ़ॉल्ट) या meta-llama/Llama-3.3-70B-Instruct (इसे फाइन-ट्यून करने के लिए विशिष्ट पंक्ति को अनकमेंट करें) को एक मजबूत LoRA मॉडल में रक्षात्मक-फाइन-ट्यून करने के लिए कमांड प्रदान करता है।

python secalign_plus_plus.py

कोड आभार

SecAlign से महत्वपूर्ण रूप से बेहतर, Meta-SecAlign कोड का अधिकांश भाग CC-BY-NC के अंतर्गत लाइसेंस प्राप्त है। परियोजना के कुछ हिस्से अलग लाइसेंस शर्तों के अंतर्गत उपलब्ध हैं: AgentDojo, TaskTracker, और lm-evaluation-harness MIT के अंतर्गत लाइसेंस प्राप्त हैं। अन्य रिपॉज़िटरी से कोड में AgentDojo (agentdojo), TaskTracker (setup.py), और lm_eval_harness (lm_eval_config) शामिल हैं। यह सॉफ़्टवेयर और/या डेटा 2025 में BAIR Open Research Commons रिपॉज़िटरी में जमा किया गया था।

टूल डाउनलोड करें