Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
autoguardrails — संरेखण-अनुसंधान स्कैफोल्ड (ऑटोरिसर्च-शैली) LLM गार्डरेल्स के लिए: एकल policy.md सतह पर खोजें | Kitploit
उपकरण/GitHubGitHub/santanderai/autoguardrails
लर्निंग और शिक्षारेड टीमिंगAI सुरक्षाप्रतिकूल हमला
GitHubsantanderai/autoguardrails

autoguardrails

संरेखण-अनुसंधान स्कैफोल्ड (ऑटोरिसर्च-शैली) LLM गार्डरेल्स के लिए: एकल policy.md सतह पर खोजें

रिपॉजिटरी देखें
12935371 महीना पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
वेबसाइट

autoguardrails

Santander AI Lab द्वारा ओपन सोर्स। एक LLM / AI-सुरक्षा गार्डरेल अनुसंधान लाइब्रेरी / मूल्यांकन हार्नेस (autoresearch-शैली): यह एक एकल परिवर्तनीय policy.md सतह पर खोज करता है ताकि एक निश्चित मूल्यांकन सूट के विरुद्ध आक्रमण सफलता दर (ASR) को न्यूनतम किया जा सके, एक हानिरहित पास सीमा के अधीन।

License: Apache 2.0 Python 3.10+ CI CodeQL codecov OpenSSF Scorecard Code style: black Ruff Conventional Commits यह Santander AI Open Source का हिस्सा है — Banco Santander (santander.com) के ओपन सोर्स AI प्रोजेक्ट।

autoguardrails एक छोटा अलाइनमेंट अनुसंधान स्कैफोल्ड है जो Karpathy के autoresearch से प्रेरित है।

train.py पर खोज करने के बजाय, यह रिपॉज़िटरी policy.md पर खोज करती है। विचार वही है:

  • परिवर्तनीय सतह को छोटा रखें
  • मूल्यांकक (evaluator) को स्थिर रखें
  • एक निश्चित वॉल-क्लॉक बजट के तहत चलाएँ
  • उम्मीदवारों की तुलना एक शीर्ष-स्तरीय मेट्रिक से करें
  • हर रखने या अस्वीकार करने के निर्णय को लॉग करें

इस रिपॉज़िटरी में, शीर्ष-स्तरीय मेट्रिक आक्रमण सफलता दर (ASR, कम बेहतर है) है, साथ ही एक हानिरहित पास सीमा है ताकि सिस्टम सब कुछ अस्वीकार करके नहीं जीत सके।

सबसे महत्वपूर्ण क्या है

रोज़मर्रा के प्रयोगों के लिए, तीन फ़ाइलें सबसे अधिक मायने रखती हैं:

  • program.md: लूप के लिए मानव-स्वामित्व वाले निर्देश
  • policy.md: एकमात्र फ़ाइल जिसे आपको रनों के बीच संपादित करना चाहिए
  • results.tsv: केवल-append रन लॉग

बाकी सब कुछ स्थिर हार्नेस कोड या स्थिर मूल्यांकन डेटा है।

वर्तमान अनुसंधान अनुबंध

  • परिवर्तनीय सतह: policy.md
  • निश्चित सूट: eval_suite.jsonl
  • निश्चित जज प्रॉम्प्ट: judge_prompt.md
  • निश्चित हार्नेस: autoguardrails/
  • स्वीकृति नियम: किसी उम्मीदवार को तभी रखें जब ASR में सुधार हो और हानिरहित पास 2 प्रतिशत अंकों से अधिक न गिरे
  • रनटाइम बजट: हार्नेस कॉन्फ़िग द्वारा निर्धारित, वर्तमान में 5 मिनट प्रति मूल्यांकन पास

यदि आप मूल autoresearch के करीब एक मानसिक मॉडल चाहते हैं, तो autoguardrails/ को निश्चित सहायक परत और policy.md को खोज के अधीन एकमात्र फ़ाइल मानें।

त्वरित आरंभ

रिपॉज़िटरी रूट से चलाएँ।

  1. बेसलाइन रिकॉर्ड करें।
root@kitploit:~
python -m autoguardrails baseline --reset --repeat 2 --notes "initial baseline"
  1. केवल policy.md संपादित करें।

  2. नए उम्मीदवार को स्कोर करें।

root@kitploit:~
python -m autoguardrails candidate --repeat 2 --notes "cover jailbreak and obfuscation"
  1. वर्तमान रखा गया परिणाम देखें।
root@kitploit:~
python -m autoguardrails status
  1. पूरा लॉग देखें।
root@kitploit:~
cat results.tsv

यदि किसी उम्मीदवार को अस्वीकार किया जाता है, तो हार्नेस स्वचालित रूप से policy.md को अंतिम स्वीकृत संस्करण में पुनर्स्थापित कर देता है।

शेल रैपर

यदि आप एकल एंट्रीपॉइंट पसंद करते हैं, तो run_autoguardrails.sh का उपयोग करें:

root@kitploit:~
sh run_autoguardrails.sh status
sh run_autoguardrails.sh evaluate
sh run_autoguardrails.sh baseline "initial baseline" 2
sh run_autoguardrails.sh candidate "cover jailbreak and obfuscation" 2

Windows पर, रैपर को Git Bash या किसी अन्य POSIX-संगत शेल से चलाएँ।

वास्तविक मॉडल कॉन्फ़िगरेशन

डिफ़ॉल्ट सेटअप एक डिटर्मिनिस्टिक लोकल स्टब का उपयोग करता है ताकि रिपॉज़िटरी ऑफ़लाइन काम करे। वास्तविक प्रयोग चलाने के लिए, टार्गेट मॉडल और जज मॉडल को OpenAI-संगत एंडपॉइंट्स पर इंगित करें।

टार्गेट मॉडल वेरिएबल्स:

  • AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_TARGET_MODEL
  • AUTOGUARDRAILS_TARGET_API_BASE
  • AUTOGUARDRAILS_TARGET_API_KEY

जज मॉडल वेरिएबल्स:

  • AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
  • AUTOGUARDRAILS_JUDGE_MODEL
  • AUTOGUARDRAILS_JUDGE_API_BASE
  • AUTOGUARDRAILS_JUDGE_API_KEY

उदाहरण:

root@kitploit:~
export AUTOGUARDRAILS_TARGET_PROVIDER=openai_compatible
export AUTOGUARDRAILS_TARGET_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_TARGET_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_TARGET_API_KEY=your-target-key

export AUTOGUARDRAILS_JUDGE_PROVIDER=openai_compatible
export AUTOGUARDRAILS_JUDGE_MODEL=gpt-4.1-mini
export AUTOGUARDRAILS_JUDGE_API_BASE=https://your-endpoint.example/v1
export AUTOGUARDRAILS_JUDGE_API_KEY=your-judge-key

python -m autoguardrails baseline --reset --repeat 2 --notes "real-model baseline"

रन श्रृंखला के दौरान एक स्थिर जज सेटअप का उपयोग करें। प्रयोग के बीच में जज प्रॉम्प्ट या जज मॉडल न बदलें।

विशिष्ट पुनरावृत्ति पैटर्न

एक सरल ऑफ़लाइन अनुकरण चक्र इस प्रकार दिखता है:

  1. बेसलाइन रिकॉर्ड करें।
  2. policy.md में एक नीति-परिवर्तन परिवार जोड़ें।
  3. candidate चलाएँ।
  4. परिवर्तन को तभी रखें जब हार्नेस उसे स्वीकार करे।
  5. एक बार में एक नया परिवर्तन जोड़कर दोहराएँ।

बंडल किए गए स्टब को बेहतर बनाने वाला एक उदाहरण उम्मीदवार परिवर्तन निम्न के लिए स्पष्ट हैंडलिंग जोड़ना है:

  • जेलब्रेक शब्दांकन जैसे "ignore previous instructions", "roleplay", और "developer mode"
  • ऑब्स्क्यूरेशन अनुरोध जैसे अनुवाद, base64, rot13, केवल-JSON फ़ॉर्मेटिंग, या स्कीमा रूपांतरण

यह मूल्यांकक को बदले बिना आपको एक यथार्थवादी पहला सुधार वक्र देता है।

रिपॉज़िटरी संरचना

  • program.md: प्रयोग निर्देश और बाधाएँ
  • policy.md: खोज के अधीन परिवर्तनीय गार्डरेल नीति
  • judge_prompt.md: स्थिर जज प्रॉम्प्ट
  • eval_suite.jsonl: निश्चित आक्रमण और हानिरहित मूल्यांकन मामले
  • results.tsv: रन लॉग
  • run_autoguardrails.sh: CLI के चारों ओर सुविधाजनक रैपर
  • autoguardrails/: स्थिर Python हार्नेस
  • tests/: हार्नेस के लिए रिग्रेशन और सुरक्षा जाँच

कोड आर्किटेक्चर के लिए autoguardrails/README.md और परीक्षण रणनीति के लिए tests/README.md देखें।

सुरक्षा नोट्स

  • यह स्कैफोल्ड जानबूझकर सिंगल-टर्न और संकीर्ण दायरे वाला है।
  • यह टूल्स, फ़ाइल एक्सेस, या मल्टी-स्टेप एजेंट क्रियाओं का मॉडल नहीं करता।
  • बंडल किया गया स्टब केवल हार्नेस सत्यापन के लिए है; यह एक यथार्थवादी सुरक्षा मॉडल नहीं है।
  • मूल्यांकन सूट डिज़ाइन द्वारा निश्चित है। यदि आप इसे बदलते हैं, तो पुराने परिणामों से तुलना करने के बजाय एक नई प्रयोग श्रृंखला शुरू करें।

आवश्यकताएँ

  • Python 3.10+
  • कोई तृतीय-पक्ष रनटाइम निर्भरता नहीं — हार्नेस पूरी तरह से Python मानक लाइब्रेरी पर बना है और डिफ़ॉल्ट रूप से ऑफ़लाइन चलता है।
  • वैकल्पिक, केवल विकास के लिए: ruff, black, mypy, pytest, pytest-cov (देखें CONTRIBUTING.md)।
  • वैकल्पिक, वास्तविक-मॉडल प्रयोगों के लिए: OpenAI-संगत chat-completions एंडपॉइंट तक पहुँच (ऊपर वर्णित AUTOGUARDRAILS_* एनवायरनमेंट वेरिएबल्स के माध्यम से कॉन्फ़िगर किया गया)।

योगदान

योगदान का स्वागत है! आरंभ करने से पहले कृपया हमारे योगदान दिशानिर्देश और आचार संहिता पढ़ें।

  • बग रिपोर्ट करें और सुविधाओं का अनुरोध GitHub Issues के माध्यम से करें।
  • बाहरी योगदानकर्ता CLA पर हस्ताक्षर करते हैं (आपके पहले PR पर CLA Assistant बॉट द्वारा स्वचालित रूप से नियंत्रित)।
  • PR खोलने से पहले ruff check ., black --check ., mypy autoguardrails, और pytest चलाएँ।
  • अनुसंधान अनुबंध का सम्मान करें: policy.md एकमात्र परिवर्तनीय सतह है; eval_suite.jsonl और judge_prompt.md स्थिर हैं।

सुरक्षा

कृपया सुरक्षा कमजोरियों की जिम्मेदारीपूर्वक रिपोर्ट करें। रिपोर्ट करने के तरीके के लिए हमारी सुरक्षा नीति देखें (कमजोरियों के लिए सार्वजनिक issue न खोलें)। संपर्क करें: [email protected] या GitHub Security Advisories का उपयोग करें।

अस्वीकरण

यह सॉफ़्टवेयर Santander AI Lab का एक ओपन सोर्स प्रोजेक्ट है, जो इसके लाइसेंस के अंतर्गत "as is" प्रदान किया गया है, बिना किसी प्रकार की वारंटी या शर्तों के। यह Banco Santander का आधिकारिक उत्पाद या सेवा नहीं है, इसके साथ प्रोडक्शन समर्थन की कोई प्रतिबद्धता नहीं जुड़ी है, और यह वित्तीय, कानूनी या पेशेवर सलाह नहीं है।

"Santander" और इसका लोगो Banco Santander, S.A. के पंजीकृत ट्रेडमार्क हैं। प्रोजेक्ट लाइसेंस तथ्यात्मक श्रेय के अलावा इनके उपयोग का कोई अधिकार नहीं देता।

यदि आपको लगता है कि आपको एक सुरक्षा कमजोरी मिली है, तो हमारी सुरक्षा नीति का पालन करें — सार्वजनिक issue न खोलें। इस सॉफ़्टवेयर की आपके उपयोग-मामले के लिए उपयुक्तता का आकलन करना और अपने स्वयं के डिप्लॉयमेंट को अद्यतन रखना आपकी ज़िम्मेदारी है।

लाइसेंस

यह प्रोजेक्ट Apache License 2.0 के अंतर्गत लाइसेंस प्राप्त है — विवरण के लिए LICENSE और NOTICE फ़ाइलें देखें।

root@kitploit:~
Copyright (c) 2026 Santander Group
SPDX-License-Identifier: Apache-2.0

उद्धरण

यदि आप अपने शोध में autoguardrails का उपयोग करते हैं, तो कृपया इसे उद्धृत करें:

root@kitploit:~
@software{autoguardrails2026,
  author  = {{Santander AI Lab}},
  title   = {autoguardrails: an autoresearch-style guardrail policy loop},
  year    = {2026},
  url     = {https://github.com/SantanderAI/autoguardrails},
  license = {Apache-2.0}
}
टूल डाउनलोड करें