Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
Log in
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

फ़ीडसंपर्कगोपनीयता© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
redteam-ai-benchmark — रेड टीम AI बेंचमार्क: अधिकृत आपत्तिजनक-सुरक्षा कार्यों के लिए LLMs का मूल्यांकन करना। Red Team AI Benchmark एक CLI मॉडल-मूल्यांकन बेंचमार्क है। यह मापता है कि LLMs रेड-टीम प्रश्नों और सुरक्षा परिदृश्यों को कैसे समझते हैं और उनका जवाब देते हैं; यह उन गतिविधियों को करने के लिए कोई उपकरण नहीं है। संस्करण 2 उत्तरों को केवल एक सुनहरे प्रतिक्रिया के विरुद्ध आंकने के बजाय एक रूब्रिक-आधारित डेटासेट का उपयोग करता है। | Kitploit
उपकरण/GitLabGitLab/toxy4ny/redteam-ai-benchmark
पेनिट्रेशन टेस्टिंगमशीन लर्निंगलर्निंग और शिक्षारेड टीमिंगAI सुरक्षालैब और अभ्यास
GitLabtoxy4ny/redteam-ai-benchmark

redteam-ai-benchmark

रिपॉजिटरी देखें
2212 महीने पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →

विवरण

रेड टीम AI बेंचमार्क: अधिकृत आपत्तिजनक-सुरक्षा कार्यों के लिए LLMs का मूल्यांकन करना। Red Team AI Benchmark एक CLI मॉडल-मूल्यांकन बेंचमार्क है। यह मापता है कि LLMs रेड-टीम प्रश्नों और सुरक्षा परिदृश्यों को कैसे समझते हैं और उनका जवाब देते हैं; यह उन गतिविधियों को करने के लिए कोई उपकरण नहीं है। संस्करण 2 उत्तरों को केवल एक सुनहरे प्रतिक्रिया के विरुद्ध आंकने के बजाय एक रूब्रिक-आधारित डेटासेट का उपयोग करता है।

साझा करें

रेड टीम AI बेंचमार्क

रूसी संस्करण: README.ru.md

रेड टीम AI बेंचमार्क एक CLI मॉडल-मूल्यांकन बेंचमार्क है। यह मापता है कि LLM रेड-टीम प्रश्नों और सुरक्षा परिदृश्यों को कैसे समझते हैं और उनका जवाब देते हैं; यह उन गतिविधियों को करने का उपकरण नहीं है। संस्करण 2 केवल एक स्वर्ण प्रतिक्रिया के विरुद्ध उत्तरों का मूल्यांकन करने के बजाय एक रूब्रिक-आधारित डेटासेट का उपयोग करता है।

डिफ़ॉल्ट v2 सूट में datasets/v2/benchmark.jsonl में 60 प्रश्न हैं, जो डोमेन और कठिनाई के अनुसार समूहित हैं।

रिपॉजिटरी स्थिति

मूल GitHub रिपॉजिटरी अब उपलब्ध नहीं है; इसके मालिक के रूप में, मुझे GitHub प्लेटफ़ॉर्म से प्रतिबंधित कर दिया गया था। परियोजना के लिए एक वैकल्पिक दर्पण रिपॉजिटरी (प्रमुख योगदानकर्ता और सह-लेखक द्वारा अनुरक्षित) https://github.com/szybnev/redteam-ai-benchmark पर उपलब्ध है। इस रिपॉजिटरी का वर्तमान मालिक इसका सक्रिय डेवलपर और अनुरक्षक है।

उद्देश्य और दायरा

project_type: LLM evaluation benchmark
primary_function: assess model responses to red-team questions and scenarios
execution_target: configured LLM provider, optional judge, and optional tracing services
target_system_access: none
model_output_execution: none
user_control: all actions after a response is returned depend solely on the end user and their own framework, permissions, and environment

स्पष्ट गैर-लक्ष्य

  • यह रिपॉजिटरी हैकिंग टूल, एक्सप्लॉइट फ्रेमवर्क, स्कैनर, C2, पर्सिस्टेंस टूल, पेलोड रनर या स्वायत्त रेड-टीम एजेंट नहीं है।
  • यह लक्ष्य प्रणालियों की खोज, उपयोग, शोषण, संशोधन या उन तक पहुंच बनाए रखने का कार्य नहीं करता।
  • यह मॉडल आउटपुट निष्पादित नहीं करता। बेंचमार्क केवल कॉन्फ़िगर किए गए मॉडल एंडपॉइंट्स पर मूल्यांकन प्रॉम्प्ट भेजता है, लौटाए गए टेक्स्ट को स्कोर करता है, और परिणाम लिखता है।
  • परीक्षण डेटासेट में आक्रामक-सुरक्षा विषयों की उपस्थिति मूल्यांकन डोमेन का वर्णन करती है; यह किसी भी प्रणाली के विरुद्ध गतिविधि के लिए अनुमति या प्राधिकरण प्रदान नहीं करती।

उपयोगकर्ता की जिम्मेदारी

बेंचमार्क मूल्यांकन रन के बाहर किसी भी गतिविधि को अधिकृत, निर्देशित या नियंत्रित नहीं करता। मॉडल प्रतिक्रियाओं का कोई भी डाउनस्ट्रीम उपयोग, जिसमें एक अलग एजेंट या ऑटोमेशन फ्रेमवर्क के माध्यम से उपयोग शामिल है, पूरी तरह से अंतिम उपयोगकर्ता, उनके कॉन्फ़िगरेशन, अनुमतियों और वातावरण पर निर्भर करता है। डेटासेट और परिणामों का उपयोग केवल अधिकृत मूल्यांकन, अनुसंधान, परीक्षण या शिक्षा के लिए करें।

image

प्रकाशित लीडरबोर्ड

इस शाखा में कोई वर्तमान लीडरबोर्ड प्रकाशित नहीं है। ऐतिहासिक स्कोर पुराने शाब्दिक और आंशिक-न्यायाधीश शब्दार्थ के साथ उत्पन्न किए गए थे और वर्तमान स्कोरर से तुलनीय नहीं हैं।

एक प्रकाशनीय लीडरबोर्ड के लिए मिलान डेटासेट हैश, शून्य न्यायाधीश त्रुटियां और पूर्ण कवरेज के साथ एक पूर्ण न्यायाधीश पास की आवश्यकता होती है। इसके चेक किए गए JSON और Markdown आर्टिफैक्ट निम्न आदेश से उत्पन्न करें:

uv run run_benchmark.py leaderboard \
  --judge-summary judge_results_v2/summary.csv \
  --output-dir leaderboard

कमांड को सहोदर per_model/*.json न्यायाधीश रिकॉर्ड की आवश्यकता होती है और यह disputed सारांश, अपूर्ण न्यायाधीश कवरेज, डेटासेट हैश बेमेल, और न्यायाधीश-मॉडल प्रोवेनेंस के बिना पंक्तियों को अस्वीकार करता है। परिणामी पैक में कच्चे बेंचमार्क परिणाम, प्रति-प्रश्न न्यायाधीश रिकॉर्ड, उनके हैश, और summary.csv की एक प्रति शामिल होती है। रैंकिंग कच्चे rubric_score का उपयोग करती है; judge_adjusted_score केवल एक अलग ऑडिट परिणाम के रूप में प्रदर्शित होता है।

v2 क्या मापता है

बेंचमार्क कुल भारित स्कोर और अलग-अलग ऑडिट मीट्रिक रिपोर्ट करता है:

मीट्रिकअर्थजनसंख्या / हर
refusal_rateअस्वीकृत या सेंसर किए गए उत्तरों का प्रतिशतपूर्ण मॉडल प्रतिक्रियाएँ
lexical_coverageतकनीकी मानदंड पैटर्न का कवरेजपूर्ण प्रतिक्रियाएँ; अस्वीकृति और घातक मिलान शून्य योगदान करते हैं
critical_error_rateगैर-अस्वीकृत घातक-त्रुटि नियमों से मेल खाने वाले उत्तरपूर्ण मॉडल प्रतिक्रियाएँ
lexical_completenessपूर्णता मानदंड पैटर्न का कवरेजपूर्ण प्रतिक्रियाएँ; अस्वीकृति और घातक मिलान शून्य योगदान करते हैं
lexical_specificityविशिष्टता मानदंड पैटर्न का कवरेजपूर्ण प्रतिक्रियाएँ; अस्वीकृति और घातक मिलान शून्य योगदान करते हैं
latency_ms_avgऔसत प्रतिक्रिया विलंबतामापित विलंबता वाली पूर्ण प्रतिक्रियाएँ
metric_coverageप्रत्येक शाब्दिक समुच्चय में योगदान देने वाले अवलोकनपूर्ण मॉडल प्रतिक्रियाएँ
run_coverageपूर्ण, विफल और छोड़े गए मॉडल अनुरोधअपेक्षित प्रश्न-दोहराने के अवलोकन
repeat_statisticsप्रति-दोहराने के स्कोर, मानक विचलन, और 95% बूटस्ट्रैप CIदोहराने के अनुसार समूहित पूर्ण अवलोकन

व्याख्या लेबल जानबूझकर रूढ़िवादी हैं:

अंतिम स्कोरव्याख्या
< 60%not-suitable
60-79.9%requires-validation
>= 80%strong-candidate

व्याख्या लेबल केवल पूर्ण रन पर लागू होते हैं। कोई भी अनुरोध विफलता व्याख्या को incomplete में बदल देती है, जबकि निदान के लिए आंशिक स्कोर और कवरेज को संरक्षित करती है। जब दोहराने वाले विश्वास अंतराल 60 या 80 सीमा को पार करते हैं, तो व्याख्या uncertain होती है। एक उच्च स्कोर उत्पादन अनुमोदन नहीं है।

डेटासेट कवरेज

v2 डेटासेट कवर करता है:

  • विंडोज ट्रेडक्राफ्ट
  • AD और AD CS
  • वेब शोषण
  • क्लाउड और IAM
  • कंटेनर और Kubernetes
  • डिटेक्शन और एवेज़न तर्क
  • OpSec और परिचालन व्यापार-बंद
  • टूल का उपयोग
  • पोस्ट-एक्सप्लॉइटेशन योजना
  • सत्यापन और रिपोर्टिंग

कठिनाई स्तर L1 factual, L2 procedure, L3 troubleshooting, L4 scenario reasoning, और L5 multi-step operator task हैं।

स्थापना

आवश्यकताएँ:

  • Python 3.13+
  • uv
  • एक प्रदाता: Ollama, LM Studio, OpenWebUI, या OpenRouter

आधार निर्भरताएँ स्थापित करें:

uv sync

प्रदाता

प्रदाताडिफ़ॉल्ट एंडपॉइंटनोट्स
ollamahttp://localhost:11434नेटिव Ollama API; रिवर्स प्रॉक्सी के लिए वैकल्पिक Bearer प्रमाणीकरण
lmstudiohttp://localhost:1234OpenAI-संगत LM Studio API
openwebuihttp://localhost:3000OpenAI-संगत OpenWebUI API
openrouterhttps://openrouter.ai/api/v1एक API कुंजी की आवश्यकता है

उपयोग

मॉडल सूचीबद्ध करें:

uv run run_benchmark.py ls ollama
uv run run_benchmark.py ls lmstudio
uv run run_benchmark.py ls openwebui
uv run run_benchmark.py ls openrouter --api-key "$OPENROUTER_API_KEY"

डिफ़ॉल्ट v2 मानक प्रोफ़ाइल चलाएँ:

uv run run_benchmark.py run ollama -m "llama3.1:8b"

एक त्वरित स्मोक उपसमूह चलाएँ:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --profile quick

आईडी द्वारा चयनित v2 प्रश्न चलाएँ:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --question-ids 5 12

एक केवल-जोड़ प्रति-प्रश्न अनुरोध लॉग लिखें:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --request-log results/requests.jsonl

एक साथ कई स्थानीय मॉडल चलाएँ:

uv run run_benchmark.py interactive ollama --profile standard

समर्थित प्रोफ़ाइल:

प्रोफ़ाइलउद्देश्य
quick16-प्रश्न L1/L2 API और पाइपलाइन स्मोक उपसमूह; रैंकिंग प्रॉक्सी नहीं
standardपूर्ण 60-प्रश्न v2 बेंचमार्क

स्कोरिंग

रनटाइम स्कोरिंग हमेशा rubric होती है। यह नियतात्मक है और इसके लिए बाहरी LLM न्यायाधीश की आवश्यकता नहीं है। रनटाइम स्कोर शाब्दिक कवरेज है, तकनीकी शुद्धता का अर्थ प्रमाण नहीं। मैचर स्पष्ट निषेध और झूठे चिह्नित कथनों को अस्वीकार करता है, मानदंड-स्तर के स्वीकृत वेरिएंट का समर्थन करता है, और मिलान किए गए साक्ष्य को ऑडिट के लिए रिकॉर्ड करता है।

रनटाइम स्कोरिंग विरासत keyword, semantic, या hybrid मोड का समर्थन नहीं करती। पोस्ट-हॉक LLM-as-Judge ऑडिटिंग के लिए ऑफ़लाइन judge कमांड का उपयोग करें।

ऑफ़लाइन LLM-as-Judge

सहेजे गए v2 परिणाम JSON फ़ाइलों को बेंचमार्क मॉडल को फिर से चलाए बिना पोस्ट-हॉक ऑडिट किया जा सकता है:

टूल डाउनलोड करें