Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
redeval — [ICLR 2026] - पेपर के लिए आधिकारिक रिपॉजिटरी: "RedBench: बड़े भाषा मॉडलों के व्यापक रेड टीमिंग के लिए एक सार्वभौमिक डेटासेट" | Kitploit
उपकरण/GitHubGitHub/knoveleng/redeval
पेपर और शोधलर्निंग और शिक्षाचयनित संसाधनAI सुरक्षाप्रतिकूल हमला
GitHubknoveleng/redeval

redeval

[ICLR 2026] - पेपर के लिए आधिकारिक रिपॉजिटरी: "RedBench: बड़े भाषा मॉडलों के व्यापक रेड टीमिंग के लिए एक सार्वभौमिक डेटासेट"

रिपॉजिटरी देखें
2945 महीने पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
वेबसाइट

RedEval - LLM सुरक्षा मूल्यांकन फ्रेमवर्क

Python 3.8+ License: MIT Dataset on HF

व्यवस्थित अटैक और अस्वीकृति परीक्षण के माध्यम से लार्ज लैंग्वेज मॉडल (LLM) की सुरक्षा का मूल्यांकन करने के लिए एक व्यापक फ्रेमवर्क। RedEval प्रतिकूल प्रॉम्प्ट और हानिकारक सामग्री के विरुद्ध LLM की मजबूती का आकलन करने के लिए एक एकीकृत, सुरक्षित और विस्तार योग्य प्लेटफ़ॉर्म प्रदान करता है। यह पेपर "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models" का एक हिस्सा है, जो LLM के व्यापक रेड टीमिंग के लिए एक सार्वभौमिक डेटासेट है।

📦 डेटासेट: RedBench डेटासेट HuggingFace पर knoveleng/redbench पर सार्वजनिक रूप से उपलब्ध है। इसमें कई सुरक्षा श्रेणियों और डोमेन में व्यापक रेड टीमिंग प्रॉम्प्ट शामिल हैं।

🚀 त्वरित प्रारंभ

1. वातावरण सेट करें

root@kitploit:~
# Clone the repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Install dependencies
pip install -r requirements.txt

# Copy and configure environment variables
cp .env.template .env
# Edit .env with your API keys

2. API कुंजियाँ कॉन्फ़िगर करें

.env फ़ाइल को अपने क्रेडेंशियल के साथ संपादित करें:

root@kitploit:~
OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. मूल्यांकन चलाएँ

root@kitploit:~
# Set up environment
source ./sh/setup_env.sh

# Run with default models, you can edit .env to define models which you wanna run
python -m redeval.cli run-pipeline

# Run complete pipeline with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Or run individual phases
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 विषय-सूची

  • अवलोकन
  • आर्किटेक्चर
  • इंस्टॉलेशन
  • कॉन्फ़िगरेशन
  • उपयोग
  • सुरक्षा सुविधाएँ
  • API संदर्भ
  • योगदान
  • लाइसेंस

🎯 अवलोकन

RedEval दो पूरक दृष्टिकोणों के माध्यम से LLM सुरक्षा का मूल्यांकन करता है:

🔴 अटैक चरण

विभिन्न जेलब्रेकिंग तकनीकों का उपयोग करके प्रतिकूल प्रॉम्प्ट के प्रति LLM की भेद्यता का परीक्षण करता है:

  • प्रत्यक्ष अटैक: सीधे हानिकारक प्रॉम्प्ट
  • मानव जेलब्रेक: मानव-निर्मित बायपास तकनीकें
  • ज़ीरो-शॉट अटैक: स्वचालित प्रतिकूल प्रॉम्प्ट जनरेशन

🛡️ अस्वीकृति चरण

कई सुरक्षा डेटासेट में हानिकारक अनुरोधों को उचित रूप से अस्वीकार करने की LLM की क्षमता का मूल्यांकन करता है:

  • CoCoNot: संदर्भ-जागरूक सामग्री मॉडरेशन
  • SGXSTest: सुरक्षा दिशानिर्देशों की जाँच
  • XSTest: क्रॉस-डोमेन सुरक्षा परीक्षण
  • ORBench: वस्तुनिष्ठ अस्वीकृति बेंचमार्किंग

📊 स्कोरिंग

अटैक और अस्वीकृति दोनों प्रदर्शन को मिलाकर व्यापक सुरक्षा मेट्रिक्स की गणना करता है।

🏗️ आर्किटेक्चर

मुख्य घटक

root@kitploit:~
redeval/
├── redeval/                 # Core Python modules
│   ├── config.py           # Environment & configuration management
│   ├── pipeline.py         # Centralized pipeline orchestrator
│   ├── cli.py              # Unified command-line interface
│   ├── exceptions.py       # Custom exception handling
│   ├── generate_attack.py  # Attack prompt generation
│   ├── run_attack.py       # Attack execution
│   ├── eval_attack.py      # Attack evaluation
│   ├── run_refuse.py       # Refusal testing
│   ├── eval_refuse.py      # Refusal evaluation
│   └── score.py            # Metric calculation
├── sh/                     # Shell script interfaces
│   ├── setup_env.sh        # Environment setup
│   ├── generate_attack.sh  # Attack generation script
│   ├── run_attack.sh       # Attack execution script
│   ├── eval_attack.sh      # Attack evaluation script
│   ├── run_refuse.sh       # Refusal testing script
│   ├── eval_refuse.sh      # Refusal evaluation script
│   └── score.sh            # Scoring script
├── recipes/                # Configuration files
├── logs/                   # Evaluation results
└── .env                    # Environment variables

मूल्यांकन पाइपलाइन

root@kitploit:~
graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ इंस्टॉलेशन

आवश्यक शर्तें

  • Python 3.8 या उच्चतर
  • OpenAI API कुंजी
  • HuggingFace टोकन
  • Git

चरण-दर-चरण इंस्टॉलेशन

  1. रिपॉजिटरी क्लोन करें

    root@kitploit:~
    git clone <repository-url>
    cd redeval
    
  2. निर्भरताएँ इंस्टॉल करें

    root@kitploit:~
    pip install -r requirements.txt
    
  3. वातावरण कॉन्फ़िगर करें

    root@kitploit:~
    cp .env.template .env
    # Edit .env with your API credentials
    
  4. इंस्टॉलेशन सत्यापित करें

    root@kitploit:~
    python -m redeval.cli --help
    

⚙️ कॉन्फ़िगरेशन

पर्यावरण चर

RedEval सुरक्षित और लचीले कॉन्फ़िगरेशन के लिए पर्यावरण चर का उपयोग करता है:

आवश्यक चर

चरविवरणउदाहरण
OPENAI_API_KEYOpenAI API कुंजीsk-proj-...
HUGGINGFACE_TOKENHuggingFace टोकनhf_...

वैकल्पिक कॉन्फ़िगरेशन

मॉडल कॉन्फ़िगरेशन

चरविवरणडिफ़ॉल्ट
REDEVAL_OPEN_SOURCE_MODELSओपन-सोर्स मॉडलों की सूची"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSक्लोज्ड-सोर्स मॉडलों की सूची"gpt-4o-mini"

कॉन्फ़िगरेशन फ़ाइलें

recipes/ निर्देशिका में कॉन्फ़िगरेशन फ़ाइलें मूल्यांकन पैरामीटर नियंत्रित करती हैं:

  • attack/base-open.yml - ओपन-सोर्स मॉडल अटैक कॉन्फ़िगरेशन
  • attack/base-close.yml - क्लोज्ड-सोर्स मॉडल अटैक कॉन्फ़िगरेशन
  • attack/eval.yml - अटैक मूल्यांकन कॉन्फ़िगरेशन
  • refuse/base-open.yml - ओपन-सोर्स मॉडल अस्वीकृति कॉन्फ़िगरेशन
  • refuse/base-close.yml - क्लोज्ड-सोर्स मॉडल अस्वीकृति कॉन्फ़िगरेशन
  • refuse/eval.yml - अस्वीकृति मूल्यांकन कॉन्फ़िगरेशन

🚀 उपयोग

कमांड लाइन इंटरफ़ेस

RedEval सभी कार्यों के लिए एक एकीकृत CLI प्रदान करता है:

संपूर्ण पाइपलाइन

root@kitploit:~
# Run full evaluation pipeline
python -m redeval.cli run-pipeline

# Run with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Run specific phases only
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

व्यक्तिगत घटक

root@kitploit:~
# Generate attack prompts
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Run attack evaluation
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate attack results
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name

# Run refusal tests
python -m redeval.cli run-refuse --config ./recipes/refuse/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate refusal results
python -m redeval.cli eval-refuse --config ./recipes/refuse/eval.yml --log-dir ./logs/refuse/CoCoNot/base/model_name

# Calculate scores
python -m redeval.cli score --log-dir ./logs/attack/HarmBench/direct/model_name --keyword "unsafe"

शेल स्क्रिप्ट इंटरफ़ेस

उन उपयोगकर्ताओं के लिए जो शेल स्क्रिप्ट पसंद करते हैं:

root@kitploit:~
# Set up environment (run first)
source ./sh/setup_env.sh

# Run evaluation phases
./sh/generate_attack.sh    # Generate attack prompts
./sh/run_attack.sh         # Execute attacks
./sh/eval_attack.sh        # Evaluate attack results
./sh/run_refuse.sh         # Run refusal tests
./sh/eval_refuse.sh        # Evaluate refusal results
./sh/score.sh              # Calculate final scores

Python API

प्रोग्रामेटिक पहुँच के लिए:

root@kitploit:~
from redeval.pipeline import PipelineOrchestrator, PipelinePhase
from redeval.config import EnvironmentConfig

# Initialize configuration
config = EnvironmentConfig.from_env()

# Create pipeline orchestrator
orchestrator = PipelineOrchestrator(config)

# Run complete pipeline
orchestrator.run_complete_pipeline()

# Run specific phases
orchestrator.run_phase(PipelinePhase.GENERATE_ATTACK)
orchestrator.run_phase(PipelinePhase.RUN_ATTACK)

🔒 सुरक्षा सुविधाएँ

✅ सुरक्षित क्रेडेंशियल प्रबंधन

  • सोर्स कोड में कोई हार्डकोडेड API कुंजियाँ नहीं
  • पर्यावरण चर-आधारित कॉन्फ़िगरेशन
  • सत्यापन के साथ .env फ़ाइल समर्थन
  • HuggingFace प्रमाणीकरण के लिए सुरक्षित टोकन हैंडलिंग

✅ इनपुट सत्यापन

  • स्टार्टअप पर पर्यावरण चर सत्यापन
  • कॉन्फ़िगरेशन फ़ाइल सत्यापन
  • मॉडल नाम और पैरामीटर सत्यापन

✅ त्रुटि प्रबंधन

  • विभिन्न त्रुटि प्रकारों के लिए कस्टम अपवाद क्लास
  • व्यापक त्रुटि लॉगिंग
  • सुगम विफलता प्रबंधन

✅ सर्वोत्तम अभ्यास

  • न्यूनतम विशेषाधिकार का सिद्धांत
  • सुरक्षित डिफ़ॉल्ट
  • संवेदनशील डेटा के जोखिम के बिना व्यापक लॉगिंग

📚 API संदर्भ

CLI कमांड

run-pipeline

संपूर्ण मूल्यांकन पाइपलाइन या विशिष्ट चरण चलाएँ।

विकल्प:

  • --models: मूल्यांकन के लिए मॉडलों की सूची
  • --phases: चलाने के लिए विशिष्ट चरण
  • --config-dir: कॉन्फ़िगरेशन निर्देशिका पथ
  • --log-dir: लॉग के लिए आउटपुट निर्देशिका

generate-attack

प्रतिकूल अटैक प्रॉम्प्ट उत्पन्न करें।

विकल्प:

  • --config: कॉन्फ़िगरेशन फ़ाइल पथ
  • --num-samples: उत्पन्न करने के लिए नमूनों की संख्या
  • --seed: पुनरुत्पादन के लिए रैंडम सीड

run-attack

लक्ष्य मॉडलों के विरुद्ध अटैक मूल्यांकन निष्पादित करें।

विकल्प:

  • --config: कॉन्फ़िगरेशन फ़ाइल पथ
  • --model: लक्ष्य मॉडल नाम
  • --num-samples: संसाधित करने के लिए नमूनों की संख्या

eval-attack

जज मॉडल का उपयोग करके अटैक परिणामों का मूल्यांकन करें।

विकल्प:

  • --config: कॉन्फ़िगरेशन फ़ाइल पथ
  • --log-dir: अटैक लॉग वाली निर्देशिका

run-refuse

अस्वीकृति क्षमता परीक्षण चलाएँ।

विकल्प:

  • --config: कॉन्फ़िगरेशन फ़ाइल पथ
  • --model: लक्ष्य मॉडल नाम
  • --num-samples: परीक्षण के लिए नमूनों की संख्या
  • --split: उपयोग करने के लिए डेटासेट विभाजन

eval-refuse

अस्वीकृति परीक्षण परिणामों का मूल्यांकन करें।

विकल्प:

  • --config: कॉन्फ़िगरेशन फ़ाइल पथ
  • --log-dir: अस्वीकृति लॉग वाली निर्देशिका

score

मूल्यांकन परिणामों से सुरक्षा स्कोर की गणना करें।

विकल्प:

  • --log-dir: मूल्यांकन लॉग वाली निर्देशिका
  • --keyword: परिणामों में खोजने के लिए कीवर्ड

Python API क्लास

PipelineOrchestrator

केंद्रीकृत पाइपलाइन प्रबंधन।

विधियाँ:

  • run_complete_pipeline(): संपूर्ण मूल्यांकन पाइपलाइन निष्पादित करें
  • run_phase(phase): विशिष्ट पाइपलाइन चरण निष्पादित करें
  • get_phase_status(phase): पाइपलाइन चरण की स्थिति प्राप्त करें

EnvironmentConfig

पर्यावरण और कॉन्फ़िगरेशन प्रबंधन।

विधियाँ:

  • from_env(): पर्यावरण चर से कॉन्फ़िगरेशन लोड करें
  • validate(): कॉन्फ़िगरेशन की पूर्णता सत्यापित करें
  • setup_logging(): लॉगिंग प्रणाली कॉन्फ़िगर करें

🤝 योगदान

डेवलपमेंट सेटअप

  1. फोर्क और क्लोन करें

    root@kitploit:~
    git clone https://github.com/knoveleng/redeval.git
    cd redeval
    
  2. डेवलपमेंट वातावरण बनाएँ

    root@kitploit:~
    python -m venv venv
    source venv/bin/activate  # On Windows: venv\Scripts\activate
    pip install -r requirements.txt
    
  3. प्री-कमिट हुक सेट करें

    root@kitploit:~
    pip install pre-commit
    pre-commit install
    

योगदान दिशानिर्देश

  • सुरक्षा प्रथम: API कुंजियाँ या संवेदनशील डेटा कभी कमिट न करें
  • पर्यावरण चर: सभी कॉन्फ़िगरेशन के लिए पर्यावरण चर का उपयोग करें
  • त्रुटि प्रबंधन: कस्टम अपवादों के साथ उचित त्रुटि प्रबंधन जोड़ें
  • दस्तावेज़ीकरण: नई सुविधाओं के लिए दस्तावेज़ अपडेट करें
  • परीक्षण: नई कार्यक्षमता के लिए परीक्षण जोड़ें
  • बैकवर्ड संगतता: मौजूदा इंटरफ़ेस के साथ संगतता बनाए रखें

कोड शैली

  • Python कोड के लिए PEP 8 का पालन करें
  • जहाँ उचित हो वहाँ टाइप हिंट का उपयोग करें
  • व्यापक डॉकस्ट्रिंग जोड़ें
  • सुसंगत लॉगिंग पैटर्न बनाए रखें

📄 लाइसेंस

यह प्रोजेक्ट MIT लाइसेंस के अंतर्गत लाइसेंस प्राप्त है - विवरण के लिए LICENSE फ़ाइल देखें।

📚 उद्धरण

यदि आपको यह प्रोजेक्ट उपयोगी लगता है, तो कृपया अपने शोध में इसे उद्धृत करने पर विचार करें:

root@kitploit:~
@inproceedings{
   dang2026redbench,
   title={RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models},
   author={Quy-Anh Dang and Chris Ngo and Truong-Son Hy},
   booktitle={ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities},
   year={2026},
   url={https://openreview.net/forum?id=7pZXyk0d07}
}
टूल डाउनलोड करें
चरविवरणडिफ़ॉल्ट
REDEVAL_PROJECT_ROOTप्रोजेक्ट रूट निर्देशिकावर्तमान निर्देशिका
REDEVAL_LOG_DIRलॉग निर्देशिका./logs
REDEVAL_RECIPES_DIRकॉन्फ़िगरेशन निर्देशिका./recipes
REDEVAL_LOG_LEVELलॉगिंग स्तरINFO
REDEVAL_NUM_SAMPLESमूल्यांकन नमूनों की संख्या10
REDEVAL_SEEDरैंडम सीड0