Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
redeval — [ICLR 2026] - المستودع الرسمي للورقة البحثية: "RedBench: مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة" | Kitploit
أدوات/GitHubGitHub/knoveleng/redeval
الأوراق والأبحاثالتعلم والتعليمموارد منسقةأمن الذكاء الاصطناعيالهجوم العدائي
GitHubknoveleng/redeval

redeval

[ICLR 2026] - المستودع الرسمي للورقة البحثية: "RedBench: مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة"

عرض المستودع
29412منذ 7 أشهرتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة
الموقع الإلكتروني

RedEval - إطار عمل تقييم سلامة نماذج اللغة الكبيرة

Python 3.8+ License: MIT Dataset on HF

إطار عمل شامل لتقييم سلامة نماذج اللغة الكبيرة (LLMs) من خلال الاختبار المنهجي للهجوم والرفض. يوفر RedEval منصة موحدة وآمنة وقابلة للتوسع لتقييم متانة نماذج اللغة الكبيرة ضد المطالبات العدائية والمحتوى الضار. وهو جزء من الورقة البحثية "RedBench: مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة"، وهي مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة.

📦 مجموعة البيانات: مجموعة بيانات RedBench متاحة للعموم على HuggingFace عبر knoveleng/redbench. وتتضمن مطالبات اختبار أحمر شاملة عبر فئات ومجالات سلامة متعددة.

🚀 بدء سريع

1. إعداد البيئة

# Clone the repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Install dependencies
pip install -r requirements.txt

# Copy and configure environment variables
cp .env.template .env
# Edit .env with your API keys

2. إعداد مفاتيح API

عدّل ملف .env ببيانات اعتمادك:

OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. تشغيل التقييم

# Set up environment
source ./sh/setup_env.sh

# Run with default models, you can edit .env to define models which you wanna run
python -m redeval.cli run-pipeline

# Run complete pipeline with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Or run individual phases
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 جدول المحتويات

  • نظرة عامة
  • البنية المعمارية
  • التثبيت
  • الإعداد
  • الاستخدام
  • ميزات الأمان
  • مرجع API
  • المساهمة
  • الترخيص

🎯 نظرة عامة

يقيّم RedEval سلامة نماذج اللغة الكبيرة من خلال نهجين متكاملين:

🔴 مرحلة الهجوم

تختبر قابلية تأثر نماذج اللغة الكبيرة بالمطالبات العدائية باستخدام تقنيات كسر الحماية المختلفة:

  • الهجمات المباشرة: مطالبات ضارة مباشرة
  • كسور الحماية البشرية: تقنيات تجاوز صيغت يدويًا
  • هجمات Zero-shot: توليد آلي للمطالبات العدائية

🛡️ مرحلة الرفض

تقيّم قدرة نماذج اللغة الكبيرة على رفض الطلبات الضارة بشكل مناسب عبر مجموعات بيانات سلامة متعددة:

  • CoCoNot: الإشراف على المحتوى المدرك للسياق
  • SGXSTest: فحص إرشادات السلامة
  • XSTest: اختبار السلامة عبر المجالات
  • ORBench: قياس مرجعي موضوعي للرفض

📊 التسجيل

يحسب مقاييس سلامة شاملة تجمع بين أداء الهجوم والرفض معًا.

🏗️ البنية المعمارية

المكونات الأساسية

redeval/
├── redeval/                 # Core Python modules
│   ├── config.py           # Environment & configuration management
│   ├── pipeline.py         # Centralized pipeline orchestrator
│   ├── cli.py              # Unified command-line interface
│   ├── exceptions.py       # Custom exception handling
│   ├── generate_attack.py  # Attack prompt generation
│   ├── run_attack.py       # Attack execution
│   ├── eval_attack.py      # Attack evaluation
│   ├── run_refuse.py       # Refusal testing
│   ├── eval_refuse.py      # Refusal evaluation
│   └── score.py            # Metric calculation
├── sh/                     # Shell script interfaces
│   ├── setup_env.sh        # Environment setup
│   ├── generate_attack.sh  # Attack generation script
│   ├── run_attack.sh       # Attack execution script
│   ├── eval_attack.sh      # Attack evaluation script
│   ├── run_refuse.sh       # Refusal testing script
│   ├── eval_refuse.sh      # Refusal evaluation script
│   └── score.sh            # Scoring script
├── recipes/                # Configuration files
├── logs/                   # Evaluation results
└── .env                    # Environment variables

خط أنابيب التقييم

graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ التثبيت

المتطلبات الأساسية

  • بايثون 3.8 أو أحدث
  • مفتاح OpenAI API
  • رمز HuggingFace
  • Git

التثبيت خطوة بخطوة

  1. استنساخ المستودع

    git clone <repository-url>
    cd redeval
    
  2. تثبيت التبعيات

    pip install -r requirements.txt
    
  3. إعداد البيئة

    cp .env.template .env
    # Edit .env with your API credentials
    
  4. التحقق من التثبيت

    python -m redeval.cli --help
    

⚙️ الإعداد

متغيرات البيئة

يستخدم RedEval متغيرات البيئة لإعداد آمن ومرن:

المتغيرات المطلوبة

المتغيرالوصفمثال
OPENAI_API_KEYمفتاح OpenAI APIsk-proj-...
HUGGINGFACE_TOKENرمز HuggingFacehf_...

الإعداد الاختياري

المتغيرالوصفالافتراضي
REDEVAL_PROJECT_ROOTمجلد جذر المشروعالمجلد الحالي
REDEVAL_LOG_DIRمجلد السجلات./logs
REDEVAL_RECIPES_DIRمجلد الإعدادات./recipes
REDEVAL_LOG_LEVELمستوى التسجيلINFO
REDEVAL_NUM_SAMPLESعدد عينات التقييم10
REDEVAL_SEEDالبذرة العشوائية0

إعداد النماذج

المتغيرالوصفالافتراضي
REDEVAL_OPEN_SOURCE_MODELSقائمة النماذج مفتوحة المصدر"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSقائمة النماذج مغلقة المصدر"gpt-4o-mini"

ملفات الإعداد

تتحكم ملفات الإعداد الموجودة في مجلد recipes/ بمعايير التقييم:

  • attack/base-open.yml - إعداد هجوم النماذج مفتوحة المصدر
  • attack/base-close.yml - إعداد هجوم النماذج مغلقة المصدر
  • attack/eval.yml - إعداد تقييم الهجوم
  • refuse/base-open.yml - إعداد رفض النماذج مفتوحة المصدر
  • refuse/base-close.yml - إعداد رفض النماذج مغلقة المصدر
  • refuse/eval.yml - إعداد تقييم الرفض

🚀 الاستخدام

واجهة سطر الأوامر

يوفر RedEval واجهة CLI موحدة لجميع العمليات:

خط الأنابيب الكامل

# Run full evaluation pipeline
python -m redeval.cli run-pipeline

# Run with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Run specific phases only
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

المكونات الفردية

# Generate attack prompts
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Run attack evaluation
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate attack results
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name

# Run refusal tests
python -m redeval.cli run-refuse --config ./recipes/refuse/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate refusal results
python -m redeval.cli eval-refuse --config ./recipes/refuse/eval.yml --log-dir ./logs/refuse/CoCoNot/base/model_name

# Calculate scores
python -m redeval.cli score --log-dir ./logs/attack/HarmBench/direct/model_name --keyword "unsafe"

واجهة السكربتات الطرفية

للمستخدمين الذين يفضلون استخدام السكربتات الطرفية:

# Set up environment (run first)
source ./sh/setup_env.sh

# Run evaluation phases
./sh/generate_attack.sh    # Generate attack prompts
./sh/run_attack.sh         # Execute attacks
./sh/eval_attack.sh        # Evaluate attack results
./sh/run_refuse.sh         # Run refusal tests
./sh/eval_refuse.sh        # Evaluate refusal results
./sh/score.sh              # Calculate final scores
تنزيل الأداة