Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
redeval — [ICLR 2026] - المستودع الرسمي للورقة البحثية: "RedBench: مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة" | Kitploit
أدوات/GitHubGitHub/knoveleng/redeval
الأوراق والأبحاثالتعلم والتعليمموارد منسقةأمن الذكاء الاصطناعيالهجوم العدائي
GitHubknoveleng/redeval

redeval

[ICLR 2026] - المستودع الرسمي للورقة البحثية: "RedBench: مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة"

عرض المستودع
294منذ 5 أشهرتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة
الموقع الإلكتروني

RedEval - إطار عمل تقييم سلامة نماذج اللغة الكبيرة

Python 3.8+ License: MIT Dataset on HF

إطار عمل شامل لتقييم سلامة نماذج اللغة الكبيرة (LLMs) من خلال الاختبار المنهجي للهجوم والرفض. يوفر RedEval منصة موحدة وآمنة وقابلة للتوسع لتقييم متانة نماذج اللغة الكبيرة ضد المطالبات العدائية والمحتوى الضار. وهو جزء من الورقة البحثية "RedBench: مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة"، وهي مجموعة بيانات عالمية للاختبار الأحمر الشامل لنماذج اللغة الكبيرة.

📦 مجموعة البيانات: مجموعة بيانات RedBench متاحة للعموم على HuggingFace عبر knoveleng/redbench. وتتضمن مطالبات اختبار أحمر شاملة عبر فئات ومجالات سلامة متعددة.

🚀 بدء سريع

1. إعداد البيئة

root@kitploit:~
# Clone the repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Install dependencies
pip install -r requirements.txt

# Copy and configure environment variables
cp .env.template .env
# Edit .env with your API keys

2. إعداد مفاتيح API

عدّل ملف .env ببيانات اعتمادك:

root@kitploit:~
OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. تشغيل التقييم

root@kitploit:~
# Set up environment
source ./sh/setup_env.sh

# Run with default models, you can edit .env to define models which you wanna run
python -m redeval.cli run-pipeline

# Run complete pipeline with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Or run individual phases
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 جدول المحتويات

  • نظرة عامة
  • البنية المعمارية
  • التثبيت
  • الإعداد
  • الاستخدام
  • ميزات الأمان
  • مرجع API
  • المساهمة
  • الترخيص

🎯 نظرة عامة

يقيّم RedEval سلامة نماذج اللغة الكبيرة من خلال نهجين متكاملين:

🔴 مرحلة الهجوم

تختبر قابلية تأثر نماذج اللغة الكبيرة بالمطالبات العدائية باستخدام تقنيات كسر الحماية المختلفة:

  • الهجمات المباشرة: مطالبات ضارة مباشرة
  • كسور الحماية البشرية: تقنيات تجاوز صيغت يدويًا
  • هجمات Zero-shot: توليد آلي للمطالبات العدائية

🛡️ مرحلة الرفض

تقيّم قدرة نماذج اللغة الكبيرة على رفض الطلبات الضارة بشكل مناسب عبر مجموعات بيانات سلامة متعددة:

  • CoCoNot: الإشراف على المحتوى المدرك للسياق
  • SGXSTest: فحص إرشادات السلامة
  • XSTest: اختبار السلامة عبر المجالات
  • ORBench: قياس مرجعي موضوعي للرفض

📊 التسجيل

يحسب مقاييس سلامة شاملة تجمع بين أداء الهجوم والرفض معًا.

🏗️ البنية المعمارية

المكونات الأساسية

root@kitploit:~
redeval/
├── redeval/                 # Core Python modules
│   ├── config.py           # Environment & configuration management
│   ├── pipeline.py         # Centralized pipeline orchestrator
│   ├── cli.py              # Unified command-line interface
│   ├── exceptions.py       # Custom exception handling
│   ├── generate_attack.py  # Attack prompt generation
│   ├── run_attack.py       # Attack execution
│   ├── eval_attack.py      # Attack evaluation
│   ├── run_refuse.py       # Refusal testing
│   ├── eval_refuse.py      # Refusal evaluation
│   └── score.py            # Metric calculation
├── sh/                     # Shell script interfaces
│   ├── setup_env.sh        # Environment setup
│   ├── generate_attack.sh  # Attack generation script
│   ├── run_attack.sh       # Attack execution script
│   ├── eval_attack.sh      # Attack evaluation script
│   ├── run_refuse.sh       # Refusal testing script
│   ├── eval_refuse.sh      # Refusal evaluation script
│   └── score.sh            # Scoring script
├── recipes/                # Configuration files
├── logs/                   # Evaluation results
└── .env                    # Environment variables

خط أنابيب التقييم

root@kitploit:~
graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ التثبيت

المتطلبات الأساسية

  • بايثون 3.8 أو أحدث
  • مفتاح OpenAI API
  • رمز HuggingFace
  • Git

التثبيت خطوة بخطوة

  1. استنساخ المستودع

    root@kitploit:~
    git clone <repository-url>
    cd redeval
    
  2. تثبيت التبعيات

    root@kitploit:~
    pip install -r requirements.txt
    
  3. إعداد البيئة

    root@kitploit:~
    cp .env.template .env
    # Edit .env with your API credentials
    
  4. التحقق من التثبيت

    root@kitploit:~
    python -m redeval.cli --help
    

⚙️ الإعداد

متغيرات البيئة

يستخدم RedEval متغيرات البيئة لإعداد آمن ومرن:

المتغيرات المطلوبة

المتغيرالوصفمثال
OPENAI_API_KEYمفتاح OpenAI APIsk-proj-...
HUGGINGFACE_TOKENرمز HuggingFacehf_...

الإعداد الاختياري

إعداد النماذج

المتغيرالوصفالافتراضي
REDEVAL_OPEN_SOURCE_MODELSقائمة النماذج مفتوحة المصدر"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSقائمة النماذج مغلقة المصدر"gpt-4o-mini"

ملفات الإعداد

تتحكم ملفات الإعداد الموجودة في مجلد recipes/ بمعايير التقييم:

  • attack/base-open.yml - إعداد هجوم النماذج مفتوحة المصدر
  • attack/base-close.yml - إعداد هجوم النماذج مغلقة المصدر
  • attack/eval.yml - إعداد تقييم الهجوم
  • refuse/base-open.yml - إعداد رفض النماذج مفتوحة المصدر
  • refuse/base-close.yml - إعداد رفض النماذج مغلقة المصدر
  • refuse/eval.yml - إعداد تقييم الرفض

🚀 الاستخدام

واجهة سطر الأوامر

يوفر RedEval واجهة CLI موحدة لجميع العمليات:

خط الأنابيب الكامل

root@kitploit:~
# Run full evaluation pipeline
python -m redeval.cli run-pipeline

# Run with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Run specific phases only
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

المكونات الفردية

root@kitploit:~
# Generate attack prompts
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Run attack evaluation
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate attack results
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name

# Run refusal tests
python -m redeval.cli run-refuse --config ./recipes/refuse/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate refusal results
python -m redeval.cli eval-refuse --config ./recipes/refuse/eval.yml --log-dir ./logs/refuse/CoCoNot/base/model_name

# Calculate scores
python -m redeval.cli score --log-dir ./logs/attack/HarmBench/direct/model_name --keyword "unsafe"

واجهة السكربتات الطرفية

للمستخدمين الذين يفضلون استخدام السكربتات الطرفية:

root@kitploit:~
# Set up environment (run first)
source ./sh/setup_env.sh

# Run evaluation phases
./sh/generate_attack.sh    # Generate attack prompts
./sh/run_attack.sh         # Execute attacks
./sh/eval_attack.sh        # Evaluate attack results
./sh/run_refuse.sh         # Run refusal tests
./sh/eval_refuse.sh        # Evaluate refusal results
./sh/score.sh              # Calculate final scores

واجهة Python البرمجية

للوصول البرمجي:

root@kitploit:~
from redeval.pipeline import PipelineOrchestrator, PipelinePhase
from redeval.config import EnvironmentConfig

# Initialize configuration
config = EnvironmentConfig.from_env()

# Create pipeline orchestrator
orchestrator = PipelineOrchestrator(config)

# Run complete pipeline
orchestrator.run_complete_pipeline()

# Run specific phases
orchestrator.run_phase(PipelinePhase.GENERATE_ATTACK)
orchestrator.run_phase(PipelinePhase.RUN_ATTACK)

🔒 ميزات الأمان

✅ الإدارة الآمنة لبيانات الاعتماد

  • لا توجد مفاتيح API مكتوبة مباشرة في الكود المصدري
  • إعداد قائم على متغيرات البيئة
  • دعم ملف .env مع التحقق من الصحة
  • معالجة آمنة للرموز لمصادقة HuggingFace

✅ التحقق من المدخلات

  • التحقق من متغيرات البيئة عند بدء التشغيل
  • التحقق من ملفات الإعداد
  • التحقق من أسماء النماذج ومعاملاتها

✅ معالجة الأخطاء

  • فئات استثناءات مخصصة لأنواع أخطاء مختلفة
  • تسجيل شامل للأخطاء
  • معالجة سليمة للأعطال

✅ أفضل الممارسات

  • مبدأ الامتياز الأدنى
  • إعدادات افتراضية آمنة
  • تسجيل شامل دون كشف بيانات حساسة

📚 مرجع API

أوامر CLI

run-pipeline

تشغيل خط أنابيب التقييم الكامل أو مراحل محددة.

الخيارات:

  • --models: قائمة النماذج المراد تقييمها
  • --phases: المراحل المحددة التي سيتم تشغيلها
  • --config-dir: مسار مجلد الإعدادات
  • --log-dir: مجلد الإخراج للسجلات

generate-attack

توليد مطالبات هجوم عدائية.

الخيارات:

  • --config: مسار ملف الإعداد
  • --num-samples: عدد العينات المطلوب توليدها
  • --seed: البذرة العشوائية لضمان إمكانية إعادة الإنتاج

run-attack

تنفيذ تقييم الهجوم ضد النماذج المستهدفة.

الخيارات:

  • --config: مسار ملف الإعداد
  • --model: اسم النموذج المستهدف
  • --num-samples: عدد العينات المطلوب معالجتها

eval-attack

تقييم نتائج الهجوم باستخدام نماذج الحكم.

الخيارات:

  • --config: مسار ملف الإعداد
  • --log-dir: المجلد الذي يحتوي سجلات الهجوم

run-refuse

تشغيل اختبار قدرة الرفض.

الخيارات:

  • --config: مسار ملف الإعداد
  • --model: اسم النموذج المستهدف
  • --num-samples: عدد العينات المطلوب اختبارها
  • --split: تقسيم مجموعة البيانات المطلوب استخدامه

eval-refuse

تقييم نتائج اختبار الرفض.

الخيارات:

  • --config: مسار ملف الإعداد
  • --log-dir: المجلد الذي يحتوي سجلات الرفض

score

حساب درجات السلامة من نتائج التقييم.

الخيارات:

  • --log-dir: المجلد الذي يحتوي سجلات التقييم
  • --keyword: الكلمة المفتاحية للبحث عنها في النتائج

فئات واجهة Python البرمجية

PipelineOrchestrator

إدارة مركزية لخط الأنابيب.

الطرق:

  • run_complete_pipeline(): تنفيذ خط أنابيب التقييم الكامل
  • run_phase(phase): تنفيذ مرحلة محددة من خط الأنابيب
  • get_phase_status(phase): الحصول على حالة مرحلة خط الأنابيب

EnvironmentConfig

إدارة البيئة والإعدادات.

الطرق:

  • from_env(): تحميل الإعدادات من متغيرات البيئة
  • validate(): التحقق من اكتمال الإعدادات
  • setup_logging(): إعداد نظام التسجيل

🤝 المساهمة

إعداد التطوير

  1. التفرع والاستنساخ

    root@kitploit:~
    git clone https://github.com/knoveleng/redeval.git
    cd redeval
    
  2. إنشاء بيئة التطوير

    root@kitploit:~
    python -m venv venv
    source venv/bin/activate  # On Windows: venv\Scripts\activate
    pip install -r requirements.txt
    
  3. إعداد خطافات pre-commit

    root@kitploit:~
    pip install pre-commit
    pre-commit install
    

إرشادات المساهمة

  • الأمان أولاً: لا تقم أبدًا بإرسال مفاتيح API أو بيانات حساسة
  • متغيرات البيئة: استخدم متغيرات البيئة لجميع الإعدادات
  • معالجة الأخطاء: أضف معالجة أخطاء مناسبة مع استثناءات مخصصة
  • التوثيق: حدّث التوثيق للميزات الجديدة
  • الاختبار: أضف اختبارات للوظائف الجديدة
  • التوافق العكسي: حافظ على التوافق مع الواجهات القائمة

أسلوب الكود

  • اتبع PEP 8 لكتابة بايثون
  • استخدم تلميحات الأنواع (type hints) عند الاقتضاء
  • أضف سلاسل توثيق (docstrings) شاملة
  • حافظ على أنماط تسجيل متسقة

📄 الترخيص

هذا المشروع مرخّص بموجب رخصة MIT - راجع ملف LICENSE للتفاصيل.

📚 الاستشهاد

إذا وجدت هذا المشروع مفيدًا، فيرجى التفكير في الاستشهاد به في بحثك:

root@kitploit:~
@inproceedings{
   dang2026redbench,
   title={RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models},
   author={Quy-Anh Dang and Chris Ngo and Truong-Son Hy},
   booktitle={ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities},
   year={2026},
   url={https://openreview.net/forum?id=7pZXyk0d07}
}
تنزيل الأداة
المتغيرالوصفالافتراضي
REDEVAL_PROJECT_ROOTمجلد جذر المشروعالمجلد الحالي
REDEVAL_LOG_DIRمجلد السجلات./logs
REDEVAL_RECIPES_DIRمجلد الإعدادات./recipes
REDEVAL_LOG_LEVELمستوى التسجيلINFO
REDEVAL_NUM_SAMPLESعدد عينات التقييم10
REDEVAL_SEEDالبذرة العشوائية0