Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
redeval — [ICLR 2026] — Официальный репозиторий статьи: «RedBench: универсальный набор данных для всестороннего red teaming больших языковых моделей» | Kitploit
Инструменты/GitHubGitHub/knoveleng/redeval
Статьи и ИсследованияОбучение и ОбразованиеПодобранные РесурсыБезопасность ИИСостязательная Атака
GitHubknoveleng/redeval

redeval

[ICLR 2026] — Официальный репозиторий статьи: «RedBench: универсальный набор данных для всестороннего red teaming больших языковых моделей»

Репозиторий
294127 месяцев назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Сайт

RedEval - фреймворк для оценки безопасности LLM

Python 3.8+ License: MIT Dataset on HF

Комплексный фреймворк для оценки безопасности больших языковых моделей (LLM) с помощью систематического тестирования атак и отказов. RedEval предоставляет унифицированную, безопасную и расширяемую платформу для оценки устойчивости LLM к состязательным промптам и вредоносному контенту. Она является частью статьи "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models", которая представляет собой универсальный набор данных для комплексного red teaming LLM.

📦 Набор данных: Набор данных RedBench публично доступен на HuggingFace по адресу knoveleng/redbench. Он включает комплексные промпты для red teaming по множеству категорий безопасности и доменов.

🚀 Быстрый старт

1. Настройка окружения

# Clone the repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Install dependencies
pip install -r requirements.txt

# Copy and configure environment variables
cp .env.template .env
# Edit .env with your API keys

2. Настройка API-ключей

Отредактируйте файл .env, указав свои учётные данные:

OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. Запуск оценки

# Set up environment
source ./sh/setup_env.sh

# Run with default models, you can edit .env to define models which you wanna run
python -m redeval.cli run-pipeline

# Run complete pipeline with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Or run individual phases
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 Содержание

  • Обзор
  • Архитектура
  • Установка
  • Конфигурация
  • Использование
  • Функции безопасности
  • Справочник API
  • Участие в разработке
  • Лицензия

🎯 Обзор

RedEval оценивает безопасность LLM с помощью двух взаимодополняющих подходов:

🔴 Этап атаки

Проверяет уязвимость LLM к состязательным промптам с помощью различных техник джейлбрейка:

  • Прямые атаки: прямые вредоносные промпты
  • Человеческие джейлбрейки: обходные техники, созданные человеком
  • Zero-shot атаки: автоматическая генерация состязательных промптов

🛡️ Этап отказа

Оценивает способность LLM корректно отказывать в выполнении вредоносных запросов на основе нескольких наборов данных по безопасности:

  • CoCoNot: контекстно-зависимая модерация контента
  • SGXSTest: проверка правил безопасности
  • XSTest: кросс-доменное тестирование безопасности
  • ORBench: объективное бенчмаркирование отказов

📊 Оценка

Вычисляет комплексные метрики безопасности, объединяющие показатели как атак, так и отказов.

🏗️ Архитектура

Основные компоненты

redeval/
├── redeval/                 # Core Python modules
│   ├── config.py           # Environment & configuration management
│   ├── pipeline.py         # Centralized pipeline orchestrator
│   ├── cli.py              # Unified command-line interface
│   ├── exceptions.py       # Custom exception handling
│   ├── generate_attack.py  # Attack prompt generation
│   ├── run_attack.py       # Attack execution
│   ├── eval_attack.py      # Attack evaluation
│   ├── run_refuse.py       # Refusal testing
│   ├── eval_refuse.py      # Refusal evaluation
│   └── score.py            # Metric calculation
├── sh/                     # Shell script interfaces
│   ├── setup_env.sh        # Environment setup
│   ├── generate_attack.sh  # Attack generation script
│   ├── run_attack.sh       # Attack execution script
│   ├── eval_attack.sh      # Attack evaluation script
│   ├── run_refuse.sh       # Refusal testing script
│   ├── eval_refuse.sh      # Refusal evaluation script
│   └── score.sh            # Scoring script
├── recipes/                # Configuration files
├── logs/                   # Evaluation results
└── .env                    # Environment variables

Конвейер оценки

graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ Установка

Предварительные требования

  • Python 3.8 или выше
  • API-ключ OpenAI
  • Токен HuggingFace
  • Git

Пошаговая установка

  1. Клонирование репозитория

    git clone <repository-url>
    cd redeval
    
  2. Установка зависимостей

    pip install -r requirements.txt
    
  3. Настройка окружения

    cp .env.template .env
    # Edit .env with your API credentials
    
  4. Проверка установки

    python -m redeval.cli --help
    

⚙️ Конфигурация

Переменные окружения

RedEval использует переменные окружения для безопасной и гибкой настройки:

Обязательные переменные

ПеременнаяОписаниеПример
OPENAI_API_KEYAPI-ключ OpenAIsk-proj-...
HUGGINGFACE_TOKENТокен HuggingFacehf_...

Необязательные параметры конфигурации

ПеременнаяОписаниеПо умолчанию
REDEVAL_PROJECT_ROOTКорневой каталог проектаТекущий каталог
REDEVAL_LOG_DIRКаталог журналов./logs
REDEVAL_RECIPES_DIRКаталог конфигураций./recipes
REDEVAL_LOG_LEVELУровень журналированияINFO
REDEVAL_NUM_SAMPLESКоличество образцов для оценки10
REDEVAL_SEEDСлучайное зерно (seed)0

Конфигурация моделей

ПеременнаяОписаниеПо умолчанию
REDEVAL_OPEN_SOURCE_MODELSСписок моделей с открытым исходным кодом"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSСписок проприетарных моделей"gpt-4o-mini"

Файлы конфигурации

Файлы конфигурации в каталоге recipes/ управляют параметрами оценки:

  • attack/base-open.yml — конфигурация атак для моделей с открытым исходным кодом
  • attack/base-close.yml — конфигурация атак для проприетарных моделей
  • attack/eval.yml — конфигурация оценки атак
  • refuse/base-open.yml — конфигурация отказов для моделей с открытым исходным кодом
  • refuse/base-close.yml — конфигурация отказов для проприетарных моделей
  • refuse/eval.yml — конфигурация оценки отказов

🚀 Использование

Интерфейс командной строки

RedEval предоставляет единый CLI для всех операций:

Полный конвейер

# Run full evaluation pipeline
python -m redeval.cli run-pipeline

# Run with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Run specific phases only
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

Отдельные компоненты

# Generate attack prompts
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Run attack evaluation
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate attack results
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name

# Run refusal tests
python -m redeval.cli run-refuse --config ./recipes/refuse/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"
Скачать инструмент