Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
redeval — [ICLR 2026] - 論文の公式リポジトリ: "RedBench: 大規模言語モデルの包括的レッドチーミングのための普遍的なデータセット" | Kitploit
ツール/GitHubGitHub/knoveleng/redeval
論文と研究学習と教育厳選リソースAIセキュリティ敵対的攻撃
GitHubknoveleng/redeval

redeval

[ICLR 2026] - 論文の公式リポジトリ: "RedBench: 大規模言語モデルの包括的レッドチーミングのための普遍的なデータセット"

リポジトリを見る
2945ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有
ウェブサイト

RedEval - LLM 安全性評価フレームワーク

Python 3.8+ License: MIT Dataset on HF

システム的な攻撃テストと拒否テストを通じて、大規模言語モデル(LLM)の安全性を評価するための包括的なフレームワークです。RedEval は、敵対的プロンプトや有害コンテンツに対する LLM の堅牢性を評価するための、統一的かつ安全で拡張可能なプラットフォームを提供します。これは、LLM の包括的なレッドチーミングのためのユニバーサルデータセットである論文「RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models」の一部です。

📦 データセット: RedBench データセットは HuggingFace の knoveleng/redbench で公開されています。複数の安全性カテゴリとドメインにわたる包括的なレッドチーミングプロンプトが含まれています。

🚀 クイックスタート

1. 環境のセットアップ

root@kitploit:~
# Clone the repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Install dependencies
pip install -r requirements.txt

# Copy and configure environment variables
cp .env.template .env
# Edit .env with your API keys

2. API キーの設定

.env ファイルに資格情報を記述してください:

root@kitploit:~
OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. 評価の実行

root@kitploit:~
# Set up environment
source ./sh/setup_env.sh

# Run with default models, you can edit .env to define models which you wanna run
python -m redeval.cli run-pipeline

# Run complete pipeline with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Or run individual phases
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 目次

  • 概要
  • アーキテクチャ
  • インストール
  • 設定
  • 使用方法
  • セキュリティ機能
  • API リファレンス
  • コントリビューション
  • ライセンス

🎯 概要

RedEval は、2 つの相補的なアプローチを通じて LLM の安全性を評価します:

🔴 攻撃フェーズ

さまざまな脱獄(ジェイルブレイク)技術を使用して、敵対的プロンプトに対する LLM の脆弱性をテストします:

  • 直接攻撃: 単純明快な有害プロンプト
  • 人間による脱獄: 人間が作成したバイパス技術
  • ゼロショット攻撃: 自動化された敵対的プロンプト生成

🛡️ 拒否フェーズ

複数の安全性データセットにわたって、有害なリクエストを適切に拒否する LLM の能力を評価します:

  • CoCoNot: コンテキストを考慮したコンテンツモデレーション
  • SGXSTest: 安全ガイドラインの検証
  • XSTest: クロスドメイン安全性テスト
  • ORBench: 客観的な拒否ベンチマーク

📊 スコアリング

攻撃と拒否の両方のパフォーマンスを組み合わせた包括的な安全性メトリクスを計算します。

🏗️ アーキテクチャ

コアコンポーネント

root@kitploit:~
redeval/
├── redeval/                 # Core Python modules
│   ├── config.py           # Environment & configuration management
│   ├── pipeline.py         # Centralized pipeline orchestrator
│   ├── cli.py              # Unified command-line interface
│   ├── exceptions.py       # Custom exception handling
│   ├── generate_attack.py  # Attack prompt generation
│   ├── run_attack.py       # Attack execution
│   ├── eval_attack.py      # Attack evaluation
│   ├── run_refuse.py       # Refusal testing
│   ├── eval_refuse.py      # Refusal evaluation
│   └── score.py            # Metric calculation
├── sh/                     # Shell script interfaces
│   ├── setup_env.sh        # Environment setup
│   ├── generate_attack.sh  # Attack generation script
│   ├── run_attack.sh       # Attack execution script
│   ├── eval_attack.sh      # Attack evaluation script
│   ├── run_refuse.sh       # Refusal testing script
│   ├── eval_refuse.sh      # Refusal evaluation script
│   └── score.sh            # Scoring script
├── recipes/                # Configuration files
├── logs/                   # Evaluation results
└── .env                    # Environment variables

評価パイプライン

root@kitploit:~
graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ インストール

前提条件

  • Python 3.8 以上
  • OpenAI API キー
  • HuggingFace トークン
  • Git

ステップバイステップのインストール

  1. リポジトリのクローン

    root@kitploit:~
    git clone <repository-url>
    cd redeval
    
  2. 依存関係のインストール

    root@kitploit:~
    pip install -r requirements.txt
    
  3. 環境の設定

    root@kitploit:~
    cp .env.template .env
    # Edit .env with your API credentials
    
  4. インストールの確認

    root@kitploit:~
    python -m redeval.cli --help
    

⚙️ 設定

環境変数

RedEval は、安全で柔軟な設定のために環境変数を使用します:

必須変数

変数説明例
OPENAI_API_KEYOpenAI API キーsk-proj-...
HUGGINGFACE_TOKENHuggingFace トークンhf_...

オプション設定

モデル設定

変数説明デフォルト
REDEVAL_OPEN_SOURCE_MODELSオープンソースモデルのリスト"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSクローズドソースモデルのリスト"gpt-4o-mini"

設定ファイル

recipes/ ディレクトリ内の設定ファイルが評価パラメータを制御します:

  • attack/base-open.yml - オープンソースモデルの攻撃設定
  • attack/base-close.yml - クローズドソースモデルの攻撃設定
  • attack/eval.yml - 攻撃評価の設定
  • refuse/base-open.yml - オープンソースモデルの拒否設定
  • refuse/base-close.yml - クローズドソースモデルの拒否設定
  • refuse/eval.yml - 拒否評価の設定

🚀 使用方法

コマンドラインインターフェース

RedEval は、すべての操作のための統合 CLI を提供します:

パイプライン全体

root@kitploit:~
# Run full evaluation pipeline
python -m redeval.cli run-pipeline

# Run with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Run specific phases only
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

個別コンポーネント

root@kitploit:~
# Generate attack prompts
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Run attack evaluation
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate attack results
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name

# Run refusal tests
python -m redeval.cli run-refuse --config ./recipes/refuse/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate refusal results
python -m redeval.cli eval-refuse --config ./recipes/refuse/eval.yml --log-dir ./logs/refuse/CoCoNot/base/model_name

# Calculate scores
python -m redeval.cli score --log-dir ./logs/attack/HarmBench/direct/model_name --keyword "unsafe"

シェルスクリプトインターフェース

シェルスクリプトを好むユーザー向け:

root@kitploit:~
# Set up environment (run first)
source ./sh/setup_env.sh

# Run evaluation phases
./sh/generate_attack.sh    # Generate attack prompts
./sh/run_attack.sh         # Execute attacks
./sh/eval_attack.sh        # Evaluate attack results
./sh/run_refuse.sh         # Run refusal tests
./sh/eval_refuse.sh        # Evaluate refusal results
./sh/score.sh              # Calculate final scores

Python API

プログラムからのアクセス用:

root@kitploit:~
from redeval.pipeline import PipelineOrchestrator, PipelinePhase
from redeval.config import EnvironmentConfig

# Initialize configuration
config = EnvironmentConfig.from_env()

# Create pipeline orchestrator
orchestrator = PipelineOrchestrator(config)

# Run complete pipeline
orchestrator.run_complete_pipeline()

# Run specific phases
orchestrator.run_phase(PipelinePhase.GENERATE_ATTACK)
orchestrator.run_phase(PipelinePhase.RUN_ATTACK)

🔒 セキュリティ機能

✅ 安全な資格情報管理

  • ソースコードに API キーがハードコードされていない
  • 環境変数ベースの設定
  • 検証付き .env ファイルのサポート
  • HuggingFace 認証のための安全なトークン処理

✅ 入力検証

  • 起動時の環境変数検証
  • 設定ファイルの検証
  • モデル名とパラメータの検証

✅ エラーハンドリング

  • エラータイプごとのカスタム例外クラス
  • 包括的なエラーロギング
  • グレースフルな障害処理

✅ ベストプラクティス

  • 最小権限の原則
  • 安全なデフォルト設定
  • 機密データを公開しない包括的なロギング

📚 API リファレンス

CLI コマンド

run-pipeline

完全な評価パイプラインまたは特定のフェーズを実行します。

オプション:

  • --models: 評価するモデルのリスト
  • --phases: 実行する特定のフェーズ
  • --config-dir: 設定ディレクトリのパス
  • --log-dir: ログの出力ディレクトリ

generate-attack

敵対的攻撃プロンプトを生成します。

オプション:

  • --config: 設定ファイルのパス
  • --num-samples: 生成するサンプル数
  • --seed: 再現性のためのランダムシード

run-attack

ターゲットモデルに対する攻撃評価を実行します。

オプション:

  • --config: 設定ファイルのパス
  • --model: ターゲットモデル名
  • --num-samples: 処理するサンプル数

eval-attack

判定モデルを使用して攻撃結果を評価します。

オプション:

  • --config: 設定ファイルのパス
  • --log-dir: 攻撃ログを含むディレクトリ

run-refuse

拒否能力のテストを実行します。

オプション:

  • --config: 設定ファイルのパス
  • --model: ターゲットモデル名
  • --num-samples: テストするサンプル数
  • --split: 使用するデータセットの分割

eval-refuse

拒否テストの結果を評価します。

オプション:

  • --config: 設定ファイルのパス
  • --log-dir: 拒否ログを含むディレクトリ

score

評価結果から安全性スコアを計算します。

オプション:

  • --log-dir: 評価ログを含むディレクトリ
  • --keyword: 結果内を検索するキーワード

Python API クラス

PipelineOrchestrator

一元化されたパイプライン管理。

メソッド:

  • run_complete_pipeline(): 完全な評価パイプラインを実行
  • run_phase(phase): 特定のパイプラインフェーズを実行
  • get_phase_status(phase): パイプラインフェーズのステータスを取得

EnvironmentConfig

環境と設定の管理。

メソッド:

  • from_env(): 環境変数から設定を読み込む
  • validate(): 設定の完全性を検証
  • setup_logging(): ロギングシステムを設定

🤝 コントリビューション

開発環境のセットアップ

  1. フォークとクローン

    root@kitploit:~
    git clone https://github.com/knoveleng/redeval.git
    cd redeval
    
  2. 開発環境の作成

    root@kitploit:~
    python -m venv venv
    source venv/bin/activate  # On Windows: venv\Scripts\activate
    pip install -r requirements.txt
    
  3. Pre-commit フックのセットアップ

    root@kitploit:~
    pip install pre-commit
    pre-commit install
    

コントリビューションガイドライン

  • セキュリティ最優先: API キーや機密データをコミットしない
  • 環境変数: すべての設定に環境変数を使用する
  • エラーハンドリング: カスタム例外による適切なエラーハンドリングを追加する
  • ドキュメント: 新機能のドキュメントを更新する
  • テスト: 新機能のテストを追加する
  • 後方互換性: 既存のインターフェースとの互換性を維持する

コードスタイル

  • Python コードは PEP 8 に従う
  • 適切な場所で型ヒントを使用する
  • 包括的な docstring を追加する
  • 一貫したロギングパターンを維持する

📄 ライセンス

このプロジェクトは MIT ライセンスの下でライセンスされています。詳細は LICENSE ファイルを参照してください。

📚 引用

このプロジェクトが役立つと思われた場合は、研究で引用をご検討ください:

root@kitploit:~
@inproceedings{
   dang2026redbench,
   title={RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models},
   author={Quy-Anh Dang and Chris Ngo and Truong-Son Hy},
   booktitle={ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities},
   year={2026},
   url={https://openreview.net/forum?id=7pZXyk0d07}
}
ツールをダウンロード
変数説明デフォルト
REDEVAL_PROJECT_ROOTプロジェクトルートディレクトリカレントディレクトリ
REDEVAL_LOG_DIRログディレクトリ./logs
REDEVAL_RECIPES_DIR設定ディレクトリ./recipes
REDEVAL_LOG_LEVELログレベルINFO
REDEVAL_NUM_SAMPLES評価サンプル数10
REDEVAL_SEEDランダムシード0