Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
Rubrics-as-an-Attack-Surface — LLMジャッジにおけるRubric-Induced Preference Drift(RIPD)の研究コード:進化的ルーブリック探索、ベンチマーク保持型選択、DPOポリシーのミスアラインメント評価。 | Kitploit
ツール/GitHubGitHub/zdcslab/rubrics-as-an-attack-surface
機械学習論文と研究学習と教育AIセキュリティ敵対的攻撃
GitHubzdcslab/rubrics-as-an-attack-surface

Rubrics-as-an-Attack-Surface

LLMジャッジにおけるRubric-Induced Preference Drift(RIPD)の研究コード:進化的ルーブリック探索、ベンチマーク保持型選択、DPOポリシーのミスアラインメント評価。

リポジトリを見る

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有
6186ヶ月前未レビュー

攻撃対象としてのルーブリック: LLM審査員におけるステルスな選好ドリフト

📊 データセット  •  🤖 学習済みモデル  •  📝 論文  •  💻 リポジトリ

Teaser

このリポジトリには、Ruomeng Ding*、Yifei Pang*、He Sun、Yizhong Wang、Steven Wu、Zhun Dengによる論文攻撃対象としてのルーブリック: LLM審査員におけるステルスな選好ドリフトのコードが含まれています。

我々は、LLMベースの評価およびアラインメントパイプラインにおける**ルーブリック誘発選好ドリフト(RIPD)**を研究し、ベンチマーク検証を通過するルーブリック編集が、標準的な指標では検出が困難な対象ドメインにおいて、体系的かつ方向性のある選好ドリフトを引き起こし得ることを示します。さらに、ルーブリックベースの選好攻撃を実証し、その結果生じるバイアスが下流のポストトレーニングを通じて伝播し、持続的なポリシーのミスアラインメントにつながることを示します。

セットアップ

  1. Rubrics-as-an-Attack-Surfaceリポジトリをクローンします。
root@kitploit:~
    git clone https://github.com/ruomengd/Rubrics-as-an-Attack-Surface.git
    cd Rubrics-as-an-Attack-Surface
  1. 環境を作成します。
root@kitploit:~
    conda create -n rubrics python=3.9
    conda activate rubrics
    pip install -r requirements.txt

データセット

我々は5つの人間選好データセット(UltraFeedback、ChatbotArena、RMB、Anthropic hh-rlhf、PKU-SafeRLHF)を使用して、4つのベンチマーク–ターゲット設定を構築します: 有用性のためのUltra-RealとUltra-Creative(UltraFeedback → ChatbotArena)、および無害性のためのSafeRLHF–RMBとAnthropic–SafeRLHFです。すべてのデータは統一されたペアワイズ選好形式に変換されます。ベンチマークはルーブリックの保持を強制し、ターゲットはデプロイに関連する選好ドリフトを測定します。下流のポリシー実験はUltra-RealとAnthropic–SafeRLHFで行います。

スクリプト

完全なデータパイプライン(ダウンロード、前処理、フィルタリング、ドメイン分割)は次で実行します:

root@kitploit:~
sh ./scripts/dataset.sh

あるいは、Hugging Faceからデータを直接ダウンロードすることもできます。

ディレクトリ構造

パイプライン完了後のディレクトリレイアウトは次のとおりです:

root@kitploit:~
data/
├── helpfulness/
│   ├── Ultra-Real/
│   │   ├── Ultra-Real-Bench/
│   │   │   ├── train.jsonl
│   │   │   ├── val.jsonl
│   │   │   └── test.jsonl
│   │   └── Ultra-Real-Target/
│   │       ├── train.jsonl
│   │       ├── val.jsonl
│   │       └── test.jsonl
│   └── ...
├── harmlessness/
│   ├── Anthropic-SafeRLHF/
│   │   ├── Anthropic-SafeRLHF-Bench/
│   │   │   ├── train.jsonl
│   │   │   ├── val.jsonl
│   │   │   └── test.jsonl
│   │   └── Anthropic-SafeRLHF-Target/
│   │       ├── train.jsonl
│   │       ├── val.jsonl
│   │       └── test.jsonl
│   └── ...

Bench対Target。
各データセット設定において、Benchはルーブリック開発中に使用されるベンチマークドメインを表し、Targetは汎化と選好ドリフトを評価するために使用されるホールドアウトされたデプロイドメインを表します。ルーブリック編集はBenchドメインでのみ検証され、Targetデータを使用して最適化されることは決してありません。

データ分割と使用方法。

  • train.jsonl: ルーブリックの探索と改良に使用されます。
  • val.jsonl: ルーブリックの選択に使用され、ベンチマーク準拠を保証します。
  • test.jsonl: ルーブリック誘発選好ドリフト(RIPD)の評価にのみ使用され、ルーブリック編集中にアクセスされることは決してありません。

バイアス付きルーブリック探索

ルーブリック探索コードはrubrics_search/search/以下にあり、ベンチマークを保持しつつ、ターゲットにバイアスを持つルーブリック変種を見つけるための、集団ベースの進化的手続きを実装しています。

  1. main.pyで進化的探索を実行し、候補ルーブリックを生成します。
  2. select_rubrics.pyで各世代ごとにトップkを選択します。
  3. 選択されたルーブリックをtarget-valで評価し(誘発されたドリフトを測定)、後の選択に備えます。
  4. target-valから選択されたルーブリックをselect_final.pyで評価し、後の選択に備えます。

完全なルーブリック探索パイプラインを実行するには:

root@kitploit:~
sh ./scripts/rubrics_search_helpfulness.sh
sh ./scripts/rubrics_search_harmlessness.sh

ルーブリック選択

ルーブリックはベンチマーク保持制約の下で選択されます: 候補は、ホールドアウトされたベンチマーク検証分割において、シードルーブリックの一致度と同等かそれを上回る必要があります。実行可能な候補の中から、ターゲット検証分割での一致度を最大限に低下させるルーブリックを選択します。

root@kitploit:~
sh ./scripts/rubrics_selection.sh

最適化されたルーブリックの転移可能性を評価するために、クロスモデル評価用のスクリプトを提供しています。ソースモデル(モデルA)で最適化されたルーブリックを取得し、ターゲットモデル(モデルB)での性能をテストするには:

root@kitploit:~
sh ./scripts/rubrics_cross_model_eval.sh

下流のポリシーミスアラインメント評価

下流のポリシーミスアラインメント実験では、Ultra-Real(有用性)とAnthropic–SafeRLHF(無害性)に焦点を当て、選択されたルーブリックによって生成された選好ラベルでポリシーモデルを直接学習させます。

DPOトレーニング

  1. 選択されたルーブリックを使用して選好ラベルを生成します:
root@kitploit:~
sh scripts/dpo_labelling.sh
  1. ラベル付きトレーニングデータでポリシーを学習させます:
root@kitploit:~
sh scripts/dpo_train.sh

ポリシー評価

評価パイプラインを実行します(任意のステップのサブセットを実行できます):

root@kitploit:~
sh scripts/dpo_eval.sh

評価スクリプトは以下のステージをサポートしています:

  • モデル応答の生成
  • 応答のスコアリング(評価器/報酬モデルを使用)
  • 勝率の分析
  • Best-of-N (BoN)応答の選択
  • サードパーティ審査員による最終出力の評価

我々の研究を引用する

root@kitploit:~
@misc{ding2026rubricsattacksurfacestealthy,
      title={Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges}, 
      author={Ruomeng Ding and Yifei Pang and He Sun and Yizhong Wang and Zhiwei Steven Wu and Zhun Deng},
      year={2026},
      eprint={2602.13576},
      archivePrefix={arXiv},
      primaryClass={cs.CR},
      url={https://arxiv.org/abs/2602.13576}, 
}
ツールをダウンロード