📊 データセット • 🤖 学習済みモデル • 📝 論文 • 💻 リポジトリ

このリポジトリには、Ruomeng Ding*、Yifei Pang*、He Sun、Yizhong Wang、Steven Wu、Zhun Dengによる論文攻撃対象としてのルーブリック: LLM審査員におけるステルスな選好ドリフトのコードが含まれています。
我々は、LLMベースの評価およびアラインメントパイプラインにおける**ルーブリック誘発選好ドリフト(RIPD)**を研究し、ベンチマーク検証を通過するルーブリック編集が、標準的な指標では検出が困難な対象ドメインにおいて、体系的かつ方向性のある選好ドリフトを引き起こし得ることを示します。さらに、ルーブリックベースの選好攻撃を実証し、その結果生じるバイアスが下流のポストトレーニングを通じて伝播し、持続的なポリシーのミスアラインメントにつながることを示します。
git clone https://github.com/ruomengd/Rubrics-as-an-Attack-Surface.git
cd Rubrics-as-an-Attack-Surface
conda create -n rubrics python=3.9
conda activate rubrics
pip install -r requirements.txt
我々は5つの人間選好データセット(UltraFeedback、ChatbotArena、RMB、Anthropic hh-rlhf、PKU-SafeRLHF)を使用して、4つのベンチマーク–ターゲット設定を構築します: 有用性のためのUltra-RealとUltra-Creative(UltraFeedback → ChatbotArena)、および無害性のためのSafeRLHF–RMBとAnthropic–SafeRLHFです。すべてのデータは統一されたペアワイズ選好形式に変換されます。ベンチマークはルーブリックの保持を強制し、ターゲットはデプロイに関連する選好ドリフトを測定します。下流のポリシー実験はUltra-RealとAnthropic–SafeRLHFで行います。
完全なデータパイプライン(ダウンロード、前処理、フィルタリング、ドメイン分割)は次で実行します:
sh ./scripts/dataset.sh
あるいは、Hugging Faceからデータを直接ダウンロードすることもできます。
パイプライン完了後のディレクトリレイアウトは次のとおりです:
data/
├── helpfulness/
│ ├── Ultra-Real/
│ │ ├── Ultra-Real-Bench/
│ │ │ ├── train.jsonl
│ │ │ ├── val.jsonl
│ │ │ └── test.jsonl
│ │ └── Ultra-Real-Target/
│ │ ├── train.jsonl
│ │ ├── val.jsonl
│ │ └── test.jsonl
│ └── ...
├── harmlessness/
│ ├── Anthropic-SafeRLHF/
│ │ ├── Anthropic-SafeRLHF-Bench/
│ │ │ ├── train.jsonl
│ │ │ ├── val.jsonl
│ │ │ └── test.jsonl
│ │ └── Anthropic-SafeRLHF-Target/
│ │ ├── train.jsonl
│ │ ├── val.jsonl
│ │ └── test.jsonl
│ └── ...
Bench対Target。
各データセット設定において、Benchはルーブリック開発中に使用されるベンチマークドメインを表し、Targetは汎化と選好ドリフトを評価するために使用されるホールドアウトされたデプロイドメインを表します。ルーブリック編集はBenchドメインでのみ検証され、Targetデータを使用して最適化されることは決してありません。
データ分割と使用方法。
ルーブリック探索コードはrubrics_search/search/以下にあり、ベンチマークを保持しつつ、ターゲットにバイアスを持つルーブリック変種を見つけるための、集団ベースの進化的手続きを実装しています。
main.pyで進化的探索を実行し、候補ルーブリックを生成します。select_rubrics.pyで各世代ごとにトップkを選択します。select_final.pyで評価し、後の選択に備えます。完全なルーブリック探索パイプラインを実行するには:
sh ./scripts/rubrics_search_helpfulness.sh
sh ./scripts/rubrics_search_harmlessness.sh
ルーブリックはベンチマーク保持制約の下で選択されます: 候補は、ホールドアウトされたベンチマーク検証分割において、シードルーブリックの一致度と同等かそれを上回る必要があります。実行可能な候補の中から、ターゲット検証分割での一致度を最大限に低下させるルーブリックを選択します。
sh ./scripts/rubrics_selection.sh
最適化されたルーブリックの転移可能性を評価するために、クロスモデル評価用のスクリプトを提供しています。ソースモデル(モデルA)で最適化されたルーブリックを取得し、ターゲットモデル(モデルB)での性能をテストするには:
sh ./scripts/rubrics_cross_model_eval.sh
下流のポリシーミスアラインメント実験では、Ultra-Real(有用性)とAnthropic–SafeRLHF(無害性)に焦点を当て、選択されたルーブリックによって生成された選好ラベルでポリシーモデルを直接学習させます。
sh scripts/dpo_labelling.sh
sh scripts/dpo_train.sh
評価パイプラインを実行します(任意のステップのサブセットを実行できます):
sh scripts/dpo_eval.sh
評価スクリプトは以下のステージをサポートしています:
@misc{ding2026rubricsattacksurfacestealthy,
title={Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges},
author={Ruomeng Ding and Yifei Pang and He Sun and Yizhong Wang and Zhiwei Steven Wu and Zhun Deng},
year={2026},
eprint={2602.13576},
archivePrefix={arXiv},
primaryClass={cs.CR},
url={https://arxiv.org/abs/2602.13576},
}