Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
Rubrics-as-an-Attack-Surface — LLM जजों में रूब्रिक-प्रेरित प्राथमिकता बहाव (RIPD) के लिए शोध कोड: विकासवादी रूब्रिक खोज, बेंचमार्क-संरक्षण चयन, और DPO नीति असंरेखण मूल्यांकन। | Kitploit
उपकरण/GitHubGitHub/zdcslab/rubrics-as-an-attack-surface
मशीन लर्निंगपेपर और शोधलर्निंग और शिक्षाAI सुरक्षाप्रतिकूल हमला
GitHubzdcslab/rubrics-as-an-attack-surface

Rubrics-as-an-Attack-Surface

LLM जजों में रूब्रिक-प्रेरित प्राथमिकता बहाव (RIPD) के लिए शोध कोड: विकासवादी रूब्रिक खोज, बेंचमार्क-संरक्षण चयन, और DPO नीति असंरेखण मूल्यांकन।

रिपॉजिटरी देखें

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
6186 महीने पहलेअभी तक समीक्षित नहीं

रूब्रिक्स एक आक्रमण सतह के रूप में: LLM जजों में गुप्त प्राथमिकता बहाव

📊 डेटासेट  •  🤖 प्रशिक्षित मॉडल  •  📝 पेपर  •  💻 रेपो

Teaser

इस रेपो में Ruomeng Ding*, Yifei Pang*, He Sun, Yizhong Wang, Steven Wu, और Zhun Deng द्वारा लिखित पेपर Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges के लिए कोड शामिल है।

हम LLM-आधारित मूल्यांकन और संरेखण पाइपलाइनों में रूब्रिक-प्रेरित प्राथमिकता बहाव (RIPD) का अध्ययन करते हैं, यह दर्शाते हुए कि बेंचमार्क सत्यापन पास करने वाले रूब्रिक संपादन फिर भी लक्ष्य डोमेन पर व्यवस्थित, दिशात्मक प्राथमिकता बहाव उत्पन्न कर सकते हैं जिन्हें मानक मेट्रिक्स से पहचानना कठिन होता है। हम आगे रूब्रिक-आधारित प्राथमिकता आक्रमणों का प्रदर्शन करते हैं और दिखाते हैं कि परिणामी पूर्वाग्रह कैसे डाउनस्ट्रीम पोस्ट-ट्रेनिंग के माध्यम से फैलता है, जिससे स्थायी नीति विसंगति उत्पन्न होती है।

सेट अप

  1. Rubrics-as-an-Attack-Surface रेपो को क्लोन करें।
root@kitploit:~
    git clone https://github.com/ruomengd/Rubrics-as-an-Attack-Surface.git
    cd Rubrics-as-an-Attack-Surface
  1. वातावरण बनाएं।
root@kitploit:~
    conda create -n rubrics python=3.9
    conda activate rubrics
    pip install -r requirements.txt

डेटासेट

हम चार बेंचमार्क–लक्ष्य सेटिंग्स का निर्माण करने के लिए पांच मानव-प्राथमिकता डेटासेट (UltraFeedback, ChatbotArena, RMB, Anthropic hh-rlhf, PKU-SafeRLHF) का उपयोग करते हैं: सहायता के लिए Ultra-Real और Ultra-Creative (UltraFeedback → ChatbotArena), और हानिरहितता के लिए SafeRLHF–RMB और Anthropic–SafeRLHF। सभी डेटा को एक समान युग्म-वार प्राथमिकता प्रारूप में परिवर्तित किया जाता है; बेंचमार्क रूब्रिक संरक्षण लागू करते हैं, जबकि लक्ष्य तैनाती-प्रासंगिक प्राथमिकता बहाव को मापते हैं, जिसमें Ultra-Real और Anthropic–SafeRLHF पर डाउनस्ट्रीम नीति प्रयोग शामिल हैं।

स्क्रिप्ट्स

पूरी डेटा पाइपलाइन (डाउनलोड, प्रीप्रोसेसिंग, फ़िल्टरिंग, और डोमेन स्प्लिटिंग) इसके साथ चलाई जाती है:

root@kitploit:~
sh ./scripts/dataset.sh

वैकल्पिक रूप से, आप Hugging Face से डेटा सीधे डाउनलोड कर सकते हैं।

निर्देशिका संरचना

पाइपलाइन पूरी होने के बाद, निर्देशिका लेआउट इस प्रकार है:

root@kitploit:~
data/
├── helpfulness/
│   ├── Ultra-Real/
│   │   ├── Ultra-Real-Bench/
│   │   │   ├── train.jsonl
│   │   │   ├── val.jsonl
│   │   │   └── test.jsonl
│   │   └── Ultra-Real-Target/
│   │       ├── train.jsonl
│   │       ├── val.jsonl
│   │       └── test.jsonl
│   └── ...
├── harmlessness/
│   ├── Anthropic-SafeRLHF/
│   │   ├── Anthropic-SafeRLHF-Bench/
│   │   │   ├── train.jsonl
│   │   │   ├── val.jsonl
│   │   │   └── test.jsonl
│   │   └── Anthropic-SafeRLHF-Target/
│   │       ├── train.jsonl
│   │       ├── val.jsonl
│   │       └── test.jsonl
│   └── ...

बेंच बनाम लक्ष्य।
प्रत्येक डेटासेट कॉन्फ़िगरेशन के लिए, बेंच उस बेंचमार्क डोमेन को दर्शाता है जिसका उपयोग रूब्रिक विकास के दौरान किया जाता है, जबकि लक्ष्य एक होल्ड-आउट तैनाती डोमेन को दर्शाता है जिसका उपयोग सामान्यीकरण और प्राथमिकता बहाव का मूल्यांकन करने के लिए किया जाता है। रूब्रिक संपादन विशेष रूप से बेंच डोमेन पर सत्यापित किए जाते हैं और कभी भी लक्ष्य डेटा का उपयोग करके अनुकूलित नहीं किए जाते हैं।

डेटा स्प्लिट्स और उपयोग।

  • train.jsonl: रूब्रिक खोज और परिष्करण के लिए उपयोग किया जाता है।
  • val.jsonl: रूब्रिक चयन के लिए उपयोग किया जाता है, जो बेंचमार्क अनुपालन सुनिश्चित करता है।
  • test.jsonl: विशेष रूप से रूब्रिक-प्रेरित प्राथमिकता बहाव (RIPD) के मूल्यांकन के लिए उपयोग किया जाता है और रूब्रिक संपादन के दौरान इसे कभी एक्सेस नहीं किया जाता है।

पक्षपाती रूब्रिक खोज

रूब्रिक खोज कोड rubrics_search/search/ के अंतर्गत स्थित है और बेंचमार्क-संरक्षण लेकिन लक्ष्य-पक्षपाती रूब्रिक वेरिएंट खोजने के लिए एक जनसंख्या-आधारित विकासवादी प्रक्रिया को लागू करता है।

  1. main.py के साथ उम्मीदवार रूब्रिक्स उत्पन्न करने के लिए विकासवादी खोज चलाएं।
  2. select_rubrics.py के साथ प्रति पीढ़ी शीर्ष-k चुनें।
  3. बाद के चयन के लिए target-val पर चयनित रूब्रिक्स का मूल्यांकन करें (प्रेरित बहाव मापें)।
  4. बाद के चयन के लिए select_final.py के साथ target-val से चयनित रूब्रिक्स का मूल्यांकन करें।

पूरी रूब्रिक-खोज पाइपलाइन चलाने के लिए:

root@kitploit:~
sh ./scripts/rubrics_search_helpfulness.sh
sh ./scripts/rubrics_search_harmlessness.sh

रूब्रिक चयन

रूब्रिक्स को बेंचमार्क-संरक्षण बाधा के अंतर्गत चुना जाता है: उम्मीदवारों को एक होल्ड-आउट बेंचमार्क सत्यापन स्प्लिट पर सीड रूब्रिक के समझौते से मेल खाना या उससे अधिक होना चाहिए। व्यवहार्य उम्मीदवारों में से, हम वह रूब्रिक चुनते हैं जो लक्ष्य सत्यापन स्प्लिट पर समझौते को अधिकतम रूप से कम करता है।

root@kitploit:~
sh ./scripts/rubrics_selection.sh

अनुकूलित रूब्रिक्स की स्थानांतरणीयता का आकलन करने के लिए, हम क्रॉस-मॉडल मूल्यांकन के लिए स्क्रिप्ट्स प्रदान करते हैं। स्रोत मॉडल (Model A) पर अनुकूलित रूब्रिक्स लेने और लक्ष्य मॉडल (Model B) पर उनके प्रदर्शन का परीक्षण करने के लिए:

root@kitploit:~
sh ./scripts/rubrics_cross_model_eval.sh

डाउनस्ट्रीम नीति विसंगति मूल्यांकन

डाउनस्ट्रीम नीति विसंगति प्रयोगों के लिए, हम Ultra-Real (सहायता) और Anthropic–SafeRLHF (हानिरहितता) पर ध्यान केंद्रित करते हैं, चयनित रूब्रिक्स द्वारा उत्पन्न प्राथमिकता लेबल्स पर सीधे नीति मॉडल को प्रशिक्षित करते हुए।

DPO प्रशिक्षण

  1. चयनित रूब्रिक्स का उपयोग करके प्राथमिकता लेबल्स उत्पन्न करें:
root@kitploit:~
sh scripts/dpo_labelling.sh
  1. लेबल किए गए प्रशिक्षण डेटा के साथ नीति को प्रशिक्षित करें:
root@kitploit:~
sh scripts/dpo_train.sh

नीति मूल्यांकन

मूल्यांकन पाइपलाइन चलाएं (आप चरणों का कोई भी उपसमूह निष्पादित कर सकते हैं) इसके माध्यम से:

root@kitploit:~
sh scripts/dpo_eval.sh

मूल्यांकन स्क्रिप्ट निम्नलिखित चरणों का समर्थन करती है:

  • मॉडल प्रतिक्रियाएं उत्पन्न करें
  • प्रतिक्रियाओं को स्कोर करें (evaluators/reward models का उपयोग करके)
  • जीत-दर का विश्लेषण करें
  • Best-of-N (BoN) प्रतिक्रियाएं चुनें
  • तीसरे पक्ष के जज के साथ अंतिम आउटपुट का मूल्यांकन करें

हमारे काम को उद्धृत करें

root@kitploit:~
@misc{ding2026rubricsattacksurfacestealthy,
      title={Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges}, 
      author={Ruomeng Ding and Yifei Pang and He Sun and Yizhong Wang and Zhiwei Steven Wu and Zhun Deng},
      year={2026},
      eprint={2602.13576},
      archivePrefix={arXiv},
      primaryClass={cs.CR},
      url={https://arxiv.org/abs/2602.13576}, 
}
टूल डाउनलोड करें