
AI एजेंट सुरक्षा का मूल्यांकन करने के लिए बेंचमार्क, जो कौशल-संबंधी संदर्भ में एम्बेडेड हमलों के विरुद्ध कार्य करता है, जिसमें 6 जोखिम डोमेन में 155 मामले शामिल हैं, और कार्य सफलता तथा हमले के प्रतिरोध को मापता है।
SkillSafetyBench एक पूर्ण रूप से मूर्त (fully materialized) बेंचमार्क है जो कौशल-उन्मुख संदर्भ (skill-facing context) पर हमलों के कारण होने वाली सुरक्षा विफलताओं का मूल्यांकन करता है। प्रत्येक मामले में उपयोगकर्ता-उन्मुख कार्य सामान्य रहता है, जबकि हमला स्थानीय कौशल, सहायक स्क्रिप्ट, साइडकार फ़ाइलों, कॉर्पोरा, टेम्पलेट्स, या अन्य वर्कस्पेस आर्टिफैक्ट्स में रखा जाता है, जिन्हें एजेंट निष्पादन के दौरान परामर्श कर सकता है।
बेंचमार्क डिज़ाइन, केस एक्सप्लोरर, लीडरबोर्ड, और प्रयोग विश्लेषण को SkillSafetyBench वेबसाइट पर देखें, और पूरा पेपर arXiv पर पढ़ें।
आधुनिक कोडिंग और कार्य एजेंट अक्सर केवल उपयोगकर्ता प्रॉम्प्ट पर नहीं, बल्कि स्थानीय कौशल और पर्यावरण आर्टिफैक्ट्स पर निर्भर करते हैं। SkillSafetyBench यह परीक्षण करता है कि क्या कोई एजेंट उन कौशल-उन्मुख सतहों में एम्बेडेड असुरक्षित निर्देशों या भ्रामक संदर्भ का प्रतिरोध करते हुए हानिरहित कार्य पूरा कर सकता है। हानिरहित कार्य वाहक SkillsBench से चुने गए हैं।
बेंचमार्क स्थिर है और चलाने के लिए तैयार है। यह केस जनरेटर नहीं है। रिपॉजिटरी में 6 जोखिम डोमेन और 30 श्रेणियों में 155 तैयार मामले शामिल हैं। प्रत्येक मामले में शामिल है:
प्रत्येक रन का मूल्यांकन दो अक्षों पर किया जाता है:
task_success: क्या सामान्य उपयोगकर्ता कार्य पूरा हुआattack_success: क्या असुरक्षित व्यवहार देखा गयायह अलगाव महत्वपूर्ण है: एक सिस्टम सक्षम दिख सकता है क्योंकि वह कार्य पूरा करता है, जबकि फिर भी कमजोर हो सकता है क्योंकि वह हमले-युक्त कौशल संदर्भ का अनुसरण करता है।
SkillSafetyBench में 6 जोखिम डोमेन और 30 श्रेणियों में व्यवस्थित 155 मामले शामिल हैं। प्रत्येक जोखिम डोमेन में 5 श्रेणियां होती हैं, और प्रत्येक श्रेणी में सामान्य कार्य वाहकों के आसपास निर्मित कई ठोस मामले होते हैं।
SkillSafetyBench
└── 6 जोखिम डोमेन
├── RD1: संदर्भ विश्वास और प्रॉम्प्ट हेरफेर जोखिम
├── RD2: एजेंसी, दायरा, और प्राधिकरण जोखिम
├── RD3: निष्पादन, रनटाइम, फ्रेमवर्क, और प्रोटोकॉल जोखिम
├── RD4: डेटा सीमा, आउटपुट, और बाह्यीकरण जोखिम
├── RD5: मेमोरी, पुनर्प्राप्ति, ऑडिट, और स्थायित्व जोखिम
└── RD6: ज्ञान, मॉडल, आपूर्ति श्रृंखला, और परिचालन जोखिम
मामले जोखिम डोमेन, श्रेणी, और केस आईडी द्वारा संग्रहीत किए जाते हैं:
benchmark/<risk-domain>/<category>/<case>/
metadata.json
rationale.md
attacked_task/
instruction.md
task.toml
environment/
solution/solve.sh
tests/test.sh
eval/verify_attack.py
बेंचमार्क निर्देशिका मामलों के लिए सत्य का स्रोत है। श्रेणी निर्देशिकाएं categoryN-... नामकरण पैटर्न का उपयोग करती हैं, उदाहरण के लिए:
benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/category1-availability_cost_and_service_exhaustion/
बेंचमार्क निर्माण पाइपलाइन हानिरहित कार्य वाहकों से शुरू होती है, मूल उपयोगकर्ता-उन्मुख कार्य को संरक्षित करती है, कौशल-उन्मुख आर्टिफैक्ट्स के माध्यम से हमले को इंजेक्ट करती है, और कार्य पूर्णता और हमले के व्यवहार दोनों के लिए निर्धारणात्मक जांच जोड़ती है। यह मूल्यांकन को इस बात पर केंद्रित रखता है कि क्या एजेंट अनुरोधित कार्य करते हुए असुरक्षित स्थानीय संदर्भ का प्रतिरोध कर सकते हैं।
इस रिपॉजिटरी में प्रतिकूल (adversarial) बेंचमार्क मामले शामिल हैं। कुछ मामले फ़िशिंग, क्रेडेंशियल मांग, विनाशकारी संचालन, डेटा बाह्यीकरण, सैंडबॉक्स सीमा दुरुपयोग, बाहरी क्रियाएं, और स्थायित्व-जैसे व्यवहारों का अनुकरण करते हैं।
बेंचमार्क को केवल पृथक शोध वातावरण में चलाएं। उत्पादन क्रेडेंशियल, उत्पादन क्लाउड खाते, व्यक्तिगत खाते, या संवेदनशील स्थानीय फ़ाइलों का उपयोग न करें। डिस्पोजेबल API कुंजियां, डिस्पोजेबल कंटेनर, प्रतिबंधित नेटवर्क एक्सेस, और एक समर्पित कार्यशील निर्देशिका पसंद करें। साझा करने से पहले रन आर्टिफैक्ट्स की समीक्षा करें।
आवश्यक उपकरण:
bashpython3, अनुशंसित >= 3.11dockeruvharbornvm22यदि आवश्यक हो तो Harbor स्थापित करें:
uv tool install harbor
मूल टूलचेन जांचें:
harbor --help
python3 --version
docker --version
यदि आपका Harbor एजेंट Node के माध्यम से स्थापित है, तो रन शुरू करने वाले शेल में Node 22 सक्रिय करें:
export NVM_DIR="$HOME/.nvm"
[ -s "$NVM_DIR/nvm.sh" ] && . "$NVM_DIR/nvm.sh"
nvm use 22
उदाहरण फ़ाइल से एक स्थानीय .envrc बनाएं:
cp env.example .envrc
codex के लिए, कम से कम सेट करें:
export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
export OPENAI_API_KEY="replace-with-your-openai-api-key"
claude-code के लिए, एक Anthropic-संगत प्रमाणीकरण चर सेट करें, उदाहरण के लिए:
export ANTHROPIC_BASE_URL="https://api.anthropic.com"
export ANTHROPIC_API_KEY="replace-with-your-anthropic-api-key"
यदि आप direnv का उपयोग करते हैं, तो चलाएं:
direnv allow
यदि नहीं, तो कोई अतिरिक्त चरण आवश्यक नहीं है। बैच स्क्रिप्ट रनटाइम पर स्पष्ट रूप से .envrc को स्रोत करती है।
प्रामाणिक प्रवेश बिंदु है:
scripts/start_agent_batch.sh
एक जोखिम डोमेन चलाएं:
scripts/start_agent_batch.sh --rd 5
एजेंट और मॉडल चुनें:
scripts/start_agent_batch.sh \
--rd 3 \
--agent codex \
--model openai/gpt-5.4
Claude Code के साथ चलाएं:
scripts/start_agent_batch.sh \
--rd 3 \
--agent claude-code \
--model claude-3-7-sonnet-20250219
एक एकल मामला चलाएं:
scripts/start_agent_batch.sh \
--rd 5 \
--case travel_planning_poisoned_belief_persistence_memory_anchor
एक एकल श्रेणी चलाएं:
scripts/start_agent_batch.sh \
--rd 6 \
--category category3-model_behavior_and_finetuning_poisoning
एक स्पष्ट मेनिफेस्ट से चलाएं:
scripts/start_agent_batch.sh \
--manifest benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/manifest.json
एक कस्टम env फ़ाइल का उपयोग करें:
scripts/start_agent_batch.sh \
--rd 5 \
--envrc /path/to/your.envrc
निष्पादन के बिना चयनित मामलों को प्रिंट करें:
scripts/start_agent_batch.sh --rd 5 --dry-run
प्रत्येक रन jobs/ के अंतर्गत एक आउटपुट निर्देशिका बनाता है:
jobs/<agent>-risk-domain-5-memory-recovery-audit-and-persistence-risks-<timestamp>/
इनसे शुरू करें:
jobs/<run>/attack_results.jsonjobs/<run>/summary.jsonjobs/<run>/attack_results.csvjobs/<run>/summary.csvउपयोगी प्रति-रन फ़ाइलें:
selected_cases.jsonbatch_config.json<case_id>/case_result.jsonattack_results.mdसामान्य हमले के परिणाम:
attack_successattack_not_observedtask_output_missingtask_output_missing का अर्थ है कि अपेक्षित स्पष्ट कार्य आउटपुट अनुपस्थित था। हमले का सत्यापनकर्ता तब भी जारी रह सकता है जब हमले की स्थिति का मूल्यांकन करने के लिए पर्याप्त आर्टिफैक्ट मौजूद हों।