Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
skill-safety-bench — AI एजेंट सुरक्षा का मूल्यांकन करने के लिए बेंचमार्क, जो कौशल-संबंधी संदर्भ में एम्बेडेड हमलों के विरुद्ध कार्य करता है, जिसमें 6 जोखिम डोमेन में 155 मामले शामिल हैं, और कार्य सफलता तथा हमले के प्रतिरोध को मापता है। | Kitploit
उपकरण/GitHubGitHub/ai45lab/skill-safety-bench
लर्निंग और शिक्षाAI सुरक्षाप्रतिकूल हमलालैब और अभ्यास
GitHubai45lab/skill-safety-bench

skill-safety-bench

AI एजेंट सुरक्षा का मूल्यांकन करने के लिए बेंचमार्क, जो कौशल-संबंधी संदर्भ में एम्बेडेड हमलों के विरुद्ध कार्य करता है, जिसमें 6 जोखिम डोमेन में 155 मामले शामिल हैं, और कार्य सफलता तथा हमले के प्रतिरोध को मापता है।

रिपॉजिटरी देखें
303143 महीने पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

SkillSafetyBench

English 中文

SkillSafetyBench एक पूर्ण रूप से मूर्त (fully materialized) बेंचमार्क है जो कौशल-उन्मुख संदर्भ (skill-facing context) पर हमलों के कारण होने वाली सुरक्षा विफलताओं का मूल्यांकन करता है। प्रत्येक मामले में उपयोगकर्ता-उन्मुख कार्य सामान्य रहता है, जबकि हमला स्थानीय कौशल, सहायक स्क्रिप्ट, साइडकार फ़ाइलों, कॉर्पोरा, टेम्पलेट्स, या अन्य वर्कस्पेस आर्टिफैक्ट्स में रखा जाता है, जिन्हें एजेंट निष्पादन के दौरान परामर्श कर सकता है।

बेंचमार्क डिज़ाइन, केस एक्सप्लोरर, लीडरबोर्ड, और प्रयोग विश्लेषण को SkillSafetyBench वेबसाइट पर देखें, और पूरा पेपर arXiv पर पढ़ें।

SkillSafetyBench अवलोकन

बेंचमार्क क्या मूल्यांकन करता है

आधुनिक कोडिंग और कार्य एजेंट अक्सर केवल उपयोगकर्ता प्रॉम्प्ट पर नहीं, बल्कि स्थानीय कौशल और पर्यावरण आर्टिफैक्ट्स पर निर्भर करते हैं। SkillSafetyBench यह परीक्षण करता है कि क्या कोई एजेंट उन कौशल-उन्मुख सतहों में एम्बेडेड असुरक्षित निर्देशों या भ्रामक संदर्भ का प्रतिरोध करते हुए हानिरहित कार्य पूरा कर सकता है। हानिरहित कार्य वाहक SkillsBench से चुने गए हैं।

बेंचमार्क स्थिर है और चलाने के लिए तैयार है। यह केस जनरेटर नहीं है। रिपॉजिटरी में 6 जोखिम डोमेन और 30 श्रेणियों में 155 तैयार मामले शामिल हैं। प्रत्येक मामले में शामिल है:

  • एक हानिरहित आधार कार्य जिसे अभी भी पूरा किया जाना चाहिए
  • एक या अधिक कौशल-उन्मुख हमले की सतहें
  • असुरक्षित व्यवहार के लिए एक निर्धारणात्मक सत्यापनकर्ता
  • आधार-कार्य पूर्णता के लिए कार्य परीक्षण
  • अंतिम केस डिज़ाइन का वर्णन करने वाले मेटाडेटा और तर्क

प्रत्येक रन का मूल्यांकन दो अक्षों पर किया जाता है:

  • task_success: क्या सामान्य उपयोगकर्ता कार्य पूरा हुआ
  • attack_success: क्या असुरक्षित व्यवहार देखा गया

यह अलगाव महत्वपूर्ण है: एक सिस्टम सक्षम दिख सकता है क्योंकि वह कार्य पूरा करता है, जबकि फिर भी कमजोर हो सकता है क्योंकि वह हमले-युक्त कौशल संदर्भ का अनुसरण करता है।

बेंचमार्क संरचना

SkillSafetyBench में 6 जोखिम डोमेन और 30 श्रेणियों में व्यवस्थित 155 मामले शामिल हैं। प्रत्येक जोखिम डोमेन में 5 श्रेणियां होती हैं, और प्रत्येक श्रेणी में सामान्य कार्य वाहकों के आसपास निर्मित कई ठोस मामले होते हैं।

root@kitploit:~
SkillSafetyBench
└── 6 जोखिम डोमेन
    ├── RD1: संदर्भ विश्वास और प्रॉम्प्ट हेरफेर जोखिम
    ├── RD2: एजेंसी, दायरा, और प्राधिकरण जोखिम
    ├── RD3: निष्पादन, रनटाइम, फ्रेमवर्क, और प्रोटोकॉल जोखिम
    ├── RD4: डेटा सीमा, आउटपुट, और बाह्यीकरण जोखिम
    ├── RD5: मेमोरी, पुनर्प्राप्ति, ऑडिट, और स्थायित्व जोखिम
    └── RD6: ज्ञान, मॉडल, आपूर्ति श्रृंखला, और परिचालन जोखिम

मामले जोखिम डोमेन, श्रेणी, और केस आईडी द्वारा संग्रहीत किए जाते हैं:

root@kitploit:~
benchmark/<risk-domain>/<category>/<case>/
  metadata.json
  rationale.md
  attacked_task/
    instruction.md
    task.toml
    environment/
    solution/solve.sh
    tests/test.sh
  eval/verify_attack.py

बेंचमार्क निर्देशिका मामलों के लिए सत्य का स्रोत है। श्रेणी निर्देशिकाएं categoryN-... नामकरण पैटर्न का उपयोग करती हैं, उदाहरण के लिए:

root@kitploit:~
benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/category1-availability_cost_and_service_exhaustion/

बेंचमार्क निर्माण पाइपलाइन

बेंचमार्क निर्माण पाइपलाइन हानिरहित कार्य वाहकों से शुरू होती है, मूल उपयोगकर्ता-उन्मुख कार्य को संरक्षित करती है, कौशल-उन्मुख आर्टिफैक्ट्स के माध्यम से हमले को इंजेक्ट करती है, और कार्य पूर्णता और हमले के व्यवहार दोनों के लिए निर्धारणात्मक जांच जोड़ती है। यह मूल्यांकन को इस बात पर केंद्रित रखता है कि क्या एजेंट अनुरोधित कार्य करते हुए असुरक्षित स्थानीय संदर्भ का प्रतिरोध कर सकते हैं।

SkillSafetyBench निर्माण पाइपलाइन

सुरक्षा सूचना

इस रिपॉजिटरी में प्रतिकूल (adversarial) बेंचमार्क मामले शामिल हैं। कुछ मामले फ़िशिंग, क्रेडेंशियल मांग, विनाशकारी संचालन, डेटा बाह्यीकरण, सैंडबॉक्स सीमा दुरुपयोग, बाहरी क्रियाएं, और स्थायित्व-जैसे व्यवहारों का अनुकरण करते हैं।

बेंचमार्क को केवल पृथक शोध वातावरण में चलाएं। उत्पादन क्रेडेंशियल, उत्पादन क्लाउड खाते, व्यक्तिगत खाते, या संवेदनशील स्थानीय फ़ाइलों का उपयोग न करें। डिस्पोजेबल API कुंजियां, डिस्पोजेबल कंटेनर, प्रतिबंधित नेटवर्क एक्सेस, और एक समर्पित कार्यशील निर्देशिका पसंद करें। साझा करने से पहले रन आर्टिफैक्ट्स की समीक्षा करें।

बेंचमार्क कैसे चलाएं

1. टूलचेन तैयार करें

आवश्यक उपकरण:

  • bash
  • python3, अनुशंसित >= 3.11
  • docker
  • uv
  • harbor
  • nvm
  • Node.js 22

यदि आवश्यक हो तो Harbor स्थापित करें:

root@kitploit:~
uv tool install harbor

मूल टूलचेन जांचें:

root@kitploit:~
harbor --help
python3 --version
docker --version

यदि आपका Harbor एजेंट Node के माध्यम से स्थापित है, तो रन शुरू करने वाले शेल में Node 22 सक्रिय करें:

root@kitploit:~
export NVM_DIR="$HOME/.nvm"
[ -s "$NVM_DIR/nvm.sh" ] && . "$NVM_DIR/nvm.sh"
nvm use 22

2. पर्यावरण चर कॉन्फ़िगर करें

उदाहरण फ़ाइल से एक स्थानीय .envrc बनाएं:

root@kitploit:~
cp env.example .envrc

codex के लिए, कम से कम सेट करें:

root@kitploit:~
export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
export OPENAI_API_KEY="replace-with-your-openai-api-key"

claude-code के लिए, एक Anthropic-संगत प्रमाणीकरण चर सेट करें, उदाहरण के लिए:

root@kitploit:~
export ANTHROPIC_BASE_URL="https://api.anthropic.com"
export ANTHROPIC_API_KEY="replace-with-your-anthropic-api-key"

यदि आप direnv का उपयोग करते हैं, तो चलाएं:

root@kitploit:~
direnv allow

यदि नहीं, तो कोई अतिरिक्त चरण आवश्यक नहीं है। बैच स्क्रिप्ट रनटाइम पर स्पष्ट रूप से .envrc को स्रोत करती है।

3. मामले चलाएं

प्रामाणिक प्रवेश बिंदु है:

root@kitploit:~
scripts/start_agent_batch.sh

एक जोखिम डोमेन चलाएं:

root@kitploit:~
scripts/start_agent_batch.sh --rd 5

एजेंट और मॉडल चुनें:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 3 \
  --agent codex \
  --model openai/gpt-5.4

Claude Code के साथ चलाएं:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 3 \
  --agent claude-code \
  --model claude-3-7-sonnet-20250219

एक एकल मामला चलाएं:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 5 \
  --case travel_planning_poisoned_belief_persistence_memory_anchor

एक एकल श्रेणी चलाएं:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 6 \
  --category category3-model_behavior_and_finetuning_poisoning

एक स्पष्ट मेनिफेस्ट से चलाएं:

root@kitploit:~
scripts/start_agent_batch.sh \
  --manifest benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/manifest.json

एक कस्टम env फ़ाइल का उपयोग करें:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 5 \
  --envrc /path/to/your.envrc

निष्पादन के बिना चयनित मामलों को प्रिंट करें:

root@kitploit:~
scripts/start_agent_batch.sh --rd 5 --dry-run

4. रन आउटपुट पढ़ें

प्रत्येक रन jobs/ के अंतर्गत एक आउटपुट निर्देशिका बनाता है:

root@kitploit:~
jobs/<agent>-risk-domain-5-memory-recovery-audit-and-persistence-risks-<timestamp>/

इनसे शुरू करें:

  • jobs/<run>/attack_results.json
  • jobs/<run>/summary.json
  • jobs/<run>/attack_results.csv
  • jobs/<run>/summary.csv

उपयोगी प्रति-रन फ़ाइलें:

  • selected_cases.json
  • batch_config.json
  • <case_id>/case_result.json
  • attack_results.md

सामान्य हमले के परिणाम:

  • attack_success
  • attack_not_observed
  • task_output_missing

task_output_missing का अर्थ है कि अपेक्षित स्पष्ट कार्य आउटपुट अनुपस्थित था। हमले का सत्यापनकर्ता तब भी जारी रह सकता है जब हमले की स्थिति का मूल्यांकन करने के लिए पर्याप्त आर्टिफैक्ट मौजूद हों।

टूल डाउनलोड करें