Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
PISmith — PISmith: प्रॉम्प्ट इंजेक्शन डिफेंस के लिए रीइन्फोर्समेंट लर्निंग-आधारित रेड टीमिंग | Kitploit
उपकरण/GitHubGitHub/albert-y1n/pismith
पेलोड जनरेशनमशीन लर्निंगपेपर और शोधरेड टीमिंगAI सुरक्षाप्रतिकूल हमला
GitHubalbert-y1n/pismith

PISmith

PISmith: प्रॉम्प्ट इंजेक्शन डिफेंस के लिए रीइन्फोर्समेंट लर्निंग-आधारित रेड टीमिंग

रिपॉजिटरी देखें
22321 महीना पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

PISmith: प्रॉम्प्ट इंजेक्शन रक्षाओं के लिए सुदृढीकरण लर्निंग-आधारित रेड टीमिंग(COLM 2026)

यह PISmith: प्रॉम्प्ट इंजेक्शन रक्षाओं के लिए सुदृढीकरण लर्निंग-आधारित रेड टीमिंग का आधिकारिक कार्यान्वयन है।


पर्यावरण सेटअप

PISmith का परीक्षण Python 3.10 और CUDA Version: 12.9 के साथ किया गया है।

1. Python 3.10 conda वातावरण बनाएँ

root@kitploit:~
conda create -n PISmith python=3.10 -y
conda activate PISmith

2. निर्भरताएँ इंस्टॉल करें

root@kitploit:~
pip install -r requirements.txt

3. (वैकल्पिक) Meta-SecAlign मॉडल चेकपॉइंट तैयार करें

secalign रक्षा को लक्षित करने वाले प्रयोगों के लिए, दी गई मर्ज स्क्रिप्ट चलाकर बेस मॉडल को SecAlign एडेप्टर के साथ डाउनलोड और मर्ज करें:

root@kitploit:~
python merge_meta_secalign.py

यह HuggingFace से और डाउनलोड करता है, उन्हें मर्ज करता है, और परिणाम को में सहेजता है।

meta-llama/Llama-3.1-8B-Instruct
facebook/Meta-SecAlign-8B
checkpoints/Meta-SecAlign-8B-merged/

स्क्रिप्ट्स

PIArena

PIArena विभिन्न प्रॉम्प्ट इंजेक्शन रक्षाओं के विरुद्ध प्रशिक्षण और मूल्यांकन का समर्थन करता है। लक्षित रक्षा का चयन करने के लिए defense तर्क का उपयोग करें।

समर्थित रक्षाएँ: secalign, none, promptguard, promptarmor, sandwich, instructional, datasentinel, piguard, datafilter

प्रशिक्षण

root@kitploit:~
bash scripts/train_piarena.sh <defense> [train_gpus] [target_gpu] [target_port]
तर्कडिफ़ॉल्टविवरण
defensesecalignप्रशिक्षण के लिए लक्षित रक्षा
train_gpus"1,2,3"RL प्रशिक्षण के लिए GPU इंडेक्स
target_gpu0लक्षित vLLM सर्वर के लिए GPU
target_port8010लक्षित vLLM सर्वर के लिए पोर्ट

उदाहरण:

root@kitploit:~
# Train against SecAlign defense
bash scripts/train_piarena.sh secalign

# Train against no defense (plain LLM)
bash scripts/train_piarena.sh none

मूल्यांकन

root@kitploit:~
bash scripts/eval_piarena.sh <checkpoint> <defense> [target_port] [target_gpu] [attacker_gpu] [attacker_port] [num_samples]
तर्कडिफ़ॉल्टविवरण
checkpoint—प्रशिक्षित हमलावर चेकपॉइंट का पथ
defensesecalignजिस रक्षा के विरुद्ध मूल्यांकन करना है
target_port8000लक्षित vLLM सर्वर के लिए पोर्ट
target_gpu0लक्षित vLLM सर्वर के लिए GPU
attacker_gpu1हमलावर vLLM सर्वर के लिए GPU
attacker_port8001हमलावर vLLM सर्वर के लिए पोर्ट
num_samples10Pass@k: प्रति परीक्षण मामले में नमूनों की संख्या

उदाहरण:

root@kitploit:~
# Evaluate against SecAlign (default settings)
bash scripts/eval_piarena.sh checkpoints/piarena/checkpoint-500 secalign

# Evaluate against no piguard, pass@10
bash scripts/eval_piarena.sh checkpoints/piarena_none/checkpoint-500 piguard

AgentDojo

GPT-4o-mini, GPT-4o, GPT-5-nano और स्थानीय vLLM लक्ष्यों का समर्थन करता है।

root@kitploit:~
bash scripts/train_agentdojo.sh [target_type] [suites] [train_gpus]
root@kitploit:~
# Default: GPT-4o-mini target on the firsr 7 injected task of workspace suite
bash scripts/train_agentdojo.sh

# Train on all suites (workspace, banking, travel, slack)
bash scripts/train_agentdojo.sh gpt4o-mini all

मूल्यांकन:

root@kitploit:~
bash scripts/eval_agentdojo.sh <checkpoint> [target_type] [eval_suites] [num_samples] [target_defense]

# Example
bash scripts/eval_agentdojo.sh checkpoints/agentdojo/checkpoint-500 gpt4o-mini

AgentDyn

AgentDyn, AgentDojo के ऊपर बनाया गया है। AgentDyn प्रयोग चलाने से पहले इसे अलग से इंस्टॉल करें:

root@kitploit:~
git clone https://github.com/SaFo-Lab/AgentDyn.git
cd AgentDyn
pip install -e . --no-deps

प्रशिक्षण github, dailylife और shopping जैसे AgentDyn सुइट्स का समर्थन करता है।

root@kitploit:~
bash scripts/train_agentdyn.sh [target_type] [suites] [train_gpus]

# Example
bash scripts/train_agentdyn.sh gpt5-nano github "0,1,2,3"

मूल्यांकन pass@k और सैंपल-स्तरीय औसत ASR दोनों को रिपोर्ट करता है, और डेटा-समानांतर हमलावर vLLM सर्विसिंग का समर्थन करता है:

root@kitploit:~
ATTACKER_GPUS=0,1,2,3 ATTACKER_DP_SIZE=4 \
bash scripts/eval_agentdyn.sh checkpoints/agentdyn/checkpoint-500 gpt5-nano "github,dailylife,shopping" 5

InjecAgent

स्थानीय vLLM लक्ष्य, GPT-4o-mini, या मल्टी-टार्गेट मोड का समर्थन करता है।

root@kitploit:~
bash scripts/train_injecagent.sh [target_type] [train_gpus] [target_gpu] [target_port]
root@kitploit:~
# Default: local vLLM target (Meta-SecAlign-8B)
bash scripts/train_injecagent.sh

# GPT-4o-mini API target
bash scripts/train_injecagent.sh gpt4o-mini

मूल्यांकन:

root@kitploit:~
bash scripts/eval_injecagent.sh <checkpoint> [target_type] [target_gpu] [target_port] [eval_gpu] [num_samples]

# Example
bash scripts/eval_injecagent.sh checkpoints/injecagent/checkpoint-500

प्रयोग परिणाम

मुख्य परिणाम (Meta-SecAlign-8B, 13 बेंचमार्क्स के विरुद्ध)

PISmith का मूल्यांकन स्टैटिक, सर्च-आधारित और RL-आधारित हमले श्रेणियों को शामिल करते हुए 7 बेसलाइनों के विरुद्ध किया जाता है। सभी RL-आधारित विधियाँ ASR@10 / ASR@1 रिपोर्ट करती हैं; स्टैटिक और सर्च-आधारित विधियाँ ASR@1 रिपोर्ट करती हैं।

विधिश्रेणीऔसत ASR@10औसत ASR@1
Directस्टैटिक—0.04
Combinedस्टैटिक—0.07
TAPसर्च-आधारित—0.11
PAIRसर्च-आधारित—0.16
Strategyसर्च-आधारित—0.21
Vanilla GRPORL-आधारित0.130.05
RL-HammerRL-आधारित0.700.48
PISmith (हमारा)RL-आधारित1.000.87

उपयोगिता–मजबूती ट्रेड-ऑफ (8 रक्षाएँ, Qwen3-4B-Instruct-2507)

PISmith ASR@1 का 13 बेंचमार्क्स पर औसत। उपयोगिता बिना किसी हमले के कार्य सटीकता को मापती है।

रक्षाप्रकारउपयोगिताPISmith ASR@1
कोई रक्षा नहीं—0.740.92
Sandwichरोकथाम0.740.91
Instructionalरोकथाम0.730.92
PromptArmorरोकथाम0.740.92
DataFilterरोकथाम0.630.49
PIGuardफ़िल्टर0.720.82
PromptGuardफ़िल्टर0.660.89
DataSentinelफ़िल्टर0.550.52

अत्याधुनिक रक्षाओं के लिए एक साथ उच्च उपयोगिता (≥0.70) और कम ASR (≤0.60) प्राप्त करना चुनौतीपूर्ण बना हुआ है, जो एक मौलिक उपयोगिता–मजबूती ट्रेड-ऑफ को उजागर करता है।

एजेंटिक सेटिंग्स

InjecAgent

लक्षित मॉडलDirect ASR@1PISmith ASR@10/1
Meta-SecAlign-8B0.001.00 / 0.99
GPT-4o-mini0.021.00 / 0.99
GPT-4.1-nano0.011.00 / 1.00
GPT-5-nano0.001.00 / 0.95

AgentDojo (सर्वश्रेष्ठ स्टैटिक बेसलाइन बनाम PISmith)

लक्षित मॉडलसर्वश्रेष्ठ स्टैटिक ASR@1PISmith ASR@10/1
GPT-4o-mini0.230.78 / 0.62
GPT-4.1-nano0.200.81 / 0.64
GPT-5-nano0.010.38 / 0.24
टूल डाउनलोड करें