Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
deleting-the-trace — टूल-उपयोग करने वाले LLM एजेंट्स पर कंट्रोल-टोकन चेन-ऑफ-थॉट दमन और पार्सर-लीनिएंसी हमलों के लिए प्रयोग | Kitploit
उपकरण/GitHubGitHub/usama1002/deleting-the-trace
भेद्यता विश्लेषणशोषणमशीन लर्निंगपेपर और शोधAI सुरक्षाप्रतिकूल हमला
GitHubusama1002/deleting-the-trace

deleting-the-trace

टूल-उपयोग करने वाले LLM एजेंट्स पर कंट्रोल-टोकन चेन-ऑफ-थॉट दमन और पार्सर-लीनिएंसी हमलों के लिए प्रयोग

रिपॉजिटरी देखें
161 दिन पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

टूल-उपयोग करने वाले एजेंट्स पर कंट्रोल-टोकन इंजेक्शन हमले

टूल-उपयोग करने वाले भाषा मॉडल एजेंट्स पर दो इनपुट-स्तरीय हमलों के अध्ययन के लिए कोड और लॉग किए गए माप। पहला हमला अविश्वसनीय इनपुट में मॉडल के अपने चैनल-कंट्रोल टोकन की एक छोटी स्ट्रिंग जोड़ता है; टोकनाइज़र इसे पहले से बंद रीज़निंग चैनल के रूप में पढ़ता है, इसलिए मॉडल कोई चेन-ऑफ-थॉट उत्सर्जित नहीं करता और सीधे टूल कॉल पर आगे बढ़ता है। यह उस रीज़निंग ट्रेस को हटा देता है जिस पर एक मॉनिटर निर्भर करता है और, उन अनुरोधों पर जिन्हें मॉडल अन्यथा अस्वीकार कर देता, इनकारों को पूर्ण किए गए कार्यों में बदल देता है। दूसरा परिणाम यह है कि एक समान टूल-कॉल जनरेशन वास्तव में फायर होती है या नहीं, यह मॉडल के बजाय हार्नेस पार्सर द्वारा तय किया जाता है, इसलिए एजेंट की मजबूती मॉडल और उसके डिकोडिंग तथा पार्सिंग हार्नेस का संयुक्त गुण है।

प्रत्येक प्रयोग पूर्ण परिशुद्धता (bfloat16) पर ग्रीडी डिकोडिंग के साथ जारी किए गए टूल सैंडबॉक्स के माध्यम से चलता है, और results/ के अंतर्गत लॉग किया गया JSON पूरी तरह से यहाँ की स्क्रिप्ट्स द्वारा उत्पन्न होता है।

पेपर: "Control-Token Injection Suppresses Chain-of-Thought and Defeats Reasoning-Based Oversight in Tool-Using Agents"।

निष्कर्ष

  1. कंट्रोल-टोकन इंजेक्शन रीज़निंग चैनल को दबा देता है जबकि असुरक्षित टूल कॉल अभी भी फायर होती है, सामग्री-पढ़ने वाले चेन-ऑफ-थॉट मॉनिटरों को हरा देता है, और मॉडल के अपने इनकारों को बायपास कर देता है। एक खाली-रीज़निंग ट्रिपवायर बुनियादी हमले को पकड़ लेता है लेकिन एक पंक्ति के सौम्य डिकॉय द्वारा हरा दिया जाता है।
  2. हार्नेस पार्सर की ढील टूल-कॉल फायरिंग को मॉडल-स्वतंत्र रूप से नियंत्रित करती है। एक ट्रंकेशन-सहिष्णु पार्सर उस कॉल को फायर करता है जिसका क्लोज़िंग टोकन गायब है जबकि एक सख्त पार्सर उसे छोड़ देता है; एक मॉडल और उसके ग्रीडी डिकोड को स्थिर रखते हुए, दो जारी किए गए पार्सर विपरीत सुरक्षा परिणाम उत्पन्न करते हैं।

आवश्यकताएँ

  • bfloat16 पर लक्ष्य मॉडलों के लिए पर्याप्त मेमोरी वाला एक CUDA GPU (रन एकल NVIDIA H200, 141 GB पर उत्पन्न किए गए थे)।
  • Python 3.12, CUDA के साथ PyTorch, और requirements.txt में पिन किए गए पैकेज (aicomp-sdk 3.1.2, transformers 5.16.1, gymnasium 0.29, openai, openai-harmony)।
  • Hugging Face पर लक्ष्य मॉडलों तक पहुँच: openai/gpt-oss-20b, google/gemma-4-26B-A4B-it, deepseek-ai/DeepSeek-R1-Distill-Qwen-7B, Qwen/Qwen3-4B-Thinking-2507।

सेटअप:

root@kitploit:~
python3 -m venv --system-site-packages .venv
source .venv/bin/activate
pip install -r requirements.txt

# download the target models (needs an authenticated Hugging Face CLI)
hf download openai/gpt-oss-20b
hf download google/gemma-4-26B-A4B-it
hf download deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
hf download Qwen/Qwen3-4B-Thinking-2507

gpt-oss-20b transformers 4.57 या 5.16 के अंतर्गत चलता है; gemma-4-26B-A4B-it एक मल्टीमॉडल मॉडल है जिसके लिए transformers 5.16 आवश्यक है। gpt-oss रीज़निंग-सप्रेशन माप दोनों संस्करणों के अंतर्गत समान है।

प्रयोग चलाना

सभी प्रयोग स्क्रिप्ट्स साझा हार्नेस को इम्पोर्ट करती हैं, इसलिए उन्हें experiments को पाथ पर रखकर चलाएँ। प्रत्येक स्क्रिप्ट अपना आउटपुट results/ में लिखती है।

root@kitploit:~
export PYTHONPATH=experiments

# reproduction gate: the forge empties the gpt-oss analysis channel while the call still fires
python scripts/h200_gate.py

# E1: chain-of-thought suppression at scale
python experiments/e1_cot_suppression.py

# E2: monitor evasion and refusal bypass (generate traces, then score three monitors)
python experiments/e2b_generate.py
JUDGE=gemma python experiments/e2b_judge.py

# E3: parser leniency
python experiments/e3a_parser_leniency.py                 # deterministic, no model
MODEL=gpt_oss python experiments/e3b_end2end.py
MODEL=gemma   python experiments/e3b_end2end.py
python experiments/e3c_gemma_parser_ab.py                 # same model, two parsers

# E4: generality across reasoning models
MODEL=deepseek-ai/DeepSeek-R1-Distill-Qwen-7B TAG=deepseek python experiments/e4_generality.py
MODEL=Qwen/Qwen3-4B-Thinking-2507 TAG=qwen3 python experiments/e4_generality.py

# E5: defenses
python experiments/e5_defenses.py                         # input sanitization
python experiments/e5_d2_parser_hardening.py              # parser hardening, deterministic

# W1 to W3: ablation, token-level grounding, indirect delivery, cross-stack parser
python experiments/w1_forge_variants.py
python experiments/w1_tokenlevel.py
python experiments/w2_indirect.py
python experiments/w3_truncation_sweep.py

# adaptive empty-reasoning evasion (raw traces, effort sweep, decoy attack, monitor matrix)
python experiments/ad_traces_effort.py
python experiments/ad_decoy.py
python experiments/ad_decoy_judge.py

# regenerate the results figure from the logged JSON
python scripts/make_results_fig.py

रिपॉज़िटरी संरचना

root@kitploit:~
experiments/harness.py            shared harness: build an agent, run a message through the
                                  sandbox gym env, and read back the reasoning channel, the
                                  fired tool events, and the predicates
experiments/e1_*.py               chain-of-thought suppression at scale
experiments/e2*_*.py              monitor evasion and refusal bypass (generate, then judge)
experiments/e3*_*.py              parser leniency: deterministic, end-to-end, and A/B
experiments/e4_*.py               generality across reasoning models
experiments/e5_*.py               defenses: sanitization and parser hardening
experiments/w1_*.py               ablation of the injected string and token-level grounding
experiments/w2_*.py               indirect delivery and broader action types
experiments/w3_*.py               truncation robustness of the attack
experiments/ad_*.py               adaptive empty-reasoning evasion and raw traces
experiments/*_probe.py, *_debug.py supporting probes used while building the study
scripts/h200_gate.py              the reproduction gate
scripts/make_results_fig.py       the results figure
results/*.json                    logged measurements produced by the scripts above

मुख्य परिणाम

प्रयोगमाप
E1 (gpt-oss-20b)रीज़निंग चैनल 52.5 से 0 टोकन (55 में से 55 कार्यों पर खाली), असुरक्षित कार्रवाई 100 प्रतिशत फायर
E2 मॉनिटर इवेज़ननियम और भाषा-मॉडल मॉनिटर इंजेक्शन के बिना 100 प्रतिशत पहचानते हैं, इसके साथ 0 प्रतिशत; 39.6 प्रतिशत इनकार पूर्ण किए गए एक्सफिल्ट्रेशन में बदल गए
E3c पार्सर A/B (Gemma)समान मॉडल और ग्रीडी डिकोड: regex पार्सर 24 में से 24 फायर करता है, native processor पार्सर 24 में से 0 फायर करता है
E4 व्यापकताgpt-oss इनपुट इंजेक्शन के माध्यम से असुरक्षित; Qwen3-Thinking अनुपालन क्लोज़्ड-चैनल प्रिमिटिव के अंतर्गत 0.08 से 1.00; DeepSeek मजबूत
E5 रक्षाreplace-with-space सैनिटाइज़र हमले को निष्प्रभावी कर देता है; भोले विलोपन सौम्य इनपुट पर विफल होते हैं; पार्सर हार्डनिंग ट्रंकेटेड कॉल को छोड़ देती है
अनुकूलीखाली-रीज़निंग ट्रिपवायर खाली फोर्ज को पकड़ लेता है लेकिन एक पंक्ति के सौम्य डिकॉय द्वारा हरा दिया जाता है जो 100 प्रतिशत फायर करता है

पुनरुत्पादन पर टिप्पणियाँ

डिकोडिंग ग्रीडी है, इसलिए प्रत्येक दर प्रति इनपुट नियतात्मक है और रिपोर्ट किए गए अंतराल परिमित कार्य नमूने को दर्शाते हैं। सीड 123 और एक आठ-हॉप इंटरैक्शन लूप जारी किए गए सैंडबॉक्स से मेल खाते हैं। लक्ष्य मॉडल संशोधन और transformers संस्करण requirements.txt में पिन किए गए हैं और प्रत्येक स्क्रिप्ट में बताए गए हैं।

लाइसेंस

MIT लाइसेंस। देखें LICENSE।

टूल डाउनलोड करें