
रक्षात्मक ढाँचा जो कार्यों के निष्पादन से पहले LLM एजेंटों के विरुद्ध प्रॉम्प्ट-इंजेक्शन और दीर्घ-कालिक खतरों का पता लगाने और उन्हें अवरुद्ध करने के लिए सुरक्षा-केंद्रित शैडो मेमोरी बनाए रखता है।
यह रिपॉज़िटरी पेपर Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory के लिए आधिकारिक कोड रिलीज़ को समाहित करती है। ShadowMem एक रक्षात्मक फ्रेमवर्क है जो एक समर्पित, सुरक्षा-केंद्रित एजेंटिक मेमोरी बनाए रखता है — जो सिस्टम सुरक्षा में shadow stack अमूर्तन से प्रेरित है — ताकि एजेंट के पूर्ण निष्पादन प्रक्षेपवक्र में सुरक्षा-महत्वपूर्ण संदर्भ को आसवित और बनाए रखा जा सके, और इस शैडो मेमोरी का उपयोग लंबित कार्यों का निष्पादन से पहले सक्रिय रूप से मूल्यांकन करने के लिए करता है।

| Folder | Role |
|---|---|
rllm/ | RL पोस्ट-ट्रेनिंग बैकबोन। शैडो-मेमोरी जज को प्रशिक्षित करने के लिए उपयोग किए जाने वाले ट्रेनिंग लूप (verl / GRPO / PPO बैकएंड) प्रदान करता है। |
memagent/ | शैडो-मेमोरी जज कार्यान्वयन — मुख्य लॉजिक, प्रॉम्प्ट, डेटासेट एडाप्टर, और ट्रेनिंग/मूल्यांकन स्क्रिप्ट। पाइपलाइनों द्वारा एक Python मॉड्यूल के रूप में आयात किया जाता है। |
agentdojo/ | LLM एजेंटों पर प्रॉम्प्ट-इंजेक्शन हमलों और रक्षा का मूल्यांकन करने के लिए बेंचमार्क हार्नेस। इस पेपर में लंबी-क्षितिज धमकियों को कवर करने के लिए विस्तारित। |
तीनों घटक एक ही Python वातावरण साझा करते हैं। पहले rllm इंस्टॉल करें (यह RL/सर्विंग स्टैक को शामिल करता है), फिर उसी वातावरण में agentdojo इंस्टॉल करें। memagent एक शुद्ध Python मॉड्यूल है और इसके लिए किसी इंस्टॉल चरण की आवश्यकता नहीं है — इसे PYTHONPATH के माध्यम से या memagent/ निर्देशिका से स्क्रिप्ट चलाकर उठाया जाता है।
आवश्यकताएँ: Python ≥ 3.10, ट्रेनिंग के लिए CUDA GPUs, uv या pip।
# 1. Create and activate a fresh environment (Python 3.10+)
uv venv --python 3.10
source .venv/bin/activate
# 2. Install rllm in editable mode with the verl training backend.
# See rllm/README.md for backend/GPU notes and optional tinker backend.
cd rllm
uv pip install -e ".[verl]"
cd ..
# 3. Install agentdojo in editable mode.
# See agentdojo/README.md for optional extras (transformers detector, docs, etc.).
cd agentdojo
uv pip install -e .
cd ..
# 4. memagent needs no install — import paths resolve from the repo root.
प्रति-प्रोजेक्ट विस्तृत सेटअप (Docker, विशिष्ट CUDA/torch संस्करण, वैकल्पिक एक्स्ट्रा) के लिए, प्रत्येक फ़ोल्डर के अंदर दस्तावेज़ देखें (rllm/README.md, memagent/README.md, agentdojo/README.md)।
memagent/ — शैडो-मेमोरी जज का प्रशिक्षण और परीक्षण। memagent/README.md देखें।agentdojo/ — लूप में प्रशिक्षित जज के साथ आगे लाइव-एजेंट मूल्यांकन। पेपर में उपयोग किए गए हमला/रक्षा कमांड के लिए agentdojo/ATTACK_DEFENSE.md देखें।rllm/ — जज मेट्रिक्स और ASR/BU रिपोर्टिंग के लिए ट्रेनर में मामूली एक्सटेंशन। अपस्ट्रीम rllm कोडबेस के विरुद्ध परिवर्तनों के सारांश के लिए rllm/diff.md देखें।Hugging Face पर जारी:
यदि आप अपने शोध में ShadowMem का उपयोग करते हैं, तो कृपया उद्धृत करें:
@inproceedings{wang2026shadowmem,
author = {Yuhui Wang and Tanqiu Jiang and Jiacheng Liang and Charles Fleming and Ting Wang},
title = {Safeguarding {LLM} Agents against Long-Horizon Threats via Shadow Memory},
booktitle = {Proceedings of the 2026 ACM SIGSAC Conference on Computer and Communications Security},
series = {CCS '26},
year = {2026},
publisher = {Association for Computing Machinery},
doi = {10.1145/3830454.3846601},
url = {https://doi.org/10.1145/3830454.3846601}
}