
إطار دفاعي يحافظ على ذاكرة ظل تركز على السلامة لاكتشاف وحظر هجمات حقن الأوامر والتهديدات طويلة المدى ضد وكلاء LLM قبل تنفيذ الإجراءات.
يحتوي هذا المستودع على الإصدار الرسمي من الشيفرة الخاصة بالورقة البحثية Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory. ShadowMem هو إطار دفاعي يحافظ على ذاكرة وكيلية مخصصة ومركّزة على السلامة — مستوحاة من تجريد shadow stack في أمن الأنظمة — لتقطير السياق الحرج للسلامة والاحتفاظ به عبر مسار التنفيذ الكامل للوكيل، ويستخدم هذه الذاكرة الظلية لتقييم الإجراءات المعلّقة بشكل استباقي قبل تنفيذها.

| المجلد | الدور |
|---|---|
rllm/ | العمود الفقري للتدريب اللاحق بالتعلم المعزز. يوفّر حلقة التدريب (خلفيات verl / GRPO / PPO) المستخدمة لتدريب حاكم الذاكرة الظلية. |
memagent/ | تنفيذ حاكم الذاكرة الظلية — المنطق الأساسي، والمطالبات (prompts)، ومحولات مجموعات البيانات، ونصوص التدريب/التقييم. يُستورد كوحدة Python بواسطة خطوط المعالجة. |
agentdojo/ | منصة اختبار معيارية لتقييم هجمات حقن المطالبات ودفاعاتها على وكلاء LLM. وُسّعت في هذه الورقة لتغطية التهديدات طويلة المدى. |
تتشارك المكوّنات الثلاثة بيئة Python واحدة. ثبّت rllm أولاً (فهو يجلب حزمة التعلم المعزز/الخدمة)، ثم ثبّت agentdojo في البيئة نفسها. memagent وحدة Python خالصة ولا تحتاج إلى خطوة تثبيت — إذ يُلتقط عبر PYTHONPATH أو بتشغيل النصوص من دليل memagent/.
المتطلبات: Python ≥ 3.10، وحدات CUDA GPU للتدريب، uv أو pip.
# 1. Create and activate a fresh environment (Python 3.10+)
uv venv --python 3.10
source .venv/bin/activate
# 2. Install rllm in editable mode with the verl training backend.
# See rllm/README.md for backend/GPU notes and optional tinker backend.
cd rllm
uv pip install -e ".[verl]"
cd ..
# 3. Install agentdojo in editable mode.
# See agentdojo/README.md for optional extras (transformers detector, docs, etc.).
cd agentdojo
uv pip install -e .
cd ..
# 4. memagent needs no install — import paths resolve from the repo root.
للاطلاع على الإعداد التفصيلي لكل مشروع (Docker، وإصدارات CUDA/torch المحددة، والإضافات الاختيارية)، راجع الوثائق داخل كل مجلد (rllm/README.md، وmemagent/README.md، وagentdojo/README.md).
memagent/ — تدريب واختبار حاكم الذاكرة الظلية. راجع memagent/README.md.agentdojo/ — تقييم إضافي للوكيل الحي مع الحاكم المدرَّب ضمن الحلقة. راجع agentdojo/ATTACK_DEFENSE.md لأوامر الهجوم/الدفاع المستخدمة في الورقة.rllm/ — امتدادات طفيفة للمدرِّب لمقاييس الحاكم وتقارير ASR/BU. راجع rllm/diff.md لملخص التغييرات مقابل قاعدة شيفرة rllm الأصلية.متاحة على Hugging Face:
إذا استخدمت ShadowMem في بحثك، فيرجى الاقتباس:
@inproceedings{wang2026shadowmem,
author = {Yuhui Wang and Tanqiu Jiang and Jiacheng Liang and Charles Fleming and Ting Wang},
title = {Safeguarding {LLM} Agents against Long-Horizon Threats via Shadow Memory},
booktitle = {Proceedings of the 2026 ACM SIGSAC Conference on Computer and Communications Security},
series = {CCS '26},
year = {2026},
publisher = {Association for Computing Machinery},
doi = {10.1145/3830454.3846601},
url = {https://doi.org/10.1145/3830454.3846601}
}