
Defensives Framework, das einen sicherheitsorientierten Shadow-Speicher pflegt, um Prompt-Injection- und Long-Horizon-Bedrohungen gegen LLM-Agenten zu erkennen und zu blockieren, bevor Aktionen ausgeführt werden.
Dieses Repository enthält die offizielle Code-Veröffentlichung für das Paper Safeguarding LLM Agents against Long-Horizon Threats via Shadow Memory. ShadowMem ist ein defensives Framework, das einen dedizierten, sicherheitsfokussierten agentischen Speicher unterhält — inspiriert von der Shadow-Stack-Abstraktion aus der Systemsicherheit —, um sicherheitskritischen Kontext über die gesamte Ausführungstrajektorie eines Agenten zu destillieren und zu bewahren, und diesen Shadow Memory nutzt, um ausstehende Aktionen proaktiv zu bewerten, bevor sie ausgeführt werden.

| Ordner | Rolle |
|---|
rllm/ | RL-Post-Training-Backbone. Stellt die Trainingsschleife (verl / GRPO / PPO-Backends) bereit, die zum Trainieren des Shadow-Memory-Judges verwendet wird. |
memagent/ | Implementierung des Shadow-Memory-Judges — Kernlogik, Prompts, Dataset-Adapter und Trainings-/Evaluierungsskripte. Wird von den Pipelines als Python-Modul importiert. |
agentdojo/ | Benchmark-Harness zur Evaluierung von Prompt-Injection-Angriffen und -Verteidigungen auf LLM-Agenten. In diesem Paper erweitert, um Long-Horizon-Bedrohungen abzudecken. |
Die drei Komponenten teilen sich eine einzige Python-Umgebung. Installieren Sie zuerst rllm (es zieht den RL-/Serving-Stack mit ein), dann agentdojo in derselben Umgebung. memagent ist ein reines Python-Modul und benötigt keinen Installationsschritt — es wird über PYTHONPATH oder durch Ausführen von Skripten aus dem Verzeichnis memagent/ eingebunden.
Voraussetzungen: Python ≥ 3.10, CUDA-GPUs für das Training, uv oder pip.
# 1. Create and activate a fresh environment (Python 3.10+)
uv venv --python 3.10
source .venv/bin/activate
# 2. Install rllm in editable mode with the verl training backend.
# See rllm/README.md for backend/GPU notes and optional tinker backend.
cd rllm
uv pip install -e ".[verl]"
cd ..
# 3. Install agentdojo in editable mode.
# See agentdojo/README.md for optional extras (transformers detector, docs, etc.).
cd agentdojo
uv pip install -e .
cd ..
# 4. memagent needs no install — import paths resolve from the repo root.
Für detaillierte projektspezifische Einrichtung (Docker, spezifische CUDA-/Torch-Versionen, optionale Extras) konsultieren Sie die Dokumentation in jedem Ordner (rllm/README.md, memagent/README.md, agentdojo/README.md).
memagent/ — Training und Test des Shadow-Memory-Judges. Siehe memagent/README.md.agentdojo/ — weitere Live-Agent-Evaluierung mit dem trainierten Judge in der Schleife. Siehe agentdojo/ATTACK_DEFENSE.md für die im Paper verwendeten Angriffs-/Verteidigungsbefehle.rllm/ — kleinere Erweiterungen des Trainers für Judge-Metriken und ASR/BU-Reporting. Siehe rllm/diff.md für eine Zusammenfassung der Änderungen gegenüber der Upstream-rllm-Codebasis.Auf Hugging Face veröffentlicht:
Wenn Sie ShadowMem in Ihrer Forschung verwenden, zitieren Sie bitte:
@inproceedings{wang2026shadowmem,
author = {Yuhui Wang and Tanqiu Jiang and Jiacheng Liang and Charles Fleming and Ting Wang},
title = {Safeguarding {LLM} Agents against Long-Horizon Threats via Shadow Memory},
booktitle = {Proceedings of the 2026 ACM SIGSAC Conference on Computer and Communications Security},
series = {CCS '26},
year = {2026},
publisher = {Association for Computing Machinery},
doi = {10.1145/3830454.3846601},
url = {https://doi.org/10.1145/3830454.3846601}
}