
أبحاث برمجية وتجارب للدفاع عن وكلاء LLM المدمجين بالأدوات ضد الهجمات العدائية، مع توسيع Agent Security Bench باستراتيجيات دفاع جديدة وسيناريوهات هجومية.
يحتوي هذا المستودع على الكود والتجارب الخاصة بمشروعنا حول الدفاع عن وكلاء النماذج اللغوية الكبيرة (LLM) المدمجين بالأدوات ضد الهجمات العدائية.
نبني على Agent Security Bench (ASB) لتقييم كيفية تأثير دمج الأدوات والاستدلال المنظم (مثل سلسلة التفكير، والتفكير التأملي) على قابلية وكلاء النماذج اللغوية الكبيرة للتعرض للمطالبات العدائية عبر سيناريوهات مهام متعددة.
يتضمن هذا المستودع:
هذا المشروع يعدّل ويوسّع الكود من مستودع ASB الرسمي:
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
GitHub: https://github.com/agiresearch/ASBench
Paper: https://openreview.net/forum?id=V4y0CpX4hK
نشكر مؤلفي ASB على إتاحة إطار عملهم للعموم.
pip install -r requirements.txt
لتقييم DPI:
python attack_launcher.py --cfg_path ./config/DPI.yml
لتقييم IPI:
python attack_launcher.py --cfg_path ./config/IPI.yml
لتقييم MP:
python attack_launcher.py --cfg_path ./config/MP.yml
لتقييم هجوم الباب الخلفي:
python agent_attack_pot.py