
Исследовательский код и эксперименты для защиты LLM-агентов с интеграцией инструментов от состязательных атак, расширяющие Agent Security Bench новыми стратегиями защиты и сценариями атак.
Этот репозиторий содержит код и эксперименты для нашего проекта по защите больших языковых моделей (LLM) агентов с интеграцией инструментов от состязательных атак.
Мы опираемся на Agent Security Bench (ASB), чтобы оценить, как интеграция инструментов и структурированное рассуждение (например, цепочка рассуждений, рефлексия) влияют на уязвимость LLM-агентов к состязательным промптам в различных сценариях задач.
Этот репозиторий включает:
Этот проект адаптирует и расширяет код из официального репозитория ASB:
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
GitHub: https://github.com/agiresearch/ASBench
Paper: https://openreview.net/forum?id=V4y0CpX4hK
Мы благодарим авторов ASB за публичное предоставление их фреймворка.
pip install -r requirements.txt
Для оценки DPI:
python attack_launcher.py --cfg_path ./config/DPI.yml
Для оценки IPI:
python attack_launcher.py --cfg_path ./config/IPI.yml
Для оценки MP:
python attack_launcher.py --cfg_path ./config/MP.yml
Для оценки бэкдор-атаки:
python agent_attack_pot.py