
Pesquisa de código e experimentos para defender agentes LLM integrados a ferramentas contra ataques adversariais, ampliando o Agent Security Bench com novas estratégias de defesa e cenários de ataque.
Este repositório contém o código e os experimentos do nosso projeto sobre a defesa de agentes de modelos de linguagem de grande porte (LLM) integrados com ferramentas contra ataques adversariais.
Baseamo-nos no Agent Security Bench (ASB) para avaliar como a integração de ferramentas e raciocínio estruturado (por exemplo, cadeia de pensamento, reflexão) afeta a vulnerabilidade de agentes LLM a prompts adversariais em múltiplos cenários de tarefas.
Este repositório inclui:
Este projeto adapta e estende o código do repositório oficial do ASB:
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
GitHub: https://github.com/agiresearch/ASBench
Paper: https://openreview.net/forum?id=V4y0CpX4hK
Agradecemos aos autores do ASB por disponibilizarem publicamente o seu framework.
pip install -r requirements.txt
Para avaliar o DPI:
python attack_launcher.py --cfg_path ./config/DPI.yml
Para avaliar o IPI:
python attack_launcher.py --cfg_path ./config/IPI.yml
Para avaliar o MP:
python attack_launcher.py --cfg_path ./config/MP.yml
Para avaliar o ataque backdoor:
python agent_attack_pot.py