
Codice di ricerca ed esperimenti per difendere gli agenti LLM integrati con strumenti da attacchi avversari, estendendo Agent Security Bench con nuove strategie di difesa e scenari di attacco.
Questo repository contiene il codice e gli esperimenti per il nostro progetto sulla difesa degli agenti basati su modelli linguistici di grandi dimensioni (LLM) integrati con strumenti contro attacchi avversariali.
Ci basiamo su Agent Security Bench (ASB) per valutare come l'integrazione di strumenti e ragionamento strutturato (ad esempio, chain-of-thought, reflection) influenzi la vulnerabilità degli agenti LLM a prompt avversariali in molteplici scenari di attività.
Questo repository include:
Questo progetto adatta ed estende il codice dal repository ufficiale ASB:
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
GitHub: https://github.com/agiresearch/ASBench
Paper: https://openreview.net/forum?id=V4y0CpX4hK
Ringraziamo gli autori di ASB per aver reso pubblicamente disponibile il loro framework.
pip install -r requirements.txt
Per valutare il DPI:
python attack_launcher.py --cfg_path ./config/DPI.yml
Per valutare l'IPI:
python attack_launcher.py --cfg_path ./config/IPI.yml
Per valutare il MP:
python attack_launcher.py --cfg_path ./config/MP.yml
Per valutare l'attacco backdoor:
python agent_attack_pot.py