
Investigación de código y experimentos para defender agentes LLM integrados con herramientas contra ataques adversarios, ampliando Agent Security Bench con nuevas estrategias de defensa y escenarios de ataque.
Este repositorio contiene el código y los experimentos de nuestro proyecto sobre la defensa de agentes de modelos de lenguaje de gran tamaño (LLM) integrados con herramientas contra ataques adversarios.
Nos basamos en Agent Security Bench (ASB) para evaluar cómo la integración de herramientas y el razonamiento estructurado (por ejemplo, cadena de pensamiento, reflexión) afecta la vulnerabilidad de los agentes LLM a los prompts adversarios en múltiples escenarios de tareas.
Este repositorio incluye:
Este proyecto adapta y extiende el código del repositorio oficial de ASB:
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents
GitHub: https://github.com/agiresearch/ASBench
Paper: https://openreview.net/forum?id=V4y0CpX4hK
Agradecemos a los autores de ASB por hacer su framework disponible públicamente.
pip install -r requirements.txt
Para evaluar el DPI:
python attack_launcher.py --cfg_path ./config/DPI.yml
Para evaluar el IPI:
python attack_launcher.py --cfg_path ./config/IPI.yml
Para evaluar el MP:
python attack_launcher.py --cfg_path ./config/MP.yml
Para evaluar el ataque de puerta trasera:
python agent_attack_pot.py