
Conjunto de herramientas para evaluar y mejorar la seguridad de los LLM.
🤗 Modelos en Hugging Face | Blog | Sitio web | Artículo de CyberSec Eval | Artículo de Llama Guard
Purple Llama es un proyecto general que, con el tiempo, reunirá herramientas y evaluaciones para ayudar a la comunidad a desarrollar soluciones de forma responsable con modelos generativos de IA abiertos. El lanzamiento inicial incluirá herramientas y evaluaciones para Ciberseguridad y salvaguardas de Entrada/Salida, pero tenemos previsto aportar más en un futuro cercano.
Tomando prestado un concepto del mundo de la ciberseguridad, creemos que para mitigar de verdad los desafíos que presenta la IA generativa, necesitamos adoptar tanto posturas de ataque (red team) como defensivas (blue team). El purple teaming, compuesto por responsabilidades tanto de red como de blue team, es un enfoque colaborativo para evaluar y mitigar riesgos potenciales, y la misma filosofía se aplica a la IA generativa y, por tanto, nuestra inversión en Purple Llama será integral.
Los componentes del proyecto Purple Llama se publicarán con licencias permisivas que permiten tanto el uso comercial como el de investigación. Creemos que este es un paso importante para habilitar la colaboración comunitaria y estandarizar el desarrollo y uso de herramientas de confianza y seguridad para el desarrollo de IA generativa. Más concretamente, las evaluaciones y los benchmarks se publican bajo la licencia MIT, mientras que cualquier modelo utiliza la licencia comunitaria de Llama correspondiente. Consulta la tabla siguiente:
| Tipo de componente | Componentes | Licencia |
|---|---|---|
| Evaluaciones/Benchmarks | Cyber Security Eval (otros próximamente) | MIT |
| Salvaguarda | Llama Guard | Licencia comunitaria de Llama 2 |
| Salvaguarda | Llama Guard 2 | Licencia comunitaria de Llama 3 |
| Salvaguarda | Llama Guard 3-8B | Licencia comunitaria de Llama 3.2 |
| Salvaguarda | Llama Guard 3-1B | Licencia comunitaria de Llama 3.2 |
| Salvaguarda | Llama Guard 3-11B-vision | Licencia comunitaria de Llama 3.2 |
| Salvaguarda | Prompt Guard | Licencia comunitaria de Llama 3.2 |
| Salvaguarda | Code Shield | MIT |
Como se indica en la Guía de uso responsable de Llama 3, recomendamos que todas las entradas y salidas del LLM se comprueben y filtren de acuerdo con las directrices de contenido adecuadas para la aplicación.
Llama Guard 3 consiste en una serie de modelos de moderación de entrada y salida de alto rendimiento diseñados para ayudar a los desarrolladores a detectar varios tipos comunes de contenido infractor.
Se crearon ajustando los modelos Meta-Llama 3.1 y 3.2 y se optimizaron para apoyar la detección de la taxonomía estándar de peligros de MLCommons, atendiendo a una variedad de casos de uso de los desarrolladores. Admiten el lanzamiento de las capacidades de Llama 3.2, incluidos 7 nuevos idiomas, una ventana de contexto de 128k y el razonamiento de imágenes. Los modelos Llama Guard 3 también se optimizaron para detectar respuestas útiles a ciberataques y evitar que el código malicioso generado por LLMs se ejecute en entornos de alojamiento para sistemas Llama que usan intérpretes de código.
Prompt Guard es una herramienta eficaz para proteger aplicaciones basadas en LLM contra prompts maliciosos, garantizando su seguridad e integridad.
Las categorías de ataques de prompts incluyen la inyección de prompts y el jailbreaking:
Code Shield añade soporte para el filtrado en tiempo de inferencia de código inseguro generado por LLMs. Code Shield ofrece mitigación del riesgo de sugerencias de código inseguro, prevención del abuso de intérpretes de código y ejecución segura de comandos. Cuaderno de ejemplo de CodeShield.
CyberSec Eval v1 fue, según creemos, el primer conjunto de evaluaciones de seguridad cibernética para LLMs de toda la industria. Estos benchmarks se basan en orientaciones y estándares del sector (p. ej., CWE y MITRE ATT&CK) y se construyeron en colaboración con nuestros expertos en seguridad. Nuestro objetivo es ofrecer herramientas que ayuden a abordar algunos de los riesgos descritos en los compromisos de la Casa Blanca sobre el desarrollo de una IA responsable, incluidos:
Creemos que estas herramientas reducirán la frecuencia con la que los LLMs sugieren código inseguro generado por IA y reducirán su utilidad para los adversarios cibernéticos. Nuestros resultados iniciales muestran que existen riesgos significativos de ciberseguridad para los LLMs, tanto al recomendar código inseguro como al cumplir solicitudes maliciosas. Consulta nuestro artículo de CyberSec Eval para más detalles.
CyberSec Eval 2 amplía su predecesor al medir la propensión de un LLM a abusar de un intérprete de código, las capacidades ofensivas de ciberseguridad y la susceptibilidad a la inyección de prompts. Puedes leer el artículo aquí.
También puedes consultar el 🤗 leaderboard aquí.
El recién publicado CyberSec Eval 3 incluye tres suites de pruebas adicionales: pruebas de inyección visual de prompts, pruebas de capacidad de spear phishing y pruebas de operaciones ciberofensivas autónomas.
Como parte del sistema de referencia Llama, estamos integrando una capa de seguridad para facilitar la adopción e implementación de estas salvaguardas. Los recursos para comenzar con las salvaguardas están disponibles en el repositorio de GitHub llama-recipes.
Para obtener una lista actualizada de preguntas frecuentes, no solo sobre los componentes de Purple Llama sino también sobre los modelos Llama en general, consulta las FAQ aquí.
Consulta el archivo CONTRIBUTING para saber cómo ayudar.