
Ensemble d'outils pour évaluer et améliorer la sécurité des LLM.
🤗 Modèles sur Hugging Face | Blog | Site web | Article CyberSec Eval | Article Llama Guard
Purple Llama est un projet parapluie qui, au fil du temps, réunira des outils et des évaluations pour aider la communauté à développer de manière responsable avec des modèles d'IA générative ouverts. La version initiale comprendra des outils et des évaluations pour la cybersécurité et les mesures de protection des entrées/sorties, mais nous prévoyons d'en ajouter davantage dans un avenir proche.
En empruntant un concept au monde de la cybersécurité, nous pensons que pour véritablement atténuer les défis posés par l'IA générative, nous devons adopter à la fois des postures d'attaque (red team) et de défense (blue team). Le purple teaming, composé des responsabilités des red et blue teams, est une approche collaborative pour évaluer et atténuer les risques potentiels. La même philosophie s'applique à l'IA générative, et c'est pourquoi notre investissement dans Purple Llama sera complet.
Les composants du projet Purple Llama seront sous licence permissive, permettant à la fois une utilisation en recherche et commerciale. Nous pensons qu'il s'agit d'une étape majeure vers la collaboration communautaire et la standardisation du développement et de l'utilisation d'outils de confiance et de sécurité pour le développement de l'IA générative. Plus concrètement, les évaluations et les benchmarks sont sous licence MIT, tandis que les modèles utilisent la licence communautaire Llama correspondante. Voir le tableau ci-dessous :
| Type de composant | Composants | Licence |
|---|---|---|
| Évaluations/Benchmarks | Cyber Security Eval (d'autres à venir) | MIT |
| Protection | Llama Guard | Llama 2 Community License |
| Protection | Llama Guard 2 | Llama 3 Community License |
| Protection | Llama Guard 3-8B | Llama 3.2 Community License |
| Protection | Llama Guard 3-1B | Llama 3.2 Community License |
| Protection | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| Protection | Prompt Guard | Llama 3.2 Community License |
| Protection | Code Shield | MIT |
Comme nous l'avons indiqué dans le guide d'utilisation responsable de Llama 3, nous recommandons que toutes les entrées et sorties du LLM soient vérifiées et filtrées conformément aux directives de contenu adaptées à l'application.
Llama Guard 3 se compose d'une série de modèles de modération d'entrées et de sorties haute performance, conçus pour aider les développeurs à détecter divers types courants de contenu non conforme.
Ils ont été créés en affinant les modèles Meta-Llama 3.1 et 3.2 et optimisés pour prendre en charge la détection de la taxonomie standard des dangers de MLCommons, répondant à une gamme de cas d'utilisation des développeurs.
Ils prennent en charge les capacités de Llama 3.2, notamment 7 nouvelles langues, une fenêtre de contexte de 128k et le raisonnement sur images. Les modèles Llama Guard 3 ont également été optimisés pour détecter les réponses utiles aux cyberattaques et empêcher que les codes malveillants générés par les LLM soient exécutés dans les environnements d'hébergement des systèmes Llama utilisant des interpréteurs de code.
Prompt Guard est un outil puissant pour protéger les applications basées sur les LLM contre les invites malveillantes, afin de garantir leur sécurité et leur intégrité.
Les catégories d'attaques par invites incluent l'injection d'invites (prompt injection) et le jailbreaking :
Code Shield ajoute la prise en charge du filtrage au moment de l'inférence des codes non sécurisés produits par les LLM. Code Shield offre l'atténuation du risque de suggestions de code non sécurisé, la prévention de l'abus des interpréteurs de code et l'exécution sécurisée de commandes. Notebook d'exemple CodeShield.
CyberSec Eval v1 était, selon nous, le premier ensemble à l'échelle de l'industrie d'évaluations de sécurité en cybersécurité pour les LLM. Ces benchmarks sont basés sur des directives et des normes de l'industrie (par exemple CWE et MITRE ATT&CK) et ont été élaborés en collaboration avec nos experts en sécurité. Nous cherchons à fournir des outils qui aideront à traiter certains risques décrits dans les engagements de la Maison Blanche sur le développement d'une IA responsable, notamment :
Nous pensons que ces outils réduiront la fréquence à laquelle les LLM suggèrent du code non sécurisé généré par l'IA et diminueront leur utilité pour les cyberadversaires. Nos premiers résultats montrent qu'il existe des risques de cybersécurité importants pour les LLM, tant en ce qui concerne la recommandation de code non sécurisé que la conformité aux demandes malveillantes. Consultez notre article Cybersec Eval pour plus de détails.
CyberSec Eval 2 s'appuie sur son prédécesseur en mesurant la propension d'un LLM à abuser d'un interpréteur de code, ses capacités offensives en cybersécurité et sa susceptibilité à l'injection d'invites. Vous pouvez lire l'article ici.
Vous pouvez également consulter le classement 🤗 ici.
Le nouveau CyberSec Eval 3 propose trois suites de tests supplémentaires : des tests d'injection d'invites visuelles, des tests de capacités de harponnage (spear phishing) et des tests d'opérations offensives cyber autonomes.
Dans le cadre du système de référence Llama, nous intégrons une couche de sécurité pour faciliter l'adoption et le déploiement de ces protections.
Des ressources pour commencer avec les protections sont disponibles dans le dépôt GitHub llama-recipes.
Pour une liste évolutive des questions fréquemment posées, concernant non seulement les composants Purple Llama mais aussi les modèles Llama en général, consultez la FAQ ici.
Consultez le fichier CONTRIBUTING pour savoir comment contribuer.