Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
PurpleLlama — Ensemble d'outils pour évaluer et améliorer la sécurité des LLM. | Kitploit
Outils/GitHubGitHub/meta-llama/purplellama
Outils DéfensifsAnalyse des VulnérabilitésAnalyse de CodeArticles et RechercheRed TeamingSécurité de l'IAAttaque AdversarialeTop en Attaque Adversariale n°10Top en Sécurité de l'IA n°4
4.4k77364il y a 25 joursVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
GitHub
meta-llama/purplellama

PurpleLlama

Ensemble d'outils pour évaluer et améliorer la sécurité des LLM.

Voir le dépôt
Partager

🤗 Modèles sur Hugging Face  | Blog  | Site web  | Article CyberSec Eval   | Article Llama Guard 


Purple Llama

Purple Llama est un projet parapluie qui, au fil du temps, réunira des outils et des évaluations pour aider la communauté à développer de manière responsable avec des modèles d'IA générative ouverts. La version initiale comprendra des outils et des évaluations pour la cybersécurité et les mesures de protection des entrées/sorties, mais nous prévoyons d'en ajouter davantage dans un avenir proche.

Pourquoi purple ?

En empruntant un concept au monde de la cybersécurité, nous pensons que pour véritablement atténuer les défis posés par l'IA générative, nous devons adopter à la fois des postures d'attaque (red team) et de défense (blue team). Le purple teaming, composé des responsabilités des red et blue teams, est une approche collaborative pour évaluer et atténuer les risques potentiels. La même philosophie s'applique à l'IA générative, et c'est pourquoi notre investissement dans Purple Llama sera complet.

Licence

Les composants du projet Purple Llama seront sous licence permissive, permettant à la fois une utilisation en recherche et commerciale. Nous pensons qu'il s'agit d'une étape majeure vers la collaboration communautaire et la standardisation du développement et de l'utilisation d'outils de confiance et de sécurité pour le développement de l'IA générative. Plus concrètement, les évaluations et les benchmarks sont sous licence MIT, tandis que les modèles utilisent la licence communautaire Llama correspondante. Voir le tableau ci-dessous :

Type de composantComposantsLicence
Évaluations/BenchmarksCyber Security Eval (d'autres à venir)MIT
ProtectionLlama GuardLlama 2 Community License
ProtectionLlama Guard 2Llama 3 Community License
ProtectionLlama Guard 3-8BLlama 3.2 Community License
ProtectionLlama Guard 3-1BLlama 3.2 Community License
ProtectionLlama Guard 3-11B-visionLlama 3.2 Community License
ProtectionPrompt GuardLlama 3.2 Community License
ProtectionCode ShieldMIT

Protection au niveau du système

Comme nous l'avons indiqué dans le guide d'utilisation responsable de Llama 3, nous recommandons que toutes les entrées et sorties du LLM soient vérifiées et filtrées conformément aux directives de contenu adaptées à l'application.

Llama Guard

Llama Guard 3 se compose d'une série de modèles de modération d'entrées et de sorties haute performance, conçus pour aider les développeurs à détecter divers types courants de contenu non conforme.

Ils ont été créés en affinant les modèles Meta-Llama 3.1 et 3.2 et optimisés pour prendre en charge la détection de la taxonomie standard des dangers de MLCommons, répondant à une gamme de cas d'utilisation des développeurs.

Ils prennent en charge les capacités de Llama 3.2, notamment 7 nouvelles langues, une fenêtre de contexte de 128k et le raisonnement sur images. Les modèles Llama Guard 3 ont également été optimisés pour détecter les réponses utiles aux cyberattaques et empêcher que les codes malveillants générés par les LLM soient exécutés dans les environnements d'hébergement des systèmes Llama utilisant des interpréteurs de code.

Prompt Guard

Prompt Guard est un outil puissant pour protéger les applications basées sur les LLM contre les invites malveillantes, afin de garantir leur sécurité et leur intégrité.

Les catégories d'attaques par invites incluent l'injection d'invites (prompt injection) et le jailbreaking :

  • Les injections d'invites sont des entrées qui exploitent l'inclusion de données non fiables provenant de tiers dans la fenêtre de contexte d'un modèle pour l'amener à exécuter des instructions non voulues.
  • Les jailbreaks sont des instructions malveillantes conçues pour contourner les fonctions de sécurité et de sûreté intégrées à un modèle.

Code Shield

Code Shield ajoute la prise en charge du filtrage au moment de l'inférence des codes non sécurisés produits par les LLM. Code Shield offre l'atténuation du risque de suggestions de code non sécurisé, la prévention de l'abus des interpréteurs de code et l'exécution sécurisée de commandes. Notebook d'exemple CodeShield.

Évaluations et benchmarks

Cybersécurité

CyberSec Eval v1

CyberSec Eval v1 était, selon nous, le premier ensemble à l'échelle de l'industrie d'évaluations de sécurité en cybersécurité pour les LLM. Ces benchmarks sont basés sur des directives et des normes de l'industrie (par exemple CWE et MITRE ATT&CK) et ont été élaborés en collaboration avec nos experts en sécurité. Nous cherchons à fournir des outils qui aideront à traiter certains risques décrits dans les engagements de la Maison Blanche sur le développement d'une IA responsable, notamment :

  • Des métriques pour quantifier les risques de cybersécurité des LLM.
  • Des outils pour évaluer la fréquence des suggestions de code non sécurisé.
  • Des outils pour évaluer les LLM afin de rendre plus difficile la génération de code malveillant ou l'aide à la réalisation de cyberattaques.

Nous pensons que ces outils réduiront la fréquence à laquelle les LLM suggèrent du code non sécurisé généré par l'IA et diminueront leur utilité pour les cyberadversaires. Nos premiers résultats montrent qu'il existe des risques de cybersécurité importants pour les LLM, tant en ce qui concerne la recommandation de code non sécurisé que la conformité aux demandes malveillantes. Consultez notre article Cybersec Eval pour plus de détails.

CyberSec Eval 2

CyberSec Eval 2 s'appuie sur son prédécesseur en mesurant la propension d'un LLM à abuser d'un interpréteur de code, ses capacités offensives en cybersécurité et sa susceptibilité à l'injection d'invites. Vous pouvez lire l'article ici.

Vous pouvez également consulter le classement 🤗 ici.

CyberSec Eval 3

Le nouveau CyberSec Eval 3 propose trois suites de tests supplémentaires : des tests d'injection d'invites visuelles, des tests de capacités de harponnage (spear phishing) et des tests d'opérations offensives cyber autonomes.

Pour commencer

Dans le cadre du système de référence Llama, nous intégrons une couche de sécurité pour faciliter l'adoption et le déploiement de ces protections.

Des ressources pour commencer avec les protections sont disponibles dans le dépôt GitHub llama-recipes.

FAQ

Pour une liste évolutive des questions fréquemment posées, concernant non seulement les composants Purple Llama mais aussi les modèles Llama en général, consultez la FAQ ici.

Rejoindre la communauté Purple Llama

Consultez le fichier CONTRIBUTING pour savoir comment contribuer.

Télécharger l’outil