NCSC Guidelines for Secure AI System Development - Lignes directrices pratiques co-rédigées par la NCSC (Royaume-Uni) et la CISA pour le développement sécurisé de l'IA, couvrant la conception, le développement, le déploiement et l'exploitation.
Cours, laboratoires et CTF
Damn Vulnerable MCP Server - Une implémentation volontairement vulnérable du Model Context Protocol (MCP) à des fins pédagogiques.
otto-support - Une implémentation de serveur MCP vulnérable utilisant mcp-go avec une authentification à plusieurs niveaux (4 rôles), 19 outils et un conteneur sandbox intégré avec Claude Code pour s'entraîner à l'élévation de privilèges et à l'utilisation abusive d'outils.
vulnerable-mcp-servers-lab - Une collection de serveurs volontairement vulnérables pour apprendre le pentesting des serveurs MCP.
FinBot Agentic AI Capture The Flag (CTF) Application - FinBot est une plateforme interactive de Capture The Flag (CTF) de sécurité agentique qui simule des vulnérabilités réelles dans les systèmes d'IA agentique à l'aide d'une application simulée axée sur les services financiers.
AI-Red-Teaming-Playground-Labs - Laboratoires de type playground pour le red teaming IA, permettant d'organiser des formations au red teaming IA, infrastructure comprise.
Damn Vulnerable LLM Agent - Agent LLM volontairement vulnérable pour apprendre l'injection de prompt, l'utilisation abusive d'outils et la sécurité des agents
LLMVault - Un laboratoire open source de sécurité LLM de style CTF pour apprendre l'OWASP LLM Top 10 grâce à des exercices pratiques sur des systèmes vulnérables couvrant l'injection de prompt, les attaques RAG, la fuite du prompt système, l'utilisation abusive d'outils et la sécurité des agents.
AI Security Ops - Podcasts hebdomadaires de Black Hills Information Security explorant comment l'IA transforme la cybersécurité — couvrant les menaces émergentes, les outils et les tendances avec des connaissances pratiques et exploitables.
AI Verify - Framework et boîte à outils de test d'IA soutenus par le gouvernement de Singapour pour vérifier les propriétés des systèmes d'IA par rapport aux cadres de gouvernance.
Taxonomies, terminologie et bases de données de risques
NIST AI 100-2e2023 - Taxonomie et terminologie de l'apprentissage automatique adversarial
ATLAS Knowledge Base Agent - Assistant IA open source pour explorer la base de connaissances ATLAS en langage naturel, avec accès aux serveurs MCP et workflows d'agents personnalisables.
The Arcanum Prompt Injection Taxonomy - Système complet de classification des attaques par injection de prompt couvrant les intentions d'attaque, les techniques, les évasions et les vecteurs d'entrée. Catégorise les objectifs, les méthodes, les techniques d'obfuscation et les surfaces d'attaque des injections de prompt.
Adversarial Robustness Toolkit - ART se concentre sur les menaces d'évasion (modifier le comportement du modèle avec des modifications d'entrée), d'empoisonnement (contrôler un modèle avec des modifications des données d'entraînement), d'extraction (voler un modèle par des requêtes) et d'inférence (attaquer la confidentialité des données d'entraînement)
cleverhans - Une bibliothèque d'exemples adversariaux pour construire des attaques, élaborer des défenses et évaluer les deux
foolbox - Une boîte à outils Python pour créer des exemples adversariaux qui trompent les réseaux de neurones dans PyTorch, TensorFlow et JAX
TextAttack - Un framework Python pour les attaques adversariales, l'augmentation de données et l'entraînement de modèles en NLP
Counterfit - couche d'automatisation générique pour évaluer la sécurité des systèmes d'apprentissage automatique
OffsecML Playbook - Une collection de TTP offensifs et adversariaux avec des preuves de concept
BadDiffusion - Dépôt officiel pour reproduire l'article « How to Backdoor Diffusion Models? » publié à CVPR 2023
secml-torch - SecML-Torch : une bibliothèque pour l'évaluation de la robustesse des modèles d'apprentissage profond
ai-scanner - Application web open source pour les évaluations de sécurité des modèles d'IA, construite sur NVIDIA garak. Propose 179 sondes, l'analyse multi-cibles, des analyses planifiées, le scoring ASR et l'intégration SIEM.
promptfoo - Testez vos prompts, agents et RAG. Red teaming, pentesting et analyse de vulnérabilités pour les LLM. Comparez les performances de GPT, Claude, Gemini, Llama et plus encore. Configurations déclaratives simples avec intégration en ligne de commande et CI/CD.
PyRIT - Le Python Risk Identification Tool pour l'IA générative (PyRIT) est un framework open source conçu pour permettre aux professionnels de la sécurité et aux ingénieurs d'identifier de manière proactive les risques dans les systèmes d'IA générative.
PurpleLlama - Ensemble d'outils pour évaluer et améliorer la sécurité des LLM.
augustus - Framework de test de sécurité des LLM pour détecter les injections de prompt, les jailbreaks et les attaques adversariales. 190+ sondes, 28 fournisseurs, un binaire Go unique. Prêt pour la production avec analyse concurrente, limitation de débit et logique de nouvelle tentative.
FuzzyAI - Un outil puissant pour le fuzzing automatisé des LLM. Il est conçu pour aider les développeurs et les chercheurs en sécurité à identifier et à atténuer les jailbreaks potentiels dans leurs API LLM.
EasyJailbreak - Un framework Python facile à utiliser pour générer des prompts de jailbreak adversariaux.
gptfuzz - Dépôt officiel de GPTFUZZER : Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
llamator - Framework pour tester les vulnérabilités des grands modèles de langage (LLM).
agentic_security - Scanner de vulnérabilités LLM agentique / kit de red teaming IA
Agentic Radar - Scanner de sécurité CLI open source pour les workflows agentiques.
RAPTOR - Framework autonome de recherche en sécurité offensive/défensive construit sur Claude Code. Enchaîne l'analyse statique (Semgrep, CodeQL), l'analyse binaire, la validation de vulnérabilités assistée par LLM, la génération d'exploits et la rédaction de correctifs. Orchestration multi-modèles avec analyse de faisabilité basée sur Z3.
whistleblower - Outil de sécurité offensive pour tester la fuite du prompt système et la découverte des capacités d'une application d'IA exposée via une API
promptmap - un scanner d'injection de prompt pour les applications LLM personnalisées
spikee - Kit simple d'injection de prompt pour l'évaluation et l'exploitation
ps-fuzz - Rendez vos applications GenAI sûres et sécurisées — Testez et renforcez votre prompt système
llm-attacks - Attaques universelles et transférables sur les modèles de langage alignés
llm-security - Nouvelles façons de casser les LLM intégrés aux applications
Plexiglass - Une boîte à outils pour détecter les vulnérabilités des grands modèles de langage (LLM) et s'en protéger.
Prompt Hacking Resources - Une liste de ressources organisées pour les personnes intéressées par le red teaming IA, le jailbreaking et l'injection de prompt
Giskard - Évaluation et test open source pour les systèmes d'IA et de LLM
blackice - BlackIce est une boîte à outils open source conteneurisée conçue pour le red teaming de modèles d'IA, y compris les grands modèles de langage (LLM) et les modèles classiques d'apprentissage automatique (ML). Inspiré par la commodité et la standardisation de Kali Linux dans le test d'intrusion traditionnel, BlackIce simplifie les évaluations de sécurité de l'IA en fournissant une image de conteneur reproductible préconfigurée avec des outils d'évaluation spécialisés.
ai-best-practices - Règles Semgrep Pro pour garantir que le code utilisant des LLM respecte les meilleures pratiques. 58 règles, 102 sous-règles couvrant 6 fournisseurs + MCP + hooks Claude Code & Cursor + LangChain. Détecte les clés API codées en dur, les risques d'injection de prompt, les contrôles de sécurité manquants et les erreurs non gérées dans 7 langages.
G0DM0D3 - Interface de chat multi-modèles open source pour le red teaming avec plus de 50 modèles via OpenRouter. Propose GODMODE CLASSIC (5 combinaisons de jailbreak), l'évaluation multi-modèles ULTRAPLINIAN, le moteur de perturbation d'entrée Parseltongue avec 33 techniques de red teaming, et l'échantillonnage adaptatif AutoTune pour la recherche sur la sécurité de l'IA.
L1B3RT4S - Collection de prompts de jailbreak et de libération pour les principaux LLM. Bibliothèque organisée de prompts adversariaux conçus pour tester et évaluer les garde-fous de sécurité de l'IA sur ChatGPT, Claude, Gemini et d'autres modèles de pointe.
OBLITERATUS - Boîte à outils d'abliteration qui supprime les comportements de refus des LLM open source sans réentraînement. Modifie les poids du modèle pour éliminer les réponses de refus alignées sur la sécurité, permettant une recherche sans restriction sur le comportement des modèles.
T3MP3ST - Plateforme autonome de red teaming et méta-harnais multi-agents de sécurité offensive. Coordonne des essaims d'agents IA pour des tests adversariaux coordonnés des systèmes d'IA de pointe.
P4RS3LT0NGV3 - Boîte à outils universelle de transformation de texte et de création de prompts. Prend en charge la traduction, la mutation, l'encodage/décodage et l'ingénierie de prompts adversariaux pour la construction de payloads de jailbreak.
claude-secure-coding-rules - Règles de sécurité open source qui guident Claude Code pour générer du code sécurisé par défaut.
DeepTeam - Framework de red teaming LLM avec plus de 40 méthodes d'attaque, notamment l'injection de prompt, le jailbreaking et l'empoisonnement RAG. S'intègre aux pipelines CI/CD.
IA agentique et outils d'attaque MCP
RAMPART - framework de test de sûreté et de sécurité natif pytest pour les applications d'IA agentique.
AI-Infra-Guard - Une plateforme de red teaming IA complète, intelligente et facile à utiliser développée par Tencent Zhuque Lab. Intègre des modules pour Infra Scan, MCP Scan et l'évaluation des jailbreaks, fournissant une interface web en un clic, des API REST et un déploiement basé sur Docker pour une évaluation complète de la sécurité de l'IA.
OpenPromptInjection - Un benchmark pour les attaques et les défenses contre l'injection de prompt
AIMap - Plateforme de découverte et de test de sécurité à l'échelle d'Internet pour l'infrastructure d'agents IA exposée. Interroge Shodan pour trouver des serveurs MCP, des instances Ollama, des proxys vLLM/LiteLLM, et plus encore — puis prend des empreintes, évalue les risques et lance des suites d'attaque spécifiques aux protocoles avec des résultats diffusés en temps réel.### Sécurité offensive assistée par IA
PentestGPT - Un outil de test d'intrusion propulsé par GPT
HackingBuddyGPT - Aider les hackers éthiques à utiliser les LLM en 50 lignes de code ou moins
cai - IA de cybersécurité (CAI), une intelligence artificielle open source prête pour le Bug Bounty (article)
shannon - Pentester IA entièrement autonome pour applications web et API par Keygraph. Tests de sécurité en boîte blanche qui analysent le code source, identifient les vecteurs d'attaque et exécutent de véritables exploits. Taux de réussite de 96,15 % (100/104 exploits) sur le benchmark XBOW.
strix - Strix sont des agents IA autonomes qui agissent comme de vrais hackers : ils exécutent votre code dynamiquement, trouvent des vulnérabilités et les valident via de véritables preuves de concept
redamon - Framework de red team agentique propulsé par l'IA qui automatise les opérations de sécurité offensive, de la reconnaissance à l'exploitation en passant par la post-exploitation, sans aucune intervention humaine.
CyberStrikeAI - Plateforme de tests de sécurité nativement IA développée en Go. Intègre plus de 100 outils de sécurité avec un moteur d'orchestration intelligent, des tests basés sur des rôles avec des rôles de sécurité prédéfinis, un système de compétences et une gestion complète du cycle de vie. Utilise le protocole MCP et des agents IA pour une automatisation de bout en bout, des commandes conversationnelles à la découverte de vulnérabilités.
HexStrikeAI - HexStrike AI MCP Agents est un serveur MCP avancé qui permet aux agents IA (Claude, GPT, Copilot, etc.) d'exécuter automatiquement plus de 150 outils de cybersécurité pour le pentest automatisé, la découverte de vulnérabilités, l'automatisation du bug bounty et la recherche en sécurité.
mcp-for-security - Une collection de serveurs Model Context Protocol pour des outils de sécurité populaires comme SQLMap, FFUF, NMAP, Masscan et bien d'autres. Intégrez les tests de sécurité et les tests d'intrusion dans les flux de travail IA.
mcp-security-hub - Une collection croissante de serveurs MCP qui apportent des outils de sécurité offensive aux assistants IA. Nmap, Ghidra, Nuclei, SQLMap, Hashcat et plus encore.
burpgpt - Une extension Burp Suite qui intègre GPT d'OpenAI pour effectuer un scan passif supplémentaire afin de découvrir des vulnérabilités très spécifiques et permet d'exécuter une analyse du trafic de tout type.
guardian-cli - Test de sécurité et scanner de vulnérabilités propulsés par l'IA. Guardian CLI est un outil intelligent de test de sécurité qui exploite l'IA pour automatiser les tests d'intrusion, l'évaluation des vulnérabilités et l'audit de sécurité.
AutoPentestX - AutoPentestX – Outil Linux automatisé de pentest et de rapport de vulnérabilités
HackGPT - Un outil utilisant ChatGPT pour le hacking
nano-analyzer - Un scanner minimal de vulnérabilités zero-day propulsé par LLM par AISLE.
clearwing - Scanner de vulnérabilités autonome et chasseur de code source basé sur LangGraph.
Zen-AI-Pentest - Framework de test d'intrusion propulsé par l'IA avec scan de vulnérabilités automatisé, système multi-agents et rapports de conformité. Plus de 72 outils de sécurité, sandbox Docker, agents ReAct, analyse des chemins d'attaque.
Violin - Profil de pentest Hermes Agent supervisé et agentique : 31 playbooks basés sur des compétences (OWASP Top 10, API Top 10, LLM Top 10) avec cadrage interactif, validation du périmètre et portes d'approbation pour la reconnaissance autorisée, la validation d'exploits et le reporting.
NeuroSploit - Harnais de pentest autonome multi-modèles en Rust. Le pool de LLM pilote la reconnaissance, la sélection des agents, l'enchaînement des exploits et le vote de validation inter-modèles dans les modes d'engagement boîte noire, boîte blanche, boîte grise et cloud.
OpenHack - Scanner multi-agents propulsé par l'IA qui détecte automatiquement SQLi, XSS, IDOR et contournement d'authentification dans votre codebase, puis vérifie chaque découverte via exécution en sandbox et relecture navigateur. Au niveau de Claude Opus 4.6 pour un coût environ 40 fois inférieur.
PentAGI - Système multi-agents entièrement autonome pour des tâches complexes de test d'intrusion. Exécution Docker en sandbox, support multi-fournisseurs de LLM (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), intégration de graphe de connaissances et supervision des agents en temps réel.
V3SP3R - Compagnon de hacking matériel propulsé par l'IA pour le Flipper Zero. Interface en langage naturel pour contrôler les attaques matérielles, avec intégration de lunettes intelligentes pour une utilisation mains libres.
Stéganographie et canaux cachés
ST3GG - Suite de stéganographie tout-en-un avec encodage multi-couches, stéganographie d'images et audio, et outils de stéganalyse pour détecter les données cachées dans les médias générés par l'IA.
Benchmarks et évaluations
ISC-Bench - Effondrement interne de la sécurité : jailbreake tous les LLM de pointe (Claude Opus 4.6, GPT-5.4) en pass@3 via l'exécution normale de tâches — sans invite adversarial. Boîte noire, transversal aux domaines et aux sciences. Mode de défaillance inédit.[Article]
jailbreakbench - JailbreakBench : un benchmark ouvert de robustesse pour le jailbreak de modèles de langage [NeurIPS 2024 Datasets and Benchmarks Track]
AgentDojo - Un environnement dynamique pour évaluer les attaques et défenses pour les agents LLM.
AIRTBench - Dépôt de code pour : AIRTBench : mesurer les capacités de red teaming IA autonome dans les modèles de langage
AgentDoG - AgentDoG est un framework d'évaluation et de garde sensible aux risques pour les agents autonomes. Il se concentre sur l'évaluation des risques au niveau de la trajectoire, afin de déterminer si la trajectoire d'exécution d'un agent contient des risques de sécurité dans divers scénarios d'application.
AICGSecEval - Benchmark complet d'évaluation de Tencent pour la sécurité de la génération de code IA, couvrant 10 catégories CWE avec banc de test automatisé
Inspect - Framework d'évaluation des grands modèles de langage par l'UK AI Security Institute. Plus de 200 évaluations pré-construites couvrant l'ingénierie de prompts, l'utilisation d'outils, le dialogue multi-tours et la notation par modèle.
sec-code-bench - Benchmark d'Alibaba pour évaluer les capacités de sécurité du code des LLM dans 17 catégories de vulnérabilités et 4 langages de programmation
Défense et contrôles de sécurité
Garde-fous d'entrée/sortie
NeMo-Guardrails - NeMo Guardrails est une boîte à outils open source pour ajouter facilement des garde-fous programmables aux systèmes conversationnels basés sur les LLM.
LlamaFirewall - LlamaFirewall est un framework conçu pour détecter et atténuer les risques de sécurité centrés sur l'IA, prenant en charge plusieurs couches d'entrées et de sorties, telles que le chat LLM typique et les opérations agentiques multi-étapes plus avancées.
llm-guard - LLM Guard de Protect AI est un outil complet conçu pour renforcer la sécurité des grands modèles de langage (LLM).
Guardrails.ai - Guardrails est un package Python qui permet à l'utilisateur d'ajouter des garanties de structure, de type et de qualité aux sorties des grands modèles de langage (LLM)
TrustGate - Pare-feu d'applications génératives (GAF) pour détecter, prévenir et bloquer les attaques contre les applications GenAI
ZenGuard AI - La couche de confiance la plus rapide pour les agents IA
LocalMod - API de modération de contenu auto-hébergée avec détection d'injection de prompts, filtrage de la toxicité, détection des PII et classification NSFW. Fonctionne 100 % hors ligne.
DynaGuard - Un modèle de garde-fou dynamique avec des politiques définies par l'utilisateur
AprielGuard - Modèle de garde-fou sûreté–sécurité de 8B paramètres
Safe Zone - Safe Zone est un moteur open source de détection de PII et de garde-fous qui empêche les données sensibles de fuir vers les LLM et les API tierces.
superagent - Superagent fournit des garde-fous entraînés à cet effet qui rendent les agents IA sécurisés et conformes.
ShellWard - Middleware de sécurité pour agents IA avec défense en 8 couches contre l'injection de prompts, l'exfiltration de données et les commandes dangereuses. Zéro dépendance.
CodeGate - Un projet open source axé sur la confidentialité qui agit comme une couche de sécurité dans le flux de travail de génération de code IA d'un développeur
Future AGI - Plateforme open source auto-hébergeable avec garde-fous intégrés en temps réel pour les sorties non sûres (jailbreak, PII, injection, toxicité), évaluations, traçage, simulations et passerelle pour les applications LLM et agents.
Sécurité d'exécution des agents et sandboxing
OpenShell - OpenShell est le runtime sûr et privé pour les agents IA autonomes. Il fournit des environnements d'exécution en sandbox régis par des politiques YAML déclaratives qui empêchent les accès non autorisés aux fichiers, l'exfiltration de données et les activités réseau incontrôlées.
OpenSandbox - Runtime sandbox sécurisé, rapide et extensible pour les agents IA. SDK multi-langages, runtimes Docker/Kubernetes, isolation gVisor/Kata Containers/Firecracker. Projet du paysage CNCF.
CubeSandbox - Sandbox instantané, concurrent, sécurisé et léger pour les agents IA par Tencent Cloud. Démarrage à froid en moins de 60 ms, surcharge mémoire <5 Mo, compatible SDK E2B. Construit sur RustVMM et KVM avec une isolation extrême (noyau dédié + eBPF).
Aegis - EDR open source pour les agents IA par Antropos. Surveillez en temps réel les processus, fichiers, réseau et comportement des agents IA autonomes. Aucune télémétrie, aucun cloud, tout reste local.
Microsoft Agent Governance Toolkit - Boîte à outils de gouvernance des agents IA de Microsoft — application des politiques, identité zero-trust, sandboxing d'exécution et ingénierie de fiabilité pour les agents IA autonomes. Couvre 10/10 de l'OWASP Agentic Top 10.
agentfield - Plan de contrôle open source pour les systèmes d'agents avec identité cryptographique, application des politiques et observabilité adaptée à l'audit.
leash - Leash enveloppe les agents de codage IA dans des conteneurs et surveille leur activité.
vibekit - Exécutez Claude Code, Gemini, Codex — ou tout agent de codage — dans un sandbox propre et isolé avec rédaction des données sensibles et observabilité intégrées.
pipelock - Harnais de sécurité pour agents IA — proxy de sortie avec scan DLP, protection SSRF, scan des réponses MCP et surveillance de l'intégrité de l'espace de travail
skill-scanner - Un scanner de sécurité pour les compétences des agents IA qui détecte les injections de prompts, l'exfiltration de données et les motifs de code malveillant. Combine la détection par motifs (YAML + YARA), le LLM-en-tant-que-juge et l'analyse comportementale des flux de données pour une détection complète des menaces.
SkillSpector - Scanner de sécurité pour les compétences des agents IA. Détecte 64 motifs de vulnérabilités dans 16 catégories avec analyse statique + évaluation sémantique LLM facultative. Sortie multi-formats (JSON, Markdown, SARIF).
Project CodeGuard - Projet open source CoSAI pour sécuriser les flux de développement assistés par l'IA. CodeGuard fournit des contrôles de sécurité et des garde-fous pour les assistants de codage IA afin d'empêcher l'introduction de vulnérabilités lors du développement de code généré par l'IA.
AgentLens - Outils d'observabilité et de relecture des agents pour la recherche en sûreté et interprétabilité de l'IA. Harnais pour exécuter des trajectoires d'agents multi-sessions, les capturer au format ATIF et suivre les changements d'état des fichiers entre les sessions. Conçu pour étudier le comportement des agents LLM dans des interactions multi-tours, multi-sessions et multi-agents.
claude-code-devcontainer - Devcontainer en sandbox pour exécuter Claude Code en mode bypass en toute sécurité. Conçu pour les audits de sécurité et la revue de code non fiable.
claude-code-safety-net - Un plugin Claude Code qui agit comme un filet de sécurité, interceptant les commandes git et système de fichiers destructrices avant leur exécution
OneCLI - Coffre-fort de credentials open source pour les agents IA. La passerelle HTTP en Rust intercepte les requêtes des agents et injecte les identifiants API de manière transparente afin que les agents ne détiennent jamais de clés en clair. Chiffrement AES-256-GCM, périmètre par agent, piste d'audit complète.
OpenSandbox - Runtime sandbox sécurisé, rapide et extensible pour les agents IA. SDK multi-langages, runtimes Docker/Kubernetes, isolation gVisor/Kata Containers/Firecracker. Projet du paysage CNCF.
openclaw-shield - Plugin de sécurité pour les agents OpenClaw - empêche les fuites de secrets, l'exposition de PII et l'exécution de commandes destructrices
clawsec - Scanner de sécurité et outil de durcissement pour les déploiements OpenClaw. Fournit des évaluations de sécurité, un audit de configuration et une détection de vulnérabilités spécifiquement pour la passerelle OpenClaw et les configurations d'agents.
nanoclaw - Alternative légère à OpenClaw qui s'exécute dans des conteneurs pour la sécurité. Se connecte à WhatsApp, dispose d'une mémoire, de tâches planifiées et s'exécute directement sur l'Agents SDK d'Anthropic. Premier assistant IA à prendre en charge les Agent Swarms pour les équipes d'agents collaboratifs.
secureclaw - Durcissement de sécurité automatisé pour les agents IA OpenClaw par Adversa AI. 51 contrôles d'audit, 12 règles comportementales, 9 scripts, 4 bases de motifs. Couverture complète de l'OWASP ASI Top 10. Protège contre l'injection de prompts, le vol de credentials, les attaques de la chaîne d'approvisionnement et les fuites de confidentialité.
defenseclaw - Couche de gouvernance d'entreprise pour OpenClaw de Cisco AI Defense. Scanne les compétences, serveurs MCP et plugins avec le SAST CodeGuard intégré, moteur d'inspection des appels d'outils, proxy de garde-fous LLM et intégration SIEM. Bloque automatiquement les résultats HIGH/CRITICAL.
microsandbox - Sandbox microVM léger pour exécuter du code généré par l'IA non fiable en toute sécurité avec de fortes garanties d'isolation
Adrian - Moteur open source de surveillance et de contrôle de sécurité d'exécution, aligné sur AARM, pour les agents IA par Secure Agentics. Analyse les journaux d'activité des agents (appels d'outils, actions, sorties) et les traces de raisonnement pour détecter les comportements malveillants, désalignés ou hors mandat, avec intervention en vol facultative (mode audit vs blocage). SDK Python (LangChain/LangGraph) et TypeScript, entièrement auto-hébergeable hors ligne. Apache-2.0.
HOL Guard - Harnais de sécurité local-first qui intercepte les appels d'outils dans les agents de codage IA (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) avant toute modification de fichiers ou contact réseau. Hooks pré-outils, centre d'approbation, scan consultatif de la chaîne d'approvisionnement et synchronisation facultative avec Guard Cloud.
Sécurité MCP
MCP-Security-Checklist - Une liste de contrôle de sécurité complète pour les outils IA basés sur MCP. Développée par SlowMist pour protéger les écosystèmes de plugins LLM.
Awesome-MCP-Security - Tout ce que vous devez savoir sur la sécurité du Model Context Protocol (MCP).
secure-mcp-gateway - Cette passerelle MCP sécurisée est construite avec authentification, découverte automatique d'outils, mise en cache et application de garde-fous.
mcp-context-protector - context-protector est un wrapper de sécurité pour les serveurs MCP qui traite les risques associés à l'exécution de serveurs MCP non fiables, notamment le saut de ligne, les modifications inattendues de configuration du serveur et d'autres attaques par injection de prompts
mcp-guardian - MCP Guardian gère l'accès de votre assistant LLM aux serveurs MCP, vous donnant un contrôle en temps réel sur l'activité de votre LLM.
MCP Audit VSCode Extension - Auditez et journalisez de manière centralisée tous les appels d'outils MCP de GitHub Copilot dans VSCode en toute simplicité.
MCP-Scan - Un outil de scan de sécurité pour les serveurs MCP
ATR (Agent Threat Rules) - Règles de détection open source pour les menaces liées aux agents IA. 108 règles regex couvrant l'injection de prompts, l'empoisonnement d'outils, l'exfiltration de credentials dans 9 catégories. Utilisé par Cisco AI Defense. Sous licence MIT.
MCPProxy - Proxy MCP local-first avec quarantaine SHA-256 par outil pour détecter les attaques d'empoisonnement d'outils et de rug-pull, scan automatique des données sensibles et des secrets dans les appels d'outils, isolation par sandbox Docker pour les serveurs MCP non fiables et OAuth 2.1. Sous licence MIT.
Scan des modèles et artefacts
modelscan - ModelScan est un projet open source de Protect AI qui scanne les modèles pour déterminer s'ils contiennent du code non sûr.
picklescan - Scanner de sécurité détectant les fichiers Python Pickle exécutant des actions suspectes
fickling - Un décompilateur et analyseur statique de pickling Python
medusa - Scanner de sécurité AI-first avec plus de 74 analyseurs, plus de 180 règles de sécurité pour agents IA, réduction intelligente des faux positifs. Prend en charge tous les langages. Détection de CVE pour React2Shell, RCE mcp-remote.
julius - Outil d'empreinte de services LLM pour les professionnels de la sécurité. Détecte plus de 32 services IA (Ollama, vLLM, LiteLLM, Hugging Face TGI, etc.) lors de tests d'intrusion et de découverte de la surface d'attaque. Utilise l'empreinte de services basée sur HTTP pour identifier l'infrastructure serveur.
a2a-scanner - Scannez les agents A2A pour détecter les menaces potentielles et les problèmes de sécurité### Sécurité défensive assistée par IA
Claude Code Security Review - Une GitHub Action de revue de sécurité propulsée par l'IA utilisant Claude pour analyser les modifications de code à la recherche de vulnérabilités de sécurité.
deepsec - Scanner de vulnérabilités basé sur des agents par Vercel Labs pour détecter les problèmes difficiles à repérer dans de grandes bases de code à l'aide d'agents de codage. Prend en charge l'analyse parallèle, la revue des diffs de PR et l'intégration CI/CD.
defending-code-reference-harness - Implémentation de référence pour la découverte et la remédiation autonomes de vulnérabilités avec Claude. Inclut des compétences de modélisation des menaces, de scan, de triage et de correction.
Visa Vulnerability Agentic Harness - Pipeline SAST agentique en 11 étapes, de la détection à la remédiation assistée par LLM et à la validation adversariale. Produit du SARIF, s'intègre à Claude Code, Copilot et Gemini.
GhidraGPT - Intègre les modèles GPT dans Ghidra pour l'analyse automatique de code, le renommage de variables, la détection de vulnérabilités et la génération d'explications.
IDAssist - Plugin de rétro-ingénierie propulsé par l'IA pour IDA Pro. Intègre l'analyse assistée par LLM dans l'interface d'IDA avec des graphes de connaissances sémantiques, la recherche documentaire RAG et la prise en charge de plusieurs fournisseurs de LLM (OpenAI, Anthropic, Ollama, LiteLLM). Analyse les fonctions, suggère des renommages, répond aux questions sur le code.
ThreatForest - Plateforme agentique de modélisation des menaces construite sur le framework Strands. Génère de manière autonome des arbres d'attaque à partir des dépôts, associe les étapes d'attaque aux techniques MITRE ATT&CK et produit des recommandations d'atténuation exploitables.
claude-grc-plugin - Plugin Claude Code qui transforme Claude en analyste GRC senior. Plus de 72 fichiers de référence couvrant 15 frameworks (NIST 800-53, FedRAMP, ISO 27001, SOC 2, etc.), 24 commandes slash et une connaissance approfondie du domaine pour les travaux de conformité fédéraux et commerciaux.
Vigil SOC - Une plateforme complète open-source d'opérations de sécurité pour les agents IA, permettant la surveillance en temps réel, la détection de menaces et la réponse aux incidents pour les environnements propulsés par l'IA.
AiSOC - SOC open-source, auto-hébergeable et propulsé par l'IA qui ingère les événements de sécurité, les corrèle, mène des investigations autonomes pilotées par l'IA via LangGraph et présente les résultats dans une console unifiée. Dispose d'une piste d'audit complète des décisions des agents, d'un harnais d'évaluation public dans le CI et de 52 connecteurs propriétaires. Sous licence MIT.
Diffprivlib - La bibliothèque de confidentialité différentielle d'IBM
TenSEAL - Une bibliothèque pour effectuer des opérations de chiffrement homomorphe sur des tenseurs
SyMPC - Une bibliothèque compagnon de calcul multipartite sécurisé pour Syft
Cloaked AI - Chiffrement open-source préservant les propriétés pour les plongements vectoriels
dstack - Framework IA confidentiel open-source pour le déploiement sécurisé de ML/LLM avec isolation matérielle et confidentialité des données
PrivacyRaven - bibliothèque de test de confidentialité pour les systèmes d'apprentissage profond
PLOT4ai - Bibliothèque de menaces pour la vie privée de l'intelligence artificielle — Une bibliothèque de modélisation des menaces pour vous aider à construire une IA responsable
OpenDP - Bibliothèque centrale pour les algorithmes de confidentialité différentielle du projet OpenDP — utilisée pour construire des pipelines d'entraînement ML préservant la confidentialité
Sécurité des données et de la chaîne d'approvisionnement
datasig - Empreinte de jeux de données pour l'AIBOM
Trusera ai-bom - Nomenclature des composants IA — découvrez chaque agent IA, modèle et API dans votre infrastructure
Compétences de sécurité IA agentiques
Elastic Agent Skills - Collection de compétences pour l'assistant IA d'Elastic, permettant des investigations de sécurité en langage naturel à travers les journaux, les traces et le renseignement sur les menaces
Ghost Security Skills - Compétences et outils de sécurité applicative des agents (appsec) pour Claude Code
tm_skills - Compétences d'agent pour aider à la modélisation continue des menaces
Trail of Bits Skills Marketplace - Compétences Claude Code de Trail of Bits pour la recherche en sécurité, la détection de vulnérabilités et les flux de travail d'audit
Semgrep Skills - Compétences Semgrep officielles pour Claude Code et d'autres assistants de codage IA. Fournit des capacités de scan de sécurité, d'analyse de code et de détection de vulnérabilités directement dans votre flux de développement assisté par IA.
claude-bug-bounty - Compétence Claude Code pour la chasse aux bugs bounty assistée par IA. Automatise les tests de reconnaissance, IDOR, XSS, SSRF, OAuth, GraphQL et d'injection LLM avec une liste de contrôle de validation à 4 étapes et la génération de rapports.
Anthropic Cybersecurity Skills - Plus de 734 compétences structurées en cybersécurité pour les agents IA. Mappées MITRE ATT&CK, norme agentskills.io. Compatible avec Claude Code, Copilot, Codex CLI, Cursor et Gemini CLI.
llm-sast-scanner - Compétence SAST pour les agents de codage IA (Claude Code, Codex, etc.) avec détection structurée de vulnérabilités sur 34 classes. Dispose d'une analyse de taint source-à-puits, d'une vérification Judge pour la réduction des faux positifs et de plus de 99 % de précision/rappel sur les benchmarks.
sast-skills - Collection de compétences d'agent qui transforment votre codeur IA en scanner SAST
pentest-ai-agents - 31 sous-agents Claude Code pour la sécurité offensive. Sous-agents IA spécialisés pour la reconnaissance, le web, l'AD, le cloud, le mobile, le sans-fil, l'ingénierie sociale, la création de charges utiles, la rétro-ingénierie, l'enchaînement d'exploits, l'ingénierie de détection, la forensique et la génération de rapports. Les agents de niveau 2 peuvent exécuter directement des outils avec des portes d'approbation.
Mantis Skills - Le pipeline découplé, séquentiel et centré sur la sécurité de Google, composé de compétences IA agentiques pour examiner, dédupliquer, valider, reproduire et corriger automatiquement les vulnérabilités dans des bases de code de toute taille. Dispose d'un pipeline multi-étapes (analyse d'architecture → modélisation des menaces → recherche → examen → reproduction → correction → calibrage → réflexion), d'un sandboxing intégré et d'une boucle d'apprentissage continu qui s'adapte au fil des exécutions itératives. Prend en charge le matériel RTL, l'IaC, les pipelines ML et les binaires compilés.
Modèles IA axés sur la sécurité
VulnLLM-R-7B - LLM de raisonnement spécialisé pour la détection de vulnérabilités. Utilise le raisonnement en chaîne de pensée pour analyser le flux de données, le flux de contrôle et le contexte de sécurité. Surpasse Claude-3.7-Sonnet et CodeQL sur les benchmarks de détection de vulnérabilités. Seulement 7B paramètres, ce qui le rend efficace et rapide.
Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning est un modèle de langage à poids ouverts de 8 milliards de paramètres, ajusté par instructions et spécialisé pour les applications de cybersécurité. Il étend le modèle de base Foundation-Sec-8B avec des capacités de suivi d'instructions et de raisonnement.
Antares (1B & 350M) - Modèles agentiques pour la localisation de vulnérabilités par fdtn-ai. Disponibles en variantes de 2B et 0,4B paramètres, conçus pour identifier et localiser de manière autonome les vulnérabilités dans le code.
CyberSecQwen-4B - _Spécialiste CTI de 4B paramètres, affiné à partir de Qwen3-4B-Instruct-2507 pour le renseignement sur les menaces en cybersécurité.
Meta-SecAlign-8B / Meta-SecAlign-70B - Modèles Llama alignés sur la sécurité, affinés pour résister aux attaques par injection de prompt, en maintenant la hiérarchie des instructions même sous des entrées adversariales
Lily-Cybersecurity-7B - Modèle de chat 7B ajusté pour la cybersécurité, optimisé pour l'analyse de sécurité, l'explication de vulnérabilités et les tâches de renseignement sur les menaces.
Classificateurs de sûreté et détection d'injection de prompt
Llama-Guard-4-12B - Le dernier classificateur de sûreté multimodal de Meta pour détecter les contenus nuisibles dans les entrées et sorties des LLM, sur les modalités texte et image.
Llama-Prompt-Guard-2-86M - Modèle léger de 86M paramètres de Meta pour détecter les tentatives d'injection de prompt et de jailbreak dans les pipelines de LLM en production.
ShieldGemma-2B - Classificateur de sûreté textuelle de 2B paramètres de Google pour détecter les contenus nuisibles, construit sur l'architecture Gemma.
DeBERTa Prompt Injection Detector v2 - DeBERTa-v3-base de Protect AI affiné pour la détection d'injection de prompt, largement utilisé dans les pipelines de garde-fous de LLM en production.
Prompt Injection Sentinel - Modèle ModernBERT-large affiné pour la classification des injections de prompt et des jailbreaks avec un faible taux de faux positifs.
Nemotron 3.5 Content Safety - Modèle de sûreté de contenu multimodal de 4B paramètres de NVIDIA, unifiant les garde-fous d'entrée texte+image, le support multilingue (plus de 35 langues), l'application personnalisable des politiques d'entreprise et un raisonnement auditable en un seul appel d'inférence. Successeur de Nemotron 3 Content Safety.
BrowseSafe - Modèle de sécurité spécialisé pour détecter les attaques par injection de prompt dans les agents navigateurs IA. Atteint un score F1 de 90,4 % sur BrowseSafe-Bench, optimisé pour la classification asynchrone en temps réel du contenu HTML brut.
Modèles de langage de sécurité adaptés au domaine
ATTACK-BERT - Modèle sentence-transformer pour associer le texte de sécurité aux techniques MITRE ATT&CK.
CySecBERT - Modèle BERT adapté aux tâches de cybersécurité et de CTI grâce à un pré-entraînement spécifique au domaine.
Jeux de données
SafetyPrompts - Collection organisée de prompts liés à la sûreté pour évaluer les propriétés de sûreté et de sécurité des LLM.
Do-Not-Answer - Jeu de données de prompts auxquels des LLM responsables ne devraient pas répondre, pour l'évaluation de la sûreté et le red teaming.
JailBreakV-28K - Jeu de données à grande échelle de 28 000 prompts de jailbreak pour l'évaluation comparative de la sûreté des LLM.
CL4R1T4S - Prompts système divulgués de ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit et d'autres outils IA majeurs. La plus grande collection connue de prompts système de production pour la transparence et la recherche sur la surface d'attaque.
LEAKHUB - Classement des fuites de prompts système — plateforme communautaire pour suivre et classer les fuites de prompts système à travers les produits IA.
Leaked System Prompts - Collection de prompts système divulgués provenant d'outils IA commerciaux — utile pour comprendre l'ingénierie de prompts du monde réel et les surfaces d'attaque.