AI Security Newsletter - Un digest mensuel de la recherche en sécurité IA, informations, rapports, événements à venir, outils et ressources
Un digest de la recherche en sécurité IA, des analyses, des rapports, des événements à venir, et des outils & ressources. Suivez la communauté AISecHub et notre groupe LinkedIn pour des mises à jour supplémentaires. Consultez également notre projet, Awesome AI Security.
Sponsorisé par InnovGuard.com - Conseil en Risques Technologiques et Cybersécurité - Innovons et Investissons avec Confiance, Avancez avec Assurance.
📌 Mise à jour de notre taxonomie : Modes de défaillance dans les systèmes d'IA agentiques Microsoft étend sa taxonomie des défaillances des IA agentiques basée sur le travail de red team, offrant aux équipes de sécurité une meilleure façon de raisonner sur l'utilisation abusive des outils, l'excès d'agence, la contamination de la mémoire, les limites d'identité et les lacunes de substitution humaine dans les systèmes agents déployés.
📌 Le ver Miasma frappe à nouveau Microsoft : Azure Functions Action et 72 autres dépôts désactivés après une attaque de la chaîne d'approvisionnement ciblant les agents de codage IA StepSecurity documente une campagne de la chaîne d'approvisionnement visant les workflows des agents de codage IA et les dépôts GitHub, avec un accent défensif sur la confiance dans les dépendances, la provenance des actions, les chemins d'écriture des dépôts et les informations d'identification visibles par les agents dans les environnements CI/CD.
📌 Le triste état de la répartition des compétences Les chercheurs de Trail of Bits ont contourné les vérifications de ClawHub, Cisco skill-scanner et skills.sh avec des paquets de compétences utilisant la troncature, l'indirection d'archive, l'empoisonnement de bytecode et le cadrage par injection de prompt, montrant pourquoi les places de marché publiques de compétences agents ont besoin de curation et de contrôles de provenance plutôt que de la seule confiance dans les scanners.
📌 Codex CLI RCE : Atténuations d'injection de prompt Cymulate parcourt les risques d'injection de prompt dans les agents de codage en ligne de commande, où un texte non fiable peut orienter les écritures de fichiers ou l'exécution d'outils à moins que le sandboxing, les limites d'approbation et les contraintes de commandes ne soient appliqués en dehors du modèle.
📌 Agentjacking : L'injection MCP détourne les agents de codage IA Cloud Security Alliance résume le modèle "agentjacking" de Sentry vers MCP, où la télémétrie ou le contenu de problème contrôlé extérieurement devient un contexte de confiance pour les agents de codage. Le cadre défensif utile est de traiter les données d'observabilité, de rapport de bug et d'intégration comme une entrée non fiable pour l'agent, et non comme des métadonnées de développement neutres.
📌 SearchLeak : Comment nous avons transformé M365 Copilot en une arme d'exfiltration de données en un clic Varonis décrit une chaîne d'attaque de Microsoft 365 Copilot Enterprise qui combine l'injection paramètre-à-prompt, le comportement de rendu HTML et l'abus de chemin de recherche pour fuiter des données sensibles de M365 via un workflow en un clic.
📌 AutoJack : Comment une seule page peut provoquer une RCE sur l'hôte exécutant votre agent IA Microsoft montre comment une page web malveillante visualisée par un agent de navigation IA peut atteindre un service AutoGen Studio local et déclencher l'exécution d'un processus hôte via une confiance locale non sécurisée et la gestion des actions de l'agent.
📌 Attaque de la chaîne d'approvisionnement Mastra npm : Plus de 140 paquets backdoorés via le typosquatting easy-day-js StepSecurity rapporte un compromis de l'écosystème npm de Mastra via une dépendance typosquattée avec un dropper postinstall obfusqué, affectant les paquets agent, RAG, MCP et workflow utilisés dans les piles d'application IA.
📌 Percer LiteLLM : D'un utilisateur à faible privilège à l'administrateur et RCE Obsidian documente un chemin d'escalade de privilèges et de RCE en chaîne dans LiteLLM, montrant comment un accès à faible privilège à une passerelle IA peut devenir un contrôle administratif sur les secrets des fournisseurs, la politique proxy et les fonctions runtime de l'agent.
📌 Vulnérabilité Amazon Q : Compromis via l'exécution automatique MCP Wiz analyse un problème de l'extension VS Code Amazon Q où une configuration MCP de confiance dans l'espace de travail, dans un dépôt cloné, pourrait charger automatiquement un comportement contrôlé par l'attaquant et exposer les chemins d'exécution du développeur et les informations d'identification cloud.
📌 macOS.Gaslight : Un backdoor Rust transforme l'injection de prompt contre l'analyste, pas le sandbox SentinelOne documente un backdoor Rust qui injecte du contenu d'injection de prompt destiné aux analystes et aux outils assistés par IA, déplaçant l'attaque de l'évasion du sandbox à la manipulation de l'humain et du modèle qui examine le malware.
📌 Computer-Use et TOCTOU : Ce que vous cliquez n'est pas ce que vous obtenez ! Johann Rehberger démontre une condition de course d'agent computer-use où l'écran change après que le modèle l'ait observé mais avant le clic, transformant une interaction d'apparence bénigne en une action d'envoi Outlook et faisant de la revalidation pixel ou état avant action un contrôle central.
📌 L'approche spectre de codage vibe pour le développement logiciel assisté par IA Le NCSC britannique présente le codage assisté par IA comme un spectre de risques, séparant les prototypes à faible risque du code généré qui touche à l'authentification, l'autorisation, les données sensibles, le comportement critique pour la sécurité ou les infrastructures critiques.
📌 Injection de prompt et sécurité du runtime agent : Un modèle de menace pratique TMLS présente l'injection de prompt comme un problème de sécurité runtime, cartographiant les attaques à travers la médiation d'outils, les magasins de mémoire, les canaux sortants et les lacunes d'approbation humaine. Le point pratique est de déplacer les contrôles dans les courtiers de capacités, l'exécution sandboxée, les listes blanches et les chemins d'audit au lieu de traiter le texte du prompt comme la frontière de sécurité.
📌 Ce qui s'est passé après que 2 000 personnes aient essayé de pirater mon assistant IA Fernando Irarrázaval rapporte un défi d'injection de prompt d'agent email OpenClaw avec plus de 6 000 tentatives et aucune fuite de secret réussie, tout en faisant remonter des problèmes pratiques de déploiement autour de la contamination de la mémoire de l'agent, du contexte batch, du coût API, de la suspension de compte et du choix du modèle.
🧰 AgentStalker - Benchmark et toolkit d'analyse des vulnérabilités agents avec suivi de flux, analyse AST, audit de code et reproduction sandboxée pour les chemins d'attaque agentiques. ⭐️115
🧰 darknet-mcp-server - Serveur MCP qui expose les outils de brèche, rançongiciel, malware, exploit, logs de voleurs et renseignements sur les menaces aux agents IA pour des workflows de recherche en sécurité contrôlés. ⭐️67
🧰 mcp-trust-plane - Plan de sécurité des données et de garde-fou composable pour les fournisseurs de Model Context Protocol, axé sur les contrôles de politique autour des outils et données connectés à MCP. ⭐️60
🧰 prompt-gate - Contrôle DLP local et couche DNS pour bloquer les outils IA non autorisés et inspecter les prompts sortants à la recherche de secrets ou de données sensibles avant qu'ils ne quittent le point de terminaison. ⭐️28
🧰 claude-ai-cyber-security-skills - Collection de compétences Claude Code pour les workflows de sécurité, incluant les tests offensifs, l'analyse défensive et les modèles d'investigation assistée par outils. ⭐️17
🧰 talos - Service de clés API et de jetons de capacité pour les humains, les services et les agents IA qui ont besoin d'une autorisation machine-à-machine limitée. ⭐️14
🧰 SkillsGuard - Scanner statique pour les paquets de compétences agents IA malveillants ou dangereux, les fichiers SKILL.md et les scripts intégrés. ⭐️13
🧰 tamga - Proxy de sécurité LLM auto-hébergé pour la rédaction de données personnelles, la défense contre l'injection de prompt et les contrôles de conformité autour du trafic des modèles. ⭐️11
🧰 llm-sec-range - Terrain d'attaque et de défense LLM couvrant les CTF d'injection de prompt, l'OWASP LLM Top 10, les agents vulnérables et les cibles de modèles locaux. ⭐️9
🧰 aka-claude-tools - Utilitaires de durcissement Claude Code pour un contexte propre, des profils isolés, des identifiants verrouillés, un égress surveillé et des valeurs par défaut locales plus sûres. ⭐️9
🧰 agent-jackstop - Couche de durcissement pour Cursor et Claude Code contre l'injection de prompt via une sortie d'outil non fiable, également décrite comme agentjacking. ⭐️8
🧰 LLM-Safety-platform - Plateforme de red-teaming IA pour l'évaluation des vulnérabilités LLM, l'injection de prompt, les attaques par obfuscation et l'analyse de stabilité d'échantillonnage. ⭐️6
La mise à jour de juin d'OWASP transforme la sécurité des IA agentiques en une carte de gouvernance et d'ingénierie, couvrant les workflows autonomes, les catégories de risques agents, les contrôles et l'écart pratique entre les premiers modèles de menace et les incidents de production.
Cloud Security Alliance publie 247 objectifs de contrôle IA dans 18 domaines de sécurité, avec des correspondances avec les cadres d'assurance et de conformité tels que ISO 42001, ISO 27001, BSI AIC4 et la gouvernance orientée AI Act de l'UE.
La CSA transforme l'AI Controls Matrix en guide de mise en œuvre pour les fournisseurs de services cloud, couvrant la planification des audits, la remédiation, la gestion des vulnérabilités, la supervision des partenaires, la détection des menaces et les pratiques d'assurance spécifiques à l'IA.
Le NCSC britannique et les partenaires Five Eyes avertissent que l'IA réduit les barrières pour les attaquants et comprime la fenêtre vulnérabilité-exploitation, tout en cartographiant le changement de risque vers des valeurs par défaut sécurisées par conception, la réduction de l'exposition, la rapidité des correctifs, l'authentification forte, la préparation aux incidents et l'utilisation défensive de l'IA.
La NSA et ses partenaires internationaux publient des recommandations de conception de sécurité MCP pour l'automatisation pilotée par IA, couvrant l'authentification, l'autorisation, la confiance dans les serveurs, les contrôles de transport, l'exposition des outils et la surveillance pour les écosystèmes agents passant des expériences à la production.
🛡️ CVE-2026-49257: mcp-pinot expose une invocation d'outil MCP non authentifiée Critique 10.0. mcp-pinot peut lier un serveur MCP HTTP à 0.0.0.0 avec OAuth désactivé par défaut, exposant les outils de mutation SQL, schéma et table via les identifiants Apache Pinot côté serveur.
🛡️ CVE-2026-54309: Le transport MCP Browser de n8n accepte des appels d'outil non authentifiés Critique 10.0. Le transport HTTP MCP Browser de n8n peut accepter l'initialisation de session et les appels d'outil sans authentification, exposant l'automatisation de contrôle de navigateur à des clients accessibles.
🛡️ CVE-2026-56274: Injection de commande dans Flowise Custom MCP Server Critique 9.9. La gestion des indicateurs de commande et les restrictions d'accès aux fichiers de Flowise Custom MCP Server peuvent être contournées pour une injection de commande OS dans une plateforme de workflow LLM.
🛡️ CVE-2026-55255: IDOR d'exécution de flux Langflow Critique 9.9. L'API des réponses de Langflow peut permettre à un attaquant authentifié d'exécuter le flux d'un autre utilisateur en fournissant un ID de flux victime, brisant l'isolation des locataires pour l'exécution de workflow IA.
🛡️ CVE-2026-50548: Évasion du sandbox terminal de l'agent Cursor Critique 9.8. Le sandbox terminal de l'agent Cursor peut être contourné en modifiant les paramètres du répertoire de travail, permettant des actions terminales pilotées par l'agent en dehors des limites prévues de l'espace de travail.
🛡️ CVE-2026-50549: Évasion du sandbox d'écriture de fichier de l'agent Cursor Critique 9.8. Le sandbox d'écriture de fichier de Cursor peut revenir incorrectement après un échec de canonisation, créant un chemin pour les écritures de fichier de l'agent en dehors des limites prévues du projet.
🛡️ CVE-2026-49468: Contournement d'autorisation d'en-tête hôte du proxy LiteLLM Critique 9.8. L'analyse de l'en-tête hôte du proxy LiteLLM peut permettre un accès non authentifié aux routes de gestion protégées dans des conditions de déploiement spécifiques, risquant les contrôles de passerelle et les secrets des fournisseurs.
🛡️ CVE-2026-7664: Contournement d'autorisation MCP Streamable d'IBM Langflow Critique 9.8. Le transport MCP Streamable d'IBM Langflow peut exposer des ressources et opérations MCP protégées à des attaquants non authentifiés dans les versions open source concernées.
🛡️ CVE-2026-55743: Contournement de la liste blanche du shell de l'agent desktop OpenHuman Critique 9.6. La liste blanche du shell de l'agent desktop OpenHuman peut être contournée via des indicateurs d'exécution find et des astuces d'environnement, transformant des chemins d'injection de prompt indirecte en exécution de commande hôte.
📅 IEEE CSR GenXSec 2026 - 3-5 août 2026 · Lisbonne, Portugal · Organisateur : IEEE CSR
📅 Black Hat USA 2026 - AI Summit - 4 août 2026 · Las Vegas, NV, États-Unis · Organisateur : Black Hat
📅 CAMLIS 2026 - 21-23 octobre 2026 · Arlington, VA, États-Unis · Organisateur : CAMLIS
📅 GAISS 2026 - 28-30 octobre 2026 · Austin, TX, États-Unis · Organisateur : IEEE
📅 ACM AISec 2026 - 15-19 novembre 2026 · La Haye, Pays-Bas · Organisateur : ACM AISec
📖 AgentRedBench : Redteaming dynamique et défense intégrée pour les agents LLM sur les intégrations SaaS
Évalue l'injection de prompt indirecte contre les agents utilisant des outils connectés à des intégrations SaaS telles que Gmail, Salesforce et Jira, rendant la surface d'attaque plus proche des workflows agents de production que les tests d'injection de prompt uniquement par chat. arXiv
📖 SkillGuard : Un cadre d'autorisations pour les compétences agents
Traite les compétences agents tierces comme des artefacts logiciels avec autorisations, cartographiant ce qu'une compétence peut injecter dans le contexte de l'agent avec ce qu'elle peut amener l'agent à faire à l'exécution. arXiv
📖 Incohérence description-code dans les serveurs MCP réels : Mesure, détection et implications de sécurité
Mesure 19 200 paires description-code provenant de 2 214 serveurs MCP et constate que les descriptions d'outils divergent souvent du comportement réel de l'implémentation, créant un angle mort pour les agents qui choisissent des outils sur la base de descriptions en langage naturel. arXiv
📖 GitInject : Attaques par injection de prompt dans les pipelines CI/CD pilotés par IA
Montre comment les agents IA intégrés dans les workflows CI/CD et de pull request peuvent ingérer du contenu de dépôt contrôlé par l'attaquant tout en détenant des autorisations élevées, transformant l'injection de prompt en un risque pour la chaîne d'approvisionnement logicielle. arXiv
📖 Vers des agents LLM sécurisés : Surfaces de menace, attaques, défenses et évaluation
Synthétise 247 articles en une carte systémique de la sécurité des agents, centrée sur le flux d'informations, l'autorité déléguée, l'état persistant, le détournement de flux de contrôle par l'intermédiaire d'outils et la faiblesse des défenses non compositionnelles. arXiv
📖 Politique de même origine pour les navigateurs agentiques
Montre que les navigateurs agentiques peuvent devenir des canaux automatisés de flux de données inter-origines, puis propose SOPGuard pour appliquer les limites d'origine du navigateur tout en préservant l'utilité des tâches. arXiv
📖 Bénin isolé, nuisible en composition : Risques de sécurité dans les écosystèmes de compétences agents
Introduit le Risque de Composition de Compétences, où des compétences individuellement bénignes deviennent nuisibles lorsque leurs sorties, signaux de confiance, indices d'autorisation ou effets secondaires influencent des appels d'outils ultérieurs dans un contexte agent partagé. arXiv
📖 SafeClawBench : Séparer les préjudices sémantiques, de preuve d'audit et de sandbox dans les agents LLM utilisant des outils
Introduit un benchmark par étapes pour la sécurité des agents utilisant des outils, couvrant l'injection de prompt directe et indirecte, l'injection de retour d'outil, l'empoisonnement de mémoire, l'extraction de mémoire et l'inférence non sécurisée, séparant l'accord du modèle du préjudice visible par audit et observé dans le sandbox. arXiv
📖 "Ce qui se produit localement, fuit globalement" : Détection des risques de fuite de confidentialité dans les serveurs MCP
Présente la fuite MCP comme un problème de confidentialité induit par le protocole, où les identifiants, clés API ou données personnelles traversent la frontière locale-LLM via des valeurs retournées, des logs ou des erreurs de gestionnaires d'outils. arXiv
📖 ShareLock : Une attaque par empoisonnement multi-outils à seuil furtif contre MCP
Introduit une attaque par empoisonnement multi-outils MCP où des instructions malveillantes sont réparties entre des descriptions d'outils d'apparence bénigne et reconstruites seulement après un déclencheur, réduisant la détectabilité par rapport à l'empoisonnement mono-outil. arXiv
💬 Un dépôt GitHub propre trompe les agents de codage IA pour qu'ils exécutent un malware r/cybersecurity · Score Reddit 183 · 19 commentaires Les praticiens ont traité le fil comme un cas de limite de confiance des agents de codage : les prompts de dépôt, les fichiers de configuration, les scripts d'installation et le contexte de sortie d'outils peuvent devenir une influence d'exécution avant qu'un réviseur ne voie une charge utile malveillante conventionnelle.
💬 Le backdoor macOS Gaslight arme l'injection de prompt contre les analystes de sécurité r/cybersecurity · Score Reddit 202 · 11 commentaires La discussion a présenté l'injection de prompt comme un abus de workflow d'analyse de malware : des échantillons malveillants peuvent planter des instructions pour les analystes et leurs outils IA, de sorte que l'environnement de révision, les notes de l'analyste et le contexte du modèle font partie de la surface d'attaque.
💬 Déploiement de Copilot - À quel point devrais-je m'inquiéter de l'injection de prompt indirecte ? r/cybersecurity · Score Reddit 48 · 31 commentaires Les équipes de sécurité ont comparé les contrôles de déploiement de Copilot pour l'injection de prompt indirecte, en se concentrant sur les documents et courriels non fiables, les autorisations utilisateur héritées, les données trop partagées, la portée des connecteurs et si le moindre privilège seul est suffisant pour les assistants à récupération augmentée.💬 Comment les équipes gèrent-elles la surface d'exposition des outils MCP ? r/cybersecurity · Score Reddit 13 · 19 commentaires Le fil a porté sur MCP comme frontière d'exposition des outils : les équipes ont débattu de l'accessibilité des serveurs, de la fiabilité des descriptions d'outils, des paliers d'approbation, de l'autorisation par outil, et de savoir si l'accès aux outils des agents devrait être modélisé plus proche de l'accès aux API ou de l'exécution de code local.
💬 La politique de sécurité de votre entreprise est-elle réellement prête pour les agents IA, ou faisons-nous tous semblant ? r/cybersecurity · Score Reddit 47 · 73 commentaires Les praticiens ont cartographié les agents IA sur les lacunes de gouvernance dans les politiques existantes : qui est responsable des actions automatisées, ce qui nécessite une approbation humaine, comment les permissions déléguées sont journalisées, et comment la réponse aux incidents change lorsqu'un opérateur de workflow est partiellement automatisé.
1️⃣ RCE dans les agents de codage LLM : leçons des vulnérabilités récemment divulguées de Claude Code Session Cloud Native San Francisco sur les leçons des RCE dans les agents de codage, utile pour les équipes qui examinent comment l'injection de prompts, les outils locaux et les environnements de développement peuvent se combiner pour créer un risque d'exécution côté hôte.
2️⃣ L'avenir de l'IA d'entreprise sécurisée : construire des agents fiables avec MCP Conférence Xpand sur la conception d'agents d'entreprise basés sur MCP, avec un accent pratique sur l'infrastructure d'agents fiable, l'exposition des données et les contrôles de sécurité autour des outils connectés.
3️⃣ Conférence de sécurité nationale CNAS 2026 : établir les règles de la guerre de l'IA Session CNAS sur les normes de guerre de l'IA et la politique de sécurité nationale, pertinente pour les équipes de sécurité qui suivent l'évolution des opérations cybernétiques assistées par l'IA vers la doctrine et la gouvernance du secteur public.
4️⃣ Guide du HitchHacker pour construire des agents sécurisés Conférence NDC sur la construction sécurisée d'agents, couvrant les risques d'ingénierie qui apparaissent lorsque les agents reçoivent des outils, des identifiants, un état et une autonomie dans des systèmes logiciels réels.
5️⃣ Attaquer les systèmes d'IA Session CodeValue sur l'attaque des systèmes d'IA, utile comme parcours orienté praticien de la manière dont les fonctionnalités IA élargissent les modèles de menace des applications au-delà de la simple gestion des invites et des API.
6️⃣ BlueHat 2026 : D'agents de confiance à adversaires : sécuriser l'IA agentique à l'ère de l'injection de prompts Talk BlueHat 2026 sur la façon dont les workflows d'agents de confiance deviennent adverses lorsque les sorties d'outils, le contenu récupéré et les actions déléguées traversent les frontières de confiance.
7️⃣ Violer les applications propulsées par LLM : surmonter les défis de sécurité et de confidentialité Session Spring I/O par Brian Vermeer couvrant les chemins d'attaque pratiques contre les applications propulsées par LLM, y compris l'injection de prompts, la fuite de confidentialité, le risque d'intégration d'application et les atténuations architecturales.
8️⃣ ContinuumCon 2026 - Chasser l'injection de prompts Talk ContinuumCon par Mackenzie Jackson sur la recherche, le test et le raisonnement sur le comportement d'injection de prompts dans les systèmes d'IA en tant que problème de sécurité opérationnelle.
9️⃣ Sécuriser les agents IA avec MCP et l'identité Zero Trust Session DZone Events sur la sécurisation des agents connectés à MCP avec des concepts d'identité zéro confiance, un accès limité, une autorisation par outil et des workflows délégués plus sûrs.
🔟 La sécurité pratique de MCP en action Session technique du Bulgarian Java User Group par Willem Jan Glerum sur les compromis de sécurité de MCP, l'exposition des serveurs et outils, les risques de configuration et les contrôles pour les intégrations d'agents.
Si vous êtes un fondateur en train de construire quelque chose de nouveau ou un investisseur évaluant des opportunités en phase de démarrage - contactez-moi.
💬 Vous avez lu quelque chose d'intéressant ? Partagez vos réflexions dans les commentaires.