#1Outils de sécurité basés sur le ML, apprentissage automatique adversarial et cyberdéfense alimentée par l'IA.
Recommandé par Kitploit

Modèle de classification de tokens bidirectionnel pour la détection et le masquage des données personnelles (PII) dans le texte, avec une interface…

Code de recherche pour une attaque de trojan en boîte grise qui inverse un seul bit du cache KV dans des classificateurs LLM affinés et mesure le…

Défense d'audit des actions avant exécution qui détecte et masque l'injection indirecte de prompts dans les agents LLM utilisant des outils, grâce à…

Artefacts de type correctif avec défauts intégrés

Module GNU Radio pour la sécurité de la couche physique utilisant l'empreinte de canal par apprentissage profond, la quantification de…

Recherche de code et expériences pour défendre les agents LLM intégrés à des outils contre les attaques adversariales, en étendant Agent Security…

Syntactic Ghost : Une attaque de porte dérobée généraliste et imperceptible sur les modèles de langage pré-entraînés

Code de recherche reproduisant les expériences de jailbreak multi-tours sur les LLM (FITD, MRCJ, ActorAttack, X-Teaming) issues de l'article de…

Code de recherche pour le Rubric-Induced Preference Drift (RIPD) : recherche évolutionnaire de rubriques, sélection préservant les benchmarks et…

Gestion automatisée du contexte multi-agents pour les tâches à long horizon dans les agents d'IA locaux

Ce dépôt contient l'implémentation officielle de l'article « [Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting] »

Framework d'attaque de shilling de groupe agentique piloté par LLM qui manipule les classements de systèmes de recommandation à filtrage collaboratif…

Plateforme open-source de renseignement sur les menaces pour l'analyse de logiciels malveillants et d'observables. Enrichit les IP, domaines, URL et…

Une base de connaissances structurée couvrant les fondamentaux de la sécurité de l'IA, la modélisation des menaces, les techniques offensives de red…

Robust audio watermarking framework embedding binary messages into magnitude spectrograms, with differentiable attack simulation, Q-Former pooling,…

Code de recherche pour les attaques par empoisonnement sur le PGM-index, démontrant comment concevoir des données adverses afin de dégrader les…

Hybrides pipelines d'apprentissage automatique pour détecter les injections SQL dans le trafic web, combinant les modèles DistilBERT et BERT-GNN avec…

Cadre de recherche évolutionnaire sensible à la trajectoire pour le red-teaming d’agents LLM sur des serveurs MCP, générant des invites adversariales…