
Liste sélectionnée d'articles, d'études et de boîtes à outils sur l'apprentissage par porte dérobée, recensant les attaques par empoisonnement et les défenses en apprentissage profond pour les chercheurs et les professionnels de la sécurité.
Ce dépôt Github résume une liste de ressources sur le Backdoor Learning. Pour plus de détails et les critères de catégorisation, veuillez consulter notre enquête.
Nous ferons de notre mieux pour maintenir ce dépôt Github en continu, sur une base mensuelle.
Le Backdoor learning est un domaine de recherche émergent qui aborde les problèmes de sécurité du processus d'entraînement des algorithmes d'apprentissage automatique. Il est essentiel pour adopter en toute sécurité des ressources ou des modèles d'entraînement tiers dans la réalité.
Remarque : « Backdoor » est également couramment appelé « Neural Trojan » ou « Trojan ».
Si notre dépôt ou notre enquête est utile à vos recherches, veuillez citer notre article comme suit :``` @article{li2022backdoor, title={Backdoor learning: A survey}, author={Li, Yiming and Jiang, Yong and Li, Zhifeng and Xia, Shu-Tao}, journal={IEEE Transactions on Neural Networks and Learning Systems}, year={2022} }
## Contribuer
<p align="center">
<img src="https://assets.kitploit.com/production/public/readmes/placeholders/f0fc86cfe65f76d40e15aaec61704ec8220a56dc89d4be03c46f67cb31b9fa8c.svg" alt="Nous avons besoin de vous !">
</p>
Merci de contribuer à cette liste en [me contactant](http://liyiming.tech) ou en ajoutant une [pull request](https://github.com/THUYimingLi/awesome-backdoor-learning/pulls)
Format Markdown :```markdown
- Paper Name.
[[pdf]](link)
[[code]](link)
- Author 1, Author 2, **and** Author 3. *Conference/Journal*, Year.
Remarque : Dans la même année, veuillez placer l'article de conférence avant l'article de revue, car les revues sont généralement soumises il y a longtemps et présentent donc un certain décalage. (c.-à-d., Conférences-->Revues-->Prépublications)
Backdoor Learning: A Survey. [pdf]
Backdoor Attacks and Countermeasures on Deep Learning: A Comprehensive Review. [pdf]
Data Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses. [pdf]
A Comprehensive Survey on Poisoning Attacks and Countermeasures in Machine Learning. [lien]
Backdoor Attacks and Defenses in Federated Learning: State-of-the-art, Taxonomy, and Future Directions. [lien]
Backdoor Attacks on Image Classification Models in Deep Neural Networks. [lien]
Defense against Neural Trojan Attacks: A Survey. [lien]
A Survey on Neural Trojans. [pdf]
Backdoor Attacks against Voice Recognition Systems: A Survey.
Poisoning-based Backdoor Attacks in Computer Vision. [pdf]
Defense of Backdoor Attacks against Deep Neural Network Classifiers. [pdf]
Towards Adversarial and Backdoor Robustness of Deep Learning. [lien]
Toward Robust and Communication Efficient Distributed Machine Learning. [pdf]
Towards Robust Image Classification with Deep Learning and Real-Time DNN Inference on Mobile. [pdf]
Countermeasures Against Backdoor, Data Poisoning, and Adversarial Attacks. [pdf]
Understanding and Mitigating the Impact of Backdooring Attacks on Deep Neural Networks. [pdf]
Un-fair trojan: Targeted Backdoor Attacks against Model Fairness. [pdf]
Check Your Other Door: Creating Backdoor Attacks in the Frequency Domain. [pdf]
Revisiting the Assumption of Latent Separability for Backdoor Defenses. [pdf] [code]
Few-shot Backdoor Attacks via Neural Tangent Kernels. [pdf] [code]
Color Backdoor: A Robust Poisoning Attack in Color Space. [pdf]
Untargeted Backdoor Watermark: Towards Harmless and Stealthy Dataset Copyright Protection. [pdf] [code]
DEFEAT: Deep Hidden Feature Backdoor Attacks by Imperceptible Perturbation and Latent Representation Constraints. [pdf]
Marksman Backdoor: Backdoor Attacks with Arbitrary Target Class. [pdf]
An Invisible Black-box Backdoor Attack through Frequency Domain. [pdf] [code]
BppAttack: Stealthy and Efficient Trojan Attacks against Deep Neural Networks via Image Quantization and Contrastive Adversarial Learning. [pdf] [code]
Dynamic Backdoor Attacks Against Machine Learning Models. [pdf]
Imperceptible Backdoor Attack: From Input Space to Feature Representation. [pdf] [code]
Invisible Backdoor Attack with Sample-Specific Triggers. [pdf] [code]
Manipulating SGD with Data Ordering Attacks. [pdf]
Backdoor Attack with Imperceptible Input and Latent Modification. [pdf]
LIRA: Learnable, Imperceptible and Robust Backdoor Attacks. [pdf]
Blind Backdoors in Deep Learning Models. [pdf] [code]
Backdoor Attacks Against Deep Learning Systems in the Physical World. [pdf] [Mémoire de master]
Deep Feature Space Trojan Attack of Neural Networks by Controlled Detoxification. [pdf] [code]
WaNet - Imperceptible Warping-based Backdoor Attack. [pdf] [code]
Attaque backdoor composite pour réseaux de neurones profonds en mélangeant des caractéristiques bénignes existantes. [pdf]
Attaque backdoor dynamique sensible à l'entrée. [pdf] [code]
Contourner les algorithmes de détection de backdoor en apprentissage profond. [pdf]
Intégration de backdoor dans les modèles de réseaux de neurones convolutifs via une perturbation invisible. [pdf]
Attaques backdoor à étiquettes propres sur les modèles de reconnaissance vidéo. [pdf] [code]
Échapper à la détection des attaques backdoor en apprentissage profond. [lien]
Backdoor par réflexion : une attaque backdoor naturelle sur les réseaux de neurones profonds. [pdf] [code]
Attaques Trojan en direct sur les réseaux de neurones profonds. [pdf]
Une nouvelle attaque backdoor dans les CNN par corruption de l'ensemble d'entraînement sans empoisonnement des étiquettes. [pdf]
Attaques backdoor cohérentes avec les étiquettes. [pdf] [code]
BadNets : identifier les vulnérabilités dans la chaîne d'approvisionnement des modèles d'apprentissage automatique. [pdf] [journal]
Attaques backdoor ciblées sur les systèmes d'apprentissage profond à l'aide d'un empoisonnement de données. [pdf] [code]
Backdoors façonnées à la main dans les réseaux de neurones profonds. [pdf]
Attaque Trojan à peine perceptible contre les réseaux de neurones avec des retournements de bits. [pdf] [code]
ProFlip : attaque Trojan ciblée avec retournements de bits progressifs. [pdf]
TBT : attaque ciblée de réseaux de neurones avec bit Trojan. [pdf] [code]
Comment injecter des backdoors avec une meilleure cohérence : ancrage des logits sur des données propres. [pdf]
Les perturbations adverses des poids peuvent-elles injecter des backdoors neuronales ? [pdf]
Attaque polyvalente sur les poids via le basculement d'un nombre limité de bits. [pdf]
Vers des attaques réalistes d'injection de backdoor sur les DNN à l'aide de Rowhammer. [pdf]
LoneNeuron : un Trojan neuronal dans le domaine des caractéristiques, très efficace, utilisant des filigranes invisibles et polymorphes. [pdf]
Vers une attaque backdoor pratique au stade du déploiement sur les réseaux de neurones profonds. [pdf] [code]
Cacher des aiguilles dans une botte de foin : vers la construction de réseaux de neurones qui échappent à la vérification. [lien] [code]
Trojan furtif et flexible dans un cadre d'apprentissage profond. [lien]
FooBaR : attaque backdoor par tromperie de panne sur l'entraînement des réseaux de neurones. [lien] [code]
DeepPayload : attaque backdoor en boîte noire sur les modèles d'apprentissage profond par injection de charge utile neuronale. [pdf]
Une approche d'une simplicité déconcertante pour l'attaque Trojan dans les réseaux de neurones profonds. [pdf] [code]
ImpNet : backdoors imperceptibles et indétectables en boîte noire dans les réseaux de neurones compilés. [pdf] [site web] [code]
Ne me déclenchez pas ! Une attaque backdoor sans déclencheur contre les réseaux de neurones profonds. [pdf]
Attaque backdoor dans le monde physique. [pdf] [extension]
DeepSweep : un cadre d'évaluation pour atténuer les attaques backdoor sur les DNN à l'aide de l'augmentation de données. [pdf] [code]
Februus : défense par purification des entrées contre les attaques Trojan sur les systèmes de réseaux de neurones profonds. [pdf] [code]
Trojans neuronaux. [pdf]
Défendre les réseaux de neurones profonds contre les attaques backdoor à l'aide d'un autoencodeur de dé-déclenchement. [pdf]
ConFoc : protection axée sur le contenu contre les attaques Trojan sur les réseaux de neurones. [pdf]
Défense indépendante du modèle contre les attaques backdoor en apprentissage automatique. [pdf]
Assainissement des backdoors avec des données non étiquetées. [pdf] [code]
Désapprentissage adverse des backdoors via l'hypergradient implicite. [pdf] [code]
Suppression de backdoor sans données basée sur la lipschitzianité des canaux. [pdf] [code]
Éliminer les déclencheurs de backdoor pour les réseaux de neurones profonds à l'aide de la distillation de graphes de relations d'attention. [pdf]
Les distributions de pré-activation exposent les neurones backdoor. [pdf] [code]
L'élagage adverse de neurones purifie les modèles profonds infectés de backdoor. [pdf] [code]
Distillation de l'attention neuronale : effacer les déclencheurs de backdoor des réseaux de neurones profonds. [pdf] [code]
Distiller les motifs backdoor cognitifs dans une image. [pdf] [code]
UNICORN : un cadre unifié d'inversion de déclencheurs backdoor. [pdf] [code]
Meilleure optimisation de l'inversion de déclencheur dans l'analyse des portes dérobées. [pdf] [code]
Défense en quelques exemples contre les portes dérobées à l'aide de l'estimation de Shapley. [pdf]
Repenser la rétro-ingénierie des déclencheurs Trojan. [pdf] [code]
Effacement de porte dérobée neuronale en un seul essai via le masquage adversarial des poids. [pdf] [code]
Détection de portes dérobées complexes par différenciation symétrique des caractéristiques. [pdf] [code]
Détection post-entraînement des attaques par porte dérobée pour les scénarios à deux classes et multi-attaques. [pdf] [code]
Mélange aléatoire de canaux : détection d'attaques par porte dérobée à surcharge minimale sans ensembles de données propres. [pdf] [code]
Une approche de détection d'anomalies pour les réseaux de neurones compromis par des portes dérobées : la reconnaissance faciale comme étude de cas. [pdf]
Détection de portes dérobées basée sur le chemin critique pour les réseaux de neurones profonds. [lien]
Détection de Trojan dans l'IA à l'aide de l'analyse neurale méta. [pdf]
Détection topologique des réseaux de neurones compromis par des chevaux de Troie. [pdf]
Défense contre les portes dérobées via le découplage du processus d'entraînement. [pdf] [code]
Défense efficace contre les portes dérobées en exploitant la sensibilité des échantillons empoisonnés. [pdf] [code]
Piéger et remplacer : défendre contre les attaques par porte dérobée en les piégeant dans un sous-réseau facile à remplacer. [pdf] [code]
S'entraîner avec plus de confiance : atténuer les portes dérobées injectées et naturelles pendant l'entraînement. [pdf] [code]
Apprentissage anti-porte dérobée : entraîner des modèles propres sur des données empoisonnées. [pdf] [code]
Détection robuste d'anomalies et détection d'attaques par porte dérobée via la confidentialité différentielle. [pdf] [code]
Une forte augmentation de données assainit les attaques par empoisonnement et par porte dérobée sans compromis sur la précision.
SCALE-UP : une détection efficace de portes dérobées au niveau des entrées en boîte noire via l'analyse de la cohérence des prédictions mises à l'échelle. [pdf] [code]
Distillation des motifs cognitifs de portes dérobées dans une image. [pdf] [code]
Le regroupement par incompatibilité comme défense contre les attaques par empoisonnement de portes dérobées. [pdf] [code]
Les résurrections de "Beatrix'' : détection robuste de portes dérobées via les matrices de Gram. [pdf] [code]
Défense efficace contre les portes dérobées en exploitant la sensibilité des échantillons empoisonnés. [pdf] [code]
Vers des défenses neuronales efficaces et robustes contre les chevaux de Troie via le filtrage des entrées. [pdf] [code]
Pouvons-nous atténuer les attaques par porte dérobée à l'aide de méthodes de détection adversariales ?
Vers une certification de robustesse contre les perturbations universelles. [pdf] [code]
BagFlip : Une défense certifiée contre l'empoisonnement de données. [pdf] [code]
RAB : Robustesse prouvable contre les attaques par porte dérobée. [pdf] [code]
Robustesse certifiée des plus proches voisins contre l'empoisonnement de données et les attaques par porte dérobée. [pdf]
Agrégation par partition profonde : Défense prouvable contre les attaques par empoisonnement générales [pdf] [code]
Robustesse certifiée intrinsèque du bagging contre les attaques par empoisonnement de données [pdf] [code]
Robustesse certifiée contre les attaques par inversion d'étiquettes via un lissage aléatoire. [pdf]
Sur la certification de robustesse contre les attaques par porte dérobée via un lissage aléatoire.
FLIP : Un cadre de défense prouvable pour l'atténuation des portes dérobées dans l'apprentissage fédéré. [pdf] [code]
Sur la vulnérabilité des défenses contre les portes dérobées pour l'apprentissage fédéré. [link] [code]
Empoisonnement avec Cerberus : Attaque par porte dérobée furtive et collusoire contre l'apprentissage fédéré. [link]
Neurotoxine : Portes dérobées durables dans l'apprentissage fédéré. [pdf]
FLAME : Apprivoiser les portes dérobées dans l'apprentissage fédéré. [pdf]
DeepSight : Atténuation des attaques par porte dérobée dans l'apprentissage fédéré par inspection approfondie du modèle. [pdf]
Défendre contre l'inférence d'étiquettes et les attaques par porte dérobée dans l'apprentissage fédéré vertical. [pdf]
Apprentissage incrémental, menaces de porte dérobée incrémentales. [link]
Injection robuste de porte dérobée avec capacité de résistance au transfert de réseau. [link]
Attaques de porte dérobée anti-distillation : les portes dérobées peuvent réellement survivre à la distillation des connaissances. [pdf]
Attaques de porte dérobée à déclencheur caché. [pdf] [code]
Attaques par empoisonnement des poids sur les modèles pré-entraînés. [pdf] [code]
Attaques de porte dérobée contre l'apprentissage par transfert avec des modèles d'apprentissage profond pré-entraînés. [pdf]
Attaques de porte dérobée latentes sur les réseaux de neurones profonds. [pdf]
Portes dérobées architecturales dans les réseaux de neurones. [pdf]
Défense prouvable contre les politiques de porte dérobée dans l'apprentissage par renforcement. [pdf] [code]
MARNet : attaques de porte dérobée contre l'apprentissage par renforcement multi-agents coopératif. [link]
BACKDOORL : attaque de porte dérobée contre l'apprentissage par renforcement compétitif. [pdf]
Stop-and-Go : exploration des attaques de porte dérobée sur les systèmes de contrôle de la congestion du trafic basés sur l'apprentissage par renforcement profond. [pdf]
Agent Manipulator : attaques furtives par stratégie sur l'apprentissage par renforcement profond. [link]
TrojDRL : évaluation des attaques de porte dérobée sur l'apprentissage par renforcement profond. [pdf] [code]
Empoisonnement des agents d'apprentissage par renforcement profond avec des déclencheurs dans la distribution. [pdf]
Attaque de porte dérobée à motif temporel contre l'apprentissage par renforcement profond.
Attaques de porte dérobée sur l'apprentissage auto-supervisé. [pdf] [code]
Empoisonnement et introduction de portes dérobées dans l'apprentissage contrastif. [pdf]
BadEncoder : attaques de porte dérobée sur les encodeurs pré-entraînés dans l'apprentissage auto-supervisé. [pdf] [code]
DeHiB : attaque de porte dérobée cachée profonde sur l'apprentissage semi-supervisé par perturbation adversariale. [pdf]
Porte dérobée neuronale profonde dans l'apprentissage semi-supervisé : menaces et contre-mesures. [link]
Attaques de porte dérobée dans la chaîne d'approvisionnement de la modélisation d'images masquées. [pdf]
Tatouage des encodeurs pré-entraînés dans l'apprentissage contrastif. [pdf]
RIBAC : vers une attaque de porte dérobée robuste et imperceptible contre les DNN compacts. [pdf] [code]
Qu-ANTI-zation : exploitation des artefacts de quantification pour obtenir des résultats adversariaux. [pdf] [code]
Comprendre les menaces des réseaux de neurones quantifiés piégés dans les chaînes d'approvisionnement de modèles. [pdf]
Portes dérobées par quantification pour les modèles d'apprentissage profond. [pdf]
Portes dérobées furtives comme artefacts de compression. [pdf]
TrojText : insertion invisible de cheval de Troie textuel au moment du test. [pdf] [code]
Défense contre les attaques de porte dérobée dans la génération de langage naturel. [link]
Suppression des portes dérobées dans les modèles pré-entraînés par pré-entraînement continu régularisé. [pdf] [code]
BadPrompt : attaques de porte dérobée sur les invites continues. [pdf] [code]
L'ajustement modéré comme défenseur naturel contre les portes dérobées pour les modèles de langage pré-entraînés [pdf] [code]
Une évaluation unifiée de l'apprentissage de portes dérobées textuelles : cadres et références. [pdf] [code]
Modèles de langage manipulateurs : risques de la propagande en tant que service et contre-mesures [pdf]
Attaque backdoor transférable sur les graphes. [pdf]
Plus c'est mieux (en général) : sur les attaques backdoor dans les réseaux de neurones graphiques fédérés. [pdf]
Backdoor sur graphes. [pdf] [code]
Attaques backdoor contre les réseaux de neurones graphiques. [pdf]
Défense contre les attaques backdoor sur les réseaux de neurones graphiques par l'explicabilité. [pdf]
Link-Backdoor : attaque backdoor sur la prédiction de liens via l'injection de nœuds. [pdf] [code]
Attaques backdoor de voisinage sur les réseaux de neurones à convolution de graphes. [pdf]
Dyn-Backdoor : attaque backdoor sur la prédiction dynamique de liens. [pdf]
Attaques backdoor basées sur l'explicabilité contre les réseaux de neurones graphiques. [pdf]
Une attaque backdoor contre les classifieurs de nuages de points 3D. [pdf] [code]
PointBA : vers des attaques backdoor dans les nuages de points 3D. [pdf]
Attaque backdoor imperceptible et robuste dans les nuages de points 3D. [pdf]
Détection des attaques backdoor contre les classifieurs de nuages de points. [pdf]
Empoisonnement de MorphNet pour une attaque backdoor à étiquettes propres contre les nuages de points. [pdf]
Vers des attaques backdoor furtives contre la reconnaissance vocale via des éléments sonores. [pdf] [code]
Casser la reconnaissance du locuteur avec Paddingback. [link]
Attaque backdoor inaudible via l'injection furtive de déclencheurs de fréquence dans le spectrogramme audio. [link]
SilentTrig : une attaque backdoor imperceptible contre l'identification du locuteur avec des déclencheurs cachés. [link]
Le diable dans la pièce : déclencher des backdoors audio dans le monde physique. [pdf]
Le manipulateur silencieux : une attaque backdoor pratique et inaudible contre les systèmes de reconnaissance vocale. [link]
Avec style : backdoors audio par transformations stylistiques. [pdf]
VenoMave : empoisonnement ciblé contre la reconnaissance vocale. [pdf]
FIBA : attaque backdoor basée sur l'injection de fréquence dans l'analyse d'images médicales. [pdf]
Exploiter les modèles de valeurs manquantes pour une attaque backdoor sur les modèles d'apprentissage automatique des dossiers de santé électroniques : étude de développement et de validation. [link]
L'apprentissage automatique avec les dossiers de santé électroniques est vulnérable aux attaques par déclencheurs backdoor. [pdf]
L'explicabilité compte : attaques backdoor sur l'imagerie médicale. [pdf]
TRAPDOOR : réutilisation des backdoors pour détecter les biais de jeu de données dans l'analyse génomique basée sur l'apprentissage automatique. [pdf]
Vous captez mon attention : les transformers de vision sont-ils de mauvais apprenants face aux attaques backdoor ? [pdf]
TrojViT : insertion de chevaux de Troie dans les transformers de vision. [pdf]
Défense contre les attaques backdoor sur les transformers de vision via le traitement des patches. [link]
Attaques backdoor sur les transformers de vision. [pdf] [code]
TrojViT : insertion de chevaux de Troie dans les transformers de vision. [pdf]
Détournement de l'attention dans les transformers à chevaux de Troie. [pdf]
DBIA : attaque par injection backdoor sans données contre les réseaux de transformers. [pdf] [code]
Comment implanter une backdoor dans les modèles de diffusion ? [pdf] [code]
TrojDiff : attaques trojan sur les modèles de diffusion avec des cibles diverses. [pdf] [code]
VulnerGAN : une attaque backdoor par amplification des vulnérabilités contre les systèmes de détection d'intrusions réseau basés sur l'apprentissage automatique. [link] [code]
Attaques par empoisonnement backdoor guidées par l'explication contre les classifieurs de malwares. [pdf]
Attaque backdoor sur les détecteurs de malwares Android basés sur l'apprentissage automatique. [link]
Puzzle : attaque backdoor sélective pour subvertir les classifieurs de malwares. [pdf]
Backdoor à image propre : attaquer les modèles multi-étiquettes avec uniquement des étiquettes empoisonnées. [pdf] [code]
Attaque backdoor non ciblée contre la détection d'objets. [pdf] [code]
Attaques backdoor few-shot sur le suivi visuel d'objets. [pdf] [code]
BadDet : attaques backdoor sur la détection d'objets. [pdf]
Attaquer en alignant : attaques backdoor à étiquettes propres sur la détection d'objets. [pdf]
Attaques backdoor invisibles basées sur des masques contre la détection d'objets. [pdf]
TAT : attaques backdoor ciblées contre le suivi visuel d'objets. [link] [code]
Le côté obscur d'AutoML : vers la recherche de backdoors architecturales. [pdf] [code]
Attaques backdoor contre la compression d'images profonde via un déclencheur de fréquence adaptatif. [pdf] Yi Yu, Yufei Wang, Wenhan Yang, Shijian Lu, Yap-Peng Tan, et Alex C. Kot. CVPR, 2023.
Le côté obscur des réseaux de neurones à routage dynamique : vers l'injection de backdoors d'efficacité. [pdf]
Attaques backdoor sur le comptage de foules. [pdf]
Attaques backdoor sur le système d'interprétation DNN. [pdf]
Le diable est dans le GAN : défendre les modèles génératifs profonds contre les attaques backdoor. [pdf] [code] [demo]
Attaque backdoor centrée sur les objets contre le sous-titrage d'images. [link]
Quand une attaque backdoor réussit-elle dans la reconstruction d'images ? Une étude des heuristiques par rapport à la solution à deux niveaux.
A Survey of Neural Trojan Attacks and Defenses in Deep Learning. [pdf]
Threats to Pre-trained Language Models: Survey and Taxonomy. [pdf]
An Overview of Backdoor Attacks Against Deep Neural Networks and Possible Defences. [pdf]
Deep Learning Backdoors. [pdf]
Backdoor Attacks in Neural Networks. [lien]
Backdoor Defenses. [pdf]
Geometric Properties of Backdoored Neural Networks. [pdf]
Detecting Backdoored Neural Networks with Structured Adversarial Attacks. [pdf]
Backdoor Attacks Against Deep Learning Systems in the Physical World. [pdf]
Stealthy Backdoor Attack with Adversarial Training. [lien]
Invisible and Efficient Backdoor Attacks for Compressed Deep Neural Networks. [lien]
Dynamic Backdoors with Global Average Pooling. [pdf]
Poison Ink: Robust and Invisible Backdoor Attack. [pdf]
Enhancing Backdoor Attacks with Multi-Level MMD Regularization. [lien]
PTB: Robust Physical Backdoor Attacks against Deep Neural Networks in Real World. [lien]
IBAttack: Being Cautious about Data Labels. [lien]
BlindNet Backdoor: Attack on Deep Neural Network using Blind Watermark. [lien]
Natural Backdoor Attacks on Deep Neural Networks via Raindrops. [lien]
Dispersed Pixel Perturbation-based Imperceptible Backdoor Trigger for Image Classifier Models. [pdf]
FRIB: Low-poisoning Rate Invisible Backdoor Attack based on Feature Repair. [pdf]
Augmentation Backdoors. [pdf] [code]
Just Rotate it: Deploying Backdoor Attacks via Rotation Transformation. [pdf]
Natural Backdoor Datasets. [pdf]
Enhancing Clean Label Backdoor Attack with Two-phase Specific Triggers. [pdf]
Circumventing Backdoor Defenses That Are Based on Latent Separability. [pdf] [code]
Narcissus: A Practical Clean-Label Backdoor Attack with Limited Information. [pdf]
CASSOCK: Viable Backdoor Attacks against DNN in The Wall of Source-Specific Backdoor Defences. [pdf]
Trojan Horse Training for Breaking Defenses against Backdoor Attacks in Deep Learning. [pdf]
Label-Smoothed Backdoor Attack. [pdf]
Imperceptible and Multi-channel Backdoor Attack against Deep Neural Networks. [pdf]
Compression-Resistant Backdoor Attack against Deep Neural Networks. [pdf]
AdvDoor: Adversarial Backdoor Attack of Deep Learning System. [pdf] [code]
Invisible Poison: A Blackbox Clean Label Backdoor Attack to Deep Neural Networks. [pdf]
Backdoor Attack in the Physical World. [pdf] [extension]
Defense-Resistant Backdoor Attacks against Deep Neural Networks in Outsourced Cloud Environment. [Lien]
Backdoors cachées dans les traits du visage : une nouvelle attaque backdoor invisible contre les systèmes de reconnaissance faciale. [lien]
Utiliser un bruit procédural pour réaliser une attaque backdoor. [lien] [code]
Une attaque backdoor multi-cibles sur les réseaux de neurones profonds avec déclencheur à emplacement aléatoire. [lien]
Simtrojan : attaque backdoor furtive. [lien]
Une méthode de réduction de la différence statistique pour échapper à la détection de backdoor. [pdf]
Attaque backdoor via le domaine fréquentiel. [pdf]
Vérifiez votre autre porte ! Établir des attaques backdoor dans le domaine fréquentiel. [pdf]
Agent dormant : backdoors à déclencheur caché et évolutives pour des réseaux de neurones entraînés de zéro. [pdf] [code]
RABA : une attaque backdoor robuste par avatar sur les réseaux de neurones profonds. [pdf]
Attaques backdoor robustes contre les réseaux de neurones profonds dans le monde physique réel. [pdf]
Injection de backdoor et empoisonnement de réseaux de neurones par des attaques de mise à l'échelle d'images. [pdf]
One-to-N et N-to-One : deux attaques backdoor avancées contre les modèles d'apprentissage profond. [pdf]
Attaques backdoor invisibles sur les réseaux de neurones profonds via la stéganographie et la régularisation. [pdf] [Version arXiv (2019)]
HaS-Nets : un mécanisme de guérison et de sélection pour défendre les DNN contre les attaques backdoor dans les scénarios de collecte de données. [pdf]
FaceHack : déclencher des systèmes de reconnaissance faciale infectés de backdoor à l'aide de caractéristiques faciales. [pdf]
La lumière peut pirater votre visage ! Attaque backdoor en boîte noire sur les systèmes de reconnaissance faciale. [pdf]
TrojanNet : intégration de modèles de cheval de Troie cachés dans les réseaux de neurones. [pdf]
Injection de backdoor dans les réseaux de neurones convolutifs via des perturbations ciblées des poids. [pdf]
BadRes : révéler les backdoors à travers la connexion résiduelle. [pdf]
Backdoors architecturales dans les réseaux de neurones. [pdf]
Installer des backdoors indétectables dans les modèles d'apprentissage automatique. [pdf]
Défense guidée par l'interprétabilité contre les attaques backdoor sur les réseaux de neurones profonds. [lien]
Boundary augment : une méthode d'augmentation de données pour se défendre contre les attaques par empoisonnement. [lien]
Relier la connectivité des modes dans les paysages de perte et la robustesse adverse. [pdf] [code]
Fine-Pruning : défendre contre les attaques d'injection de backdoor sur les réseaux de neurones profonds. [pdf] [code]
Trojans neuronaux. [pdf]
Adaptation au moment du test des blocs résiduels contre les attaques par empoisonnement et par backdoor. [pdf]
Désactiver la backdoor et identifier les données empoisonnées en utilisant la distillation de connaissances dans les attaques backdoor sur les réseaux de neurones profonds. [pdf]
Défendre contre les attaques backdoor sur les réseaux de neurones profonds. [pdf]
Défense contre les attaques backdoor en identifiant et en purifiant les neurones défectueux. [pdf]
Transformer une malédiction en bénédiction : permettre des défenses sans données propres par inversion de modèle. [pdf]
Affinage adverse pour la défense contre les backdoors : connecter les exemples adverses aux échantillons déclenchés. [pdf]
Blanchiment de réseaux de neurones : supprimer les filigranes backdoor en boîte noire des réseaux de neurones profonds. [pdf]
HaS-Nets : un mécanisme de guérison et de sélection pour défendre les DNN contre les attaques backdoor dans les scénarios de collecte de données. [pdf]
AEVA : détection de portes dérobées en boîte noire à l'aide de l'analyse des valeurs extrêmes adversariales. [pdf] [code]
Chasse aux déclencheurs avec un a priori topologique pour la détection de Trojan. [pdf] [code]
Défense contre les portes dérobées par désapprentissage automatique. [pdf]
Détection en boîte noire des attaques par porte dérobée avec des informations et des données limitées. [pdf]
Analyse des portes dérobées pour les réseaux de neurones profonds via l'optimisation à K bras. [pdf] [code]
Vers l'inspection et l'élimination des portes dérobées Trojan dans les réseaux de neurones profonds. [pdf] [version précédente] [code]
GangSweep : balayer les portes dérobées neuronales par GAN. [pdf]
Détection de portes dérobées dans des classifieurs entraînés sans accès à l'ensemble d'apprentissage. [pdf]
Neural Cleanse : identification et atténuation des attaques par porte dérobée dans les réseaux de neurones. [pdf] [code]
Défense contre les portes dérobées neuronales via la modélisation générative de distributions. [pdf] [code]
DeepInspect : un cadre de détection et d'atténuation de Trojan en boîte noire pour les réseaux de neurones profonds. [pdf]
Identification de déclencheurs physiquement réalisables pour les réseaux de reconnaissance faciale compromis par des portes dérobées. [lien]
Révéler les portes dérobées perceptibles dans les DNN sans l'ensemble d'apprentissage via la statistique de fraction maximale atteignable de mauvaise classification. [pdf]
Génération adaptative de perturbations pour la détection de multiples portes dérobées. [pdf]
La confiance compte : inspection des portes dérobées dans les réseaux de neurones profonds via le transfert de distribution. [pdf]
Défense contre les attaques Trojan multi-cibles. [pdf]
Apprentissage contrastif de modèles pour la défense contre les portes dérobées. [pdf]
CatchBackdoor : test de portes dérobées par identification de chemins neuronaux Trojan critiques via le fuzzing différentiel. [pdf]
Détecter et supprimer le filigrane dans les réseaux de neurones profonds via les réseaux adversariaux génératifs. [pdf]
TAD : détection de Trojan en boîte noire basée sur l'approximation de déclencheur pour l'IA. [pdf]
Détection de portes dérobées à grande échelle dans les réseaux de neurones. [pdf]
NNoculation : traitement à large spectre et ciblé des DNN compromis par des portes dérobées. [pdf] [code]
Détection en boîte noire des attaques par porte dérobée avec des informations et des données limitées. [pdf]
Motifs de test universels : révéler les attaques par porte dérobée dans les CNN. [pdf] [code]
Signature à un pixel : caractérisation des modèles CNN pour la détection de portes dérobées. [pdf]
Détection pratique de réseaux de neurones Trojan : cas avec données limitées et sans données. [pdf] [code]
Détection des attaques par porte dérobée via la différence de classes dans les réseaux de neurones profonds. [pdf]
Approche de détection de Trojan dans les réseaux de neurones basée sur l'élagage de référence. [pdf]
Détection universelle de portes dérobées post-entraînement. [pdf]
Signatures Trojan dans les poids des DNN. [pdf]
EX-RAY : distinguer les portes dérobées injectées des caractéristiques naturelles dans les réseaux de neurones en examinant la symétrie différentielle des caractéristiques. [pdf]
TOP : détection de portes dérobées dans les réseaux de neurones via la transférabilité de la perturbation. [pdf]
Détection de DNN compromis par Trojan à l'aide d'attributions contrefactuelles. [pdf]
Cassandra : détection de réseaux compromis par Trojan à partir de perturbations adversariales. [pdf]
Odyssey : création, analyse et détection de modèles Trojan. [pdf] [jeu de données]
Analyse de la réponse au bruit pour la détection rapide de portes dérobées dans les réseaux de neurones profonds. [pdf]
NeuronInspect : détection de portes dérobées dans les réseaux de neurones via des explications de sortie. [pdf]
Ce qui ne vous tue pas vous rend plus robuste : l'entraînement adversarial contre les poisons et les portes dérobées. [pdf]
Suppression des filigranes basés sur des portes dérobées dans les réseaux de neurones avec des données limitées. [pdf]
Masquer et restaurer : défense aveugle contre les portes dérobées au moment du test avec un autoencodeur masqué. [pdf] [code]
Sur l'efficacité de l'entraînement adversarial contre les attaques par porte dérobée. [pdf]
Ressusciter la confiance dans la reconnaissance faciale : atténuer les attaques par porte dérobée dans la reconnaissance faciale pour prévenir d'éventuelles violations de la vie privée. [pdf]
SanitAIs : augmentation de données non supervisée pour assainir les réseaux de neurones compromis par Trojan. [pdf]
Sur l'efficacité de l'atténuation des attaques par empoisonnement de données avec le façonnage de gradient. [pdf] [code]
DP-InstaHide : désamorçage prouvable des attaques par empoisonnement et par porte dérobée avec des augmentations de données différenciellement privées. [pdf]
LinkBreaker : briser le lien porte dérobée-déclencheur dans les DNN via un contrôle de cohérence des neurones. [lien]
Protection de l'intégrité basée sur la similarité pour les systèmes d'apprentissage profond. [lien]
Un détecteur en ligne basé sur les caractéristiques pour supprimer les portes dérobées adversariales par démarcation itérative. [pdf]
Repenser les déclencheurs des attaques par porte dérobée : une perspective fréquentielle. [pdf] [code]
Démon dans la variante : analyse statistique des DNN pour une détection robuste de contamination par porte dérobée. [pdf] [code]
CLEANN : Bouclier Trojan accéléré pour les réseaux de neurones embarqués. [pdf]
Détection robuste d'anomalies et détection d'attaques par porte dérobée via la confidentialité différentielle. [pdf] [code]
Défense simple, agnostique aux attaques, contre les attaques ciblées sur l'ensemble d'entraînement à l'aide de la similarité cosinus. [pdf] [code]
SentiNet : Détection d'attaques universelles localisées contre les systèmes d'apprentissage profond. [pdf]
STRIP : Une défense contre les attaques Trojan sur les réseaux de neurones profonds. [pdf] [extension] [code]
Détection d'attaques par porte dérobée sur les réseaux de neurones profonds par clustering d'activations. [pdf] [code]
Modèles probabilistes profonds pour détecter les attaques par empoisonnement de données. [pdf]
Signatures spectrales dans les attaques par porte dérobée. [pdf] [code]
Une défense adaptative en boîte noire contre les attaques Trojan (TrojDef). [pdf]
Combattre le poison par le poison : Détection d'échantillons empoisonnés par porte dérobée via le découplage des corrélations bénignes. [pdf] [code]
PiDAn : Une approche d'optimisation de cohérence pour la détection et l'atténuation des attaques par porte dérobée dans les réseaux de neurones profonds. [pdf]
Analyse et atténuation des chevaux de Troie dans les réseaux de neurones à partir du domaine d'entrée. [pdf]
Un cadre général pour se défendre contre les attaques par porte dérobée via le graphe d'influence. [pdf]
NTD : Détection de porte dérobée activée par la non-transférabilité. [pdf]
Un cadre unifié pour la gestion de la qualité des données pilotée par les tâches. [pdf]
TESDA : Détection statistique d'attaques dans les réseaux de neurones profonds activée par transformée. [pdf]
Traçage des attaques par empoisonnement de données dans les réseaux de neurones. [pdf]
Garanties prouvables contre l'empoisonnement de données à l'aide de l'auto-expansion et de la compatibilité. [pdf]
Défense en ligne des modèles trojanisés à l'aide de fausses attributions. [pdf]
Détection de portes dérobées dans les réseaux de neurones profonds via des perturbations adversariales intentionnelles. [pdf]
Exposer les portes dérobées dans les modèles d'apprentissage automatique robustes. [pdf]
HaS-Nets : Un mécanisme de guérison et de sélection pour défendre les DNN contre les attaques par porte dérobée pour les scénarios de collecte de données. [pdf]
Le poison comme remède : Détection et neutralisation d'attaques par porte dérobée de taille variable dans les réseaux de neurones profonds. [pdf]
BagFlip : Une défense certifiée contre l'empoisonnement de données. [pdf]
Une analyse des mécanismes d'agrégation tolérants aux pannes byzantines sur l'empoisonnement de modèles dans l'apprentissage fédéré. [link]
Contre les attaques par porte dérobée dans l'apprentissage fédéré avec la confidentialité différentielle. [link]
Agrégation partielle sécurisée : Rendre l'apprentissage fédéré plus robuste pour les applications de l'industrie 4.0. [link]
Agrégation résiliente aux attaques par porte dérobée basée sur un filtrage robuste des valeurs aberrantes dans l'apprentissage fédéré pour la classification d'images. [link]
Défense contre les attaques par porte dérobée dans l'apprentissage fédéré. [link] [code]
Apprentissage fédéré à confidentialité renforcée contre les adversaires par empoisonnement. [link]
Attaques par porte dérobée coordonnées contre l'apprentissage fédéré avec déclencheurs dépendants du modèle. [link]
CRFL : Apprentissage fédéré robuste de manière certifiable contre les attaques par porte dérobée. [pdf]
Malédiction ou rédemption ? Comment l'hétérogénéité des données affecte la robustesse de l'apprentissage fédéré. [pdf]
Défense contre les portes dérobées dans l'apprentissage fédéré avec un taux d'apprentissage robuste. [pdf]
BaFFLe : Détection de portes dérobées via l'apprentissage fédéré basé sur le retour d'information. [pdf]
PipAttack : Empoisonnement des systèmes de recommandation fédérés pour manipuler la promotion d'articles. [pdf]
Atténuation de l'attaque par porte dérobée par des filtres fédérés pour les applications industrielles de l'IdO. [link]
Analyse et défense basées sur la stabilité contre les attaques par porte dérobée sur les services d'informatique de périphérie. [link]
L'attaque des queues : Oui, vous pouvez vraiment introduire une porte dérobée dans l'apprentissage fédéré. [pdf]
DBA : Attaques par porte dérobée distribuées contre l'apprentissage fédéré. [pdf]
Les limites de l'apprentissage fédéré dans les contextes Sybil. [pdf] [extension] [code]
Comment introduire une porte dérobée dans l'apprentissage fédéré. [pdf]
BEAS : Apprentissage automatique fédéré asynchrone et sécurisé activé par la blockchain. [pdf]
Attaques par porte dérobée et défenses dans l'apprentissage collaboratif partitionné par caractéristiques. [pdf]
Pouvez-vous vraiment introduire une porte dérobée dans l'apprentissage fédéré ? [pdf]
Agrégateur invariant pour défendre contre les attaques par porte dérobée fédérées. [pdf]
Protéger l'apprentissage fédéré : Atténuer les attaques byzantines avec moins de contraintes. [pdf]
Apprentissage fédéré zero-shot pour la reconnaissance visuelle. [pdf]
Assister l'apprentissage fédéré avec porte dérobée par l'alignement des connaissances de l'ensemble de la population. [pdf]
FL-Defender : Combattre les attaques ciblées dans l'apprentissage fédéré. [pdf]
L'attaque par porte dérobée est un diable dans la synthèse d'images médicales fédérée basée sur les GAN. [pdf]
SafeNet : Atténuation des attaques par empoisonnement de données sur l'apprentissage automatique privé. [pdf] [code]
PerDoor : Portes dérobées non uniformes persistantes dans l'apprentissage fédéré à l'aide de perturbations adversariales. [pdf] [code]
Vers une défense contre les attaques par porte dérobée dans l'apprentissage fédéré continu. [pdf]
Porte dérobée ciblée par client dans l'apprentissage fédéré. [pdf]
Défense contre les portes dérobées dans l'apprentissage fédéré à l'aide de tests différentiels et de détection des valeurs aberrantes. [pdf]
ARIBA : Vers une identification précise et robuste des attaques par porte dérobée dans l'apprentissage fédéré. [pdf]
Plus c'est mieux (la plupart du temps) : Sur les attaques par porte dérobée dans les réseaux de neurones graphiques fédérés. [pdf]
Compression de sous-espace à faible perte pour des gains propres contre les attaques par porte dérobée multi-agents. [pdf]
Des portes dérobées coincées à la porte d'entrée : Des attaques par porte dérobée multi-agents qui se retournent contre l'attaquant. [pdf]
Désapprentissage fédéré avec distillation des connaissances. [pdf]
Attaques par transfert de modèle vers l'hyperréseau à porte dérobée dans l'apprentissage fédéré personnalisé. [pdf]
Attaques par porte dérobée sur l'apprentissage fédéré avec l'hypothèse du billet de loterie. [pdf]
Sur la défense prouvable contre les portes dérobées dans l'apprentissage collaboratif. [pdf]
SparseFed : Atténuation des attaques par empoisonnement de modèles dans l'apprentissage fédéré avec éparsification. [pdf]
Apprentissage fédéré robuste avec agrégation adaptative aux attaques. [pdf] [code]
Méta-apprentissage fédéré. [pdf]
FLGUARD : Apprentissage fédéré sécurisé et privé. [pdf]
Attaques de porte dérobée sur le méta-apprentissage fédéré. [pdf]
Attaques de porte dérobée dynamiques contre l'apprentissage fédéré. [pdf]
Apprentissage fédéré dans des contextes adversariaux. [pdf]
BlockFLA : apprentissage fédéré responsable via une architecture de blockchain hybride. [pdf]
Atténuation des attaques de porte dérobée dans l'apprentissage fédéré. [pdf]
Apprendre à détecter les clients malveillants pour un apprentissage fédéré robuste. [pdf]
Apprentissage fédéré résistant aux attaques avec repondération basée sur les résidus. [pdf] [code]
Alarme rouge pour les modèles pré-entraînés : vulnérabilités universelles par attaques de porte dérobée au niveau des neurones. [pdf] [code]
Détection de portes dérobées dans l'apprentissage par renforcement. [pdf]
Conception de portes dérobées intentionnelles dans les modèles séquentiels. [pdf]
PICCOLO : exposition des portes dérobées complexes dans les modèles Transformer de TAL. [pdf] [code]
Attaque de porte dérobée sans déclencheur pour les tâches de TAL avec des étiquettes propres. [pdf]
Étude de l'anomalie d'attention dans les BERT piégés. [pdf] [code]
Les déclencheurs qui ouvrent les portes dérobées des modèles de TAL sont cachés dans les échantillons adversariaux. [link]
BDDR : une défense efficace contre les attaques de porte dérobée textuelles. [pdf]
BadPre : attaques de porte dérobée indépendantes de la tâche sur les modèles de fondation de TAL pré-entraînés. [pdf]
Exploration de la vulnérabilité universelle du paradigme d'apprentissage basé sur les invites. [pdf] [code]
Les modèles pré-entraînés à porte dérobée peuvent se transférer à tous. [pdf]
BadNL : attaques de porte dérobée contre les modèles de TAL avec des améliorations préservant la sémantique. [pdf] [arXiv-20]
Attaques de porte dérobée sur les modèles pré-entraînés par empoisonnement des poids par couches. [pdf]
T-Miner : une approche générative pour se défendre contre les attaques de cheval de Troie sur la classification de textes basée sur les DNN. [pdf]
RAP : perturbations conscientes de la robustesse pour se défendre contre les attaques de porte dérobée sur les modèles de TAL. [pdf] [code]
ONION : une défense simple et efficace contre les attaques de porte dérobée textuelles. [pdf]
Attention au style du texte ! Attaques adversariales et portes dérobées basées sur le transfert de style de texte. [pdf] [code]
Repenser la furtivité des attaques de porte dérobée contre les modèles de TAL. [pdf] [code]
Tourner le cadenas à combinaison : attaques de porte dérobée textuelles apprenables par substitution de mots. [pdf]
Tueur caché : attaques de porte dérobée textuelles invisibles avec déclencheur syntaxique. [pdf] [code]
Atténuation de l'empoisonnement des données dans la classification de textes avec confidentialité différentielle. [pdf]
BFClass : un cadre de classification de textes sans porte dérobée. [pdf] [code]
Attention aux plongements de mots empoisonnés : exploration de la vulnérabilité des couches de plongement dans les modèles de TAL. [pdf] [code]
Chirurgie de réseaux de neurones : injection de motifs de données dans les modèles pré-entraînés avec des effets secondaires minimaux par instance. [pdf]
Détection de portes dérobées textuelles à l'aide d'un modèle abstrait RNN interprétable. [link]
Attaque de porte dérobée textuelle pour le système de classification de textes. [pdf]
Attaques par empoisonnement des poids sur les modèles pré-entraînés. [pdf] [code]
Attaques par empoisonnement contre les ensembles de données textuelles avec un auto-encodeur conditionnel à régularisation adversariale. [pdf]
Attaque de porte dérobée contre les systèmes de classification de textes basés sur LSTM. [pdf]
PerD : cadre de détection de cheval de Troie neuronal basé sur la sensibilité aux perturbations pour les applications de TAL. [pdf]
Kallima : un cadre à étiquettes propres pour les attaques de porte dérobée textuelles. [pdf]
Attaques de porte dérobée textuelles avec injection itérative de déclencheurs. [pdf] [code]
WeDef : défense faiblement supervisée contre les portes dérobées pour la classification de textes. [pdf]
Optimisation sous contraintes avec mise à l'échelle dynamique des bornes pour une défense efficace contre les portes dérobées en TAL. [pdf]
Repenser les attaques de porte dérobée furtives dans le traitement du langage naturel. [pdf]
Les attaques de porte dérobée textuelles peuvent être plus nuisibles grâce à deux astuces simples. [pdf]
Manipulation des modèles séquence-à-séquence avec des méta-portes dérobées. [pdf]
Défense contre les attaques de porte dérobée dans la génération de langage naturel. [pdf] [code]
Portes dérobées cachées dans les modèles de langage centrés sur l'humain. [pdf]
Détection de l'attaque adversariale à déclencheur universel avec un pot de miel. [pdf]
Injecter des chevaux de Troie dans les modèles de langage pour le plaisir et le profit. [pdf]
Attaque backdoor furtive contre la reconnaissance du locuteur utilisant un déclencheur caché par injection de phase. [link]
Falsifier le réel : attaque backdoor sur la classification profonde de la parole via la conversion vocale. [pdf]
Attaques backdoor opportunistes : exploration des vulnérabilités imperceptibles pour l'humain dans les systèmes de reconnaissance vocale. [link] [code]
Attaque backdoor indépendante de la position dans le domaine audio via des déclencheurs imperceptibles. [pdf]
L'entendez-vous ? Attaques backdoor via des déclencheurs ultrasoniques. [pdf] [code]
Attaques backdoor naturelles sur les modèles de reconnaissance vocale. [link]
Audio adversarial : une nouvelle méthode de dissimulation d'informations et backdoor pour les modèles de reconnaissance vocale basés sur DNN. [pdf] [code]
DriNet : attaque backdoor dynamique contre les modèles de reconnaissance automatique de la parole. [link]
Attaque backdoor contre la vérification du locuteur [pdf] [code]
Une nouvelle attaque trojan contre le système DNN de reconnaissance automatique de la parole basé sur le co-apprentissage. [link]
Une perspective interprétative : attaque trojan adversaire sur les systèmes d'IA en périphérie activés par la recherche d'architecture neuronale. [link]
Une attaque backdoor sans déclencheur et un mécanisme de défense pour le déchargement intelligent de tâches dans les systèmes multi-UAV. [link]
Réseaux trojanisés invisibles multi-cibles pour la reconnaissance et la détection visuelles. [pdf]
Attaque backdoor cachée contre les modèles de segmentation sémantique. [pdf]
Oubli ciblé adversarial dans les modèles d'apprentissage continu basés sur la régularisation et la génération. [link]
Oubli ciblé et formation de faux souvenirs dans les apprenants continus via des attaques backdoor adverses. [pdf]
Attaques trojan sur la classification des signaux sans fil avec apprentissage automatique adversarial. [pdf]