
Lista curada de artículos, estudios y cajas de herramientas sobre aprendizaje con puertas traseras, que organiza ataques y defensas basados en envenenamiento en el aprendizaje profundo para investigadores y profesionales de la seguridad.
Este repositorio de Github resume una lista de recursos de Backdoor Learning. Para más detalles y los criterios de categorización, consulte nuestro estudio.
Haremos todo lo posible por mantener continuamente este repositorio de Github de forma mensual.
Backdoor learning es un área de investigación emergente que aborda los problemas de seguridad del proceso de entrenamiento de los algoritmos de aprendizaje automático. Es fundamental para adoptar de forma segura recursos o modelos de entrenamiento de terceros en la realidad.
Nota: 'Backdoor' también se conoce comúnmente como 'Neural Trojan' o 'Trojan'.
Si nuestro repositorio o estudio es útil para su investigación, cite nuestro artículo de la siguiente manera:``` @article{li2022backdoor, title={Backdoor learning: A survey}, author={Li, Yiming and Jiang, Yong and Li, Zhifeng and Xia, Shu-Tao}, journal={IEEE Transactions on Neural Networks and Learning Systems}, year={2022} }
## Contribuciones
<p align="center">
<img src="https://assets.kitploit.com/production/public/readmes/placeholders/f0fc86cfe65f76d40e15aaec61704ec8220a56dc89d4be03c46f67cb31b9fa8c.svg" alt="¡Te necesitamos!">
</p>
Por favor, ayuda a contribuir a esta lista contactando [conmigo](http://liyiming.tech) o añadiendo un [pull request](https://github.com/THUYimingLi/awesome-backdoor-learning/pulls)
Formato Markdown:```markdown
- Paper Name.
[[pdf]](link)
[[code]](link)
- Author 1, Author 2, **and** Author 3. *Conference/Journal*, Year.
Nota: En el mismo año, coloque el artículo de conferencia antes del artículo de revista, ya que las revistas suelen enviarse con mucha antelación y, por tanto, tienen cierto desfase. (es decir, Conferencias-->Revistas-->Preprints)
Backdoor Learning: A Survey. [pdf]
Backdoor Attacks and Countermeasures on Deep Learning: A Comprehensive Review. [pdf]
Data Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses. [pdf]
A Comprehensive Survey on Poisoning Attacks and Countermeasures in Machine Learning. [link]
Backdoor Attacks and Defenses in Federated Learning: State-of-the-art, Taxonomy, and Future Directions. [link]
Backdoor Attacks on Image Classification Models in Deep Neural Networks. [link]
Defense against Neural Trojan Attacks: A Survey. [link]
A Survey on Neural Trojans. [pdf]
Backdoor Attacks against Voice Recognition Systems: A Survey.
Poisoning-based Backdoor Attacks in Computer Vision. [pdf]
Defense of Backdoor Attacks against Deep Neural Network Classifiers. [pdf]
Towards Adversarial and Backdoor Robustness of Deep Learning. [link]
Toward Robust and Communication Efficient Distributed Machine Learning. [pdf]
Towards Robust Image Classification with Deep Learning and Real-Time DNN Inference on Mobile. [pdf]
Countermeasures Against Backdoor, Data Poisoning, and Adversarial Attacks. [pdf]
Understanding and Mitigating the Impact of Backdooring Attacks on Deep Neural Networks. [pdf]
Un-fair trojan: Targeted Backdoor Attacks against Model Fairness. [pdf]
Check Your Other Door: Creating Backdoor Attacks in the Frequency Domain. [pdf]
Revisiting the Assumption of Latent Separability for Backdoor Defenses. [pdf] [code]
Few-shot Backdoor Attacks via Neural Tangent Kernels. [pdf] [code]
Color Backdoor: A Robust Poisoning Attack in Color Space. [pdf]
Untargeted Backdoor Watermark: Towards Harmless and Stealthy Dataset Copyright Protection. [pdf] [code]
DEFEAT: Deep Hidden Feature Backdoor Attacks by Imperceptible Perturbation and Latent Representation Constraints. [pdf]
Marksman Backdoor: Backdoor Attacks with Arbitrary Target Class. [pdf]
An Invisible Black-box Backdoor Attack through Frequency Domain. [pdf] [code]
BppAttack: Stealthy and Efficient Trojan Attacks against Deep Neural Networks via Image Quantization and Contrastive Adversarial Learning. [pdf] [code]
Dynamic Backdoor Attacks Against Machine Learning Models. [pdf]
Imperceptible Backdoor Attack: From Input Space to Feature Representation. [pdf] [code]
Invisible Backdoor Attack with Sample-Specific Triggers. [pdf] [code]
Manipulating SGD with Data Ordering Attacks. [pdf]
Backdoor Attack with Imperceptible Input and Latent Modification. [pdf]
LIRA: Learnable, Imperceptible and Robust Backdoor Attacks. [pdf]
Blind Backdoors in Deep Learning Models. [pdf] [code]
Backdoor Attacks Against Deep Learning Systems in the Physical World. [pdf] [Tesis de maestría]
Deep Feature Space Trojan Attack of Neural Networks by Controlled Detoxification. [pdf] [code]
WaNet - Imperceptible Warping-based Backdoor Attack. [pdf] [code]
Ataque de puerta trasera compuesto para redes neuronales profundas mediante la mezcla de características benignas existentes. [pdf]
Ataque de puerta trasera dinámico consciente de la entrada. [pdf] [código]
Evasión de algoritmos de detección de puertas traseras en el aprendizaje profundo. [pdf]
Incrustación de puertas traseras en modelos de redes neuronales convolucionales mediante perturbación invisible. [pdf]
Ataques de puerta trasera de etiqueta limpia en modelos de reconocimiento de video. [pdf] [código]
Evasión de la detección de ataques de puerta trasera en el aprendizaje profundo. [enlace]
Puerta trasera por reflexión: un ataque de puerta trasera natural en redes neuronales profundas. [pdf] [código]
Ataques troyanos en vivo contra redes neuronales profundas. [pdf]
Un nuevo ataque de puerta trasera en CNNS mediante la corrupción del conjunto de entrenamiento sin envenenamiento de etiquetas. [pdf]
Ataques de puerta trasera consistentes con la etiqueta. [pdf] [código]
BadNets: identificación de vulnerabilidades en la cadena de suministro de modelos de aprendizaje automático. [pdf] [revista]
Ataques de puerta trasera dirigidos a sistemas de aprendizaje profundo mediante envenenamiento de datos. [pdf] [código]
Puertas traseras artesanales en redes neuronales profundas. [pdf]
Ataque troyano apenas perceptible contra redes neuronales con volteo de bits. [pdf] [código]
ProFlip: ataque troyano dirigido con volteo progresivo de bits. [pdf]
TBT: ataque dirigido a redes neuronales con troyano de bits. [pdf] [código]
Cómo inyectar puertas traseras con mayor consistencia: anclaje de logits en datos limpios. [pdf]
¿Pueden las perturbaciones adversarias de pesos inyectar puertas traseras neuronales? [pdf]
Ataque versátil a pesos mediante el volteo de un número limitado de bits. [pdf]
Hacia ataques realistas de inyección de puertas traseras en DNNs mediante Rowhammer. [pdf]
LoneNeuron: un troyano neuronal de dominio de características altamente eficaz que utiliza marcas de agua invisibles y polimórficas. [pdf]
Hacia un ataque de puerta trasera práctico en la etapa de despliegue en redes neuronales profundas. [pdf] [código]
Ocultar agujas en un pajar: hacia la construcción de redes neuronales que evaden la verificación. [enlace] [código]
Troyano sigiloso y flexible en un marco de aprendizaje profundo. [enlace]
FooBaR: ataque de puerta trasera de engaño por fallos en el entrenamiento de redes neuronales. [enlace] [código]
DeepPayload: ataque de puerta trasera de caja negra a modelos de aprendizaje profundo mediante inyección de carga neuronal. [pdf]
Un enfoque sorprendentemente simple para ataques troyanos en redes neuronales profundas. [pdf] [código]
ImpNet: puertas traseras imperceptibles e indetectables por caja negra en redes neuronales compiladas. [pdf] [sitio web] [código]
¡No me actives! Un ataque de puerta trasera sin disparador contra redes neuronales profundas. [pdf]
Ataque de puerta trasera en el mundo físico. [pdf] [extensión]
DeepSweep: un marco de evaluación para mitigar ataques de puerta trasera en DNNs mediante aumento de datos. [pdf] [código]
Februus: defensa por purificación de entradas contra ataques troyanos en sistemas de redes neuronales profundas. [pdf] [código]
Troyanos neuronales. [pdf]
Defensa de redes neuronales profundas contra ataques de puerta trasera mediante un autoencoder de desactivación de disparadores. [pdf]
ConFoc: protección enfocada en el contenido contra ataques troyanos en redes neuronales. [pdf]
Defensa agnóstica al modelo contra ataques de puerta trasera en el aprendizaje automático. [pdf]
Limpieza de puertas traseras con datos no etiquetados. [pdf] [código]
Desaprendizaje adversario de puertas traseras mediante hipergradiente implícito. [pdf] [código]
Eliminación de puertas traseras sin datos basada en la lipschitzianidad de canales. [pdf] [código]
Eliminación de disparadores de puertas traseras para redes neuronales profundas mediante destilación de grafos de relaciones de atención. [pdf]
Las distribuciones de preactivación exponen neuronas de puerta trasera. [pdf] [código]
La poda adversarial de neuronas purifica modelos profundos con puertas traseras. [pdf] [código]
Destilación de atención neuronal: borrado de disparadores de puertas traseras en redes neuronales profundas. [pdf] [código]
Destilación de patrones cognitivos de puerta trasera dentro de una imagen. [pdf] [código]
UNICORN: un marco unificado de inversión de disparadores de puertas traseras. [pdf] [código]
Mejor optimización de la inversión de disparadores en el escaneo de puertas traseras. [pdf] [código]
Defensa contra puertas traseras con pocas muestras mediante la estimación de Shapley. [pdf]
Repensando la ingeniería inversa de los disparadores troyanos. [pdf] [código]
Borrado de puertas traseras neuronales con una sola muestra mediante enmascaramiento adversarial de pesos. [pdf] [código]
Detección de puertas traseras complejas mediante la diferenciación simétrica de características. [pdf] [código]
Detección posterior al entrenamiento de ataques de puertas traseras para escenarios de dos clases y de múltiples ataques. [pdf] [código]
Barajado aleatorio de canales: detección de ataques de puertas traseras con sobrecarga mínima sin conjuntos de datos limpios. [pdf] [código]
Un enfoque de detección de anomalías para redes neuronales con puertas traseras: el reconocimiento facial como caso de estudio. [pdf]
Detección de puertas traseras basada en rutas críticas para redes neuronales profundas. [enlace]
Detección de troyanos en IA mediante análisis meta neuronal. [pdf]
Detección topológica de redes neuronales troyanizadas. [pdf]
Defensa contra puertas traseras mediante el desacoplamiento del proceso de entrenamiento. [pdf] [código]
Defensa eficaz contra puertas traseras explotando la sensibilidad de las muestras envenenadas. [pdf] [código]
Trampa y reemplazo: defender los ataques de puertas traseras atrapándolos en una subred fácil de reemplazar. [pdf] [código]
Entrenar con más confianza: mitigación de puertas traseras inyectadas y naturales durante el entrenamiento. [pdf] [código]
Aprendizaje anti-puertas traseras: entrenamiento de modelos limpios con datos envenenados. [pdf] [código]
Detección robusta de anomalías y detección de ataques de puertas traseras mediante privacidad diferencial. [pdf] [código]
El aumento de datos fuerte sanea los ataques de envenenamiento y de puertas traseras sin un compromiso de precisión. [pdf]
SCALE-UP: Detección eficiente de puertas traseras a nivel de entrada en caja negra mediante el análisis de la consistencia de predicciones escaladas. [pdf] [código]
Destilando patrones cognitivos de puertas traseras dentro de una imagen. [pdf] [código]
Agrupamiento por incompatibilidad como defensa contra los ataques de envenenamiento por puertas traseras. [pdf] [código]
Las "Beatrix'' Resurrecciones: Detección robusta de puertas traseras mediante matrices de Gram. [pdf] [código]
Defensa eficaz contra puertas traseras explotando la sensibilidad de las muestras envenenadas. [pdf] [código]
Hacia defensas eficaces y robustas contra troyanos neuronales mediante el filtrado de entradas. [pdf] [código]
¿Podemos mitigar los ataques de puertas traseras utilizando métodos de detección adversarial? [enlace]
Towards Robustness Certification Against Universal Perturbations. [pdf] [código]
BagFlip: A Certified Defense against Data Poisoning. [pdf] [código]
RAB: Provable Robustness Against Backdoor Attacks. [pdf] [código]
Certified Robustness of Nearest Neighbors against Data Poisoning and Backdoor Attacks. [pdf]
Deep Partition Aggregation: Provable Defense against General Poisoning Attacks [pdf] [código]
Intrinsic Certified Robustness of Bagging against Data Poisoning Attacks [pdf] [código]
Certified Robustness to Label-Flipping Attacks via Randomized Smoothing. [pdf]
On Certifying Robustness against Backdoor Attacks via Randomized Smoothing. [pdf]
FLIP: A Provable Defense Framework for Backdoor Mitigation in Federated Learning. [pdf] [código]
On the Vulnerability of Backdoor Defenses for Federated Learning. [enlace] [código]
Poisoning with Cerberus: Stealthy and Colluded Backdoor Attack against Federated Learning. [enlace]
Neurotoxin: Durable Backdoors in Federated Learning. [pdf]
FLAME: Taming Backdoors in Federated Learning. [pdf]
DeepSight: Mitigating Backdoor Attacks in Federated Learning Through Deep Model Inspection. [pdf]
Defending Label Inference and Backdoor Attacks in Vertical Federated Learning. [pdf]
An Analysis of Byzantine-Tolerant Aggregation Mechanisms on Model Poisoning in Federated Learning.
Aprendizaje incremental, amenazas de backdoor incrementales. [link]
Inyección robusta de backdoors con capacidad de resistir la transferencia de red. [link]
Ataques de backdoor antidestilación: los backdoors realmente pueden sobrevivir en la destilación de conocimiento. [pdf]
Ataques de backdoor con disparadores ocultos. [pdf] [code]
Ataques de envenenamiento de pesos en modelos preentrenados. [pdf] [code]
Ataques de backdoor contra el aprendizaje por transferencia con modelos de aprendizaje profundo preentrenados. [pdf]
Ataques de backdoor latentes en redes neuronales profundas. [pdf]
Backdoors arquitectónicos en redes neuronales. [pdf]
Defensa demostrable contra políticas de backdoor en el aprendizaje por refuerzo. [pdf] [code]
MARNet: Ataques de backdoor contra el aprendizaje por refuerzo multiagente cooperativo. [link]
BACKDOORL: Ataque de backdoor contra el aprendizaje por refuerzo competitivo. [pdf]
Stop-and-Go: Explorando ataques de backdoor en sistemas de control de congestión del tráfico basados en aprendizaje por refuerzo profundo. [pdf]
Manipulador de agentes: ataques de estrategia sigilosos sobre el aprendizaje por refuerzo profundo. [link]
TrojDRL: Evaluación de ataques de backdoor en el aprendizaje por refuerzo profundo. [pdf] [code]
Envenenando agentes de aprendizaje por refuerzo profundo con disparadores dentro de la distribución. [pdf]
Un ataque de backdoor de patrón temporal al aprendizaje por refuerzo profundo. [pdf]
Ataques de backdoor en el aprendizaje autosupervisado. [pdf] [code]
Envenenamiento y backdooring del aprendizaje contrastivo. [pdf]
BadEncoder: Ataques de backdoor a codificadores preentrenados en el aprendizaje autosupervisado. [pdf] [code]
DeHiB: Ataque de backdoor oculto profundo en el aprendizaje semi-supervisado mediante perturbación adversarial. [pdf]
Backdoor neuronal profundo en el aprendizaje semi-supervisado: amenazas y contramedidas. [link]
Ataques de backdoor en la cadena de suministro del modelado de imágenes enmascaradas. [pdf]
Marcado de agua de codificadores preentrenados en el aprendizaje contrastivo. [pdf]
RIBAC: Hacia un ataque de backdoor robusto e imperceptible contra DNN compactas. [pdf] [code]
Qu-ANTI-zation: Explotando los artefactos de cuantización para lograr resultados adversariales. [pdf] [code]
Comprendiendo las amenazas de las redes neuronales cuantizadas troyanizadas en las cadenas de suministro de modelos. [pdf]
Backdoors de cuantización en modelos de aprendizaje profundo. [pdf]
Backdoors sigilosos como artefactos de compresión. [pdf]
TrojText: Inserción invisible de troyanos textuales en tiempo de prueba. [pdf] [code]
Defensa contra ataques de backdoor en la generación de lenguaje natural. [link]
Eliminación de backdoors en modelos preentrenados mediante preentrenamiento continuo regularizado. [pdf] [code]
BadPrompt: Ataques de backdoor en prompts continuos. [pdf] [code]
Moderate-fitting como defensor natural contra backdoors para modelos de lenguaje preentrenados [pdf] [code]
Una evaluación unificada del aprendizaje de backdoors textuales: frameworks y benchmarks. [pdf] [code]
Haciendo girar los modelos de lenguaje: riesgos de la propaganda como servicio y contramedidas [pdf] [code]
Ataque de puerta trasera transferible en grafos. [pdf]
Más es mejor (casi siempre): sobre los ataques de puerta trasera en redes neuronales de grafos federadas. [pdf]
Puerta trasera en grafos. [pdf] [code]
Ataques de puerta trasera a redes neuronales de grafos. [pdf]
Defensa contra ataques de puerta trasera en redes neuronales de grafos mediante explicabilidad. [pdf]
Link-Backdoor: ataque de puerta trasera a la predicción de enlaces mediante inyección de nodos. [pdf] [code]
Ataques de puerta trasera de vecindad en redes convolucionales de grafos. [pdf]
Dyn-Backdoor: ataque de puerta trasera a la predicción dinámica de enlaces. [pdf]
Ataques de puerta trasera basados en explicabilidad contra redes neuronales de grafos. [pdf]
Un ataque de puerta trasera contra clasificadores de nubes de puntos 3D. [pdf] [code]
PointBA: hacia ataques de puerta trasera en nubes de puntos 3D. [pdf]
Ataque de puerta trasera imperceptible y robusto en nubes de puntos 3D. [pdf]
Detección de ataques de puerta trasera contra clasificadores de nubes de puntos. [pdf]
Envenenando MorphNet para ataques de puerta trasera de etiqueta limpia a nubes de puntos. [pdf]
Hacia ataques de puerta trasera sigilosos contra el reconocimiento de voz mediante elementos del sonido. [pdf] [code]
Rompiendo el reconocimiento de hablante con Paddingback. [link]
Ataque de puerta trasera inaudible mediante inyección sigilosa de disparadores de frecuencia en espectrogramas de audio. [link]
SilentTrig: un ataque de puerta trasera imperceptible contra la identificación de hablante con disparadores ocultos. [link]
El diablo en la habitación: activando puertas traseras de audio en el mundo físico. [pdf]
El manipulador silencioso: un ataque de puerta trasera práctico e inaudible contra sistemas de reconocimiento de voz. [link]
Con estilo: puertas traseras de audio mediante transformaciones estilísticas. [pdf]
VenoMave: envenenamiento dirigido contra el reconocimiento de voz. [pdf]
FIBA: ataque de puerta trasera basado en inyección de frecuencia en análisis de imágenes médicas. [pdf]
Explotando patrones de valores faltantes para un ataque de puerta trasera en modelos de aprendizaje automático de registros de salud electrónicos: estudio de desarrollo y validación. [link]
El aprendizaje automático con registros electrónicos de salud es vulnerable a ataques de disparadores de puerta trasera. [pdf]
La explicabilidad importa: ataques de puerta trasera en imágenes médicas. [pdf]
TRAPDOOR: reutilizando puertas traseras para detectar sesgos en conjuntos de datos en análisis genómico basado en aprendizaje automático. [pdf]
Estás llamando mi atención: ¿son los transformadores de visión malos aprendices bajo ataques de puerta trasera? [pdf]
TrojViT: inserción de troyanos en transformadores de visión. [pdf]
Defensa contra ataques de puerta trasera en transformadores de visión mediante procesamiento de parches. [link]
Ataques de puerta trasera en transformadores de visión. [pdf] [code]
TrojViT: inserción de troyanos en transformadores de visión. [pdf]
Secuestro de atención en transformadores troyanos. [pdf]
DBIA: ataque de inyección de puerta trasera sin datos contra redes transformadoras. [pdf] [code]
¿Cómo inyectar puertas traseras en modelos de difusión? [pdf] [code]
TrojDiff: ataques troyanos en modelos de difusión con diversos objetivos. [pdf] [code]
VulnerGAN: un ataque de puerta trasera mediante amplificación de vulnerabilidades contra sistemas de detección de intrusiones en redes basados en aprendizaje automático. [link] [code]
Ataques de envenenamiento de puerta trasera guiados por explicaciones contra clasificadores de malware. [pdf]
Ataque de puerta trasera a detectores de malware Android basados en aprendizaje automático. [link]
Rompecabezas: ataque selectivo de puerta trasera para subvertir clasificadores de malware. [pdf]
Puerta trasera de imagen limpia: atacando modelos multietiqueta solo con etiquetas envenenadas. [pdf] [code]
Ataque de puerta trasera no dirigido contra la detección de objetos. [pdf] [code]
Ataques de puerta trasera con pocas muestras en el seguimiento de objetos visuales. [pdf] [code]
BadDet: ataques de puerta trasera en la detección de objetos. [pdf]
Atacar alineando: ataques de puerta trasera de etiqueta limpia en la detección de objetos. [pdf]
Ataques de puerta trasera invisibles basados en máscaras en la detección de objetos. [pdf]
TAT: ataques de puerta trasera dirigidos contra el seguimiento de objetos visuales. [link] [code]
El lado oscuro de AutoML: hacia la búsqueda de puertas traseras arquitectónicas. [pdf] [code]
Ataques de puerta trasera contra la compresión profunda de imágenes mediante disparador de frecuencia adaptativo. [pdf] Yi Yu, Yufei Wang, Wenhan Yang, Shijian Lu, Yap-Peng Tan y Alex C. Kot. CVPR, 2023.
El lado oscuro de las redes neuronales de enrutamiento dinámico: hacia la inyección de puertas traseras de eficiencia. [pdf]
Ataques de puerta trasera en el conteo de multitudes. [pdf]
Ataques de puerta trasera en el sistema de interpretación de DNN. [pdf]
El diablo está en el GAN: defendiendo modelos generativos profundos contra ataques de puerta trasera. [pdf] [code] [demo]
Ataque de puerta trasera orientado a objetos contra la generación de descripciones de imágenes. [link]
A Survey of Neural Trojan Attacks and Defenses in Deep Learning. [pdf]
Threats to Pre-trained Language Models: Survey and Taxonomy. [pdf]
An Overview of Backdoor Attacks Against Deep Neural Networks and Possible Defences. [pdf]
Deep Learning Backdoors. [pdf]
Backdoor Attacks in Neural Networks. [link]
Backdoor Defenses. [pdf]
Geometric Properties of Backdoored Neural Networks. [pdf]
Detecting Backdoored Neural Networks with Structured Adversarial Attacks. [pdf]
Backdoor Attacks Against Deep Learning Systems in the Physical World. [pdf]
Stealthy Backdoor Attack with Adversarial Training. [link]
Invisible and Efficient Backdoor Attacks for Compressed Deep Neural Networks. [link]
Dynamic Backdoors with Global Average Pooling. [pdf]
Poison Ink: Robust and Invisible Backdoor Attack. [pdf]
Enhancing Backdoor Attacks with Multi-Level MMD Regularization. [link]
PTB: Robust Physical Backdoor Attacks against Deep Neural Networks in Real World. [link]
IBAttack: Being Cautious about Data Labels. [link]
BlindNet Backdoor: Attack on Deep Neural Network using Blind Watermark. [link]
Natural Backdoor Attacks on Deep Neural Networks via Raindrops. [link]
Dispersed Pixel Perturbation-based Imperceptible Backdoor Trigger for Image Classifier Models. [pdf]
FRIB: Low-poisoning Rate Invisible Backdoor Attack based on Feature Repair. [pdf]
Augmentation Backdoors. [pdf] [code]
Just Rotate it: Deploying Backdoor Attacks via Rotation Transformation. [pdf]
Natural Backdoor Datasets. [pdf]
Enhancing Clean Label Backdoor Attack with Two-phase Specific Triggers. [pdf]
Circumventing Backdoor Defenses That Are Based on Latent Separability. [pdf] [code]
Narcissus: A Practical Clean-Label Backdoor Attack with Limited Information. [pdf]
CASSOCK: Viable Backdoor Attacks against DNN in The Wall of Source-Specific Backdoor Defences. [pdf]
Trojan Horse Training for Breaking Defenses against Backdoor Attacks in Deep Learning. [pdf]
Label-Smoothed Backdoor Attack. [pdf]
Imperceptible and Multi-channel Backdoor Attack against Deep Neural Networks. [pdf]
Compression-Resistant Backdoor Attack against Deep Neural Networks. [pdf]
AdvDoor: Adversarial Backdoor Attack of Deep Learning System. [pdf] [code]
Invisible Poison: A Blackbox Clean Label Backdoor Attack to Deep Neural Networks. [pdf]
Backdoor Attack in the Physical World. [pdf] [extensión]
Defense-Resistant Backdoor Attacks against Deep Neural Networks in Outsourced Cloud Environment. [Link]
Puertas traseras ocultas en características faciales: un novedoso ataque de puerta trasera invisible contra sistemas de reconocimiento facial. [enlace]
Usar ruido procedural para lograr un ataque de puerta trasera. [enlace] [código]
Un ataque de puerta trasera multiobjetivo en redes neuronales profundas con disparador de ubicación aleatoria. [enlace]
Simtrojan: ataque de puerta trasera sigiloso. [enlace]
Un método de reducción de diferencias estadísticas para evadir la detección de puertas traseras. [pdf]
Ataque de puerta trasera mediante el dominio de la frecuencia. [pdf]
¡Revisa tu otra puerta! Estableciendo ataques de puerta trasera en el dominio de la frecuencia. [pdf]
Agente durmiente: puertas traseras ocultas escalables con disparador para redes neuronales entrenadas desde cero. [pdf] [código]
RABA: un ataque de puerta trasera de avatar robusto en redes neuronales profundas. [pdf]
Ataques de puerta trasera robustos contra redes neuronales profundas en el mundo físico real. [pdf]
Inyección de puertas traseras y envenenamiento de redes neuronales con ataques de escalado de imágenes. [pdf]
One-to-N y N-to-One: dos ataques de puerta trasera avanzados contra modelos de aprendizaje profundo. [pdf]
Ataques de puerta trasera invisibles en redes neuronales profundas mediante esteganografía y regularización. [pdf] [Versión de arXiv (2019)]
HaS-Nets: un mecanismo de sanar y seleccionar para defender DNNs contra ataques de puerta trasera en escenarios de recopilación de datos. [pdf]
FaceHack: activación de sistemas de reconocimiento facial con puertas traseras mediante características faciales. [pdf]
¡La luz puede hackear tu cara! Ataque de puerta trasera de caja negra en sistemas de reconocimiento facial. [pdf]
TrojanNet: incrustación de modelos troyano ocultos en redes neuronales. [pdf]
Inyección de puertas traseras en redes neuronales convolucionales mediante perturbaciones dirigidas de pesos. [pdf]
BadRes: revelar las puertas traseras mediante conexiones residuales. [pdf]
Puertas traseras arquitectónicas en redes neuronales. [pdf]
Incrustando puertas traseras indetectables en modelos de aprendizaje automático. [pdf]
Defensa guiada por interpretabilidad contra ataques de puerta trasera en redes neuronales profundas. [enlace]
Boundary augment: un método de aumento de datos para defenderse de los ataques de envenenamiento. [enlace]
Conexión de modos en paisajes de pérdida y robustez adversarial. [pdf] [código]
Fine-Pruning: defensa contra ataques de inyección de puertas traseras en redes neuronales profundas. [pdf] [código]
Troyanos neuronales. [pdf]
Adaptación en tiempo de prueba de bloques residuales contra ataques de envenenamiento y puertas traseras. [pdf]
Desactivación de puertas traseras e identificación de datos envenenados mediante destilación de conocimiento en ataques de puerta trasera a redes neuronales profundas. [pdf]
Defensa contra ataques de puerta trasera en redes neuronales profundas. [pdf]
Defensa contra ataques de puerta trasera mediante la identificación y purificación de neuronas dañadas. [pdf]
Convertir una maldición en una bendición: habilitación de defensas sin datos limpios mediante inversión de modelos. [pdf]
Ajuste fino adversarial para la defensa contra puertas traseras: conectar ejemplos adversariales con muestras activadas. [pdf]
Lavado de redes neuronales: eliminación de marcas de agua de puerta trasera de caja negra en redes neuronales profundas. [pdf]
HaS-Nets: un mecanismo de sanar y seleccionar para defender DNNs contra ataques de puerta trasera en escenarios de recopilación de datos. [pdf]
AEVA: Detección de puertas traseras en caja negra mediante el análisis de valores extremos adversariales. [pdf] [código]
Caza de disparadores con un prior topológico para la detección de troyanos. [pdf] [código]
Defensa contra puertas traseras mediante desaprendizaje automático. [pdf]
Detección en caja negra de ataques de puertas traseras con información y datos limitados. [pdf]
Escaneo de puertas traseras para redes neuronales profundas mediante la optimización de K brazos. [pdf] [código]
Hacia la inspección y eliminación de puertas traseras troyanas en redes neuronales profundas. [pdf] [versión anterior] [código]
GangSweep: Eliminación de puertas traseras neuronales mediante GAN. [pdf]
Detección de puertas traseras en clasificadores entrenados sin acceso al conjunto de entrenamiento. [pdf]
Neural Cleanse: Identificación y mitigación de ataques de puertas traseras en redes neuronales. [pdf] [código]
Defensa de puertas traseras neuronales mediante el modelado generativo de distribuciones. [pdf] [código]
DeepInspect: Un marco de detección y mitigación de troyanos en caja negra para redes neuronales profundas. [pdf]
Identificación de disparadores físicamente realizables para redes de reconocimiento facial con puertas traseras. [enlace]
Revelación de puertas traseras perceptibles en DNN sin el conjunto de entrenamiento mediante la estadística de la fracción máxima alcanzable de clasificación errónea. [pdf]
Generación adaptativa de perturbaciones para la detección de múltiples puertas traseras. [pdf]
La confianza importa: Inspección de puertas traseras en redes neuronales profundas mediante la transferencia de distribuciones. [pdf]
Defensa contra ataques troyanos de múltiples objetivos. [pdf]
Aprendizaje contrastivo de modelos para la defensa contra puertas traseras. [pdf]
CatchBackdoor: Pruebas de puertas traseras mediante la identificación de rutas neuronales troyanas críticas a través de fuzzing diferencial. [pdf]
Detectar y eliminar marcas de agua en redes neuronales profundas mediante redes generativas adversariales. [pdf]
TAD: Detección de troyanos en caja negra basada en la aproximación de disparadores para IA. [pdf]
Detección escalable de puertas traseras en redes neuronales. [pdf]
NNoculation: Tratamiento de amplio espectro y dirigido de DNN con puertas traseras. [pdf] [código]
Detección en caja negra de ataques de puertas traseras con información y datos limitados. [pdf]
Patrones de prueba universales: revelando ataques de puertas traseras en CNN. [pdf] [código]
Firma de un píxel: Caracterización de modelos CNN para la detección de puertas traseras. [pdf]
Detección práctica de redes neuronales troyanas: casos con datos limitados y sin datos. [pdf] [código]
Detección de ataques de puertas traseras mediante la diferencia de clases en redes neuronales profundas. [pdf]
Enfoque basado en poda de línea base para la detección de troyanos en redes neuronales. [pdf]
Detección universal de puertas traseras posterior al entrenamiento. [pdf]
Firmas troyanas en los pesos de DNN. [pdf]
EX-RAY: Distinguir la puerta trasera inyectada de las características naturales en redes neuronales examinando la simetría diferencial de las características. [pdf]
TOP: Detección de puertas traseras en redes neuronales mediante la transferibilidad de la perturbación. [pdf]
Detección de DNN troyanizadas mediante atribuciones contrafactuales. [pdf]
Cassandra: Detección de redes troyanizadas a partir de perturbaciones adversariales. [pdf]
Odyssey: Creación, análisis y detección de modelos troyanos. [pdf] [conjunto de datos]
Análisis de la respuesta al ruido para la detección rápida de puertas traseras en redes neuronales profundas. [pdf]
NeuronInspect: Detección de puertas traseras en redes neuronales mediante explicaciones de salida. [pdf]
Lo que no te mata te hace más robusto: entrenamiento adversarial contra venenos y puertas traseras. [pdf]
Eliminación de marcas de agua basadas en puertas traseras en redes neuronales con datos limitados. [pdf]
Enmascarar y restaurar: defensa ciega contra puertas traseras en tiempo de prueba con autoencoder enmascarado. [pdf] [código]
Sobre la eficacia del entrenamiento adversarial contra los ataques de puertas traseras. [pdf]
Restaurando la confianza en el reconocimiento facial: mitigación de ataques de puertas traseras en el reconocimiento facial para prevenir posibles violaciones de la privacidad. [pdf]
SanitAIs: Aumento de datos no supervisado para sanear redes neuronales troyanizadas. [pdf]
Sobre la eficacia de mitigar los ataques de envenenamiento de datos mediante la conformación de gradientes. [pdf] [código]
DP-InstaHide: desactivación demostrable de ataques de envenenamiento y de puertas traseras mediante aumentos de datos con privacidad diferencial. [pdf]
LinkBreaker: Romper el vínculo entre la puerta trasera y el disparador en DNN mediante la comprobación de consistencia de las neuronas. [enlace]
Protección de integridad basada en similitud para sistemas de aprendizaje profundo. [enlace]
Un detector en línea basado en características para eliminar puertas traseras adversariales mediante demarcación iterativa. [pdf]
Repensando los disparadores de los ataques de puertas traseras: una perspectiva de frecuencia. [pdf] [código]
Demonio en la variante: análisis estadístico de DNN para la detección robusta de contaminación por puertas traseras. [pdf] [código]
CLEANN: Accelerated Trojan Shield for Embedded Neural Networks. [pdf]
Robust Anomaly Detection and Backdoor Attack Detection via Differential Privacy. [pdf] [código]
Simple, Attack-Agnostic Defense Against Targeted Training Set Attacks Using Cosine Similarity. [pdf] [código]
SentiNet: Detecting Localized Universal Attacks Against Deep Learning Systems. [pdf]
STRIP: A Defence Against Trojan Attacks on Deep Neural Networks. [pdf] [extensión] [código]
Detecting Backdoor Attacks on Deep Neural Networks by Activation Clustering. [pdf] [código]
Deep Probabilistic Models to Detect Data Poisoning Attacks. [pdf]
Spectral Signatures in Backdoor Attacks. [pdf] [código]
An Adaptive Black-box Defense against Trojan Attacks (TrojDef). [pdf]
Fight Poison with Poison: Detecting Backdoor Poison Samples via Decoupling Benign Correlations. [pdf] [código]
PiDAn: A Coherence Optimization Approach for Backdoor Attack Detection and Mitigation in Deep Neural Networks. [pdf]
Neural Network Trojans Analysis and Mitigation from the Input Domain. [pdf]
A General Framework for Defending Against Backdoor Attacks via Influence Graph. [pdf]
NTD: Non-Transferability Enabled Backdoor Detection. [pdf]
A Unified Framework for Task-Driven Data Quality Management. [pdf]
TESDA: Transform Enabled Statistical Detection of Attacks in Deep Neural Networks. [pdf]
Traceback of Data Poisoning Attacks in Neural Networks. [pdf]
Provable Guarantees against Data Poisoning Using Self-Expansion and Compatibility. [pdf]
Online Defense of Trojaned Models using Misattributions. [pdf]
Detecting Backdoor in Deep Neural Networks via Intentional Adversarial Perturbations. [pdf]
Exposing Backdoors in Robust Machine Learning Models. [pdf]
HaS-Nets: A Heal and Select Mechanism to Defend DNNs Against Backdoor Attacks for Data Collection Scenarios. [pdf]
Poison as a Cure: Detecting & Neutralizing Variable-Sized Backdoor Attacks in Deep Neural Networks. [pdf]
BagFlip: A Certified Defense against Data Poisoning. [pdf]
Against Backdoor Attacks In Federated Learning With Differential Privacy. [enlace]
Secure Partial Aggregation: Making Federated Learning More Robust for Industry 4.0 Applications. [enlace]
Backdoor Attacks-resilient Aggregation based on Robust Filtering of Outliers in Federated Learning for Image Classification. [enlace]
Defense against Backdoor Attack in Federated Learning. [enlace] [código]
Privacy-Enhanced Federated Learning against Poisoning Adversaries. [enlace]
Coordinated Backdoor Attacks against Federated Learning with Model-Dependent Triggers. [enlace]
CRFL: Certifiably Robust Federated Learning against Backdoor Attacks. [pdf]
Curse or Redemption? How Data Heterogeneity Affects the Robustness of Federated Learning. [pdf]
Defending Against Backdoors in Federated Learning with Robust Learning Rate. [pdf]
BaFFLe: Backdoor detection via Feedback-based Federated Learning. [pdf]
PipAttack: Poisoning Federated Recommender Systems for Manipulating Item Promotion. [pdf]
Mitigating the Backdoor Attack by Federated Filters for Industrial IoT Applications. [enlace]
Stability-Based Analysis and Defense against Backdoor Attacks on Edge Computing Services. [enlace]
Attack of the Tails: Yes, You Really Can Backdoor Federated Learning. [pdf]
DBA: Distributed Backdoor Attacks against Federated Learning. [pdf]
The Limitations of Federated Learning in Sybil Settings. [pdf] [extensión] [código]
How to Backdoor Federated Learning. [pdf]
BEAS: Blockchain Enabled Asynchronous & Secure Federated Machine Learning. [pdf]
Backdoor Attacks and Defenses in Feature-partitioned Collaborative Learning. [pdf]
Can You Really Backdoor Federated Learning? [pdf]
Invariant Aggregator for Defending Federated Backdoor Attacks. [pdf]
Shielding Federated Learning: Mitigating Byzantine Attacks with Less Constraints. [pdf]
Federated Zero-Shot Learning for Visual Recognition. [pdf]
Assisting Backdoor Federated Learning with Whole Population Knowledge Alignment. [pdf]
FL-Defender: Combating Targeted Attacks in Federated Learning. [pdf]
Backdoor Attack is A Devil in Federated GAN-based Medical Image Synthesis. [pdf]
SafeNet: Mitigating Data Poisoning Attacks on Private Machine Learning. [pdf] [código]
PerDoor: Persistent Non-Uniform Backdoors in Federated Learning using Adversarial Perturbations. [pdf] [código]
Towards a Defense against Backdoor Attacks in Continual Federated Learning. [pdf]
Client-Wise Targeted Backdoor in Federated Learning. [pdf]
Backdoor Defense in Federated Learning Using Differential Testing and Outlier Detection. [pdf]
ARIBA: Towards Accurate and Robust Identification of Backdoor Attacks in Federated Learning. [pdf]
More is Better (Mostly): On the Backdoor Attacks in Federated Graph Neural Networks. [pdf]
Low-Loss Subspace Compression for Clean Gains against Multi-Agent Backdoor Attacks. [pdf]
Backdoors Stuck at The Frontdoor: Multi-Agent Backdoor Attacks That Backfire. [pdf]
Federated Unlearning with Knowledge Distillation. [pdf]
Model Transferring Attacks to Backdoor HyperNetwork in Personalized Federated Learning. [pdf]
Backdoor Attacks on Federated Learning with Lottery Ticket Hypothesis. [pdf]
On Provable Backdoor Defense in Collaborative Learning. [pdf]
SparseFed: Mitigating Model Poisoning Attacks in Federated Learning with Sparsification. [pdf]
Robust Federated Learning with Attack-Adaptive Aggregation. [pdf] [código]
Meta Federated Learning. [pdf]
FLGUARD: Secure and Private Federated Learning. [pdf]
Ataques de backdoor al meta-aprendizaje federado. [pdf]
Ataques de backdoor dinámicos contra el aprendizaje federado. [pdf]
Aprendizaje federado en entornos adversariales. [pdf]
BlockFLA: Aprendizaje federado con rendición de cuentas mediante arquitectura híbrida de blockchain. [pdf]
Mitigación de ataques de backdoor en el aprendizaje federado. [pdf]
Aprender a detectar clientes maliciosos para un aprendizaje federado robusto. [pdf]
Aprendizaje federado resistente a ataques con reponderación basada en residuos. [pdf] [code]
Alerta roja para los modelos preentrenados: vulnerabilidades universales mediante ataques de backdoor a nivel de neuronas. [pdf] [code]
Detección de backdoors en el aprendizaje por refuerzo. [pdf]
Diseño de backdoors intencionales en modelos secuenciales. [pdf]
PICCOLO: Exponiendo backdoors complejos en modelos transformer de NLP. [pdf] [code]
Ataque de backdoor sin disparador para tareas de NLP con etiquetas limpias. [pdf]
Un estudio de la anomalía de la atención en BERT troyanizados. [pdf] [code]
Los disparadores que abren los backdoors de los modelos de NLP están ocultos en las muestras adversariales. [link]
BDDR: Una defensa eficaz contra los ataques de backdoor textuales. [pdf]
BadPre: Ataques de backdoor independientes de la tarea a modelos fundacionales de NLP preentrenados. [pdf]
Explorando la vulnerabilidad universal del paradigma de aprendizaje basado en prompts. [pdf] [code]
Los modelos preentrenados con backdoors pueden transferirse a todos. [pdf]
BadNL: Ataques de backdoor contra modelos de NLP con mejoras que preservan la semántica. [pdf] [arXiv-20]
Ataques de backdoor en modelos preentrenados mediante envenenamiento de pesos por capas. [pdf]
T-Miner: Un enfoque generativo para defenderse de los ataques troyanos en la clasificación de texto basada en DNN. [pdf]
RAP: Perturbaciones conscientes de la robustez para defender contra ataques de backdoor en modelos de NLP. [pdf] [code]
ONION: Una defensa simple y eficaz contra los ataques de backdoor textuales. [pdf]
¡Cuidado con el estilo del texto! Ataques adversariales y de backdoor basados en la transferencia de estilo de texto. [pdf] [code]
Repensando el sigilo de los ataques de backdoor contra modelos de NLP. [pdf] [code]
Gira el candado de combinación: Ataques de backdoor textuales aprendibles mediante sustitución de palabras. [pdf]
Hidden Killer: Ataques de backdoor textuales invisibles con disparador sintáctico. [pdf] [code]
Mitigación del envenenamiento de datos en la clasificación de texto con privacidad diferencial. [pdf]
BFClass: Un marco de clasificación de texto libre de backdoors. [pdf] [code]
Ten cuidado con los word embeddings envenenados: Explorando la vulnerabilidad de las capas de embedding en los modelos de NLP. [pdf] [code]
Cirugía de redes neuronales: Inyección de patrones de datos en modelos preentrenados con efectos secundarios mínimos por instancia. [pdf]
Detección de backdoors en texto mediante un modelo abstracto RNN interpretable. [link]
Ataque de backdoor textual para el sistema de clasificación de texto. [pdf]
Ataques de envenenamiento de pesos en modelos preentrenados. [pdf] [code]
Ataques de envenenamiento contra conjuntos de datos de texto con autoencoder condicional regularizado adversarialmente. [pdf]
Un ataque de backdoor contra sistemas de clasificación de texto basados en LSTM. [pdf]
PerD: Marco de detección de troyanos neuronales basado en la sensibilidad a perturbaciones en aplicaciones de NLP. [pdf]
Kallima: Un marco de etiquetas limpias para ataques de backdoor textuales. [pdf]
Ataques de backdoor textuales con inyección iterativa de disparadores. [pdf] [code]
WeDef: Defensa contra backdoors débilmente supervisada para la clasificación de texto. [pdf]
Optimización restringida con escalado dinámico de límites para una defensa eficaz contra backdoors en NLP. [pdf]
Repensar los ataques de backdoor sigilosos en el procesamiento del lenguaje natural. [pdf]
Los ataques de backdoor textuales pueden ser más dañinos mediante dos trucos simples. [pdf]
Haciendo girar modelos de secuencia a secuencia con meta-backdoors. [pdf]
Defensa contra ataques de backdoor en la generación de lenguaje natural. [pdf] [code]
Backdoors ocultos en modelos de lenguaje centrados en el ser humano. [pdf]
Detección del ataque adversarial del disparador universal con honeypot. [pdf]
Trojanizando modelos de lenguaje por diversión y beneficio. [pdf]
Ataque de puerta trasera sigiloso contra el reconocimiento de hablante mediante disparador oculto por inyección de fase. [link]
Finge lo real: ataque de puerta trasera a la clasificación profunda de voz mediante conversión de voz. [pdf]
Ataques de puerta trasera oportunistas: explorando vulnerabilidades imperceptibles para el ser humano en sistemas de reconocimiento de voz. [link] [code]
Ataque de puerta trasera independiente de la posición en el dominio de audio mediante disparadores imperceptibles. [pdf]
¿Puedes oírlo? Ataques de puerta trasera mediante disparadores ultrasónicos. [pdf] [code]
Ataques de puerta trasera naturales en modelos de reconocimiento de voz. [link]
Audio adversario: un nuevo método de ocultación de información y puerta trasera para modelos de reconocimiento de voz basados en DNN. [pdf] [code]
DriNet: ataque dinámico de puerta trasera contra modelos automáticos de reconocimiento de voz. [link]
Ataque de puerta trasera contra la verificación de hablante [pdf] [code]
Un novedoso ataque troyano contra sistemas DNN de ASR basados en co-aprendizaje. [link]
¿Cuándo tiene éxito un ataque de puerta trasera en la reconstrucción de imágenes? Un estudio de heurísticas frente a solución de dos niveles. [link]
Una perspectiva interpretativa: ataque de trojanización adversaria en sistemas de IA de borde habilitados por búsqueda de arquitectura neuronal. [link]
Un mecanismo de ataque de puerta trasera sin disparador y de defensa para la descarga inteligente de tareas en sistemas multi-UAV. [link]
Redes troyanizadas invisiblemente para múltiples objetivos en el reconocimiento y la detección visual. [pdf]
Ataque de puerta trasera oculto contra modelos de segmentación semántica. [pdf]
Olvido dirigido adversarial en modelos de aprendizaje continuo basados en regularización y generativos. [link]
Olvido dirigido y formación de falsos recuerdos en aprendices continuos mediante ataques de puerta trasera adversariales. [pdf]
Ataques troyanos en la clasificación de señales inalámbricas con aprendizaje automático adversarial. [pdf]
BadHash: ataques de puerta trasera invisibles contra hash profundo con etiqueta limpia. [pdf]
Un disparador de crominancia temporal para ataques de puerta trasera de etiqueta limpia contra la detección de retransmisión anti-suplantación. [pdf]
MACAB: puerta trasera de anotación limpia independiente del modelo para detección de objetos con disparador natural en el mundo real. [pdf]
BadDet: ataques de puerta trasera en la detección de objetos. [pdf]
Ataques de puerta trasera en redes neuronales bayesianas utilizando distribución inversa. [pdf]
Inyectando puertas traseras en aprendizaje automático explicable. [pdf]
Ataque de puerta trasera de anotación limpia contra sistemas de detección de carriles en el mundo real. [pdf]
Camuflaje peligroso: ataques de puerta trasera basados en disparadores naturales a detectores de objetos en el mundo físico. [pdf]
Ataques de caballo de Troya dirigidos en la recuperación de imágenes basada en lenguaje. [pdf]
Puertas traseras multimodales de doble clave para la respuesta a preguntas visuales. [pdf]
Ataque de puerta trasera de etiqueta limpia contra la recuperación basada en hashing profundo. [pdf]
Ataques de puerta trasera a la certificación de redes mediante el envenenamiento de datos. [pdf]
Ataque y defensa de puertas traseras para la regresión profunda. [pdf]
El diablo está en la GAN: Defensa de modelos generativos profundos contra ataques de puerta trasera. [pdf]
BAAAN: Ataques de puerta trasera contra modelos de aprendizaje automático basados en autoencoders y GAN. [pdf]
DeepObliviate: Un poderoso encantamiento para borrar la memoria residual de datos en redes neuronales profundas. [pdf]
Puertas traseras en modelos neuronales de código fuente. [pdf]
Las interfaces cerebro-computadora basadas en EEG son vulnerables a los ataques de puerta trasera. [pdf]
Bias Busters: Robustificación de detectores de hotspots litográficos basados en DL contra ataques de puerta trasera. [pdf]