本 Github 仓库总结了 后门学习(Backdoor Learning) 资源清单。更多细节和分类标准,请参考我们的综述。
我们将尽最大努力以月度为单位持续维护本 Github 仓库。
后门学习是一个新兴的研究领域,讨论机器学习算法训练过程中的安全问题。它在现实中安全地采用第三方训练资源或模型时至关重要。
注意:“后门”也常被称为“神经木马”或“木马”。
如果我们的仓库或综述对您的研究有帮助,请按如下方式引用我们的论文:``` @article{li2022backdoor, title={Backdoor learning: A survey}, author={Li, Yiming and Jiang, Yong and Li, Zhifeng and Xia, Shu-Tao}, journal={IEEE Transactions on Neural Networks and Learning Systems}, year={2022} }
## 贡献
<p align="center">
<img src="https://assets.kitploit.com/production/public/readmes/placeholders/f0fc86cfe65f76d40e15aaec61704ec8220a56dc89d4be03c46f67cb31b9fa8c.svg" alt="我们需要你!">
</p>
请通过联系[我](http://liyiming.tech)或提交[pull request](https://github.com/THUYimingLi/awesome-backdoor-learning/pulls)来为此列表做出贡献。
Markdown格式:```markdown
- Paper Name.
[[pdf]](link)
[[code]](link)
- Author 1, Author 2, **and** Author 3. *Conference/Journal*, Year.
注意:在同一年中,请将会议论文放在期刊论文之前,因为期刊通常是很久以前投稿的,因此存在一定滞后。(即,会议-->期刊-->预印本)
后门学习:综述。 [pdf]
深度学习上的后门攻击与对策:综合评述。 [pdf]
机器学习的数据安全:数据投毒、后门攻击与防御。 [pdf]
机器学习中投毒攻击与对策的全面综述。 [link]
联邦学习中的后门攻击与防御:最新进展、分类与未来方向。 [link]
深度神经网络中图像分类模型的后门攻击。 [link]
针对神经木马攻击的防御:综述。 [link]
神经木马综述。 [pdf]
针对语音识别系统的后门攻击:综述。 [pdf]
深度学习中的神经木马攻击与防御综述。 [pdf]
计算机视觉中基于投毒的后门攻击。 [pdf]
针对深度神经网络分类器的后门攻击防御。 [pdf]
迈向深度学习的对抗与后门鲁棒性。 [link]
迈向鲁棒且通信高效的分布式机器学习。 [pdf]
基于深度学习的鲁棒图像分类与移动端实时 DNN 推理。 [pdf]
针对后门、数据投毒与对抗攻击的对策。 [pdf]
理解并减轻后门攻击对深度神经网络的影响。 [pdf]
不公平木马:针对模型公平性的定向后门攻击。 [pdf]
检查你的另一扇门:在频域中创建后门攻击。 [pdf]
神经网络中的后门攻击。 [link]
后门防御。 [pdf]
带后门神经网络的几何性质。
重新审视后门防御的潜在可分离性假设。 [pdf] [code]
颜色后门:颜色空间中的鲁棒投毒攻击。 [pdf]
非目标后门水印:迈向无害且隐蔽的数据集版权保护。 [pdf] [code]
DEFEAT:通过不可感知扰动与潜在表示约束的深度隐藏特征后门攻击。 [pdf]
神枪手后门:任意目标类别的后门攻击。 [pdf]
BppAttack:通过图像量化与对比对抗学习对深度神经网络的隐蔽高效木马攻击。 [pdf] [code]
针对机器学习模型的动态后门攻击。 [pdf]
不可感知后门攻击:从输入空间到特征表示。 [pdf] [code]
带有对抗训练的隐蔽后门攻击。 [link]
具有样本特定触发器的隐形后门攻击。 [pdf] [code]
通过数据排序攻击操纵 SGD。 [pdf]
具有不可感知输入和潜在修改的后门攻击。 [pdf]
LIRA:可学习、不可感知且鲁棒的后门攻击。 [pdf]
物理世界中针对深度学习系统的后门攻击。 [pdf] [Master Thesis]
通过受控解毒对神经网络进行深度特征空间木马攻击。 [pdf] [code]
WaNet - 不可感知的基于形变的后门攻击。 [pdf] [code]
AdvDoor:深度学习系统的对抗后门攻击。 [pdf]
通过混合现有良性特征实现对深度神经网络的复合后门攻击。 [pdf]
绕过深度学习中的后门检测算法。 [pdf]
通过隐形扰动在卷积神经网络模型中嵌入后门。 [pdf]
针对视频识别模型的干净标签后门攻击。 [pdf] [code]
逃避深度学习的后门攻击检测。 [link]
反射后门:一种针对深度神经网络的自然后门攻击。 [pdf] [code]
利用图像缩放攻击植入后门和投毒神经网络。 [pdf]
一种通过训练集破坏实现CNN新后门攻击而无需标签投毒的方法。 [pdf]
BadNets:识别机器学习模型供应链中的漏洞。 [pdf] [journal]
使用数据投毒对深度学习系统进行定向后门攻击。 [pdf] [code]
深度神经网络中的手工后门。 [pdf]
利用比特翻转对神经网络进行难以察觉的木马攻击。 [pdf] [code]
ProFlip:使用渐进式比特翻转的定向木马攻击。 [pdf]
TBT:利用比特木马实现定向神经网络攻击。 [pdf] [code]
如何以更好的一致性注入后门:在干净数据上进行Logit锚定。 [pdf]
对抗性权重扰动能否注入神经后门? [pdf]
通过翻转有限比特实现多功能权重攻击。 [pdf]
使用Rowhammer实现针对DNN的现实后门注入攻击。 [pdf]
TrojanNet:在神经网络中嵌入隐藏的特洛伊木马模型。 [pdf]
通过定向权重扰动在卷积神经网络中植入后门。
LoneNeuron:使用隐形和多态水印实现的高效特征域神经木马。 [pdf]
面向深度神经网络的实际部署阶段后门攻击。 [pdf] [code]
大海捞针:构建能够逃避验证的神经网络。 [link] [code]
深度学习框架中的隐形灵活木马。 [link]
FooBaR:针对神经网络训练的故障欺骗后门攻击。 [link] [code]
DeepPayload:通过神经负载注入对深度学习模型实施黑盒后门攻击。 [pdf]
一种针对深度神经网络木马攻击的极其简单的方法。 [pdf] [code]
BadRes:通过残差连接揭示后门。 [pdf]
神经网络中的架构后门。 [pdf]
ImpNet:编译后神经网络中不可感知且黑盒不可检测的后门。 [pdf] [website] [code]
别触发我!一种针对深度神经网络的无触发器后门攻击。 [pdf]
物理世界中的后门攻击。 [pdf] [extension]
DeepSweep:使用数据增强缓解DNN后门攻击的评估框架。 [pdf] [code]
Februus:针对深度神经网络系统木马攻击的输入净化防御。 [pdf] [code]
神经木马。 [pdf]
使用去触发器自编码器防御深度神经网络的后门攻击。 [pdf]
ConFoc:针对神经网络木马攻击的内容聚焦保护。 [pdf]
针对机器学习后门攻击的模型无关防御。 [pdf]
通过隐式超梯度实现后门的对抗性遗忘。 [pdf] [code]
基于通道Lipschitz性质的免数据后门移除。 [pdf] [code]
使用注意力关系图蒸馏消除深度神经网络的后门触发器。 [pdf]
对抗性神经元剪枝净化带后门的深度模型。 [pdf] [code]
神经注意力蒸馏:从深度神经网络中擦除后门触发器。 [pdf] [code]
可解释性引导的深度神经网络后门攻击防御。 [link]
Better Trigger Inversion Optimization in Backdoor Scanning. [pdf] [代码]
Few-shot Backdoor Defense Using Shapley Estimation. [pdf]
Rethinking the Reverse-engineering of Trojan Triggers. [pdf] [代码]
One-shot Neural Backdoor Erasing via Adversarial Weight Masking. [pdf] [代码]
AEVA: Black-box Backdoor Detection Using Adversarial Extreme Value Analysis.
Complex Backdoor Detection by Symmetric Feature Differencing. [pdf] [代码]
Post-Training Detection of Backdoor Attacks for Two-Class and Multi-Attack Scenarios. [pdf] [代码]
Randomized Channel Shuffling: Minimal-Overhead Backdoor Attack Detection without Clean Datasets. [pdf] [代码]
An Anomaly Detection Approach for Backdoored Neural Networks: Face Recognition as a Case Study. [pdf]
Critical Path-Based Backdoor Detection for Deep Neural Networks. [链接]
Detecting AI Trojans Using Meta Neural Analysis. [pdf]
Topological Detection of Trojaned Neural Networks. [pdf]
Black-box Detection of Backdoor Attacks with Limited Information and Data. [pdf]
Backdoor Defense via Decoupling the Training Process. [pdf] [代码]
Effective Backdoor Defense by Exploiting Sensitivity of Poisoned Samples. [pdf] [代码]
Trap and Replace: Defending Backdoor Attacks by Trapping Them into an Easy-to-Replace Subnetwork. [pdf] [代码]
Training with More Confidence: Mitigating Injected and Natural Backdoors During Training. [pdf] [代码]
Anti-Backdoor Learning: Training Clean Models on Poisoned Data. [pdf] [代码]
Robust Anomaly Detection and Backdoor Attack Detection via Differential Privacy. [pdf] [代码]
Strong Data Augmentation Sanitizes Poisoning and Backdoor Attacks Without an Accuracy Trade-off. [pdf]
SCALE-UP: An Efficient Black-box Input-level Backdoor Detection via Analyzing Scaled Prediction Consistency. [pdf] [代码]
Distilling Cognitive Backdoor Patterns within an Image. [pdf] [代码]
Incompatibility Clustering as a Defense Against Backdoor Poisoning Attacks. [pdf] [代码]
The "Beatrix'' Resurrections: Robust Backdoor Detection via Gram Matrices. [pdf] [代码]
Effective Backdoor Defense by Exploiting Sensitivity of Poisoned Samples. [pdf] [代码]
Towards Effective and Robust Neural Trojan Defenses via Input Filtering. [pdf] [代码]
Can We Mitigate Backdoor Attack Using Adversarial Detection Methods? [链接]
BagFlip:一种针对数据投毒的可认证防御。 [pdf] [code]
RAB:针对后门攻击的可证明稳健性。 [pdf] [code]
最近邻分类器针对数据投毒与后门攻击的可认证稳健性。 [pdf]
深度分区聚合:针对通用投毒攻击的可证明防御。 [pdf] [code]
Bagging 针对数据投毒攻击的内在可认证稳健性。 [pdf] [code]
通过随机平滑实现针对标签翻转攻击的可认证稳健性。 [pdf]
通过随机平滑认证针对后门攻击的稳健性。 [pdf]
BagFlip:一种针对数据投毒的可认证防御。 [pdf]
FLIP:一种用于联邦学习后门缓解的可证明防御框架。 [pdf] [code]
使用 Cerberus 投毒:针对联邦学习的隐蔽共谋后门攻击。 [link]
Neurotoxin:联邦学习中的持久后门。 [pdf]
FLAME:驯服联邦学习中的后门。 [pdf]
DeepSight:通过深度模型检查缓解联邦学习中的后门攻击。 [pdf]
在纵向联邦学习中防御标签推断与后门攻击。 [pdf]
联邦学习中模型投毒的拜占庭容错聚合机制分析。 [link]
在带差分隐私的联邦学习中防御后门攻击。 [link]
强化学习中针对后门策略的可证明防御。 [pdf] [code]
MARNet:针对合作式多智能体强化学习的后门攻击。 [link]
BACKDOORL:针对竞争性强化学习的后门攻击。 [pdf]
Stop-and-Go:探索基于深度强化学习的交通拥堵控制系统上的后门攻击。 [pdf]
Agent Manipulator:针对深度强化学习的隐蔽策略攻击。 [link]
TrojDRL:深度强化学习后门攻击的评估。 [pdf] [code]
使用分布内触发器对深度强化学习智能体进行投毒。 [pdf]
一种针对深度强化学习的时间模式后门攻击。 [pdf]
强化学习中的后门检测。 [pdf]
序列模型中蓄意后门的设计。 [pdf]
对比学习中的投毒与后门攻击。 [pdf]
BadEncoder:自监督学习中针对预训练编码器的后门攻击。 [pdf] [code]
DeHiB:通过对抗扰动对半监督学习进行的深度隐藏后门攻击。 [pdf]
半监督学习中的深度神经后门:威胁与对策。 [link]
掩码图像建模供应链中的后门攻击。 [pdf]
对比学习中预训练编码器的水印标记。 [pdf]
RIBAC:面向紧凑型DNN的鲁棒且不可察觉的后门攻击。 [pdf] [code]
Qu-ANTI-zation:利用量化伪影实现对抗性结果。 [pdf] [code]
理解模型供应链中特洛伊化量化神经网络的威胁。 [pdf]
深度学习模型的量化后门。 [pdf]
作为压缩伪影的隐蔽后门。 [pdf]
TrojText:测试时隐形文本特洛伊木马插入。 [pdf] [code]
防御自然语言生成中的后门攻击。 [link]
通过正则化持续预训练移除预训练模型中的后门。 [pdf] [code]
BadPrompt:针对连续提示的后门攻击。 [pdf] [code]
适度拟合:预训练语言模型的天然后门防御者 [pdf] [code]
文本后门学习的统一评估:框架与基准。 [pdf] [code]
旋转语言模型:宣传即服务的风险与对策 [pdf] [code]
可迁移的图后门攻击。 [pdf]
多即是好(大多数情况下):联邦图神经网络中的后门攻击研究。 [pdf]
对图神经网络的后门攻击。 [pdf]
通过可解释性防御图神经网络上的后门攻击。 [pdf]
Link-Backdoor:通过节点注入对链接预测的后门攻击。 [pdf] [code]
针对图卷积网络的邻近后门攻击。 [pdf]
Dyn-Backdoor:对动态链接预测的后门攻击。 [pdf]
基于可解释性的针对图神经网络的后门攻击。 [pdf]
PointBA:面向3D点云的后门攻击。 [pdf]
3D点云中不可感知且鲁棒的后门攻击。 [pdf]
检测针对点云分类器的后门攻击。 [pdf]
毒化MorphNet以实现对点云的干净标签后门攻击。 [pdf]
通过声音元素实现针对语音识别的隐蔽后门攻击。 [pdf] [code]
使用Paddingback攻破说话人识别。 [link]
通过音频语谱图中的隐蔽频率触发器注入实现不可闻后门攻击。 [link]
SilentTrig:利用隐藏触发器对说话人识别发起不可察觉的后门攻击。 [link]
房间里的恶魔:在物理世界中触发音频后门。 [pdf]
沉默的操纵者:针对语音识别系统的实用且不可闻的后门攻击。 [link]
时尚变身:通过风格转换实现音频后门。 [pdf]
VenoMave:针对语音识别的定向投毒。 [pdf]
利用相位注入隐藏触发器对说话人识别发起隐蔽后门攻击。 [link]
以假乱真:通过语音转换对深度语音分类的后门攻击。
FIBA:基于频率注入的医学图像分析后门攻击。 [pdf]
利用缺失值模式对电子健康记录机器学习模型发起后门攻击:开发与验证研究。 [link]
基于电子健康记录的机器学习易受后门触发器攻击。 [pdf]
可解释性至关重要:针对医学成像的后门攻击。 [pdf]
TRAPDOOR:重新利用后门检测基于机器学习的基因组分析中的数据集偏差。 [pdf]
你引起了我的注意:视觉Transformer在后门攻击下是糟糕的学习者吗? [pdf]
TrojViT:视觉Transformer中的木马注入。 [pdf]
通过补丁处理防御针对视觉Transformer的后门攻击。 [link]
对视觉Transformer的后门攻击。 [pdf] [code]
TrojViT:视觉Transformer中的木马注入。 [pdf]
木马Transformer中的注意力劫持。 [pdf]
DBIA:针对Transformer网络的无数据后门注入攻击。 [pdf] [code]
TrojDiff:针对具有多样化目标的扩散模型的木马攻击。 [pdf] [code]
VulnerGAN:通过漏洞放大针对基于机器学习的网络入侵检测系统的后门攻击。 [link] [code]
解释引导的针对恶意软件分类器的后门投毒攻击。 [pdf]
基于机器学习的Android恶意软件检测器上的后门攻击。 [link]
拼图游戏:颠覆恶意软件分类器的选择性后门攻击。 [pdf]
干净图像后门:仅使用有毒标签攻击多标签模型。 [pdf] [code]
BadDet:目标检测上的后门攻击。 [pdf]
通过对齐进行攻击:目标检测上的干净标签后门攻击。 [pdf]
基于掩码的目标检测隐形后门攻击。 [pdf]
TAT:针对视觉目标跟踪的定向后门攻击。 [link] [code]
AutoML的阴暗面:迈向架构后门搜索。 [pdf] [code]
通过自适应频率触发器对深度图像压缩的后门攻击。 [pdf] Yi Yu, Yufei Wang, Wenhan Yang, Shijian Lu, Yap-Peng Tan, and Alex C. Kot. CVPR, 2023.
动态路由神经网络的阴暗面:迈向效率后门注入。 [pdf]
对人群计数的后门攻击。 [pdf]
对DNN解释系统的后门攻击。 [pdf]
魔鬼在GAN中:防御深度生成模型免受后门攻击。 [pdf] [code] [demo]
面向物体的图像描述后门攻击。 [link]
后门攻击何时能在图像重建中成功?启发式方法与双层解决方案的研究。 [link]
解释性视角:针对支持神经架构搜索的边缘AI系统的对抗性木马攻击。 [link]
在图像数据集中发现自然存在的物理后门。 [pdf] [code]
BackdoorBox:用于后门学习的Python工具箱。 [pdf] [code]
TROJANZOO:关于神经后门你想知道的一切(但不敢问)。 [pdf] [code]
文本后门学习的统一评估:框架与基准。 [pdf] [code]
BackdoorBench:后门学习的综合基准。 [pdf] [code] [website]
预训练语言模型的威胁:综述与分类。 [pdf]
深度神经网络后门攻击及可行防御概述。 [pdf]
深度学习后门。 [pdf]
使用结构化对抗攻击检测带后门的神经网络。 [pdf]
物理世界中针对深度学习系统的后门攻击。 [pdf]
针对压缩深度神经网络的隐形高效后门攻击。 [link]
基于全局平均池化的动态后门。 [pdf]
毒墨:鲁棒且隐形的后门攻击。 [pdf]
通过多级 MMD 正则化增强后门攻击。 [link]
PTB:现实世界中针对深度神经网络的鲁棒物理后门攻击。 [link]
IBAttack:谨慎对待数据标签。 [link]
BlindNet 后门:使用盲水印攻击深度神经网络。 [link]
通过雨滴对深度神经网络的自然后门攻击。 [link]
基于离散像素扰动的图像分类器模型不可感知后门触发器。 [pdf]
FRIB:基于特征修复的低投毒率隐形后门攻击。 [pdf]
只需旋转:通过旋转变换部署后门攻击。 [pdf]
自然后门数据集。 [pdf]
通过两阶段特定触发器增强干净标签后门攻击。 [pdf]
Narcissus:信息有限条件下的实用干净标签后门攻击。 [pdf]
CASSOCK:源特定后门防御墙下针对 DNN 的可行后门攻击。 [pdf]
用于攻破深度学习后门攻击防御的特洛伊木马训练。 [pdf]
标签平滑后门攻击。 [pdf]
针对深度神经网络的不可感知多通道后门攻击。 [pdf]
针对深度神经网络的抗压缩后门攻击。 [pdf]
隐形毒药:针对深度神经网络的黑盒干净标签后门攻击。 [pdf]
物理世界中的后门攻击。 [pdf] [extension]
外包云环境中针对深度神经网络的抗防御后门攻击。 [Link]
隐藏在面部特征中的后门:一种针对人脸识别系统的新型隐形后门攻击。 [link]
一种使用随机位置触发器的深度神经网络多目标后门攻击。 [link]
Simtrojan:隐形后门攻击。 [link]
一种用于逃避后门检测的统计差异缩减方法。 [pdf]
通过频域实现后门攻击。 [pdf]
检查你的另一扇门!在频域中建立后门攻击。 [pdf]
潜伏代理:针对从零训练的神经网络的规模化隐藏触发器后门。 [pdf] [code]
RABA:针对深度神经网络的鲁棒头像后门攻击。 [pdf]
真实物理世界中针对深度神经网络的鲁棒后门攻击。 [pdf]
一对多与多对一:两种针对深度学习模型的高级后门攻击。 [pdf]
通过隐写术和正则化实现对深度神经网络的隐形后门攻击。 [pdf] [arXiv Version (2019)]
HaS-Nets:一种用于数据采集场景中防御DNN后门攻击的修复与选择机制。 [pdf]
FaceHack:利用面部特征触发带后门的人脸识别系统。 [pdf]
光能黑掉你的脸!针对人脸识别系统的黑盒后门攻击。 [pdf]
在机器学习模型中植入不可检测的后门。 [pdf]
Boundary augment:一种用于防御投毒攻击的数据增强方法。 [link]
连接损失景观中的模式连通性与对抗鲁棒性。 [pdf] [code]
神经木马。 [pdf]
针对投毒和后门攻击的残差块测试时自适应。 [pdf]
在深度神经网络后门攻击中利用知识蒸馏禁用后门并识别投毒数据。 [pdf]
防御针对深度神经网络的后门攻击。 [pdf]
通过识别和净化坏神经元防御后门攻击。 [pdf]
化诅咒为祝福:通过模型反演实现免干净数据防御。 [pdf]
用于后门防御的对抗性微调:将对抗样本与触发样本关联起来。 [pdf]
神经网络清洗:从深度神经网络中移除黑盒后门水印。 [pdf]
HaS-Nets:一种用于数据采集场景中防御DNN后门攻击的修复与选择机制。 [pdf]
Trigger Hunting with a Topological Prior for Trojan Detection. [pdf] [代码]
Backdoor Defense with Machine Unlearning. [pdf]
Black-box Detection of Backdoor Attacks with Limited Information and Data. [pdf]
Backdoor Scanning for Deep Neural Networks through K-Arm Optimization. [pdf] [代码]
Towards Inspecting and Eliminating Trojan Backdoors in Deep Neural Networks. [pdf] [先前版本] [代码]
GangSweep: Sweep out Neural Backdoors by GAN. [pdf]
Detection of Backdoors in Trained Classifiers Without Access to the Training Set. [pdf]
Neural Cleanse: Identifying and Mitigating Backdoor Attacks in Neural Networks. [pdf] [代码]
Defending Neural Backdoors via Generative Distribution Modeling. [pdf] [代码]
DeepInspect: A Black-box Trojan Detection and Mitigation Framework for Deep Neural Networks. [pdf]
Identifying Physically Realizable Triggers for Backdoored Face Recognition Networks. [链接]
Revealing Perceptible Backdoors in DNNs Without the Training Set via the Maximum Achievable Misclassification Fraction Statistic. [pdf]
Adaptive Perturbation Generation for Multiple Backdoors Detection. [pdf]
Confidence Matters: Inspecting Backdoors in Deep Neural Networks via Distribution Transfer. [pdf]
Defense Against Multi-target Trojan Attacks. [pdf]
Model-Contrastive Learning for Backdoor Defense. [pdf]
CatchBackdoor: Backdoor Testing by Critical Trojan Neural Path Identification via Differential Fuzzing. [pdf]
Detect and Remove Watermark in Deep Neural Networks via Generative Adversarial Networks. [pdf]
TAD: Trigger Approximation based Black-box Trojan Detection for AI. [pdf]
Scalable Backdoor Detection in Neural Networks. [pdf]
NNoculation: Broad Spectrum and Targeted Treatment of Backdoored DNNs. [pdf] [代码]
Universal Litmus Patterns: Revealing Backdoor Attacks in CNNs. [pdf] [代码]
One-Pixel Signature: Characterizing CNN Models for Backdoor Detection. [pdf]
Practical Detection of Trojan Neural Networks: Data-Limited and Data-Free Cases. [pdf] [代码]
Detecting Backdoor Attacks via Class Difference in Deep Neural Networks. [pdf]
Baseline Pruning-Based Approach to Trojan Detection in Neural Networks. [pdf]
Universal Post-Training Backdoor Detection. [pdf]
Trojan Signatures in DNN Weights. [pdf]
EX-RAY: Distinguishing Injected Backdoor from Natural Features in Neural Networks by Examining Differential Feature Symmetry. [pdf]
TOP: Backdoor Detection in Neural Networks via Transferability of Perturbation. [pdf]
Detecting Trojaned DNNs Using Counterfactual Attributions. [pdf]
Cassandra: Detecting Trojaned Networks from Adversarial Perturbations. [pdf]
Odyssey: Creation, Analysis and Detection of Trojan Models. [pdf] [数据集]
Noise-response Analysis for Rapid Detection of Backdoors in Deep Neural Networks. [pdf]
NeuronInspect: Detecting Backdoors in Neural Networks via Output Explanations. [pdf]
What Doesn't Kill You Makes You Robust(er): Adversarial Training against Poisons and Backdoors. [pdf]
Removing Backdoor-Based Watermarks in Neural Networks with Limited Data. [pdf]
Mask and Restore: Blind Backdoor Defense at Test Time with Masked Autoencoder. [pdf] [代码]
On the Effectiveness of Adversarial Training against Backdoor Attacks. [pdf]
Resurrecting Trust in Facial Recognition: Mitigating Backdoor Attacks in Face Recognition to Prevent Potential Privacy Breaches. [pdf]
SanitAIs: Unsupervised Data Augmentation to Sanitize Trojaned Neural Networks. [pdf]
On the Effectiveness of Mitigating Data Poisoning Attacks with Gradient Shaping. [pdf] [代码]
DP-InstaHide: Provably Defusing Poisoning and Backdoor Attacks with Differentially Private Data Augmentations. [pdf]
LinkBreaker: Breaking the Backdoor-Trigger Link in DNNs via Neurons Consistency Check. [链接]
Similarity-based Integrity Protection for Deep Learning Systems. [链接]
A Feature-Based On-Line Detector to Remove Adversarial-Backdoors by Iterative Demarcation. [pdf]
Rethinking the Backdoor Attacks' Triggers: A Frequency Perspective. [pdf] [代码]
Demon in the Variant: Statistical Analysis of DNNs for Robust Backdoor Contamination Detection. [pdf] [代码]
CLEANN:面向嵌入式神经网络的加速特洛伊盾牌。 [pdf]
SentiNet:检测针对深度学习系统的局部通用攻击。 [pdf]
STRIP:一种针对深度神经网络特洛伊攻击的防御方法。 [pdf] [extension] [code]
通过激活聚类检测深度神经网络上的后门攻击。 [pdf] [code]
用于检测数据投毒攻击的深度概率模型。 [pdf]
一种针对特洛伊攻击的自适应黑盒防御(TrojDef)。 [pdf]
以毒攻毒:通过解耦良性相关性检测后门投毒样本。 [pdf] [code]
PiDAn:一种用于深度神经网络后门攻击检测与缓解的相干性优化方法。 [pdf]
从输入域角度进行神经网络特洛伊分析与缓解。 [pdf]
一种通过影响图防御后门攻击的通用框架。 [pdf]
NTD:基于不可迁移性的后门检测。 [pdf]
一种面向任务的数据质量管理的统一框架。 [pdf]
TESDA:基于变换的深度神经网络攻击统计检测。 [pdf]
神经网络中数据投毒攻击的溯源。 [pdf]
通过自扩展与兼容性实现针对数据投毒的可证明保证。 [pdf]
使用错误归因对特洛伊模型进行在线防御。 [pdf]
通过有意对抗扰动检测深度神经网络中的后门。 [pdf]
揭示稳健机器学习模型中的后门。 [pdf]
HaS-Nets:一种用于数据采集场景下防御 DNN 后门攻击的修复与选择机制。 [pdf]
以毒为药:检测并中和深度神经网络中可变大小的后门攻击。 [pdf]
安全部分聚合:使联邦学习对工业 4.0 应用更加稳健。 [link]
基于异常值稳健过滤的联邦学习图像分类后门攻击弹性聚合。 [link]
针对投毒对手的隐私增强联邦学习。 [link]
使用模型相关触发器的联邦学习协同后门攻击。 [link]
CRFL:针对后门攻击的可认证稳健联邦学习。 [pdf]
诅咒还是救赎?数据异质性如何影响联邦学习的稳健性。 [pdf]
使用稳健学习率防御联邦学习中的后门。 [pdf]
BaFFLe:基于反馈的联邦学习后门检测。 [pdf]
PipAttack:投毒联邦推荐系统以操纵商品推广。 [pdf]
通过联邦过滤器缓解工业物联网应用中的后门攻击。 [link]
基于稳定性的边缘计算服务后门攻击分析与防御。 [link]
尾部攻击:是的,你确实可以后门联邦学习。 [pdf]
DBA:针对联邦学习的分布式后门攻击。 [pdf]
联邦学习在 Sybil 场景中的局限性。 [pdf] [extension] [code]
如何后门联邦学习。 [pdf]
BEAS:基于区块链的异步安全联邦机器学习。 [pdf]
特征分区协作学习中的后门攻击与防御。 [pdf]
你真的能后门联邦学习吗? [pdf]
用于防御联邦后门攻击的不变聚合器。 [pdf]
保护联邦学习:以更少的约束缓解拜占庭攻击。 [pdf]
面向视觉识别的联邦零样本学习。 [pdf]
以全域知识对齐辅助后门联邦学习。 [pdf]
FL-Defender:对抗联邦学习中的定向攻击。 [pdf]
后门攻击是联邦 GAN 医学图像合成中的恶魔。 [pdf]
PerDoor:使用对抗扰动在联邦学习中植入持久非均匀后门。 [pdf] [code]
面向持续联邦学习中后门攻击的防御。 [pdf]
联邦学习中的客户端定向后门。 [pdf]
使用差分测试与离群点检测的联邦学习后门防御。 [pdf]
ARIBA:迈向联邦学习中后门攻击的准确稳健识别。 [pdf]
多即是好(大多数情况下):联邦图神经网络中的后门攻击。 [pdf]
用于对抗多智能体后门攻击的低损耗子空间压缩。 [pdf]
后门卡在前门:适得其反的多智能体后门攻击。 [pdf]
基于知识蒸馏的联邦遗忘。 [pdf]
针对个性化联邦学习中后门超网络的模型迁移攻击。 [pdf]
基于彩票假说的联邦学习后门攻击。 [pdf]
协作学习中的可证明后门防御。 [pdf]
SparseFed:通过稀疏化缓解联邦学习中的模型投毒攻击。 [pdf]
元联邦学习。 [pdf]
FLGUARD:安全且私密的联邦学习。 [pdf]
增量学习,增量后门威胁。 [link]
具有抵抗网络迁移能力的鲁棒后门注入。 [link]
抗蒸馏后门攻击:后门确实能在知识蒸馏中生存。 [pdf]
针对使用预训练深度学习模型的迁移学习的后门攻击。 [pdf]
深度神经网络上的潜在后门攻击。 [pdf]
神经网络中的架构后门。 [pdf]
预训练模型的红色警报:神经元级后门攻击造成的通用漏洞。 [pdf] [code]
面向干净标签NLP任务的无触发器后门攻击。 [pdf]
打开NLP模型后门的触发器隐藏在对抗样本中。 [link]
BDDR:一种有效的文本后门攻击防御方法。 [pdf]
BadPre:针对预训练NLP基础模型的任务无关后门攻击。 [pdf]
探索基于提示的学习范式的通用漏洞。 [pdf] [code]
后门预训练模型可以迁移到所有任务。 [pdf]
BadNL:具有语义保持改进的针对NLP模型的后门攻击。 [pdf] [arXiv-20]
通过逐层权重投毒对预训练模型的后门攻击。 [pdf]
T-Miner:一种防御基于DNN的文本分类特洛伊木马攻击的生成式方法。 [pdf]
RAP:用于防御NLP模型后门攻击的鲁棒性感知扰动。 [pdf] [code]
ONION:一种简单有效的文本后门攻击防御方法。 [pdf]
注意文本风格!基于文本风格迁移的对抗攻击与后门攻击。 [pdf] [code]
重新思考针对NLP模型的后门攻击的隐蔽性。 [pdf] [code]
转动组合锁:通过词语替换的可学习文本后门攻击。 [pdf]
隐藏杀手:具有句法触发器的隐形文本后门攻击。 [pdf] [code]
使用差分隐私缓解文本分类中的数据投毒。 [pdf]
BFClass:一种无后门文本分类框架。 [pdf] [code]
小心被投毒的词嵌入:探索NLP模型中嵌入层的脆弱性。 [pdf] [code]
神经网络手术:以最小的逐实例副作用将数据模式注入预训练模型。 [pdf]
使用可解释的RNN抽象模型进行文本后门检测。 [link]
针对文本分类系统的文本后门攻击。 [pdf]
使用条件对抗正则化自动编码器对文本数据集进行投毒攻击。 [pdf]
一种针对基于LSTM的文本分类系统的后门攻击。 [pdf]
PerD:基于扰动敏感性的NLP应用神经特洛伊木马检测框架。 [pdf]
Kallima:一种用于文本后门攻击的干净标签框架。 [pdf]
WeDef:面向文本分类的弱监督后门防御。 [pdf]
动态边界缩放的约束优化以实现有效的NLP后门防御。 [pdf]
重新思考自然语言处理中的隐蔽后门攻击。 [pdf]
文本后门攻击通过两个简单技巧可能更具危害性。 [pdf]
利用元后门操控序列到序列模型。 [pdf]
以人为中心的语言模型中的隐藏后门。 [pdf]
使用蜜罐检测通用触发器的对抗攻击。 [pdf]
为了乐趣和利益对语言模型植入木马。 [pdf]
机会主义后门攻击:探索语音识别系统上人类不可感知的漏洞。 [link] [code]
通过不易察觉的触发器实现音频域位置无关的后门攻击。 [pdf]
你能听到它吗?通过超声波触发器发起的后门攻击。 [pdf] [code]
对语音识别模型的自然后门攻击。 [link]
DriNet:针对自动语音识别模型的动态后门攻击。 [link]
针对基于协同学习的ASR DNN系统的新型木马攻击。 [link]
面向多无人机系统智能任务卸载的无触发器后门攻击与防御机制。 [link]
用于视觉识别与检测的多目标隐形木马网络。 [pdf]
针对语义分割模型的隐藏后门攻击。 [pdf]
正则化与生成式持续学习模型中的对抗性定向遗忘。 [link]
通过对抗性后门攻击在持续学习器中实现定向遗忘与虚假记忆形成。 [pdf]
利用对抗机器学习对无线信号分类的木马攻击。 [pdf]
BadHash:干净标签下针对深度哈希的隐形后门攻击。 [pdf]
针对防欺骗转播检测的干净标签后门攻击的时间色度触发器。 [pdf]
MACAB:真实世界中利用自然触发器的模型无关干净标注目标检测后门。 [pdf]
BadDet:目标检测上的后门攻击。 [pdf]
使用逆分布对贝叶斯神经网络的后门攻击。 [pdf]
对可解释机器学习植入后门。 [pdf]
真实场景中针对车道检测系统的干净标注后门攻击。 [pdf]
危险的伪装:物理世界中基于自然触发器的目标检测器后门攻击。 [pdf]
针对基于语言的图像检索的定向特洛伊木马攻击。 [pdf]
面向视觉问答的双密钥多模态后门。 [pdf]
针对基于深度哈希检索的干净标签后门攻击。 [pdf]
通过数据投毒对网络认证的后门攻击。 [pdf]
深度回归的后门攻击与防御。 [pdf]
魔鬼藏在GAN中:保护深度生成模型免受后门攻击。 [pdf]
BAAAN:针对自编码器及基于GAN的机器学习模型的后门攻击。 [pdf]
DeepObliviate:擦除深度神经网络中数据残留记忆的强大咒语。 [pdf]
源代码神经模型中的后门。 [pdf]
基于EEG的脑机接口易受后门攻击。 [pdf]
Bias Busters:强化基于深度学习的版图热点检测器以抵御后门攻击。 [pdf]
如何以更好的一致性注入后门:在干净数据上进行Logit锚定。 [pdf]
通过验证嵌入的外部特征来防御模型窃取。 [pdf] [code]
卫星图像训练的卷积网络对后门攻击的敏感性与防御。 [link]
过剩容量与后门投毒。 [pdf]
数据投毒究竟有多毒?后门与数据投毒攻击的统一基准。 [pdf] [code]
重新思考后门攻击的触发器:频率视角。 [pdf]
物理世界中针对深度学习系统的后门攻击。 [pdf] [硕士论文]
光学木马能否辅助对抗扰动? [pdf]
论对抗鲁棒性与后门鲁棒性之间的权衡。 [pdf]
邪恶双胞胎的故事:对抗输入与被投毒模型。 [pdf] [code]
对图像分类器后门数据投毒攻击的系统评估。 [pdf]
论评估神经网络后门防御。 [pdf]
特洛伊Transformer中的注意力劫持。 [pdf]
特洛伊游戏:一种子模拜占庭方法。 [pdf]
文本后门学习的统一评估:框架与基准。 [pdf] [code]
后门攻击能否在时变模型中存活? [pdf]
在机器学习模型中植入不可检测的后门。 [pdf]