
Курируемый список научных статей, обзоров и инструментальных наборов по бэкдор-обучению, систематизирующий атаки на основе отравления данных и методы защиты в глубоком обучении для исследователей и специалистов по безопасности.
Этот репозиторий Github содержит список ресурсов по Backdoor Learning. Более подробную информацию и критерии категоризации см. в нашем обзоре.
Мы будем стараться регулярно обновлять этот репозиторий Github ежемесячно.
Backdoor learning — это новая область исследований, в которой рассматриваются проблемы безопасности процесса обучения алгоритмов машинного обучения. Это критически важно для безопасного использования сторонних обучающих ресурсов или моделей на практике.
Примечание: «Backdoor» также часто называют «Neural Trojan» или «Trojan».
Если наш репозиторий или обзор окажутся полезными для вашего исследования, пожалуйста, процитируйте нашу статью следующим образом:``` @article{li2022backdoor, title={Backdoor learning: A survey}, author={Li, Yiming and Jiang, Yong and Li, Zhifeng and Xia, Shu-Tao}, journal={IEEE Transactions on Neural Networks and Learning Systems}, year={2022} }
## Вклад
<p align="center">
<img src="https://assets.kitploit.com/production/public/readmes/placeholders/f0fc86cfe65f76d40e15aaec61704ec8220a56dc89d4be03c46f67cb31b9fa8c.svg" alt="Вы нам нужны!">
</p>
Пожалуйста, помогите внести вклад в этот список, связавшись со [мной](http://liyiming.tech) или отправив [pull request](https://github.com/THUYimingLi/awesome-backdoor-learning/pulls)
Формат Markdown:```markdown
- Paper Name.
[[pdf]](link)
[[code]](link)
- Author 1, Author 2, **and** Author 3. *Conference/Journal*, Year.
Примечание: В том же году, пожалуйста, размещайте статью конференции перед статьёй журнала, поскольку журналы обычно подаются задолго до этого и поэтому имеют некоторую задержку. (т.е., Конференции-->Журналы-->Препринты)
Бэкдор-обучение: обзор. [pdf]
Бэкдор-атаки и контрмеры в глубоком обучении: всесторонний обзор. [pdf]
Безопасность данных для машинного обучения: отравление данных, бэкдор-атаки и защита. [pdf]
Всесторонний обзор атак отравлением и контрмер в машинном обучении. [ссылка]
Бэкдор-атаки и защита в федеративном обучении: современное состояние, таксономия и будущие направления. [ссылка]
Бэкдор-атаки на модели классификации изображений в глубоких нейронных сетях. [ссылка]
Защита от нейронных троянских атак: обзор. [ссылка]
Обзор нейронных троянов. [pdf]
Бэкдор-атаки на системы распознавания голоса: обзор.
Бэкдор-атаки на основе отравления в компьютерном зрении. [pdf]
Защита от бэкдор-атак на классификаторы глубоких нейронных сетей. [pdf]
К устойчивости глубокого обучения к состязательным и бэкдор-атакам. [ссылка]
К устойчивому и коммуникационно-эффективному распределённому машинному обучению. [pdf]
К устойчивой классификации изображений с помощью глубокого обучения и вывода DNN в реальном времени на мобильных устройствах. [pdf]
Контрмеры против бэкдор-атак, отравления данных и состязательных атак. [pdf]
Понимание и снижение влияния бэкдор-атак на глубокие нейронные сети. [pdf]
Несправедливый троян: целенаправленные бэкдор-атаки против справедливости моделей. [pdf]
Проверьте свою другую дверь: создание бэкдор-атак в частотной области.
Пересмотр предположения о разделимости в скрытом пространстве для защиты от бэкдоров. [pdf] [code]
Бэкдор-атаки в режиме нескольких примеров с помощью нейронных касательных ядер. [pdf] [code]
Цветовой бэкдор: устойчивая атака отравлением в цветовом пространстве. [pdf]
Ненаправленный бэкдор-водяной знак: к безвредной и скрытной защите авторских прав на наборы данных. [pdf] [code]
DEFEAT: бэкдор-атаки на глубокие скрытые признаки с помощью незаметных возмущений и ограничений на скрытые представления. [pdf]
Marksman Backdoor: бэкдор-атаки с произвольным целевым классом. [pdf]
Невидимая black-box бэкдор-атака через частотную область. [pdf] [code]
BppAttack: скрытые и эффективные троянские атаки на глубокие нейронные сети с помощью квантования изображений и контрастного состязательного обучения. [pdf] [code]
Динамические бэкдор-атаки на модели машинного обучения. [pdf]
Незаметная бэкдор-атака: от пространства входных данных к представлению признаков. [pdf] [code]
Невидимая бэкдор-атака с триггерами, специфичными для образца. [pdf] [code]
Манипулирование SGD с помощью атак на порядок данных. [pdf]
Бэкдор-атака с незаметным входом и модификацией скрытого пространства. [pdf]
LIRA: обучаемые, незаметные и устойчивые бэкдор-атаки. [pdf]
Слепые бэкдоры в моделях глубокого обучения. [pdf] [code]
Бэкдор-атаки на системы глубокого обучения в физическом мире. [pdf] [Магистерская диссертация]
Троянская атака на глубокое пространство признаков нейронных сетей с помощью контролируемой детоксикации. [pdf] [code]
WaNet — незаметная бэкдор-атака на основе деформации. [pdf]
Композитная бэкдор-атака на глубокие нейронные сети путём смешивания существующих безвредных признаков. [pdf]
Динамическая бэкдор-атака с учётом входных данных. [pdf] [код]
Обход алгоритмов обнаружения бэкдоров в глубоком обучении. [pdf]
Встраивание бэкдоров в модели свёрточных нейронных сетей с помощью невидимого возмущения. [pdf]
Бэкдор-атаки с чистыми метками на модели распознавания видео. [pdf] [код]
Уклонение от обнаружения бэкдор-атак в глубоком обучении. [ссылка]
Reflection Backdoor: естественная бэкдор-атака на глубокие нейронные сети. [pdf] [код]
«Живые» троянские атаки на глубокие нейронные сети. [pdf] [код]
Новая бэкдор-атака на CNN путём повреждения обучающего набора без отравления меток. [pdf]
Бэкдор-атаки с согласованными метками. [pdf] [код]
BadNets: выявление уязвимостей в цепочке поставок моделей машинного обучения. [pdf] [журнал]
Целенаправленные бэкдор-атаки на системы глубокого обучения с использованием отравления данных. [pdf] [код]
Созданные вручную бэкдоры в глубоких нейронных сетях. [pdf]
Едва заметная троянская атака на нейронные сети с переворотом битов. [pdf] [код]
ProFlip: целенаправленная троянская атака с прогрессивным переворотом битов. [pdf]
TBT: целенаправленная атака на нейронную сеть с битовым трояном. [pdf] [код]
Как внедрять бэкдоры с лучшей согласованностью: якорение логитов на чистых данных. [pdf]
Могут ли состязательные возмущения весов внедрять нейронные бэкдоры? [pdf]
Универсальная атака на веса посредством переворота ограниченного числа битов. [pdf]
К реалистичным атакам внедрения бэкдоров в DNN с использованием Rowhammer. [pdf]
LoneNeuron: высокоэффективный нейронный троян в пространстве признаков, использующий невидимые и полиморфные водяные знаки. [pdf]
К практической бэкдор-атаке на этапе развёртывания глубоких нейронных сетей. [pdf] [код]
Прятать иголки в стоге сена: к созданию нейронных сетей, уклоняющихся от верификации. [ссылка] [код]
Скрытный и гибкий троян в фреймворке глубокого обучения. [ссылка]
FooBaR: бэкдор-атака с обманом сбоев на обучение нейронной сети. [ссылка] [код]
DeepPayload: black-box бэкдор-атака на модели глубокого обучения посредством инъекции нейронной полезной нагрузки. [pdf]
До неприличия простой подход к троянской атаке в глубоких нейронных сетях. [pdf] [код]
BadRes: выявление бэкдоров через остаточные соединения.
ImpNet: незаметные и необнаруживаемые black-box бэкдоры в скомпилированных нейронных сетях. [pdf] [сайт] [код]
Не триггерь меня! Бэкдор-атака без триггера на глубокие нейронные сети. [pdf]
Бэкдор-атака в физическом мире. [pdf] [расширение]
DeepSweep: фреймворк для оценки смягчения бэкдор-атак на DNN с использованием аугментации данных. [pdf] [код]
Februus: защита путём очистки входных данных от троянских атак на системы глубоких нейронных сетей. [pdf] [код]
Нейронные трояны. [pdf]
Защита глубоких нейронных сетей от бэкдор-атак с помощью де-триггерного автоэнкодера. [pdf]
ConFoc: защита с фокусом на содержимое от троянских атак на нейронные сети. [pdf]
Не зависящая от модели защита от бэкдор-атак в машинном обучении. [pdf]
Очистка бэкдоров с использованием немаркированных данных. [pdf] [код]
Состязательное разучивание бэкдоров с помощью неявного гиперградиента. [pdf] [код]
Удаление бэкдоров без использования данных на основе липшицевости каналов. [pdf] [код]
Устранение бэкдор-триггеров для глубоких нейронных сетей с помощью дистилляции графа отношений внимания. [pdf]
Распределения пред-активации выявляют бэкдор-нейроны. [pdf] [код]
Состязательное прореживание нейронов очищает заражённые бэкдором глубокие модели. [pdf] [код]
Дистилляция нейронного внимания: стирание бэкдор-триггеров из глубоких нейронных сетей. [pdf] [код]
Дистилляция когнитивных бэкдор-паттернов внутри изображения. [pdf] [код]
UNICORN: унифицированный фреймворк инверсии бэкдор-триггеров. [pdf] [код]
Улучшенная оптимизация инверсии триггеров при сканировании бэкдоров. [pdf] [code]
Защита от бэкдоров в режиме few-shot с использованием оценки Шепли. [pdf]
Переосмысление обратной разработки троянских триггеров. [pdf] [code]
Одношаговое устранение нейронных бэкдоров с помощью состязательного маскирования весов. [pdf] [code]
Обнаружение сложных бэкдоров с помощью симметричной разности признаков. [pdf] [code]
Обнаружение бэкдор-атак после обучения для сценариев с двумя классами и множественными атаками. [pdf] [code]
Случайное перемешивание каналов: обнаружение бэкдор-атак с минимальными накладными расходами без чистых наборов данных. [pdf] [code]
Подход к обнаружению аномалий для нейронных сетей с бэкдорами: на примере распознавания лиц. [pdf]
Обнаружение бэкдоров в глубоких нейронных сетях на основе критических путей. [link]
Обнаружение троянов в ИИ с помощью мета-нейронного анализа. [pdf]
Топологическое обнаружение троянизированных нейронных сетей. [pdf]
Обнаружение бэкдор-атак в условиях чёрного ящика при ограниченной информации и данных.
Защита от бэкдоров путём разделения процесса обучения. [pdf] [code]
Эффективная защита от бэкдоров за счёт использования чувствительности отравленных образцов. [pdf] [code]
Trap and Replace: защита от бэкдор-атак путём заманивания их в легкозаменяемую подсеть. [pdf] [code]
Обучение с большей уверенностью: смягчение внедрённых и естественных бэкдоров во время обучения. [pdf] [code]
Anti-Backdoor Learning: обучение чистых моделей на отравленных данных. [pdf] [code]
Устойчивое обнаружение аномалий и бэкдор-атак с помощью дифференциальной приватности. [pdf] [code]
Сильная аугментация данных нейтрализует атаки отравлением и бэкдоры без ущерба для точности. [pdf]
SCALE-UP: эффективное обнаружение бэкдоров на уровне входных данных в условиях чёрного ящика путём анализа согласованности масштабированных предсказаний. [pdf] [code]
Дистилляция когнитивных бэкдор-паттернов внутри изображения. [pdf] [code]
Кластеризация несовместимости как защита от бэкдор-атак с отравлением. [pdf] [code]
Воскрешения "Beatrix'': устойчивое обнаружение бэкдоров с помощью матриц Грама. [pdf] [code]
Эффективная защита от бэкдоров за счёт использования чувствительности отравленных образцов. [pdf] [code]
К эффективной и устойчивой защите от нейронных троянов с помощью фильтрации входных данных. [pdf] [code]
Можно ли смягчить бэкдор-атаку с помощью методов состязательного обнаружения? [link]
К сертификации робастности против универсальных возмущений. [pdf] [code]
BagFlip: сертифицированная защита от отравления данных. [pdf] [code]
RAB: доказуемая робастность против бэкдор-атак. [pdf] [code]
Сертифицированная робастность ближайших соседей против отравления данных и бэкдор-атак. [pdf]
Глубокая агрегация разбиений: доказуемая защита от общих атак с отравлением [pdf] [code]
Собственная сертифицированная робастность бэггинга против атак с отравлением данных [pdf] [code]
Сертифицированная робастность к атакам с инвертированием меток с помощью рандомизированного сглаживания. [pdf]
О сертификации робастности против бэкдор-атак с помощью рандомизированного сглаживания. [pdf]
FLIP: доказуемая структура защиты для смягчения бэкдоров в федеративном обучении. [pdf] [code]
Об уязвимости защит от бэкдоров для федеративного обучения. [link] [code]
Отравление с помощью Цербера: скрытая бэкдор-атака на основе сговора против федеративного обучения. [link]
Neurotoxin: устойчивые бэкдоры в федеративном обучении. [pdf]
FLAME: укрощение бэкдоров в федеративном обучении. [pdf]
DeepSight: смягчение бэкдор-атак в федеративном обучении посредством глубокой инспекции моделей. [pdf]
Защита от атак на вывод меток и бэкдор-атак в вертикальном федеративном обучении. [pdf]
Анализ византийско-устойчивых механизмов агрегации при отравлении моделей в федеративном обучении.
Инкрементальное обучение, инкрементальные угрозы бэкдоров. [link]
Устойчивая инъекция бэкдоров с возможностью противостоять переносу сети. [link]
Атаки бэкдорами, устойчивые к дистилляции: бэкдоры действительно могут выживать при дистилляции знаний. [pdf]
Атаки бэкдорами со скрытым триггером. [pdf] [code]
Атаки отравлением весов на предварительно обученные модели. [pdf] [code]
Атаки бэкдорами против трансферного обучения с предварительно обученными моделями глубокого обучения. [pdf]
Латентные атаки бэкдорами на глубокие нейронные сети. [pdf]
Архитектурные бэкдоры в нейронных сетях. [pdf]
Доказуемая защита от политик-бэкдоров в обучении с подкреплением. [pdf] [code]
MARNet: атаки бэкдорами против кооперативного мультиагентного обучения с подкреплением. [link]
BACKDOORL: атака бэкдором против соревновательного обучения с подкреплением. [pdf]
Stop-and-Go: исследование атак бэкдорами на системы управления дорожными заторами на основе глубокого обучения с подкреплением. [pdf]
Agent Manipulator: скрытые атаки на стратегии глубокого обучения с подкреплением. [link]
TrojDRL: оценка атак бэкдорами на глубокое обучение с подкреплением. [pdf] [code]
Отравление агентов глубокого обучения с подкреплением триггерами из распределения данных. [pdf]
Атака бэкдором с временным паттерном на глубокое обучение с подкреплением. [pdf]
Атаки бэкдорами на самоконтролируемое обучение. [pdf] [code]
Отравление и внедрение бэкдоров в контрастивное обучение. [pdf]
BadEncoder: атаки бэкдорами на предварительно обученные энкодеры в самоконтролируемом обучении. [pdf] [code]
DeHiB: глубокая скрытая атака бэкдором на полуконтролируемое обучение с помощью состязательного возмущения. [pdf]
Глубокий нейронный бэкдор в полуконтролируемом обучении: угрозы и меры противодействия. [link]
Атаки бэкдорами в цепочке поставок моделирования изображений с маскированием. [pdf]
Нанесение водяных знаков на предварительно обученные энкодеры в контрастивном обучении. [pdf]
RIBAC: к устойчивой и незаметной атаке бэкдором против компактных DNN. [pdf] [code]
Qu-ANTI-zation: использование артефактов квантования для достижения состязательных результатов. [pdf] [code]
Понимание угроз троянизированных квантованных нейронных сетей в цепочках поставок моделей. [pdf]
Бэкдоры на основе квантования для моделей глубокого обучения. [pdf]
Скрытые бэкдоры как артефакты сжатия. [pdf]
TrojText: невидимая вставка текстовых троянов во время тестирования. [pdf] [code]
Защита от атак бэкдорами в генерации естественного языка. [link]
Удаление бэкдоров из предварительно обученных моделей с помощью регуляризованного непрерывного предобучения. [pdf] [code]
BadPrompt: атаки бэкдорами на непрерывные промпты. [pdf] [code]
Moderate-fitting как естественный защитник от бэкдоров для предварительно обученных языковых моделей [pdf] [code]
Унифицированная оценка обучения текстовым бэкдорам: фреймворки и бенчмарки. [pdf] [code]
Искажение языковых моделей: риски пропаганды-как-услуги и меры противодействия [pdf] [code]
Обзор нейронных троянских атак и защит в глубоком обучении. [pdf]
Угрозы предобученным языковым моделям: обзор и таксономия. [pdf]
Обзор бэкдор-атак на глубокие нейронные сети и возможных защит. [pdf]
Бэкдоры в глубоком обучении. [pdf]
Бэкдор-атаки в нейронных сетях. [ссылка]
Защита от бэкдоров. [pdf]
Геометрические свойства нейронных сетей с бэкдорами. [pdf]
Обнаружение нейронных сетей с бэкдорами с помощью структурированных состязательных атак. [pdf]
Бэкдор-атаки на системы глубокого обучения в физическом мире. [pdf]
Скрытная бэкдор-атака с состязательным обучением. [ссылка]
Невидимые и эффективные бэкдор-атаки для сжатых глубоких нейронных сетей. [ссылка]
Динамические бэкдоры с глобальным усредняющим пулингом. [pdf]
Poison Ink: устойчивая и невидимая бэкдор-атака. [pdf]
Усиление бэкдор-атак с помощью многоуровневой MMD-регуляризации. [ссылка]
PTB: устойчивые физические бэкдор-атаки на глубокие нейронные сети в реальном мире. [ссылка]
IBAttack: осторожность в отношении меток данных. [ссылка]
BlindNet Backdoor: атака на глубокую нейронную сеть с использованием слепого водяного знака. [ссылка]
Естественные бэкдор-атаки на глубокие нейронные сети через капли дождя. [ссылка]
Незаметный бэкдор-триггер на основе рассеянного возмущения пикселей для моделей классификации изображений. [pdf]
FRIB: невидимая бэкдор-атака с низким уровнем отравления на основе восстановления признаков. [pdf]
Бэкдоры с помощью аугментации. [pdf] [code]
Просто поверните: применение бэкдор-атак с помощью поворота. [pdf]
Естественные бэкдор-наборы данных. [pdf]
Усиление бэкдор-атаки с чистыми метками с помощью двухфазных специфических триггеров. [pdf]
Обход защит от бэкдоров, основанных на разделимости в скрытом пространстве. [pdf] [code]
Narcissus: практическая бэкдор-атака с чистыми метками при ограниченной информации. [pdf]
CASSOCK: жизнеспособные бэкдор-атаки на DNN в условиях специфичных для источника защит от бэкдоров. [pdf]
Обучение «троянского коня» для взлома защит от бэкдор-атак в глубоком обучении. [pdf]
Бэкдор-атака со сглаживанием меток. [pdf]
Незаметная и многоканальная бэкдор-атака на глубокие нейронные сети. [pdf]
Бэкдор-атака, устойчивая к сжатию, на глубокие нейронные сети. [pdf]
AdvDoor: состязательная бэкдор-атака на систему глубокого обучения. [pdf] [code]
Невидимый яд: black-box бэкдор-атака с чистыми метками на глубокие нейронные сети. [pdf]
Бэкдор-атака в физическом мире. [pdf] [расширение]
Бэкдор-атаки, устойчивые к защите, на глубокие нейронные сети в среде облачного аутсорсинга. [ссылка]
Бэкдоры, скрытые в чертах лица: новая невидимая бэкдор-атака на системы распознавания лиц. [ссылка]
Использование процедурного шума для осуществления бэкдор-атаки. [ссылка] [код]
Многоцелевая бэкдор-атака на глубокие нейронные сети с триггером в случайном месте. [ссылка]
Simtrojan: скрытная бэкдор-атака. [ссылка]
Метод снижения статистических различий для уклонения от обнаружения бэкдоров. [pdf]
Бэкдор-атака через частотную область. [pdf]
Проверь свою другую дверь! Создание бэкдор-атак в частотной области. [pdf]
Sleeper Agent: масштабируемые бэкдоры со скрытым триггером для нейронных сетей, обучаемых с нуля. [pdf] [код]
RABA: устойчивая бэкдор-атака на основе аватара на глубокие нейронные сети. [pdf]
Устойчивые бэкдор-атаки на глубокие нейронные сети в реальном физическом мире. [pdf]
Внедрение бэкдоров и отравление нейронных сетей атаками на масштабирование изображений. [pdf]
One-to-N и N-to-One: две продвинутые бэкдор-атаки на модели глубокого обучения. [pdf]
Невидимые бэкдор-атаки на глубокие нейронные сети с помощью стеганографии и регуляризации. [pdf] [arXiv-версия (2019)]
HaS-Nets: механизм «восстановления и отбора» для защиты DNN от бэкдор-атак в сценариях сбора данных. [pdf]
FaceHack: активация заражённых бэкдором систем распознавания лиц с использованием характеристик лица. [pdf]
Свет может взломать ваше лицо! Black-box бэкдор-атака на системы распознавания лиц. [pdf]
TrojanNet: встраивание скрытых троянских моделей в нейронную сеть. [pdf]
Внедрение бэкдоров в свёрточные нейронные сети посредством целенаправленных возмущений весов. [pdf]
Архитектурные бэкдоры в нейронных сетях. [pdf]
Внедрение необнаруживаемых бэкдоров в модели машинного обучения. [pdf]
Защита от бэкдор-атак на глубокие нейронные сети на основе интерпретируемости. [ссылка]
Boundary augment: метод аугментации данных для защиты от атак отравлением. [ссылка]
Соединение мод в ландшафтах функции потерь и состязательная устойчивость. [pdf] [код]
Fine-Pruning: защита от атак внедрения бэкдоров в глубокие нейронные сети. [pdf] [код]
Нейронные трояны. [pdf]
Адаптация остаточных блоков во время тестирования против атак отравлением и бэкдор-атак. [pdf]
Отключение бэкдора и выявление отравленных данных с помощью дистилляции знаний при бэкдор-атаках на глубокие нейронные сети. [pdf]
Защита от бэкдор-атак на глубокие нейронные сети. [pdf]
Защита от бэкдор-атак путём выявления и очистки повреждённых нейронов. [pdf]
Превращая проклятие в благословение: защита без чистых данных с помощью инверсии модели. [pdf]
Состязательная донастройка для защиты от бэкдоров: связывание состязательных примеров с триггерными образцами. [pdf]
Отмывание нейронных сетей: удаление black-box бэкдор-водяных знаков из глубоких нейронных сетей. [pdf]
HaS-Nets: механизм «восстановления и отбора» для защиты DNN от бэкдор-атак в сценариях сбора данных. [pdf]
AEVA: обнаружение бэкдоров в условиях чёрного ящика с помощью анализа экстремальных значений состязательных примеров. [pdf] [code]
Поиск триггеров с топологическим априором для обнаружения троянов. [pdf] [code]
Защита от бэкдоров с помощью машинного забывания. [pdf]
Обнаружение бэкдор-атак в условиях чёрного ящика при ограниченной информации и данных. [pdf]
Сканирование бэкдоров в глубоких нейронных сетях с помощью K-Arm-оптимизации. [pdf] [code]
Инспекция и устранение троянских бэкдоров в глубоких нейронных сетях. [pdf] [previous version] [code]
GangSweep: вычищаем нейронные бэкдоры с помощью GAN. [pdf]
Обнаружение бэкдоров в обученных классификаторах без доступа к обучающему набору. [pdf]
Neural Cleanse: выявление и смягчение бэкдор-атак в нейронных сетях. [pdf] [code]
Защита от нейронных бэкдоров с помощью генеративного моделирования распределений. [pdf] [code]
DeepInspect: фреймворк для обнаружения и смягчения троянских атак в глубоких нейронных сетях в условиях чёрного ящика. [pdf]
Выявление физически реализуемых триггеров для сетей распознавания лиц с бэкдорами. [link]
Выявление различимых бэкдоров в глубоких нейронных сетях без обучающего набора с помощью статистики максимально достижимой доли ошибочной классификации. [pdf]
Адаптивная генерация возмущений для обнаружения множественных бэкдоров. [pdf]
Уверенность имеет значение: инспекция бэкдоров в глубоких нейронных сетях с помощью переноса распределений. [pdf]
Защита от многоцелевых троянских атак. [pdf]
Контрастивное обучение моделей для защиты от бэкдоров. [pdf]
CatchBackdoor: тестирование бэкдоров путём выявления критических троянских нейронных путей с помощью дифференциального фаззинга. [pdf]
Обнаружение и удаление водяных знаков в глубоких нейронных сетях с помощью генеративно-состязательных сетей. [pdf]
TAD: обнаружение троянов в ИИ в условиях чёрного ящика на основе аппроксимации триггеров. [pdf]
Масштабируемое обнаружение бэкдоров в нейронных сетях. [pdf]
NNoculation: широкоспектральное и целевое лечение глубоких нейронных сетей с бэкдорами. [pdf] [code]
Универсальные лакмусовые паттерны: выявление бэкдор-атак в свёрточных нейронных сетях. [pdf] [code]
Сигнатура одного пикселя: характеристика моделей свёрточных нейронных сетей для обнаружения бэкдоров. [pdf]
Практическое обнаружение троянских нейронных сетей: случаи с ограниченными данными и без данных. [pdf] [code]
Обнаружение бэкдор-атак на основе различий между классами в глубоких нейронных сетях. [pdf]
Базовый подход к обнаружению троянов в нейронных сетях на основе прунинга. [pdf]
Универсальное обнаружение бэкдоров после обучения. [pdf]
Троянские сигнатуры в весах глубоких нейронных сетей. [pdf]
EX-RAY: различение внедрённых бэкдоров и естественных признаков в нейронных сетях путём анализа симметрии дифференциальных признаков. [pdf]
TOP: обнаружение бэкдоров в нейронных сетях с помощью переносимости возмущений. [pdf]
Обнаружение троянизированных глубоких нейронных сетей с помощью контрфактических атрибуций. [pdf]
Cassandra: обнаружение троянизированных сетей по состязательным возмущениям. [pdf]
Odyssey: создание, анализ и обнаружение троянских моделей. [pdf] [dataset]
Анализ реакции на шум для быстрого обнаружения бэкдоров в глубоких нейронных сетях. [pdf]
NeuronInspect: обнаружение бэкдоров в нейронных сетях с помощью объяснений выходных данных. [pdf]
Что нас не убивает, делает нас устойчивее: состязательное обучение против отравлений и бэкдоров. [pdf]
Удаление водяных знаков на основе бэкдоров в нейронных сетях с ограниченными данными. [pdf]
Mask and Restore: слепая защита от бэкдоров во время тестирования с помощью маскированного автоэнкодера. [pdf] [code]
Об эффективности состязательного обучения против бэкдор-атак. [pdf]
Возрождение доверия к распознаванию лиц: смягчение бэкдор-атак в системах распознавания лиц для предотвращения потенциальных нарушений конфиденциальности. [pdf]
SanitAIs: неконтролируемая аугментация данных для санации троянизированных нейронных сетей. [pdf]
Об эффективности смягчения атак отравлением данных с помощью формирования градиентов. [pdf] [code]
DP-InstaHide: доказуемое обезвреживание атак отравлением и бэкдоров с помощью дифференциально-приватной аугментации данных. [pdf]
LinkBreaker: разрыв связи между бэкдором и триггером в глубоких нейронных сетях с помощью проверки согласованности нейронов. [link]
Защита целостности систем глубокого обучения на основе подобия. [link]
Онлайн-детектор на основе признаков для удаления состязательных бэкдоров путём итеративной демаркации. [pdf]
Переосмысление триггеров бэкдор-атак: частотная перспектива. [pdf] [code]
Демон в варианте: статистический анализ глубоких нейронных сетей для устойчивого обнаружения бэкдор-заражения. [pdf] [code]
CLEANN: ускоренная защита от троянов для встроенных нейронных сетей. [pdf]
Робастное обнаружение аномалий и обнаружение бэкдор-атак с помощью дифференциальной конфиденциальности. [pdf] [code]
Простая, не зависящая от типа атаки защита от целевых атак на обучающий набор с использованием косинусного сходства. [pdf] [code]
SentiNet: обнаружение локализованных универсальных атак на системы глубокого обучения. [pdf]
STRIP: защита от троянских атак на глубокие нейронные сети. [pdf] [extension] [code]
Обнаружение бэкдор-атак на глубокие нейронные сети с помощью кластеризации активаций. [pdf] [code]
Глубокие вероятностные модели для обнаружения атак с отравлением данных. [pdf]
Спектральные сигнатуры в бэкдор-атаках. [pdf] [code]
Адаптивная black-box защита от троянских атак (TrojDef). [pdf]
Бороться с ядом ядом: обнаружение отравленных бэкдор-выборок путём развязывания безвредных корреляций. [pdf] [code]
PiDAn: подход на основе оптимизации когерентности для обнаружения и смягчения бэкдор-атак в глубоких нейронных сетях. [pdf]
Анализ и смягчение троянов в нейронных сетях на основе входного пространства. [pdf]
Общая структура защиты от бэкдор-атак с использованием графа влияния. [pdf]
NTD: обнаружение бэкдоров на основе отсутствия переносимости. [pdf]
Единая структура для управления качеством данных на основе задач. [pdf]
TESDA: статистическое обнаружение атак в глубоких нейронных сетях на основе преобразований. [pdf]
Прослеживание атак с отравлением данных в нейронных сетях. [pdf]
Доказуемые гарантии против отравления данных с использованием саморасширения и совместимости. [pdf]
Онлайн-защита троянизированных моделей с использованием неверных атрибуций. [pdf]
Обнаружение бэкдоров в глубоких нейронных сетях с помощью намеренных состязательных возмущений. [pdf]
Выявление бэкдоров в робастных моделях машинного обучения. [pdf]
HaS-Nets: механизм «исцеления и отбора» для защиты DNN от бэкдор-атак в сценариях сбора данных. [pdf]
Яд как лекарство: обнаружение и нейтрализация бэкдор-атак переменного размера в глубоких нейронных сетях. [pdf]
BagFlip: сертифицированная защита от отравления данных. [pdf]
Против бэкдор-атак в федеративном обучении с дифференциальной конфиденциальностью. [link]
Безопасная частичная агрегация: повышение робастности федеративного обучения для приложений Индустрии 4.0. [link]
Устойчивая к бэкдор-атакам агрегация на основе робастной фильтрации выбросов в федеративном обучении для классификации изображений. [link]
Защита от бэкдор-атак в федеративном обучении. [link] [code]
Федеративное обучение с усиленной конфиденциальностью против отравляющих противников. [link]
Скоординированные бэкдор-атаки на федеративное обучение с триггерами, зависящими от модели. [link]
CRFL: сертифицируемо робастное федеративное обучение против бэкдор-атак. [pdf]
Проклятие или искупление? Как неоднородность данных влияет на робастность федеративного обучения. [pdf]
Защита от бэкдоров в федеративном обучении с робастной скоростью обучения. [pdf]
BaFFLe: обнаружение бэкдоров посредством федеративного обучения на основе обратной связи. [pdf]
PipAttack: отравление федеративных рекомендательных систем для манипулирования продвижением товаров. [pdf]
Смягчение бэкдор-атаки с помощью федеративных фильтров для приложений промышленного Интернета вещей. [link]
Анализ на основе стабильности и защита от бэкдор-атак в сервисах граничных вычислений. [link]
Атака хвостов: да, вы действительно можете внедрить бэкдор в федеративное обучение. [pdf]
DBA: распределённые бэкдор-атаки на федеративное обучение. [pdf]
Ограничения федеративного обучения в условиях сибил-атак. [pdf] [extension] [code]
Как внедрить бэкдор в федеративное обучение. [pdf]
BEAS: асинхронное и безопасное федеративное машинное обучение на основе блокчейна. [pdf]
Бэкдор-атаки и защиты в коллаборативном обучении с разделением признаков. [pdf]
Можно ли действительно внедрить бэкдор в федеративное обучение? [pdf]
Инвариантный агрегатор для защиты от бэкдор-атак в федеративном обучении. [pdf]
Экранирование федеративного обучения: смягчение византийских атак с меньшим количеством ограничений. [pdf]
Федеративное zero-shot обучение для визуального распознавания. [pdf]
Содействие бэкдор-федеративному обучению с помощью согласования знаний всей совокупности. [pdf]
FL-Defender: борьба с целевыми атаками в федеративном обучении. [pdf]
Бэкдор-атака — это дьявол в федеративном синтезе медицинских изображений на основе GAN. [pdf]
SafeNet: смягчение атак с отравлением данных в приватном машинном обучении. [pdf] [code]
PerDoor: устойчивые неравномерные бэкдоры в федеративном обучении с использованием состязательных возмущений. [pdf] [code]
К защите от бэкдор-атак в непрерывном федеративном обучении. [pdf]
Целевой бэкдор на уровне клиентов в федеративном обучении. [pdf]
Защита от бэкдоров в федеративном обучении с использованием дифференциального тестирования и обнаружения выбросов. [pdf]
ARIBA: к точной и робастной идентификации бэкдор-атак в федеративном обучении. [pdf]
Больше — лучше (в основном): о бэкдор-атаках в федеративных графовых нейронных сетях. [pdf]
Сжатие подпространства с малыми потерями для чистых выигрышей против многоагентных бэкдор-атак. [pdf]
Бэкдоры, застрявшие у парадного входа: многоагентные бэкдор-атаки, дающие обратный эффект. [pdf]
Федеративное разобучение с дистилляцией знаний. [pdf]
Атаки с переносом моделей на бэкдор-гиперсеть в персонализированном федеративном обучении. [pdf]
Бэкдор-атаки на федеративное обучение с использованием гипотезы лотерейных билетов. [pdf]
О доказуемой защите от бэкдоров в коллаборативном обучении. [pdf]
SparseFed: смягчение атак с отравлением моделей в федеративном обучении с помощью разреживания. [pdf]
Робастное федеративное обучение с адаптивной к атакам агрегацией. [pdf] [code]
Мета-федеративное обучение. [pdf]
FLGUARD: безопасное и приватное федеративное обучение. [pdf]
Атаки бэкдорами на федеративное мета-обучение. [pdf]
Динамические атаки бэкдорами против федеративного обучения. [pdf]
Федеративное обучение в состязательных условиях. [pdf]
BlockFLA: подотчётное федеративное обучение на основе гибридной архитектуры блокчейна. [pdf]
Смягчение атак бэкдорами в федеративном обучении. [pdf]
Обучение обнаружению вредоносных клиентов для устойчивого федеративного обучения. [pdf]
Устойчивое к атакам федеративное обучение с перевзвешиванием на основе остатков. [pdf] [code]
Красная тревога для предварительно обученных моделей: универсальные уязвимости при атаках бэкдорами на уровне нейронов. [pdf] [code]
Обнаружение бэкдоров в обучении с подкреплением. [pdf]
Проектирование преднамеренных бэкдоров в последовательных моделях. [pdf]
PICCOLO: выявление сложных бэкдоров в NLP-моделях на основе Transformer. [pdf] [code]
Атака бэкдором без триггера для NLP-задач с чистыми метками. [pdf]
Исследование аномалий внимания в троянизированных BERT. [pdf] [code]
Триггеры, открывающие бэкдоры NLP-моделей, скрыты в состязательных примерах. [link]
BDDR: эффективная защита от текстовых атак бэкдорами. [pdf]
BadPre: атаки бэкдорами, не зависящие от задачи, на предварительно обученные фундаментальные NLP-модели. [pdf]
Исследование универсальной уязвимости парадигмы обучения на основе промптов. [pdf] [code]
Предварительно обученные модели с бэкдорами могут переноситься на все. [pdf]
BadNL: атаки бэкдорами на NLP-модели с улучшениями, сохраняющими семантику. [pdf] [arXiv-20]
Атаки бэкдорами на предварительно обученные модели посредством послойного отравления весов. [pdf]
T-Miner: генеративный подход к защите от троянских атак на классификацию текста на основе DNN. [pdf]
RAP: возмущения с учётом устойчивости для защиты от атак бэкдорами на NLP-модели. [pdf] [code]
ONION: простая и эффективная защита от текстовых атак бэкдорами. [pdf]
Следите за стилем текста! Состязательные атаки и атаки бэкдорами на основе переноса стиля текста. [pdf] [code]
Переосмысление скрытности атак бэкдорами против NLP-моделей. [pdf] [code]
Поверните кодовый замок: обучаемые текстовые атаки бэкдорами с помощью подстановки слов. [pdf]
Hidden Killer: невидимые текстовые атаки бэкдорами с синтаксическим триггером. [pdf] [code]
Смягчение отравления данных в классификации текста с помощью дифференциальной конфиденциальности. [pdf]
BFClass: фреймворк классификации текста без бэкдоров. [pdf] [code]
Остерегайтесь отравленных эмбеддингов слов: исследование уязвимости слоёв эмбеддингов в NLP-моделях. [pdf] [code]
Хирургия нейронных сетей: внедрение паттернов данных в предварительно обученные модели с минимальными побочными эффектами на уровне отдельных экземпляров. [pdf]
Обнаружение текстовых бэкдоров с помощью интерпретируемой абстрактной модели RNN. [link]
Текстовая атака бэкдором для системы классификации текста. [pdf]
Атаки отравлением весов на предварительно обученные модели. [pdf] [code]
Атаки отравлением на текстовые датасеты с помощью условного состязательно регуляризованного автоэнкодера. [pdf]
Атака бэкдором против систем классификации текста на основе LSTM. [pdf]
PerD: фреймворк обнаружения нейронных троянов на основе чувствительности к возмущениям для NLP-приложений. [pdf]