Index organisé des attaques et défenses liées à la latence, à l'énergie-latence et au timing (disponibilité) en apprentissage profond — complément à la soumission à ACM Computing Surveys.
Ce dépôt est maintenu comme ressource complémentaire de l'étude « Deep Learning Latency Attacks and Defenses: A Cross-Domain Survey ». Il recense des articles, des liens vers du code, des notes de taxonomie et des figures sur les menaces d'atteinte à la disponibilité orientées latence dans les systèmes d'IA déployés.
La liste se concentre sur les attaques et les défenses qui affectent le coût au moment de l'inférence ou au niveau du système — latence, énergie, pression sur le débit et dépassements d'échéances — plutôt que sur les attaques qui ne modifient que les prédictions du modèle. Elle comprend actuellement 110 travaux (71 attaques en phase d'inférence, 13 attaques en phase d'entraînement, 26 défenses).
Recherchez et filtrez le catalogue dans le tableau interactif sur GitHub Pages.
Figure 1. Vue d'ensemble de la structure de l'étude.

Figure 2. Les attaques par latence comme menaces de disponibilité au niveau système.

Les attaques par latence sont des attaques de disponibilité : plutôt que de corrompre une prédiction, l'attaquant gonfle le temps de calcul à l'inférence, l'énergie ou la latence en temps réel d'un modèle afin qu'un consommateur temps réel (un contrôleur de véhicule, un service interactif, un capteur alimenté par batterie) manque son échéance ou épuise ses ressources — souvent alors que la prédiction elle-même reste nominalement correcte. Cela relie les systèmes d'IA déployés, les goulots d'étranglement exploités par les attaques, l'amplification du travail intermédiaire, les défaillances au niveau système et les points de contrôle des défenses.
Chaque famille d'attaques partage un mécanisme que nous appelons amplification du travail intermédiaire : l'attaquant force une étape en aval (NMS, auto-attention, décodage autorégressif, routage d'experts) à traiter davantage d'objets intermédiaires, de tokens ou d'étapes qu'une entrée bénigne n'en générerait. Comme ces étapes ont une complexité dans le pire des cas super-linéaire, une augmentation modeste du nombre produit une augmentation disproportionnée du coût. La défense inter-domaines naturelle est un budget de travail — un plafond imposé sur les objets/tokens intermédiaires par unité de temps.