
DeeCLIP
Implémentation de l'article "DeeCLIP: A Robust and Generalizable Transformer-Based Framework for Detecting AI-Generated Images"

Implémentation de l'article "DeeCLIP: A Robust and Generalizable Transformer-Based Framework for Detecting AI-Generated Images"

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

Code pour « Steering the CensorShip: Uncovering Representation Vectors for LLM "Thought" Control »

CVPR2023 : Clusters non-apprenables : vers des exemples non-apprenables agnostiques aux étiquettes

[ICLR 2026] - Dépôt officiel de l'article : "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models"

AGLS

Cadre d'attaque pour contourner les défenses contre l'injection de prompts basées sur le fine-tuning (SecAlign, SecAlign++, StruQ) en utilisant des…

Project Mantis : contre-attaquer l’IA-hackeuse ; l’injection de prompts comme défense contre les cyberattaques pilotées par les LLM

Une nouvelle attaque adverse contre les LLM basée sur la technique d'Exponentiated Gradient Descent.

Architecture d'apprentissage profond résiliente aux adversaires pour la localisation intérieure 5G sécurisée, combinant CNN et attention multi-têtes…

Démonstration de recherche sur les attaques par injection indirecte de prompts pour contrôler des agents web autonomes basés sur des LLM, avec des…

Le code pour ACM MM2024 (Exemples non désapprenables multimodaux : Protéger les données contre l'apprentissage contrastif multimodal)

StealthRL : framework de RL pour la reformulation adverse de textes d'IA afin de tester la robustesse des détecteurs.

Un cadre de diagnostic pour mesurer la vulnérabilité des LLM à l'Érosion Contextuelle Affective (ACE) et aux vecteurs d'attaque liminaux associés.…

Dépôt de code pour le projet CS5446 explorant les défenses contre les attaques de jailbreak sur les grands modèles de langage. Il comprend des…

Attribution contextuelle causale et défense de moniteur LLM basée sur des règles contre l’injection indirecte de prompts dans les agents LLM,…

Benchmark de sécurité pour évaluer les agents OpenClaw face à des contextes d'exécution adverses incluant des fichiers empoisonnés, des compétences…

Plateforme de laboratoire de sécurité IA pratique avec plus de 50 scénarios couvrant l'injection de prompts, l'exploitation de systèmes agentiques,…