
ODPure
Défense de purification en entrée en boîte noire qui neutralise les attaques par porte dérobée sur les détecteurs d'objets via corruption,…

Défense de purification en entrée en boîte noire qui neutralise les attaques par porte dérobée sur les détecteurs d'objets via corruption,…

Benchmarking des détections d'injection de prompt pour les agents web.

Recherche de code et expériences pour défendre les agents LLM intégrés à des outils contre les attaques adversariales, en étendant Agent Security…

Code de recherche reproduisant les expériences de jailbreak multi-tours sur les LLM (FITD, MRCJ, ActorAttack, X-Teaming) issues de l'article de…

The exploit server for out-of-band findings. Point a target at a domain you own. Every HTTP request and every email it sends back lands in a…

Une base de connaissances structurée couvrant les fondamentaux de la sécurité de l'IA, la modélisation des menaces, les techniques offensives de red…

Cadre de recherche évolutionnaire sensible à la trajectoire pour le red-teaming d’agents LLM sur des serveurs MCP, générant des invites adversariales…

Framework d’attaque en boîte noire qui détourne le raisonnement des systèmes de génération augmentée par récupération agentiques en injectant des…

Implémentation de recherche d’une attaque par empoisonnement contre les modèles de langage à récupération augmentée, utilisant des documents…

Benchmark pour évaluer la sécurité des agents IA face à des attaques intégrées dans le contexte orienté compétences, avec 155 cas répartis sur 6…

Bypass llm guardrails by confusing it with fabricated tool output.

Implémentation de recherche pour l'atténuation des injections de prompt adaptatives via la distillation on-policy, avec des recettes d'entraînement…

Portage en Crystal de GodPotato pour abuser du privilège SeImpersonatePrivilege avec des syscalls indirects, résolution dynamique d'API et…

Bibliothèque Python pour la sécurité de l'apprentissage automatique adversarial, permettant aux équipes rouge et bleue d'exécuter des attaques et des…

Une bibliothèque d'exemples adverses pour construire des attaques, élaborer des défenses et évaluer les deux.

Une boîte à outils Python pour créer des exemples adversariaux qui trompent les réseaux de neurones dans PyTorch, TensorFlow et JAX.

Protection contre les attaques de sérialisation de modèles

Algorithmes de détection des valeurs aberrantes, des échantillons adverses et de la dérive