
ZoneClaw-code
Code de benchmark et de défense contre les attaques de mémoire persistante sur les agents d'utilisation informatique de style OpenClaw, avec…

Code de benchmark et de défense contre les attaques de mémoire persistante sur les agents d'utilisation informatique de style OpenClaw, avec…

Un benchmark de cycle de vie pour les attaques d'extraction de LLM en boîte noire, les défenses et les attaques adaptatives.

Le refus se localise, le dommage se déplace, les couches de sécurité sous un fine-tuning à quelques échantillons

Harnais de benchmark mesurant où les défenses contre l'injection de prompt se déclenchent dans les pipelines d'agents LLM utilisant des outils, en…

Index organisé des attaques et défenses liées à la latence, à l'énergie-latence et au timing (disponibilité) en apprentissage profond — complément à…

LLM à poids ouverts et code d'entraînement/évaluation pour se défendre contre les attaques par injection de prompt, avec des benchmarks pour la…

Banc d'essai et harnais d'évaluation testant si les agents LLM résistent aux instructions malveillantes cachées dans des images de compétences…

Framework de jailbreak agentique pour les agents basés sur des LLM utilisant la décomposition de tâches basée sur des schémas, des stratégies de…

Framework évolutionniste de jailbreak et de garde-fous pour LLM qui développe un pool de stratégies réutilisables via mutation génétique, sélection…

Framework ouvert pour le red teaming d'injection de prompts basé sur le RL, avec un entraîneur partagé, un apprentissage par curriculum et des…

Plateforme d'émulation d'adversaire basée sur le Web qui orchestre les tests Atomic Red Team sur les points de terminaison Windows via des agents Go,…

Collection organisée de prompts de jailbreak LLM et de techniques de contournement, documentant les entrées adverses qui contournent les garde-fous…

Outil de perturbation d'images adversariales qui utilise la segmentation SAM et les modèles CLIP pour contourner les classificateurs d'images…

Guide de construction pour un home lab de Red Teaming. Mise en place du lab GOAD dans Proxmox et pfSense, Operator/C2 et Redirectors.

Émulation automatisée d'adversaire (Caldera) contre un lab AD afin de valider la couverture de détection Sigma et de mapper les résultats à MITRE…

Suivi des techniques d'injection de prompt signalées publiquement, classées par méthode de livraison, encodage et comportement de propagation, avec…

Defense framework that keeps audio-language models frozen and adds a mid-layer risk gate with late-layer safety adapters to block audio jailbreaks at…

Génère des pages de contrebande HTML qui intègrent et reconstruisent des fichiers côté client via JavaScript, avec encodage de charge utile,…