
ZoneClaw-code
Code de benchmark et de défense contre les attaques de mémoire persistante sur les agents d'utilisation informatique de style OpenClaw, avec…

Code de benchmark et de défense contre les attaques de mémoire persistante sur les agents d'utilisation informatique de style OpenClaw, avec…

Un benchmark de cycle de vie pour les attaques d'extraction de LLM en boîte noire, les défenses et les attaques adaptatives.

Le refus se localise, le dommage se déplace, les couches de sécurité sous un fine-tuning à quelques échantillons

Code de recherche pour HARDE, un harnais d'agent qui sonde et optimise de manière adaptative les composants pour la détection des risques à…

Harnais de benchmark mesurant où les défenses contre l'injection de prompt se déclenchent dans les pipelines d'agents LLM utilisant des outils, en…

Analyseur de code statique basé sur l'AST avec cartographie relationnelle agentique alimentée par LLM pour découvrir les chemins RCE Python et les…

Index organisé des attaques et défenses liées à la latence, à l'énergie-latence et au timing (disponibilité) en apprentissage profond — complément à…

LLM à poids ouverts et code d'entraînement/évaluation pour se défendre contre les attaques par injection de prompt, avec des benchmarks pour la…

Banc d'essai et harnais d'évaluation testant si les agents LLM résistent aux instructions malveillantes cachées dans des images de compétences…

Framework de jailbreak agentique pour les agents basés sur des LLM utilisant la décomposition de tâches basée sur des schémas, des stratégies de…

Framework évolutionniste de jailbreak et de garde-fous pour LLM qui développe un pool de stratégies réutilisables via mutation génétique, sélection…

Framework ouvert pour le red teaming d'injection de prompts basé sur le RL, avec un entraîneur partagé, un apprentissage par curriculum et des…

Next-generation JavaScript identifier recovery with LLMs.

Outil de perturbation d'images adversariales qui utilise la segmentation SAM et les modèles CLIP pour contourner les classificateurs d'images…

Defense framework that keeps audio-language models frozen and adds a mid-layer risk gate with late-layer safety adapters to block audio jailbreaks at…

Benchmark suite and code for detecting AI alignment failures, with 44 benchmarks across ten failure types and a zero-shot RLCD detector evaluated on…

Détection de malwares 0-day pour les binaires, le code source et les scripts (qui ne craint pas)

Proxy DNS simple et rapide avec des fonctionnalités pas si simples. Axé sur le transfert DNS routé, le filtrage et le contrôle parental.