#1Tools für LLM-Sicherheit, Prompt-Injection, Modellextraktion, adversariales KI und KI-Red-Teaming.
Kitploit empfohlen

KI-Red-Teaming-Übungsplattform mit Labs zur Durchführung von KI-Red-Teaming-Schulungen, einschließlich Infrastruktur.

Forschungscode und Experimente zur Verteidigung von tool-integrierten LLM-Agenten gegen adversariale Angriffe, die das Agent Security Bench um neue…

Benchmark zur Bewertung von Sicherheitsrisiken computernutzender Agenten, mit 104 realistischen Missbrauchsszenarien in sieben bösartigen Kategorien,…

Forschungscode und Datensatz (WSD) zur Bewertung der Auswirkungen von Audio-Wasserzeichen auf Anti-Spoofing, unter Verwendung von wav2vec2 XLS-R und…

Umgehe eingeschränkte und zensierte Inhalte bei KI-Chat-Prompts 😈

3D Passive Face Liveness Detection (Anti-Spoofing) & Deepfake-Erkennung. Ein einzelnes Bild wird benötigt, um den Liveness-Score zu berechnen. 99,67…

Datenschutz-Testbibliothek für Deep-Learning-Systeme, die die Bewertung der Anfälligkeit für Membership-Inference-Angriffe, Modellextraktion und…

Ein PoC für CVE-2024-3660. Beliebige Codeausführung in Keras.

Eine Schwachstelle durch Prompt Injection mit hohem Schweregrad in Claude AI beweist, dass selbst die intelligentesten Sprachmodelle zu Waffen werden…

Proof-of-Concept-Exploit für CVE-2025-23266 (NVIDIAScape), der den NVIDIA-AI-Container-Runtime angreift. Demonstriert Container-Escape über eine…

Automatisiertes Web-Domain-Reconnaissance- und Sicherheitsbewertungstool, das Subdomain-Enumeration, Port-Scanning, Schwachstellenscan und…

Diese Studie analysiert Schwachstellen in der Deserialisierung von Python-Pickles, mit Fokus auf CVE-2024-3568 in Hugging Face Transformers'…

Forschungsdemonstration von indirekten Prompt-Injection-Angriffen zur Kontrolle autonomer LLM-basierter Web-Agenten, mit Werkzeugen zur…

PowerShell-basiertes Erkennungs- und Behebungstoolkit für CVE-2025-32711 (EchoLeak), eine kritische Zero-Click-AI-Befehlsinjektionsschwachstelle in…

Exploit für Langflow AI Remote Code Execution (Unauthenticated)

Code für das Paper Certified Unlearning for Neural Networks, ICML 2025

[CVPR 2025-ADVML] Offizielles Repository für `Attacking Attention of Foundation Models Effectively Disrupts Downstream Tasks`

Eine Sammlung realer Bedrohungsmodell-Beispiele aus verschiedenen Technologien, die praktische Einblicke in die Identifizierung und Minderung von…