NCSC Guidelines for Secure AI System Development - Praktische Leitlinien, verfasst von NCSC (UK) und CISA, für die sichere KI-Entwicklung – von Design und Entwicklung über Bereitstellung bis hin zum Betrieb.
Kurse, Labs & CTFs
Damn Vulnerable MCP Server - Eine absichtlich verwundbare Implementierung des Model Context Protocol (MCP) für Bildungszwecke.
otto-support - Eine verwundbare MCP-Server-Implementierung auf Basis von mcp-go mit abgestufter Authentifizierung (4 Rollen), 19 Tools und integriertem Sandbox-Container mit Claude Code zum Üben von Privilege Escalation und Tool-Missbrauch.
vulnerable-mcp-servers-lab - Eine Sammlung von Servern, die absichtlich verwundbar sind, um Pentesting von MCP-Servern zu lernen.
FinBot Agentic AI Capture The Flag (CTF) Application - FinBot ist eine interaktive Agentic-Security-Capture-The-Flag-Plattform (CTF), die reale Schwachstellen in agentischen KI-Systemen anhand einer simulierten, auf Finanzdienstleistungen ausgerichteten Anwendung simuliert.
AI-Red-Teaming-Playground-Labs - AI-Red-Teaming-Übungslabore zur Durchführung von AI-Red-Teaming-Schulungen inklusive Infrastruktur.
Damn Vulnerable LLM Agent - Absichtlich verwundbarer LLM-Agent zum Lernen von Prompt Injection, Tool-Missbrauch und Agentensicherheit
LLMVault - Ein Open-Source-LLM-Sicherheitslabor im CTF-Stil zum Erlernen der OWASP LLM Top 10 durch praktische Übungen an verwundbaren Systemen – abgedeckt werden Prompt Injection, RAG-Angriffe, System-Prompt-Leaks, Tool-Missbrauch und Agentensicherheit.
AI Security Ops - Wöchentliche Podcasts von Black Hills Information Security, die untersuchen, wie KI die Cybersicherheit verändert – mit aufkommenden Bedrohungen, Tools und Trends sowie praktischem, umsetzbarem Wissen.
AI Verify - Von der Regierung Singapurs unterstütztes KI-Testframework und Toolkit zur Verifizierung von KI-Systemeigenschaften gegenüber Governance-Frameworks.
Taxonomien, Terminologie & Risikodatenbanken
NIST AI 100-2e2023 - Taxonomie und Terminologie des Adversarial Machine Learning
ATLAS Knowledge Base Agent - Open-Source-KI-Assistent zur Erkundung der ATLAS-Wissensdatenbank mit natürlicher Sprache, MCP-Serverzugriff und anpassbaren Agenten-Workflows.
The Arcanum Prompt Injection Taxonomy - Umfassendes Klassifikationssystem für Prompt-Injection-Angriffe, das Angriffsabsichten, Techniken, Umgehungen und Eingabevektoren abdeckt. Kategorisiert Ziele, Methoden, Verschleierungstechniken und Angriffsflächen für Prompt-Injection-Angriffe.
Adversarial Robustness Toolkit - ART konzentriert sich auf die Bedrohungen Evasion (Veränderung des Modellverhaltens durch Eingabemodifikationen), Poisoning (Kontrolle eines Modells durch Trainingsdatenmodifikationen), Extraction (Stehlen eines Modells durch Abfragen) und Inference (Angriff auf die Privatsphäre der Trainingsdaten)
cleverhans - Eine Bibliothek für adversarial examples zum Erstellen von Angriffen, Aufbau von Abwehrmaßnahmen und Benchmarking beider
foolbox - Eine Python-Toolbox zum Erstellen adversarialer Beispiele, die neuronale Netze in PyTorch, TensorFlow und JAX täuschen
TextAttack - Ein Python-Framework für Adversarial Attacks, Data Augmentation und Modelltraining in NLP
Counterfit - generische Automatisierungsschicht zur Bewertung der Sicherheit von maschinellen Lernsystemen
OffsecML Playbook - Eine Sammlung offensiver und adversarischer TTPs mit Proofs of Concept
BadDiffusion - Offizielles Repository zur Reproduktion des Papers „How to Backdoor Diffusion Models?“, veröffentlicht auf der CVPR 2023
secml-torch - SecML-Torch: Eine Bibliothek zur Robustheitsbewertung von Deep-Learning-Modellen
ai-scanner - Open-Source-Webanwendung für KI-Modell-Sicherheitsbewertungen, basierend auf NVIDIA garak. Bietet 179 Probes, Multi-Target-Scans, geplante Scans, ASR-Bewertung und SIEM-Integration.
promptfoo - Teste deine Prompts, Agenten und RAGs. Red Teaming, Pentesting und Schwachstellenscanning für LLMs. Vergleiche die Leistung von GPT, Claude, Gemini, Llama und mehr. Einfache deklarative Konfigurationen mit CLI- und CI/CD-Integration.
PyRIT - Das Python Risk Identification Tool für generative KI (PyRIT) ist ein Open-Source-Framework, das Sicherheitsprofis und Ingenieure dabei unterstützt, Risiken in generativen KI-Systemen proaktiv zu identifizieren.
PurpleLlama - Werkzeugsammlung zur Bewertung und Verbesserung der LLM-Sicherheit.
augustus - LLM-Sicherheitstest-Framework zur Erkennung von Prompt Injection, Jailbreaks und Adversarial Attacks. 190+ Probes, 28 Provider, einzelnes Go-Binary. Produktionsreif mit nebenläufigem Scannen, Rate Limiting und Retry-Logik.
FuzzyAI - Ein leistungsstarkes Tool für automatisiertes LLM-Fuzzing. Es hilft Entwicklern und Sicherheitsforschern, potenzielle Jailbreaks in ihren LLM-APIs zu identifizieren und zu entschärfen.
EasyJailbreak - Ein benutzerfreundliches Python-Framework zur Erzeugung adversarialer Jailbreak-Prompts.
gptfuzz - Offizielles Repository für GPTFUZZER: Red Teaming von Large Language Models mit automatisch generierten Jailbreak-Prompts
llamator - Framework zum Testen von Schwachstellen großer Sprachmodelle (LLM).
EasyEdit - Modifiziere die Ground Truths eines LLMs
llm-attacks - Universelle und übertragbare Angriffe auf alignierte Sprachmodelle
llm-security - Neue Wege, app-integrierte LLMs zu brechen
Plexiglass - Ein Toolkit zur Erkennung von und zum Schutz vor Schwachstellen in Large Language Models (LLMs).
Prompt Hacking Resources - Eine Liste kuratierter Ressourcen für alle, die sich für AI Red Teaming, Jailbreaking und Prompt Injection interessieren
Giskard - Open-Source-Evaluierung & -Test für KI- & LLM-Systeme
blackice - BlackIce ist ein Open-Source-Container-Toolkit für das Red Teaming von KI-Modellen, einschließlich Large Language Models (LLMs) und klassischer Machine-Learning-Modelle (ML). Inspiriert von der Bequemlichkeit und Standardisierung von Kali Linux im traditionellen Penetrationstest vereinfacht BlackIce KI-Sicherheitsbewertungen durch ein reproduzierbares Container-Image, das mit speziellen Bewertungswerkzeugen vorkonfiguriert ist.
ai-best-practices - Semgrep-Pro-Regeln, um sicherzustellen, dass Code mit LLMs Best Practices folgt. 58 Regeln, 102 Unterregeln für 6 Provider + MCP + Claude Code- & Cursor-Hooks + LangChain. Erkennt hartcodierte API-Schlüssel, Prompt-Injection-Risiken, fehlende Sicherheitsprüfungen und unbehandelte Fehler in 7 Sprachen.
G0DM0D3 - Open-Source-Multi-Modell-Chat-Interface für Red Teaming mit über 50 Modellen via OpenRouter. Bietet GODMODE CLASSIC (5 Jailbreak-Kombos), ULTRAPLINIAN Multi-Modell-Evaluierung, die Parseltongue-Eingabe-Perturbation-Engine mit 33 Red-Team-Techniken und AutoTune-adaptives Sampling für KI-Sicherheitsforschung.
L1B3RT4S - Sammlung von Jailbreak- und Befreiungs-Prompts für große LLMs. Kuratierte Bibliothek adversarialer Prompts zum Testen und Bewerten von KI-Sicherheitsvorkehrungen bei ChatGPT, Claude, Gemini und anderen Frontier-Modellen.
OBLITERATUS - Abliterations-Toolkit, das Verweigerungsverhalten aus Open-Source-LLMs ohne erneutes Training entfernt. Modifiziert Modellgewichte, um sicherheitskonforme Verweigerungsantworten zu eliminieren und ermöglicht so uneingeschränkte Forschung zum Modellverhalten.
T3MP3ST - Autonome Red-Teaming-Plattform und Multi-Agenten-Meta-Harness für offensive Sicherheit. Koordiniert Schwärme von KI-Agenten für koordinierte Adversarial-Tests von Frontier-KI-Systemen.
P4RS3LT0NGV3 - Universelles Toolkit für Texttransformation und Promptcrafting. Unterstützt Übersetzung, Mutation, Kodierung/Dekodierung und adversariales Prompt Engineering für den Bau von Jailbreak-Payloads.
claude-secure-coding-rules - Open-Source-Sicherheitsregeln, die Claude Code dazu anleiten, standardmäßig sicheren Code zu erzeugen.
DeepTeam - LLM-Red-Teaming-Framework mit über 40 Angriffsmethoden, darunter Prompt Injection, Jailbreaking und RAG-Poisoning. Integriert sich in CI/CD-Pipelines.
Agentische KI & MCP-Angriffswerkzeuge
RAMPART - pytest-natives Safety- und Security-Testframework für agentische KI-Anwendungen.
AI-Infra-Guard - Eine umfassende, intelligente und einfach zu bedienende AI-Red-Teaming-Plattform, entwickelt vom Tencent Zhuque Lab. Integriert Module für Infra Scan, MCP Scan und Jailbreak-Evaluierung und bietet eine One-Click-Web-UI, REST-APIs sowie Docker-basierte Bereitstellung für eine umfassende KI-Sicherheitsbewertung.
OpenPromptInjection - Ein Benchmark für Prompt-Injection-Angriffe und -Abwehrmaßnahmen
AIMap - Plattform für Discovery und Sicherheitstests im Internet-Maßstab für exponierte KI-Agenten-Infrastruktur. Fragt Shodan nach MCP-Servern, Ollama-Instanzen, vLLM/LiteLLM-Proxys und mehr ab – und erstellt dann Fingerprints, bewertet Risiken und startet protokollspezifische Angriffssuiten mit Echtzeit-Streaming-Ergebnissen.### KI-gestützte offensive Sicherheit
PentestGPT - Ein GPT-gestütztes Penetrationstest-Tool
HackingBuddyGPT - Hilft ethischen Hackern, LLMs in 50 Codezeilen oder weniger zu nutzen
cai - Cybersecurity AI (CAI), eine offene, Bug-Bounty-taugliche künstliche Intelligenz (Paper)
shannon - Vollautonomer KI-Pentester für Webanwendungen und APIs von Keygraph. White-Box-Sicherheitstests, die Quellcode analysieren, Angriffsvektoren identifizieren und echte Exploits ausführen. 96,15 % Erfolgsrate (100/104 Exploits) im XBOW-Benchmark.
strix - Strix sind autonome KI-Agenten, die sich wie echte Hacker verhalten – sie führen deinen Code dynamisch aus, finden Schwachstellen und validieren sie durch echte Proof-of-Concepts
redamon - KI-gestütztes agentisches Red-Team-Framework, das offensive Sicherheitsoperationen von der Aufklärung über die Ausnutzung bis zur Post-Exploitation ohne menschliches Eingreifen automatisiert.
CyberStrikeAI - KI-native Sicherheitstestplattform in Go. Integriert über 100 Sicherheitstools mit einer intelligenten Orchestrierungs-Engine, rollenbasierte Tests mit vordefinierten Sicherheitsrollen, Skill-System und umfassendes Lebenszyklusmanagement. Nutzt das MCP-Protokoll und KI-Agenten für durchgängige Automatisierung von Konversationsbefehlen bis zur Schwachstellenerkennung.
HexStrikeAI - HexStrike AI MCP Agents ist ein fortschrittlicher MCP-Server, der KI-Agenten (Claude, GPT, Copilot usw.) ermöglicht, autonom über 150 Cybersicherheitstools für automatisiertes Pentesting, Schwachstellenerkennung, Bug-Bounty-Automatisierung und Sicherheitsforschung auszuführen.
mcp-for-security - Eine Sammlung von Model-Context-Protocol-Servern für beliebte Sicherheitstools wie SQLMap, FFUF, NMAP, Masscan und weitere. Integriert Sicherheits- und Penetrationstests in KI-Workflows.
mcp-security-hub - Eine wachsende Sammlung von MCP-Servern, die offensive Sicherheitstools zu KI-Assistenten bringt. Nmap, Ghidra, Nuclei, SQLMap, Hashcat und mehr.
burpgpt - Eine Burp-Suite-Erweiterung, die OpenAIs GPT integriert, um einen zusätzlichen passiven Scan zur Erkennung hochspezifischer Schwachstellen durchzuführen und verkehrsbasierte Analysen jeder Art zu ermöglichen.
guardian-cli - KI-gestützter Sicherheitstest- und Schwachstellenscanner. Guardian CLI ist ein intelligentes Sicherheitstesttool, das KI nutzt, um Penetrationstests, Schwachstellenbewertung und Sicherheitsaudits zu automatisieren.
AutoPentestX - AutoPentestX – Automatisiertes Linux-Pentesting- und Schwachstellenbericht-Tool
nano-analyzer - Ein minimaler, LLM-gestützter Zero-Day-Schwachstellenscanner von AISLE.
clearwing - Autonomer Schwachstellenscanner und Source-Code-Sucher auf Basis von LangGraph.
Zen-AI-Pentest - KI-gestütztes Penetrationstest-Framework mit automatisiertem Schwachstellenscan, Multi-Agenten-System und Compliance-Berichterstattung. Über 72 Sicherheitstools, Docker-Sandbox, ReAct-Agenten, Angriffspfadanalyse.
Violin - Überwachtes, agentisches Hermes-Agent-Pentestprofil: 31 fähigkeitsbasierte Playbooks (OWASP Top 10, API Top 10, LLM Top 10) mit interaktivem Scoping, Scope-Validierung und Genehmigungsstufen für autorisierte Aufklärung, Exploit-Validierung und Berichterstattung.
NeuroSploit - Autonome Multi-Modell-Pentesting-Umgebung in Rust. Ein LLM-Pool steuert Aufklärung, Agentenauswahl, Exploit-Verkettung und modellübergreifende Validierungsabstimmung über Black-Box-, White-Box-, Grey-Box- und Cloud-Einsatzmodi.
OpenHack - KI-gestützter Multi-Agenten-Scanner, der autonom SQLi, XSS, IDOR und Auth-Bypass in deiner Codebasis findet und anschließend jeden Befund durch Sandbox-Ausführung und Browser-Replay verifiziert. Auf Augenhöhe mit Claude Opus 4.6 bei etwa 40-fach geringeren Kosten.
PentAGI - Vollautonomes Multi-Agenten-System für komplexe Penetrationstest-Aufgaben. Sandbox-Docker-Ausführung, Multi-Provider-LLM-Unterstützung (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), Wissensgraphen-Integration und Echtzeit-Agentenüberwachung.
V3SP3R - KI-gestützter Hardware-Hacking-Begleiter für das Flipper Zero. Natürliche Sprachschnittstelle zur Steuerung von Hardware-Angriffen, mit Smart-Glasses-Integration für den freihändigen Betrieb.
Steganografie & verdeckte Kanäle
ST3GG - All-in-One-Steganografie-Suite mit mehrschichtiger Kodierung, Bild- und Audio-Steganografie sowie Steganalyse-Tools zur Erkennung versteckter Daten in KI-generierten Medien.
Benchmarks & Evaluierungen
ISC-Bench - Internal Safety Collapse: bricht jedes Frontier-LLM (Claude Opus 4.6, GPT-5.4) in pass@3 über normale Aufgabenausführung aus – ohne adversariale Aufforderungen. Black-Box, domänenübergreifend, wissenschaftsübergreifend. Neuartiger Ausfallmodus.[Paper]
jailbreakbench - JailbreakBench: Ein offener Robustheits-Benchmark für das Jailbreaking von Sprachmodellen [NeurIPS 2024 Datasets and Benchmarks Track]
AgentDojo - Eine dynamische Umgebung zur Bewertung von Angriffen und Verteidigungen für LLM-Agenten.
AIRTBench - Code-Repository für: AIRTBench: Messung autonomer KI-Red-Teaming-Fähigkeiten in Sprachmodellen
AgentDoG - AgentDoG ist ein risikobewusstes Bewertungs- und Schutzframework für autonome Agenten. Es konzentriert sich auf die Risikobewertung auf Trajektorienebene und zielt darauf ab, festzustellen, ob die Ausführungstrajektorie eines Agenten unter verschiedenen Anwendungsszenarien Sicherheitsrisiken enthält.
AICGSecEval - Tencents umfassender Bewertungs-Benchmark für die Sicherheit von KI-Codegenerierung, der 10 CWE-Kategorien mit automatisiertem Testrahmen abdeckt
Inspect - Framework für Large-Language-Model-Evaluierungen des UK AI Security Institute. Über 200 vorgefertigte Evaluierungen, die Prompt Engineering, Tool-Nutzung, Multi-Turn-Dialoge und modellbasierte Bewertung abdecken.
sec-code-bench - Alibabas Benchmark zur Bewertung der LLM-Codesicherheitsfähigkeiten über 17 Schwachstellenkategorien und 4 Programmiersprachen
Verteidigung & Sicherheitskontrollen
Ein-/Ausgabe-Guardrails
NeMo-Guardrails - NeMo Guardrails ist ein Open-Source-Toolkit zum einfachen Hinzufügen programmierbarer Guardrails zu LLM-basierten Konversationssystemen.
LlamaFirewall - LlamaFirewall ist ein Framework zur Erkennung und Abschwächung KI-zentrierter Sicherheitsrisiken, das mehrere Eingabe- und Ausgabeschichten unterstützt, wie typischen LLM-Chat und fortgeschrittenere mehrstufige agentische Operationen.
llm-guard - LLM Guard von Protect AI ist ein umfassendes Tool, das die Sicherheit von Large Language Models (LLMs) stärkt.
Guardrails.ai - Guardrails ist ein Python-Paket, mit dem Benutzer den Ausgaben von Large Language Models (LLMs) Struktur-, Typ- und Qualitätsgarantien hinzufügen können
TrustGate - Generative Application Firewall (GAF) zur Erkennung, Verhinderung und Blockierung von Angriffen auf GenAI-Anwendungen
ZenGuard AI - Die schnellste Trust-Layer für KI-Agenten
LocalMod - Selbst gehostete Content-Moderation-API mit Prompt-Injection-Erkennung, Toxizitätsfilterung, PII-Erkennung und NSFW-Klassifizierung. Läuft zu 100 % offline.
DynaGuard - Ein dynamisches Guardrail-Modell mit benutzerdefinierten Richtlinien
Safe Zone - Safe Zone ist eine Open-Source-Engine zur PII-Erkennung und für Guardrails, die verhindert, dass sensible Daten an LLMs und Drittanbieter-APIs gelangen.
superagent - Superagent bietet zwecktrainierte Guardrails, die KI-Agenten sicher und konform machen.
ShellWard - KI-Agenten-Sicherheits-Middleware mit 8-Schichten-Verteidigung gegen Prompt Injection, Datenextraktion und gefährliche Befehle. Null Abhängigkeiten.
CodeGate - Ein Open-Source-Projekt mit Fokus auf Datenschutz, das als Sicherheitsschicht innerhalb des KI-Workflows eines Entwicklers zur Codegenerierung fungiert
Future AGI - Open-Source-Plattform zum Selbsthosten mit integrierten Echtzeit-Guardrails für unsichere Ausgaben (Jailbreak, PII, Injection, Toxizität), Evals, Tracing, Simulationen und Gateway für LLM- und Agentenanwendungen.
Agenten-Laufzeitsicherheit & Sandboxing
OpenShell - OpenShell ist die sichere, private Laufzeitumgebung für autonome KI-Agenten. Sie bietet sandboxisierte Ausführungsumgebungen, die durch deklarative YAML-Richtlinien gesteuert werden und unbefugten Dateizugriff, Datenextraktion und unkontrollierte Netzwerkaktivität verhindern.
OpenSandbox - Sichere, schnelle und erweiterbare Sandbox-Laufzeitumgebung für KI-Agenten. Mehrsprachige SDKs, Docker/Kubernetes-Runtimes, gVisor/Kata-Containers/Firecracker-Isolation. CNCF-Landscape-Projekt.
CubeSandbox - Sofortige, nebenläufige, sichere und leichte Sandbox für KI-Agenten von Tencent Cloud. Kaltstart unter 60 ms, <5 MB Speicher-Overhead, E2B-SDK-kompatibel. Basiert auf RustVMM und KVM mit extremer Isolation (dedizierter Kernel + eBPF).
Aegis - Open-Source-EDR für KI-Agenten von Antropos. Überwacht Prozesse, Dateien, Netzwerk und Verhalten autonomer KI-Agenten in Echtzeit. Keine Telemetrie, keine Cloud, alles bleibt lokal.
Microsoft Agent Governance Toolkit - KI-Agent-Governance-Toolkit von Microsoft – Richtliniendurchsetzung, Zero-Trust-Identität, Ausführungs-Sandboxing und Zuverlässigkeitstechnik für autonome KI-Agenten. Deckt 10/10 der OWASP Agentic Top 10 ab.
agentfield - Open-Source-Control-Plane für Agentensysteme mit kryptografischer Identität, Richtliniendurchsetzung und auditfreundlicher Beobachtbarkeit.
leash - Leash kapselt KI-Codierungsagenten in Containern und überwacht ihre Aktivität.
vibekit - Führe Claude Code, Gemini, Codex – oder jeden Codierungsagenten – in einer sauberen, isolierten Sandbox mit integrierter Schwärzung sensibler Daten und Beobachtbarkeit aus.
pipelock - Sicherheits-Harness für KI-Agenten – Egress-Proxy mit DLP-Scanning, SSRF-Schutz, MCP-Antwort-Scanning und Überwachung der Workspace-Integrität
skill-scanner - Ein Sicherheitsscanner für KI-Agenten-Skills, der Prompt Injection, Datenextraktion und bösartige Codemuster erkennt. Kombiniert musterbasierte Erkennung (YAML + YARA), LLM-as-a-Judge und verhaltensbasierte Datenflussanalyse für eine umfassende Bedrohungserkennung.
SkillSpector - Sicherheitsscanner für KI-Agenten-Skills. Erkennt 64 Schwachstellenmuster in 16 Kategorien mit statischer Analyse + optionaler LLM-semantischer Bewertung. Mehrformat-Ausgabe (JSON, Markdown, SARIF).
Project CodeGuard - CoSAI-Open-Source-Projekt zur Sicherung KI-gestützter Entwicklungsabläufe. CodeGuard bietet Sicherheitskontrollen und Guardrails für KI-Codierungsassistenten, um zu verhindern, dass während der Entwicklung KI-generierten Codes Schwachstellen eingeführt werden.
AgentLens - Agenten-Beobachtbarkeits- und Replay-Tools für KI-Sicherheits- und Interpretierbarkeitsforschung. Umgebung zum Ausführen von Multi-Session-Agent-Trajektorien, Erfassen im ATIF-Format und Verfolgen von Dateizustandsänderungen über Sitzungen hinweg. Entwickelt, um das Verhalten von LLM-Agenten über Multi-Turn-, Multi-Session- und Multi-Agenten-Interaktionen zu untersuchen.
claude-code-devcontainer - Sandboxisierter Devcontainer zum sicheren Ausführen von Claude Code im Bypass-Modus. Entwickelt für Sicherheitsaudits und Überprüfung nicht vertrauenswürdigen Codes.
claude-code-safety-net - Ein Claude-Code-Plugin, das als Sicherheitsnetz fungiert und destruktive Git- und Dateisystembefehle abfängt, bevor sie ausgeführt werden
OneCLI - Open-Source-Anmeldedaten-Tresor für KI-Agenten. Ein Rust-HTTP-Gateway fängt Agentenanfragen ab und injiziert API-Anmeldedaten transparent, sodass Agenten niemals rohe Schlüssel besitzen. AES-256-GCM-Verschlüsselung, Pro-Agenten-Scoping, vollständiger Prüfpfad.
OpenSandbox - Sichere, schnelle und erweiterbare Sandbox-Laufzeitumgebung für KI-Agenten. Mehrsprachige SDKs, Docker/Kubernetes-Runtimes, gVisor/Kata-Containers/Firecracker-Isolation. CNCF-Landscape-Projekt.
openclaw-shield - Sicherheits-Plugin für OpenClaw-Agenten – verhindert Geheimnislecks, PII-Offenlegung und destruktive Befehlsausführung
clawsec - Sicherheitsscanner und Härtungswerkzeug für OpenClaw-Bereitstellungen. Bietet Sicherheitsbewertungen, Konfigurationsaudits und Schwachstellenerkennung speziell für OpenClaw-Gateway- und Agentenkonfigurationen.
nanoclaw - Leichte OpenClaw-Alternative, die aus Sicherheitsgründen in Containern läuft. Verbindet sich mit WhatsApp, hat Speicher, geplante Aufgaben und läuft direkt auf dem Agents SDK von Anthropic. Erster KI-Assistent mit Unterstützung für Agent Swarms für kollaborative Agententeams.
secureclaw - Automatische Sicherheitshärtung für OpenClaw-KI-Agenten von Adversa AI. 51 Audit-Checks, 12 Verhaltensregeln, 9 Skripte, 4 Datenbanken mit Mustern. Vollständige Abdeckung der OWASP ASI Top 10. Schützt vor Prompt Injection, Anmeldedatendiebstahl, Lieferkettenangriffen und Datenschutzlecks.
defenseclaw - Enterprise-Governance-Schicht für OpenClaw von Cisco AI Defense. Scannt Skills, MCP-Server und Plugins mit integriertem CodeGuard-SAST, Tool-Call-Inspektions-Engine, LLM-Guardrail-Proxy und SIEM-Integration. Blockiert automatisch HIGH/CRITICAL-Befunde.
microsandbox - Leichte MicroVM-Sandbox zum sicheren Ausführen nicht vertrauenswürdigen KI-generierten Codes mit starken Isolationsgarantien
Adrian - Open-Source-, AARM-konforme Laufzeit-Sicherheitsüberwachungs- und Steuerungs-Engine für KI-Agenten von Secure Agentics. Analysiert Aktivitätsprotokolle von Agenten (Tool-Aufrufe, Aktionen, Ausgaben) und Denkspuren (Reasoning Traces), um bösartiges, fehlausgerichtetes oder außerhalb des Auftrags liegendes Verhalten zu erkennen, mit optionalem Eingriff während der Ausführung (Audit- vs. Block-Modus). Python- (LangChain/LangGraph) und TypeScript-SDKs, vollständig offline selbst hostbar. Apache-2.0.
HOL Guard - Local-first-Sicherheits-Harness, das Tool-Aufrufe in KI-Codierungsagenten (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) abfängt, bevor Dateien geändert oder das Netzwerk kontaktiert wird. Pre-Tool-Hooks, Genehmigungszentrum, Advisory-Scanning der Lieferkette und optionale Guard-Cloud-Synchronisierung.
MCP-Sicherheit
MCP-Security-Checklist - Eine umfassende Sicherheits-Checkliste für MCP-basierte KI-Tools. Entwickelt von SlowMist, um LLM-Plugin-Ökosysteme zu schützen.
Awesome-MCP-Security - Alles, was du über die Sicherheit des Model Context Protocol (MCP) wissen musst.
secure-mcp-gateway - Dieses sichere MCP-Gateway ist mit Authentifizierung, automatischer Tool-Erkennung, Caching und Guardrail-Durchsetzung gebaut.
mcp-context-protector - context-protector ist ein Sicherheits-Wrapper für MCP-Server, der Risiken im Zusammenhang mit der Ausführung nicht vertrauenswürdiger MCP-Server adressiert, einschließlich Line Jumping, unerwarteter Serverkonfigurationsänderungen und anderer Prompt-Injection-Angriffe
mcp-guardian - MCP Guardian verwaltet den Zugriff deines LLM-Assistenten auf MCP-Server und gibt dir Echtzeitkontrolle über die Aktivität deines LLMs.
MCP Audit VSCode Extension - Auditiere und protokolliere alle GitHub-Copilot-MCP-Tool-Aufrufe in VSCode zentral und mühelos.
MCP-Scan - Ein Sicherheits-Scan-Tool für MCP-Server
ATR (Agent Threat Rules) - Open-Source-Erkennungsregeln für Bedrohungen durch KI-Agenten. 108 Regex-Regeln, die Prompt Injection, Tool-Poisoning und Anmeldedaten-Exfiltration in 9 Kategorien abdecken. Wird von Cisco AI Defense verwendet. MIT-lizenziert.
MCPProxy - Local-first-MCP-Proxy mit SHA-256-Quarantäne pro Tool zur Erkennung von Tool-Poisoning- und Rug-Pull-Angriffen, automatischem Scannen von Tool-Aufrufen auf sensible Daten und Geheimnisse, Docker-Sandbox-Isolation für nicht vertrauenswürdige MCP-Server und OAuth 2.1. MIT-lizenziert.
Modell- & Artefakt-Scanning
modelscan - ModelScan ist ein Open-Source-Projekt von Protect AI, das Modelle scannt, um festzustellen, ob sie unsicheren Code enthalten.
picklescan - Sicherheitsscanner, der Python-Pickle-Dateien erkennt, die verdächtige Aktionen ausführen
fickling - Ein Python-Pickling-Decompiler und statischer Analysator
medusa - AI-first-Sicherheitsscanner mit über 74 Analysatoren, über 180 KI-Agenten-Sicherheitsregeln und intelligenter Reduzierung falsch positiver Ergebnisse. Unterstützt alle Sprachen. CVE-Erkennung für React2Shell, mcp-remote RCE.
julius - LLM-Service-Fingerprinting-Tool für Sicherheitsexperten. Erkennt über 32 KI-Dienste (Ollama, vLLM, LiteLLM, Hugging Face TGI usw.) bei Penetrationstests und der Ermittlung der Angriffsfläche. Verwendet HTTP-basiertes Service-Fingerprinting zur Identifizierung der Serverinfrastruktur.
a2a-scanner - Scannt A2A-Agenten auf potenzielle Bedrohungen und Sicherheitsprobleme### KI-gestützte defensive Sicherheit
Claude Code Security Review - Eine KI-gestützte GitHub Action für Sicherheitsüberprüfungen, die Claude nutzt, um Codeänderungen auf Sicherheitslücken zu analysieren.
deepsec - Agentengestützter Schwachstellenscanner von Vercel Labs zum Auffinden schwer erkennbarer Probleme in großen Codebasen mithilfe von Coding-Agenten. Unterstützt paralleles Scannen, PR-Diff-Review und CI/CD-Integration.
defending-code-reference-harness - Referenzimplementierung für autonome Schwachstellenerkennung und -behebung mit Claude. Enthält Fähigkeiten für Threat Modeling, Scannen, Triage und Patching.
Visa Vulnerability Agentic Harness - Agentische SAST-Pipeline mit 11 Stufen von der Erkennung bis zur LLM-gestützten Behebung und adversarischen Validierung. Gibt SARIF aus und integriert sich mit Claude Code, Copilot und Gemini.
GhidraGPT - Integriert GPT-Modelle in Ghidra für automatisierte Codeanalyse, Variablenumbenennung, Schwachstellenerkennung und Generierung von Erläuterungen.
IDAssist - KI-gestütztes Reverse-Engineering-Plugin für IDA Pro. Integriert LLM-gestützte Analyse in die IDA-Oberfläche mit semantischen Wissensgraphen, RAG-Dokumentsuche und Unterstützung für mehrere LLM-Anbieter (OpenAI, Anthropic, Ollama, LiteLLM). Analysiert Funktionen, schlägt Umbenennungen vor und beantwortet Fragen zum Code.
ThreatForest - Agentische Threat-Modeling-Plattform auf Basis des Strands-Frameworks. Generiert autonom Angriffsbäume aus Repositorys, ordnet Angriffsschritte MITRE-ATT&CK-Techniken zu und erstellt umsetzbare Abhilfeempfehlungen.
claude-grc-plugin - Claude-Code-Plugin, das Claude in einen leitenden GRC-Analysten verwandelt. Über 72 Referenzdateien, die 15 Frameworks abdecken (NIST 800-53, FedRAMP, ISO 27001, SOC 2 usw.), 24 Slash-Befehle und fundiertes Domänenwissen für behördliche und kommerzielle Compliance-Arbeiten.
Vigil SOC - Eine umfassende Open-Source-Plattform für Security Operations für KI-Agenten, die Echtzeit-Überwachung, Bedrohungserkennung und Incident Response für KI-gestützte Umgebungen ermöglicht.
AiSOC - Open-Source-, selbst hostbarer KI-gestützter SOC, der Sicherheitsereignisse aufnimmt, korreliert, autonome KI-gesteuerte Untersuchungen über LangGraph durchführt und Ergebnisse in einer einheitlichen Konsole anzeigt. Bietet vollständigen Audit-Trail für Agentenentscheidungen, öffentliche Evaluierungsumgebung in CI und 52 eigene Konnektoren. MIT-lizenziert.
Diffprivlib - Die IBM-Bibliothek für differenzielle Privatsphäre
TenSEAL - Eine Bibliothek für homomorphe Verschlüsselungsoperationen auf Tensoren
SyMPC - Eine Begleitbibliothek für sicheres Mehrparteien-Rechnen (Secure Multiparty Computation) für Syft
Cloaked AI - Open-Source-Eigenschaftserhaltende Verschlüsselung für Vektor-Embeddings
dstack - Open-Source-Framework für vertrauliche KI zur sicheren ML-/LLM-Bereitstellung mit hardwaregestützter Isolierung und Datenschutz
PrivacyRaven - Testbibliothek für den Datenschutz von Deep-Learning-Systemen
PLOT4ai - Privacy Library Of Threats 4 Artificial Intelligence — Eine Threat-Modeling-Bibliothek, die Ihnen hilft, verantwortungsvolle KI zu entwickeln
OpenDP - Kernbibliothek für Algorithmen zur differenziellen Privatsphäre aus dem OpenDP-Projekt — wird verwendet, um datenschutzerhaltende ML-Trainingspipelines zu erstellen
Daten- & Lieferketten-Sicherheit
datasig - Fingerprinting von Datensätzen für AIBOM
Trusera ai-bom - AI Bill of Materials — Entdecken Sie jeden KI-Agenten, jedes Modell und jede API in Ihrer Infrastruktur
Agentische KI-Sicherheits-Skills
Elastic Agent Skills - Sammlung von Fähigkeiten für den KI-Assistenten von Elastic, die Sicherheitsuntersuchungen in natürlicher Sprache über Logs, Traces und Threat Intelligence hinweg ermöglichen
Ghost Security Skills - Agenten-Fähigkeiten und -Werkzeuge für Anwendungssicherheit (AppSec) für Claude Code
tm_skills - Agenten-Fähigkeiten zur Unterstützung bei kontinuierlichem Threat Modeling
Trail of Bits Skills Marketplace - Trail-of-Bits-Claude-Code-Fähigkeiten für Sicherheitsforschung, Schwachstellenerkennung und Audit-Workflows
Semgrep Skills - Offizielle Semgrep-Fähigkeiten für Claude Code und andere KI-Codierungsassistenten. Bietet Funktionen für Sicherheitsscans, Codeanalyse und Schwachstellenerkennung direkt in Ihrem KI-gestützten Entwicklungs-Workflow.
claude-bug-bounty - Claude-Code-Fähigkeit für KI-gestützte Bug-Bounty-Jagd. Automatisiert Reconnaissance, IDOR-, XSS-, SSRF-, OAuth-, GraphQL- und LLM-Injection-Tests mit 4-stufiger Validierungs-Checkliste und Berichtserstellung.
Anthropic Cybersecurity Skills - Über 734 strukturierte Cybersicherheits-Fähigkeiten für KI-Agenten. MITRE-ATT&CK-zugeordnet, agentskills.io-Standard. Kompatibel mit Claude Code, Copilot, Codex CLI, Cursor und Gemini CLI.
llm-sast-scanner - SAST-Fähigkeit für KI-Codierungsagenten (Claude Code, Codex usw.) mit strukturierter Schwachstellenerkennung über 34 Klassen. Bietet Source-to-Sink-Taint-Analyse, Judge-Verifizierung zur Reduzierung falsch positiver Ergebnisse und über 99 % Präzision/Recall bei Benchmarks.
sast-skills - Sammlung von Agenten-Fähigkeiten, die Ihren KI-Coder in einen SAST-Scanner verwandeln
pentest-ai-agents - 31 Claude-Code-Subagenten für offensive Sicherheit. Spezialisierte KI-Subagenten für Recon, Web, AD, Cloud, Mobile, Wireless, Social Engineering, Payload-Erstellung, Reverse Engineering, Exploit-Verkettung, Detection Engineering, Forensik und Berichtserstellung. Tier-2-Agenten können Tools direkt mit Genehmigungs-Gates ausführen.
Mantis Skills - Googles entkoppelte, sequenzielle, sicherheitsfokussierte Pipeline agentischer KI-Fähigkeiten zum autonomen Überprüfen, Deduplizieren, Validieren, Reproduzieren und Patchen von Schwachstellen in Codebasen jeder Größe. Bietet eine mehrstufige Pipeline (Architekturanalyse → Threat Modeling → Recherche → Überprüfung → Reproduktion → Patching → Kalibrierung → Reflexion), integrierte Sandboxing-Umgebung und eine kontinuierliche Lernschleife, die sich über iterative Läufe anpasst. Unterstützt RTL-Hardware, IaC, ML-Pipelines und kompilierte Binärdateien.
Sicherheitsfokussierte KI-Modelle
VulnLLM-R-7B - Spezialisiertes Reasoning-LLM für Schwachstellenerkennung. Nutzt Chain-of-Thought-Reasoning zur Analyse von Datenfluss, Kontrollfluss und Sicherheitskontext. Übertrifft Claude-3.7-Sonnet und CodeQL bei Benchmarks zur Schwachstellenerkennung. Nur 7B Parameter, dadurch effizient und schnell.
Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning ist ein Open-Weight-Sprachmodell mit 8 Milliarden Parametern, das für Cybersicherheitsanwendungen spezialisiert und instruktionsabgestimmt ist. Es erweitert das Basismodell Foundation-Sec-8B um Fähigkeiten zur Befolgung von Anweisungen und zum logischen Schlussfolgern.
Antares (1B & 350M) - Agentische Modelle zur Schwachstellenlokalisierung von fdtn-ai. Verfügbar in Varianten mit 2B und 0.4B Parametern, entwickelt, um Schwachstellen im Code autonom zu identifizieren und zu lokalisieren.
CyberSecQwen-4B - _CTI-Spezialist mit 4B Parametern, feinabgestimmt aus Qwen3-4B-Instruct-2507 für Cybersicherheits-Threat-Intelligence.
Meta-SecAlign-8B / Meta-SecAlign-70B - Sicherheitsausgerichtete Llama-Modelle, die feinabgestimmt wurden, um Prompt-Injection-Angriffen zu widerstehen und die Anweisungshierarchie selbst unter adversarischen Eingaben aufrechtzuerhalten
Lily-Cybersecurity-7B - Cybersicherheits-abgestimmtes 7B-Chatmodell, optimiert für Sicherheitsanalyse, Schwachstellenerklärung und Threat-Intelligence-Aufgaben.
Llama-Guard-4-12B - Metas neuester multimodaler Safety-Klassifikator zur Erkennung schädlicher Inhalte in LLM-Eingaben und -Ausgaben über Text- und Bildmodalitäten hinweg.
Llama-Prompt-Guard-2-86M - Leichtgewichtiges 86M-Parameter-Modell von Meta zur Erkennung von Prompt-Injection- und Jailbreak-Versuchen in LLM-Produktionspipelines.
ShieldGemma-2B - Googles Text-Safety-Klassifikator mit 2B Parametern zur Erkennung schädlicher Inhalte, basierend auf der Gemma-Architektur.
DeBERTa Prompt Injection Detector v2 - Protect AIs DeBERTa-v3-base, feinabgestimmt für Prompt-Injection-Erkennung, weit verbreitet in Produktions-Guardrail-Pipelines für LLMs.
Prompt Injection Sentinel - ModernBERT-large-Modell, feinabgestimmt für Prompt-Injection- und Jailbreak-Klassifizierung mit niedriger Falsch-Positiv-Rate.
Nemotron 3.5 Content Safety - NVIDIAs multimodales Content-Safety-Modell mit 4B Parametern, das Text-+Bild-Eingabe-Guardrails, mehrsprachige Unterstützung (35+ Sprachen), anpassbare Durchsetzung von Unternehmensrichtlinien und überprüfbares Reasoning in einem einzigen Inferenzaufruf vereint. Nachfolger von Nemotron 3 Content Safety.
BrowseSafe - Spezialisiertes Sicherheitsmodell zur Erkennung von Prompt-Injection-Angriffen in KI-Browseragenten. Erreicht 90.4% F1-Score auf BrowseSafe-Bench, optimiert für Echtzeit-Asynchron-Klassifizierung von rohen HTML-Inhalten.
Domänenadaptierte Sicherheits-Sprachmodelle
ATTACK-BERT - Sentence-Transformer-Modell zur Zuordnung von Sicherheitstext zu MITRE-ATT&CK-Techniken.
CySecBERT - BERT-Modell, das durch domänenspezifisches Pre-Training für Cybersicherheits- und CTI-Aufgaben angepasst wurde.
Datensätze
SafetyPrompts - Kuratierte Sammlung sicherheitsrelevanter Prompts zur Bewertung der Safety- und Security-Eigenschaften von LLMs.
Do-Not-Answer - Datensatz von Prompts, die verantwortungsvolle LLMs nicht beantworten sollten, für Safety-Evaluierung und Red Teaming.
JailBreakV-28K - Groß angelegter Datensatz mit 28.000 Jailbreak-Prompts zum Benchmarking der LLM-Sicherheit.
CL4R1T4S - Durchgesickerte System-Prompts von ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit und anderen großen KI-Tools. Größte bekannte Sammlung von Produktions-System-Prompts für Transparenz- und Angriffsflächen-Forschung.
LEAKHUB - System-Prompt-Leak-Leaderboard — Community-Plattform zur Verfolgung und Einstufung von System-Prompt-Leaks in KI-Produkten.
Leaked System Prompts - Sammlung durchgesickerter System-Prompts aus kommerziellen KI-Tools — nützlich zum Verständnis realer Prompt-Engineering- und Angriffsflächen.