Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
awesome-ai-security — Eine Sammlung großartiger Ressourcen zur KI-Sicherheit | Kitploit
Tools/GitHubGitHub/ottosulin/awesome-ai-security
SchwachstellenscannerPenetrationstestsPrivatsphäreLieferkettensicherheitLernen & BildungRed TeamingKuratierte RessourcenKI-SicherheitAdversarial-Angriff
GitHubottosulin/awesome-ai-security

awesome-ai-security

Eine Sammlung großartiger Ressourcen zur KI-Sicherheit

1.4k35212vor 1 TagVon Kitploit geprüft
Repository anzeigen

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen

Awesome AI Security Awesome Track Awesome List

Eine kuratierte Liste großartiger KI-Sicherheits-Frameworks, -Standards, -Lernressourcen und Open-Source-Tools.

Wenn du einen Beitrag leisten möchtest, erstelle einen PR oder kontaktiere mich @ottosulin.

Inhaltsverzeichnis

  • Lernressourcen
    • Lektüre & Leitfäden
    • Kurse, Labs & CTFs
    • Podcasts
  • Governance & Risikomanagement
  • Frameworks
  • Standards & Verifizierung
  • Taxonomien, Terminologie & Risikodatenbanken
  • Checklisten & praktische Anleitungen
  • Angriffstechniken & Red Teaming
    • Adversarial ML & klassische Modelle
    • LLM- & GenAI-Red-Teaming
    • Agentische KI & MCP-Angriffswerkzeuge
    • KI-gestützte offensive Sicherheit
    • Steganografie & verdeckte Kanäle
  • Benchmarks & Evaluierungen
  • Verteidigung & Sicherheitskontrollen
    • Input/Output-Guardrails
    • Agenten-Laufzeitsicherheit & Sandboxing
    • MCP-Sicherheit
    • Modell- & Artefakt-Scanning
    • KI-gestützte defensive Sicherheit
    • Datenschutz & vertrauliches Rechnen
    • Daten- & Lieferkettensicherheit
  • Sicherheitsfähigkeiten für agentische KI
  • Sicherheitsorientierte KI-Modelle
  • Lernressourcen

    Lektüre & Leitfäden

    • OWASP ML TOP 10
    • OWASP LLM TOP 10
    • OWASP AI Security and Privacy Guide
    • NIST AIRC - NIST Trustworthy & Responsible AI Resource Center
    • The MLSecOps Top 10 by Institute for Ethical AI & Machine Learning
    • OWASP Multi-Agentic System Threat Modeling
    • OWASP: CheatSheet – A Practical Guide for Securely Using Third-Party MCP Servers 1.0
    • OWASP GenAI Threat & Defense Compass - Referenzleitfaden, der GenAI-Bedrohungen den entsprechenden Verteidigungsmaßnahmen zuordnet.
    • NCSC Guidelines for Secure AI System Development - Praktische Leitlinien, verfasst von NCSC (UK) und CISA, für die sichere KI-Entwicklung – von Design und Entwicklung über Bereitstellung bis hin zum Betrieb.

    Kurse, Labs & CTFs

    • Damn Vulnerable MCP Server - Eine absichtlich verwundbare Implementierung des Model Context Protocol (MCP) für Bildungszwecke.
    • otto-support - Eine verwundbare MCP-Server-Implementierung auf Basis von mcp-go mit abgestufter Authentifizierung (4 Rollen), 19 Tools und integriertem Sandbox-Container mit Claude Code zum Üben von Privilege Escalation und Tool-Missbrauch.
    • OWASP WrongSecrets LLM exercise
    • vulnerable-mcp-servers-lab - Eine Sammlung von Servern, die absichtlich verwundbar sind, um Pentesting von MCP-Servern zu lernen.
    • FinBot Agentic AI Capture The Flag (CTF) Application - FinBot ist eine interaktive Agentic-Security-Capture-The-Flag-Plattform (CTF), die reale Schwachstellen in agentischen KI-Systemen anhand einer simulierten, auf Finanzdienstleistungen ausgerichteten Anwendung simuliert.
    • AI-Red-Teaming-Playground-Labs - AI-Red-Teaming-Übungslabore zur Durchführung von AI-Red-Teaming-Schulungen inklusive Infrastruktur.
    • Damn Vulnerable LLM Agent - Absichtlich verwundbarer LLM-Agent zum Lernen von Prompt Injection, Tool-Missbrauch und Agentensicherheit
      • LLMVault - Ein Open-Source-LLM-Sicherheitslabor im CTF-Stil zum Erlernen der OWASP LLM Top 10 durch praktische Übungen an verwundbaren Systemen – abgedeckt werden Prompt Injection, RAG-Angriffe, System-Prompt-Leaks, Tool-Missbrauch und Agentensicherheit.

    Podcasts

    • MLSecOps podcast
    • AI Security Podcast
    • AI Security Ops - Wöchentliche Podcasts von Black Hills Information Security, die untersuchen, wie KI die Cybersicherheit verändert – mit aufkommenden Bedrohungen, Tools und Trends sowie praktischem, umsetzbarem Wissen.
    • GenAI Security podcast

    Governance & Risikomanagement

    Frameworks

    • NIST AI Risk Management Framework
    • ISO/IEC 42001 Artificial Intelligence Management System
    • ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management
    • Google Secure AI Framework (SAIF)
    • ENISA Multilayer Framework for Good Cybersecurity Practices for AI
    • OWASP Artificial Intelligence Maturity Assessment
    • CSA AI Model Risk Framework
    • CSA Maestro AI Threat Modeling Framework
    • CSA AI Controls Matrix - Umfassende Kontrollmatrix für KI-Systeme, die Governance, Risiko und Compliance abdeckt.
    • OWASP Agentic AI Top 10 - Top 10 für Agentic AI, das als Kern für OWASP- und CSA-Red-Teaming dient.

    Standards & Verifizierung

    • OWASP AI Security Verification Standard
    • OWASP Agent Name Service
    • OWASP Agent Observability Standard
    • AI Verify - Von der Regierung Singapurs unterstütztes KI-Testframework und Toolkit zur Verifizierung von KI-Systemeigenschaften gegenüber Governance-Frameworks.

    Taxonomien, Terminologie & Risikodatenbanken

    • NIST AI 100-2e2023 - Taxonomie und Terminologie des Adversarial Machine Learning
    • MITRE ATLAS
      • ATLAS Knowledge Base Agent - Open-Source-KI-Assistent zur Erkundung der ATLAS-Wissensdatenbank mit natürlicher Sprache, MCP-Serverzugriff und anpassbaren Agenten-Workflows.
    • AVIDML
    • MIT AI Risk Repository
    • AI Incident Database
    • ISO/IEC 22989:2022 Information technology — Artificial intelligence — Artificial intelligence concepts and terminology
    • NIST AI Glossary
    • The Arcanum Prompt Injection Taxonomy - Umfassendes Klassifikationssystem für Prompt-Injection-Angriffe, das Angriffsabsichten, Techniken, Umgehungen und Eingabevektoren abdeckt. Kategorisiert Ziele, Methoden, Verschleierungstechniken und Angriffsflächen für Prompt-Injection-Angriffe.
    • CSA LLM Threats Taxonomy
    • OWASP AI Vulnerability Scoring System (AIVSS) - Bewertungssystem für KI-spezifische Schwachstellen, das CVSS-Konzepte auf KI-Risikodimensionen erweitert.

    Checklisten & praktische Anleitungen

    • OWASP LLM Applications Cybersecurity and Governance Checklist
    • OWASP AI Security and Privacy Guide
    • OWASP LLM and Generative AI Security Center of Excellence Guide
    • OWASP Agentic AI – Threats and Mitigations
    • OWASP AI Security Solutions Landscape
    • OWASP GenAI Incident Response Guide
    • OWASP LLM and GenAI Data Security Best Practices
    • OWASP Securing Agentic AI Applications
    • OWASP GenAI Red Teaming Guide

    Angriffstechniken & Red Teaming

    Adversarial ML & klassische Modelle

    • Adversarial Robustness Toolkit - ART konzentriert sich auf die Bedrohungen Evasion (Veränderung des Modellverhaltens durch Eingabemodifikationen), Poisoning (Kontrolle eines Modells durch Trainingsdatenmodifikationen), Extraction (Stehlen eines Modells durch Abfragen) und Inference (Angriff auf die Privatsphäre der Trainingsdaten)
    • cleverhans - Eine Bibliothek für adversarial examples zum Erstellen von Angriffen, Aufbau von Abwehrmaßnahmen und Benchmarking beider
    • foolbox - Eine Python-Toolbox zum Erstellen adversarialer Beispiele, die neuronale Netze in PyTorch, TensorFlow und JAX täuschen
    • TextAttack - Ein Python-Framework für Adversarial Attacks, Data Augmentation und Modelltraining in NLP
    • Counterfit - generische Automatisierungsschicht zur Bewertung der Sicherheit von maschinellen Lernsystemen
    • OffsecML Playbook - Eine Sammlung offensiver und adversarischer TTPs mit Proofs of Concept
    • BadDiffusion - Offizielles Repository zur Reproduktion des Papers „How to Backdoor Diffusion Models?“, veröffentlicht auf der CVPR 2023
    • secml-torch - SecML-Torch: Eine Bibliothek zur Robustheitsbewertung von Deep-Learning-Modellen

    LLM- & GenAI-Red-Teaming

    • garak - Sicherheits-Sondierungswerkzeug für LLMs
    • ai-scanner - Open-Source-Webanwendung für KI-Modell-Sicherheitsbewertungen, basierend auf NVIDIA garak. Bietet 179 Probes, Multi-Target-Scans, geplante Scans, ASR-Bewertung und SIEM-Integration.
    • promptfoo - Teste deine Prompts, Agenten und RAGs. Red Teaming, Pentesting und Schwachstellenscanning für LLMs. Vergleiche die Leistung von GPT, Claude, Gemini, Llama und mehr. Einfache deklarative Konfigurationen mit CLI- und CI/CD-Integration.
    • PyRIT - Das Python Risk Identification Tool für generative KI (PyRIT) ist ein Open-Source-Framework, das Sicherheitsprofis und Ingenieure dabei unterstützt, Risiken in generativen KI-Systemen proaktiv zu identifizieren.
    • PurpleLlama - Werkzeugsammlung zur Bewertung und Verbesserung der LLM-Sicherheit.
    • augustus - LLM-Sicherheitstest-Framework zur Erkennung von Prompt Injection, Jailbreaks und Adversarial Attacks. 190+ Probes, 28 Provider, einzelnes Go-Binary. Produktionsreif mit nebenläufigem Scannen, Rate Limiting und Retry-Logik.
    • FuzzyAI - Ein leistungsstarkes Tool für automatisiertes LLM-Fuzzing. Es hilft Entwicklern und Sicherheitsforschern, potenzielle Jailbreaks in ihren LLM-APIs zu identifizieren und zu entschärfen.
    • EasyJailbreak - Ein benutzerfreundliches Python-Framework zur Erzeugung adversarialer Jailbreak-Prompts.
    • gptfuzz - Offizielles Repository für GPTFUZZER: Red Teaming von Large Language Models mit automatisch generierten Jailbreak-Prompts
    • llamator - Framework zum Testen von Schwachstellen großer Sprachmodelle (LLM).
    • agentic_security - Agentic-LLM-Schwachstellenscanner / AI-Red-Teaming-Kit
    • Agentic Radar - Open-Source-CLI-Sicherheitsscanner für agentische Workflows.
    • RAPTOR - Autonomes Framework für offensive/defensive Sicherheitsforschung, basierend auf Claude Code. Verkettet statische Analyse (Semgrep, CodeQL), Binäranalyse, LLM-gestützte Schwachstellenvalidierung, Exploit-Generierung und Patch-Erstellung. Multi-Modell-Orchestrierung mit Z3-basierter Machbarkeitsanalyse.
    • whistleblower - Offensives Sicherheitstool zum Testen auf System-Prompt-Leaks und Capability-Discovery einer über eine API exponierten KI-Anwendung
    • promptmap - ein Prompt-Injection-Scanner für benutzerdefinierte LLM-Anwendungen
    • spikee - Einfaches Prompt-Injection-Kit für Evaluierung und Exploitation
    • ps-fuzz - Mach deine GenAI-Apps sicher & geschützt – Teste & härte deinen System-Prompt
    • EasyEdit - Modifiziere die Ground Truths eines LLMs
    • llm-attacks - Universelle und übertragbare Angriffe auf alignierte Sprachmodelle
    • llm-security - Neue Wege, app-integrierte LLMs zu brechen
    • Plexiglass - Ein Toolkit zur Erkennung von und zum Schutz vor Schwachstellen in Large Language Models (LLMs).
    • Prompt Hacking Resources - Eine Liste kuratierter Ressourcen für alle, die sich für AI Red Teaming, Jailbreaking und Prompt Injection interessieren
    • Giskard - Open-Source-Evaluierung & -Test für KI- & LLM-Systeme
    • blackice - BlackIce ist ein Open-Source-Container-Toolkit für das Red Teaming von KI-Modellen, einschließlich Large Language Models (LLMs) und klassischer Machine-Learning-Modelle (ML). Inspiriert von der Bequemlichkeit und Standardisierung von Kali Linux im traditionellen Penetrationstest vereinfacht BlackIce KI-Sicherheitsbewertungen durch ein reproduzierbares Container-Image, das mit speziellen Bewertungswerkzeugen vorkonfiguriert ist.
    • ai-best-practices - Semgrep-Pro-Regeln, um sicherzustellen, dass Code mit LLMs Best Practices folgt. 58 Regeln, 102 Unterregeln für 6 Provider + MCP + Claude Code- & Cursor-Hooks + LangChain. Erkennt hartcodierte API-Schlüssel, Prompt-Injection-Risiken, fehlende Sicherheitsprüfungen und unbehandelte Fehler in 7 Sprachen.
    • G0DM0D3 - Open-Source-Multi-Modell-Chat-Interface für Red Teaming mit über 50 Modellen via OpenRouter. Bietet GODMODE CLASSIC (5 Jailbreak-Kombos), ULTRAPLINIAN Multi-Modell-Evaluierung, die Parseltongue-Eingabe-Perturbation-Engine mit 33 Red-Team-Techniken und AutoTune-adaptives Sampling für KI-Sicherheitsforschung.
    • L1B3RT4S - Sammlung von Jailbreak- und Befreiungs-Prompts für große LLMs. Kuratierte Bibliothek adversarialer Prompts zum Testen und Bewerten von KI-Sicherheitsvorkehrungen bei ChatGPT, Claude, Gemini und anderen Frontier-Modellen.
    • OBLITERATUS - Abliterations-Toolkit, das Verweigerungsverhalten aus Open-Source-LLMs ohne erneutes Training entfernt. Modifiziert Modellgewichte, um sicherheitskonforme Verweigerungsantworten zu eliminieren und ermöglicht so uneingeschränkte Forschung zum Modellverhalten.
    • T3MP3ST - Autonome Red-Teaming-Plattform und Multi-Agenten-Meta-Harness für offensive Sicherheit. Koordiniert Schwärme von KI-Agenten für koordinierte Adversarial-Tests von Frontier-KI-Systemen.
    • P4RS3LT0NGV3 - Universelles Toolkit für Texttransformation und Promptcrafting. Unterstützt Übersetzung, Mutation, Kodierung/Dekodierung und adversariales Prompt Engineering für den Bau von Jailbreak-Payloads.
    • claude-secure-coding-rules - Open-Source-Sicherheitsregeln, die Claude Code dazu anleiten, standardmäßig sicheren Code zu erzeugen.
    • DeepTeam - LLM-Red-Teaming-Framework mit über 40 Angriffsmethoden, darunter Prompt Injection, Jailbreaking und RAG-Poisoning. Integriert sich in CI/CD-Pipelines.

    Agentische KI & MCP-Angriffswerkzeuge

    • RAMPART - pytest-natives Safety- und Security-Testframework für agentische KI-Anwendungen.
    • AI-Infra-Guard - Eine umfassende, intelligente und einfach zu bedienende AI-Red-Teaming-Plattform, entwickelt vom Tencent Zhuque Lab. Integriert Module für Infra Scan, MCP Scan und Jailbreak-Evaluierung und bietet eine One-Click-Web-UI, REST-APIs sowie Docker-basierte Bereitstellung für eine umfassende KI-Sicherheitsbewertung.
    • OpenPromptInjection - Ein Benchmark für Prompt-Injection-Angriffe und -Abwehrmaßnahmen
    • AIMap - Plattform für Discovery und Sicherheitstests im Internet-Maßstab für exponierte KI-Agenten-Infrastruktur. Fragt Shodan nach MCP-Servern, Ollama-Instanzen, vLLM/LiteLLM-Proxys und mehr ab – und erstellt dann Fingerprints, bewertet Risiken und startet protokollspezifische Angriffssuiten mit Echtzeit-Streaming-Ergebnissen.### KI-gestützte offensive Sicherheit
    • PentestGPT - Ein GPT-gestütztes Penetrationstest-Tool
    • HackingBuddyGPT - Hilft ethischen Hackern, LLMs in 50 Codezeilen oder weniger zu nutzen
    • cai - Cybersecurity AI (CAI), eine offene, Bug-Bounty-taugliche künstliche Intelligenz (Paper)
    • shannon - Vollautonomer KI-Pentester für Webanwendungen und APIs von Keygraph. White-Box-Sicherheitstests, die Quellcode analysieren, Angriffsvektoren identifizieren und echte Exploits ausführen. 96,15 % Erfolgsrate (100/104 Exploits) im XBOW-Benchmark.
    • strix - Strix sind autonome KI-Agenten, die sich wie echte Hacker verhalten – sie führen deinen Code dynamisch aus, finden Schwachstellen und validieren sie durch echte Proof-of-Concepts
    • redamon - KI-gestütztes agentisches Red-Team-Framework, das offensive Sicherheitsoperationen von der Aufklärung über die Ausnutzung bis zur Post-Exploitation ohne menschliches Eingreifen automatisiert.
    • CyberStrikeAI - KI-native Sicherheitstestplattform in Go. Integriert über 100 Sicherheitstools mit einer intelligenten Orchestrierungs-Engine, rollenbasierte Tests mit vordefinierten Sicherheitsrollen, Skill-System und umfassendes Lebenszyklusmanagement. Nutzt das MCP-Protokoll und KI-Agenten für durchgängige Automatisierung von Konversationsbefehlen bis zur Schwachstellenerkennung.
    • HexStrikeAI - HexStrike AI MCP Agents ist ein fortschrittlicher MCP-Server, der KI-Agenten (Claude, GPT, Copilot usw.) ermöglicht, autonom über 150 Cybersicherheitstools für automatisiertes Pentesting, Schwachstellenerkennung, Bug-Bounty-Automatisierung und Sicherheitsforschung auszuführen.
    • mcp-for-security - Eine Sammlung von Model-Context-Protocol-Servern für beliebte Sicherheitstools wie SQLMap, FFUF, NMAP, Masscan und weitere. Integriert Sicherheits- und Penetrationstests in KI-Workflows.
    • mcp-security-hub - Eine wachsende Sammlung von MCP-Servern, die offensive Sicherheitstools zu KI-Assistenten bringt. Nmap, Ghidra, Nuclei, SQLMap, Hashcat und mehr.
    • Burp MCP Server - MCP-Server für Burp
    • burpgpt - Eine Burp-Suite-Erweiterung, die OpenAIs GPT integriert, um einen zusätzlichen passiven Scan zur Erkennung hochspezifischer Schwachstellen durchzuführen und verkehrsbasierte Analysen jeder Art zu ermöglichen.
    • guardian-cli - KI-gestützter Sicherheitstest- und Schwachstellenscanner. Guardian CLI ist ein intelligentes Sicherheitstesttool, das KI nutzt, um Penetrationstests, Schwachstellenbewertung und Sicherheitsaudits zu automatisieren.
    • AutoPentestX - AutoPentestX – Automatisiertes Linux-Pentesting- und Schwachstellenbericht-Tool
    • HackGPT - Ein Tool, das ChatGPT zum Hacken nutzt
    • nano-analyzer - Ein minimaler, LLM-gestützter Zero-Day-Schwachstellenscanner von AISLE.
    • clearwing - Autonomer Schwachstellenscanner und Source-Code-Sucher auf Basis von LangGraph.
    • Zen-AI-Pentest - KI-gestütztes Penetrationstest-Framework mit automatisiertem Schwachstellenscan, Multi-Agenten-System und Compliance-Berichterstattung. Über 72 Sicherheitstools, Docker-Sandbox, ReAct-Agenten, Angriffspfadanalyse.
    • Violin - Überwachtes, agentisches Hermes-Agent-Pentestprofil: 31 fähigkeitsbasierte Playbooks (OWASP Top 10, API Top 10, LLM Top 10) mit interaktivem Scoping, Scope-Validierung und Genehmigungsstufen für autorisierte Aufklärung, Exploit-Validierung und Berichterstattung.
    • NeuroSploit - Autonome Multi-Modell-Pentesting-Umgebung in Rust. Ein LLM-Pool steuert Aufklärung, Agentenauswahl, Exploit-Verkettung und modellübergreifende Validierungsabstimmung über Black-Box-, White-Box-, Grey-Box- und Cloud-Einsatzmodi.
    • OpenHack - KI-gestützter Multi-Agenten-Scanner, der autonom SQLi, XSS, IDOR und Auth-Bypass in deiner Codebasis findet und anschließend jeden Befund durch Sandbox-Ausführung und Browser-Replay verifiziert. Auf Augenhöhe mit Claude Opus 4.6 bei etwa 40-fach geringeren Kosten.
    • PentAGI - Vollautonomes Multi-Agenten-System für komplexe Penetrationstest-Aufgaben. Sandbox-Docker-Ausführung, Multi-Provider-LLM-Unterstützung (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), Wissensgraphen-Integration und Echtzeit-Agentenüberwachung.
    • V3SP3R - KI-gestützter Hardware-Hacking-Begleiter für das Flipper Zero. Natürliche Sprachschnittstelle zur Steuerung von Hardware-Angriffen, mit Smart-Glasses-Integration für den freihändigen Betrieb.

    Steganografie & verdeckte Kanäle

    • ST3GG - All-in-One-Steganografie-Suite mit mehrschichtiger Kodierung, Bild- und Audio-Steganografie sowie Steganalyse-Tools zur Erkennung versteckter Daten in KI-generierten Medien.

    Benchmarks & Evaluierungen

    • ISC-Bench - Internal Safety Collapse: bricht jedes Frontier-LLM (Claude Opus 4.6, GPT-5.4) in pass@3 über normale Aufgabenausführung aus – ohne adversariale Aufforderungen. Black-Box, domänenübergreifend, wissenschaftsübergreifend. Neuartiger Ausfallmodus. [Paper]
    • jailbreakbench - JailbreakBench: Ein offener Robustheits-Benchmark für das Jailbreaking von Sprachmodellen [NeurIPS 2024 Datasets and Benchmarks Track]
    • AgentDojo - Eine dynamische Umgebung zur Bewertung von Angriffen und Verteidigungen für LLM-Agenten.
    • AIRTBench - Code-Repository für: AIRTBench: Messung autonomer KI-Red-Teaming-Fähigkeiten in Sprachmodellen
    • HackingBuddyGPT benchmark dataset - Benchmark-Datensatz für automatisiertes Pentesting
    • AgentDoG - AgentDoG ist ein risikobewusstes Bewertungs- und Schutzframework für autonome Agenten. Es konzentriert sich auf die Risikobewertung auf Trajektorienebene und zielt darauf ab, festzustellen, ob die Ausführungstrajektorie eines Agenten unter verschiedenen Anwendungsszenarien Sicherheitsrisiken enthält.
    • AICGSecEval - Tencents umfassender Bewertungs-Benchmark für die Sicherheit von KI-Codegenerierung, der 10 CWE-Kategorien mit automatisiertem Testrahmen abdeckt
    • Inspect - Framework für Large-Language-Model-Evaluierungen des UK AI Security Institute. Über 200 vorgefertigte Evaluierungen, die Prompt Engineering, Tool-Nutzung, Multi-Turn-Dialoge und modellbasierte Bewertung abdecken.
    • sec-code-bench - Alibabas Benchmark zur Bewertung der LLM-Codesicherheitsfähigkeiten über 17 Schwachstellenkategorien und 4 Programmiersprachen

    Verteidigung & Sicherheitskontrollen

    Ein-/Ausgabe-Guardrails

    • NeMo-Guardrails - NeMo Guardrails ist ein Open-Source-Toolkit zum einfachen Hinzufügen programmierbarer Guardrails zu LLM-basierten Konversationssystemen.
    • LlamaFirewall - LlamaFirewall ist ein Framework zur Erkennung und Abschwächung KI-zentrierter Sicherheitsrisiken, das mehrere Eingabe- und Ausgabeschichten unterstützt, wie typischen LLM-Chat und fortgeschrittenere mehrstufige agentische Operationen.
    • llm-guard - LLM Guard von Protect AI ist ein umfassendes Tool, das die Sicherheit von Large Language Models (LLMs) stärkt.
    • Guardrails.ai - Guardrails ist ein Python-Paket, mit dem Benutzer den Ausgaben von Large Language Models (LLMs) Struktur-, Typ- und Qualitätsgarantien hinzufügen können
    • TrustGate - Generative Application Firewall (GAF) zur Erkennung, Verhinderung und Blockierung von Angriffen auf GenAI-Anwendungen
    • ZenGuard AI - Die schnellste Trust-Layer für KI-Agenten
    • LocalMod - Selbst gehostete Content-Moderation-API mit Prompt-Injection-Erkennung, Toxizitätsfilterung, PII-Erkennung und NSFW-Klassifizierung. Läuft zu 100 % offline.
    • DynaGuard - Ein dynamisches Guardrail-Modell mit benutzerdefinierten Richtlinien
    • AprielGuard - 8B-Parameter-Safety-Security-Schutzmodell
    • Safe Zone - Safe Zone ist eine Open-Source-Engine zur PII-Erkennung und für Guardrails, die verhindert, dass sensible Daten an LLMs und Drittanbieter-APIs gelangen.
    • superagent - Superagent bietet zwecktrainierte Guardrails, die KI-Agenten sicher und konform machen.
    • ShellWard - KI-Agenten-Sicherheits-Middleware mit 8-Schichten-Verteidigung gegen Prompt Injection, Datenextraktion und gefährliche Befehle. Null Abhängigkeiten.
    • CodeGate - Ein Open-Source-Projekt mit Fokus auf Datenschutz, das als Sicherheitsschicht innerhalb des KI-Workflows eines Entwicklers zur Codegenerierung fungiert
    • Future AGI - Open-Source-Plattform zum Selbsthosten mit integrierten Echtzeit-Guardrails für unsichere Ausgaben (Jailbreak, PII, Injection, Toxizität), Evals, Tracing, Simulationen und Gateway für LLM- und Agentenanwendungen.

    Agenten-Laufzeitsicherheit & Sandboxing

    • OpenShell - OpenShell ist die sichere, private Laufzeitumgebung für autonome KI-Agenten. Sie bietet sandboxisierte Ausführungsumgebungen, die durch deklarative YAML-Richtlinien gesteuert werden und unbefugten Dateizugriff, Datenextraktion und unkontrollierte Netzwerkaktivität verhindern.
    • OpenSandbox - Sichere, schnelle und erweiterbare Sandbox-Laufzeitumgebung für KI-Agenten. Mehrsprachige SDKs, Docker/Kubernetes-Runtimes, gVisor/Kata-Containers/Firecracker-Isolation. CNCF-Landscape-Projekt.
    • CubeSandbox - Sofortige, nebenläufige, sichere und leichte Sandbox für KI-Agenten von Tencent Cloud. Kaltstart unter 60 ms, <5 MB Speicher-Overhead, E2B-SDK-kompatibel. Basiert auf RustVMM und KVM mit extremer Isolation (dedizierter Kernel + eBPF).
    • Aegis - Open-Source-EDR für KI-Agenten von Antropos. Überwacht Prozesse, Dateien, Netzwerk und Verhalten autonomer KI-Agenten in Echtzeit. Keine Telemetrie, keine Cloud, alles bleibt lokal.
    • Microsoft Agent Governance Toolkit - KI-Agent-Governance-Toolkit von Microsoft – Richtliniendurchsetzung, Zero-Trust-Identität, Ausführungs-Sandboxing und Zuverlässigkeitstechnik für autonome KI-Agenten. Deckt 10/10 der OWASP Agentic Top 10 ab.
    • agentfield - Open-Source-Control-Plane für Agentensysteme mit kryptografischer Identität, Richtliniendurchsetzung und auditfreundlicher Beobachtbarkeit.
    • leash - Leash kapselt KI-Codierungsagenten in Containern und überwacht ihre Aktivität.
    • vibekit - Führe Claude Code, Gemini, Codex – oder jeden Codierungsagenten – in einer sauberen, isolierten Sandbox mit integrierter Schwärzung sensibler Daten und Beobachtbarkeit aus.
    • pipelock - Sicherheits-Harness für KI-Agenten – Egress-Proxy mit DLP-Scanning, SSRF-Schutz, MCP-Antwort-Scanning und Überwachung der Workspace-Integrität
    • skill-scanner - Ein Sicherheitsscanner für KI-Agenten-Skills, der Prompt Injection, Datenextraktion und bösartige Codemuster erkennt. Kombiniert musterbasierte Erkennung (YAML + YARA), LLM-as-a-Judge und verhaltensbasierte Datenflussanalyse für eine umfassende Bedrohungserkennung.
    • SkillSpector - Sicherheitsscanner für KI-Agenten-Skills. Erkennt 64 Schwachstellenmuster in 16 Kategorien mit statischer Analyse + optionaler LLM-semantischer Bewertung. Mehrformat-Ausgabe (JSON, Markdown, SARIF).
    • Project CodeGuard - CoSAI-Open-Source-Projekt zur Sicherung KI-gestützter Entwicklungsabläufe. CodeGuard bietet Sicherheitskontrollen und Guardrails für KI-Codierungsassistenten, um zu verhindern, dass während der Entwicklung KI-generierten Codes Schwachstellen eingeführt werden.
    • AgentLens - Agenten-Beobachtbarkeits- und Replay-Tools für KI-Sicherheits- und Interpretierbarkeitsforschung. Umgebung zum Ausführen von Multi-Session-Agent-Trajektorien, Erfassen im ATIF-Format und Verfolgen von Dateizustandsänderungen über Sitzungen hinweg. Entwickelt, um das Verhalten von LLM-Agenten über Multi-Turn-, Multi-Session- und Multi-Agenten-Interaktionen zu untersuchen.
    • claude-code-devcontainer - Sandboxisierter Devcontainer zum sicheren Ausführen von Claude Code im Bypass-Modus. Entwickelt für Sicherheitsaudits und Überprüfung nicht vertrauenswürdigen Codes.
    • claude-code-safety-net - Ein Claude-Code-Plugin, das als Sicherheitsnetz fungiert und destruktive Git- und Dateisystembefehle abfängt, bevor sie ausgeführt werden
    • OneCLI - Open-Source-Anmeldedaten-Tresor für KI-Agenten. Ein Rust-HTTP-Gateway fängt Agentenanfragen ab und injiziert API-Anmeldedaten transparent, sodass Agenten niemals rohe Schlüssel besitzen. AES-256-GCM-Verschlüsselung, Pro-Agenten-Scoping, vollständiger Prüfpfad.
    • OpenSandbox - Sichere, schnelle und erweiterbare Sandbox-Laufzeitumgebung für KI-Agenten. Mehrsprachige SDKs, Docker/Kubernetes-Runtimes, gVisor/Kata-Containers/Firecracker-Isolation. CNCF-Landscape-Projekt.
    • openclaw-shield - Sicherheits-Plugin für OpenClaw-Agenten – verhindert Geheimnislecks, PII-Offenlegung und destruktive Befehlsausführung
    • clawsec - Sicherheitsscanner und Härtungswerkzeug für OpenClaw-Bereitstellungen. Bietet Sicherheitsbewertungen, Konfigurationsaudits und Schwachstellenerkennung speziell für OpenClaw-Gateway- und Agentenkonfigurationen.
    • nanoclaw - Leichte OpenClaw-Alternative, die aus Sicherheitsgründen in Containern läuft. Verbindet sich mit WhatsApp, hat Speicher, geplante Aufgaben und läuft direkt auf dem Agents SDK von Anthropic. Erster KI-Assistent mit Unterstützung für Agent Swarms für kollaborative Agententeams.
    • secureclaw - Automatische Sicherheitshärtung für OpenClaw-KI-Agenten von Adversa AI. 51 Audit-Checks, 12 Verhaltensregeln, 9 Skripte, 4 Datenbanken mit Mustern. Vollständige Abdeckung der OWASP ASI Top 10. Schützt vor Prompt Injection, Anmeldedatendiebstahl, Lieferkettenangriffen und Datenschutzlecks.
    • defenseclaw - Enterprise-Governance-Schicht für OpenClaw von Cisco AI Defense. Scannt Skills, MCP-Server und Plugins mit integriertem CodeGuard-SAST, Tool-Call-Inspektions-Engine, LLM-Guardrail-Proxy und SIEM-Integration. Blockiert automatisch HIGH/CRITICAL-Befunde.
    • microsandbox - Leichte MicroVM-Sandbox zum sicheren Ausführen nicht vertrauenswürdigen KI-generierten Codes mit starken Isolationsgarantien
    • Adrian - Open-Source-, AARM-konforme Laufzeit-Sicherheitsüberwachungs- und Steuerungs-Engine für KI-Agenten von Secure Agentics. Analysiert Aktivitätsprotokolle von Agenten (Tool-Aufrufe, Aktionen, Ausgaben) und Denkspuren (Reasoning Traces), um bösartiges, fehlausgerichtetes oder außerhalb des Auftrags liegendes Verhalten zu erkennen, mit optionalem Eingriff während der Ausführung (Audit- vs. Block-Modus). Python- (LangChain/LangGraph) und TypeScript-SDKs, vollständig offline selbst hostbar. Apache-2.0.
    • HOL Guard - Local-first-Sicherheits-Harness, das Tool-Aufrufe in KI-Codierungsagenten (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) abfängt, bevor Dateien geändert oder das Netzwerk kontaktiert wird. Pre-Tool-Hooks, Genehmigungszentrum, Advisory-Scanning der Lieferkette und optionale Guard-Cloud-Synchronisierung.

    MCP-Sicherheit

    • MCP-Security-Checklist - Eine umfassende Sicherheits-Checkliste für MCP-basierte KI-Tools. Entwickelt von SlowMist, um LLM-Plugin-Ökosysteme zu schützen.
    • Awesome-MCP-Security - Alles, was du über die Sicherheit des Model Context Protocol (MCP) wissen musst.
    • secure-mcp-gateway - Dieses sichere MCP-Gateway ist mit Authentifizierung, automatischer Tool-Erkennung, Caching und Guardrail-Durchsetzung gebaut.
    • mcp-context-protector - context-protector ist ein Sicherheits-Wrapper für MCP-Server, der Risiken im Zusammenhang mit der Ausführung nicht vertrauenswürdiger MCP-Server adressiert, einschließlich Line Jumping, unerwarteter Serverkonfigurationsänderungen und anderer Prompt-Injection-Angriffe
    • mcp-guardian - MCP Guardian verwaltet den Zugriff deines LLM-Assistenten auf MCP-Server und gibt dir Echtzeitkontrolle über die Aktivität deines LLMs.
    • MCP Audit VSCode Extension - Auditiere und protokolliere alle GitHub-Copilot-MCP-Tool-Aufrufe in VSCode zentral und mühelos.
    • MCP-Scan - Ein Sicherheits-Scan-Tool für MCP-Server
    • ATR (Agent Threat Rules) - Open-Source-Erkennungsregeln für Bedrohungen durch KI-Agenten. 108 Regex-Regeln, die Prompt Injection, Tool-Poisoning und Anmeldedaten-Exfiltration in 9 Kategorien abdecken. Wird von Cisco AI Defense verwendet. MIT-lizenziert.
    • MCPProxy - Local-first-MCP-Proxy mit SHA-256-Quarantäne pro Tool zur Erkennung von Tool-Poisoning- und Rug-Pull-Angriffen, automatischem Scannen von Tool-Aufrufen auf sensible Daten und Geheimnisse, Docker-Sandbox-Isolation für nicht vertrauenswürdige MCP-Server und OAuth 2.1. MIT-lizenziert.

    Modell- & Artefakt-Scanning

    • modelscan - ModelScan ist ein Open-Source-Projekt von Protect AI, das Modelle scannt, um festzustellen, ob sie unsicheren Code enthalten.
    • picklescan - Sicherheitsscanner, der Python-Pickle-Dateien erkennt, die verdächtige Aktionen ausführen
    • fickling - Ein Python-Pickling-Decompiler und statischer Analysator
    • medusa - AI-first-Sicherheitsscanner mit über 74 Analysatoren, über 180 KI-Agenten-Sicherheitsregeln und intelligenter Reduzierung falsch positiver Ergebnisse. Unterstützt alle Sprachen. CVE-Erkennung für React2Shell, mcp-remote RCE.
    • julius - LLM-Service-Fingerprinting-Tool für Sicherheitsexperten. Erkennt über 32 KI-Dienste (Ollama, vLLM, LiteLLM, Hugging Face TGI usw.) bei Penetrationstests und der Ermittlung der Angriffsfläche. Verwendet HTTP-basiertes Service-Fingerprinting zur Identifizierung der Serverinfrastruktur.
    • a2a-scanner - Scannt A2A-Agenten auf potenzielle Bedrohungen und Sicherheitsprobleme### KI-gestützte defensive Sicherheit
    • Claude Code Security Review - Eine KI-gestützte GitHub Action für Sicherheitsüberprüfungen, die Claude nutzt, um Codeänderungen auf Sicherheitslücken zu analysieren.
    • deepsec - Agentengestützter Schwachstellenscanner von Vercel Labs zum Auffinden schwer erkennbarer Probleme in großen Codebasen mithilfe von Coding-Agenten. Unterstützt paralleles Scannen, PR-Diff-Review und CI/CD-Integration.
    • defending-code-reference-harness - Referenzimplementierung für autonome Schwachstellenerkennung und -behebung mit Claude. Enthält Fähigkeiten für Threat Modeling, Scannen, Triage und Patching.
    • Visa Vulnerability Agentic Harness - Agentische SAST-Pipeline mit 11 Stufen von der Erkennung bis zur LLM-gestützten Behebung und adversarischen Validierung. Gibt SARIF aus und integriert sich mit Claude Code, Copilot und Gemini.
    • GhidraGPT - Integriert GPT-Modelle in Ghidra für automatisierte Codeanalyse, Variablenumbenennung, Schwachstellenerkennung und Generierung von Erläuterungen.
    • IDAssist - KI-gestütztes Reverse-Engineering-Plugin für IDA Pro. Integriert LLM-gestützte Analyse in die IDA-Oberfläche mit semantischen Wissensgraphen, RAG-Dokumentsuche und Unterstützung für mehrere LLM-Anbieter (OpenAI, Anthropic, Ollama, LiteLLM). Analysiert Funktionen, schlägt Umbenennungen vor und beantwortet Fragen zum Code.
    • ThreatForest - Agentische Threat-Modeling-Plattform auf Basis des Strands-Frameworks. Generiert autonom Angriffsbäume aus Repositorys, ordnet Angriffsschritte MITRE-ATT&CK-Techniken zu und erstellt umsetzbare Abhilfeempfehlungen.
    • claude-grc-plugin - Claude-Code-Plugin, das Claude in einen leitenden GRC-Analysten verwandelt. Über 72 Referenzdateien, die 15 Frameworks abdecken (NIST 800-53, FedRAMP, ISO 27001, SOC 2 usw.), 24 Slash-Befehle und fundiertes Domänenwissen für behördliche und kommerzielle Compliance-Arbeiten.
    • Vigil SOC - Eine umfassende Open-Source-Plattform für Security Operations für KI-Agenten, die Echtzeit-Überwachung, Bedrohungserkennung und Incident Response für KI-gestützte Umgebungen ermöglicht.
    • AiSOC - Open-Source-, selbst hostbarer KI-gestützter SOC, der Sicherheitsereignisse aufnimmt, korreliert, autonome KI-gesteuerte Untersuchungen über LangGraph durchführt und Ergebnisse in einer einheitlichen Konsole anzeigt. Bietet vollständigen Audit-Trail für Agentenentscheidungen, öffentliche Evaluierungsumgebung in CI und 52 eigene Konnektoren. MIT-lizenziert.

    Datenschutz & Confidential Computing

    • Python Differential Privacy Library
    • Diffprivlib - Die IBM-Bibliothek für differenzielle Privatsphäre
    • TenSEAL - Eine Bibliothek für homomorphe Verschlüsselungsoperationen auf Tensoren
    • SyMPC - Eine Begleitbibliothek für sicheres Mehrparteien-Rechnen (Secure Multiparty Computation) für Syft
    • Cloaked AI - Open-Source-Eigenschaftserhaltende Verschlüsselung für Vektor-Embeddings
    • dstack - Open-Source-Framework für vertrauliche KI zur sicheren ML-/LLM-Bereitstellung mit hardwaregestützter Isolierung und Datenschutz
    • PrivacyRaven - Testbibliothek für den Datenschutz von Deep-Learning-Systemen
    • PLOT4ai - Privacy Library Of Threats 4 Artificial Intelligence — Eine Threat-Modeling-Bibliothek, die Ihnen hilft, verantwortungsvolle KI zu entwickeln
    • OpenDP - Kernbibliothek für Algorithmen zur differenziellen Privatsphäre aus dem OpenDP-Projekt — wird verwendet, um datenschutzerhaltende ML-Trainingspipelines zu erstellen

    Daten- & Lieferketten-Sicherheit

    • datasig - Fingerprinting von Datensätzen für AIBOM
    • OWASP AIBOM - AI Bill of Materials
    • Trusera ai-bom - AI Bill of Materials — Entdecken Sie jeden KI-Agenten, jedes Modell und jede API in Ihrer Infrastruktur

    Agentische KI-Sicherheits-Skills

    • Elastic Agent Skills - Sammlung von Fähigkeiten für den KI-Assistenten von Elastic, die Sicherheitsuntersuchungen in natürlicher Sprache über Logs, Traces und Threat Intelligence hinweg ermöglichen
    • Ghost Security Skills - Agenten-Fähigkeiten und -Werkzeuge für Anwendungssicherheit (AppSec) für Claude Code
    • tm_skills - Agenten-Fähigkeiten zur Unterstützung bei kontinuierlichem Threat Modeling
    • Trail of Bits Skills Marketplace - Trail-of-Bits-Claude-Code-Fähigkeiten für Sicherheitsforschung, Schwachstellenerkennung und Audit-Workflows
    • Semgrep Skills - Offizielle Semgrep-Fähigkeiten für Claude Code und andere KI-Codierungsassistenten. Bietet Funktionen für Sicherheitsscans, Codeanalyse und Schwachstellenerkennung direkt in Ihrem KI-gestützten Entwicklungs-Workflow.
    • claude-bug-bounty - Claude-Code-Fähigkeit für KI-gestützte Bug-Bounty-Jagd. Automatisiert Reconnaissance, IDOR-, XSS-, SSRF-, OAuth-, GraphQL- und LLM-Injection-Tests mit 4-stufiger Validierungs-Checkliste und Berichtserstellung.
    • Anthropic Cybersecurity Skills - Über 734 strukturierte Cybersicherheits-Fähigkeiten für KI-Agenten. MITRE-ATT&CK-zugeordnet, agentskills.io-Standard. Kompatibel mit Claude Code, Copilot, Codex CLI, Cursor und Gemini CLI.
    • llm-sast-scanner - SAST-Fähigkeit für KI-Codierungsagenten (Claude Code, Codex usw.) mit strukturierter Schwachstellenerkennung über 34 Klassen. Bietet Source-to-Sink-Taint-Analyse, Judge-Verifizierung zur Reduzierung falsch positiver Ergebnisse und über 99 % Präzision/Recall bei Benchmarks.
    • sast-skills - Sammlung von Agenten-Fähigkeiten, die Ihren KI-Coder in einen SAST-Scanner verwandeln
    • pentest-ai-agents - 31 Claude-Code-Subagenten für offensive Sicherheit. Spezialisierte KI-Subagenten für Recon, Web, AD, Cloud, Mobile, Wireless, Social Engineering, Payload-Erstellung, Reverse Engineering, Exploit-Verkettung, Detection Engineering, Forensik und Berichtserstellung. Tier-2-Agenten können Tools direkt mit Genehmigungs-Gates ausführen.
    • Mantis Skills - Googles entkoppelte, sequenzielle, sicherheitsfokussierte Pipeline agentischer KI-Fähigkeiten zum autonomen Überprüfen, Deduplizieren, Validieren, Reproduzieren und Patchen von Schwachstellen in Codebasen jeder Größe. Bietet eine mehrstufige Pipeline (Architekturanalyse → Threat Modeling → Recherche → Überprüfung → Reproduktion → Patching → Kalibrierung → Reflexion), integrierte Sandboxing-Umgebung und eine kontinuierliche Lernschleife, die sich über iterative Läufe anpasst. Unterstützt RTL-Hardware, IaC, ML-Pipelines und kompilierte Binärdateien.

    Sicherheitsfokussierte KI-Modelle

    • VulnLLM-R-7B - Spezialisiertes Reasoning-LLM für Schwachstellenerkennung. Nutzt Chain-of-Thought-Reasoning zur Analyse von Datenfluss, Kontrollfluss und Sicherheitskontext. Übertrifft Claude-3.7-Sonnet und CodeQL bei Benchmarks zur Schwachstellenerkennung. Nur 7B Parameter, dadurch effizient und schnell.
    • Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning ist ein Open-Weight-Sprachmodell mit 8 Milliarden Parametern, das für Cybersicherheitsanwendungen spezialisiert und instruktionsabgestimmt ist. Es erweitert das Basismodell Foundation-Sec-8B um Fähigkeiten zur Befolgung von Anweisungen und zum logischen Schlussfolgern.
    • Antares (1B & 350M) - Agentische Modelle zur Schwachstellenlokalisierung von fdtn-ai. Verfügbar in Varianten mit 2B und 0.4B Parametern, entwickelt, um Schwachstellen im Code autonom zu identifizieren und zu lokalisieren.
    • CyberSecQwen-4B - _CTI-Spezialist mit 4B Parametern, feinabgestimmt aus Qwen3-4B-Instruct-2507 für Cybersicherheits-Threat-Intelligence.
    • Meta-SecAlign-8B / Meta-SecAlign-70B - Sicherheitsausgerichtete Llama-Modelle, die feinabgestimmt wurden, um Prompt-Injection-Angriffen zu widerstehen und die Anweisungshierarchie selbst unter adversarischen Eingaben aufrechtzuerhalten
    • Lily-Cybersecurity-7B - Cybersicherheits-abgestimmtes 7B-Chatmodell, optimiert für Sicherheitsanalyse, Schwachstellenerklärung und Threat-Intelligence-Aufgaben.

    Safety-Klassifikatoren & Prompt-Injection-Erkennung

    • Llama-Guard-4-12B - Metas neuester multimodaler Safety-Klassifikator zur Erkennung schädlicher Inhalte in LLM-Eingaben und -Ausgaben über Text- und Bildmodalitäten hinweg.
    • Llama-Prompt-Guard-2-86M - Leichtgewichtiges 86M-Parameter-Modell von Meta zur Erkennung von Prompt-Injection- und Jailbreak-Versuchen in LLM-Produktionspipelines.
    • ShieldGemma-2B - Googles Text-Safety-Klassifikator mit 2B Parametern zur Erkennung schädlicher Inhalte, basierend auf der Gemma-Architektur.
    • DeBERTa Prompt Injection Detector v2 - Protect AIs DeBERTa-v3-base, feinabgestimmt für Prompt-Injection-Erkennung, weit verbreitet in Produktions-Guardrail-Pipelines für LLMs.
    • Prompt Injection Sentinel - ModernBERT-large-Modell, feinabgestimmt für Prompt-Injection- und Jailbreak-Klassifizierung mit niedriger Falsch-Positiv-Rate.
    • Nemotron 3.5 Content Safety - NVIDIAs multimodales Content-Safety-Modell mit 4B Parametern, das Text-+Bild-Eingabe-Guardrails, mehrsprachige Unterstützung (35+ Sprachen), anpassbare Durchsetzung von Unternehmensrichtlinien und überprüfbares Reasoning in einem einzigen Inferenzaufruf vereint. Nachfolger von Nemotron 3 Content Safety.
    • BrowseSafe - Spezialisiertes Sicherheitsmodell zur Erkennung von Prompt-Injection-Angriffen in KI-Browseragenten. Erreicht 90.4% F1-Score auf BrowseSafe-Bench, optimiert für Echtzeit-Asynchron-Klassifizierung von rohen HTML-Inhalten.

    Domänenadaptierte Sicherheits-Sprachmodelle

    • ATTACK-BERT - Sentence-Transformer-Modell zur Zuordnung von Sicherheitstext zu MITRE-ATT&CK-Techniken.
    • CySecBERT - BERT-Modell, das durch domänenspezifisches Pre-Training für Cybersicherheits- und CTI-Aufgaben angepasst wurde.

    Datensätze

    • SafetyPrompts - Kuratierte Sammlung sicherheitsrelevanter Prompts zur Bewertung der Safety- und Security-Eigenschaften von LLMs.
    • Do-Not-Answer - Datensatz von Prompts, die verantwortungsvolle LLMs nicht beantworten sollten, für Safety-Evaluierung und Red Teaming.
    • JailBreakV-28K - Groß angelegter Datensatz mit 28.000 Jailbreak-Prompts zum Benchmarking der LLM-Sicherheit.
    • CL4R1T4S - Durchgesickerte System-Prompts von ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit und anderen großen KI-Tools. Größte bekannte Sammlung von Produktions-System-Prompts für Transparenz- und Angriffsflächen-Forschung.
    • LEAKHUB - System-Prompt-Leak-Leaderboard — Community-Plattform zur Verfolgung und Einstufung von System-Prompt-Leaks in KI-Produkten.
    • Leaked System Prompts - Sammlung durchgesickerter System-Prompts aus kommerziellen KI-Tools — nützlich zum Verständnis realer Prompt-Engineering- und Angriffsflächen.
    Tool herunterladen