Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
awesome-ai-security — Коллекция отличных ресурсов, связанных с безопасностью ИИ | Kitploit
Инструменты/GitHubGitHub/ottosulin/awesome-ai-security
Сканеры уязвимостейТестирование на ПроникновениеКонфиденциальностьБезопасность Цепочки ПоставокОбучение и ОбразованиеRed TeamingПодобранные РесурсыБезопасность ИИСостязательная Атака
GitHubottosulin/awesome-ai-security

awesome-ai-security

Коллекция отличных ресурсов, связанных с безопасностью ИИ

1.4k3521 день назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться
Репозиторий

Awesome AI Security Awesome Track Awesome List

Курируемый список лучших фреймворков, стандартов, учебных ресурсов и инструментов с открытым исходным кодом, связанных с безопасностью ИИ.

Если вы хотите внести свой вклад, создайте PR или свяжитесь со мной @ottosulin.

Содержание

  • Учебные ресурсы
    • Чтение и руководства
    • Курсы, лаборатории и CTF
    • Подкасты
  • Управление и риск-менеджмент
    • Фреймворки
    • Стандарты и верификация
    • Таксономии, терминология и базы данных рисков
    • Чек-листы и практические руководства
  • Техники атак и Red Teaming
    • Состязательное машинное обучение и классические модели
    • LLM и GenAI Red Teaming
    • Agentic AI и инструменты атак на MCP
    • Атакующая безопасность с помощью ИИ
    • Стеганография и скрытые каналы
  • Бенчмарки и оценки
  • Защита и средства контроля безопасности
    • Защитные механизмы ввода/вывода
    • Безопасность среды выполнения агентов и песочницы
    • Безопасность MCP
    • Сканирование моделей и артефактов
    • Оборонительная безопасность с помощью ИИ
    • Конфиденциальность и доверительные вычисления
    • Безопасность данных и цепочки поставок
  • Навыки безопасности Agentic AI
  • Модели ИИ, ориентированные на безопасность

Учебные ресурсы

Чтение и руководства

  • OWASP ML TOP 10
  • OWASP LLM TOP 10
  • OWASP AI Security and Privacy Guide
  • NIST AIRC - Ресурсный центр NIST по надежному и ответственному ИИ
  • The MLSecOps Top 10 by Institute for Ethical AI & Machine Learning
  • OWASP Multi-Agentic System Threat Modeling
  • OWASP: CheatSheet – A Practical Guide for Securely Using Third-Party MCP Servers 1.0
  • OWASP GenAI Threat & Defense Compass - Справочное руководство, сопоставляющее угрозы GenAI с соответствующими защитными мерами.
  • NCSC Guidelines for Secure AI System Development - Практические рекомендации по безопасной разработке ИИ, подготовленные совместно NCSC (Великобритания) и CISA и охватывающие проектирование, разработку, развертывание и эксплуатацию.

Курсы, лаборатории и CTF

  • Damn Vulnerable MCP Server - Преднамеренно уязвимая реализация Model Context Protocol (MCP) в образовательных целях.
  • otto-support - Реализация уязвимого MCP-сервера на базе mcp-go с многоуровневой аутентификацией (4 роли), 19 инструментами и встроенным изолированным контейнером с Claude Code для отработки повышения привилегий и неправомерного использования инструментов.
  • OWASP WrongSecrets LLM exercise
  • vulnerable-mcp-servers-lab - Набор серверов с преднамеренными уязвимостями для обучения пентесту MCP-серверов.
  • FinBot Agentic AI Capture The Flag (CTF) Application - FinBot — это интерактивная платформа Agentic Security Capture The Flag (CTF), которая моделирует реальные уязвимости агентных систем ИИ с помощью симуляции приложения, ориентированного на финансовые услуги.
  • AI-Red-Teaming-Playground-Labs - Лабораторные площадки AI Red Teaming для проведения тренингов по AI Red Teaming, включая инфраструктуру.
  • Damn Vulnerable LLM Agent - Преднамеренно уязвимый LLM-агент для изучения prompt-инъекций, неправомерного использования инструментов и безопасности агентов
    • LLMVault - Открытая CTF-лаборатория по безопасности LLM для изучения OWASP LLM Top 10 с помощью практических упражнений на уязвимых системах, охватывающих prompt-инъекции, атаки на RAG, утечку системного промпта, неправомерное использование инструментов и безопасность агентов.

Подкасты

  • MLSecOps podcast
  • AI Security Podcast
  • AI Security Ops - Еженедельные подкасты от Black Hills Information Security о том, как ИИ преобразует кибербезопасность — рассматриваются новые угрозы, инструменты и тренды с практическими, применимыми знаниями.
  • GenAI Security podcast

Управление и риск-менеджмент

Фреймворки

  • NIST AI Risk Management Framework
  • ISO/IEC 42001 Artificial Intelligence Management System
  • ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management
  • Google Secure AI Framework (SAIF)
  • ENISA Multilayer Framework for Good Cybersecurity Practices for AI
  • OWASP Artificial Intelligence Maturity Assessment
  • CSA AI Model Risk Framework
  • CSA Maestro AI Threat Modeling Framework
  • CSA AI Controls Matrix - Комплексная матрица контролей для ИИ-систем, охватывающая управление, риски и соответствие требованиям.
  • OWASP Agentic AI Top 10 - Топ-10 для Agentic AI, служащий основой для red teaming в OWASP и CSA.

Стандарты и верификация

  • OWASP AI Security Verification Standard
  • OWASP Agent Name Service
  • OWASP Agent Observability Standard
  • AI Verify - Поддерживаемый правительством Сингапура фреймворк и набор инструментов для тестирования ИИ и проверки свойств ИИ-систем на соответствие фреймворкам управления.

Таксономии, терминология и базы данных рисков

  • NIST AI 100-2e2023 - Таксономия и терминология состязательного машинного обучения
  • MITRE ATLAS
    • ATLAS Knowledge Base Agent - ИИ-ассистент с открытым исходным кодом для изучения базы знаний ATLAS с помощью естественного языка, доступа к MCP-серверу и настраиваемых агентных рабочих процессов.
  • AVIDML
  • MIT AI Risk Repository
  • AI Incident Database
  • ISO/IEC 22989:2022 Information technology — Artificial intelligence — Artificial intelligence concepts and terminology
  • NIST AI Glossary
  • The Arcanum Prompt Injection Taxonomy - Комплексная система классификации атак с помощью prompt-инъекций, охватывающая намерения атак, техники, обходы и векторы ввода. Категоризирует цели, методы, техники обфускации и поверхности атак для prompt-инъекций.
  • CSA LLM Threats Taxonomy
  • OWASP AI Vulnerability Scoring System (AIVSS) - Система оценки уязвимостей, специфичных для ИИ, расширяющая концепции CVSS на измерения рисков ИИ.

Чек-листы и практические руководства

  • OWASP LLM Applications Cybersecurity and Governance Checklist
  • OWASP AI Security and Privacy Guide
  • OWASP LLM and Generative AI Security Center of Excellence Guide
  • OWASP Agentic AI – Threats and Mitigations
  • OWASP AI Security Solutions Landscape
  • OWASP GenAI Incident Response Guide
  • OWASP LLM and GenAI Data Security Best Practices
  • OWASP Securing Agentic AI Applications
  • OWASP GenAI Red Teaming Guide

Техники атак и Red Teaming

Состязательное машинное обучение и классические модели

  • Adversarial Robustness Toolkit - ART фокусируется на таких угрозах, как Evasion (изменение поведения модели с помощью модификации входных данных), Poisoning (контроль модели с помощью модификации обучающих данных), Extraction (кража модели через запросы) и Inference (атака на конфиденциальность обучающих данных)
  • cleverhans - Библиотека состязательных примеров для создания атак, построения защит и их бенчмаркинга
  • foolbox - Python-инструментарий для создания состязательных примеров, обманывающих нейронные сети в PyTorch, TensorFlow и JAX
  • TextAttack - Python-фреймворк для состязательных атак, дополнения данных и обучения моделей в NLP
  • Counterfit - Универсальный уровень автоматизации для оценки безопасности систем машинного обучения
  • OffsecML Playbook - Коллекция атакующих и состязательных TTP с PoC
  • BadDiffusion - Официальный репозиторий для воспроизведения статьи «How to Backdoor Diffusion Models?», опубликованной на CVPR 2023
  • secml-torch - SecML-Torch: библиотека для оценки устойчивости моделей глубокого обучения

LLM и GenAI Red Teaming

  • garak - Инструмент проверки безопасности LLM
  • ai-scanner - Веб-приложение с открытым исходным кодом для оценки безопасности моделей ИИ, построенное на NVIDIA garak. Включает 179 проб, сканирование нескольких целей, плановые сканирования, оценку ASR и интеграцию с SIEM.
  • promptfoo - Тестируйте свои промпты, агентов и RAG. Red teaming, пентест и сканирование уязвимостей для LLM. Сравнивайте производительность GPT, Claude, Gemini, Llama и других. Простые декларативные конфигурации с поддержкой командной строки и интеграцией в CI/CD.
  • PyRIT - Python Risk Identification Tool для генеративного ИИ (PyRIT) — это фреймворк с открытым исходным кодом, созданный, чтобы помочь специалистам по безопасности и инженерам активно выявлять риски в системах генеративного ИИ.
  • PurpleLlama - Набор инструментов для оценки и повышения безопасности LLM.
  • augustus - Фреймворк тестирования безопасности LLM для обнаружения prompt-инъекций, джейлбрейков и состязательных атак. 190+ проб, 28 провайдеров, один Go-бинарник. Готов к продакшену: параллельное сканирование, ограничение скорости и логика повторов.
  • FuzzyAI - Мощный инструмент для автоматизированного фаззинга LLM. Он помогает разработчикам и исследователям безопасности выявлять и устранять потенциальные джейлбрейки в их LLM API.
  • EasyJailbreak - Простой в использовании Python-фреймворк для генерации состязательных джейлбрейк-промптов.
  • gptfuzz - Официальный репозиторий GPTFUZZER: Red Teaming больших языковых моделей с автоматически генерируемыми джейлбрейк-промптами
  • llamator - Фреймворк для тестирования уязвимостей больших языковых моделей (LLM).
  • agentic_security - Сканер уязвимостей агентных LLM / набор для AI red teaming
  • Agentic Radar -

Agentic AI и инструменты атак на MCP

  • RAMPART - pytest-нативный фреймворк тестирования safety и security агентных ИИ-приложений.
  • AI-Infra-Guard - Комплексная, интеллектуальная и простая в использовании платформа AI Red Teaming, разработанная Tencent Zhuque Lab. Объединяет модули Infra Scan, MCP Scan и Jailbreak Evaluation, предоставляя веб-интерфейс в один клик, REST API и развертывание на основе Docker для комплексной оценки безопасности ИИ.
  • OpenPromptInjection - Бенчмарк для атак и защит от prompt-инъекций
  • AIMap - Платформа для обнаружения и тестирования безопасности в интернет-масштабе для открытой инфраструктуры ИИ-агентов. Запрашивает Shodan для поиска MCP-серверов, инстансов Ollama, прокси vLLM/LiteLLM и других — затем снимает отпечатки, оценивает риски и запускает протокол-специфичные наборы атак с потоковой выдачей результатов в реальном времени.### Наступательная безопасность с поддержкой ИИ
  • PentestGPT - Инструмент для пентестинга на основе GPT
  • HackingBuddyGPT - Помогает этичным хакерам использовать LLM в 50 строках кода или меньше
  • cai - Cybersecurity AI (CAI) — открытый ИИ, готовый к Bug Bounty (статья)
  • shannon - Полностью автономный ИИ-пентестер для веб-приложений и API от Keygraph. White-box тестирование безопасности, которое анализирует исходный код, выявляет векторы атак и выполняет реальные эксплойты. 96,15% успеха (100/104 эксплойтов) на бенчмарке XBOW.
  • strix - Strix — это автономные ИИ-агенты, которые действуют как настоящие хакеры: динамически запускают ваш код, находят уязвимости и подтверждают их реальными proof-of-concept
  • redamon - Агентный red team фреймворк на основе ИИ, который автоматизирует операции наступательной безопасности — от разведки до эксплуатации и постэксплуатации — без вмешательства человека.
  • CyberStrikeAI -

Стеганография и скрытые каналы

  • ST3GG - Универсальный набор инструментов для стеганографии с многослойным кодированием, стеганографией изображений и аудио, а также инструментами стеганализа для обнаружения скрытых данных в ИИ-генерируемых медиа.

Бенчмарки и оценки

  • ISC-Bench - Internal Safety Collapse: выполняет джейлбрейк любой передовой LLM (Claude Opus 4.6, GPT-5.4) с pass@3 через обычное выполнение задач — без adversarial-промптинга. Black-box, кросс-доменный, кросс-научный. Новый режим отказа. [Статья]
  • jailbreakbench - JailbreakBench: открытый бенчмарк устойчивости для джейлбрейка языковых моделей [NeurIPS 2024 Datasets and Benchmarks Track]
  • AgentDojo - Динамическая среда для оценки атак и защиты LLM-агентов.
  • AIRTBench - Репозиторий с кодом для: AIRTBench: измерение возможностей автономного ИИ-редтиминга в языковых моделях
  • HackingBuddyGPT benchmark dataset - Набор данных бенчмарка для автоматизированного пентестинга
  • AgentDoG - AgentDoG — это фреймворк оценки и защиты автономных агентов с учётом рисков. Он фокусируется на оценке рисков на уровне траекторий, определяя, содержит ли траектория выполнения агента риски безопасности в различных сценариях применения.
  • AICGSecEval - Комплексный бенчмарк Tencent для оценки безопасности ИИ-генерации кода, охватывающий 10 категорий CWE с автоматизированной тестовой обвязкой
  • Inspect - Фреймворк для оценки больших языковых моделей от Института безопасности ИИ Великобритании. Более 200 готовых оценок, охватывающих промпт-инжиниринг, использование инструментов, многоходовые диалоги и оценку с помощью моделей.
  • sec-code-bench - Бенчмарк Alibaba для оценки возможностей LLM в области безопасности кода по 17 категориям уязвимостей и 4 языкам программирования

Защита и средства контроля безопасности

Гардрейлы ввода/вывода

  • NeMo-Guardrails - NeMo Guardrails — это набор инструментов с открытым исходным кодом для простого добавления программируемых гардрейлов в диалоговые системы на основе LLM.
  • LlamaFirewall - LlamaFirewall — это фреймворк, предназначенный для обнаружения и снижения рисков безопасности, связанных с ИИ. Поддерживает несколько уровней ввода и вывода: от типичного LLM-чата до более сложных многошаговых агентных операций.
  • llm-guard - LLM Guard от Protect AI — это комплексный инструмент, предназначенный для усиления безопасности больших языковых моделей (LLM).
  • Guardrails.ai - Guardrails — это Python-пакет, который позволяет пользователю добавлять гарантии структуры, типа и качества к выходам больших языковых моделей (LLM)
  • TrustGate - Generative Application Firewall (GAF) для обнаружения, предотвращения и блокировки атак на GenAI-приложения
  • ZenGuard AI - Самый быстрый доверительный слой (Trust Layer) для ИИ-агентов
  • LocalMod - API модерации контента для самостоятельного развёртывания с обнаружением prompt-инъекций, фильтрацией токсичности, детекцией PII и классификацией NSFW. Работает на 100% офлайн.
  • DynaGuard - Динамическая модель гардрейлов с определяемыми пользователем политиками
  • AprielGuard - Модель-предохранитель для безопасности и защищённости с 8 млрд параметров
  • Safe Zone - Safe Zone — это движок с открытым исходным кодом для обнаружения PII и гардрейлов, который предотвращает утечку чувствительных данных в LLM и сторонние API.
  • superagent - Superagent предоставляет специально обученные гардрейлы, которые делают ИИ-агентов безопасными и соответствующими требованиям.
  • ShellWard -

Безопасность среды выполнения агентов и песочницы

  • OpenShell - OpenShell — это безопасная и приватная среда выполнения для автономных ИИ-агентов. Предоставляет изолированные среды выполнения, управляемые декларативными YAML-политиками, которые предотвращают несанкционированный доступ к файлам, кражу данных и неконтролируемую сетевую активность.
  • OpenSandbox - Безопасная, быстрая и расширяемая среда выполнения-песочница для ИИ-агентов. Многоязычные SDK, среды выполнения Docker/Kubernetes, изоляция gVisor/Kata Containers/Firecracker. Проект в ландшафте CNCF.
  • CubeSandbox - Мгновенная, конкурентная, безопасная и лёгкая песочница для ИИ-агентов от Tencent Cloud. Холодный старт менее 60 мс, накладные расходы памяти <5 МБ, совместимость с E2B SDK. Построена на RustVMM и KVM с экстремальной изоляцией (выделенное ядро + eBPF).
  • Aegis - EDR с открытым исходным кодом для ИИ-агентов от Antropos. Отслеживайте процессы, файлы, сеть и поведение автономных ИИ-агентов в реальном времени. Без телеметрии и облака — всё остаётся локально.
  • Microsoft Agent Governance Toolkit - AI Agent Governance Toolkit от Microsoft — применение политик, zero-trust идентичность, изоляция выполнения и инженерия надёжности для автономных ИИ-агентов. Покрывает 10/10 пунктов OWASP Agentic Top 10.
  • agentfield - Контрольная плоскость с открытым исходным кодом для агентных систем с криптографической идентичностью, применением политик и наблюдаемостью, удобной для аудита.
  • leash - Leash помещает ИИ-агентов кодинга в контейнеры и отслеживает их активность.
  • vibekit - Запускайте Claude Code, Gemini, Codex — или любого агента кодинга — в чистой изолированной песочнице со встроенным маскированием чувствительных данных и наблюдаемостью.
  • pipelock - Защитная обвязка для ИИ-агентов — исходящий прокси со сканированием DLP, защитой от SSRF, сканированием MCP-ответов и мониторингом целостности рабочего пространства
  • skill-scanner -

Безопасность MCP

  • MCP-Security-Checklist - Комплексный чек-лист безопасности для ИИ-инструментов на основе MCP. Создан SlowMist для защиты экосистем LLM-плагинов.
  • Awesome-MCP-Security - Всё, что нужно знать о безопасности Model Context Protocol (MCP).
  • secure-mcp-gateway - Этот защищённый MCP-шлюз построен с аутентификацией, автоматическим обнаружением инструментов, кэшированием и применением гардрейлов.
  • mcp-context-protector - context-protector — это защитная обёртка для MCP-серверов, которая устраняет риски, связанные с запуском недоверенных MCP-серверов, включая перескакивание строк, неожиданные изменения конфигурации сервера и другие атаки с помощью prompt-инъекций
  • mcp-guardian - MCP Guardian управляет доступом вашего LLM-ассистента к MCP-серверам, предоставляя вам контроль над активностью LLM в реальном времени.
  • MCP Audit VSCode Extension - Централизованно аудируйте и регистрируйте все MCP-вызовы инструментов GitHub Copilot в VSCode с лёгкостью.
  • MCP-Scan - Инструмент сканирования безопасности для MCP-серверов
  • ATR (Agent Threat Rules) - Правила обнаружения угроз ИИ-агентов с открытым исходным кодом. 108 regex-правил, охватывающих prompt-инъекции, отравление инструментов и кражу учётных данных в 9 категориях. Используется Cisco AI Defense. Лицензия MIT.
  • MCPProxy - Локальный MCP-прокси со SHA-256-карантином для каждого инструмента для обнаружения атак отравления инструментов и rug-pull, автоматическим сканированием вызовов инструментов на чувствительные данные и секреты, изоляцией недоверенных MCP-серверов в Docker-песочнице и поддержкой OAuth 2.1. Лицензия MIT.

Сканирование моделей и артефактов

  • modelscan - ModelScan — это проект с открытым исходным кодом от Protect AI, который сканирует модели, чтобы определить, содержат ли они небезопасный код.
  • picklescan - Сканер безопасности, обнаруживающий Pickle-файлы Python, выполняющие подозрительные действия
  • fickling - Декомпилятор и статический анализатор Python pickling
  • medusa - Сканер безопасности с приоритетом ИИ: более 74 анализаторов, более 180 правил безопасности для ИИ-агентов, интеллектуальное снижение ложных срабатываний. Поддерживает все языки. Обнаружение CVE для React2Shell, mcp-remote RCE.
  • julius - Инструмент фингерпринтинга LLM-сервисов для специалистов по безопасности. Обнаруживает более 32 ИИ-сервисов (Ollama, vLLM, LiteLLM, Hugging Face TGI и др.) во время пентестов и выявления поверхности атаки. Использует HTTP-фингерпринтинг сервисов для идентификации серверной инфраструктуры.
  • a2a-scanner - Сканируйте A2A-агентов на предмет потенциальных угроз и проблем безопасности### AI-ассистируемая оборонительная безопасность
  • Claude Code Security Review - AI-ассистируемый GitHub Action для проверки безопасности, использующий Claude для анализа изменений кода на наличие уязвимостей.
  • deepsec - Агентный сканер уязвимостей от Vercel Labs для поиска труднообнаруживаемых проблем в больших кодовых базах с помощью агентов кодинга. Поддерживает параллельное сканирование, проверку диффов PR и интеграцию с CI/CD.
  • defending-code-reference-harness - Эталонная реализация для автономного обнаружения и устранения уязвимостей с помощью Claude. Включает навыки моделирования угроз, сканирования, триажа и исправления.
  • Visa Vulnerability Agentic Harness - Агентный конвейер SAST с 11 стадиями — от обнаружения до исправления на основе LLM и состязательной валидации. Выводит SARIF, интегрируется с Claude Code, Copilot и Gemini.

Приватность и конфиденциальные вычисления

  • Python Differential Privacy Library
  • Diffprivlib - Библиотека дифференциальной приватности IBM
  • TenSEAL - Библиотека для выполнения операций гомоморфного шифрования над тензорами
  • SyMPC - Компаньон-библиотека безопасных многосторонних вычислений (Secure Multiparty Computation) для Syft
  • Cloaked AI - Open-source шифрование с сохранением свойств для векторных эмбеддингов
  • dstack - Open-source фреймворк конфиденциального ИИ для безопасного развертывания ML/LLM с аппаратной изоляцией и приватностью данных
  • PrivacyRaven - библиотека тестирования приватности для систем глубокого обучения
  • PLOT4ai - Библиотека угроз приватности для ИИ (Privacy Library Of Threats 4 Artificial Intelligence) — библиотека моделирования угроз, помогающая создавать ответственный ИИ
  • OpenDP - Базовая библиотека алгоритмов дифференциальной приватности от проекта OpenDP — используется для создания конвейеров обучения ML с сохранением приватности

Безопасность данных и цепочки поставок

  • datasig - Снятие отпечатков наборов данных для AIBOM
  • OWASP AIBOM - Спецификация состава ИИ (AI Bill of Materials)
  • Trusera ai-bom - Спецификация состава ИИ (AI Bill of Materials) — обнаружьте каждого ИИ-агента, модель и API в вашей инфраструктуре

Навыки безопасности для агентного ИИ

  • Elastic Agent Skills - Набор навыков для ИИ-ассистента Elastic, позволяющий проводить расследования безопасности на естественном языке по логам, трейсам и данным threat intelligence
  • Ghost Security Skills - Навыки и инструменты агентной безопасности приложений (appsec) для Claude Code
  • tm_skills - Агентные навыки для помощи в непрерывном моделировании угроз
  • Trail of Bits Skills Marketplace - Навыки Trail of Bits для Claude Code для исследований в области безопасности, обнаружения уязвимостей и аудиторских процессов
  • Semgrep Skills - Официальные навыки Semgrep для Claude Code и других ИИ-ассистентов программирования. Предоставляют возможности сканирования безопасности, анализа кода и обнаружения уязвимостей прямо в вашем процессе разработки с ИИ-ассистированием.
  • claude-bug-bounty - Навык Claude Code для AI-ассистируемой охоты за багами. Автоматизирует разведку и тестирование IDOR, XSS, SSRF, OAuth, GraphQL и LLM-инъекций с контрольным списком валидации из 4 этапов и генерацией отчетов.
  • Anthropic Cybersecurity Skills - 734+ структурированных навыков кибербезопасности для ИИ-агентов. Сопоставлены с MITRE ATT&CK, стандарт agentskills.io. Совместимы с Claude Code, Copilot, Codex CLI, Cursor и Gemini CLI.
  • llm-sast-scanner - SAST-навык для ИИ-агентов кодинга (Claude Code, Codex и др.) со структурированным обнаружением уязвимостей по 34 классам. Включает анализ потоков данных «источник-сток» (source-to-sink taint analysis), верификацию Judge для снижения ложных срабатываний и точность/полноту 99%+ на бенчмарках.
  • sast-skills - Коллекция агентных навыков, превращающих вашего ИИ-кодера в SAST-сканер
  • pentest-ai-agents - 31 субагент Claude Code для наступательной безопасности. Специализированные ИИ-субагенты для разведки, веба, AD, облака, мобильных устройств, беспроводных сетей, социальной инженерии, создания пейлоадов, реверс-инжиниринга, связывания эксплойтов, detection engineering, форензики и генерации отчетов. Субагенты уровня Tier 2 могут напрямую выполнять инструменты с контрольными точками одобрения.

Модели ИИ, ориентированные на безопасность

  • VulnLLM-R-7B - Специализированная LLM с рассуждением для обнаружения уязвимостей. Использует цепочку рассуждений (Chain-of-Thought) для анализа потоков данных, управления и контекста безопасности. Превосходит Claude-3.7-Sonnet и CodeQL на бенчмарках обнаружения уязвимостей. Всего 7B параметров, что делает её эффективной и быстрой.
  • Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning — это open-weight языковая модель с 8 миллиардами параметров, дообученная на инструкциях и специализированная для задач кибербезопасности. Она наделяет базовую модель Foundation-Sec-8B способностями следовать инструкциям и рассуждать.
  • Antares (1B & 350M) - Агентные модели для локализации уязвимостей от fdtn-ai. Доступны в вариантах на 2B и 0.4B параметров, предназначены для автономного выявления и локализации уязвимостей в коде.
  • CyberSecQwen-4B - _Специалист по CTI на 4B параметров, дообученный на основе Qwen3-4B-Instruct-2507 для киберразведки угроз.
  • Meta-SecAlign-8B / Meta-SecAlign-70B - Модели Llama, выровненные по безопасности (security-aligned), дообученные для устойчивости к атакам промпт-инъекций и сохранения иерархии инструкций даже при состязательных входах
  • Lily-Cybersecurity-7B - Чат-модель на 7B, настроенная на кибербезопасность, оптимизирована для анализа безопасности, объяснения уязвимостей и задач киберразведки угроз.

Классификаторы безопасности и обнаружение промпт-инъекций

  • Llama-Guard-4-12B - Новейший мультимодальный классификатор безопасности от Meta для обнаружения вредоносного контента во входах и выходах LLM в текстовой и графической модальностях.
  • Llama-Prompt-Guard-2-86M - Легковесная модель на 86M параметров от Meta для обнаружения промпт-инъекций и джейлбрейк-попыток в production-конвейерах LLM.
  • ShieldGemma-2B - Текстовый классификатор безопасности от Google на 2B параметров для обнаружения вредоносного контента, построенный на архитектуре Gemma.
  • DeBERTa Prompt Injection Detector v2 - Модель DeBERTa-v3-base от Protect AI, дообученная для обнаружения промпт-инъекций, широко используемая в production-конвейерах защиты LLM.
  • Prompt Injection Sentinel - Модель ModernBERT-large, дообученная для классификации промпт-инъекций и джейлбрейков с низким уровнем ложных срабатываний.
  • Nemotron 3.5 Content Safety - Мультимодальная модель безопасности контента от NVIDIA на 4B параметров, объединяющая защитные механизмы ввода для текста и изображений, многоязычную поддержку (35+ языков), настраиваемое применение корпоративных политик и аудируемые рассуждения в одном вызове инференса. Преемник модели Nemotron 3 Content Safety.
  • BrowseSafe - Специализированная модель безопасности для обнаружения атак промпт-инъекций в ИИ-браузерных агентах. Достигает F1-скор 90.4% на BrowseSafe-Bench, оптимизирована для асинхронной классификации сырого HTML-контента в реальном времени.

Доменно-адаптированные языковые модели безопасности

  • ATTACK-BERT - Модель sentence-transformer для сопоставления текстов по безопасности с техниками MITRE ATT&CK.
  • CySecBERT - Модель BERT, адаптированная для задач кибербезопасности и CTI через доменно-специфическое предобучение.

Наборы данных

  • SafetyPrompts - Курируемая коллекция промптов, значимых для безопасности, для оценки свойств безопасности и защищённости LLM.
  • Do-Not-Answer - Набор промптов, на которые ответственные LLM не должны отвечать, для оценки безопасности и red teaming.
  • JailBreakV-28K - Крупномасштабный набор данных из 28 000 джейлбрейк-промптов для бенчмаркинга безопасности LLM.
  • CL4R1T4S - Утёкшие системные промпты из ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit и других крупных ИИ-инструментов. Крупнейшая известная коллекция production-системных промптов для исследований прозрачности и поверхности атак.
  • LEAKHUB - Лидерборд утечек системных промптов (System Prompt Leak Leaderboard) — сообщество для отслеживания и ранжирования утечек системных промптов в ИИ-продуктах.
  • Leaked System Prompts - Коллекция утёкших системных промптов из коммерческих ИИ-инструментов — полезна для понимания реального промпт-инжиниринга и поверхностей атак.
Скачать инструмент
CLI-сканер безопасности с открытым исходным кодом для агентных рабочих процессов.
  • RAPTOR - Автономный фреймворк для атакующих и защитных исследований в области безопасности, построенный на Claude Code. Объединяет статический анализ (Semgrep, CodeQL), анализ бинарных файлов, проверку уязвимостей с помощью LLM, генерацию эксплойтов и написание патчей. Мультимодельная оркестрация с анализом выполнимости на основе Z3.
  • whistleblower - Инструмент атакующей безопасности для тестирования утечки системного промпта и обнаружения возможностей ИИ-приложения, доступного через API
  • promptmap - сканер prompt-инъекций для пользовательских LLM-приложений
  • spikee - Простой набор для prompt-инъекций для оценки и эксплуатации
  • ps-fuzz - Сделайте свои GenAI-приложения безопасными — тестируйте и укрепляйте свой системный промпт
  • EasyEdit - Модификация ground truth LLM
  • llm-attacks - Универсальные и переносимые атаки на согласованные языковые модели
  • llm-security - Новые способы взлома LLM, интегрированных в приложения
  • Plexiglass - Набор инструментов для обнаружения уязвимостей в больших языковых моделях (LLM) и защиты от них.
  • Prompt Hacking Resources - Курируемый список ресурсов для интересующихся AI Red Teaming, джейлбрейками и prompt-инъекциями
  • Giskard - Оценка и тестирование с открытым исходным кодом для систем ИИ и LLM
  • blackice - BlackIce — это контейнеризированный набор инструментов с открытым исходным кодом, предназначенный для red teaming моделей ИИ, включая большие языковые модели (LLM) и классические модели машинного обучения (ML). Вдохновленный удобством и стандартизацией Kali Linux в традиционном пентесте, BlackIce упрощает оценку безопасности ИИ, предоставляя воспроизводимый образ контейнера с предварительно настроенными специализированными инструментами оценки.
  • ai-best-practices - Semgrep Pro Rules для обеспечения соблюдения лучших практик в коде, использующем LLM. 58 правил, 102 подправила, охватывающие 6 провайдеров + MCP + хуки Claude Code и Cursor + LangChain. Обнаруживает захардкоженные API-ключи, риски prompt-инъекций, отсутствующие проверки безопасности и необработанные ошибки на 7 языках.
  • G0DM0D3 - Открытый мультимодельный чат-интерфейс для red teaming с 50+ моделями через OpenRouter. Включает GODMODE CLASSIC (5 джейлбрейк-комбинаций), мультимодельную оценку ULTRAPLINIAN, движок возмущения входных данных Parseltongue с 33 техниками red teaming и адаптивную выборку AutoTune для исследований безопасности ИИ.
  • L1B3RT4S - Коллекция джейлбрейк- и «освобождающих» промптов для основных LLM. Курируемая библиотека состязательных промптов для тестирования и оценки защитных механизмов ИИ в ChatGPT, Claude, Gemini и других передовых моделях.
  • OBLITERATUS - Набор инструментов для аблитерации, который удаляет поведение отказа у LLM с открытым исходным кодом без переобучения. Изменяет веса модели, чтобы устранить отказы, обусловленные выравниванием безопасности, что позволяет проводить исследования неограниченного поведения модели.
  • T3MP3ST - Автономная платформа red teaming и мультиагентный мета-инструментарий атакующей безопасности. Координирует рои ИИ-агентов для согласованного состязательного тестирования передовых систем ИИ.
  • P4RS3LT0NGV3 - Универсальный набор инструментов для трансформации текста и создания промптов. Поддерживает перевод, мутацию, кодирование/декодирование и состязательный инжиниринг промптов для создания джейлбрейк-пейлоадов.
  • claude-secure-coding-rules - Открытые правила безопасности, которые направляют Claude Code на генерацию безопасного кода по умолчанию.
  • DeepTeam - Фреймворк LLM red teaming с 40+ методами атак, включая prompt-инъекции, джейлбрейки и отравление RAG. Интегрируется с CI/CD-конвейерами.
  • ИИ-нативная платформа тестирования безопасности, написанная на Go. Интегрирует более 100 инструментов безопасности с интеллектуальным механизмом оркестрации, ролевое тестирование с предопределёнными ролями безопасности, систему навыков и комплексное управление жизненным циклом. Использует протокол MCP и ИИ-агентов для сквозной автоматизации — от команд на естественном языке до обнаружения уязвимостей.
  • HexStrikeAI - HexStrike AI MCP Agents — это продвинутый MCP-сервер, который позволяет ИИ-агентам (Claude, GPT, Copilot и др.) автономно запускать более 150 инструментов кибербезопасности для автоматизированного пентестинга, обнаружения уязвимостей, автоматизации bug bounty и исследований в области безопасности.
  • mcp-for-security - Коллекция серверов Model Context Protocol для популярных инструментов безопасности, таких как SQLMap, FFUF, NMAP, Masscan и других. Интегрируйте тестирование безопасности и пентестинг в ИИ-рабочие процессы.
  • mcp-security-hub - Растущая коллекция MCP-серверов, предоставляющая ИИ-ассистентам доступ к инструментам наступательной безопасности: Nmap, Ghidra, Nuclei, SQLMap, Hashcat и другим.
  • Burp MCP Server - MCP-сервер для Burp
  • burpgpt - Расширение Burp Suite, которое интегрирует GPT от OpenAI для выполнения дополнительного пассивного сканирования с целью обнаружения узкоспециализированных уязвимостей и позволяет проводить анализ трафика любого типа.
  • guardian-cli - Тестирование безопасности и сканер уязвимостей на основе ИИ. Guardian CLI — это интеллектуальный инструмент тестирования безопасности, который использует ИИ для автоматизации пентестинга, оценки уязвимостей и аудита безопасности.
  • AutoPentestX - AutoPentestX — инструмент автоматизированного пентестинга и составления отчётов об уязвимостях для Linux
  • HackGPT - Инструмент, использующий ChatGPT для взлома
  • nano-analyzer - Минималистичный LLM-сканер zero-day уязвимостей от AISLE.
  • clearwing - Автономный сканер уязвимостей и охотник за уязвимостями в исходном коде, построенный на LangGraph.
  • Zen-AI-Pentest - Фреймворк пентестинга на основе ИИ с автоматизированным сканированием уязвимостей, мультиагентной системой и отчётностью о соответствии требованиям. Более 72 инструментов безопасности, Docker-песочница, ReAct-агенты, анализ путей атак.
  • Violin - Контролируемый агентный профиль пентестинга Hermes Agent: 31 плейбук на основе навыков (OWASP Top 10, API Top 10, LLM Top 10) с интерактивным скоупингом, валидацией границ и этапами согласования для авторизованной разведки, проверки эксплойтов и составления отчётов.
  • NeuroSploit - Автономный мультимодельный инструментарий для пентестинга на Rust. Пул LLM управляет разведкой, выбором агентов, связыванием эксплойтов и кросс-модельным голосованием за валидацию в режимах black-box, white-box, grey-box и облачных кампаний.
  • OpenHack - Мультиагентный сканер на основе ИИ, который автономно находит SQLi, XSS, IDOR и обход аутентификации в вашей кодовой базе, а затем проверяет каждую находку с помощью выполнения в песочнице и воспроизведения в браузере. На уровне Claude Opus 4.6 при примерно в 40 раз меньшей стоимости.
  • PentAGI - Полностью автономная мультиагентная система для сложных задач пентестинга. Изолированное выполнение в Docker, поддержка LLM от нескольких провайдеров (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), интеграция графа знаний и контроль агентов в реальном времени.
  • V3SP3R - Аппаратный хакерский компаньон на основе ИИ для Flipper Zero. Интерфейс на естественном языке для управления аппаратными атаками с интеграцией умных очков для работы без использования рук.
  • Middleware безопасности для ИИ-агентов с 8-уровневой защитой от prompt-инъекций, кражи данных и опасных команд. Ноль зависимостей.
  • CodeGate - Проект с открытым исходным кодом, ориентированный на конфиденциальность, который выступает в роли уровня безопасности в рабочем процессе разработчика по ИИ-генерации кода
  • Future AGI - Платформа с открытым исходным кодом для самостоятельного развёртывания со встроенными гардрейлами реального времени для небезопасных выходов (jailbreak, PII, инъекции, токсичность), оценками, трассировкой, симуляциями и шлюзом для LLM и агентных приложений.
  • Сканер безопасности для навыков ИИ-агентов, который обнаруживает prompt-инъекции, кражу данных и паттерны вредоносного кода. Сочетает обнаружение на основе паттернов (YAML + YARA), LLM-as-a-judge и поведенческий анализ потоков данных для комплексного выявления угроз.
  • SkillSpector - Сканер безопасности для навыков ИИ-агентов. Обнаруживает 64 паттерна уязвимостей в 16 категориях с помощью статического анализа и опциональной семантической оценки LLM. Вывод в нескольких форматах (JSON, Markdown, SARIF).
  • Project CodeGuard - Открытый проект CoSAI для защиты рабочих процессов разработки с помощью ИИ. CodeGuard предоставляет средства контроля безопасности и гардрейлы для ИИ-ассистентов кодинга, предотвращая появление уязвимостей при разработке ИИ-генерируемого кода.
  • AgentLens - Инструменты наблюдаемости и воспроизведения агентов для исследований безопасности и интерпретируемости ИИ. Среда для запуска многосессионных траекторий агентов, их захвата в формат ATIF и отслеживания изменений состояния файлов между сессиями. Создан для изучения поведения LLM-агентов в многоходовых, многосессионных и мультиагентных взаимодействиях.
  • claude-code-devcontainer - Изолированный devcontainer для безопасного запуска Claude Code в режиме bypass. Создан для аудитов безопасности и проверки недоверенного кода.
  • claude-code-safety-net - Плагин для Claude Code, который выступает в роли страховочной сети, перехватывая деструктивные git-команды и команды файловой системы до их выполнения
  • OneCLI - Хранилище учётных данных с открытым исходным кодом для ИИ-агентов. HTTP-шлюз на Rust перехватывает запросы агентов и прозрачно внедряет API-учётные данные, поэтому агенты никогда не хранят сырые ключи. Шифрование AES-256-GCM, скоуп на уровне агента, полный журнал аудита.
  • OpenSandbox - Безопасная, быстрая и расширяемая среда выполнения-песочница для ИИ-агентов. Многоязычные SDK, среды выполнения Docker/Kubernetes, изоляция gVisor/Kata Containers/Firecracker. Проект в ландшафте CNCF.
  • openclaw-shield - Плагин безопасности для агентов OpenClaw — предотвращает утечку секретов, раскрытие PII и выполнение деструктивных команд
  • clawsec - Сканер безопасности и инструмент усиления защиты для развёртываний OpenClaw. Предоставляет оценку безопасности, аудит конфигураций и обнаружение уязвимостей специально для конфигураций шлюза и агентов OpenClaw.
  • nanoclaw - Лёгкая альтернатива OpenClaw, которая для безопасности запускается в контейнерах. Подключается к WhatsApp, имеет память, планировщик задач и работает напрямую на Agents SDK от Anthropic. Первый ИИ-ассистент с поддержкой Agent Swarms для совместных агентных команд.
  • secureclaw - Автоматическое усиление безопасности ИИ-агентов OpenClaw от Adversa AI. 51 проверка аудита, 12 поведенческих правил, 9 скриптов, 4 базы паттернов. Полное покрытие OWASP ASI Top 10. Защищает от prompt-инъекций, кражи учётных данных, атак на цепочку поставок и утечек конфиденциальных данных.
  • defenseclaw - Корпоративный слой управления для OpenClaw от Cisco AI Defense. Сканирует навыки, MCP-серверы и плагины со встроенным CodeGuard SAST, движком проверки вызовов инструментов, прокси-гардрейлом для LLM и интеграцией с SIEM. Автоматически блокирует находки уровня HIGH/CRITICAL.
  • microsandbox - Лёгкая microVM-песочница для безопасного запуска недоверенного ИИ-генерируемого кода с сильными гарантиями изоляции
  • Adrian - Движок мониторинга и контроля безопасности среды выполнения для ИИ-агентов от Secure Agentics с открытым исходным кодом, соответствующий AARM. Анализирует журналы активности агентов (вызовы инструментов, действия, выходы) и трассы рассуждений для обнаружения вредоносного, несогласованного или выходящего за рамки полномочий поведения, с опциональным вмешательством на лету (режим аудита или блокировки). SDK на Python (LangChain/LangGraph) и TypeScript, полная поддержка самостоятельного развёртывания офлайн. Apache-2.0.
  • HOL Guard - Локальная защитная обвязка, которая перехватывает вызовы инструментов в ИИ-агентах кодинга (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) до изменения файлов или обращения к сети. Хуки перед вызовами инструментов, центр согласования, сканирование предупреждений о цепочке поставок и опциональная синхронизация с Guard Cloud.
  • GhidraGPT - Интегрирует модели GPT в Ghidra для автоматического анализа кода, переименования переменных, обнаружения уязвимостей и генерации объяснений.
  • IDAssist - Плагин для реверс-инжиниринга с поддержкой ИИ для IDA Pro. Интегрирует анализ на базе LLM в интерфейс IDA с семантическими графами знаний, поиском по документам через RAG и поддержкой нескольких LLM-провайдеров (OpenAI, Anthropic, Ollama, LiteLLM). Анализирует функции, предлагает переименования, отвечает на вопросы о коде.
  • ThreatForest - Агентная платформа моделирования угроз, построенная на фреймворке Strands. Автономно генерирует деревья атак из репозиториев, сопоставляет шаги атак с техниками MITRE ATT&CK и формирует практические рекомендации по смягчению последствий.
  • claude-grc-plugin - Плагин для Claude Code, превращающий Claude в старшего GRC-аналитика. 72+ справочных файла, покрывающих 15 фреймворков (NIST 800-53, FedRAMP, ISO 27001, SOC 2 и др.), 24 слэш-команды и глубокие доменные знания для работы по комплаенсу в федеральном и коммерческом секторах.
  • Vigil SOC - Комплексная open-source платформа операций безопасности для ИИ-агентов, обеспечивающая мониторинг в реальном времени, обнаружение угроз и реагирование на инциденты в средах на базе ИИ.
  • AiSOC - Open-source, самохостируемый SOC на базе ИИ, который принимает события безопасности, коррелирует их, проводит автономные расследования под управлением ИИ через LangGraph и выводит результаты в единую консоль. Включает полный аудит-трейл решений агента, публичный eval-харнесс в CI и 52 собственных коннектора. Лицензия MIT.
  • Mantis Skills - Раздельный последовательный конвейер агентных ИИ-навыков от Google, ориентированный на безопасность, для автономного анализа, дедупликации, валидации, воспроизведения и исправления уязвимостей в кодовых базах любого масштаба. Включает многостадийный конвейер (анализ архитектуры → моделирование угроз → исследование → анализ → воспроизведение → исправление → калибровка → рефлексия), встроенную песочницу и цикл непрерывного обучения, адаптирующийся между итеративными запусками. Поддерживает RTL-аппаратуру, IaC, ML-конвейеры и скомпилированные бинарные файлы.