NCSC Guidelines for Secure AI System Development - Практические рекомендации по безопасной разработке ИИ, подготовленные совместно NCSC (Великобритания) и CISA и охватывающие проектирование, разработку, развертывание и эксплуатацию.
Курсы, лаборатории и CTF
Damn Vulnerable MCP Server - Преднамеренно уязвимая реализация Model Context Protocol (MCP) в образовательных целях.
otto-support - Реализация уязвимого MCP-сервера на базе mcp-go с многоуровневой аутентификацией (4 роли), 19 инструментами и встроенным изолированным контейнером с Claude Code для отработки повышения привилегий и неправомерного использования инструментов.
vulnerable-mcp-servers-lab - Набор серверов с преднамеренными уязвимостями для обучения пентесту MCP-серверов.
FinBot Agentic AI Capture The Flag (CTF) Application - FinBot — это интерактивная платформа Agentic Security Capture The Flag (CTF), которая моделирует реальные уязвимости агентных систем ИИ с помощью симуляции приложения, ориентированного на финансовые услуги.
AI-Red-Teaming-Playground-Labs - Лабораторные площадки AI Red Teaming для проведения тренингов по AI Red Teaming, включая инфраструктуру.
Damn Vulnerable LLM Agent - Преднамеренно уязвимый LLM-агент для изучения prompt-инъекций, неправомерного использования инструментов и безопасности агентов
LLMVault - Открытая CTF-лаборатория по безопасности LLM для изучения OWASP LLM Top 10 с помощью практических упражнений на уязвимых системах, охватывающих prompt-инъекции, атаки на RAG, утечку системного промпта, неправомерное использование инструментов и безопасность агентов.
AI Security Ops - Еженедельные подкасты от Black Hills Information Security о том, как ИИ преобразует кибербезопасность — рассматриваются новые угрозы, инструменты и тренды с практическими, применимыми знаниями.
AI Verify - Поддерживаемый правительством Сингапура фреймворк и набор инструментов для тестирования ИИ и проверки свойств ИИ-систем на соответствие фреймворкам управления.
Таксономии, терминология и базы данных рисков
NIST AI 100-2e2023 - Таксономия и терминология состязательного машинного обучения
ATLAS Knowledge Base Agent - ИИ-ассистент с открытым исходным кодом для изучения базы знаний ATLAS с помощью естественного языка, доступа к MCP-серверу и настраиваемых агентных рабочих процессов.
The Arcanum Prompt Injection Taxonomy - Комплексная система классификации атак с помощью prompt-инъекций, охватывающая намерения атак, техники, обходы и векторы ввода. Категоризирует цели, методы, техники обфускации и поверхности атак для prompt-инъекций.
Состязательное машинное обучение и классические модели
Adversarial Robustness Toolkit - ART фокусируется на таких угрозах, как Evasion (изменение поведения модели с помощью модификации входных данных), Poisoning (контроль модели с помощью модификации обучающих данных), Extraction (кража модели через запросы) и Inference (атака на конфиденциальность обучающих данных)
cleverhans - Библиотека состязательных примеров для создания атак, построения защит и их бенчмаркинга
foolbox - Python-инструментарий для создания состязательных примеров, обманывающих нейронные сети в PyTorch, TensorFlow и JAX
TextAttack - Python-фреймворк для состязательных атак, дополнения данных и обучения моделей в NLP
Counterfit - Универсальный уровень автоматизации для оценки безопасности систем машинного обучения
ai-scanner - Веб-приложение с открытым исходным кодом для оценки безопасности моделей ИИ, построенное на NVIDIA garak. Включает 179 проб, сканирование нескольких целей, плановые сканирования, оценку ASR и интеграцию с SIEM.
promptfoo - Тестируйте свои промпты, агентов и RAG. Red teaming, пентест и сканирование уязвимостей для LLM. Сравнивайте производительность GPT, Claude, Gemini, Llama и других. Простые декларативные конфигурации с поддержкой командной строки и интеграцией в CI/CD.
PyRIT - Python Risk Identification Tool для генеративного ИИ (PyRIT) — это фреймворк с открытым исходным кодом, созданный, чтобы помочь специалистам по безопасности и инженерам активно выявлять риски в системах генеративного ИИ.
PurpleLlama - Набор инструментов для оценки и повышения безопасности LLM.
augustus - Фреймворк тестирования безопасности LLM для обнаружения prompt-инъекций, джейлбрейков и состязательных атак. 190+ проб, 28 провайдеров, один Go-бинарник. Готов к продакшену: параллельное сканирование, ограничение скорости и логика повторов.
FuzzyAI - Мощный инструмент для автоматизированного фаззинга LLM. Он помогает разработчикам и исследователям безопасности выявлять и устранять потенциальные джейлбрейки в их LLM API.
EasyJailbreak - Простой в использовании Python-фреймворк для генерации состязательных джейлбрейк-промптов.
gptfuzz - Официальный репозиторий GPTFUZZER: Red Teaming больших языковых моделей с автоматически генерируемыми джейлбрейк-промптами
llamator - Фреймворк для тестирования уязвимостей больших языковых моделей (LLM).
agentic_security - Сканер уязвимостей агентных LLM / набор для AI red teaming
RAMPART - pytest-нативный фреймворк тестирования safety и security агентных ИИ-приложений.
AI-Infra-Guard - Комплексная, интеллектуальная и простая в использовании платформа AI Red Teaming, разработанная Tencent Zhuque Lab. Объединяет модули Infra Scan, MCP Scan и Jailbreak Evaluation, предоставляя веб-интерфейс в один клик, REST API и развертывание на основе Docker для комплексной оценки безопасности ИИ.
AIMap - Платформа для обнаружения и тестирования безопасности в интернет-масштабе для открытой инфраструктуры ИИ-агентов. Запрашивает Shodan для поиска MCP-серверов, инстансов Ollama, прокси vLLM/LiteLLM и других — затем снимает отпечатки, оценивает риски и запускает протокол-специфичные наборы атак с потоковой выдачей результатов в реальном времени.### Наступательная безопасность с поддержкой ИИ
PentestGPT - Инструмент для пентестинга на основе GPT
HackingBuddyGPT - Помогает этичным хакерам использовать LLM в 50 строках кода или меньше
cai - Cybersecurity AI (CAI) — открытый ИИ, готовый к Bug Bounty (статья)
shannon - Полностью автономный ИИ-пентестер для веб-приложений и API от Keygraph. White-box тестирование безопасности, которое анализирует исходный код, выявляет векторы атак и выполняет реальные эксплойты. 96,15% успеха (100/104 эксплойтов) на бенчмарке XBOW.
strix - Strix — это автономные ИИ-агенты, которые действуют как настоящие хакеры: динамически запускают ваш код, находят уязвимости и подтверждают их реальными proof-of-concept
redamon - Агентный red team фреймворк на основе ИИ, который автоматизирует операции наступательной безопасности — от разведки до эксплуатации и постэксплуатации — без вмешательства человека.
ST3GG - Универсальный набор инструментов для стеганографии с многослойным кодированием, стеганографией изображений и аудио, а также инструментами стеганализа для обнаружения скрытых данных в ИИ-генерируемых медиа.
Бенчмарки и оценки
ISC-Bench - Internal Safety Collapse: выполняет джейлбрейк любой передовой LLM (Claude Opus 4.6, GPT-5.4) с pass@3 через обычное выполнение задач — без adversarial-промптинга. Black-box, кросс-доменный, кросс-научный. Новый режим отказа.[Статья]
jailbreakbench - JailbreakBench: открытый бенчмарк устойчивости для джейлбрейка языковых моделей [NeurIPS 2024 Datasets and Benchmarks Track]
AgentDojo - Динамическая среда для оценки атак и защиты LLM-агентов.
AIRTBench - Репозиторий с кодом для: AIRTBench: измерение возможностей автономного ИИ-редтиминга в языковых моделях
AgentDoG - AgentDoG — это фреймворк оценки и защиты автономных агентов с учётом рисков. Он фокусируется на оценке рисков на уровне траекторий, определяя, содержит ли траектория выполнения агента риски безопасности в различных сценариях применения.
AICGSecEval - Комплексный бенчмарк Tencent для оценки безопасности ИИ-генерации кода, охватывающий 10 категорий CWE с автоматизированной тестовой обвязкой
Inspect - Фреймворк для оценки больших языковых моделей от Института безопасности ИИ Великобритании. Более 200 готовых оценок, охватывающих промпт-инжиниринг, использование инструментов, многоходовые диалоги и оценку с помощью моделей.
sec-code-bench - Бенчмарк Alibaba для оценки возможностей LLM в области безопасности кода по 17 категориям уязвимостей и 4 языкам программирования
Защита и средства контроля безопасности
Гардрейлы ввода/вывода
NeMo-Guardrails - NeMo Guardrails — это набор инструментов с открытым исходным кодом для простого добавления программируемых гардрейлов в диалоговые системы на основе LLM.
LlamaFirewall - LlamaFirewall — это фреймворк, предназначенный для обнаружения и снижения рисков безопасности, связанных с ИИ. Поддерживает несколько уровней ввода и вывода: от типичного LLM-чата до более сложных многошаговых агентных операций.
llm-guard - LLM Guard от Protect AI — это комплексный инструмент, предназначенный для усиления безопасности больших языковых моделей (LLM).
Guardrails.ai - Guardrails — это Python-пакет, который позволяет пользователю добавлять гарантии структуры, типа и качества к выходам больших языковых моделей (LLM)
TrustGate - Generative Application Firewall (GAF) для обнаружения, предотвращения и блокировки атак на GenAI-приложения
ZenGuard AI - Самый быстрый доверительный слой (Trust Layer) для ИИ-агентов
LocalMod - API модерации контента для самостоятельного развёртывания с обнаружением prompt-инъекций, фильтрацией токсичности, детекцией PII и классификацией NSFW. Работает на 100% офлайн.
DynaGuard - Динамическая модель гардрейлов с определяемыми пользователем политиками
AprielGuard - Модель-предохранитель для безопасности и защищённости с 8 млрд параметров
Safe Zone - Safe Zone — это движок с открытым исходным кодом для обнаружения PII и гардрейлов, который предотвращает утечку чувствительных данных в LLM и сторонние API.
superagent - Superagent предоставляет специально обученные гардрейлы, которые делают ИИ-агентов безопасными и соответствующими требованиям.
OpenShell - OpenShell — это безопасная и приватная среда выполнения для автономных ИИ-агентов. Предоставляет изолированные среды выполнения, управляемые декларативными YAML-политиками, которые предотвращают несанкционированный доступ к файлам, кражу данных и неконтролируемую сетевую активность.
OpenSandbox - Безопасная, быстрая и расширяемая среда выполнения-песочница для ИИ-агентов. Многоязычные SDK, среды выполнения Docker/Kubernetes, изоляция gVisor/Kata Containers/Firecracker. Проект в ландшафте CNCF.
CubeSandbox - Мгновенная, конкурентная, безопасная и лёгкая песочница для ИИ-агентов от Tencent Cloud. Холодный старт менее 60 мс, накладные расходы памяти <5 МБ, совместимость с E2B SDK. Построена на RustVMM и KVM с экстремальной изоляцией (выделенное ядро + eBPF).
Aegis - EDR с открытым исходным кодом для ИИ-агентов от Antropos. Отслеживайте процессы, файлы, сеть и поведение автономных ИИ-агентов в реальном времени. Без телеметрии и облака — всё остаётся локально.
Microsoft Agent Governance Toolkit - AI Agent Governance Toolkit от Microsoft — применение политик, zero-trust идентичность, изоляция выполнения и инженерия надёжности для автономных ИИ-агентов. Покрывает 10/10 пунктов OWASP Agentic Top 10.
agentfield - Контрольная плоскость с открытым исходным кодом для агентных систем с криптографической идентичностью, применением политик и наблюдаемостью, удобной для аудита.
leash - Leash помещает ИИ-агентов кодинга в контейнеры и отслеживает их активность.
vibekit - Запускайте Claude Code, Gemini, Codex — или любого агента кодинга — в чистой изолированной песочнице со встроенным маскированием чувствительных данных и наблюдаемостью.
pipelock - Защитная обвязка для ИИ-агентов — исходящий прокси со сканированием DLP, защитой от SSRF, сканированием MCP-ответов и мониторингом целостности рабочего пространства
MCP-Security-Checklist - Комплексный чек-лист безопасности для ИИ-инструментов на основе MCP. Создан SlowMist для защиты экосистем LLM-плагинов.
Awesome-MCP-Security - Всё, что нужно знать о безопасности Model Context Protocol (MCP).
secure-mcp-gateway - Этот защищённый MCP-шлюз построен с аутентификацией, автоматическим обнаружением инструментов, кэшированием и применением гардрейлов.
mcp-context-protector - context-protector — это защитная обёртка для MCP-серверов, которая устраняет риски, связанные с запуском недоверенных MCP-серверов, включая перескакивание строк, неожиданные изменения конфигурации сервера и другие атаки с помощью prompt-инъекций
mcp-guardian - MCP Guardian управляет доступом вашего LLM-ассистента к MCP-серверам, предоставляя вам контроль над активностью LLM в реальном времени.
MCP Audit VSCode Extension - Централизованно аудируйте и регистрируйте все MCP-вызовы инструментов GitHub Copilot в VSCode с лёгкостью.
MCP-Scan - Инструмент сканирования безопасности для MCP-серверов
ATR (Agent Threat Rules) - Правила обнаружения угроз ИИ-агентов с открытым исходным кодом. 108 regex-правил, охватывающих prompt-инъекции, отравление инструментов и кражу учётных данных в 9 категориях. Используется Cisco AI Defense. Лицензия MIT.
MCPProxy - Локальный MCP-прокси со SHA-256-карантином для каждого инструмента для обнаружения атак отравления инструментов и rug-pull, автоматическим сканированием вызовов инструментов на чувствительные данные и секреты, изоляцией недоверенных MCP-серверов в Docker-песочнице и поддержкой OAuth 2.1. Лицензия MIT.
Сканирование моделей и артефактов
modelscan - ModelScan — это проект с открытым исходным кодом от Protect AI, который сканирует модели, чтобы определить, содержат ли они небезопасный код.
picklescan - Сканер безопасности, обнаруживающий Pickle-файлы Python, выполняющие подозрительные действия
fickling - Декомпилятор и статический анализатор Python pickling
medusa - Сканер безопасности с приоритетом ИИ: более 74 анализаторов, более 180 правил безопасности для ИИ-агентов, интеллектуальное снижение ложных срабатываний. Поддерживает все языки. Обнаружение CVE для React2Shell, mcp-remote RCE.
julius - Инструмент фингерпринтинга LLM-сервисов для специалистов по безопасности. Обнаруживает более 32 ИИ-сервисов (Ollama, vLLM, LiteLLM, Hugging Face TGI и др.) во время пентестов и выявления поверхности атаки. Использует HTTP-фингерпринтинг сервисов для идентификации серверной инфраструктуры.
a2a-scanner - Сканируйте A2A-агентов на предмет потенциальных угроз и проблем безопасности### AI-ассистируемая оборонительная безопасность
Claude Code Security Review - AI-ассистируемый GitHub Action для проверки безопасности, использующий Claude для анализа изменений кода на наличие уязвимостей.
deepsec - Агентный сканер уязвимостей от Vercel Labs для поиска труднообнаруживаемых проблем в больших кодовых базах с помощью агентов кодинга. Поддерживает параллельное сканирование, проверку диффов PR и интеграцию с CI/CD.
defending-code-reference-harness - Эталонная реализация для автономного обнаружения и устранения уязвимостей с помощью Claude. Включает навыки моделирования угроз, сканирования, триажа и исправления.
Visa Vulnerability Agentic Harness - Агентный конвейер SAST с 11 стадиями — от обнаружения до исправления на основе LLM и состязательной валидации. Выводит SARIF, интегрируется с Claude Code, Copilot и Gemini.
Cloaked AI - Open-source шифрование с сохранением свойств для векторных эмбеддингов
dstack - Open-source фреймворк конфиденциального ИИ для безопасного развертывания ML/LLM с аппаратной изоляцией и приватностью данных
PrivacyRaven - библиотека тестирования приватности для систем глубокого обучения
PLOT4ai - Библиотека угроз приватности для ИИ (Privacy Library Of Threats 4 Artificial Intelligence) — библиотека моделирования угроз, помогающая создавать ответственный ИИ
OpenDP - Базовая библиотека алгоритмов дифференциальной приватности от проекта OpenDP — используется для создания конвейеров обучения ML с сохранением приватности
Безопасность данных и цепочки поставок
datasig - Снятие отпечатков наборов данных для AIBOM
OWASP AIBOM - Спецификация состава ИИ (AI Bill of Materials)
Trusera ai-bom - Спецификация состава ИИ (AI Bill of Materials) — обнаружьте каждого ИИ-агента, модель и API в вашей инфраструктуре
Навыки безопасности для агентного ИИ
Elastic Agent Skills - Набор навыков для ИИ-ассистента Elastic, позволяющий проводить расследования безопасности на естественном языке по логам, трейсам и данным threat intelligence
Ghost Security Skills - Навыки и инструменты агентной безопасности приложений (appsec) для Claude Code
tm_skills - Агентные навыки для помощи в непрерывном моделировании угроз
Trail of Bits Skills Marketplace - Навыки Trail of Bits для Claude Code для исследований в области безопасности, обнаружения уязвимостей и аудиторских процессов
Semgrep Skills - Официальные навыки Semgrep для Claude Code и других ИИ-ассистентов программирования. Предоставляют возможности сканирования безопасности, анализа кода и обнаружения уязвимостей прямо в вашем процессе разработки с ИИ-ассистированием.
claude-bug-bounty - Навык Claude Code для AI-ассистируемой охоты за багами. Автоматизирует разведку и тестирование IDOR, XSS, SSRF, OAuth, GraphQL и LLM-инъекций с контрольным списком валидации из 4 этапов и генерацией отчетов.
Anthropic Cybersecurity Skills - 734+ структурированных навыков кибербезопасности для ИИ-агентов. Сопоставлены с MITRE ATT&CK, стандарт agentskills.io. Совместимы с Claude Code, Copilot, Codex CLI, Cursor и Gemini CLI.
llm-sast-scanner - SAST-навык для ИИ-агентов кодинга (Claude Code, Codex и др.) со структурированным обнаружением уязвимостей по 34 классам. Включает анализ потоков данных «источник-сток» (source-to-sink taint analysis), верификацию Judge для снижения ложных срабатываний и точность/полноту 99%+ на бенчмарках.
sast-skills - Коллекция агентных навыков, превращающих вашего ИИ-кодера в SAST-сканер
pentest-ai-agents - 31 субагент Claude Code для наступательной безопасности. Специализированные ИИ-субагенты для разведки, веба, AD, облака, мобильных устройств, беспроводных сетей, социальной инженерии, создания пейлоадов, реверс-инжиниринга, связывания эксплойтов, detection engineering, форензики и генерации отчетов. Субагенты уровня Tier 2 могут напрямую выполнять инструменты с контрольными точками одобрения.
Модели ИИ, ориентированные на безопасность
VulnLLM-R-7B - Специализированная LLM с рассуждением для обнаружения уязвимостей. Использует цепочку рассуждений (Chain-of-Thought) для анализа потоков данных, управления и контекста безопасности. Превосходит Claude-3.7-Sonnet и CodeQL на бенчмарках обнаружения уязвимостей. Всего 7B параметров, что делает её эффективной и быстрой.
Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning — это open-weight языковая модель с 8 миллиардами параметров, дообученная на инструкциях и специализированная для задач кибербезопасности. Она наделяет базовую модель Foundation-Sec-8B способностями следовать инструкциям и рассуждать.
Antares (1B & 350M) - Агентные модели для локализации уязвимостей от fdtn-ai. Доступны в вариантах на 2B и 0.4B параметров, предназначены для автономного выявления и локализации уязвимостей в коде.
CyberSecQwen-4B - _Специалист по CTI на 4B параметров, дообученный на основе Qwen3-4B-Instruct-2507 для киберразведки угроз.
Meta-SecAlign-8B / Meta-SecAlign-70B - Модели Llama, выровненные по безопасности (security-aligned), дообученные для устойчивости к атакам промпт-инъекций и сохранения иерархии инструкций даже при состязательных входах
Lily-Cybersecurity-7B - Чат-модель на 7B, настроенная на кибербезопасность, оптимизирована для анализа безопасности, объяснения уязвимостей и задач киберразведки угроз.
Классификаторы безопасности и обнаружение промпт-инъекций
Llama-Guard-4-12B - Новейший мультимодальный классификатор безопасности от Meta для обнаружения вредоносного контента во входах и выходах LLM в текстовой и графической модальностях.
Llama-Prompt-Guard-2-86M - Легковесная модель на 86M параметров от Meta для обнаружения промпт-инъекций и джейлбрейк-попыток в production-конвейерах LLM.
ShieldGemma-2B - Текстовый классификатор безопасности от Google на 2B параметров для обнаружения вредоносного контента, построенный на архитектуре Gemma.
DeBERTa Prompt Injection Detector v2 - Модель DeBERTa-v3-base от Protect AI, дообученная для обнаружения промпт-инъекций, широко используемая в production-конвейерах защиты LLM.
Prompt Injection Sentinel - Модель ModernBERT-large, дообученная для классификации промпт-инъекций и джейлбрейков с низким уровнем ложных срабатываний.
Nemotron 3.5 Content Safety - Мультимодальная модель безопасности контента от NVIDIA на 4B параметров, объединяющая защитные механизмы ввода для текста и изображений, многоязычную поддержку (35+ языков), настраиваемое применение корпоративных политик и аудируемые рассуждения в одном вызове инференса. Преемник модели Nemotron 3 Content Safety.
BrowseSafe - Специализированная модель безопасности для обнаружения атак промпт-инъекций в ИИ-браузерных агентах. Достигает F1-скор 90.4% на BrowseSafe-Bench, оптимизирована для асинхронной классификации сырого HTML-контента в реальном времени.
Доменно-адаптированные языковые модели безопасности
ATTACK-BERT - Модель sentence-transformer для сопоставления текстов по безопасности с техниками MITRE ATT&CK.
CySecBERT - Модель BERT, адаптированная для задач кибербезопасности и CTI через доменно-специфическое предобучение.
Наборы данных
SafetyPrompts - Курируемая коллекция промптов, значимых для безопасности, для оценки свойств безопасности и защищённости LLM.
Do-Not-Answer - Набор промптов, на которые ответственные LLM не должны отвечать, для оценки безопасности и red teaming.
JailBreakV-28K - Крупномасштабный набор данных из 28 000 джейлбрейк-промптов для бенчмаркинга безопасности LLM.
CL4R1T4S - Утёкшие системные промпты из ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit и других крупных ИИ-инструментов. Крупнейшая известная коллекция production-системных промптов для исследований прозрачности и поверхности атак.
LEAKHUB - Лидерборд утечек системных промптов (System Prompt Leak Leaderboard) — сообщество для отслеживания и ранжирования утечек системных промптов в ИИ-продуктах.
Leaked System Prompts - Коллекция утёкших системных промптов из коммерческих ИИ-инструментов — полезна для понимания реального промпт-инжиниринга и поверхностей атак.
CLI-сканер безопасности с открытым исходным кодом для агентных рабочих процессов.
RAPTOR - Автономный фреймворк для атакующих и защитных исследований в области безопасности, построенный на Claude Code. Объединяет статический анализ (Semgrep, CodeQL), анализ бинарных файлов, проверку уязвимостей с помощью LLM, генерацию эксплойтов и написание патчей. Мультимодельная оркестрация с анализом выполнимости на основе Z3.
whistleblower - Инструмент атакующей безопасности для тестирования утечки системного промпта и обнаружения возможностей ИИ-приложения, доступного через API
promptmap - сканер prompt-инъекций для пользовательских LLM-приложений
spikee - Простой набор для prompt-инъекций для оценки и эксплуатации
ps-fuzz - Сделайте свои GenAI-приложения безопасными — тестируйте и укрепляйте свой системный промпт
llm-attacks - Универсальные и переносимые атаки на согласованные языковые модели
llm-security - Новые способы взлома LLM, интегрированных в приложения
Plexiglass - Набор инструментов для обнаружения уязвимостей в больших языковых моделях (LLM) и защиты от них.
Prompt Hacking Resources - Курируемый список ресурсов для интересующихся AI Red Teaming, джейлбрейками и prompt-инъекциями
Giskard - Оценка и тестирование с открытым исходным кодом для систем ИИ и LLM
blackice - BlackIce — это контейнеризированный набор инструментов с открытым исходным кодом, предназначенный для red teaming моделей ИИ, включая большие языковые модели (LLM) и классические модели машинного обучения (ML). Вдохновленный удобством и стандартизацией Kali Linux в традиционном пентесте, BlackIce упрощает оценку безопасности ИИ, предоставляя воспроизводимый образ контейнера с предварительно настроенными специализированными инструментами оценки.
ai-best-practices - Semgrep Pro Rules для обеспечения соблюдения лучших практик в коде, использующем LLM. 58 правил, 102 подправила, охватывающие 6 провайдеров + MCP + хуки Claude Code и Cursor + LangChain. Обнаруживает захардкоженные API-ключи, риски prompt-инъекций, отсутствующие проверки безопасности и необработанные ошибки на 7 языках.
G0DM0D3 - Открытый мультимодельный чат-интерфейс для red teaming с 50+ моделями через OpenRouter. Включает GODMODE CLASSIC (5 джейлбрейк-комбинаций), мультимодельную оценку ULTRAPLINIAN, движок возмущения входных данных Parseltongue с 33 техниками red teaming и адаптивную выборку AutoTune для исследований безопасности ИИ.
L1B3RT4S - Коллекция джейлбрейк- и «освобождающих» промптов для основных LLM. Курируемая библиотека состязательных промптов для тестирования и оценки защитных механизмов ИИ в ChatGPT, Claude, Gemini и других передовых моделях.
OBLITERATUS - Набор инструментов для аблитерации, который удаляет поведение отказа у LLM с открытым исходным кодом без переобучения. Изменяет веса модели, чтобы устранить отказы, обусловленные выравниванием безопасности, что позволяет проводить исследования неограниченного поведения модели.
T3MP3ST - Автономная платформа red teaming и мультиагентный мета-инструментарий атакующей безопасности. Координирует рои ИИ-агентов для согласованного состязательного тестирования передовых систем ИИ.
P4RS3LT0NGV3 - Универсальный набор инструментов для трансформации текста и создания промптов. Поддерживает перевод, мутацию, кодирование/декодирование и состязательный инжиниринг промптов для создания джейлбрейк-пейлоадов.
claude-secure-coding-rules - Открытые правила безопасности, которые направляют Claude Code на генерацию безопасного кода по умолчанию.
DeepTeam - Фреймворк LLM red teaming с 40+ методами атак, включая prompt-инъекции, джейлбрейки и отравление RAG. Интегрируется с CI/CD-конвейерами.
ИИ-нативная платформа тестирования безопасности, написанная на Go. Интегрирует более 100 инструментов безопасности с интеллектуальным механизмом оркестрации, ролевое тестирование с предопределёнными ролями безопасности, систему навыков и комплексное управление жизненным циклом. Использует протокол MCP и ИИ-агентов для сквозной автоматизации — от команд на естественном языке до обнаружения уязвимостей.
HexStrikeAI - HexStrike AI MCP Agents — это продвинутый MCP-сервер, который позволяет ИИ-агентам (Claude, GPT, Copilot и др.) автономно запускать более 150 инструментов кибербезопасности для автоматизированного пентестинга, обнаружения уязвимостей, автоматизации bug bounty и исследований в области безопасности.
mcp-for-security - Коллекция серверов Model Context Protocol для популярных инструментов безопасности, таких как SQLMap, FFUF, NMAP, Masscan и других. Интегрируйте тестирование безопасности и пентестинг в ИИ-рабочие процессы.
mcp-security-hub - Растущая коллекция MCP-серверов, предоставляющая ИИ-ассистентам доступ к инструментам наступательной безопасности: Nmap, Ghidra, Nuclei, SQLMap, Hashcat и другим.
burpgpt - Расширение Burp Suite, которое интегрирует GPT от OpenAI для выполнения дополнительного пассивного сканирования с целью обнаружения узкоспециализированных уязвимостей и позволяет проводить анализ трафика любого типа.
guardian-cli - Тестирование безопасности и сканер уязвимостей на основе ИИ. Guardian CLI — это интеллектуальный инструмент тестирования безопасности, который использует ИИ для автоматизации пентестинга, оценки уязвимостей и аудита безопасности.
AutoPentestX - AutoPentestX — инструмент автоматизированного пентестинга и составления отчётов об уязвимостях для Linux
HackGPT - Инструмент, использующий ChatGPT для взлома
nano-analyzer - Минималистичный LLM-сканер zero-day уязвимостей от AISLE.
clearwing - Автономный сканер уязвимостей и охотник за уязвимостями в исходном коде, построенный на LangGraph.
Zen-AI-Pentest - Фреймворк пентестинга на основе ИИ с автоматизированным сканированием уязвимостей, мультиагентной системой и отчётностью о соответствии требованиям. Более 72 инструментов безопасности, Docker-песочница, ReAct-агенты, анализ путей атак.
Violin - Контролируемый агентный профиль пентестинга Hermes Agent: 31 плейбук на основе навыков (OWASP Top 10, API Top 10, LLM Top 10) с интерактивным скоупингом, валидацией границ и этапами согласования для авторизованной разведки, проверки эксплойтов и составления отчётов.
NeuroSploit - Автономный мультимодельный инструментарий для пентестинга на Rust. Пул LLM управляет разведкой, выбором агентов, связыванием эксплойтов и кросс-модельным голосованием за валидацию в режимах black-box, white-box, grey-box и облачных кампаний.
OpenHack - Мультиагентный сканер на основе ИИ, который автономно находит SQLi, XSS, IDOR и обход аутентификации в вашей кодовой базе, а затем проверяет каждую находку с помощью выполнения в песочнице и воспроизведения в браузере. На уровне Claude Opus 4.6 при примерно в 40 раз меньшей стоимости.
PentAGI - Полностью автономная мультиагентная система для сложных задач пентестинга. Изолированное выполнение в Docker, поддержка LLM от нескольких провайдеров (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), интеграция графа знаний и контроль агентов в реальном времени.
V3SP3R - Аппаратный хакерский компаньон на основе ИИ для Flipper Zero. Интерфейс на естественном языке для управления аппаратными атаками с интеграцией умных очков для работы без использования рук.
Middleware безопасности для ИИ-агентов с 8-уровневой защитой от prompt-инъекций, кражи данных и опасных команд. Ноль зависимостей.
CodeGate - Проект с открытым исходным кодом, ориентированный на конфиденциальность, который выступает в роли уровня безопасности в рабочем процессе разработчика по ИИ-генерации кода
Future AGI - Платформа с открытым исходным кодом для самостоятельного развёртывания со встроенными гардрейлами реального времени для небезопасных выходов (jailbreak, PII, инъекции, токсичность), оценками, трассировкой, симуляциями и шлюзом для LLM и агентных приложений.
Сканер безопасности для навыков ИИ-агентов, который обнаруживает prompt-инъекции, кражу данных и паттерны вредоносного кода. Сочетает обнаружение на основе паттернов (YAML + YARA), LLM-as-a-judge и поведенческий анализ потоков данных для комплексного выявления угроз.
SkillSpector - Сканер безопасности для навыков ИИ-агентов. Обнаруживает 64 паттерна уязвимостей в 16 категориях с помощью статического анализа и опциональной семантической оценки LLM. Вывод в нескольких форматах (JSON, Markdown, SARIF).
Project CodeGuard - Открытый проект CoSAI для защиты рабочих процессов разработки с помощью ИИ. CodeGuard предоставляет средства контроля безопасности и гардрейлы для ИИ-ассистентов кодинга, предотвращая появление уязвимостей при разработке ИИ-генерируемого кода.
AgentLens - Инструменты наблюдаемости и воспроизведения агентов для исследований безопасности и интерпретируемости ИИ. Среда для запуска многосессионных траекторий агентов, их захвата в формат ATIF и отслеживания изменений состояния файлов между сессиями. Создан для изучения поведения LLM-агентов в многоходовых, многосессионных и мультиагентных взаимодействиях.
claude-code-devcontainer - Изолированный devcontainer для безопасного запуска Claude Code в режиме bypass. Создан для аудитов безопасности и проверки недоверенного кода.
claude-code-safety-net - Плагин для Claude Code, который выступает в роли страховочной сети, перехватывая деструктивные git-команды и команды файловой системы до их выполнения
OneCLI - Хранилище учётных данных с открытым исходным кодом для ИИ-агентов. HTTP-шлюз на Rust перехватывает запросы агентов и прозрачно внедряет API-учётные данные, поэтому агенты никогда не хранят сырые ключи. Шифрование AES-256-GCM, скоуп на уровне агента, полный журнал аудита.
OpenSandbox - Безопасная, быстрая и расширяемая среда выполнения-песочница для ИИ-агентов. Многоязычные SDK, среды выполнения Docker/Kubernetes, изоляция gVisor/Kata Containers/Firecracker. Проект в ландшафте CNCF.
openclaw-shield - Плагин безопасности для агентов OpenClaw — предотвращает утечку секретов, раскрытие PII и выполнение деструктивных команд
clawsec - Сканер безопасности и инструмент усиления защиты для развёртываний OpenClaw. Предоставляет оценку безопасности, аудит конфигураций и обнаружение уязвимостей специально для конфигураций шлюза и агентов OpenClaw.
nanoclaw - Лёгкая альтернатива OpenClaw, которая для безопасности запускается в контейнерах. Подключается к WhatsApp, имеет память, планировщик задач и работает напрямую на Agents SDK от Anthropic. Первый ИИ-ассистент с поддержкой Agent Swarms для совместных агентных команд.
secureclaw - Автоматическое усиление безопасности ИИ-агентов OpenClaw от Adversa AI. 51 проверка аудита, 12 поведенческих правил, 9 скриптов, 4 базы паттернов. Полное покрытие OWASP ASI Top 10. Защищает от prompt-инъекций, кражи учётных данных, атак на цепочку поставок и утечек конфиденциальных данных.
defenseclaw - Корпоративный слой управления для OpenClaw от Cisco AI Defense. Сканирует навыки, MCP-серверы и плагины со встроенным CodeGuard SAST, движком проверки вызовов инструментов, прокси-гардрейлом для LLM и интеграцией с SIEM. Автоматически блокирует находки уровня HIGH/CRITICAL.
microsandbox - Лёгкая microVM-песочница для безопасного запуска недоверенного ИИ-генерируемого кода с сильными гарантиями изоляции
Adrian - Движок мониторинга и контроля безопасности среды выполнения для ИИ-агентов от Secure Agentics с открытым исходным кодом, соответствующий AARM. Анализирует журналы активности агентов (вызовы инструментов, действия, выходы) и трассы рассуждений для обнаружения вредоносного, несогласованного или выходящего за рамки полномочий поведения, с опциональным вмешательством на лету (режим аудита или блокировки). SDK на Python (LangChain/LangGraph) и TypeScript, полная поддержка самостоятельного развёртывания офлайн. Apache-2.0.
HOL Guard - Локальная защитная обвязка, которая перехватывает вызовы инструментов в ИИ-агентах кодинга (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) до изменения файлов или обращения к сети. Хуки перед вызовами инструментов, центр согласования, сканирование предупреждений о цепочке поставок и опциональная синхронизация с Guard Cloud.
GhidraGPT - Интегрирует модели GPT в Ghidra для автоматического анализа кода, переименования переменных, обнаружения уязвимостей и генерации объяснений.
IDAssist - Плагин для реверс-инжиниринга с поддержкой ИИ для IDA Pro. Интегрирует анализ на базе LLM в интерфейс IDA с семантическими графами знаний, поиском по документам через RAG и поддержкой нескольких LLM-провайдеров (OpenAI, Anthropic, Ollama, LiteLLM). Анализирует функции, предлагает переименования, отвечает на вопросы о коде.
ThreatForest - Агентная платформа моделирования угроз, построенная на фреймворке Strands. Автономно генерирует деревья атак из репозиториев, сопоставляет шаги атак с техниками MITRE ATT&CK и формирует практические рекомендации по смягчению последствий.
claude-grc-plugin - Плагин для Claude Code, превращающий Claude в старшего GRC-аналитика. 72+ справочных файла, покрывающих 15 фреймворков (NIST 800-53, FedRAMP, ISO 27001, SOC 2 и др.), 24 слэш-команды и глубокие доменные знания для работы по комплаенсу в федеральном и коммерческом секторах.
Vigil SOC - Комплексная open-source платформа операций безопасности для ИИ-агентов, обеспечивающая мониторинг в реальном времени, обнаружение угроз и реагирование на инциденты в средах на базе ИИ.
AiSOC - Open-source, самохостируемый SOC на базе ИИ, который принимает события безопасности, коррелирует их, проводит автономные расследования под управлением ИИ через LangGraph и выводит результаты в единую консоль. Включает полный аудит-трейл решений агента, публичный eval-харнесс в CI и 52 собственных коннектора. Лицензия MIT.
Mantis Skills - Раздельный последовательный конвейер агентных ИИ-навыков от Google, ориентированный на безопасность, для автономного анализа, дедупликации, валидации, воспроизведения и исправления уязвимостей в кодовых базах любого масштаба. Включает многостадийный конвейер (анализ архитектуры → моделирование угроз → исследование → анализ → воспроизведение → исправление → калибровка → рефлексия), встроенную песочницу и цикл непрерывного обучения, адаптирующийся между итеративными запусками. Поддерживает RTL-аппаратуру, IaC, ML-конвейеры и скомпилированные бинарные файлы.