Securekit
Securekit защищает то, что выполняют ваши модели — в любой ИИ-системе.
Securekit — это протокол-агностическое ядро безопасности для выполнения инструментов ИИ.
Оно располагается между любой LLM или агентной системой и используемыми ими инструментами, обеспечивая выполнение с нулевым доверием, песочную изоляцию и управление на основе политик.
Оно спроектировано как готовое к внедрению, модульное и расширяемое, работающее с MCP, вызовом инструментов OpenAI и пользовательскими агентными фреймворками.
🧠 Зачем существует Securekit
Современные ИИ-системы больше не просто генерируют текст — они выполняют действия:
- чтение и запись файлов
- вызов внешних API
- запуск кода
- запуск рабочих процессов
- взаимодействие с системами и сетями
Это создаёт критический риск:
Каждый вызов инструмента — это потенциальная поверхность атаки.
Securekit внедряет универсальный уровень безопасности выполнения, который обеспечивает контроль до выполнения любого действия.
🧱 Обзор архитектуры
LLM / Агентная система
↓
Уровень протокольных адаптеров
(MCP / OpenAI / Пользовательский / Будущие протоколы)
↓
Ядро Securekit
- Механизм политик
- Система возможностей
- Межсетевой экран для промптов
- Механизм оценки рисков
- Классификатор намерений
- Межсетевой экран потоков данных
- Аудит и квитанции
↓
Оркестратор песочниц
(gVisor / Firecracker / Docker / WASM)
↓
Уровень контролируемого выполнения
(Файловая система / Сеть / Границы системы)
⚙️ Полный список функций
🔌 Протокол-агностический дизайн
- Работает с любой ИИ-системой или агентным фреймворком
- Адаптерный уровень, совместимый с MCP
- Поддержка вызова инструментов/функций OpenAI
- Интерфейс пользовательских протокольных адаптеров
- Перспективный уровень абстракции протоколов
🛡️ Механизм политик с нулевым доверием
- Каждый вызов инструмента проверяется до выполнения
- Декларативные правила политик
- Многоуровневое наследование политик (глобальная, организационная, проектная, сессионная)
- Модель безопасности «запрещено по умолчанию»
🧩 Система возможностей
- Ограниченные по времени разрешения (доступ на основе TTL)
- Ограниченные возможности инструментов
- Отзываемые права выполнения
- Детальный контроль доступа к инструментам
🧠 Межсетевой экран для инъекций в промпты
- Обнаруживает попытки переопределения инструкций
- Нейтрализует скрытые или вредоносные команды в выводах инструментов
- Защищает от цепочек косвенных инъекций в промпты
- Очищает недоверенный контент, сгенерированный моделями
🌐 Межсетевой экран потоков данных
- Контролирует перемещение данных между инструментами
- Предотвращает небезопасные цепочки выводов
- Блокирует паттерны эксфильтрации между инструментами
- Применяет правила маршрутизации данных на основе рисков
🧪 Механизм симуляции выполнения
- Симулирует выполнение инструмента перед его запуском
- Прогнозирует нарушения политик
- Предотвращает небезопасные действия до выполнения
- Режим пробного запуска для операций с высоким риском
📊 Система доверия и репутации
- Динамическая оценка доверия для каждого инструмента
- Поведенческий анализ с течением времени
- Автоматическое снижение уровня риска для подозрительных инструментов
- Адаптивные ограничения выполнения на основе доверия
🧯 Аварийный выключатель и режим изоляции
- Мгновенная остановка выполнения при обнаружении аномалий
- Режим изоляции сессии
- Автоматический отзыв привилегий
- Выполнение с откатом в безопасное состояние
🧾 Квитанции выполнения (система аудита)
- Криптографически отслеживаемые журналы выполнения
- Хеширование входных/выходных данных
- Отслеживание решений политик
- Метаданные выполнения в песочнице
- Полная судебная прослеживаемость
🔐 Уровень выполнения в песочнице
- Поддержка песочницы gVisor (по умолчанию)
- Изоляция виртуальных машин Firecracker (режим повышенной безопасности)
- Выполнение в контейнерах Docker (режим совместимости)
- Поддержка среды выполнения WASM (лёгкое выполнение)
- Полностью изолированные файловые системы и сетевые среды
🧭 Система классификации намерений
- Классифицирует намерение использования инструмента:
- извлечение данных
- изменение системы
- внешняя коммуникация
- неизвестное поведение
- Применение политик на основе типа намерения
Модуль системы классификации намерений
Включите интеллектуальную безопасность с учётом намерений через координированный многогагентный анализ, который оценивает почему инструмент вызывается до его выполнения. Вместо того чтобы полагаться только на имена инструментов или запрошенные действия, специализированные агенты сотрудничают для классификации намерения выполнения, оценки риска и применения политик безопасности на основе предполагаемого результата.
Возможности
- Многогагентная классификация намерений
- Обнаружение извлечения данных
- Обнаружение изменения системы
- Обнаружение внешней коммуникации
- Обнаружение неизвестного или неоднозначного поведения
- Оценка уверенности в намерении
- Контекстно-зависимый анализ намерений
- Проверка консенсуса между агентами
- Применение политик на основе классифицированного намерения
- Проверка возможностей с учётом намерения
- Автоматическая эскалация при неопределённом намерении
- Обнаружение аномалий намерений
- Сравнение намерений с историческими данными
- Журналирование аудита намерений
- Настраиваемые таксономии намерений
- Пользовательские плагины классификации намерений
- Поддержка многоярлыковых намерений
- Разрешение конфликтов намерений
- Адаптивные точки обучения для будущих классификаторов
- Мониторинг намерений в реальном времени
- Объяснимые решения классификации
- Интеграция с механизмом политик и средствами контроля песочницы
Многогагентный рабочий процесс
-
Агент анализа запроса
- Разбирает входящий запрос инструмента.
- Извлекает контекстные метаданные и цели выполнения.
-
Агент классификации намерений
- Определяет наиболее вероятное намерение выполнения.
- Присваивает оценки уверенности одной или нескольким категориям намерений.
-
Агент проверки контекста
- Анализирует историю разговора, состояние рабочего процесса и предыдущие действия.
- Обнаруживает несоответствия или подозрительный контекст.
-
Агент оценки рисков
- Оценивает последствия классифицированного намерения для безопасности.
- Выявляет поведение с высоким риском или неожиданное поведение.
-
Агент применения политик
- Применяет политики безопасности с учётом намерения.
- Проверяет разрешения, возможности и ограничения выполнения.
-
Агент консенсуса
- Разрешает разногласия между агентами классификации и проверки.
- Формирует окончательное проверенное решение о намерении.
-
Агент аудита
- Записывает результаты классификации, уровни уверенности, решения политик и результаты выполнения для судебного анализа.
Поддерживаемые категории намерений
- Извлечение данных
- Изменение системы
- Внешняя коммуникация
- Неизвестное поведение
- Пользовательские намерения, определённые администратором
Преимущества
- Предотвращает выполнение, основанное исключительно на предположениях, сгенерированных моделью
- Обнаруживает вредоносные или неожиданные поведенческие паттерны
- Улучшает принятие решений с нулевым доверием
- Снижает влияние атак с инъекцией в промпты
- Обеспечивает детальное применение политик
- Предоставляет объяснимые решения безопасности
- Повышает аудируемость и соответствие требованиям
- Поддерживает протокол-агностическую безопасность ИИ в любой LLM или агентной системе
🌍 Сетевые средства контроля безопасности
- Запрет исходящего сетевого доступа по умолчанию
- Списки разрешённых доменов/IP
- Сетевые политики для конкретных инструментов
- Необязательная проверка на уровне запросов
- Эвристики обнаружения эксфильтрации
🔁 Уровень кросс-протокольной трансляции
- Взаимодействие инструментов MCP ↔ OpenAI
- Унифицированная модель выполнения между фреймворками
- Конвертация протоколов на основе адаптеров
- Встроенная совместимость с будущими протоколами
🧩 Архитектура плагинов
- Расширяемый конвейер безопасности
- Пользовательские модули межсетевых экранов
- Плагины оценки рисков
- Модули соответствия и управления
- Расширения безопасности для предметных областей
🔁 Симуляция выполнения и режим предпросмотра
- Предварительный анализ всех вызовов инструментов
- Предпросмотр влияния политик
- Безопасная оценка операций с высоким риском
🔐 Криптографическое подписание политик
- Применение подписанных политик
- Проверка конфигурации, защищённая от взлома
- Безопасное распространение политик для команд и предприятий
📈 Панель наблюдаемости (планируется)
- Графы выполнения инструментов
- Трассировка решений политик
- Мониторинг активности песочниц
- Тепловые карты рисков
- Хронология событий безопасности
🧩 Философия дизайна
Ни одна ИИ-система не должна напрямую выполнять, получать доступ или взаимодействовать, не проходя через проверяемое ядро безопасности.
Securekit обеспечивает:
- Нулевое неявное доверие
- Контролируемые границы выполнения
- Полную аудируемость всех действий инструментов
- Независимость от протоколов (MCP, OpenAI, пользовательские агенты, будущие системы)
- Расширяемую архитектуру безопасности на основе плагинов
Система спроектирована как субстрат безопасности для агентного ИИ, а не как обёртка приложения.
🚀 Установка (скоро)
Securekit в настоящее время находится на ранней стадии проектирования.
Эталонные реализации будут предоставлены для:
- Python SDK
- Node SDK
- Основная среда выполнения на Rust
- Инструменты командной строки
- Развёртывание в Docker
- Режим сайдкара Kubernetes
🤝 Вклад в проект
Вклад приветствуется.
Пожалуйста, убедитесь, что все вклады:
- соответствуют AGPL-3.0+
- поддерживают принципы выполнения с нулевым доверием Securekit
- следуют стандартам интерфейсов адаптеров и плагинов
- не обходят уровни песочницы или применения политик
Лицензия на брендирование спецификаций (SBL)
Стандартная
- Полностью совместимая с AGPL-3.0+ система
- Копилефт обязателен для сетевых развёртываний
- Требуемая атрибуция:
Опциональная
- Лицензия на брендирование спецификаций (SBL)
📜 Лицензия и требования к уведомлениям
Securekit выпущен под GNU Affero General Public License v3.0 или более поздней версией (AGPL-3.0+).
Внося вклад в этот проект, вы соглашаетесь с тем, что ваши вклады также будут выпущены под этой лицензией.
Обратите внимание на следующее:
- Все вклады должны соответствовать условиям AGPL-3.0+.
- В соответствии с Разделом 7 лицензии, все повторные распространения, форки и производные работы должны сохранять атрибуцию:
Roxanne Ardary и roxanneardary.com.
- Спецификации Securekit можно свободно использовать с указанием атрибуции. Лицензия на брендирование спецификаций может быть согласована по запросу.
- Файл проекта notice.md отслеживает требования к атрибуции и подтверждения участников.
Любое обновление, добавляющее новых участников или изменяющее атрибуцию, должно также обновлять notice.md.
- При отправке pull request убедитесь, что любые новые файлы сохраняют заголовки атрибуции, где это применимо.
- Сетевые версии этого программного обеспечения также должны оставаться полностью совместимыми с AGPL-3.0+, включая раскрытие изменений исходного кода, когда это применимо по лицензии.
Для полных юридических деталей обратитесь к лицензии AGPL-3.0+ и файлу проекта notice.md.
🛡️ Резюме
Securekit — это протокол-агностическое ядро безопасности для выполнения инструментов ИИ, которое обеспечивает:
- Применение нулевого доверия
- Изолированные среды выполнения в песочницах
- Обнаружение угроз с учётом ИИ
- Кросс-протокольную совместимость
- Полную аудируемость выполнения
Оно функционирует как универсальный уровень безопасности для агентных ИИ-систем, гарантируя, что ни одна модель не сможет выполнять инструменты, не проходя через проверяемую плоскость управления.
Open Arsenal Hub
https://gitlab.com/Roxanne_Ardary/open-arsenal-specs