Skip to content
KitploitKITPLOIT
ИнструментыБлог
Log in
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
PurpleLlama — Набор инструментов для оценки и повышения безопасности LLM. | Kitploit
Инструменты/GitHubGitHub/meta-llama/purplellama
Оборонительные ИнструментыАнализ уязвимостейАнализ КодаСтатьи и ИсследованияRed TeamingБезопасность ИИСостязательная АтакаТоп в Состязательная Атака №10Топ в Безопасность ИИ №4
4.4k7761043 дней назадПроверено Kitploit

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
GitHub
meta-llama/purplellama

PurpleLlama

Набор инструментов для оценки и повышения безопасности LLM.

Репозиторий
Поделиться

🤗 Модели на Hugging Face  | Блог  | Веб-сайт  | Статья CyberSec Eval   | Статья Llama Guard 


Purple Llama

Purple Llama — это зонтичный проект, который со временем объединит инструменты и оценки (evals), чтобы помочь сообществу ответственно создавать решения на основе открытых генеративных моделей ИИ. Первоначальный релиз включает инструменты и оценки для кибербезопасности и средств защиты ввода/вывода, но в ближайшем будущем мы планируем добавить и другие.

Почему purple?

Заимствуя концепцию из мира кибербезопасности, мы считаем, что для настоящего снижения рисков, которые создаёт генеративный ИИ, необходимо сочетать как атакующие (red team), так и защитные (blue team) подходы. Purple teaming, объединяющий обязанности red и blue team, — это совместный подход к оценке и снижению потенциальных рисков. Та же философия применима и к генеративному ИИ, поэтому наши инвестиции в Purple Llama будут комплексными.

Лицензия

Компоненты проекта Purple Llama будут распространяться по разрешительным лицензиям, допускающим как исследовательское, так и коммерческое использование. Мы считаем, что это важный шаг на пути к развитию сотрудничества в сообществе и стандартизации разработки и использования инструментов доверия и безопасности для генеративного ИИ. В частности, оценки и бенчмарки распространяются под лицензией MIT, а любые модели используют соответствующую лицензию Llama Community. См. таблицу ниже:

Тип компонентаКомпонентыЛицензия
Оценки/БенчмаркиCyber Security Eval (другие появятся позже)MIT
ЗащитаLlama GuardLlama 2 Community License
ЗащитаLlama Guard 2Llama 3 Community License
ЗащитаLlama Guard 3-8BLlama 3.2 Community License
ЗащитаLlama Guard 3-1BLlama 3.2 Community License
ЗащитаLlama Guard 3-11B-visionLlama 3.2 Community License
ЗащитаPrompt GuardLlama 3.2 Community License
ЗащитаCode ShieldMIT

Защитные механизмы системного уровня

Как мы отметили в Руководстве по ответственному использованию Llama 3, мы рекомендуем проверять и фильтровать все входные и выходные данные LLM в соответствии с правилами контента, подходящими для конкретного приложения.

Llama Guard

Llama Guard 3 — это серия высокопроизводительных моделей модерации ввода и вывода, предназначенных для помощи разработчикам в обнаружении различных распространённых типов недопустимого контента.

Они были созданы путём тонкой настройки моделей Meta-Llama 3.1 и 3.2 и оптимизированы для поддержки обнаружения стандартной таксономии рисков MLCommons, охватывая широкий спектр сценариев использования разработчиками. Они поддерживают возможности Llama 3.2, включая 7 новых языков, контекстное окно на 128k токенов и рассуждения по изображениям. Модели Llama Guard 3 также были оптимизированы для обнаружения опасных ответов, связанных с кибератаками, и для предотвращения выполнения вредоносного кода, генерируемого LLM, в средах размещения систем Llama, использующих интерпретаторы кода.

Prompt Guard

Prompt Guard — это мощный инструмент для защиты приложений на основе LLM от вредоносных подсказок, обеспечивающий их безопасность и целостность.

Категории атак на подсказки включают инъекции подсказок (prompt injection) и джейлбрейки:

  • Инъекции подсказок — это входные данные, которые используют включение недоверенных данных от третьих сторон в контекстное окно модели, чтобы заставить её выполнить непредусмотренные инструкции.
  • Джейлбрейки — это вредоносные инструкции, предназначенные для обхода функций безопасности и защитных механизмов, встроенных в модель.

Code Shield

Code Shield добавляет поддержку фильтрации небезопасного кода, создаваемого LLM, на этапе логического вывода. Code Shield обеспечивает снижение риска предложений небезопасного кода, предотвращение злоупотребления интерпретатором кода и безопасное выполнение команд. Пример блокнота CodeShield.

Оценки и бенчмарки

Кибербезопасность

CyberSec Eval v1

CyberSec Eval v1 — это, по нашему мнению, первый в отрасли набор оценок кибербезопасности для LLM. Эти бенчмарки основаны на отраслевых руководствах и стандартах (например, CWE и MITRE ATT&CK) и созданы в сотрудничестве с нашими экспертами по безопасности. Мы стремимся предоставить инструменты, которые помогут устранить некоторые риски, описанные в обязательствах Белого дома по разработке ответственного ИИ, в том числе:

  • Метрики для количественной оценки рисков кибербезопасности LLM.
  • Инструменты для оценки частоты предложений небезопасного кода.
  • Инструменты для оценки LLM, затрудняющие генерацию вредоносного кода или помощь в осуществлении кибератак.

Мы считаем, что эти инструменты снизят частоту предложений LLM небезопасного ИИ-кода и уменьшат их полезность для киберпротивников. Наши первоначальные результаты показывают, что LLM несут значительные риски в области кибербезопасности — как при рекомендации небезопасного кода, так и при выполнении вредоносных запросов. Подробнее см. в нашей статье CyberSec Eval.

CyberSec Eval 2

CyberSec Eval 2 расширяет своего предшественника, измеряя склонность LLM к злоупотреблению интерпретатором кода, наступательные возможности в области кибербезопасности и восприимчивость к инъекциям подсказок. Статью можно прочитать здесь.

Вы также можете ознакомиться с лидербордом 🤗 здесь.

CyberSec Eval 3

Недавно выпущенный CyberSec Eval 3 включает три дополнительных набора тестов: тесты визуальной инъекции подсказок, тесты навыков фишинга и тесты автономных наступательных киберопераций.

Начало работы

Скачать инструмент