
Набор инструментов для оценки и повышения безопасности LLM.
🤗 Модели на Hugging Face | Блог | Веб-сайт | Статья CyberSec Eval | Статья Llama Guard
Purple Llama — это зонтичный проект, который со временем объединит инструменты и оценки (evals), чтобы помочь сообществу ответственно создавать решения на основе открытых генеративных моделей ИИ. Первоначальный релиз включает инструменты и оценки для кибербезопасности и средств защиты ввода/вывода, но в ближайшем будущем мы планируем добавить и другие.
Заимствуя концепцию из мира кибербезопасности, мы считаем, что для настоящего снижения рисков, которые создаёт генеративный ИИ, необходимо сочетать как атакующие (red team), так и защитные (blue team) подходы. Purple teaming, объединяющий обязанности red и blue team, — это совместный подход к оценке и снижению потенциальных рисков. Та же философия применима и к генеративному ИИ, поэтому наши инвестиции в Purple Llama будут комплексными.
Компоненты проекта Purple Llama будут распространяться по разрешительным лицензиям, допускающим как исследовательское, так и коммерческое использование. Мы считаем, что это важный шаг на пути к развитию сотрудничества в сообществе и стандартизации разработки и использования инструментов доверия и безопасности для генеративного ИИ. В частности, оценки и бенчмарки распространяются под лицензией MIT, а любые модели используют соответствующую лицензию Llama Community. См. таблицу ниже:
| Тип компонента | Компоненты | Лицензия |
|---|---|---|
| Оценки/Бенчмарки | Cyber Security Eval (другие появятся позже) | MIT |
| Защита | Llama Guard | Llama 2 Community License |
| Защита | Llama Guard 2 | Llama 3 Community License |
| Защита | Llama Guard 3-8B | Llama 3.2 Community License |
| Защита | Llama Guard 3-1B | Llama 3.2 Community License |
| Защита | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| Защита | Prompt Guard | Llama 3.2 Community License |
| Защита | Code Shield | MIT |
Как мы отметили в Руководстве по ответственному использованию Llama 3, мы рекомендуем проверять и фильтровать все входные и выходные данные LLM в соответствии с правилами контента, подходящими для конкретного приложения.
Llama Guard 3 — это серия высокопроизводительных моделей модерации ввода и вывода, предназначенных для помощи разработчикам в обнаружении различных распространённых типов недопустимого контента.
Они были созданы путём тонкой настройки моделей Meta-Llama 3.1 и 3.2 и оптимизированы для поддержки обнаружения стандартной таксономии рисков MLCommons, охватывая широкий спектр сценариев использования разработчиками. Они поддерживают возможности Llama 3.2, включая 7 новых языков, контекстное окно на 128k токенов и рассуждения по изображениям. Модели Llama Guard 3 также были оптимизированы для обнаружения опасных ответов, связанных с кибератаками, и для предотвращения выполнения вредоносного кода, генерируемого LLM, в средах размещения систем Llama, использующих интерпретаторы кода.
Prompt Guard — это мощный инструмент для защиты приложений на основе LLM от вредоносных подсказок, обеспечивающий их безопасность и целостность.
Категории атак на подсказки включают инъекции подсказок (prompt injection) и джейлбрейки:
Code Shield добавляет поддержку фильтрации небезопасного кода, создаваемого LLM, на этапе логического вывода. Code Shield обеспечивает снижение риска предложений небезопасного кода, предотвращение злоупотребления интерпретатором кода и безопасное выполнение команд. Пример блокнота CodeShield.
CyberSec Eval v1 — это, по нашему мнению, первый в отрасли набор оценок кибербезопасности для LLM. Эти бенчмарки основаны на отраслевых руководствах и стандартах (например, CWE и MITRE ATT&CK) и созданы в сотрудничестве с нашими экспертами по безопасности. Мы стремимся предоставить инструменты, которые помогут устранить некоторые риски, описанные в обязательствах Белого дома по разработке ответственного ИИ, в том числе:
Мы считаем, что эти инструменты снизят частоту предложений LLM небезопасного ИИ-кода и уменьшат их полезность для киберпротивников. Наши первоначальные результаты показывают, что LLM несут значительные риски в области кибербезопасности — как при рекомендации небезопасного кода, так и при выполнении вредоносных запросов. Подробнее см. в нашей статье CyberSec Eval.
CyberSec Eval 2 расширяет своего предшественника, измеряя склонность LLM к злоупотреблению интерпретатором кода, наступательные возможности в области кибербезопасности и восприимчивость к инъекциям подсказок. Статью можно прочитать здесь.
Вы также можете ознакомиться с лидербордом 🤗 здесь.
Недавно выпущенный CyberSec Eval 3 включает три дополнительных набора тестов: тесты визуальной инъекции подсказок, тесты навыков фишинга и тесты автономных наступательных киберопераций.