Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
Learning-to-Detect — Обнаруживает неизвестные jailbreak-атаки в больших визуально-языковых моделях с помощью анализа скрытых состояний и автоэнкодеров, включая конвейеры обучения и оценки для надёжного мониторинга безопасности. | Kitploit
Инструменты/GitHubGitHub/shuangliangx/learning-to-detect
Оборонительные ИнструментыАнализ уязвимостейМашинное ОбучениеБезопасность ИИОбнаружение Аномалий
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

Обнаруживает неизвестные jailbreak-атаки в больших визуально-языковых моделях с помощью анализа скрытых состояний и автоэнкодеров, включая конвейеры обучения и оценки для надёжного мониторинга безопасности.

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Репозиторий
183 месяцев назадЕщё не проверено
Поделиться

Обучение обнаружению неизвестных jailbreak-атак в больших визуально-языковых моделях

Этот репозиторий содержит официальную реализацию «Обучение обнаружению неизвестных jailbreak-атак в больших визуально-языковых моделях».

Содержание

  • Базовая модель

  • Обнаружение jailbreak-атак

  • Набор данных

Базовая модель

Наш метод использует следующие две базовые модели:

LLaVA-v1.6-Vicuna — это мощная визуально-языковая модель, которая объединяет визуальный кодировщик с языковой моделью Vicuna для обработки мультимодальных входных данных и генерации ответов на естественном языке.

LlamaGuard3 — это модель безопасности, разработанная Meta AI, специально предназначенная для обнаружения и предотвращения генерации вредоносного контента, а также для эффективного выявления потенциально небезопасных запросов и ответов.

Пожалуйста, загрузите веса моделей и поместите их в каталог code/asset/weights.

Обнаружение jailbreak-атак

1. Обработка данных и извлечение скрытых состояний

(Необязательно, так как обработанные данные и извлеченные состояния уже сохранены в репозитории.)

Запрос к модели на $I^-$ (AdvBench) и $I^+$ (GQA)

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

Оценка ответов модели и разделение на обучающий/тестовый наборы данных

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

Извлечение скрытых состояний для обучения LoD и оценки бенчмарков

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. Обучение и тестирование классификаторов MSCAV

Обучение и тестирование классификаторов

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. Обучение автоэнкодера паттернов безопасности (SPAE)

root@kitploit:~
    python code/autoencoder.py

4. Оценка эффективности обнаружения

root@kitploit:~
    python code/test.py

Набор данных

Набор данныхПодробности
MM-SafetyBench
HADES

Пожалуйста, загрузите наборы данных и поместите их в каталог code/asset.

Скачать инструмент