Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
SLDR — Фреймворк защиты, который смягчает вредоносное дообучение LLM с помощью выборочного восстановления слоёв и динамической маршрутизации, со скриптами для обучения, оценки вредоносности и оценки джейлбрейков. | Kitploit
Инструменты/GitHubGitHub/stardust457/sldr
Оборонительные ИнструментыМашинное ОбучениеСтатьи и ИсследованияБезопасность ИИСостязательная Атака
GitHubstardust457/sldr

SLDR

Фреймворк защиты, который смягчает вредоносное дообучение LLM с помощью выборочного восстановления слоёв и динамической маршрутизации, со скриптами для обучения, оценки вредоносности и оценки джейлбрейков.

Репозиторий
27 дней назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

[NeurIPS 2026] SLDR: Защита от вредоносного дообучения с помощью выборочного восстановления слоёв и динамической маршрутизации

🔧 Настройка окружения

Клонируйте репозиторий, создайте и активируйте окружение Conda, затем установите необходимые зависимости:

git clone https://github.com/Stardust457/SLDR.git
cd SLDR

conda create -n sldr python=3.12 -y

conda activate sldr

python -m pip install --upgrade pip

python -m pip install -r requirements.txt

🔑 Доступ к моделям Llama и их загрузка

Модели Llama требуют запроса доступа на Hugging Face.

Перед использованием модели войдите в Hugging Face, перейдите на страницу нужной модели в разделе Meta Llama, примите условия использования и отправьте запрос на доступ. После предоставления доступа с той же учётной записи создайте Access Token с правами на чтение целевой модели на странице настроек Access Tokens. Подробности см. в руководстве Hugging Face по моделям с ограниченным доступом.

Сначала настройте HF-Mirror в терминале Bash:

export HF_ENDPOINT="https://hf-mirror.com"

Затем выполните следующую команду для входа:

hf auth login

Введите только что созданный Hugging Face Access Token, когда появится соответствующий запрос.


🚀 Обучение и оценка

Выполните следующие команды из корня репозитория, чтобы обучить и оценить каждую модель:

Llama 3.1

bash scripts/run_llama31_downstream.sh

Llama 3

bash scripts/run_llama3_downstream.sh

Qwen 2.5

bash scripts/run_qwen25_downstream.sh

Mistral

bash scripts/run_mistral_downstream.sh

Развёртывание Llama Guard и оценка вредоносности

После сбора ответов модели разверните Llama Guard и запустите сервис в терминале:

bash scripts/run_llama_guard.sh serve

Оставьте этот терминал работающим и дождитесь готовности сервиса. Затем откройте другой терминал, активируйте окружение sldr и выполните следующую команду из корня репозитория, чтобы оценить вредоносность ответов модели:

bash scripts/run_llama_guard.sh score

⚠️ Важное напоминание: оценка на Alpaca

Перед запуском оценки Llama 3.1 на наборе данных Alpaca настройте базовый URL API и API-ключ GPT-судьи в том же терминале:

export GPT_JUDGE_BASE_URL='your base url'
export OPENAI_API_KEY='your API key'

Замените заполнители на ваш базовый URL API и API-ключ перед началом оценки.

Дополнительная оценка на вредоносных бенчмарках

После генерации соответствующих downstream-чекпоинтов выполните следующую команду, чтобы оценить Llama 3.1 на дополнительных вредоносных бенчмарках, включая DirectHarm4, HarmBench и HEx-PHI:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
SEEDS="42" \
VARIANTS="defended" \
bash /root/scripts/run_llama31_harm_benchmarks.sh

Оценка джейлбрейк-атак Zulu и IJP

Выполните следующую команду, чтобы оценить Llama 3.1 против джейлбрейк-атак Zulu и IJP с использованием соответствующих downstream-чекпоинтов:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
TRAIN_SAMPLES="1000" \
SEEDS="42" \
VARIANTS="defended" \
JAILBREAK_ATTACKS="zulu ijp" \
bash /root/scripts/run_llama31_jailbreak.sh

Примечание: Ответы модели, сгенерированные для набора данных Zulu, необходимо перевести на английский язык перед оценкой их вредоносности с помощью Llama Guard.


Скачать инструмент