Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
aegis-audio-defense — Фреймворк защиты, который сохраняет аудио-языковые модели замороженными и добавляет среднеуровневый шлюз риска с адаптерами безопасности поздних слоёв для блокировки аудио-джейлбрейков при инференсе. | Kitploit
Инструменты/GitHubGitHub/azzzzliao/aegis-audio-defense
Оборонительные ИнструментыАнализ уязвимостейМашинное ОбучениеСтатьи и ИсследованияБезопасность ИИСостязательная Атака
GitHubazzzzliao/aegis-audio-defense

aegis-audio-defense

Фреймворк защиты, который сохраняет аудио-языковые модели замороженными и добавляет среднеуровневый шлюз риска с адаптерами безопасности поздних слоёв для блокировки аудио-джейлбрейков при инференсе.

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Репозиторий
93 дней назадЕщё не проверено
Поделиться

AEGIS: Аудио-эндогенная защита через внутренние сигналы против джейлбрейков больших аудио-языковых моделей

Yu-Ling Liao*, Tzu-Chin Chiu*, Zong-You Chen*, Chi-Lei Tsai*, Shao-Yuan Lo — National Taiwan University (*равный вклад)

Код для подачи в ICASSP 2027. AEGIS сохраняет целевую аудио-языковую модель замороженной и добавляет среднеуровневый риск-гейт, который условно управляет позднеуровневыми адаптерами безопасности, с замкнутым контуром масштабирования на инференсе.

Содержание

СтраницаЧто в ней
МетодРазрыв между риском и отказом, гейт и адаптеры, функция потерь обучения, замкнутый контур.
РезультатыТаблицы статьи: шесть моделей, три бенчмарка, абляция и сравнение защит.
Анализы за пределами статьиРазрыв между риском и отказом в остальных пяти моделях, поведение гейта, представления, полная таблица абляций.
ДанныеОткуда берётся каждый датасет и как строятся манифесты.
Добавление моделиПеренос AEGIS на другую LALM путём написания одного адаптера.

На этой странице: Структура репозитория · Установка · Данные · Запуск AEGIS · Протокол · Абляции · Тесты · Цитирование

Структура репозитория

root@kitploit:~
aegis/                        defense runtime; every script runs from any directory
  model_registry.py           ModelAdapter interface, registry, Qwen2-Audio and Phi-4 adapters
  adapters_gemma_voxtral.py   Gemma 4 E4B-it and Voxtral-Small-24B adapters
  adapters_ultravox_vita.py   Ultravox v0.5 and VITA-1.5 adapters
  train_gate_lora.py          joint training of the risk gate and the safety adapters
  run_defense.py              gated inference with closed-loop scaling (--score-only: gate scores)
  run_model.py                undefended generation
  judge.py                    Llama-Guard-3-8B safety judge
  refusal.py                  refusal regex for the over-refusal metric
  extract_hidden.py, analysis/  hidden-state probes for layer selection
scripts/
  prepare_data.py             downloaded datasets -> manifests (+ in-domain test splits)
  run_baseline.sh             step 0: undefended responses, judgments, training files
  run_aegis.sh                steps 1-4 for one protocol (PROTOCOL=indomain or lobo)
  run_ablation.sh             the Full and Always-on ablations
  models.sh                   per-model gate layer, intervention layers, prompt mode
  build_trainsets.py, calibrate_threshold.py, summarize.py
data/splits/                  in-domain train/test ids used in the paper
docs/                         method, results, analyses, porting guide
tests/                        CPU tests of the evaluation protocol

Установка

root@kitploit:~
pip install -r requirements.txt

Каждой модели нужна версия Transformers, способная её загрузить. Апстримы расходятся во мнениях, поэтому мы использовали одно окружение на семейство моделей:

MODELБазовая модельHugging Face id (переменная переопределения)Слой гейтаСлои вмешательстваИспользованный Transformers
gemma4_e4b_itGemma 4 E4B ITgoogle/gemma-4-E4B-it (AEGIS_GEMMA4_PATH)2125–415.7.0.dev0
phi4_mmPhi-4-multimodalmicrosoft/Phi-4-multimodal-instruct (AEGIS_PHI4_MM_PATH)1519–315.7.0.dev0
vita_15VITA-1.5VITA-MLLM/VITA-1.5 (AEGIS_VITA_PATH)1519–274.43.4
qwen2_audioQwen2-Audio-7B-InstructQwen/Qwen2-Audio-7B-Instruct (AEGIS_QWEN2_AUDIO_PATH)1519–31≥ 4.45
ultravox_v05Ultravox v0.5 (Llama-3.1-8B)fixie-ai/ultravox-v0_5-llama-3_1-8b (AEGIS_ULTRAVOX_PATH)1519–314.48.1
voxtral_smallVoxtral Small 24Bmistralai/Voxtral-Small-24B-2507 (AEGIS_VOXTRAL_PATH)2428–394.57.6
  • По умолчанию модели загружаются из Hub. Для офлайн-работы укажите переменную переопределения на локальный снапшот.
  • Llama-Guard-3-8B, Gemma 4 и бэкбон Llama-3.1, который скачивает Ultravox, закрыты на Hub. Примите их лицензии и выполните huggingface-cli login, либо укажите GUARD и AEGIS_LLAMA31_PATH на локальные копии.
  • VITA-1.5 требует свой код с GitHub: клонируйте https://github.com/VITA-MLLM/VITA и укажите AEGIS_VITA_REPO на чекаут (по умолчанию: external/VITA).
  • Оборудование: одной GPU на 48 ГБ достаточно для большинства моделей. Обучение Gemma 4 требует одной карты минимум на ~40 ГБ, поскольку лосс со словарём на 262k плохо шардируется. Voxtral Small требует двух карт по 48 ГБ (DEVICE=auto шардирует модель; гейт и адаптеры следуют за слоями, к которым они подключены). Qwen2-Audio и Phi-4 также выигрывают от DEVICE=auto на длинных клипах AJail.

Данные

Скачайте пять датасетов, как описано в data/README.md, затем соберите манифесты:

root@kitploit:~
python scripts/prepare_data.py --data-root data --out-dir data/manifests

Скрипт проверяет количество строк, использованных в статье: AJail 1,490, JALM 946, SACRED 1,364, XSTest 250, Benign_train 215. Он также записывает in-domain тестовые сплиты (718 / 499 / 683 строк) из списков id в data/splits/.

Запуск AEGIS

Для каждой модели (PY — это Python из окружения этой модели; JUDGE_PY может указывать на другое окружение для Llama Guard):

root@kitploit:~
MODEL=gemma4_e4b_it PY=python DEVICE=cuda:0 bash scripts/run_baseline.sh                  # step 0
MODEL=gemma4_e4b_it PROTOCOL=indomain PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # in-domain
MODEL=gemma4_e4b_it PROTOCOL=lobo     PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # LOBO

Каждый этап возобновляем; перезапустите ту же команду после прерывания. Выходные данные сохраняются в runs/<model>/:

root@kitploit:~
baseline/                        undefended responses; <bench>_judged.jsonl = Llama Guard labels
train/train_{indomain,lobo}_<bench>.jsonl
<protocol>/<bench>/adapter/      router_head.pt, late_adapters.pt, config.json
<protocol>/<bench>/scores/       gate scores on XSTest and on the evaluation set
<protocol>/<bench>/threshold.json
<protocol>/<bench>/defended/     defended responses and their judgments
<protocol>/summary.json          unsafe rate, over-refusal, gate AUROC per benchmark

Протокол

  • Настройки оценки. In-domain: AEGIS обучается на train-сплите бенчмарка и оценивается на его отложенном test-сплите, по одному адаптеру на бенчмарк. Сплиты 50/50, seed 42, сгруппированы по промпту, чтобы варианты одного и того же запроса оставались на одной стороне; id находятся в data/splits/. LOBO (leave one benchmark out): AEGIS обучается на двух других бенчмарках и оценивается на всём отложенном бенчмарке. В обоих режимах оцениваемые данные никогда не участвуют в выборе порога, а XSTest никогда не используется для обучения.
  • Обучающие данные (scripts/build_trainsets.py). Безвредное аудио — это Benign_train с собственными незащищёнными ответами модели в качестве целевых. Безвредные промпты, которые выглядят вредоносными и на которые модель отказалась отвечать на бейзлайне, отбрасываются. Вредоносные целевые ответы — это обобщённые шаблоны отказа. Количество вредоносных клипов равно количеству безвредных клипов. Seed 42.
  • Оптимизация. AdamW, скорость обучения 2e-4, 4 эпохи, накопление градиента 8, LoRA ранга 16, λ_BCE = 1.0, λ_L1 = 0.01.
  • Промпт. Qwen2-Audio получает только аудио (PROMPT_MODE=native); остальные модели получают аудио плюс один фиксированный текстовый промпт. Гейт читает зависящее от промпта скрытое состояние, поэтому адаптер валиден только в том режиме промпта, в котором он обучался.
  • Порог (scripts/calibrate_threshold.py). Id XSTest сортируются и разбиваются поочерёдно на половину для валидации и половину для теста. Порог — это наименьший балл гейта, при котором добавленный over-refusal на валидационной половине составляет не более 10%, считая по промптам, на которые незащищённая модель ответила.
  • Замкнутый контур. Вероятность отказа суммирует вероятность следующего токена для открывающих фраз отказа на последнем слое. In-domain запуски используют многоязычный список открывающих фраз (REFUSAL_PHRASE_SET=multi, задаётся в run_aegis.sh), поэтому неанглоязычные отказы учитываются.
  • Метрики (scripts/summarize.py): unsafe rate — доля оценённых строк, которые Llama-Guard-3-8B помечает как unsafe; over-refusal — доля ответов XSTest, совпадающих с aegis/refusal.py, сообщается по всем 250 промптам и по тестовой половине; gate AUROC использует сырые баллы гейта, где атаки — положительные, а XSTest — отрицательные.

Абляции

root@kitploit:~
MODEL=qwen2_audio VARIANT=full bash scripts/run_ablation.sh        # LoRA on all layers, no gate
MODEL=qwen2_audio VARIANT=always_on bash scripts/run_ablation.sh   # AEGIS layers, no gate

Тесты

root@kitploit:~
python -m unittest discover tests

Цитирование

root@kitploit:~
@misc{liao2027aegis,
  title  = {{AEGIS}: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks},
  author = {Liao, Yu-Ling and Chiu, Tzu-Chin and Chen, Zong-You and Tsai, Chi-Lei and Lo, Shao-Yuan},
  note   = {Submitted to ICASSP 2027},
  year   = {2026}
}

Лицензия

Код выпущен под MIT License. Базовые модели (например, Gemma 4, Llama 3.1 в Ultravox, Llama-Guard-3-8B) и бенчмарки сохраняют свои собственные лицензии и условия использования.

Скачать инструмент