Skip to content
KitploitKITPLOIT
ツールエクスプロイトブログ
Log in
提出
ツールエクスプロイトブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
aegis-audio-defense — 音声言語モデルを凍結したまま、推論時に音声ジェイルブレイクをブロックするための中間層リスクゲートと後段層セーフティアダプタを追加する防御フレームワーク。 | Kitploit
ツール/GitHubGitHub/azzzzliao/aegis-audio-defense
防御ツール脆弱性分析機械学習論文と研究AIセキュリティ敵対的攻撃
GitHubazzzzliao/aegis-audio-defense

aegis-audio-defense

音声言語モデルを凍結したまま、推論時に音声ジェイルブレイクをブロックするための中間層リスクゲートと後段層セーフティアダプタを追加する防御フレームワーク。

リポジトリを見る
33日前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

AEGIS: 大規模音声言語モデルのジェイルブレイクに対する内部信号による音声内在性ガード

Yu-Ling Liao*、Tzu-Chin Chiu*、Zong-You Chen*、Chi-Lei Tsai*、Shao-Yuan Lo — 国立台湾大学(*同等貢献)

ICASSP 2027 投稿用のコード。AEGIS は対象の音声言語モデルを凍結したまま、中間層のリスクゲートを追加し、これが条件付きで後半層の安全アダプタを駆動し、推論時に閉ループスケーリングを行う。

目次

ページ内容
手法リスクと拒否のギャップ、ゲートとアダプタ、訓練損失、閉ループ。
結果論文の表:6モデル、3ベンチマーク、アブレーション、防御比較。
論文を超えた分析他の5モデルにおけるリスクと拒否のギャップ、ゲートの挙動、表現、完全なアブレーション表。
データ各データセットの出所とマニフェストの構築方法。
モデルの追加1つのアダプタを書くことで AEGIS を別の LALM に移植する。

このページの内容:リポジトリ構成 · セットアップ · データ · AEGIS の実行 · プロトコル · アブレーション · テスト · 引用

リポジトリ構成

root@kitploit:~
aegis/                        defense runtime; every script runs from any directory
  model_registry.py           ModelAdapter interface, registry, Qwen2-Audio and Phi-4 adapters
  adapters_gemma_voxtral.py   Gemma 4 E4B-it and Voxtral-Small-24B adapters
  adapters_ultravox_vita.py   Ultravox v0.5 and VITA-1.5 adapters
  train_gate_lora.py          joint training of the risk gate and the safety adapters
  run_defense.py              gated inference with closed-loop scaling (--score-only: gate scores)
  run_model.py                undefended generation
  judge.py                    Llama-Guard-3-8B safety judge
  refusal.py                  refusal regex for the over-refusal metric
  extract_hidden.py, analysis/  hidden-state probes for layer selection
scripts/
  prepare_data.py             downloaded datasets -> manifests (+ in-domain test splits)
  run_baseline.sh             step 0: undefended responses, judgments, training files
  run_aegis.sh                steps 1-4 for one protocol (PROTOCOL=indomain or lobo)
  run_ablation.sh             the Full and Always-on ablations
  models.sh                   per-model gate layer, intervention layers, prompt mode
  build_trainsets.py, calibrate_threshold.py, summarize.py
data/splits/                  in-domain train/test ids used in the paper
docs/                         method, results, analyses, porting guide
tests/                        CPU tests of the evaluation protocol

セットアップ

root@kitploit:~
pip install -r requirements.txt

各モデルにはそれをロードできる Transformers のバージョンが必要である。上流の要件が一致しないため、モデルファミリーごとに1つの環境を使用した:

  • モデルはデフォルトで Hub からロードされる。オフラインで実行するには、上書き変数をローカルスナップショットに向ける。
  • Llama-Guard-3-8B、Gemma 4、および Ultravox がダウンロードする Llama-3.1 バックボーンは Hub でゲートされている。それらのライセンスに同意し、huggingface-cli login を実行するか、GUARD と AEGIS_LLAMA31_PATH をローカルコピーに設定する。
  • VITA-1.5 は GitHub のコードが必要である:https://github.com/VITA-MLLM/VITA をクローンし、AEGIS_VITA_REPO をチェックアウト先に設定する(デフォルト:external/VITA)。
  • ハードウェア:ほとんどのモデルには 48 GB の GPU 1 台で十分である。Gemma 4 の訓練には少なくとも約 40 GB のシングルカードが必要である。262k 語彙の損失はうまくシャード化できないためである。Voxtral Small には 48 GB のカードが 2 枚必要である(DEVICE=auto がモデルをシャードし、ゲートとアダプタはフックする層に従う)。Qwen2-Audio と Phi-4 も、長い AJail クリップでは DEVICE=auto の恩恵を受ける。

データ

data/README.md の説明に従って5つのデータセットをダウンロードし、マニフェストを構築する:

root@kitploit:~
python scripts/prepare_data.py --data-root data --out-dir data/manifests

このスクリプトは論文で使用された行数をチェックする:AJail 1,490、JALM 946、SACRED 1,364、XSTest 250、Benign_train 215。また、data/splits/ の id リストからドメイン内テスト分割(718 / 499 / 683 行)を書き出す。

AEGIS の実行

各モデルについて(PY はそのモデルの環境の Python、JUDGE_PY は Llama Guard 用に別の環境を指すことができる):

root@kitploit:~
MODEL=gemma4_e4b_it PY=python DEVICE=cuda:0 bash scripts/run_baseline.sh                  # step 0
MODEL=gemma4_e4b_it PROTOCOL=indomain PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # in-domain
MODEL=gemma4_e4b_it PROTOCOL=lobo     PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # LOBO

各ステージは再開可能である。中断後は同じコマンドを再実行する。出力は runs/<model>/ に保存される:

root@kitploit:~
baseline/                        undefended responses; <bench>_judged.jsonl = Llama Guard labels
train/train_{indomain,lobo}_<bench>.jsonl
<protocol>/<bench>/adapter/      router_head.pt, late_adapters.pt, config.json
<protocol>/<bench>/scores/       gate scores on XSTest and on the evaluation set
<protocol>/<bench>/threshold.json
<protocol>/<bench>/defended/     defended responses and their judgments
<protocol>/summary.json          unsafe rate, over-refusal, gate AUROC per benchmark

プロトコル

  • 評価設定。 ドメイン内: AEGIS はベンチマークの訓練分割で訓練され、そのホールドアウトテスト分割で評価される。ベンチマークごとに1つのアダプタ。分割は 50/50、シード 42、プロンプトでグループ化されるため、同じリクエストの変種は同じ側に留まる。id は data/splits/ にある。LOBO(leave one benchmark out): AEGIS は他の2つのベンチマークで訓練され、ホールドアウトベンチマーク全体で評価される。どちらの設定でも、評価データは閾値選択に一切関与せず、XSTest は訓練に一切使用されない。
  • 訓練データ(scripts/build_trainsets.py)。良性音声は Benign_train で、モデル自身の未防御の回答をターゲットとする。有害に見えるがベースラインでモデルが拒否した良性プロンプトは除外される。有害なターゲットは汎用的な拒否テンプレートである。有害クリップの数は良性クリップの数と等しい。シード 42。
  • 最適化。 AdamW、学習率 2e-4、4 エポック、勾配蓄積 8、LoRA ランク 16、λ_BCE = 1.0、λ_L1 = 0.01。
  • プロンプト。 Qwen2-Audio は音声のみを受け取る(PROMPT_MODE=native)。他のモデルは音声と1つの固定テキストプロンプトを受け取る。ゲートはプロンプト依存の隠れ状態を読むため、アダプタは訓練されたプロンプトモードでのみ有効である。
  • 閾値(scripts/calibrate_threshold.py)。XSTest の id はソートされ、検証半分とテスト半分に交互に分割される。閾値は、検証半分での追加の過剰拒否が最大 10% である最小のゲートスコアであり、未防御モデルが回答したプロンプトでカウントされる。
  • 閉ループ。 拒否確率は、最終層における拒否開始語の次トークン確率を合計する。ドメイン内実行では多言語開始語リスト(REFUSAL_PHRASE_SET=multi、run_aegis.sh により設定)を使用するため、非英語の拒否もカウントされる。
  • メトリクス(scripts/summarize.py):unsafe rate は Llama-Guard-3-8B が とラベル付けした評価行の割合である。over-refusal は に一致する XSTest 応答の割合で、全 250 プロンプトおよびテスト半分について報告される。gate AUROC は生のゲートスコアを使用し、攻撃を陽性、XSTest を陰性とする。

アブレーション

root@kitploit:~
MODEL=qwen2_audio VARIANT=full bash scripts/run_ablation.sh        # LoRA on all layers, no gate
MODEL=qwen2_audio VARIANT=always_on bash scripts/run_ablation.sh   # AEGIS layers, no gate

テスト

root@kitploit:~
python -m unittest discover tests

引用

root@kitploit:~
@misc{liao2027aegis,
  title  = {{AEGIS}: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks},
  author = {Liao, Yu-Ling and Chiu, Tzu-Chin and Chen, Zong-You and Tsai, Chi-Lei and Lo, Shao-Yuan},
  note   = {Submitted to ICASSP 2027},
  year   = {2026}
}

ライセンス

コードは MIT License の下で公開されている。ベースモデル(例:Gemma 4、Ultravox の Llama 3.1、Llama-Guard-3-8B)およびベンチマークは、それぞれ独自のライセンスと利用規約を保持する。

ツールをダウンロード
MODELベースモデルHugging Face id(上書き変数)ゲート層介入層使用した Transformers
gemma4_e4b_itGemma 4 E4B ITgoogle/gemma-4-E4B-it (AEGIS_GEMMA4_PATH)2125–415.7.0.dev0
phi4_mmPhi-4-multimodalmicrosoft/Phi-4-multimodal-instruct (AEGIS_PHI4_MM_PATH)1519–315.7.0.dev0
vita_15VITA-1.5VITA-MLLM/VITA-1.5 (AEGIS_VITA_PATH)1519–274.43.4
qwen2_audioQwen2-Audio-7B-InstructQwen/Qwen2-Audio-7B-Instruct (AEGIS_QWEN2_AUDIO_PATH)1519–31≥ 4.45
ultravox_v05Ultravox v0.5 (Llama-3.1-8B)fixie-ai/ultravox-v0_5-llama-3_1-8b (AEGIS_ULTRAVOX_PATH)1519–314.48.1
voxtral_smallVoxtral Small 24Bmistralai/Voxtral-Small-24B-2507 (AEGIS_VOXTRAL_PATH)2428–394.57.6
unsafe
aegis/refusal.py