Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
aegis-audio-defense — إطار دفاعي يُبقي نماذج اللغة الصوتية مجمّدة ويضيف بوابة مخاطر في الطبقة الوسطى مع محوّلات أمان في الطبقات المتأخرة لصدّ اختراقات الحماية الصوتية عند الاستدلال. | Kitploit
أدوات/GitHubGitHub/azzzzliao/aegis-audio-defense
أدوات دفاعيةتحليل الثغرات الأمنيةتعلم الآلةالأوراق والأبحاثأمن الذكاء الاصطناعيالهجوم العدائي
GitHubazzzzliao/aegis-audio-defense

aegis-audio-defense

إطار دفاعي يُبقي نماذج اللغة الصوتية مجمّدة ويضيف بوابة مخاطر في الطبقة الوسطى مع محوّلات أمان في الطبقات المتأخرة لصدّ اختراقات الحماية الصوتية عند الاستدلال.

عرض المستودع
9منذ 3 أياملم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

AEGIS: حماية صوتية داخلية عبر الإشارات الداخلية ضد اختراقات نماذج اللغة الصوتية الكبيرة

Yu-Ling Liao*, Tzu-Chin Chiu*, Zong-You Chen*, Chi-Lei Tsai*, Shao-Yuan Lo — جامعة تايوان الوطنية (*مساهمة متساوية)

كود تقديم ICASSP 2027. يحافظ AEGIS على نموذج اللغة الصوتية الهدف مجمّدًا ويضيف بوابة مخاطر في الطبقة الوسطى تقود بشكل شرطي محوّلات الأمان في الطبقات المتأخرة، مع تحجيم الحلقة المغلقة عند الاستدلال.

المحتويات

الصفحةما تحتويه
المنهجيةالفجوة بين المخاطر والرفض، البوابة والمحوّلات، خسارة التدريب، الحلقة المغلقة.
النتائججداول الورقة البحثية: ستة نماذج، ثلاثة معايير، الاستئصال، ومقارنة الدفاع.
تحليلات تتجاوز الورقةالفجوة بين المخاطر والرفض في النماذج الخمسة الأخرى، سلوك البوابة، التمثيلات، جدول الاستئصال الكامل.
البياناتمصدر كل مجموعة بيانات وكيفية بناء البيانات الوصفية.
إضافة نموذجنقل AEGIS إلى LALM آخر بكتابة محوّل واحد.

في هذه الصفحة: تخطيط المستودع · الإعداد · البيانات · تشغيل AEGIS · البروتوكول · الاستئصالات · الاختبارات · الاقتباس

تخطيط المستودع

root@kitploit:~
aegis/                        defense runtime; every script runs from any directory
  model_registry.py           ModelAdapter interface, registry, Qwen2-Audio and Phi-4 adapters
  adapters_gemma_voxtral.py   Gemma 4 E4B-it and Voxtral-Small-24B adapters
  adapters_ultravox_vita.py   Ultravox v0.5 and VITA-1.5 adapters
  train_gate_lora.py          joint training of the risk gate and the safety adapters
  run_defense.py              gated inference with closed-loop scaling (--score-only: gate scores)
  run_model.py                undefended generation
  judge.py                    Llama-Guard-3-8B safety judge
  refusal.py                  refusal regex for the over-refusal metric
  extract_hidden.py, analysis/  hidden-state probes for layer selection
scripts/
  prepare_data.py             downloaded datasets -> manifests (+ in-domain test splits)
  run_baseline.sh             step 0: undefended responses, judgments, training files
  run_aegis.sh                steps 1-4 for one protocol (PROTOCOL=indomain or lobo)
  run_ablation.sh             the Full and Always-on ablations
  models.sh                   per-model gate layer, intervention layers, prompt mode
  build_trainsets.py, calibrate_threshold.py, summarize.py
data/splits/                  in-domain train/test ids used in the paper
docs/                         method, results, analyses, porting guide
tests/                        CPU tests of the evaluation protocol

الإعداد

root@kitploit:~
pip install -r requirements.txt

يحتاج كل نموذج إلى إصدار Transformers قادر على تحميله. تختلف المصادر الأصلية، لذا استخدمنا بيئة واحدة لكل عائلة نماذج:

  • تُحمَّل النماذج من Hub افتراضيًا. للتشغيل دون اتصال، وجّه متغير التجاوز إلى نسخة محلية.
  • Llama-Guard-3-8B وGemma 4 والعمود الفقري Llama-3.1 الذي يُنزّله Ultravox محميّة على Hub. اقبل تراخيصها وشغّل huggingface-cli login، أو اضبط GUARD وAEGIS_LLAMA31_PATH على نسخ محلية.
  • يحتاج VITA-1.5 إلى كود GitHub الخاص به: استنسخ https://github.com/VITA-MLLM/VITA واضبط AEGIS_VITA_REPO على مجلد الاستنساخ (الافتراضي: external/VITA).
  • العتاد: بطاقة رسومات واحدة بسعة 48 GB كافية لمعظم النماذج. يحتاج تدريب Gemma 4 إلى بطاقة واحدة بسعة ~40 GB على الأقل، لأن خسارة المفردات بحجم 262k لا تتوزع جيدًا. يحتاج Voxtral Small إلى بطاقتين بسعة 48 GB (DEVICE=auto يوزّع النموذج؛ تتبع البوابة والمحوّلات الطبقات التي ترتبط بها). يستفيد Qwen2-Audio وPhi-4 أيضًا من DEVICE=auto على مقاطع AJail الطويلة.

البيانات

نزّل مجموعات البيانات الخمس كما هو موضح في data/README.md، ثم ابنِ البيانات الوصفية:

root@kitploit:~
python scripts/prepare_data.py --data-root data --out-dir data/manifests

يتحقق السكربت من أعداد الصفوف المستخدمة في الورقة: AJail 1,490، JALM 946، SACRED 1,364، XSTest 250، Benign_train 215. كما يكتب تقسيمات الاختبار داخل النطاق (718 / 499 / 683 صفًا) من قوائم المعرّفات في data/splits/.

تشغيل AEGIS

لكل نموذج (PY هو Python الخاص ببيئة ذلك النموذج؛ يمكن أن يشير JUDGE_PY إلى بيئة مختلفة لـ Llama Guard):

root@kitploit:~
MODEL=gemma4_e4b_it PY=python DEVICE=cuda:0 bash scripts/run_baseline.sh                  # step 0
MODEL=gemma4_e4b_it PROTOCOL=indomain PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # in-domain
MODEL=gemma4_e4b_it PROTOCOL=lobo     PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # LOBO

كل مرحلة قابلة للاستئناف؛ أعد تشغيل الأمر نفسه بعد أي انقطاع. تذهب المخرجات إلى runs/<model>/:

root@kitploit:~
baseline/                        undefended responses; <bench>_judged.jsonl = Llama Guard labels
train/train_{indomain,lobo}_<bench>.jsonl
<protocol>/<bench>/adapter/      router_head.pt, late_adapters.pt, config.json
<protocol>/<bench>/scores/       gate scores on XSTest and on the evaluation set
<protocol>/<bench>/threshold.json
<protocol>/<bench>/defended/     defended responses and their judgments
<protocol>/summary.json          unsafe rate, over-refusal, gate AUROC per benchmark

البروتوكول

  • إعدادات التقييم. داخل النطاق: يُدرَّب AEGIS على تقسيم التدريب لمعيار ويُقيَّم على تقسيم الاختبار المحجوز، محوّل واحد لكل معيار. التقسيمات بنسبة 50/50، البذرة 42، مجمّعة حسب الطلب بحيث تبقى متغيرات الطلب نفسه على جانب واحد؛ المعرّفات في data/splits/. LOBO (ترك معيار واحد خارجًا): يُدرَّب AEGIS على المعيارين الآخرين ويُقيَّم على المعيار المحجوز بالكامل. في كلا الإعدادين لا تشارك البيانات المُقيَّمة أبدًا في اختيار العتبة، ولا يُستخدم XSTest أبدًا للتدريب.
  • بيانات التدريب (scripts/build_trainsets.py). الصوت الحميد هو Benign_train مع إجابات النموذج غير المدافعة كأهداف. تُستبعد الطلبات الحميدة التي تبدو ضارة والتي رفضها النموذج عند خط الأساس. الأهداف الضارة هي قوالب رفض عامة. عدد المقاطع الضارة يساوي عدد المقاطع الحميدة. البذرة 42.
  • التحسين. AdamW، معدل التعلم 2e-4، 4 حقب، تراكم التدرجات 8، رتبة LoRA 16، λ_BCE = 1.0، λ_L1 = 0.01.
  • الطلب. يتلقى Qwen2-Audio الصوت فقط (PROMPT_MODE=native)؛ تتلقى النماذج الأخرى الصوت بالإضافة إلى طلب نصي ثابت واحد. تقرأ البوابة حالة مخفية تعتمد على الطلب، لذا يكون المحوّل صالحًا فقط تحت وضع الطلب الذي دُرِّب عليه.
  • العتبة (scripts/calibrate_threshold.py). تُرتَّب معرّفات XSTest وتُقسَّم بالتناوب إلى نصف تحقق ونصف اختبار. العتبة هي أصغر درجة بوابة يكون فيها الرفض الزائد المضاف على نصف التحقق 10% على الأكثر، محسوبًا على الطلبات التي أجاب عنها النموذج غير المدافع.
  • الحلقة المغلقة. يجمع احتمال الرفض احتمال الرمز التالي لمفتتحات الرفض عند الطبقة الأخيرة. تستخدم تشغيلات داخل النطاق قائمة المفتتحات متعددة اللغات (REFUSAL_PHRASE_SET=multi، التي يضبطها )، لذا تُحتسب حالات الرفض غير الإنجليزية.

الاستئصالات

root@kitploit:~
MODEL=qwen2_audio VARIANT=full bash scripts/run_ablation.sh        # LoRA on all layers, no gate
MODEL=qwen2_audio VARIANT=always_on bash scripts/run_ablation.sh   # AEGIS layers, no gate

الاختبارات

root@kitploit:~
python -m unittest discover tests

الاقتباس

root@kitploit:~
@misc{liao2027aegis,
  title  = {{AEGIS}: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks},
  author = {Liao, Yu-Ling and Chiu, Tzu-Chin and Chen, Zong-You and Tsai, Chi-Lei and Lo, Shao-Yuan},
  note   = {Submitted to ICASSP 2027},
  year   = {2026}
}

الترخيص

يُصدر الكود بموجب MIT License. تحتفظ النماذج الأساسية (مثل Gemma 4، وLlama 3.1 في Ultravox، وLlama-Guard-3-8B) والمعايير بتراخيصها وشروط استخدامها الخاصة.

تنزيل الأداة
MODELالنموذج الأساسيمعرّف Hugging Face (متغير التجاوز)طبقة البوابةطبقات التدخلإصدار Transformers المستخدم
gemma4_e4b_itGemma 4 E4B ITgoogle/gemma-4-E4B-it (AEGIS_GEMMA4_PATH)2125–415.7.0.dev0
phi4_mmPhi-4-multimodalmicrosoft/Phi-4-multimodal-instruct (AEGIS_PHI4_MM_PATH)1519–315.7.0.dev0
vita_15VITA-1.5VITA-MLLM/VITA-1.5 (AEGIS_VITA_PATH)1519–274.43.4
qwen2_audioQwen2-Audio-7B-InstructQwen/Qwen2-Audio-7B-Instruct (AEGIS_QWEN2_AUDIO_PATH)1519–31≥ 4.45
ultravox_v05Ultravox v0.5 (Llama-3.1-8B)fixie-ai/ultravox-v0_5-llama-3_1-8b (AEGIS_ULTRAVOX_PATH)1519–314.48.1
voxtral_smallVoxtral Small 24Bmistralai/Voxtral-Small-24B-2507 (AEGIS_VOXTRAL_PATH)2428–394.57.6
run_aegis.sh
  • المقاييس (scripts/summarize.py): معدل عدم الأمان هو نسبة الصفوف المُقيَّمة التي يصنّفها Llama-Guard-3-8B كـ unsafe؛ الرفض الزائد هو نسبة استجابات XSTest المطابقة لـ aegis/refusal.py، مُبلَّغًا عنها على جميع الطلبات الـ 250 وعلى نصف الاختبار؛ يستخدم gate AUROC درجات البوابة الخام مع الهجمات كإيجابيات وXSTest كسلبيات.