Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
aegis-audio-defense — रक्षा ढाँचा जो ऑडियो-भाषा मॉडलों को स्थिर रखता है और अनुमान के समय ऑडियो जेलब्रेक को रोकने के लिए लेट-लेयर सुरक्षा अडैप्टरों के साथ एक मध्य-परत जोखिम गेट जोड़ता है। | Kitploit
उपकरण/GitHubGitHub/azzzzliao/aegis-audio-defense
रक्षात्मक उपकरणभेद्यता विश्लेषणमशीन लर्निंगपेपर और शोधAI सुरक्षाप्रतिकूल हमला
GitHubazzzzliao/aegis-audio-defense

aegis-audio-defense

रक्षा ढाँचा जो ऑडियो-भाषा मॉडलों को स्थिर रखता है और अनुमान के समय ऑडियो जेलब्रेक को रोकने के लिए लेट-लेयर सुरक्षा अडैप्टरों के साथ एक मध्य-परत जोखिम गेट जोड़ता है।

रिपॉजिटरी देखें
93 दिन पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

AEGIS: बड़े ऑडियो-भाषा मॉडल जेलब्रेक के विरुद्ध आंतरिक संकेतों के माध्यम से ऑडियो एंडोजेनस गार्डिंग

Yu-Ling Liao*, Tzu-Chin Chiu*, Zong-You Chen*, Chi-Lei Tsai*, Shao-Yuan Lo — National Taiwan University (*समान योगदान)

ICASSP 2027 सबमिशन के लिए कोड। AEGIS लक्ष्य ऑडियो-भाषा मॉडल को फ्रीज़ रखता है और एक मध्य-परत जोखिम गेट जोड़ता है जो सशर्त रूप से देर-परत सुरक्षा अडैप्टरों को संचालित करता है, साथ में इन्फरेंस पर क्लोज़्ड-लूप स्केलिंग।

विषय-सूची

पृष्ठइसमें क्या है
विधिजोखिम-से-इनकार अंतराल, गेट और अडैप्टर, प्रशिक्षण लॉस, क्लोज़्ड लूप।
परिणामपेपर की तालिकाएँ: छह मॉडल, तीन बेंचमार्क, एब्लेशन, और डिफेंस तुलना।
पेपर से परे विश्लेषणअन्य पाँच मॉडलों में जोखिम-से-इनकार अंतराल, गेट व्यवहार, प्रतिनिधित्व, पूर्ण एब्लेशन तालिका।
डेटाप्रत्येक डेटासेट कहाँ से आता है और मैनिफ़ेस्ट कैसे बनाए जाते हैं।
मॉडल जोड़नाएक अडैप्टर लिखकर AEGIS को किसी अन्य LALM पर पोर्ट करना।

इस पृष्ठ पर: रिपॉज़िटरी लेआउट · सेटअप · डेटा · AEGIS चलाना · प्रोटोकॉल · एब्लेशन · टेस्ट · उद्धरण

रिपॉज़िटरी लेआउट

root@kitploit:~
aegis/                        defense runtime; every script runs from any directory
  model_registry.py           ModelAdapter interface, registry, Qwen2-Audio and Phi-4 adapters
  adapters_gemma_voxtral.py   Gemma 4 E4B-it and Voxtral-Small-24B adapters
  adapters_ultravox_vita.py   Ultravox v0.5 and VITA-1.5 adapters
  train_gate_lora.py          joint training of the risk gate and the safety adapters
  run_defense.py              gated inference with closed-loop scaling (--score-only: gate scores)
  run_model.py                undefended generation
  judge.py                    Llama-Guard-3-8B safety judge
  refusal.py                  refusal regex for the over-refusal metric
  extract_hidden.py, analysis/  hidden-state probes for layer selection
scripts/
  prepare_data.py             downloaded datasets -> manifests (+ in-domain test splits)
  run_baseline.sh             step 0: undefended responses, judgments, training files
  run_aegis.sh                steps 1-4 for one protocol (PROTOCOL=indomain or lobo)
  run_ablation.sh             the Full and Always-on ablations
  models.sh                   per-model gate layer, intervention layers, prompt mode
  build_trainsets.py, calibrate_threshold.py, summarize.py
data/splits/                  in-domain train/test ids used in the paper
docs/                         method, results, analyses, porting guide
tests/                        CPU tests of the evaluation protocol

सेटअप

root@kitploit:~
pip install -r requirements.txt

प्रत्येक मॉडल को उसे लोड कर सकने वाले Transformers संस्करण की आवश्यकता होती है। अपस्ट्रीम्स में मतभेद है, इसलिए हमने प्रत्येक मॉडल परिवार के लिए एक वातावरण का उपयोग किया:

  • मॉडल डिफ़ॉल्ट रूप से Hub से लोड होते हैं। ऑफ़लाइन चलाने के लिए, ओवरराइड वेरिएबल को एक स्थानीय स्नैपशॉट पर इंगित करें।
  • Llama-Guard-3-8B, Gemma 4, और वह Llama-3.1 बैकबोन जिसे Ultravox डाउनलोड करता है, Hub पर गेटेड हैं। उनके लाइसेंस स्वीकार करें और huggingface-cli login चलाएँ, या GUARD और AEGIS_LLAMA31_PATH को स्थानीय प्रतियों पर सेट करें।
  • VITA-1.5 को उसके GitHub कोड की आवश्यकता है: https://github.com/VITA-MLLM/VITA क्लोन करें और AEGIS_VITA_REPO को चेकआउट पर सेट करें (डिफ़ॉल्ट: external/VITA)।
  • हार्डवेयर: अधिकांश मॉडलों के लिए एक 48 GB GPU पर्याप्त है। Gemma 4 प्रशिक्षण के लिए कम से कम ~40 GB वाला एक कार्ड चाहिए, क्योंकि 262k-वोकैबुलरी लॉस अच्छी तरह शार्ड नहीं होता। Voxtral Small को दो 48 GB कार्ड चाहिए (DEVICE=auto मॉडल को शार्ड करता है; गेट और अडैप्टर उन परतों का अनुसरण करते हैं जिन्हें वे हुक करते हैं)। Qwen2-Audio और Phi-4 को लंबे AJail क्लिप्स पर DEVICE=auto से लाभ होता है।

डेटा

data/README.md में वर्णित पाँच डेटासेट डाउनलोड करें, फिर मैनिफ़ेस्ट बनाएँ:

root@kitploit:~
python scripts/prepare_data.py --data-root data --out-dir data/manifests

स्क्रिप्ट पेपर में प्रयुक्त पंक्ति गणनाओं की जाँच करती है: AJail 1,490, JALM 946, SACRED 1,364, XSTest 250, Benign_train 215। यह data/splits/ में id सूचियों से इन-डोमेन टेस्ट स्प्लिट्स (718 / 499 / 683 पंक्तियाँ) भी लिखती है।

AEGIS चलाना

प्रत्येक मॉडल के लिए (PY उस मॉडल के वातावरण का Python है; JUDGE_PY Llama Guard के लिए एक भिन्न वातावरण को इंगित कर सकता है):

root@kitploit:~
MODEL=gemma4_e4b_it PY=python DEVICE=cuda:0 bash scripts/run_baseline.sh                  # step 0
MODEL=gemma4_e4b_it PROTOCOL=indomain PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # in-domain
MODEL=gemma4_e4b_it PROTOCOL=lobo     PY=python DEVICE=cuda:0 bash scripts/run_aegis.sh   # LOBO

प्रत्येक चरण फिर से शुरू करने योग्य है; रुकावट के बाद वही कमांड दोबारा चलाएँ। आउटपुट runs/<model>/ में जाते हैं:

root@kitploit:~
baseline/                        undefended responses; <bench>_judged.jsonl = Llama Guard labels
train/train_{indomain,lobo}_<bench>.jsonl
<protocol>/<bench>/adapter/      router_head.pt, late_adapters.pt, config.json
<protocol>/<bench>/scores/       gate scores on XSTest and on the evaluation set
<protocol>/<bench>/threshold.json
<protocol>/<bench>/defended/     defended responses and their judgments
<protocol>/summary.json          unsafe rate, over-refusal, gate AUROC per benchmark

प्रोटोकॉल

  • मूल्यांकन सेटिंग्स। इन-डोमेन: AEGIS को एक बेंचमार्क के ट्रेन स्प्लिट पर प्रशिक्षित किया जाता है और उसके होल्ड-आउट टेस्ट स्प्लिट पर मूल्यांकित किया जाता है, प्रति बेंचमार्क एक अडैप्टर। स्प्लिट्स 50/50 हैं, seed 42, प्रॉम्प्ट द्वारा समूहीकृत ताकि एक ही अनुरोध के वेरिएंट एक ही तरफ रहें; ids data/splits/ में हैं। LOBO (एक बेंचमार्क छोड़ें): AEGIS को अन्य दो बेंचमार्क पर प्रशिक्षित किया जाता है और पूरे होल्ड-आउट बेंचमार्क पर मूल्यांकित किया जाता है। दोनों सेटिंग्स में मूल्यांकित डेटा थ्रेशोल्ड चयन में कभी भाग नहीं लेता, और XSTest कभी प्रशिक्षण के लिए उपयोग नहीं किया जाता।
  • प्रशिक्षण डेटा (scripts/build_trainsets.py)। बिनाइन ऑडियो Benign_train है जिसमें मॉडल के स्वयं के अरक्षित उत्तर लक्ष्य के रूप में हैं। हानिकारक दिखने वाले बिनाइन प्रॉम्प्ट जिन्हें मॉडल ने बेसलाइन पर अस्वीकार किया, हटा दिए जाते हैं। हानिकारक लक्ष्य सामान्य इनकार टेम्पलेट हैं। हानिकारक क्लिप्स की संख्या बिनाइन क्लिप्स के बराबर है। Seed 42।
  • ऑप्टिमाइज़ेशन। AdamW, लर्निंग रेट 2e-4, 4 एपॉक्स, ग्रेडिएंट एक्युमुलेशन 8, LoRA रैंक 16, λ_BCE = 1.0, λ_L1 = 0.01।
  • प्रॉम्प्ट। Qwen2-Audio को केवल ऑडियो प्राप्त होता है (PROMPT_MODE=native); अन्य मॉडलों को ऑडियो के साथ एक निश्चित टेक्स्ट प्रॉम्प्ट प्राप्त होता है। गेट एक प्रॉम्प्ट-निर्भर हिडन स्टेट पढ़ता है, इसलिए एक अडैप्टर केवल उसी प्रॉम्प्ट मोड के अंतर्गत मान्य है जिसके साथ उसे प्रशिक्षित किया गया था।
  • थ्रेशोल्ड (scripts/calibrate_threshold.py)। XSTest ids को क्रमबद्ध किया जाता है और बारी-बारी से एक वैलिडेशन आधे और एक टेस्ट आधे में विभाजित किया जाता है। थ्रेशोल्ड वह सबसे छोटा गेट स्कोर है जिसका वैलिडेशन आधे पर जोड़ा गया ओवर-रिफ्यूज़ल अधिकतम 10% है, जो उन प्रॉम्प्ट्स पर गिना जाता है जिनका अरक्षित मॉडल ने उत्तर दिया।
  • क्लोज़्ड लूप। इनकार संभाव्यता अंतिम परत पर इनकार ओपनरों की नेक्स्ट-टोकन संभाव्यता का योग करती है। इन-डोमेन रन बहुभाषी ओपनर सूची (, जो द्वारा सेट किया जाता है) का उपयोग करते हैं, इसलिए गैर-अंग्रेज़ी इनकार भी गिने जाते हैं।

एब्लेशन

root@kitploit:~
MODEL=qwen2_audio VARIANT=full bash scripts/run_ablation.sh        # LoRA on all layers, no gate
MODEL=qwen2_audio VARIANT=always_on bash scripts/run_ablation.sh   # AEGIS layers, no gate

टेस्ट

root@kitploit:~
python -m unittest discover tests

उद्धरण

root@kitploit:~
@misc{liao2027aegis,
  title  = {{AEGIS}: Audio Endogenous Guarding via Internal Signals Against Large Audio-Language Model Jailbreaks},
  author = {Liao, Yu-Ling and Chiu, Tzu-Chin and Chen, Zong-You and Tsai, Chi-Lei and Lo, Shao-Yuan},
  note   = {Submitted to ICASSP 2027},
  year   = {2026}
}

लाइसेंस

कोड MIT License के अंतर्गत जारी किया गया है। बेस मॉडल (जैसे Gemma 4, Ultravox में Llama 3.1, Llama-Guard-3-8B) और बेंचमार्क अपने स्वयं के लाइसेंस और उपयोग की शर्तें रखते हैं।

टूल डाउनलोड करें
MODELबेस मॉडलHugging Face id (ओवरराइड वेरिएबल)गेट परतइंटरवेंशन परतेंप्रयुक्त Transformers
gemma4_e4b_itGemma 4 E4B ITgoogle/gemma-4-E4B-it (AEGIS_GEMMA4_PATH)2125–415.7.0.dev0
phi4_mmPhi-4-multimodalmicrosoft/Phi-4-multimodal-instruct (AEGIS_PHI4_MM_PATH)1519–315.7.0.dev0
vita_15VITA-1.5VITA-MLLM/VITA-1.5 (AEGIS_VITA_PATH)1519–274.43.4
qwen2_audioQwen2-Audio-7B-InstructQwen/Qwen2-Audio-7B-Instruct (AEGIS_QWEN2_AUDIO_PATH)1519–31≥ 4.45
ultravox_v05Ultravox v0.5 (Llama-3.1-8B)fixie-ai/ultravox-v0_5-llama-3_1-8b (AEGIS_ULTRAVOX_PATH)1519–314.48.1
voxtral_smallVoxtral Small 24Bmistralai/Voxtral-Small-24B-2507 (AEGIS_VOXTRAL_PATH)2428–394.57.6
REFUSAL_PHRASE_SET=multi
run_aegis.sh
  • मेट्रिक्स (scripts/summarize.py): unsafe rate उन मूल्यांकित पंक्तियों का हिस्सा है जिन्हें Llama-Guard-3-8B unsafe लेबल करता है; over-refusal उन XSTest उत्तरों का हिस्सा है जो aegis/refusal.py से मेल खाते हैं, जो सभी 250 प्रॉम्प्ट्स पर और टेस्ट आधे पर रिपोर्ट किया जाता है; gate AUROC कच्चे गेट स्कोर का उपयोग करता है जिसमें हमले पॉज़िटिव और XSTest नेगेटिव होते हैं।