
ज़ोंबी ZIP आर्काइव हेडर एवेज़न हमलों की ML-आधारित पहचान (CVE-2026-0866)
ZIP अभिलेखागारों में संरचनात्मक मेटाडेटा एवेज़न के लिए एक रक्षात्मक स्कैनर।
ZombieGuard ZIP स्थानीय फ़ाइल हेडर, केंद्रीय निर्देशिका रिकॉर्ड और पेलोड विशेषताओं के बीच विरोधाभासों का पता लगाता है। इन विरोधाभासों का उपयोग अभिलेखागार की सामग्री को एक पार्सर के लिए खाली या हानिरहित दिखाने के लिए किया जा सकता है, जबकि दूसरा पार्सर फिर भी पेलोड तक पहुँच जाता है।
यह एक सीमित ZIP पार्सर को एक छोटे LightGBM मॉडल के साथ जोड़ता है। यह अभिलेखागार की सामग्री को निकालता या निष्पादित नहीं करता है।
[!IMPORTANT] ZombieGuard अभिलेखागार-एवेज़न संकेतों का पता लगाता है, मैलवेयर का नहीं। एक स्वच्छ परिणाम इस बात का प्रमाण नहीं है कि अभिलेखागार के अंदर की फ़ाइलें सुरक्षित हैं।
ZombieGuard Python 3.11 और 3.12 का समर्थन करता है।
git clone https://github.com/mdshoaibuddinchanda/zombieguard.git
cd zombieguard
python -m pip install .
zombieguard scan suspicious.zip --include-features
रिलीज़ मॉडल पैकेज के साथ स्थापित होता है। इनपुट-आकार सीमा, JSON/SARIF आउटपुट और निर्देशिका-स्कैनिंग विकल्पों के लिए zombieguard scan --help का उपयोग करें।
विकास के लिए, रिपॉजिटरी को एडिटेबल मोड में स्थापित करें:
python -m pip install -e ".[dev]"
python -m pytest
ZombieGuard प्रत्येक ZIP को मैलवेयर हस्ताक्षर खोजने के बजाय एक संगति समस्या के रूप में मानता है:
स्कैनर सहायक कारण कोड के साथ एक निर्णय रिपोर्ट करता है। पार्सिंग विफलताओं को अनिश्चित या संदिग्ध स्थितियों के रूप में रिपोर्ट किया जाता है; उन्हें कभी भी चुपचाप स्वच्छ परिणाम में परिवर्तित नहीं किया जाता है।
Untrusted ZIP bytes
│
▼
Bounded structural parser ──► explicit parse/limit failures
│
▼
Per-entry consistency features
│
▼
Versioned LightGBM model
│
▼
verdict + score + reasons
संरचनात्मक सत्यापन त्रुटियाँ एक स्पष्ट स्कैन-अयोग्य परिणाम उत्पन्न करती हैं। सफलतापूर्वक पार्स किए गए अभिलेखागारों को मॉडल द्वारा स्कोर किया जाता है, और देखी गई असंगतियाँ कारण कोड के रूप में लौटाई जाती हैं। मॉडल मेटाडेटा फीचर स्कीमा, प्रशिक्षण कॉन्फ़िगरेशन, स्रोत हैश और मॉडल चेकसम रिकॉर्ड करता है।
रिलीज़ मूल्यांकन जानबूझकर संकीर्ण और पुनरुत्पादनीय है। यह वास्तविक-विश्व मैलवेयर पहचान या क्रॉस-फॉर्मेट सामान्यीकरण का दावा नहीं करता है।
वर्तमान आर्टिफैक्ट रिपोर्ट करता है:
कंफ्यूज़न मैट्रिक्स TN=1,565, FP=3, FN=0, TP=1,150 है। प्रामाणिक परिणाम artifacts/metrics.json में हैं; उस फ़ाइल में प्रति-वैरिएंट फोल्ड सारांश, डेटा-स्रोत हैश, लीकेज अभिकथन, मॉडल चेकसम और सटीक कॉन्फ़िगरेशन भी शामिल हैं। यदि किसी मेट्रिक का उपयोग रिज़्यूमे, पेपर या प्रेजेंटेशन में किया जाता है, तो उसके दायरे को सिंथेटिक नेस्टेड लीव-वन-वैरिएंट-आउट फीचर मूल्यांकन के रूप में उद्धृत करें।
नकारात्मक पंक्तियों में 686 PyPI-व्युत्पन्न, 478 उत्पन्न हार्ड-नेगेटिव, 400 उत्पन्न छोटे-बेनाइन और 4 Office-व्युत्पन्न फीचर पंक्तियाँ शामिल हैं। नकारात्मक स्रोत परिवार फोल्डों में वितरित किए जाते हैं, परिवारों के रूप में बाहर नहीं रखे जाते। अंतराल इस बेंचमार्क के भीतर पंक्ति-स्तरीय अनिश्चितता का वर्णन करते हैं; वे परिनियोजन अनिश्चितता या डोमेन शिफ्ट का अनुमान नहीं लगाते। LightGBM आउटपुट को एक अनकैलिब्रेटेड स्कोर के रूप में रिपोर्ट किया जाता है, संभावना के रूप में नहीं। थ्रेशोल्ड नीति एक विकास ऑपरेटिंग पॉइंट है जिसका मूल्यांकन नेस्टेड फोल्डों के साथ किया गया है; वर्तमान रिलीज़ द्वारा पार्स किए गए नए बेनाइन अभिलेखागार अभी भी आवश्यक हैं, इससे पहले कि इसकी मापी गई गलत-सकारात्मक दर को उत्पादन साक्ष्य माना जाए।
सिंथेटिक पॉज़िटिव का उपयोग क्यों करें? इस संकीर्ण एवेज़न तकनीक के सार्वजनिक, स्वतंत्र रूप से सत्यापित उदाहरण दुर्लभ हैं। जनरेशन प्रत्येक संरचनात्मक म्यूटेशन को स्पष्ट और दोहराने योग्य बनाता है। सिंथेटिक प्रदर्शन इस बात का साक्ष्य है कि डिटेक्टर उन म्यूटेशनों को पहचानता है; यह स्वतंत्र रूप से लेबल किए गए वास्तविक-विश्व बेंचमार्क का विकल्प नहीं है।
उत्पत्ति, लेबल शब्दार्थ और विफलता मोड के लिए डेटा कार्ड और मॉडल कार्ड देखें।
मुख्य निर्भरताएँ स्थापित करें और प्रतिबद्ध आर्टिफैक्ट्स को सत्यापित करें। अतिरिक्त जनरेशन और रीफ़्रेश चरण सभी सुरक्षित सिंथेटिक पॉज़िटिव को पुनरुत्पादित करते हैं और पुनःप्रशिक्षण से पहले पुष्टि करते हैं कि उनकी प्रतिबद्ध फीचर्स अभी भी वर्तमान पार्सर से मेल खाती हैं:
python -m pip install -e .
python -m zombieguard.evaluate --check
python data/scripts/generate_zombie_samples.py
python scripts/refresh_synthetic_features.py
python -m zombieguard.evaluate --train --check
प्रशिक्षण प्रतिबद्ध फीचर और लेबल तालिकाओं को पढ़ता है और लिखता है:
src/zombieguard/assets/zombieguard_lgbm.txt — पोर्टेबल LightGBM मॉडल;src/zombieguard/assets/zombieguard_lgbm.metadata.json — स्कीमा और अखंडता मेटाडेटा;artifacts/metrics.json — मशीन-पठनीय मूल्यांकन रिपोर्ट।निरंतर एकीकरण लिंटिंग, निर्भरता और स्थैतिक सुरक्षा ऑडिटिंग, बाइट-संकलन, कवरेज के साथ परीक्षण, Python 3.11 और 3.12 पर पैकेज निर्माण, जनरेटर/पार्सर संरेखण, प्रतिबद्ध आर्टिफैक्ट सत्यापन और एक पृथक ट्रेन-एंड-चेक स्मोक टेस्ट चलाता है।
src/zombieguard/ installable scanner package and release assets
tests/ self-contained unit, adversarial, and CLI tests
data/processed/ committed feature table and labels
data/scripts/ safe synthetic-data builders
scripts/ dataset curation and audit helpers
artifacts/metrics.json reproducible release metrics
docs/ data and model cards
रॉ मैलवेयर, डाउनलोड किए गए कॉर्पस, क्रेडेंशियल्स और स्थानीय रूप से प्रशिक्षित स्क्रैच मॉडल रिपॉजिटरी का हिस्सा नहीं हैं।
--max-size-mb इनपुट कैप सक्षम रखें और उत्पादन परिनियोजन में प्रक्रिया-स्तरीय मेमोरी और समय सीमाएँ जोड़ें।पार्सर, डेटासेट या मूल्यांकन प्रोटोकॉल बदलने से पहले CONTRIBUTING.md पढ़ें। पुनरुत्पादनीय आर्टिफैक्ट के बिना मैलवेयर नमूने, API क्रेडेंशियल्स या बेंचमार्क दावे कमिट न करें।
भेद्यता या पार्सर-बाइपास रिपोर्ट के लिए, SECURITY.md का पालन करें। कृपया सार्वजनिक इश्यू में लाइव मैलवेयर संलग्न न करें।
Apache License 2.0 के अंतर्गत लाइसेंस प्राप्त है।
डेटा कार्ड · मॉडल कार्ड · सुरक्षा नीति · योगदान · CI
| गुण | रिलीज़ प्रोटोकॉल |
|---|
| दायरा | सिंथेटिक-पॉज़िटिव ZIP संरचनात्मक-एवेज़न फीचर बेंचमार्क |
| पात्र कॉर्पस | 1,150 उत्पन्न पॉज़िटिव और 1,568 डीडुप्लिकेटेड बेनाइन-लेबल वाली फीचर पंक्तियाँ |
| पॉज़िटिव होल्डआउट | प्रति फोल्ड एक पूर्ण आक्रमण वैरिएंट बाहर रखें (8 वैरिएंट) |
| बेनाइन होल्डआउट | निर्धारणीय SHA-256 विभाजन; प्रत्येक नमूने का एक बार मूल्यांकन किया जाता है |
| निर्णय सीमा | केवल बाहरी-प्रशिक्षण पंक्तियों पर नेस्टेड समूहित कैलिब्रेशन; 0.5% बेनाइन-FPR बजट |
| रिपोर्ट की गई भविष्यवाणियाँ | केवल बाहरी-फोल्ड भविष्यवाणियाँ; होल्ड-आउट पंक्तियाँ कभी अपनी सीमा निर्धारित नहीं करतीं |
| दावों से बाहर | MalwareBazaar-व्युत्पन्न और अन्यथा असत्यापित पॉज़िटिव लेबल |
| विश्वास | समग्र मेट्रिक्स के साथ Wilson 95% अंतराल |
| मेट्रिक | परिणाम | 95% Wilson अंतराल |
|---|
| सटीकता | 99.89% (2,715 / 2,718) | 99.68–99.96% |
| परिशुद्धता | 99.74% | 99.24–99.91% |
| रिकॉल | 100% (1,150 / 1,150) | 99.67–100% |
| F1 | 99.87% | — |
| ROC-AUC | 99.90% | — |
| गलत-सकारात्मक दर | 0.191% (3 / 1,568) | 0.065–0.561% |