
टाइम-सीरीज़ डेटा में विसंगति पहचान के लिए उपकरणों और डेटासेट की सूची।
टाइम-सीरीज़ डेटा पर विसंगति का पता लगाना के लिए उपकरणों और डेटासेट की सूची।
सभी सूचियाँ वर्णानुक्रम में हैं। सूचियों में, अनुरक्षित परियोजनाओं को गैर-अनुरक्षित परियोजनाओं पर प्राथमिकता दी जाती है। किसी रिपॉजिटरी को "अनुरक्षित नहीं" माना जाता है यदि नवीनतम कमिट 1 वर्ष से अधिक पुराना है, या लेखकों द्वारा स्पष्ट रूप से उल्लेख किया गया है।
🎓 यदि आपको यह संग्रह उपयोगी लगा और आप इसे उद्धृत करना चाहते हैं, तो कृपया उद्धरण नीति का पालन करें।
| नाम | भाषा | विवरण | लाइसेंस | अनुरक्षित |
|---|---|---|---|---|
| Cuebook का CueObserve | Python3 | SQL डेटा वेयरहाउस और डेटाबेस पर विसंगति पहचान। | Apache-2.0 | ✔️ |
| Yahoo का EGADS | Java | GADS एक लाइब्रेरी है जिसमें कई विसंगति पहचान तकनीकें शामिल हैं जो कई उपयोग-मामलों पर लागू होती हैं, एक ही पैकेज में जिसकी एकमात्र निर्भरता Java है। | GPL | ✔️ |
| AIStream का flow-forecast | Python | टाइम सीरीज़ पूर्वानुमान, वर्गीकरण और विसंगति पहचान के लिए डीप लर्निंग PyTorch लाइब्रेरी (मूल रूप से बाढ़ पूर्वानुमान के लिए)। | GPL-3 | ✔️ |
| Hastic | Python + node.js | Grafana-आधारित UI के साथ टाइम सीरीज़ डेटा के लिए विसंगति पहचान उपकरण। | GPL | ✔️ |
| Zillow का Luminaire | Python | Luminaire एक Python पैकेज है जो टाइम सीरीज़ डेटा के लिए ML-संचालित विसंगति पहचान और पूर्वानुमान समाधान प्रदान करता है। | Apache-2.0 | ✔️ |
| MIDAS | C++ | MIDAS, जो Microcluster-Based Detector of Anomalies in Edge Streams का संक्षिप्त रूप है, एज स्ट्रीम से स्थिर समय और मेमोरी में माइक्रोक्लस्टर विसंगतियों का पता लगाता है। | Apache-2.0 | ✔️ |
| Orion | Python | Orion एक मशीन लर्निंग लाइब्रेरी है जो बिना पर्यवेक्षण वाली टाइम सीरीज़ विसंगति पहचान के लिए बनाई गई है, जो कई "सत्यापित" ML पाइपलाइन (उर्फ Orion पाइपलाइन) प्रदान करती है जो दुर्लभ पैटर्न की पहचान करती हैं और विशेषज्ञ समीक्षा के लिए उन्हें चिह्नित करती हैं। | MIT | ✔️ |
| OutlierDetection.jl |
इस अनुभाग में विसंगति पहचान से संबंधित कार्यों के लिए कुछ टाइम-सीरीज़ सॉफ़्टवेयर शामिल हैं, जैसे पूर्वानुमान, सामान्य TS विश्लेषण और लेबलिंग।
NAB स्ट्रीमिंग, रीयल-टाइम अनुप्रयोगों में विसंगति पहचान के लिए एल्गोरिदम का मूल्यांकन करने हेतु एक नया बेंचमार्क है। इसमें 50 से अधिक लेबल किए गए वास्तविक-विश्व और कृत्रिम टाइमसीरीज़ डेटा फ़ाइलें शामिल हैं, साथ ही रीयल-टाइम अनुप्रयोगों के लिए डिज़ाइन किया गया एक नया स्कोरिंग तंत्र भी शामिल है।
डेटासेट में टैग किए गए विसंगति बिंदुओं के साथ वास्तविक और सिंथेटिक टाइम-सीरीज़ शामिल हैं। डेटासेट आउटलाइअर और चेंज-पॉइंट सहित विभिन्न विसंगति-प्रकारों की पहचान सटीकता का परीक्षण करता है।
SKAB (Skoltech Anomaly Benchmark) विसंगति पहचान के लिए एल्गोरिदम का मूल्यांकन करने के लिए डिज़ाइन किया गया है। बेंचमार्क में वर्तमान में 30+ डेटासेट के साथ-साथ एल्गोरिदम के मूल्यांकन के लिए Python मॉड्यूल शामिल हैं। प्रत्येक डेटासेट टेस्टबेड पर स्थापित सेंसरों से एकत्रित एक बहु-चर टाइम सीरीज़ का प्रतिनिधित्व करता है। आउटलाइअर पहचान और चेंजपॉइंट पहचान समस्याओं को हल करने के परिणामों का मूल्यांकन करने के लिए सभी उदाहरण लेबल किए गए हैं।
डेटासेट में ग्राउंड ट्रुथ लेबल के साथ इंटरनेट कंपनियों के कई वास्तविक परिदृश्यों से KPI (की परफॉर्मेंस इंडेक्स) टाइम सीरीज़ डेटा शामिल है। अधिक विस्तृत विवरण के लिए नीचे क्लिक करें।
डेटासेट में ग्राउंड ट्रुथ लेबल के साथ इंटरनेट कंपनियों के कई वास्तविक परिदृश्यों से KPI (की परफॉर्मेंस इंडेक्स) टाइम सीरीज़ डेटा शामिल है। KPI दो व्यापक श्रेणियों में आते हैं: सेवा KPI और मशीन KPI। सेवा KPI प्रदर्शन मेट्रिक्स हैं जो किसी वेब सेवा के आकार और गुणवत्ता को दर्शाते हैं, जैसे पेज प्रतिक्रिया समय, पेज व्यू और कनेक्शन त्रुटियों की संख्या। मशीन KPI प्रदर्शन संकेतक हैं जो मशीन (सर्वर, राउटर, स्विच) के स्वास्थ्य को दर्शाते हैं, जैसे CPU उपयोग, मेमोरी उपयोग, डिस्क IO, नेटवर्क कार्ड थ्रूपुट आदि।
डेटासेट विवरण:
विसंगति पहचान एल्गोरिदम को प्रशिक्षित करने के लिए, हमारे द्वारा प्रदान किया गया प्रशिक्षण KPI डेटा तालिका 1 में दिखाया गया है, जिसमें चार कॉलम शामिल हैं: KPI ID, टाइमस्टैम्प, उस समय KPI का मान, और क्या वह समय असामान्य है (लेबल)।
तालिका 1 प्रशिक्षण KPI डेटा उदाहरण
यदि आप इस रिपॉजिटरी को उद्धृत करना चाहते हैं, तो कृपया निम्नलिखित DOI का उपयोग करें:
या इस BibTex का उपयोग करें
@article{medico2020,
title={rob-med/awesome-TS-anomaly-detection},
DOI={10.5281/zenodo.3972944},
abstractNote={A collection of tools and datasets for anomaly detection on time-series data.},
publisher={Zenodo}, author={Roberto Medico}, year={2020}, month={Aug}}
| Julia |
| Julia के साथ तेज़, स्केलेबल और लचीली आउटलाइअर पहचान। |
| MIT |
| ✔️ |
| PyOD | Python | PyOD बहु-चर डेटा में आउटलाइअर वस्तुओं का पता लगाने के लिए एक व्यापक और स्केलेबल Python टूलकिट है। | BSD 2-Clause | ✔️ |
| ruptures | Python | Ruptures ऑफ़लाइन चेंज पॉइंट पहचान के लिए एक Python लाइब्रेरी है। यह पैकेज गैर-स्थिर संकेतों के विश्लेषण और विभाजन के लिए विधियाँ प्रदान करता है। | BSD 2-Clause | ✔️ |
| EarthGecko Skyline | Python3 | Skyline एक रीयल-टाइम विसंगति पहचान प्रणाली है, जो सैकड़ों-हजारों मेट्रिक्स की निष्क्रिय निगरानी को सक्षम करने के लिए बनाई गई है। | MIT | ✔️ |
| Expedia.com का Adaptive Alerting | Java | स्वचालित मॉडल चयन और फिटिंग के साथ स्ट्रीमिंग विसंगति पहचान। | Apache-2.0 | ❌ |
| Arundo का ADTK | Python | विसंगति पहचान टूलकिट (ADTK) बिना पर्यवेक्षण / नियम-आधारित टाइम सीरीज़ विसंगति पहचान के लिए एक Python पैकेज है। | MPL 2.0 | ❌ |
| Twitter का AnomalyDetection | R | AnomalyDetection एक ओपन-सोर्स R पैकेज है जो विसंगतियों का पता लगाता है, जो सांख्यिकीय दृष्टिकोण से मौसमी और अंतर्निहित प्रवृत्ति की उपस्थिति में मजबूत है। | GPL | ❌ |
| Lytics का Anomalyzer | Go | Anomalyzer सांख्यिकीय परीक्षणों का एक समूह लागू करता है जो यह संभावना देता है कि संख्यात्मक इनपुट का एक दिया गया सेट, आमतौर पर एक टाइम सीरीज़, में विषम व्यवहार है। | Apache-2.0 | ❌ |
| banpei | Python | टाइम-सीरीज़ के लिए आउटलाइअर पहचान (Hotelling का सिद्धांत) और चेंज पॉइंट पहचान (सिंगुलर स्पेक्ट्रम ट्रांसफ़ॉर्मेशन)। | MIT | ❌ |
| Ele.me का banshee | Go | आवधिक मेट्रिक्स के लिए विसंगति पहचान प्रणाली। | MIT | ❌ |
| CAD | Python | स्ट्रीमिंग डेटा पर रीयल-टाइम AD के लिए प्रासंगिक विसंगति पहचान (2016 NAB प्रतियोगिता का विजेता एल्गोरिदम)। | AGPL | ❌ |
| Chaos Genius | Python | आउटलाइअर/विसंगति पहचान और मूल कारण विश्लेषण के लिए ML-संचालित एनालिटिक्स इंजन। | MIT | ❌ |
| Mentat का datastream.io | Python | Python, Elasticsearch और Kibana का उपयोग करके रीयल-टाइम विसंगति पहचान के लिए एक ओपन-सोर्स फ्रेमवर्क। | Apache-2.0 | ❌ |
| DeepADoTS | Python | टाइम-सीरीज़ डेटा पर विसंगति पहचान के लिए 7 डीप लर्निंग-आधारित तकनीकों का कार्यान्वयन और मूल्यांकन। | MIT | ❌ |
| Donut | Python | Donut मौसमी KPIs के लिए एक बिना पर्यवेक्षण वाला विसंगति पहचान एल्गोरिदम है, जो वैरिएशनल ऑटोएन्कोडर पर आधारित है। | - | ❌ |
| LoudML | Python | Loud ML TensorFlow के ऊपर निर्मित एक ओपन सोर्स टाइम सीरीज़ इन्फ्रेंस इंजन है। यह डेटा का पूर्वानुमान लगाने, आउटलाइअर का पता लगाने और भविष्य के ज्ञान का उपयोग करके आपकी प्रक्रिया को स्वचालित करने के लिए उपयोगी है। | MIT | ❌ |
| Linkedin का luminol | Python | Luminol टाइम सीरीज़ डेटा विश्लेषण के लिए एक हल्की Python लाइब्रेरी है। यह जिन दो प्रमुख कार्यक्षमताओं का समर्थन करती है वे हैं विसंगति पहचान और सहसंबंध। इसका उपयोग विसंगति के संभावित कारणों की जांच के लिए किया जा सकता है। | Apache-2.0 | ❌ |
| Numenta का Nupic | C++ | Numenta Platform for Intelligent Computing, Hierarchical Temporal Memory (HTM) का एक कार्यान्वयन है। | AGPL | ❌ |
| oddstream | R | oddstream (डेटा स्ट्रीम में आउटलाइअर पहचान) स्ट्रीमिंग टाइम सीरीज़ डेटा के बड़े संग्रह के भीतर विषम श्रृंखलाओं का शीघ्र पता लगाने के लिए रीयल-टाइम समर्थन प्रदान करता है। | GPL-3 | ❌ |
| PyOdds | Python | PyODDS डेटाबेस समर्थन के साथ आउटलाइअर पहचान के लिए एक एंड-टू-एंड Python प्रणाली है। PyODDS आउटलाइअर पहचान एल्गोरिदम प्रदान करता है, जो स्थिर और टाइम-सीरीज़ दोनों डेटा का समर्थन करते हैं। | MIT | ❌ |
| PySAD | Python | PySAD एक स्ट्रीमिंग विसंगति पहचान फ्रेमवर्क है जिसमें विभिन्न ऑनलाइन मॉडल और प्रयोग के लिए उपकरणों का पूरा सेट है। | BSD 3-Clause | ❌ |
| rrcf | Python | स्ट्रीम पर विसंगति पहचान के लिए Robust Random Cut Forest एल्गोरिदम का कार्यान्वयन। | MIT | ❌ |
| Netflix का Surus | Java | Robust Anomaly Detection (RAD) - Robust PCA का एक कार्यान्वयन। | Apache-2.0 | ❌ |
| NASA का Telemanom | Python | बहु-चर टाइम सीरीज़ डेटा में विसंगतियों का पता लगाने के लिए LSTM का उपयोग करने हेतु एक फ्रेमवर्क। इसमें Mars Science Laboratory और SMAP मिशनों से अंतरिक्ष यान विसंगति डेटा और प्रयोग शामिल हैं। | कस्टम | ❌ |
| नाम | भाषा | विवरण | लाइसेंस | अनुरक्षित |
|---|
| darts | Python | darts टाइम सीरीज़ के आसान हेरफेर और पूर्वानुमान के लिए एक Python लाइब्रेरी है। इसमें ARIMA जैसे क्लासिक मॉडल से लेकर न्यूरल नेटवर्क तक विभिन्न प्रकार के मॉडल शामिल हैं। | Apache-2.0 | ✔️ |
| ETNA | Python | etna टाइम सीरीज़ पूर्वानुमान और विश्लेषण के लिए एक Python लाइब्रेरी है जो अस्थायी डेटा संरचना को हमेशा ध्यान में रखती है। इसमें EDA और सत्यापन विधियों के साथ एकीकृत इंटरफ़ेस वाले विभिन्न प्रकार के पूर्वानुमान मॉडल शामिल हैं। | Apache-2.0 | ✔️ |
| Amazon का GluonTS | Python | GluonTS MXNet के आसपास निर्मित संभाव्य टाइम सीरीज़ मॉडलिंग के लिए एक Python टूलकिट है। GluonTS टाइम सीरीज़ डेटासेट को लोड करने और उन पर पुनरावृति करने के लिए उपयोगिताएँ, प्रशिक्षण के लिए तैयार अत्याधुनिक मॉडल और अपने स्वयं के मॉडल परिभाषित करने के लिए बिल्डिंग ब्लॉक प्रदान करता है। | Apache-2.0 | ✔️ |
| pmdarima | Python | R के auto.arima का scikit-learn-अनुकूल इंटरफ़ेस के साथ पोर्टिंग। | MIT | ✔️ |
| Facebook का Prophet | Python/R | Prophet टाइम सीरीज़ डेटा के पूर्वानुमान के लिए एक प्रक्रिया है। यह एक योगात्मक मॉडल पर आधारित है जहाँ गैर-रेखीय प्रवृत्तियों को वार्षिक और साप्ताहिक मौसमी, साथ ही छुट्टियों के साथ फिट किया जाता है। | BSD | ✔️ |
| PyFlux | Python | लाइब्रेरी में आधुनिक टाइम सीरीज़ मॉडल की अच्छी श्रृंखला है, साथ ही अनुमान विकल्पों (फ्रीक्वेंटिस्ट और बायेसियन) की एक लचीली श्रृंखला है जिसे इन मॉडलों पर लागू किया जा सकता है। | BSD 3-Clause | ❌ |
| नाम | भाषा | विवरण | लाइसेंस | अनुरक्षित |
|---|
| Facebook का Kats | Python | Kats का लक्ष्य टाइम सीरीज़ विश्लेषण के लिए वन-स्टॉप समाधान प्रदान करना है, जिसमें पहचान, पूर्वानुमान, फीचर निष्कर्षण/एम्बेडिंग, बहु-चर विश्लेषण आदि शामिल हैं। | MIT | ✔️ |
| MatrixProfile | Python | एक Python 3 लाइब्रेरी जो मैट्रिक्स प्रोफाइल एल्गोरिदम का उपयोग करके टाइम सीरीज़ डेटा माइनिंग कार्यों को सभी के लिए सुलभ बनाती है। | Apache-2.0 | ✔️ |
| Salesforce का Merlion | Python | Merlion: टाइम सीरीज़ इंटेलिजेंस के लिए एक मशीन लर्निंग फ्रेमवर्क, ARIMA सहित कई मॉडलों का समर्थन करता है। | BSD 3-Clause | ✔️ |
| SaxPy | Python | SAX का सामान्य कार्यान्वयन, साथ ही विसंगति पहचान के लिए HOTSAX। | GPLv2.0 | ✔️ |
| sktime | Python | टाइम सीरीज़ के साथ मशीन लर्निंग के लिए एक एकीकृत फ्रेमवर्क। यह विशेष टाइम सीरीज़ एल्गोरिदम और scikit-learn-संगत उपकरण प्रदान करता है, जिससे कई सीखने की समस्याओं के लिए टाइम सीरीज़ मॉडल बनाए, ट्यून और सत्यापित किए जा सकते हैं। | BSD 3-Clause | ✔️ |
| sktime-dl | Python | sktime के लिए Tensorflow/Keras के साथ डीप लर्निंग हेतु एक एक्सटेंशन पैकेज। | BSD 3-Clause | ✔️ |
| Squey | C++ | विज़ुअलाइज़ेशन सॉफ़्टवेयर जो प्रत्येक आउटलाइअर को प्रदर्शित करते हुए टाइमसीरीज़ की गहन खोज की अनुमति देता है। | MIT | ✔️ |
| Tigramite | Python | Tigramite एक कारणात्मक टाइम सीरीज़ विश्लेषण Python पैकेज है। यह उच्च-आयामी टाइम सीरीज़ डेटासेट से कारणात्मक ग्राफ़ का कुशलतापूर्वक पुनर्निर्माण करने और कारणात्मक मध्यस्थता और भविष्यवाणी विश्लेषण के लिए प्राप्त कारणात्मक निर्भरताओं को मॉडल करने की अनुमति देता है। | GPLv3.0 | ✔️ |
| tsflex | Python | tsflex फीचर निष्कर्षण और प्रसंस्करण के लिए एक टाइम सीरीज़ टूलकिट है जो लचीला और कुशल दोनों है। यह पैकेज बहु-चर, अनियमित रूप से नमूना किए गए अनुक्रम डेटा पर स्ट्राइडेड-विंडो फीचर निष्कर्षण का समर्थन करता है। | MIT | ✔️ |
| tslearn | Python | tslearn एक Python पैकेज है जो टाइम सीरीज़ के विश्लेषण के लिए मशीन लर्निंग उपकरण प्रदान करता है। यह पैकेज scikit-learn, numpy और scipy लाइब्रेरी पर आधारित है। | BSD 2-Clause | ✔️ |
| seglearn | Python | Seglearn मशीन लर्निंग टाइम सीरीज़ या अनुक्रमों के लिए एक Python पैकेज है। यह विभाजन, फीचर निष्कर्षण, फीचर प्रोसेसिंग और अंतिम अनुमानक के लिए एक एकीकृत पाइपलाइन प्रदान करता है। | BSD 3-Clause | ❌ |
| नाम | भाषा | विवरण | लाइसेंस | अनुरक्षित |
|---|
| Baidu का Curve | Python | Curve एक ओपन-सोर्स उपकरण है जो टाइम-सीरीज़ डेटा पर विसंगतियों को लेबल करने में मदद करता है। | Apache-2.0 | ❌ |
| Microsoft का Taganomaly | R (डॉकराइज़्ड वेब ऐप) | टाइम सीरीज़ डेटा को टैग करने के लिए सरल उपकरण। एकल-चर और बहु-चर डेटा के लिए काम करता है, Twitter के AnomalyDetection पैकेज का उपयोग करके एक संदर्भ विसंगति भविष्यवाणी प्रदान करता है। | MIT | ❌ |
| KPI ID | टाइमस्टैम्प | मान | लेबल |
|---|
| 0 | 1503831000 | 10.8 | 0 |
| 0 | 1503831060 | 12.3 | 1 |
| ... | ... | ... | ... |
विसंगति पहचान एल्गोरिदम का मूल्यांकन करने के लिए, हमारे द्वारा प्रदान किया गया परीक्षण KPI डेटा तालिका 2 में दिखाया गया है, जिसमें दो कॉलम शामिल हैं: KPI ID, टाइमस्टैम्प, और उस समय KPI के अनुरूप मान।
तालिका 2 परीक्षण KPI डेटा उदाहरण
| KPI ID | टाइमस्टैम्प | मान |
|---|---|---|
| 0 | 1503831000 | 10.8 |
| 0 | 1503831060 | 12.3 |
| ... | ... | ... |