
समय श्रृंखला से प्रासंगिक विशेषताओं का स्वचालित निष्कर्षण:
यह रिपॉज़िटरी TSFRESH पायथन पैकेज रखती है। यह संक्षिप्त नाम निम्नलिखित के लिए है:
"स्केलेबल परिकल्पना परीक्षणों पर आधारित समय-श्रेणी फीचर निष्कर्षण"।
यह पैकेज सांख्यिकी, समय-श्रेणी विश्लेषण, सिग्नल प्रोसेसिंग और अरैखिक गतिकी के स्थापित एल्गोरिदम को एक मज़बूत फीचर चयन एल्गोरिदम के साथ जोड़कर व्यवस्थित समय-श्रेणी फीचर निष्कर्षण प्रदान करता है। इस संदर्भ में, समय-श्रेणी शब्द की व्याख्या सबसे व्यापक संभव अर्थ में की गई है, ताकि किसी भी प्रकार के नमूना किए गए डेटा या यहाँ तक कि घटना अनुक्रमों को भी चित्रित किया जा सके।
डेटा वैज्ञानिक अक्सर अपना अधिकांश समय या तो डेटा साफ़ करने या फीचर बनाने में बिताते हैं। जबकि हम पहली चीज़ नहीं बदल सकते, दूसरी को स्वचालित किया जा सकता है। TSFRESH फीचर्स को स्वचालित रूप से निकालकर फीचर निर्माण में बिताया गया आपका समय बचाता है। इसलिए, आपके पास नवीनतम डीप लर्निंग पेपर पढ़ने, हैकर न्यूज़ पढ़ने या बेहतर मॉडल बनाने के लिए अधिक समय होता है।
TSFRESH समय श्रेणियों से स्वचालित रूप से सैकड़ों फीचर्स निकालता है। ये फीचर्स समय श्रेणी की मूल विशेषताओं का वर्णन करते हैं, जैसे कि शिखरों की संख्या, औसत या अधिकतम मान, या अधिक जटिल फीचर्स जैसे कि समय-उत्क्रमण सममिति आँकड़ा।

फीचर्स के इस समूह का उपयोग तब समय श्रेणी पर सांख्यिकीय या मशीन लर्निंग मॉडल बनाने के लिए किया जा सकता है, उदाहरण के लिए प्रतिगमन या वर्गीकरण कार्यों में।
समय श्रेणियों में अक्सर शोर, पुनरावृत्ति या अप्रासंगिक जानकारी होती है। परिणामस्वरूप, निकाले गए अधिकांश फीचर्स हाथ में लिए गए मशीन लर्निंग कार्य के लिए उपयोगी नहीं होंगे।
अप्रासंगिक फीचर्स निकालने से बचने के लिए, TSFRESH पैकेज में एक अंतर्निहित फ़िल्टरिंग प्रक्रिया है। यह फ़िल्टरिंग प्रक्रिया हाथ में लिए गए प्रतिगमन या वर्गीकरण कार्यों के लिए प्रत्येक विशेषता की व्याख्यात्मक शक्ति और महत्व का मूल्यांकन करती है।
यह परिकल्पना परीक्षण के सुविकसित सिद्धांत पर आधारित है और एक बहु-परीक्षण प्रक्रिया का उपयोग करती है। परिणामस्वरूप, फ़िल्टरिंग प्रक्रिया गणितीय रूप से निकाले गए अप्रासंगिक फीचर्स के प्रतिशत को नियंत्रित करती है।
TSFRESH पैकेज का वर्णन निम्नलिखित खुली-पहुँच पेपर में किया गया है:
FRESH एल्गोरिदम का वर्णन निम्नलिखित श्वेतपत्र में किया गया है:
सामान्यता मॉडल यह अनुकरण करते हैं कि मनुष्य समय-श्रेणी विसंगतियों का कैसे पता लगाते हैं:
Teh, H.Y., Wang, K.I-K., Kempa-Liehr, A.W. (2021). Expect the Unexpected: Unsupervised feature selection for automated sensor anomaly detection. IEEE Sensors Journal 15.16, p. 18033-18046, doi: 10.1109/JSEN.2021.3084970.
Teh, H.Y., Wang, K.I-K., Kempa-Liehr, A.W. (2025). Feature-based normality models for anomaly detection. Sensors 25.4757, p. 1-25, doi: 10.3390/s25154757.
व्यवस्थित समय-श्रेणी फीचर निष्कर्षण बिना पर्यवेक्षण वाली समस्याओं के लिए भी काम करता है:
चूँकि tsfresh मूल रूप से समय-श्रेणी फीचर निष्कर्षण मुफ़्त में प्रदान करता है, अब आप नई समय-श्रेणियों को इंजीनियर करने पर ध्यान केंद्रित कर सकते हैं, जैसे कि समकालिक मापों से संकेतों के अंतर, जो और भी बेहतर समय-श्रेणी फीचर्स प्रदान करते हैं:
Kempa-Liehr, A.W., Oram, J., Wong, A., Finch, M., Besier, T. (2020). Feature engineering workflow for activity recognition from synchronized inertial measurement units. In: Pattern Recognition. ACPR 2019. Ed. by M. Cree et al. Vol. 1180. Communications in Computer and Information Science (CCIS). Singapore: Springer, p. 223–231. doi: 10.1007/978-981-15-3651-9_20.
Simmons, S., Jarvis, L., Dempsey, D., Kempa-Liehr, A.W. (2021). Data Mining on Extremely Long Time-Series. In: 2021 International Conference on Data Mining Workshops (ICDMW). Ed. by B. Xue et al. Los Alamitos: IEEE, p. 1057-1066. doi: 10.1109/ICDMW53433.2021.00137.
व्यवस्थित समय-श्रेणी फीचर इंजीनियरिंग विभिन्न लंबाई के समय-श्रेणी नमूनों के साथ काम करने की अनुमति देती है, क्योंकि प्रत्येक समय-श्रेणी को एक सुपरिभाषित फीचर स्थान में प्रक्षेपित किया जाता है। यह दृष्टिकोण लुप्त डेटा वाले अनुप्रयोगों में मज़बूत मशीन लर्निंग एल्गोरिदम के डिज़ाइन की अनुमति देता है।
क्या आपकी समय-श्रेणी वर्गीकरण समस्या असंतुलित है? अच्छी संभावना है कि समय-श्रेणी फीचर मैट्रिक्स का अंडरसैंपलिंग आपकी समस्या हल कर सकता है:
क्या आप समय-श्रेणी के साथ नहीं, बल्कि 2D और 3D छवियों के साथ काम कर रहे हैं? स्थानिक विचरण अनुक्रम (SVS) tsfresh के लिए एक उत्कृष्ट अनुप्रयोग हैं:
Jeune, H., Pechan, N., Reitsma, S., Kempa-Liehr, A.W. (2021). Spatial Variation Sequences for Remote Sensing Applications with Small Sample Sizes. In: 2024 Image and Video Technology. 11th Pacific-Rim Symposium, Ed. by W.Q. Yan et al., Lecture Notes in Computer Science (14403). Springer Nature: Singapore, p. 153-166. doi: {10.1007/978-981-97-0376-0_12.
Koptev, I., Tian, J., Peel, E., Parker, R., Walker, C., Kempa-Liehr, A.W. (2025). Interpretable Dimensionality Reduction in 3D Image Recognition with Small Sample Sizes. Journal of Nondestructive Evaluation 44.44, p. 1-12, doi: 10.1007/s10921-025-01183-z.
लिखित पाठों का प्राकृतिक भाषा प्रसंस्करण, घटना अनुक्रमों पर व्यवस्थित समय-श्रेणी फीचर इंजीनियरिंग लागू करने का एक उदाहरण है, जिसका वर्णन निम्नलिखित खुली-पहुँच पेपर में किया गया है:
TSFRESH के कई लाभ हैं, उदाहरण के लिए
यदि आप तकनीकी कार्यप्रणाली में रुचि रखते हैं, तो http://tsfresh.readthedocs.io पर हमारा व्यापक Read-The-Docs दस्तावेज़ीकरण देखें।
एल्गोरिदम, विशेष रूप से फ़िल्टरिंग भाग, का वर्णन ऊपर उल्लिखित पेपर में भी किया गया है।
हम किसी भी योगदान की सराहना करते हैं; यदि आप TSFRESH को पायथन में फीचर निष्कर्षण विधियों का सबसे बड़ा संग्रह बनाने में हमारी मदद करने में रुचि रखते हैं, तो हमारे How-To-Contribute निर्देशों पर जाएँ।
यदि आप tsfresh को जल्दी से आज़माना चाहते हैं या इसे अपने कार्यप्रवाह में एकीकृत करना चाहते हैं, तो हमारे पास एक डॉकर इमेज भी उपलब्ध है:
docker pull nbraun/tsfresh
यदि आप उन समय-श्रेणी फीचर्स को पुन: उत्पन्न या अद्यतन करना चाहते हैं, जिनकी गणना matrixprofile फीचर कैलकुलेटर से की गई थी, तो आपको Python 3.8 वातावरण बनाना होगा:
conda create --name tsfresh__py_3.8 python=3.8
conda activate tsfresh__py_3.8
pip install tsfresh[matrixprofile]
TSFRESH का अनुसंधान और विकास आंशिक रूप से जर्मन संघीय शिक्षा और अनुसंधान मंत्रालय द्वारा अनुदान संख्या 01IS14004 (परियोजना iPRODICT) के अंतर्गत वित्त पोषित किया गया था।