
시계열에서 관련 특징의 자동 추출:
이 저장소에는 TSFRESH 파이썬 패키지가 포함되어 있습니다. 약어는 다음을 뜻합니다.
"Time Series Feature extraction based on scalable hypothesis tests".
이 패키지는 통계학, 시계열 분석, 신호 처리 및 비선형 동역학의 검증된 알고리즘과 강력한 특징 선택 알고리즘을 결합하여 체계적인 시계열 특징 추출을 제공합니다. 이 맥락에서 time-series라는 용어는 가능한 가장 넓은 의미로 해석되므로, 모든 유형의 샘플링된 데이터나 이벤트 시퀀스까지도 특성화할 수 있습니다.
데이터 과학자들은 대부분의 시간을 데이터를 정리하거나 특징을 구축하는 데 보내곤 합니다. 전자는 바꿀 수 없지만, 후자는 자동화할 수 있습니다. TSFRESH는 특징을 자동으로 추출하여 특징 구축에 쓰는 시간을 줄여줍니다. 따라서 최신 딥러닝 논문을 공부하거나, 해커 뉴스를 읽거나, 더 나은 모델을 만드는 데 더 많은 시간을 쓸 수 있습니다.
TSFRESH는 시계열에서 수백 가지 특징을 자동으로 추출합니다. 이 특징들은 피크 수, 평균값 또는 최댓값과 같은 시계열의 기본 특성이나, 시간 역전 대칭 통계량과 같은 더 복잡한 특징을 설명합니다.

그런 다음 이 특징 집합을 사용하여 시계열에 대한 통계 모델이나 머신러닝 모델을 구축할 수 있으며, 예를 들어 회귀 또는 분류 작업에 활용할 수 있습니다.
시계열에는 종종 노이즈, 중복 또는 무관한 정보가 포함됩니다. 그 결과 추출된 특징의 대부분은 현재의 머신러닝 작업에 유용하지 않을 수 있습니다.
무관한 특징을 추출하지 않도록 TSFRESH 패키지에는 내장된 필터링 절차가 있습니다. 이 필터링 절차는 현재의 회귀 또는 분류 작업에 대한 각 특성의 설명력과 중요도를 평가합니다.
이는 잘 정립된 가설 검정 이론에 기반하며 다중 검정 절차를 사용합니다. 그 결과 필터링 과정은 추출된 무관한 특징의 비율을 수학적으로 제어합니다.
다음 오픈 액세스 논문에서 TSFRESH 패키지에 대해 설명합니다:
FRESH 알고리즘은 다음 백서에서 설명합니다:
정규성 모델은 인간이 시계열 이상 징후를 감지하는 방식을 시뮬레이션합니다:
Teh, H.Y., Wang, K.I-K., Kempa-Liehr, A.W. (2021). Expect the Unexpected: Unsupervised feature selection for automated sensor anomaly detection. IEEE Sensors Journal 15.16, p. 18033-18046, doi: 10.1109/JSEN.2021.3084970.
Teh, H.Y., Wang, K.I-K., Kempa-Liehr, A.W. (2025). Feature-based normality models for anomaly detection. Sensors 25.4757, p. 1-25, doi: 10.3390/s25154757.
체계적인 시계열 특징 추출은 비지도 문제에도 적용됩니다:
tsfresh가 기본적으로 시계열 특징 추출을 자동으로 제공하므로, 이제 동기식 측정 신호 간의 차이와 같은 새로운 시계열 엔지니어링에 집중할 수 있으며, 이를 통해 더 나은 시계열 특징을 얻을 수 있습니다:
Kempa-Liehr, A.W., Oram, J., Wong, A., Finch, M., Besier, T. (2020). Feature engineering workflow for activity recognition from synchronized inertial measurement units. In: Pattern Recognition. ACPR 2019. Ed. by M. Cree et al. Vol. 1180. Communications in Computer and Information Science (CCIS). Singapore: Springer, p. 223–231. doi: 10.1007/978-981-15-3651-9_20.
Simmons, S., Jarvis, L., Dempsey, D., Kempa-Liehr, A.W. (2021). Data Mining on Extremely Long Time-Series. In: 2021 International Conference on Data Mining Workshops (ICDMW). Ed. by B. Xue et al. Los Alamitos: IEEE, p. 1057-1066. doi: 10.1109/ICDMW53433.2021.00137.
체계적인 시계열 특징 엔지니어링은 모든 시계열이 잘 정의된 특징 공간으로 투영되므로 서로 다른 길이의 시계열 샘플을 다룰 수 있게 해줍니다. 이 접근 방식은 데이터가 누락된 애플리케이션에서도 강건한 머신러닝 알고리즘을 설계할 수 있게 합니다.
시계열 분류 문제가 불균형합니까? 시계열 특징 행렬의 언더샘플링이 문제를 해결할 가능성이 높습니다:
시계열이 아니라 2D 및 3D 이미지를 다루고 있나요? 공간 변화 시퀀스(SVS)는 tsfresh에 훌륭한 적용 사례입니다:
Jeune, H., Pechan, N., Reitsma, S., Kempa-Liehr, A.W. (2021). Spatial Variation Sequences for Remote Sensing Applications with Small Sample Sizes. In: 2024 Image and Video Technology. 11th Pacific-Rim Symposium, Ed. by W.Q. Yan et al., Lecture Notes in Computer Science (14403). Springer Nature: Singapore, p. 153-166. doi: {10.1007/978-981-97-0376-0_12.
Koptev, I., Tian, J., Peel, E., Parker, R., Walker, C., Kempa-Liehr, A.W. (2025). Interpretable Dimensionality Reduction in 3D Image Recognition with Small Sample Sizes. Journal of Nondestructive Evaluation 44.44, p. 1-12, doi: 10.1007/s10921-025-01183-z.
문서 텍스트의 자연어 처리는 체계적인 시계열 특징 엔지니어링을 이벤트 시퀀스에 적용한 예로서, 다음 오픈 액세스 논문에서 설명합니다:
TSFRESH에는 몇 가지 강점이 있습니다. 예를 들면
기술적인 작동 방식에 관심이 있다면 http://tsfresh.readthedocs.io에서 포괄적인 Read-The-Docs 문서를 확인하세요.
알고리즘, 특히 필터링 부분은 위에서 언급한 논문에서도 설명됩니다.
어떤 기여도 환영합니다. TSFRESH를 파이썬에서 가장 큰 특징 추출 방법 아카이브로 만드는 데 관심이 있다면 How-To-Contribute 지침을 확인해 주세요.
tsfresh를 빠르게 사용해 보거나 워크플로우에 통합하려면 도커 이미지도 제공하고 있습니다:
docker pull nbraun/tsfresh
matrixprofile 특징 계산기로 계산된 시계열 특징을 재현하거나 업데이트해야 한다면 Python 3.8 환경을 만들어야 합니다:
conda create --name tsfresh__py_3.8 python=3.8
conda activate tsfresh__py_3.8
pip install tsfresh[matrixprofile]
TSFRESH의 연구 및 개발은 독일 연방 교육연구부의 지원 번호 01IS14004(프로젝트 iPRODICT)로 일부 자금을 지원받았습니다.