
보안 연구 랩으로, CVE-2025-54430(GHSA-wrg3-xqw8-m85p)을 재현합니다: dedupeio/dedupe에서 issue_comment로 트리거되는 Benchmark Bot을 통한 비밀 정보 유출. dedupeio/dedupe@54ecfe77d41390da66899596834a2bde3712c966의 스냅샷.
자동화된 연구 산출물 — 상위 프로젝트가 아님.
이 저장소는 Université Laval의 석사 논문에서 게시된 GitHub Actions 워크플로우 취약점 재현을 위해 자동화된 하네스가 구축한 일회용 실험실입니다. 이는 커밋
54ecfe77d41390da66899596834a2bde3712c966(2024-11-01) 시점의dedupeio/dedupe를 그대로 스냅샷한 것으로, 해당 프로젝트의 자체 라이선스에 따라 재배포되며, 해당 라이선스 파일은 이 스냅샷에 변경 없이 포함되어 있습니다.상위 프로젝트는 관여하지 않으며, 결코 공격 대상이 아니고, 여기서 연구된 취약점은 이미 공개된 것입니다. 이 저장소의 모든 시크릿과 변수는 무작위로 생성된 더미 값입니다 — 실제 자격 증명은 존재하지 않습니다. 액션 참조와 러너 이미지는 2024-11-01에 확인된 값으로 고정되어 있습니다. 스냅샷에 적용된 모든 변경 사항은 하네스 출력의
pinning.md를 참조하세요.질문 또는 이의 제기: [email protected]
dedupe는 구조화된 데이터에서 퍼지 매칭, 중복 제거 및 엔터티 해상도를 빠르게 수행하기 위해 머신 러닝을 사용하는 파이썬 라이브러리입니다.
dedupe 는 다음을 도와줍니다:
dedupe는 사람의 훈련 데이터를 입력받아 데이터셋에 가장 적합한 규칙을 도출하여, 매우 큰 데이터베이스에서도 유사한 레코드를 빠르고 자동으로 찾아냅니다.
귀하 또는 귀하의 조직이 dedupe 라이브러리 사용에 전문적인 지원이 필요하다면, Dedupe.io LLC가 컨설팅 서비스를 제공합니다. 가격 및 제공 서비스에 대해 자세히 알아보기.
데이터 중복 제거 및 매칭을 위해 dedupe 라이브러리로 구동되는 클라우드 서비스입니다. 데이터 업로드, 모델 설정, 훈련, 클러스터링 및 결과 검토를 위한 단계별 마법사를 제공합니다.
자세한 내용은 Dedupe.io 제품 사이트, 사용 방법 튜토리얼, 그리고 Dedupe.io와 dedupe 라이브러리의 차이점을 참조하세요.
Dedupe는 Python 커뮤니티에서 널리 채택되었습니다. 이 블로그 게시물, Python과 함께 Dedupe를 사용하는 방법에 대한 YouTube 동영상 및 Spark를 사용하여 Dedupe를 대규모로 적용하는 방법에 대한 YouTube 동영상을 확인하세요.
CSV 파일의 중복 제거 및 연결을 위한 명령줄 도구입니다. Source Knight-Mozilla OpenNews에서 자세히 알아보세요.
dedupe만 사용하려면 다음과 같이 설치하세요:
pip install dedupe
dedupe의 API에 익숙해지고 프로젝트를 시작하세요. 영감이 필요하신가요? 몇 가지 예제를 살펴보세요.
가상화된 개발 환경에서 작업하려면 virtualenv 및 virtualenvwrapper를 사용하는 것이 좋습니다. virtualenv 설정 방법 읽기.
virtualenvwrapper를 설정한 후,
mkvirtualenv dedupe
git clone https://github.com/dedupeio/dedupe.git
cd dedupe
pip install -e . --config-settings editable_mode=compat
pip install -r requirements.txt
이 테스트가 통과하면 모든 것이 올바르게 설치된 것입니다!
pytest
이후 dedupe 작업을 원할 때마다,
workon dedupe
핵심 dedupe 함수의 단위 테스트
pytest
중복 제거 사용
python -m pip install -e ./benchmarks
python benchmarks/benchmarks/canonical.py
레코드 연결 사용
python -m pip install -e ./benchmarks
python benchmarks/benchmarks/canonical_matching.py
Dedupe는 Mikhail Yuryevich Bilenko의 박사 학위 논문: Learnable Similarity Functions and their Application to Record Linkage and Clustering을 기반으로 합니다.
무언가 직관적으로 작동하지 않는다면 그것은 버그이며 보고해야 합니다. 여기에 보고하세요
Copyright (c) 2022 Forest Gregg and Derek Eder. MIT 라이선스에 따라 배포됩니다.
이 배포판의 타사 저작권은 해당되는 경우 명시되어 있습니다.
학술 작업에서 Dedupe를 사용하는 경우 다음 인용을 사용하세요:
Forest Gregg and Derek Eder. 2022. Dedupe. https://github.com/dedupeio/dedupe.