自动化研究产物 — 非上游项目。
本仓库是由自动化工具链构建的一次性实验环境,用于拉瓦尔大学(Université Laval)硕士论文中复现已发表的 GitHub Actions 工作流漏洞。它是
dedupeio/dedupe在提交54ecfe77d41390da66899596834a2bde3712c966(2024-11-01)时的逐字快照,依据该项目自身的许可证重新分发,该许可证文件已原样包含在本快照中。上游项目未参与其中,也从未成为攻击目标,此处研究的漏洞已公开。本仓库中的每个密钥和变量均为随机生成的虚拟值——不包含任何真实凭据。操作引用和运行器镜像均固定为 2024-11-01 时解析到的版本;有关对快照所做的所有更改,请参阅工具链输出中的
pinning.md。如有疑问或异议,请联系:[email protected]
dedupe 是一个 Python 库,利用机器学习对结构化数据快速执行模糊匹配、去重和实体解析。
dedupe 将帮助您:
dedupe 接收人工训练数据,并为您的数据集生成最佳规则,从而快速、自动地查找相似记录,即使面对非常大的数据库也能胜任。
如果您或您的组织希望在 dedupe 库的使用方面获得专业协助,Dedupe.io LLC 提供咨询服务。在此了解有关定价和可用服务的更多信息。
一项由 dedupe 库驱动的云服务,用于对您的数据进行去重和查找匹配。它提供分步向导,帮助您上传数据、设置模型、训练、聚类并查看结果。
Dedupe.io 还支持跨数据源的记录关联,并通过 API 提供持续匹配和训练功能。
更多信息,请参阅 Dedupe.io 产品网站、使用教程 以及 它与 dedupe 库之间的区别。
Dedupe 已被 Python 社区广泛采用。请查看这篇博客文章、关于如何将 Dedupe 与 Python 结合使用的 YouTube 视频,以及关于如何使用 Spark 大规模应用 Dedupe的 YouTube 视频。
用于对 CSV 文件进行去重和关联的命令行工具。可在 Source Knight-Mozilla OpenNews 上阅读相关介绍。
如果您只想使用 dedupe,请按以下方式安装:
pip install dedupe
熟悉 dedupe 的 API,然后开始您的项目。需要灵感?请查看一些示例。
我们建议使用 virtualenv 和 virtualenvwrapper 在虚拟化开发环境中工作。了解如何设置 virtualenv。
设置好 virtualenvwrapper 后,
mkvirtualenv dedupe
git clone https://github.com/dedupeio/dedupe.git
cd dedupe
pip install -e . --config-settings editable_mode=compat
pip install -r requirements.txt
如果这些测试通过,则说明一切已正确安装!
pytest
之后,每当您想在 dedupe 上工作时,
workon dedupe
dedupe 核心功能的单元测试
pytest
使用去重功能
python -m pip install -e ./benchmarks
python benchmarks/benchmarks/canonical.py
使用记录关联功能
python -m pip install -e ./benchmarks
python benchmarks/benchmarks/canonical_matching.py
Dedupe 基于 Mikhail Yuryevich Bilenko 的博士论文:《可学习的相似性函数及其在记录关联和聚类中的应用》。
如果某些行为不符合直觉,那就是一个 bug,应当予以报告。 在此报告
版权所有 (c) 2022 Forest Gregg 和 Derek Eder。依据 MIT 许可证发布。
本发行版中适用的第三方版权已在相应位置注明。
如果您在学术工作中使用 Dedupe,请使用以下引用:
Forest Gregg and Derek Eder. 2022. Dedupe. https://github.com/dedupeio/dedupe.