
新发布Jul 24, 2026
presidio v2.2.364
一个用于检测、编辑、遮盖和匿名化跨文本、图像和结构化数据的敏感数据(PII)的开源框架。支持自然语言处理、模式匹配和可定制的流水线。
Presidio - 数据保护和去标识化 SDK
📣 Presidio 即将迁往新家!点击此处了解更多 📣
上下文感知、可插拔且可定制的文本和图像PII去标识化服务。
什么是 Presidio
Presidio(源自拉丁语 praesidium,意为“保护、驻军”)有助于确保敏感数据得到妥善管理和治理。它提供快速的识别和匿名化模块,用于处理文本中的私人实体,例如信用卡号、姓名、位置、社会安全号码、比特币钱包、美国电话号码、财务数据等。

📘 完整文档
📣 项目迁移更新
❓ 常见问题解答
💭 演示
🛫 示例
目标
- 通过普及去标识化技术并在决策中引入透明度,让组织能够以更简单的方式保护隐私。
- 拥抱对特定业务需求的可扩展性和可定制性。
- 在多个平台上促进全自动和半自动的PII去标识化流程。
主要特性
- 预定义或自定义PII识别器,利用_命名实体识别_、正则表达式、基于规则的逻辑_和_校验和,并支持多种语言的上下文。
- 连接外部PII检测模型的选项。
- 多种使用选项:从Python或PySpark工作负载,通过Docker到Kubernetes。
- PII识别和去标识化的可定制性。
- 用于在图像中编辑PII文本的模块(标准图像类型和DICOM医学图像)。
⚠️ Presidio 可以帮助识别非结构化/结构化文本中的敏感/PII数据。然而,由于它使用自动化检测机制,无法保证Presidio能找到所有敏感信息。因此,应部署额外的系统和保护措施。
安装 Presidio
运行 Presidio
支持
- 提交问题前,请先查阅文档。
- 对于一般性讨论,请使用GitHub仓库的讨论区。
- 如果您有使用问题、发现bug或有改进建议,请提交GitHub issue。
- 其他事宜,请发送邮件至[email protected]。
贡献
关于如何向本仓库贡献的详细信息,请参阅贡献指南。
本项目已采用贡献者契约行为准则。