Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
privacy-parser — Reverso del filtro de privacidad de OpenAI: mismo modelo de 1.5B, devuelve PII como segmentos estructurados en lugar de enmascararla. | Kitploit
Herramientas/GitHubGitHub/chiefautism/privacy-parser
OSINT (Inteligencia de Fuentes Abiertas)ReconocimientoAnálisis de VulnerabilidadesExfiltración de DatosRecopilación de InformaciónPruebas de PenetraciónPrivacidadAprendizaje Automático
GitHubchiefautism/privacy-parser

privacy-parser

Reverso del filtro de privacidad de OpenAI: mismo modelo de 1.5B, devuelve PII como segmentos estructurados en lugar de enmascararla.

Ver Repositorio
40334hace 4 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

OpenAI Privacy Parser

OpenAI publicó Privacy Filter — un modelo que oculta la PII en el texto. Los defensores lo usan para que los datos no se filtren.

Pero toda defensa tiene una segunda cara. Los atacantes también necesitan PII. De registros, volcados, buckets de S3 abandonados, bandejas de entrada robadas. La misma tarea: encontrar todo lo personal en un montón de texto.

Privacy Filter enmascara. Privacy Parser extrae.

El mismo modelo, la misma taxonomía de etiquetas, los mismos pesos. En lugar de <REDACTED> obtienes spans estructurados — qué, dónde, qué tipo.

Defensa: audita tus datos antes de que se filtren. Ataque: analiza los de otros después de que se filtraran.

La herramienta no sabe de qué lado está. Es solo un buen parser.


Instalación

root@kitploit:~
uv venv
uv pip install -e ./privacy-filter
uv pip install -e ./pii_parser

La primera ejecución descarga el checkpoint opf 1.5B (~3 GB) en ~/.opf/privacy_filter/.

Uso

root@kitploit:~
from pii_parser.hybrid import HybridPIIParser

parser = HybridPIIParser(device="cpu")
result = parser.parse(
    "Hi Quindle Testwick ([email protected] / +1-415-555-0102), "
    "account 40702810500001234567, 14 Beautiful Ct, Anytown USA, "
    "password Priv4cy-Filt3r-2026."
)
for s in result.spans:
    print(f"{s.label:18}  {s.text}")
root@kitploit:~
private_person      Quindle Testwick
private_email       [email protected]
private_phone       +1-415-555-0102
account_number      40702810500001234567
private_address     14 Beautiful Ct, Anytown USA
secret              Priv4cy-Filt3r-2026

CLI

root@kitploit:~
python -m pii_parser.cli_model "Alice paid 40702810500001234567 on 2026-05-17."

Tres backends

Hybrid = modelo + span-merge + regex backstop. Usa este.

Etiquetas

Taxonomía opf v2 — 8 categorías:

private_person · private_email · private_phone · private_address · private_url · private_date · account_number · secret

Arquitectura

root@kitploit:~
text
  ↓
opf 1.5B → BIOES logits → Viterbi (tuned) → char spans
  ↓
span-merge (glues Quindle + Testwick)
  ↓
regex backstop (URL, secret, account — where the model misses)
  ↓
spans[]

Benchmarks

root@kitploit:~
python pii_parser/tests/test_hybrid.py
root@kitploit:~
Fixture F1:  0.929
Scenarios:   8/8 passed
Latency:     ~600 ms CPU

Licencia

Apache-2.0.

Descargar herramienta
BackendPesosVelocidadF1
PIIParserningunoµs1.000
ModelPIIParser1.5B500 ms CPU0.733
HybridPIIParser1.5B600 ms CPU0.929