
Umkehrung des OpenAI Privacy Filters: gleiches 1.5B-Modell, gibt PII als strukturierte Spans anstatt Maskierung zurück.
OpenAI hat Privacy Filter veröffentlicht – ein Modell, das PII in Text versteckt. Verteidiger nutzen es, damit keine Daten auslaufen.
Aber jede Verteidigung hat eine zweite Seite. Auch Angreifer brauchen PII. Aus Logs, Dumps, verlassenen S3-Buckets, gestohlenen Posteingängen. Gleiche Aufgabe: alles Persönliche in einem Texthaufen finden.
Privacy Filter maskiert. Privacy Parser extrahiert.
Gleiches Modell, gleiche Label-Taxonomie, gleiche Gewichte. Statt <REDACTED> erhältst du strukturierte Spannen – was, wo, welcher Typ.
Verteidigung: Prüfe deine Daten, bevor sie auslaufen. Angriff: Analysiere die Daten anderer, nachdem sie ausgelaufen sind.
Das Tool weiß nicht, auf welcher Seite es steht. Es ist einfach ein guter Parser.
uv venv
uv pip install -e ./privacy-filter
uv pip install -e ./pii_parser
Der erste Lauf lädt den opf 1.5B Checkpoint (~3 GB) nach ~/.opf/privacy_filter/ herunter.
from pii_parser.hybrid import HybridPIIParser
parser = HybridPIIParser(device="cpu")
result = parser.parse(
"Hi Quindle Testwick ([email protected] / +1-415-555-0102), "
"account 40702810500001234567, 14 Beautiful Ct, Anytown USA, "
"password Priv4cy-Filt3r-2026."
)
for s in result.spans:
print(f"{s.label:18} {s.text}")
private_person Quindle Testwick
private_email [email protected]
private_phone +1-415-555-0102
account_number 40702810500001234567
private_address 14 Beautiful Ct, Anytown USA
secret Priv4cy-Filt3r-2026
python -m pii_parser.cli_model "Alice paid 40702810500001234567 on 2026-05-17."
Hybrid = Modell + Spannen-Zusammenführung + Regex-Absicherung. Verwende diesen.
opf v2 Taxonomie – 8 Kategorien:
private_person · private_email · private_phone · private_address ·
private_url · private_date · account_number · secret
text
↓
opf 1.5B → BIOES logits → Viterbi (tuned) → char spans
↓
span-merge (glues Quindle + Testwick)
↓
regex backstop (URL, secret, account — where the model misses)
↓
spans[]
python pii_parser/tests/test_hybrid.py
Fixture F1: 0.929
Szenarien: 8/8 bestanden
Latenz: ~600 ms CPU
Apache-2.0.
| Backend | Gewichte | Geschwindigkeit | F1 |
|---|
PIIParser | none | µs | 1.000 |
ModelPIIParser | 1.5B | 500 ms CPU | 0.733 |
HybridPIIParser | 1.5B | 600 ms CPU | 0.929 |