Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
privacy-parser — OpenAI Privacy Filterの逆: 同じ1.5Bモデルを用い、マスキングの代わりにPIIを構造化スパンとして返します。 | Kitploit
ツール/GitHubGitHub/chiefautism/privacy-parser
OSINT (オープンソースインテリジェンス)偵察脆弱性分析データ流出情報収集ペネトレーションテストプライバシー機械学習
GitHubchiefautism/privacy-parser

privacy-parser

OpenAI Privacy Filterの逆: 同じ1.5Bモデルを用い、マスキングの代わりにPIIを構造化スパンとして返します。

リポジトリを見る
403343ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

OpenAI プライバシーパーサー

OpenAI は Privacy Filter を公開しました — テキスト内の PII を隠すモデルです。防御側はデータが漏洩しないようにこれを使います。

しかし、あらゆる防御にはもう一つの側面があります。攻撃者も PII を必要とします。ログ、ダンプ、放置された S3 バケット、盗まれた受信トレイから。同じタスク: テキストの山から個人情報をすべて見つけ出すことです。

Privacy Filter はマスクします。Privacy Parser は抽出します。

同じモデル、同じラベル分類、同じ重みです。<REDACTED> の代わりに構造化されたスパン — 何が、どこに、どのタイプかを取得できます。

防御: 漏洩する前に自社データを監査する。 攻撃: 漏洩した後に他人のデータを解析する。

このツールはどちらの立場かを知りません。単に優れたパーサーです。


インストール

root@kitploit:~
uv venv
uv pip install -e ./privacy-filter
uv pip install -e ./pii_parser

初回実行時、opf 1.5B チェックポイント(約3 GB)が ~/.opf/privacy_filter/ にダウンロードされます。

使用方法

root@kitploit:~
from pii_parser.hybrid import HybridPIIParser

parser = HybridPIIParser(device="cpu")
result = parser.parse(
    "Hi Quindle Testwick ([email protected] / +1-415-555-0102), "
    "account 40702810500001234567, 14 Beautiful Ct, Anytown USA, "
    "password Priv4cy-Filt3r-2026."
)
for s in result.spans:
    print(f"{s.label:18}  {s.text}")
root@kitploit:~
private_person      Quindle Testwick
private_email       [email protected]
private_phone       +1-415-555-0102
account_number      40702810500001234567
private_address     14 Beautiful Ct, Anytown USA
secret              Priv4cy-Filt3r-2026

CLI

root@kitploit:~
python -m pii_parser.cli_model "Alice paid 40702810500001234567 on 2026-05-17."

3つのバックエンド

ハイブリッド = モデル + スパン結合 + 正規表現バックストップ。これを採用しましょう。

ラベル

opf v2 分類体系 — 8カテゴリ:

private_person · private_email · private_phone · private_address · private_url · private_date · account_number · secret

アーキテクチャ

root@kitploit:~
text
  ↓
opf 1.5B → BIOES logits → Viterbi (tuned) → char spans
  ↓
span-merge (glues Quindle + Testwick)
  ↓
regex backstop (URL, secret, account — where the model misses)
  ↓
spans[]

ベンチマーク

root@kitploit:~
python pii_parser/tests/test_hybrid.py
root@kitploit:~
Fixture F1:  0.929
Scenarios:   8/8 passed
Latency:     ~600 ms CPU

ライセンス

Apache-2.0.

ツールをダウンロード
バックエンド重み速度F1
PIIParsernoneµs1.000
ModelPIIParser1.5B500 ms CPU0.733
HybridPIIParser1.5B600 ms CPU0.929