Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

फ़ीडसंपर्कगोपनीयता© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
privacy-filter — पाठ में PII का पता लगाने और मास्किंग के लिए द्विदिशात्मक टोकन-वर्गीकरण मॉडल, जिसमें ऑन-प्रिमाइसेस रिडैक्शन, मूल्यांकन और फाइनट्यूनिंग के लिए CLI शामिल है। | Kitploit
उपकरण/GitHubGitHub/openai/privacy-filter
रक्षात्मक उपकरणडेटा निष्कासनजानकारी एकत्र करनागोपनीयतासीक्रेट डिटेक्शनमशीन लर्निंगAI सुरक्षा
GitHubopenai/privacy-filter

privacy-filter

पाठ में PII का पता लगाने और मास्किंग के लिए द्विदिशात्मक टोकन-वर्गीकरण मॉडल, जिसमें ऑन-प्रिमाइसेस रिडैक्शन, मूल्यांकन और फाइनट्यूनिंग के लिए CLI शामिल है।

रिपॉजिटरी देखें
2.7k245275 महीने पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

OpenAI Privacy Filter

OpenAI Privacy Filter टेक्स्ट में व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) का पता लगाने और मास्किंग के लिए एक द्विदिशात्मक टोकन-वर्गीकरण मॉडल है। यह उच्च-थ्रूपुट डेटा सैनिटाइज़ेशन वर्कफ़्लो के लिए अभिप्रेत है जहाँ टीमों को एक ऐसे मॉडल की आवश्यकता होती है जिसे वे ऑन-प्रिमाइसेस चला सकें, जो तेज़, संदर्भ-जागरूक और ट्यून करने योग्य हो।

OpenAI Privacy Filter को ऑटोरिग्रेसिव रूप से प्रीट्रेन किया गया है ताकि gpt-oss के समान आर्किटेक्चर वाला चेकपॉइंट प्राप्त हो, हालाँकि छोटे आकार का। फिर हमने उस चेकपॉइंट को एक प्राइवेसी लेबल टैक्सोनॉमी पर द्विदिशात्मक टोकन क्लासिफायर में परिवर्तित किया, और एक सुपरवाइज़्ड क्लासिफिकेशन लॉस के साथ पोस्ट-ट्रेन किया। (gpt-oss के आर्किटेक्चर विवरण के लिए, कृपया gpt-oss मॉडल कार्ड देखें।) टोकन-दर-टोकन टेक्स्ट जनरेट करने के बजाय, यह मॉडल एक ही फ़ॉरवर्ड पास में इनपुट अनुक्रम को लेबल करता है, फिर एक नियंत्रित Viterbi प्रक्रिया के साथ सुसंगत स्पैन को डिकोड करता है। प्रत्येक इनपुट टोकन के लिए, मॉडल लेबल टैक्सोनॉमी पर एक प्रायिकता वितरण की भविष्यवाणी करता है जिसमें नीचे वर्णित 8 आउटपुट श्रेणियाँ शामिल हैं।

मुख्य विशेषताएँ:

  • अनुमतिपूर्ण Apache 2.0 लाइसेंस: प्रयोग, अनुकूलन और व्यावसायिक तैनाती के लिए आदर्श।
  • छोटा आकार: वेब ब्राउज़र या लैपटॉप पर चलता है – कुल 1.5B पैरामीटर और 50M सक्रिय पैरामीटर।
  • फाइन-ट्यून करने योग्य: आसान और डेटा-कुशल फाइनट्यूनिंग के माध्यम से मॉडल को विशिष्ट डेटा वितरणों के अनुकूल बनाएँ।
  • लंबा-संदर्भ: 128,000-टोकन संदर्भ विंडो उच्च थ्रूपुट के साथ लंबे टेक्स्ट को बिना चंकिंग के संसाधित करने में सक्षम बनाती है।
  • रनटाइम नियंत्रण: प्रीसेट ऑपरेटिंग पॉइंट्स के माध्यम से प्रिसिज़न/रिकॉल ट्रेडऑफ़ और पता लगाए गए स्पैन की लंबाई कॉन्फ़िगर करें।

यह रेपो

इस रिपॉज़िटरी में Privacy Filter चेकपॉइंट्स को चलाने, मूल्यांकन करने और फाइनट्यून करने के लिए उपयोग किया जाने वाला स्थानीय कोड, CLI, और उदाहरण एसेट्स शामिल हैं। यह उन टीमों के लिए है जो कार्यान्वयन का सीधे निरीक्षण करना चाहते हैं और मॉडल को अपने स्वयं के वातावरण में संचालित करना चाहते हैं।

रिपॉज़िटरी संसाधन: License और Security Policy।

उपयोग कैसे करें

  1. पैकेज को स्थानीय रूप से इंस्टॉल करें:
pip install -e .

इसके बाद, आपके पास एक पायथन स्क्रिप्ट opf होगी जिसे सीधे या python -m opf के माध्यम से चलाया जा सकता है। स्क्रिप्ट का उपयोग 3 अलग-अलग तरीकों से किया जा सकता है, जैसा कि नीचे वर्णित है।

  1. वन-शॉट रिडैक्शन चलाएँ:

डिफ़ॉल्ट रूप से, opf OPF_CHECKPOINT वेरिएबल द्वारा इंगित डायरेक्टरी में, या ~/.opf/privacy_filter में एक मॉडल खोजता है। यदि ~/.opf/privacy_filter स्थान में कोई मॉडल नहीं मिलता है, तो इसे डाउनलोड कर लिया जाएगा।

opf "Alice was born on 1990-01-02."

कोड GPU (डिफ़ॉल्ट रूप से) और CPU दोनों पर चलाने का समर्थन करता है। CPU पर चलाने के लिए, --device cpu फ़्लैग का उपयोग करें:

opf --device cpu "Alice was born on 1990-01-02."

डिफ़ॉल्ट चेकपॉइंट को ओवरराइड करने के लिए, --checkpoint पास करें:

opf --checkpoint /path/to/checkpoint_dir "Alice was born on 1990-01-02."

रिडैक्शन मोड एक बार में पूरी फ़ाइल को रिडैक्ट करने का समर्थन करता है

opf -f /path/to/file

रिडैक्शन पाइप्स के माध्यम से भी किया जा सकता है, जिससे जटिल वन-लाइनर्स का समर्थन होता है:

cat /path/to/file | grep -e 'some_pattern' | opf

यदि कोई इनपुट प्रदान नहीं किया जाता है, तो opf इंटरैक्टिव मोड में शुरू होगा। इस मोड में, प्रत्येक इनपुट उदाहरण के लिए, CLI संरचित JSON आउटपुट प्रिंट करता है, और यदि टर्मिनल समर्थन करता है तो ANSI रंग-कोडित पूर्वावलोकन का उपयोग करता है। इन विकल्पों को फ़्लैग्स द्वारा नियंत्रित किया जा सकता है।

अधिक फ़्लैग्स और रिडैक्शन मोड के बारे में जानकारी के लिए opf redact --help देखें।

  1. लेबल किए गए डेटासेट पर eval चलाएँ:
opf eval examples/data/sample_eval_five_examples.jsonl

examples/data/sample_eval_five_examples*.jsonl के अंतर्गत नमूना eval फ़िक्स्चर केवल सिंथेटिक उदाहरण डेटा हैं और वास्तविक व्यक्तियों या वास्तविक संवेदनशील रिकॉर्ड का वर्णन नहीं करते हैं। examples/data/README.md देखें।

अधिक फ़्लैग्स और मूल्यांकन मोड के बारे में जानकारी के लिए opf eval --help देखें।

  1. अपने स्वयं के लेबल किए गए डेटासेट पर फाइनट्यून करें:
opf train /path/to/train.jsonl --output-dir /path/to/finetuned_checkpoint

अधिक फ़्लैग्स और फाइनट्यूनिंग मोड के बारे में जानकारी के लिए opf train --help देखें।

संरचना

  • opf/__main__.py: redact, eval, और train मोड के लिए एकीकृत CLI एंट्रीपॉइंट।
  • opf/_api.py: रनटाइम और डिकोडिंग स्टैक पर पायथन-फेसिंग API।
  • opf/_cli/: कमांड-लाइन आर्ग्युमेंट पार्सिंग और टर्मिनल रेंडरिंग हेल्पर्स।
  • opf/_core/: रनटाइम लोडिंग, स्पैन रूपांतरण, और साझा डिकोडिंग लॉजिक।
  • opf/_eval/: डेटासेट लोडिंग, प्रीप्रोसेसिंग, मेट्रिक्स, और मूल्यांकन रनर।
  • opf/_train/: स्थानीय फाइनट्यूनिंग आर्ग्युमेंट पार्सिंग और ट्रेनिंग रनर।
  • opf/_model/: ट्रांसफ़ॉर्मर कार्यान्वयन, चेकपॉइंट कॉन्फ़िग, और वेट लोडिंग।
  • examples/data/: नमूना eval फ़ाइलें और प्रतिलिपि-योग्य फाइनट्यूनिंग डेमो डेटासेट।
  • examples/scripts/finetuning/: चलाने योग्य फाइनट्यूनिंग डेमो हार्नेस।
  • FINETUNING.md: केंद्रित फाइनट्यूनिंग वर्कफ़्लो और डेमो-स्क्रिप्ट गाइड।
  • OUTPUT_SCHEMAS.md: JSON प्रतिक्रिया और एक्सपोर्ट पेलोड फ़ॉर्मेट।
  • EVAL_AND_OUTPUT_MODES.md: रिडैक्शन और मूल्यांकन के लिए आउटपुट मोड का विवरण।

मॉडल विवरण

मॉडल विवरण

Privacy Filter स्पैन डिकोडिंग के साथ एक द्विदिशात्मक टोकन वर्गीकरण मॉडल है। इसे चरणों में प्रशिक्षित किया जाता है, जिसकी शुरुआत ऑटोरिग्रेसिव प्रीट्रेनिंग से होती है। प्रीट्रेन किए गए भाषा मॉडल को फिर संशोधित किया जाता है और बैंड आकार 128 (प्रभावी अटेंशन विंडो: स्वयं सहित 257 टोकन) के साथ एक द्विदिशात्मक बैंडेड अटेंशन टोकन क्लासिफायर के रूप में पोस्ट-ट्रेन किया जाता है। इसका मतलब है:

  • बेस मॉडल एक ऑटोरिग्रेसिव प्रीट्रेन किया गया चेकपॉइंट है।
  • भाषा-मॉडल आउटपुट हेड को प्राइवेसी लेबल्स पर एक टोकन-वर्गीकरण हेड से बदल दिया जाता है।
  • पोस्ट-ट्रेनिंग नेक्स्ट-टोकन प्रेडिक्शन के बजाय सुपरवाइज़्ड टोकन-स्तरीय वर्गीकरण है।
  • इन्फ़रेंस सुसंगत BIOES (Begin, Inside, Outside, End, Single) स्पैन लेबल उत्पन्न करने के लिए नियंत्रित अनुक्रम डिकोडिंग लागू करता है।

आर्किटेक्चरल रूप से, इस रेपो में कार्यान्वयन एक प्री-नॉर्म ट्रांसफ़ॉर्मर एनकोडर-शैली स्टैक है जिसमें शामिल हैं:

  • टोकन एम्बेडिंग्स
  • 8 दोहराए गए ट्रांसफ़ॉर्मर ब्लॉक
  • रोटरी पोज़िशनल एम्बेडिंग्स के साथ ग्रुप्ड-क्वेरी अटेंशन, जिसमें 14 क्वेरी हेड्स और 2 KV हेड्स हैं (प्रति KV हेड समूह आकार = 7 क्वेरीज़)
  • कुल 128 एक्सपर्ट्स के साथ स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स फ़ीड-फ़ॉरवर्ड ब्लॉक (प्रति टोकन टॉप-4 रूटिंग)
  • प्राइवेसी लेबल्स पर एक अंतिम टोकन-वर्गीकरण हेड (प्राकृतिक भाषा शब्दावली टोकन के बजाय), जिसमें रेसिडुअल स्ट्रीम चौड़ाई d_model = 640 है।

पुनरावृत्त ऑटोरिग्रेसिव दृष्टिकोणों की तुलना में, यह डिज़ाइन सभी टोकन को एक ही पास में लेबल करने की अनुमति देता है, जो थ्रूपुट को बेहतर बनाता है। क्लासिकल मास्क्ड-लैंग्वेज-मॉडल प्रीट्रेनिंग दृष्टिकोणों की तुलना में, यह एक ऑटोरिग्रेसिव मॉडल का पोस्ट-ट्रेनिंग रूपांतरण है, न कि मूल मास्क्ड-LM सेटअप।

आउटपुट आकार

Privacy Filter 8 प्राइवेसी स्पैन श्रेणियों का पता लगा सकता है:

  1. account_number
  2. private_address
  3. private_email
  4. private_person
  5. private_phone
  6. private_url
  7. private_date
  8. secret

टोकन-वर्गीकरण करने के लिए, प्रत्येक गैर-बैकग्राउंड स्पैन श्रेणी को सीमा-टैग किए गए टोकन क्लासेस में विस्तारित किया जाता है: B-<label>, I-<label>, E-<label>, S-<label>, साथ ही बैकग्राउंड क्लास, O। इसलिए टोकन-स्तरीय आउटपुट क्लासेस की कुल संख्या 33 है: 1 बैकग्राउंड क्लास + 8 स्पैन लेबल * 4 सीमा टैग = 33 क्लासेस। इसका मतलब है कि आउटपुट हेड प्रत्येक टोकन के लिए 33 लॉजिट्स उत्सर्जित करता है। लंबाई T के अनुक्रम के लिए, आउटपुट का आकार [T, 33] होता है; आकार B के बैच के लिए, इसका आकार [B, T, 33] होता है।

टूल डाउनलोड करें