Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

الخلاصاتاتصالالخصوصية© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
privacy-filter — نموذج تصنيف الرموز ثنائي الاتجاه لكشف وإخفاء المعلومات الشخصية القابلة للتعريف (PII) في النصوص، مع واجهة سطر أوامر (CLI) لتنقيح البيانات وتقييمها وضبطها الدقيق محليًا. | Kitploit
أدوات/GitHubGitHub/openai/privacy-filter
أدوات دفاعيةتسريب البياناتجمع المعلوماتالخصوصيةكشف الأسرارتعلم الآلةأمن الذكاء الاصطناعي
GitHubopenai/privacy-filter

privacy-filter

نموذج تصنيف الرموز ثنائي الاتجاه لكشف وإخفاء المعلومات الشخصية القابلة للتعريف (PII) في النصوص، مع واجهة سطر أوامر (CLI) لتنقيح البيانات وتقييمها وضبطها الدقيق محليًا.

عرض المستودع
2.7k24527منذ 5 أشهرتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

OpenAI Privacy Filter

OpenAI Privacy Filter هو نموذج تصنيف رموز ثنائي الاتجاه للكشف عن المعلومات الشخصية القابلة للتعريف (PII) وإخفائها في النصوص. وهو مخصص لسير عمل تعقيم البيانات عالي الإنتاجية حيث تحتاج الفرق إلى نموذج يمكنها تشغيله محليًا يكون سريعًا وواعيًا بالسياق وقابلًا للضبط.

تم تدريب OpenAI Privacy Filter مسبقًا بشكل انحداري ذاتي للوصول إلى نقطة تفتيش بمعمارية مشابهة لـ gpt-oss، وإن كانت بحجم أصغر. ثم قمنا بتحويل نقطة التفتيش تلك إلى مصنّف رموز ثنائي الاتجاه وفق تصنيف تسميات الخصوصية، وأعدنا تدريبه بخسارة تصنيف خاضعة للإشراف. (للاطلاع على تفاصيل معمارية gpt-oss، يرجى الرجوع إلى بطاقة نموذج gpt-oss.) بدلًا من توليد النص رمزًا برمز، يقوم هذا النموذج بوسم تسلسل الإدخال في تمريرة أمامية واحدة، ثم يفك ترميز النطاقات المتماسكة بإجراء Viterbi مقيّد. لكل رمز إدخال، يتنبأ النموذج بتوزيع احتمالي على تصنيف التسميات الذي يتكون من 8 فئات مخرجات موصوفة أدناه.

أبرز الميزات:

  • ترخيص Apache 2.0 المتساهل: مثالي للتجريب والتخصيص والنشر التجاري.
  • حجم صغير: يعمل في متصفح ويب أو على حاسوب محمول – 1.5B معامل إجمالًا و50M معامل نشط.
  • قابل للضبط الدقيق: كيّف النموذج مع توزيعات بيانات محددة من خلال ضبط دقيق سهل وفعّال من حيث البيانات.
  • سياق طويل: نافذة سياق تبلغ 128,000 رمز تتيح معالجة نصوص طويلة بإنتاجية عالية ودون تقسيم.
  • تحكم وقت التشغيل: اضبط المقايضات بين الدقة/الاستدعاء وأطوال النطاقات المكتشفة عبر نقاط تشغيل معدّة مسبقًا.

هذا المستودع

يحتوي هذا المستودع على الكود المحلي وواجهة سطر الأوامر والأصول المثالية المستخدمة لتشغيل نقاط تفتيش Privacy Filter وتقييمها وضبطها الدقيق. وهو مخصص للفرق التي تريد فحص التنفيذ مباشرة وتشغيل النموذج في بيئتها الخاصة.

موارد المستودع: الترخيص وسياسة الأمان.

كيفية الاستخدام

  1. ثبّت الحزمة محليًا:
pip install -e .

بعد ذلك، سيكون لديك سكربت بايثون باسم opf يمكن تشغيله مباشرة أو عبر python -m opf. يمكن استخدام السكربت بثلاث طرق منفصلة، كما هو موضح أدناه.

  1. تشغيل الإخفاء لمرة واحدة:

بشكل افتراضي، يبحث opf عن نموذج في الدليل الذي يشير إليه متغير OPF_CHECKPOINT، أو ~/.opf/privacy_filter. إذا لم يتم العثور على نموذج في موقع ~/.opf/privacy_filter، فسيتم تنزيله.

opf "Alice was born on 1990-01-02."

يدعم الكود التشغيل على GPU (بشكل افتراضي) وعلى CPU. للتشغيل على CPU، استخدم علم --device cpu:

opf --device cpu "Alice was born on 1990-01-02."

لتجاوز نقطة التفتيش الافتراضية، مرّر --checkpoint:

opf --checkpoint /path/to/checkpoint_dir "Alice was born on 1990-01-02."

يدعم وضع الإخفاء إخفاء ملف كامل دفعة واحدة

opf -f /path/to/file

يمكن أيضًا تنفيذ الإخفاء عبر الأنابيب، لدعم أوامر مركبة معقدة:

cat /path/to/file | grep -e 'some_pattern' | opf

إذا لم يتم توفير أي إدخال، سيبدأ opf في الوضع التفاعلي. في هذا الوضع، لكل مثال إدخال، تطبع واجهة سطر الأوامر مخرجات JSON منظمة، باستخدام معاينات مرمّزة بالألوان ANSI إذا كان الطرفية تدعم ذلك. يمكن التحكم في هذه الخيارات عبر الأعلام.

راجع opf redact --help لمزيد من الأعلام والمعلومات حول وضع الإخفاء.

  1. تشغيل التقييم على مجموعة بيانات موسومة:
opf eval examples/data/sample_eval_five_examples.jsonl

ملفات التقييم المثالية تحت examples/data/sample_eval_five_examples*.jsonl هي بيانات مثالية اصطناعية فقط ولا تصف أشخاصًا حقيقيين أو سجلات حساسة حقيقية. راجع examples/data/README.md.

راجع opf eval --help لمزيد من الأعلام والمعلومات حول وضع التقييم.

  1. الضبط الدقيق على مجموعة بياناتك الموسومة الخاصة:
opf train /path/to/train.jsonl --output-dir /path/to/finetuned_checkpoint

راجع opf train --help لمزيد من الأعلام والمعلومات حول وضع الضبط الدقيق.

البنية

  • opf/__main__.py: نقطة دخول موحدة لواجهة سطر الأوامر لأوضاع redact وeval وtrain.
  • opf/_api.py: واجهة برمجية موجهة لبايثون فوق حزمة وقت التشغيل وفك الترميز.
  • opf/_cli/: تحليل وسائط سطر الأوامر وأدوات مساعدة للعرض في الطرفية.
  • opf/_core/: تحميل وقت التشغيل وتحويل النطاقات ومنطق فك الترميز المشترك.
  • opf/_eval/: تحميل مجموعات البيانات والمعالجة المسبقة والمقاييس ومشغلات التقييم.
  • opf/_train/: تحليل وسائط الضبط الدقيق المحلي ومشغلات التدريب.
  • opf/_model/: تنفيذ المحوّل وإعداد نقطة التفتيش وتحميل الأوزان.
  • examples/data/: ملفات تقييم مثالية بالإضافة إلى مجموعات بيانات تجريبية قابلة لإعادة الإنتاج للضبط الدقيق.
  • examples/scripts/finetuning/: أدوات تجريبية قابلة للتشغيل للضبط الدقيق.
  • FINETUNING.md: دليل مركّز لسير عمل الضبط الدقيق وسكربتات العرض التوضيحي.
  • OUTPUT_SCHEMAS.md: تنسيقات استجابة JSON وحمولات التصدير.
  • EVAL_AND_OUTPUT_MODES.md: وصف أوضاع المخرجات للإخفاء والتقييم.

تفاصيل النموذج

وصف النموذج

Privacy Filter هو نموذج تصنيف رموز ثنائي الاتجاه مع فك ترميز النطاقات. يتم تدريبه على مراحل، بدءًا من التدريب المسبق الانحداري الذاتي. ثم يتم تعديل نموذج اللغة المُدرَّب مسبقًا وإعادة تدريبه كمصنّف رموز ثنائي الاتجاه بانتباه نطاقي بحجم نطاق 128 (نافذة الانتباه الفعلية: 257 رمزًا بما في ذلك الذات). وهذا يعني:

  • النموذج الأساسي هو نقطة تفتيش مُدرَّبة مسبقًا بشكل انحداري ذاتي.
  • يتم استبدال رأس مخرجات نموذج اللغة برأس تصنيف رموز على تسميات الخصوصية.
  • إعادة التدريب هي تصنيف خاضع للإشراف على مستوى الرمز بدلًا من التنبؤ بالرمز التالي.
  • يطبّق الاستدلال فك ترميز تسلسلي مقيّد لإنتاج تسميات نطاقات BIOES (Begin, Inside, Outside, End, Single) متماسكة.

معماريًا، التنفيذ في هذا المستودع هو حزمة على نمط مُرمِّز محوّل بمعيار مسبق مع:

  • تضمينات الرموز
  • 8 كتل محوّل متكررة
  • انتباه استعلامات مجمّعة مع تضمينات موضعية دورانية، مع 14 رأس استعلام ورأسي KV (حجم المجموعة = 7 استعلامات لكل رأس KV)
  • كتل تغذية أمامية متناثرة بمزيج من الخبراء مع 128 خبيرًا إجمالًا (توجيه top-4 لكل رمز)
  • رأس تصنيف رموز نهائي على تسميات الخصوصية (بدلًا من رموز مفردات اللغة الطبيعية)، بعرض تدفق متبقٍ d_model = 640.

مقارنة بالأساليب الانحدارية الذاتية التكرارية، يتيح هذا التصميم وسم جميع الرموز في تمريرة واحدة، مما يحسّن الإنتاجية. مقارنة بأساليب التدريب المسبق الكلاسيكية لنموذج اللغة المقنّع، هذا تحويل بعد التدريب لنموذج انحداري ذاتي بدلًا من إعداد masked-LM أصلي.

شكل المخرجات

يمكن لـ Privacy Filter اكتشاف 8 فئات لنطاقات الخصوصية:

  1. account_number
  2. private_address
  3. private_email
  4. private_person
  5. private_phone
  6. private_url
  7. private_date
  8. secret

لإجراء تصنيف الرموز، يتم توسيع كل فئة نطاق غير خلفية إلى فئات رموز موسومة بالحدود: B-<label>، I-<label>، E-<label>، S-<label>، بالإضافة إلى فئة الخلفية، O. لذا فإن العدد الإجمالي لفئات المخرجات على مستوى الرمز هو 33: فئة خلفية واحدة + 8 تسميات نطاق * 4 وسوم حدود = 33 فئة. وهذا يعني أن رأس المخرجات يُصدر 33 قيمة logit لكل رمز. لتسلسل بطول T، يكون للمخرجات شكل [T, 33]؛ ولدفعة بحجم B، يكون لها شكل [B, T, 33].

تتكون مفردات تسميات الرموز من تسمية الخلفية O بالإضافة إلى متغيرات موسومة بـ BIOES لكل فئة خصوصية: account_number، private_address، private_email، private_person، private_phone، private_url، private_date، وsecret. بعبارة أخرى، لكل فئة، يتنبأ النموذج بأشكال B- وI- وE- وS- المقابلة لنطاقات البداية والداخل والنهاية والرمز الواحد. في وقت الاستدلال، يتم فك ترميز قيم logit لكل رمز إلى تسميات نطاقات BIOES متماسكة باستخدام فك ترميز تسلسلي مقيّد.

منطق فك ترميز التسلسل والمعايرة

المنطق

بعد أن ينتج مصنّف الرموز قيم logit لكل رمز، نفك ترميز التسميات بفاك ترميز Viterbi مقيّد باستخدام تسجيل انتقالي بسلسلة خطية، بدلًا من أخذ argmax مستقل لكل رمز. يفرض الفاك انتقالات حدود BIOES المسموح بها ويسجّل مسارات التسميات الكاملة بشروط البداية والانتقال والنهاية، بالإضافة إلى ستة معاملات تحيّز انتقالي تتحكم في استمرارية الخلفية ودخول النطاق واستمرار النطاق وإغلاق النطاق والتسليم من حد إلى حد. يهدف هذا التحسين الشامل للمسار إلى تحسين تماسك النطاق واستقرار الحدود من خلال جعل كل قرار رمز يعتمد على بنية على مستوى التسلسل، وليس فقط على قيم logit المحلية، خاصة في النصوص المزعجة أو المختلطة التنسيق حيث يمكن لقرارات الرموز المحلية وحدها أن تنتج حدودًا مجزأة أو غير متسقة.

معايرة نقطة التشغيل

تنزيل الأداة