Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

الخلاصاتاتصالالخصوصية© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
ASCENT — إطار عمل للضبط الدقيق يطبّق معايرة أمان مثلى من الدرجة الأولى وإعادة معايرة دورية على النماذج اللغوية الكبيرة، مع الحفاظ على التحديثات المتوافقة مع الأمان وتحسين فائدة المهام اللاحقة. | Kitploit
أدوات/GitHubGitHub/zju-llm-safety/ascent
أدوات دفاعيةتعلم الآلةالأوراق والأبحاثأمن الذكاء الاصطناعيالهجوم العدائي
GitHubzju-llm-safety/ascent

ASCENT

إطار عمل للضبط الدقيق يطبّق معايرة أمان مثلى من الدرجة الأولى وإعادة معايرة دورية على النماذج اللغوية الكبيرة، مع الحفاظ على التحديثات المتوافقة مع الأمان وتحسين فائدة المهام اللاحقة.

عرض المستودع
113منذ 4 أياملم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

ASCENT

الضبط الدقيق الأمثل من الدرجة الأولى مع إعادة المعايرة لتعزيز السلامة والفائدة معًا

يستخلص ASCENT تحديث معايرة السلامة الأمثل من الدرجة الأولى والبنية المرتبطة بالسلامة المقابلة، ويحسّن تحديثات المهام اللاحقة للحفاظ على المكونات المتوافقة مع السلامة مع كبح المكونات المُضِرّة بالسلامة، ويعيد معايرة هذه البنية بشكل دوري أثناء الضبط الدقيق لتحسين السلامة والفائدة اللاحقة معًا.

الطريقة · البدء السريع · البيانات · الإعدادات · التقييم

🧠 نظرة عامة على الطريقة

ASCENT framework: safety calibration, safety-preserving task optimization, and periodic recalibration.

  1. معايرة السلامة الأمثل من الدرجة الأولى. تقدير تدرّج السلامة للنموذج الحالي باستخدام حَكَم سلامة. تُحدِّد مكوناته المفردة العلوية r تحديث معايرة يعظّم التحسّن المتوقع في السلامة من الدرجة الأولى في ظل ميزانيتين ثابتتين للرتبة ومعيار فروبينيوس.
  2. تحسين المهام مع الحفاظ على السلامة. الحفاظ على مكونات تحديث المهام المتوافقة مع السلامة وكبح تلك ذات التأثيرات السلبية من الدرجة الأولى على السلامة بشكل انتقائي. توازن الصيغة المغلقة بين القرب من تحديث المهمة الأصلي و عقوبة على تعارضات السلامة، مرجّحة بالقيم المفردة.
  3. إعادة المعايرة الدورية. تنفيذ تحديثات المهام بين نقاط المعايرة، ثم دمج تحديث المهمة الفعّال وإعادة تقدير البنية المرتبطة بالسلامة على النموذج المُحدَّث. يُضبط جدول المعايرة في config.toml.

🚀 البدء السريع

المتطلبات: Python 3.12 ونقاط حفظ النماذج المحلية. يستخدم التدريب وحدتي CUDA GPU، واحدة للنموذج الهدف وواحدة لـ Llama Guard؛ يجب أن يتّسع كل نموذج لوحدة GPU الخاصة به.

pip install -r requirements.txt
cp config.example.toml config.toml

املأ القيم الفارغة في config.toml، وفقًا لتعليقاته المضمّنة، ثم شغّل:

python run.py \
  --config config.toml \
  --model-path /path/to/target-model \
  --guard-model-path /path/to/Llama-Guard-3-8B \
  --data-root data \
  --output-dir /path/to/new-run \
  --target-gpu 0 --guard-gpu 1

أضف --execute للتدريب أو توليد الاستجابات أو حفظ نتائج التقييم.

اختر دليل إخراج جديدًا خارج المستودع مع مساحة لنقاط الحفظ. يطبع التدريب مسار النموذج المدموج النهائي عند انتهائه.

📁 البيانات

وفّر مصفوفات JSON بأعداد السجلات المُهيَّأة:

  • المعايرة: <data-root>/calibration/prompts.json
  • بيانات المهمة: <data-root>/<task>/{train,test}.json، مع مدخلات تدريب/اختبار منفصلة.
DatasetRequired fields
SAMSumdialogue, summary
AGNewstext, label_name: World, Sports, Business, or Sci/Tech
GSM8Kquestion, answer with a #### final answer
OpenBookQAquestion_stem, choice_labels: ["A","B","C","D"], four choice_texts, answer_key: A–D
HarmBenchgoal only; optional id, source; no stored responses

⚙️ الإعدادات

اضبط نموذجك ومهمتك والمعاملات الفائقة في config.toml. يتبع تحميل النموذج واختيار المصفوفة model.key.

📊 التقييم

استخدم evaluate.py لكلا الوضعين؛ يتطلب التوليد نموذجًا محليًا مدموجًا بالكامل. وفّر بياناتك ودرجات السلامة الخارجية الخاصة بك. لا تُضمَّن أي مجموعات بيانات أو حَكَم عبر الإنترنت أو إعدادات API.

الفائدة

python evaluate.py utility --task gsm8k --data /path/to/test.json \
  --model-path /path/to/merged-model --output-dir /path/to/task-evaluation --execute

المهام: samsum، agnews، gsm8k، openbookqa. المقاييس هي ROUGE-L لـ SAMSum والدقة/التطابق التام للأخرى، وتُقدَّم كنسب مئوية. لتقييم الاستجابات المحفوظة، استبدل --model-path بـ --responses /path/to/responses.json.

السلامة

وفّر مطالبات ثابتة كسجلات تحتوي على id وgoal وprompt اختياري (يُفترض أن يكون goal). أبقِ الهدف الضار الأصلي منفصلًا عن مطالبة الهجوم.

توليد الاستجابات:

python evaluate.py safety --data /path/to/prompts.json \
  --model-path /path/to/merged-model --output-dir /path/to/safety-responses --execute

تجميع الدرجات الخارجية:

python evaluate.py safety \
  --responses /path/to/safety-responses/responses.json --judgments /path/to/scores.json \
  --output-dir /path/to/safety-metrics --execute

الدرجات هي سجلات JSON { "id": "...", "score": 1 }، باستخدام معرّفات الاستجابات ودرجات من 1 إلى 5 (null للأحكام الفاشلة). تُحتسب الدرجات 4–5 كهجمات ناجحة؛ استخدم --success-threshold 5 لاحتساب 5 فقط. الأحكام المفقودة أو الفاشلة لا تُنتج ASR نهائيًا.

بالنسبة لأي من الوضعين، تُرفض المدخلات التي تتجاوز --max-input-tokens بعد تنسيق المحادثة، ولا تُقتطع. اضبط الحد ضمن سعة سياق النموذج، مع ترك مساحة للرموز المولَّدة.

تنزيل الأداة